EmbeddingGemma 2 Google Rilis: Bikin RAG Multimodal Irit RAM
Google DeepMind resmi ngerilis EmbeddingGemma 2, model embedding multimodal 740M parameter yang bisa cari teks, kode, audio, dan video langsung di perangkat lokal.
· 5 menit baca

Inti singkat
- EmbeddingGemma 2 punya ukuran 740M parameter dan memakai lisensi Apache 2.0 yang ramah komersial.
- Model ini mendukung pencarian lintas modalitas untuk teks, kode, gambar, audio, dan video dalam satu ruang vektor.
- Desainnya modular sehingga bisa dijalankan mode teks saja (270M) dengan kebutuhan RAM mulai 191MB.
- Teknologi Matryoshka Representation Learning memangkas dimensi vektor hingga hemat ruang penyimpanan sampai 6 kali lipat.
Daftar isi5 bagian
- 01
- 02
- 03
- 04
- 05
Google DeepMind resmi meluncurkan EmbeddingGemma 2 Google, model embedding multimodal berukuran 740 juta parameter yang dirancang khusus untuk berjalan langsung di perangkat pengguna (on-device). Model ini menyatukan teks, kode pemrograman, gambar, video, dan rekaman audio ke dalam satu ruang vektor yang sama tanpa butuh koneksi server luar.
Kabar ini diumumkan langsung lewat pengumuman resmi Google DeepMind oleh Sahil Dua dan Henrique Schechter Vera. Versi pertamanya tahun lalu tercatat sudah diunduh lebih dari 20 juta kali oleh komunitas developer untuk membangun pencarian semantik dan pipeline Retrieval-Augmented Generation (RAG). Sekarang lewat EmbeddingGemma 2, kamu nggak cuma bisa mengolah teks, tapi juga mencari klip video lewat rekaman suara atau menyortir file audio berjam-jam cuma bermodal kueri teks pendek.
Panduan gratis · gratis
Panduan Cepat API AI untuk Developer
Dari request pertama sampai siap produksi: contoh kode, streaming, kontrol biaya, keamanan API key, dan penanganan error.
- Contoh request dengan cURL, Python, dan JavaScript
- Streaming dan format OpenAI vs Anthropic
- Cara mengontrol biaya token
- Checklist keamanan dan siap produksi
Apa Itu EmbeddingGemma 2 Google dan Apa Kelebihannya?
EmbeddingGemma 2 adalah model open weight berbasis arsitektur Gemma 4 yang dirilis di bawah lisensi terbuka Apache 2.0, jadi aman banget dipakai buat proyek komersial. Model ini dibangun memakai fondasi teknologi yang sama dengan model Gemini Embedding buatan Google.
Tujuan utama model ini adalah bikin komputasi vektor multimodal jadi ringan dan ramah perangkat keras konsumen. Kamu nggak perlu sewa GPU cloud mahal cuma buat bikin fitur pencarian media di aplikasi lokal. Menariknya lagi, jendela konteksnya melonjak jadi 8K token—empat kali lebih lapang dibanding versi pertamanya. Ruang 8K token ini sanggup menampung audio sampai 5,5 menit, 29 gambar, atau 58 frame video sekaligus.
Berikut rincian spesifikasi teknis dan perbandingannya:
| Komponen / Fitur | EmbeddingGemma 1 | EmbeddingGemma 2 |
|---|---|---|
| Total Parameter | ~300M (hanya teks) | 740M (multimodal penuh) |
| Dukungan Modalitas | Teks | Teks, kode, gambar, video, audio |
| Jendela Konteks | 2.048 token | 8.192 token (8K) |
| Lisensi | Terbuka | Apache 2.0 |
| Dimensi Vektor Bawaan | 768 dimensi | 768 (bisa dipotong ke 512, 256, 128) |
| Skor MTEB Code | 68,76 | 78,68 |
Arsitektur Modular: Irit RAM dan Hemat Storage Database
Salah satu masalah terbesar model multimodal biasanya ada di konsumsi memori. Google DeepMind ngakalin masalah ini lewat arsitektur yang modular. Kalau aplikasi kamu cuma butuh pencarian dokumen teks atau kode, kamu cukup memuat encoder teks berukuran 270 juta parameter saja.
Kalau butuh fitur visual, tinggal pasang modul vision tambahan sebesar 170 juta parameter. Butuh pemrosesan suara? Ada modul audio sebesar 300 juta parameter. Saat dites lewat kuantisasi pada Google Pixel 11 Pro, bobot teksnya cuma butuh RAM aktif sekitar ~191MB, sedangkan seluruh model multimodal lengkapnya cuma makan RAM sekitar ~567MB.
Selain hemat RAM, ada juga teknik Matryoshka Representation Learning (MRL). Fitur ini bikin kamu bisa memangkas dimensi vektor output secara dinamis dari ukuran standar 768 dimensi ke 512, 256, atau bahkan 128 dimensi. Hasilnya, konsumsi kapasitas penyimpanan di database vektor lokal bisa dihemat sampai 6 kali lipat tanpa merusak akurasi pencarian secara drastis.
Hasil Benchmark MTEB Code dan Performa Audio
Di pengujian benchmark, EmbeddingGemma 2 mencatatkan skor paling tinggi di kelas model multimodal di bawah 1 miliar parameter (sub-1B). Pada pengujian Massive Text Embedding Benchmark (MTEB) Code, skornya naik 9,92 poin dari 68,76 di versi lama menjadi 78,68. Ini bikin pencarian semantik untuk repositori codebase dan coding agent jadi jauh lebih akurat.
Nggak cuma urusan kode, model ini juga meraih skor terdepan di benchmark MAEB (Massive Audio Embedding Benchmark) buat kategori ukurannya. Google DeepMind menyebut performanya mampu menandingi bahkan melampaui beberapa model spesialis lain yang punya ukuran parameter dua kali lipat lebih besar.
4 Langkah Memanfaatkan EmbeddingGemma 2 untuk RAG Multimodal
Buat developer yang ingin nyobain arsitektur ini di aplikasi lokal, ekosistemnya sudah disiapkan bareng banyak mitra komunitas seperti Hugging Face, Kaggle, Ollama, dan llama.cpp. Alur integrasinya mirip dengan yang biasa dibahas di artikel Agentic Retrieval LangChain Bedrock, tapi kali ini sepenuhnya offline.
- Unduh Bobot Model: Ambil bobot model langsung di Hugging Face atau Kaggle. Buat versi optimasi mobile, kamu bisa cek repositori LiteRT Community.
- Pilih Runtime Sesuai Platform: Kamu bisa menjalankan model ini memakai
sentence-transformers, vLLM, llama.cpp, atau LMStudio. Buat jalan di browser, manfaatkantransformers.jsatau WebGPU. - Simpan Vektor di Vector Store Lokal: Simpan representasi vektor kueri dan aset media kamu memakai database vektor seperti Qdrant.
- Gandengkan dengan LLM Lokal atau Cloud: Pasangkan embedding ini dengan model generasi teks seperti Gemma 4. Karena EmbeddingGemma 2 berbagi tokenizer teks dan audio encoder yang sama dengan Gemma 4, kamu bisa menjalankan keduanya barengan dengan penggunaan memori terpadu yang jauh lebih hemat.
Kalau kamu butuh model penalaran yang lebih besar setelah dokumen atau klip berhasil ditemukan oleh embedding lokal, kamu bisa mengoper hasilnya ke model cloud lewat Classai Router. Di sana tersedia pilihan hemat seperti Gemini 3.8 Flash seharga Rp2.000 / Rp8.000 per 1 juta token, atau DeepSeek V4.1 Flash dengan tarif Rp160 / Rp800 per 1 juta token yang bisa diakses pakai saldo rupiah tanpa ribet kartu kredit luar negeri.
Kalau kamu mau melatih ulang model ini untuk kosakata atau dataset spesifik kantormu, kamu juga bisa mengikuti panduan fine-tuning yang disediakan oleh Unsloth.
Contoh prompt sistem untuk mengarahkan agent pencarian multimodal lokal:
Kamu adalah asisten pengindeks file multimedia lokal. Gunakan potongan vektor teks, gambar, dan transkrip audio yang diambil dari database untuk menjawab pertanyaan pengguna secara presisi. Jangan menambah informasi yang tidak tercantum pada konteks media.Dampak Nyata Buat Developer dan Pengguna di Indonesia
Kehadiran model multimodal yang benar-benar bisa jalan di perangkat lokal ini membawa beberapa keuntungan nyata:
- Kepatuhan Privasi Data: Buat pengembang aplikasi medis, keuangan, atau data sensitif di Indonesia, pemrosesan on-device memastikan rekaman suara dan foto pengguna tidak pernah keluar dari gawai, sejalan dengan prinsip perlindungan privasi data pribadi.
- Bebas Kuota dan Latensi: Di daerah yang sinyal internetnya kurang stabil, aplikasi katalog produk UMKM atau arsip video edukasi tetap bisa melakukan pencarian semantik canggih secara offline tanpa menunggu respons server.
- Hemat Biaya Server: Startup atau developer independen nggak perlu bayar tagihan embedding API bulanan untuk jutaan file media pengguna, karena semua komputasi dibebankan langsung ke hardware pengguna secara efisien.
Sumber & referensi
- 01
Google DeepMind · 7 Oktober 2026
EmbeddingGemma 2: an open, lightweight multimodal embedding model
Artikel ini ditulis ulang oleh Tim Classai dengan bantuan AI berdasarkan sumber di atas — bukan terjemahan. Ada yang keliru? Kabari kami di [email protected].
Pertanyaan yang sering ditanyakan
Apa bedanya EmbeddingGemma 2 dengan model embedding biasa?
Model embedding biasa umumnya cuma menerima input teks, sementara EmbeddingGemma 2 bisa memetakan teks, kode pemrograman, gambar, video, dan audio ke dalam satu ruang vektor yang sama.
Berapa memori RAM yang dibutuhkan untuk menjalankan model ini?
Untuk pemrosesan teks saja dengan kuantisasi, model ini butuh RAM aktif sekitar ~191MB di perangkat seluler. Jika menjalankan seluruh modalitas lengkap, kebutuhan RAM aktifnya berkisar di ~567MB.
Apakah EmbeddingGemma 2 boleh dipakai untuk aplikasi komersial?
Boleh banget. Google DeepMind merilis model ini dengan lisensi Apache 2.0 yang memberi kebebasan bagi developer untuk memakai dan memodifikasi model buat keperluan komersial.
Bagaimana cara memperkecil ukuran database vektor dari model ini?
Kamu bisa memanfaatkan fitur Matryoshka Representation Learning (MRL) bawaannya untuk memotong dimensi vektor dari 768 ke 512, 256, atau 128 dimensi, sehingga kapasitas penyimpanan bisa hemat hingga 6 kali lipat.

Classai Weekly
dari Luthfi · Setiap Senin, 06.30 WIB
Nggak sempat ngikutin berita AI? Biar aku yang rangkumin tiap Senin.
- 5 berita AI paling penting minggu ini — udah disaring, nggak perlu baca puluhan situs
- Kenapa itu penting buat kamu — plus opini jujur Luthfi soal arahnya
- 1 prompt siap pakai yang bisa langsung dicoba
- Pilihan kelas & model AI minggu ini — kadang ada promo khusus pelanggan
Langkah berikutnya
Sudah paham teorinya. Sekarang praktikkan.
Daftar, isi saldo mulai puluhan ribu rupiah, dan panggil model AI pilihanmu dari kode yang sudah ada.
Ditulis oleh
Pengembang Classai Router
Tim Engineering Classai membangun dan menjalankan Classai Router, gateway API AI yang kompatibel dengan format OpenAI dan Anthropic. Kami menulis panduan teknis dari pengalaman mengoperasikan API AI setiap hari.


