Kita bahas soal Gemma 4 yang lagi rame dibicarain dengan singkat ya. Sebenarnya Gemma 4 itu adalah keluarga model bahasa besar yang sifatnya multimodal dan open, artinya mereka nggak cuma jago ngolah teks doang, tapi bisa juga paham gambar sama suara. Nah, yang bikin menarik, mereka ini punya lima ukuran yang beda-beda dan dibagi ke dalam empat arsitektur yang berbeda juga. Jadi, kalian nggak bisa asal pilih, karena tiap model punya kegunaan yang beda banget tergantung kebutuhan kalian.
Kalau kita mulai dari model yang ukurannya lebih kecil, kayak tipe E2B atau E4B, mereka ini tipenya dense. Maksudnya, mereka itu efisien banget dan emang dirancang supaya pas banget kalau kalian mau pakai langsung di perangkat, kayak di HP atau laptop yang speknya nggak terlalu tinggi. Ada hal unik di sini, huruf “E” di nama E2B atau E4B itu ngerujuk ke kata “effective”. Ini sebenernya ngebawa konsep yang namanya per-layer embeddings atau PLE yang mereka pake di arsitekturnya. Jadi, mereka tuh kayak punya tabel pencarian embedding yang bisa dipake model buat proses pertanyaan-pertanyaan yang masuk. Terus, mereka juga bisa proses audio sama gambar lewat encoder khusus yang emang tugasnya nganalisis berbagai macam modalitas itu. Rasanya teknologi ini ngebikin model kecil jadi nggak kalah pinter buat urusan multitasking.
Terus, kalau kalian ngerasa model kecil kurang kuat, ada model 12B. Model ini satu tingkat lebih gede dan kayaknya bakal cocok banget buat kalian yang pake laptop spek tinggi. Tapi, ada sesuatu yang spesial di sini yang ngebikin dia beda dari yang kecil tadi. Model 12B ini mungkin nggak pake sistem PLE kayak model-model kecil tadi, tapi mereka malah pake metode yang nggak pake encoder alias encoder-free. Jadi, daripada pake encoder khusus kayak yang ada di E2B, mereka malah ngelepasin encoder itu sepenuhnya. Contohnya nih, kalau di E2B ada audio encoder, nah di 12B ini encoder itu dibuang, terus audionya langsung diproyeksiin aja ke LLM-nya. Ini cara yang beda banget buat nanganin input, dan emang ngebikin prosesnya jadi lebih unik.
Nah, kalau kalian butuh yang lebih gila lagi, ada model 26B A4B. Ini tipenya Mixture-of-Experts, makanya ada huruf “A” yang artinya “active”. Jadi gini, meskipun dia punya parameter yang gede banget, yaitu 26 miliar, tapi pas lagi jalan, dia cuma pake 4 miliar parameter aja dalam satu waktu. Ini ngebantu banget biar nggak terlalu berat tapi tetep dapet kecerdasan yang oke. Karena dia model yang lebih gede, mereka juga ngasih vision encoder yang lebih gede juga. Jadi, buat kalian yang punya tugas-tugas penglihatan atau analisis gambar yang susah-susah, model ini emang paling pas buat dipake. Mereka kayaknya emang fokus di situ biar performanya maksimal buat tugas visual yang kompleks.
Terakhir, yang nggak kalah penting, ada model 31B. Ini adalah model tipe dense dan bisa dibilang ini yang paling jago atau paling capable di seluruh keluarga Gemma 4. Sama kayak model gede lainnya, dia juga pake vision encoder yang lebih besar, tapi dia nggak pake trik-trik aneh kayak model lainnya. Dia emang cuma fokus jadi model yang paling pinter di keluarganya. Jadi kalau kalian emang butuh yang paling akurat dan paling kuat tanpa peduli soal efisiensi parameter yang aktif, model 31B ini jawabannya.
Sebenernya tiap model ini kayaknya udah dipikirin banget buat ngasih pilihan ke pengguna. Ada yang buat di HP, ada yang buat laptop, sampai yang buat kebutuhan berat. Mereka semua punya cara masing-masing buat nanganin data, mulai dari pake PLE, sampe cara encoder-free yang tadi gue omongin. Kalau kalian mau ngebaca lebih lanjut atau nyoba sendiri, udah banyak banget sumber daya yang bisa kalian manfaatin di internet. Intinya, Gemma 4 ini ngebawa perubahan cara kita ngelihat gimana model open source bisa sekuat ini buat urusan multimodal.
Kalau mau lebih jelas, silakan tonton video berikut: