Google lagi lanjutin pengembangan Android Bench lewat versi 2.0 yang nunjukkin gimana AI bisa nanganin tugas pengembangan yang lebih ribet. Kalau versi pertamanya cuma fokus ke perubahan kecil di repositori yang udah ada, kayak benerin bug atau nambahin fitur kecil, Android Bench 2.0 ini targetnya beda banget. Mereka mau ngetes tugas-tugas yang kompleks banget, yang biasanya ngebikin engineer butuh waktu berhari-hari bahkan seminggu buat nyelesainnya, kayak nambahin fitur baru, ngebangun aplikasi dari nol, sampai konversi aplikasi cross-platform ke Android.
Karena fokusnya berubah, Google ngerasa mereka butuh cara evaluasi dan penilaian yang lebih detail, nggak cuma sekadar lulus atau gagal doang. Sekarang mereka pindah dari sistem biner ke sistem skor yang terus-menerus. Mereka ngitung tingkat penyelesaian ini lewat gabungan beberapa faktor, kayak fungsinya gimana, tampilan visualnya seberapa mirip, sampai mastiin nggak ada error baru yang muncul. Mereka juga ngasih penalti skor kalau ada model yang nggak ngikutin instruksi evaluasi atau melanggar batasan struktur yang udah ditentuin.
.png)
Dalam pengujian ini, Google udah ngetes beberapa model kayak Gemini 3.7/3.8 Flash, OpenAI GPT-6, Anthropic Fable 5.1, Kimi K3, dan Qwen 3.8 Max. Hasilnya, GPT-6 Astra ada di posisi paling atas dengan tingkat kelulusan 28%. Angka ini emang kelihatan kecil kalau dibandingin sama skor yang mencapai 90% di metode sebelumnya, tapi ini karena standar tugasnya emang jauh lebih susah.
Google juga bagiin beberapa temuan menarik buat kita semua. Sepertinya, proses mindahin aplikasi cross-platform ke Android masih jadi tantangan besar karena nggak ada satu pun model yang bisa dapet skor lulus 100%. Model-model paling canggih pun mentok di tingkat penyelesaian sekitar 80%. Selain itu, AI emang lebih jago pas disuruh nulis kode baru daripada pas disuruh ngerombak (refactoring) kode yang udah ada. Tugas refactoring atau migrasi itu rasanya lebih susah karena keberhasilannya bukan tergantung seberapa banyak kodenya, tapi seberapa ribet arsitekturnya.
.png)
Meskipun gitu, model-model AI ini nunjukkin kemampuan yang kuat buat tugas-tugas yang sifatnya pasti, kayak konversi Java ke Kotlin, ganti Retrofit ke Ktor, atau nambahin layer ViewModel. Tapi, mereka bakal ngerasa keganggu atau kesulitan kalau tugasnya butuh validasi saat aplikasi jalan (kayak pas ada masalah di dependency injection), harus ngadepin perubahan framework yang drastis, atau pas mereka nggak tau soal library yang belum rilis.
Pas ngetes pakai sistem agent, Android Bench ngerun agent dari penyedia modelnya masing-masing, kayak Gemini 3.8 Flash di Google Antigravity dan GPT-5.6 Sol dengan Codex. Google bilang kalau desain harness yang bagus emang beneran ngebantu hasil kerja developer. Kedepannya, mereka berencana buat terus nambahin berbagai kombinasi model dan agent yang beda-beda buat ngetes kemampuan AI ini lebih dalam lagi.
Sumber: Google Blog
