Ada kabar seru banget buat kalian yang hobi mainan AI lokal di komputer sendiri. Sekarang model K2-Horizon-MoVA-36B-A4B udah bisa kalian pake secara lokal, dan ini bukan sembarang model. Mereka ngerilis enam versi EXL3 yang bisa kalian pilih sesuai sama spek GPU yang kalian punya, mulai dari yang cuma punya 8 GB sampe yang sultan punya 96 GB. Rasanya kayak dapet kemudahan banget karena nggak semua orang punya hardware dewa, kan?
Model ini emang menarik banget karena dia pake sistem Mixture-of-Experts (MoE). Jadi, walaupun dia nyimpen 36 miliar parameter, tapi pas lagi kerja buat ngeproses token, dia cuma aktifin sekitar 4 miliar parameter aja. Ini ngebikin dia jadi lebih efisien. Mereka juga gabungin Mixture-of-Values attention sama native context sampe 512K. Yang bikin makin keren, mereka bener-bener transparan karena ngebuka semua weights, data training, sampe log-lognya. Jadi kita nggak cuma dapet barang jadi, tapi bisa ngerti gimana dia dibikin.
Kalo kita bandingin sama Qwen3.6-35B-A3B, model K2 Horizon ini kayaknya lebih unggul di banyak hal. Dari data yang dipublish, dia menang di 6 dari 9 poin perbandingan, kayak pas lagi pake tool agentic, Terminal-Bench, SciCode, sampe urusan biar nggak gampang halusinasi. Jadi buat kalian yang butuh AI yang lebih pinter dan nggak asal ngomong, model ini emang layak banget buat dicoba.
Nah, sekarang masalahnya adalah gimana cara kalian milih versi yang pas buat GPU kalian. Kami ngeliat ada beberapa pilihan “tangga” kualitas yang udah disediain. Kalo kalian punya GPU dengan VRAM 48 GB ke atas, mending ambil yang 8.00 bpw. Ukurannya sekitar 38.07 GB dan akurasinya (top-1 agreement) sampe 96.43%. Ini kualitas yang paling deket sama model aslinya. Tapi kalo kalian pengen punya sisa memori lebih buat context atau KV cache yang lebih gede, kalian bisa pake yang 6.50 bpw yang ukurannya 31.34 GB.
Buat kalian yang GPU-nya menengah, kayak yang punya 32 GB, bisa pake yang 5.00 bpw (24.56 GB). Terus kalo kalian cuma punya 24 GB, ada versi 4.00 bpw yang ukurannya 20.05 GB. Buat yang speknya agak terbatas, kayak 16 GB, kalian masih bisa manfaatin versi 2.50 bpw yang cuma 13.27 GB. Bahkan, buat yang cuma punya 8 GB, mereka tetep bisa nyoba pake 2.00 bpw dengan sistem expert offload, meskipun ukurannya jadi 11.01 GB.
Kenapa sih mending pake EXL3? Karena tujuannya emang buat nyari kualitas model paling maksimal di setiap GB-nya. Yang perlu kalian tau, ini bukan kuantisasi biasa yang asal potong bit. Mereka pake workflow SAGE mixed-precision. Jadi, mereka nggak kasih presisi yang sama rata ke seluruh bagian model. Mereka nyesuain alokasi presisinya di tiap bagian model, tapi tetep ngejaga output head-nya di 6-bit. Ini ngebikin hasilnya lebih pinter dibanding kuantisasi standar yang biasanya cuma ngasih angka bitrate sembarangan.
Tiap paket yang mereka rilis udah dites lewat 10.240 posisi token buat dibandingin sama model BF16 aslinya. Top-1 agreement itu artinya model yang udah dikecilin ini milih token selanjutnya yang sama persis kayak model aslinya. Kalo kita liat, model BF16 yang asli itu akurasinya 97.71%, dan versi 8-bit EXL3 ini udah nyampe 96.43%. Itu udah deket banget sama batas maksimal yang bisa dicapai, padahal ukurannya udah dipangkas jadi cuma 38 GB. Gila sih, hemat banget kan?
Kedepannya, mereka lagi ngerjain banyak hal lagi, kayak benchmark buat RTX PRO 6000, ngukur kecepatan decode sama prefill, sampe perbaikan kernel buat MoVA plus MoE. Jadi, buat kalian yang pengen tau seberapa kenceng model ini pas jalan, tungguin aja update selanjutnya. Intinya, kalo kalian pengen ngerasain AI kelas atas di mesin sendiri, kalian harus mulai ngikutin perkembangan model K2 Horizon ini.
