Aleph Alpha merilis Kolibri pada 3 Oktober 2026, bertepatan dengan Hari Persatuan Jerman. Model ini adalah transformer Mixture-of-Experts dwibahasa Inggris-Jerman dengan 78 miliar parameter total dan sekitar 3 miliar parameter aktif per token, serta mendukung konteks hingga 1 juta token. Bobot penuhnya tersedia di Hugging Face dan bisa dipakai di bawah lisensi Apache 2.0, termasuk untuk penggunaan komersial. Yang membuatnya menarik bukan hanya ukurannya, tetapi kombinasi antara efisiensi, keterbukaan bobot, dan fokus pada kebutuhan sektor yang diatur ketat seperti administrasi publik dan industri dirgantara.
TL;DR
- Kolibri dirilis 3 Oktober 2026 dengan 78B parameter total dan 3B aktif.
- Model mendukung konteks hingga 1 juta token dan bobot penuh Apache 2.0.
- Kolibri Origin, versi sebelumnya, hanya 30B parameter dengan konteks 65k.
- Pelatihan memakai 768 GPU B200 dan sekitar 24T token.
- Di benchmark internal, skor beberapa sektor naik dari 0,14 menjadi 0,59.
Apa Itu Kolibri dan Apa Bedanya?
Kolibri adalah model bahasa Mixture-of-Experts yang dirancang untuk pekerjaan misi kritis yang berdaulat di area teregulasi, termasuk administrasi publik, industri, dan kedirgantaraan. Arsitektur Mixture-of-Experts berarti model punya banyak parameter total, tetapi hanya sebagian kecil yang aktif untuk setiap token. Pada Kolibri, dari 78 miliar parameter total, hanya sekitar 3 miliar yang aktif per token. Pendekatan ini menekan biaya penyajian tanpa mengorbankan kapasitas model secara keseluruhan.
Menurut laporan teknis Aleph Alpha, Kolibri adalah hasil iterasi berkelanjutan dari upaya pelatihan model mereka. Mereka lebih dulu membangun dan memvalidasi jalur pelatihan lewat Kolibri Origin, model 30 miliar parameter total dengan 3 miliar aktif dan jendela konteks 65 ribu token yang jauh lebih pendek. Kolibri kemudian melewati jalur yang sama: dari pencernaan dan kurasi data, ablasi, pra-pelatihan, pasca-pelatihan, hingga evaluasi akhir. Investasi pada jalur ini terlihat dari seberapa jauh Kolibri melampaui Kolibri Origin dalam waktu yang berdekatan.
Seberapa Cepat Kolibri Dibangun?
Pekerjaan pada jalur pelatihan dimulai pada Januari. Lima bulan dan ratusan percobaan ablasi kemudian, Kolibri Origin menyelesaikan pra-pelatihan pada skala target tanggal 11 Juni. Kolibri menyelesaikannya pada 11 September. Dalam tiga bulan di antara dua tanggal itu, mereka berpindah dari 30 miliar parameter ke 78 miliar, dari jendela konteks 65 ribu token ke hingga 1 juta token, dan dari 7,5 triliun token pelatihan ke 20 triliun token. Untuk mendapatkan 20 triliun token itu, jalur mereka memproses lebih dari 200 triliun token data mentah yang difilter, dideduplikasi, dan dikurasi.
Pada periode yang sama, mereka mengubah desain atensi, melipatgandakan jumlah pakar menjadi tiga kali, meningkatkan sparsitas, mengganti algoritma routing, memperbaiki data pasca-pelatihan, lebih dari menggandakan jumlah tugas lingkungan, dan mengajarkan model bernalar pada empat tingkat usaha berbeda. Meski keduanya menjaga jumlah parameter aktif per token yang mirip, Kolibri berlatih lebih cepat per token daripada Kolibri Origin berkat kerja tim efisiensi.
Berapa Besar Sumber Daya yang Dipakai?
Kolibri dilatih pada 768 GPU B200 dalam tiga tahap. Menurut laporan teknisnya, tahap pertama adalah pra-pelatihan 20 triliun token pada panjang sekuens 16 ribu selama 21 hari. Tahap kedua adalah pelatihan menengah 3,44 triliun token pada 64 ribu token. Tahap ketiga adalah adaptasi konteks panjang 200 miliar token pada 256 ribu token. Secara total, ini hampir 24 triliun token, sekitar tiga kali lipat konsumsi Kolibri Origin.
Komposisi bahasanya juga spesifik. Bahasa Jerman menyumbang lebih dari seperlima campuran pra-pelatihan, sekitar 4,3 triliun token, dibandingkan sekitar 62 persen bahasa Inggris dan 14 persen kode. Untuk mencapai proporsi Jerman itu, mereka harus mencari 4 triliun token Jerman. Setelah deduplikasi dan pemfilteran, kumpulan data Jerman terbuka hanya menyisakan 390 miliar token, jauh dari target. Kekurangannya ditutup dengan mengkurasi data Jerman dari Common Crawl sendiri, dengan parameter pemfilteran yang disetel ulang khusus untuk bahasa Jerman, karena pengaturan standar bahasa Inggris diam-diam membuang gaya penulisan administrasi publik Jerman.
Bagaimana Hasil Benchmark Kolibri?
Menurut tabel benchmark pada laporan teknis, Kolibri mencatat skor 96,9 pada AIME 2025, 84,3 pada GPQA diamond, 85,9 pada LiveCodeBench v6, dan 92,7 pada HumanEval+. Pada AIME 2025 versi Jerman, skornya 87,5, sedangkan GPQA diamond versi Jerman 81,3. Angka-angka ini dipakai Aleph Alpha untuk menunjukkan bahwa Kolibri bersaing dengan model yang jumlah parameter aktifnya hingga empat kali lebih besar, misalnya Nemotron 3 Super.
Selain benchmark publik, mereka membangun suite evaluasi internal untuk sektor yang mereka layani, seperti sektor publik Jerman, penerbangan, manufaktur, dan industri otomotif. Setiap suite mencerminkan keterampilan, alur kerja, dan kasus tepi yang dibutuhkan sektor tersebut, dan lingkungan pelatihan sintetis yang berpasangan memungkinkan peningkatan terhadap evaluasi itu tanpa pernah melatih pada data pelanggan. Hasilnya, skor pada benchmark proksi pelanggan naik konsisten di lima vertikal.
| Vertikal | Skor Kolibri Origin | Skor Kolibri |
|---|---|---|
| Pemasok otomotif | 0,72 | 0,99 |
| Semikonduktor | 0,35 | 0,80 |
| Sektor publik Jerman | 0,54 | 0,75 |
| Teknologi penggerak industri | 0,31 | 0,60 |
| Kedirgantaraan | 0,14 | 0,59 |
Kenapa Efisiensi dan Kedaulatan Jadi Fokus?
Keputusan desain Kolibri didorong oleh biaya penyajian. Dalam eksperimen mereka, memperbesar model dari 32 miliar ke 123 miliar parameter memang meningkatkan performa, tetapi biaya pelatihan dan penyajiannya ikut naik. Ukuran 123 miliar hanya sanggup menangani tiga kueri pengguna berkonteks 256 ribu token pada dua GPU H100, sementara 78 miliar menangani 18 permintaan bersamaan dan mendekode 28 persen lebih cepat. Karena itu mereka memilih 78 miliar parameter dan memakai 384 pakar yang lebih kecil alih-alih pakar yang lebih sedikit tetapi lebar.
Mereka juga menerapkan logika efisiensi pada atensi. Dari 50 lapisan total, hanya 10 yang memproses konteks penuh, sedangkan 40 sisanya memakai jendela fokus 512 token. Ini menjaga komputasi dan memori tetap terbatas di lapisan-lapisan tersebut, apa pun panjang konteksnya. Keuntungan efisiensi ini bermanfaat baik untuk penyajian model terlatih maupun selama pembelajaran penguatan pasca-pelatihan, yang sangat bergantung pada inferensi dalam jumlah besar.
Dimensi kedua adalah kedaulatan. Aleph Alpha mendefinisikannya sebagai kombinasi antara cara model dibangun dan bagaimana ia berpindah ke pelanggan. Mereka menawarkan integritas rantai pasok penuh dan bisa mempertanggungjawabkan setiap keputusan, dari pencernaan data hingga evaluasi akhir. Pelanggan mendapat kebebasan penuh dalam penyebaran dan keamanan kekayaan intelektual, sehingga kepatuhan menjadi properti yang diwarisi dari model, bukan lapisan tambahan yang harus dipasang belakangan. Dengan bobot terbuka di bawah Apache 2.0, model bisa dijalankan di infrastruktur sendiri tanpa mengirim data internal ke layanan inferensi pihak ketiga.
Bagaimana Cara Menjalankan Kolibri Sendiri?
Bobot penuh Kolibri tersedia di Hugging Face dan dirilis di bawah Apache 2.0. Untuk menjalankannya, kamu perlu menyiapkan perangkat keras yang memadai, karena meski hanya sekitar 3 miliar parameter yang aktif per token, seluruh 78 miliar parameter tetap harus tersimpan. Aleph Alpha juga menyediakan plugin inferensi di PyPI yang dirancang untuk melayani model mereka, sehingga integrasi dengan tumpukan inferensi yang sudah ada bisa lebih mudah.
Karena model ini diarahkan untuk pekerjaan yang berdaulat, pola penyebaran yang masuk akal adalah menjalankannya di infrastruktur sendiri, sehingga data internal tidak perlu dikirim ke layanan pihak ketiga. Untuk organisasi yang terikat aturan tentang lokasi data dan jejak audit, kemampuan menempatkan model sepenuhnya di premis sendiri sering menjadi pertimbangan yang menentukan, terlepas dari skor benchmark.
Apakah Kolibri Bisa Dipakai untuk Bahasa Indonesia?
Belum ada data publik yang menunjukkan kemampuan Kolibri pada bahasa Indonesia. Model ini secara eksplisit dirancang untuk bahasa Inggris dan Jerman, dengan campuran pra-pelatihan yang didominasi kedua bahasa tersebut ditambah kode. Kalau kamu membutuhkan model untuk bahasa Indonesia, sebaiknya uji sendiri dengan data representatif, karena performa pada bahasa yang tidak menjadi fokus pelatihan biasanya jauh di bawah klaim utama yang dipublikasikan.
Apa yang Membuat Pendekatan Aleph Alpha Berbeda?
Dua hal menonjol. Pertama, mereka membangun dan memvalidasi jalur pelatihan lewat model pendahulu sebelum menskalakan, sehingga masalah infrastruktur ditemukan pada skala yang lebih murah. Selama 21 hari pra-pelatihan Kolibri, tercatat 38 gangguan tak terencana, kira-kira satu per 10.000 jam GPU, dan semuanya ditangani otomatis tanpa intervensi manusia, dengan pelatihan dilanjutkan dari checkpoint paling jauh 250 langkah ke belakang. Kedua, mereka menekankan transparansi dan kemampuan menjelaskan keputusan, termasuk lewat jejak penalaran dan protokol yang melatih model untuk menahan diri menjawab ketika konteks tidak mendukung.
Pendekatan itu mencerminkan pilihan strategis: alih-alih mengejar skor tertinggi di semua benchmark, mereka mengoptimalkan untuk kasus penggunaan pelanggan di sektor yang diatur ketat. Untuk pembaca yang menilai model dari angka publik, penting diingat bahwa benchmark internal mereka diukur dengan suite yang mereka susun sendiri, sehingga hasilnya paling relevan untuk kebutuhan pelanggan mereka, bukan sebagai perbandingan universal yang berlaku untuk semua pemakaian.
Apakah Ukuran Kecil Berarti Kualitas Lebih Rendah?
Tidak otomatis. Arsitektur Mixture-of-Experts memungkinkan model menyimpan kapasitas besar sambil hanya mengaktifkan sebagian kecil parameter per token, sehingga biaya penyajian turun tanpa harus memangkas kemampuan secara proporsional. Menurut laporan teknis Aleph Alpha, pada tugas matematika, kode, grounding, dan konteks panjang, Kolibri menyamai model yang jumlah parameter aktifnya hingga empat kali lebih besar. Namun angka itu berasal dari suite pengujian mereka sendiri, jadi kesimpulan yang jujur adalah bahwa efisiensi ini menjanjikan, bukan bahwa model kecil selalu setara dengan model besar di semua tugas.
FAQ
Berapa parameter Kolibri?
Kolibri punya 78 miliar parameter total dengan sekitar 3 miliar parameter aktif per token, dan mendukung konteks hingga 1 juta token.
Apakah bobot Kolibri bisa diunduh gratis?
Ya. Bobot penuhnya tersedia di Hugging Face dan dirilis di bawah lisensi Apache 2.0, sehingga bisa dipakai sesuai ketentuan lisensi tersebut, termasuk untuk keperluan komersial.
Bahasa apa saja yang didukung Kolibri?
Kolibri dirancang khusus untuk bahasa Inggris dan Jerman. Campuran pra-pelatihannya sekitar 62 persen bahasa Inggris, lebih dari seperlima bahasa Jerman, dan 14 persen kode.
Berapa GPU yang dipakai untuk melatih Kolibri?
Pelatihan memakai 768 GPU B200 dalam tiga tahap, dengan total hampir 24 triliun token, sekitar tiga kali lipat konsumsi Kolibri Origin.
Apakah Kolibri bisa dijalankan di infrastruktur sendiri?
Ya. Ukurannya yang efisien dirancang agar bisa dijalankan di premis sendiri, sehingga data internal tidak perlu dikirim ke layanan inferensi pihak ketiga.
Sumber utama: pengumuman Kolibri di blog Aleph Alpha, laporan teknis Kolibri, bobot model Kolibri-1 di Hugging Face, dan plugin inferensi aleph-alpha-inference di PyPI.
💬 Komentar (0)
Belum ada komentar. Jadilah yang pertama! 💬