AI & Tech

Beam: Model Open-Weight 501 Miliar Parameter dari Reflection, Bobot Dirilis Apache 2.0

Beam: Model Open-Weight 501 Miliar Parameter dari Reflection, Bobot Dirilis Apache 2.0

Reflection memperkenalkan Beam pada 5 Oktober 2026 sebagai model open-weight pertamanya: sebuah sparse Mixture-of-Experts dengan 501 miliar parameter total dan 23 miliar parameter aktif, dirancang untuk coding, penalaran, dan beban kerja agentic. Model ini dilatih pada 23,8 triliun token dan menjalani reinforcement learning berskala besar dengan lebih dari 100 juta rollout di 10.500 GPU NVIDIA GB300 selama empat pekan. Bobotnya dijadwalkan dirilis bulan ini di bawah lisensi Apache 2.0, sementara akses awal dibuka lewat daftar tunggu.

TL;DR

  • Beam adalah model open-weight pertama Reflection: sparse MoE 501 miliar parameter total dan 23 miliar aktif.
  • Dilatih pada 23,8 triliun token, lalu RL lebih dari 100 juta rollout di 10.500 GPU GB300 selama empat pekan.
  • Diklaim kompetitif dengan GLM 5.2 dan mendekati Qwen 3.8-Max pada coding serta tugas agentic.
  • Keunggulan utamanya efisiensi inferensi: 3 sampai 4 kali lebih hemat compute dibanding GLM-5.2 pada penalaran lanjut.
  • Bobot, technical report, dan model card dijadwalkan rilis bulan ini di bawah lisensi Apache 2.0.

Apa itu Beam dan seberapa besar modelnya?

Beam adalah model sparse Mixture-of-Experts (MoE) yang hanya mengaktifkan sebagian parameternya saat menghasilkan token. Dari 501 miliar parameter total, sekitar 23 miliar di antaranya aktif per langkah. Arsitektur MoE seperti ini bertujuan memberi kapasitas pengetahuan besar dengan biaya inferensi lebih rendah dibanding model padat berukuran setara, karena hanya subset ahli yang dipanggil untuk tiap token. Penjelasan lengkapnya ada di pengumuman resmi Beam.

Reflection membangun fondasinya lewat dua tahap. Pertama, pretraining pada 23,8 triliun token berkualitas tinggi dari web, sumber publik, dan kumpulan data berlisensi. Kedua, reinforcement learning berkomputasi tinggi yang menjadi sumbu penskalaan utama. Pada tahap RL, tim menjalankan lebih dari 100 juta rollout di 10.500 GPU NVIDIA GB300 selama empat pekan, dengan panjang konteks maksimum 256K token, sekitar 1,3 miliar sandbox untuk pelatihan dan penilaian, serta hampir satu juta lingkungan tugas. Pretraining-nya sendiri selesai dalam waktu kurang dari empat pekan pada klaster 6.144 GPU GB300 NVL72.

Bagaimana performa Beam dibanding model open-weight lain?

Reflection menyatakan Beam kompetitif dengan model open berukuran lebih besar seperti GLM 5.2 dan mendekati Qwen 3.8-Max pada tugas coding dan agentic. Perusahaan itu juga jujur menyebut bahwa model seperti Kimi K3 masih unggul pada kemampuan mentah, sementara keunggulan Beam terletak pada efisiensi saat inferensi. Pada penalaran tingkat lanjut, Beam diklaim mencapai skor sebanding GLM-5.2 dengan pemakaian compute inferensi 3 sampai 4 kali lebih sedikit.

Angka-angka ini berasal dari benchmark yang dilaporkan Reflection, dengan data pembanding dari Artificial Analysis dan DataCurve. Perlu dicatat, estimasi compute di sana bersifat perkiraan: mereka menghitung FLOPS sekitar 2 kali jumlah parameter aktif dikali rata-rata token yang dihasilkan, dan tidak memasukkan prefill prompt, operasi attention yang bergantung konteks, serta overhead penyajian. Tabel berikut merangkum sebagian hasil yang dilaporkan pada benchmark coding, penalaran, dan pengetahuan.

Bagaimana Beam dilatih dengan reinforcement learning skala besar?

Reflection menjadikan reinforcement learning berkomputasi tinggi sebagai sumbu penskalaan utama Beam. Untuk menstabilkan proses pada skala itu, tim memakai asynchronous policy gradients, sebab pada pelatihan besar, kebasian kebijakan (policy staleness) menjadi sumber ketidakstabilan yang serius. Rollout berdurasi panjang memuat token yang dihasilkan oleh beberapa checkpoint model sekaligus, sehingga token awal bisa jadi jauh lebih tua dibanding kebijakan saat ini. Reflection mengembangkan algoritma baru agar pembelajaran tetap stabil meski belajar dari interaksi yang dihasilkan lebih dari sehari sebelumnya, bahkan saat sampel tertua sudah tertinggal 107 versi bobot dari kebijakan terkini.

Selain itu, Beam dilatih dengan penalti panjang yang bisa dikendalikan: model diberi imbalan untuk solusi yang berhasil, tetapi didorong agar tidak menghasilkan token berlebihan. Pada tahap awal RL, performa naik justru saat panjang jawaban menurun, tanda model belajar menyelesaikan tugas lebih efektif dengan penalaran lebih ringkas. Setelah kemampuan agentic-nya menguat, panjang jawaban tumbuh lagi, tetapi token tambahan itu menopang peningkatan performa. Pengguna bisa mengatur tradeoff ini lewat parameter reasoning effort: pengaturan rendah menghasilkan jawaban lebih pendek, pengaturan tinggi memberi ruang penalaran lebih panjang untuk tugas berat.

Infrastrukturnya pun dirancang untuk skala itu. Reflection menyebut rata-rata 110 ribu rollout berjalan bersamaan, hingga 170 ribu sandbox bersamaan, dan lebih dari satu miliar permintaan pembuatan sandbox di sepanjang proses. Dari sisi keandalan, 71 insiden inferensi ditangani tanpa menghentikan pelatihan, kapasitas pulih dalam median sekitar delapan menit, dan goodput run pretraining mencapai 92,3 persen menjelang akhir. Bobot baru tiba di armada inferensi dalam median sekitar 12 detik.

Apakah kemampuan agentic Beam digeneralisasi ke tugas baru?

Reflection merancang pelatihan RL Beam untuk mengembangkan kemampuan penalaran dan agentic yang bisa digeneralisasi di luar tugas latihannya. Salah satu bukti yang mereka soroti: selama fase pelatihan pada tugas penalaran, rekayasa perangkat lunak, dan terminal, terjadi peningkatan konsisten pada kemampuan browsing meskipun tidak ada tugas browsing dalam campuran RL. Transfer ini dianggap tanda bahwa Beam mempelajari kemampuan agentic yang lebih luas lintas domain.

Ketika diberi akses web, Beam bahkan belajar sendiri untuk mencari dan menanyai model bahasa lain, serta memakai API OCR untuk membaca dokumen. Reflection menampilkan beberapa contoh penerapan, mulai dari membangun dashboard live untuk subway New York memakai data publik MTA, membuat aplikasi interaktif, hingga menyiapkan notebook fine-tuning untuk model Gemma-4 terkecil pada tugas Text2SQL. Pada contoh terakhir, Beam berhasil menyetel ulang Gemma sehingga akurasinya pada set uji naik 66,5 persen, meski domain itu di luar distribusi latihannya. Ada juga uji generalisasi pada puzzle viral yang baru beberapa hari muncul, di mana Beam mencapai 95,5 persen cakupan benar, berada di antara dua model pembanding.

Apa implikasi Beam bagi tim pengembang?

Karena bobotnya akan dirilis di bawah lisensi Apache 2.0, tim yang ingin menjalankan model coding dan agentic di infrastruktur sendiri punya opsi baru tanpa bergantung pada satu penyedia tertutup. Namun ada catatan praktis: model berukuran 501 miliar parameter tetap menuntut sumber daya besar untuk dilayani, sehingga menjalankannya penuh di perangkat sendiri belum tentu realistis bagi banyak tim. Di sinilah keunggulan efisiensi yang diklaim Reflection menjadi relevan, sebab hanya 23 miliar parameter yang aktif per langkah.

Reflection juga menyatakan akan menyertakan dokumentasi dan tumpukan perangkat lengkap untuk menjalankan, mengevaluasi, dan menyetel ulang model, serta integrasi dengan berbagai library dan harness open source. Kombinasi itu penting bagi tim yang sudah punya alur kerja berbasis perangkat open source dan ingin menambahkan Beam tanpa membangun ulang seluruh pipeline mereka. Namun sebelum memakai untuk produksi, tetap tunggu tanggal rilis bobot resmi dan uji pada beban kerja sendiri.

Satu hal yang perlu dijaga adalah sikap kritis terhadap angka benchmark. Skor yang dipublikasikan berasal dari vendor, dan estimasi efisiensi compute-nya bersifat perkiraan yang tidak memasukkan prefill serta overhead penyajian. Cara paling sehat adalah menunggu pengujian pihak ketiga dan mencoba langsung pada tugas yang relevan dengan kebutuhanmu, bukan hanya menilai dari tabel skor.

BenchmarkBeamGLM 5.2Kimi K3
Terminal Bench v2.180,181,088,3
GPQA Diamond90,591,293,5
HLE tanpa alat36,240,546,9
AIME 202697,899,2Tidak dilaporkan
SWE Bench Verified80,9Tidak dilaporkanTidak dilaporkan

Pada sebagian benchmark, Beam berada sedikit di bawah GLM 5.2 dan Kimi K3. Reflection tidak menyembunyikan hal itu: mereka menyebut keunggulan Beam bukan pada skor mentah tertinggi, melainkan pada jumlah compute yang dibutuhkan untuk mencapai skor tersebut. Untuk pembanding pihak ketiga yang independen, kamu bisa merujuk ke Artificial Analysis, yang datanya juga dipakai Reflection dalam analisis efisiensinya.

Apakah bobot Beam akan dirilis?

Ya. Reflection menyatakan akan merilis bobot Beam bulan ini di bawah lisensi Apache 2.0, disertai dokumentasi dan tumpukan perangkat lengkap untuk menjalankan, mengevaluasi, dan menyetel ulang model. Model ini juga akan diluncurkan bersama mitra distribusi dan integrasi dengan berbagai library serta harness open source, sehingga pengembang bisa memakainya dalam alur kerja yang sudah ada. Teks lisensi Apache 2.0 sendiri bisa dibaca di situs Apache Software Foundation.

Sebelum bobot dirilis, Reflection menggelar akses awal bagi sekelompok pengguna terpilih melalui daftar tunggu. Modelnya masih menjalani tahap akhir red-teaming dan evaluasi, dan hasil evaluasi keamanan akan dipublikasikan dalam technical report. Reflection juga berencana membuka sebagian evaluasi keamanan internal mereka sebagai standar yang bisa diperiksa bersama oleh ekosistem terbuka.

Kapan Beam tersedia untuk umum?

Bobot, technical report, model card, dan artefak pengembang dijadwalkan rilis pada bulan yang sama dengan pengumuman ini, yaitu Oktober 2026, di bawah lisensi Apache 2.0. Sampai saat itu, akses tersedia terbatas lewat daftar tunggu akses awal. Beam juga disebut sebagai model pertama dalam seri, dengan model berikutnya sudah mulai dilatih.

Karena pendekatannya open-weight dan menyertakan integrasi dengan harness serta library open source, Beam menyasar tim yang ingin menjalankan model coding dan agentic di infrastruktur sendiri tanpa bergantung pada satu penyedia tertutup. Untuk kebutuhan produksi, pantau tanggal rilis bobot resminya dan uji pada beban kerja sendiri sebelum menggantikan model yang sedang dipakai.

FAQ

Apakah Beam model multimodal?

Tidak. Beam adalah model teks, meski ia bisa bekerja dengan informasi dari modalitas lain bila direpresentasikan sebagai teks. Reflection mencontohkan Beam memakai API OCR untuk membaca dokumen, dan model ini juga belajar mencari serta menanyai model bahasa lain saat diberi akses web.

Berapa panjang konteks Beam?

Selama pelatihan RL, panjang konteks maksimumnya 256K token, sementara tahap midtraining memperluas panjang konteks efektif hingga 1 juta token. Kombinasi ini ditujukan agar model bisa menangani tugas berhorison panjang yang menuntut penalaran bertahap.

Apakah skor benchmark Beam bisa langsung dipercaya?

Scores itu dilaporkan Reflection, dengan sebagian data pembanding dari Artificial Analysis dan DataCurve. Estimasi efisiensi compute-nya juga bersifat perkiraan dan tidak memasukkan prefill serta overhead penyajian, jadi perlakukan angka-angka tersebut sebagai klaim vendor sampai ada pengujian pihak ketiga.

Model apa yang masih lebih kuat dari Beam?

Menurut Reflection sendiri, model seperti Kimi K3 masih unggul pada kemampuan mentah, dan sebagian benchmark menempatkan GLM 5.2 sedikit di atas Beam. Keunggulan Beam bukan skor tertinggi, melainkan efisiensi inferensi untuk mencapai skor sebanding.

Apakah Beam gratis dipakai?

Bobotnya akan dirilis di bawah lisensi Apache 2.0, lisensi open source permisif, sehingga bisa dipakai sesuai ketentuan lisensi itu. Namun biaya menjalankan model tetap ada, yaitu kebutuhan GPU dan infrastruktur untuk melayani model berukuran 501 miliar parameter ini.

Rekomendasi Tools & Layanan

Mau langsung nyobain AI yang dibahas di artikel ini tanpa setup ribet? AI token plan Alibaba Cloud ngasih akses ke Qwen, DeepSeek, dan model lain lewat satu API — dan platform Qwen buat build agent sendiri. Free tier-nya cukup buat eksperimen pertama.

💬 Komentar (0)

Belum ada komentar. Jadilah yang pertama! 💬

Komentar akan muncul setelah moderasi.