Artificial Analysis, lembaga pengukuran independen untuk model bahasa, memperbarui profil Mercury 2.5 pada September 2026. Model ini dikembangkan Inception sebagai model proprietary dan menarik perhatian karena satu alasan yang jarang jadi sorotan utama: kecepatannya. Mercury 2.5 mencatat 780,8 token keluaran per detik, menempatkannya di peringkat kedua dari 173 model yang diukur di basis data tersebut.
Angka kecepatan itu datang bersama catatan yang tidak bisa diabaikan. Skor kecerdasannya berada di bawah rata-rata. Kombinasi ini membuat Mercury 2.5 jadi contoh bagus untuk membahas satu hal yang sering salah dipahami dalam pemilihan model: kecepatan dan kecerdasan adalah dua sumbu berbeda, dan model yang menang di satu sumbu belum tentu berguna di sumbu lain.
Profil singkat
Sebelum menilai angkanya, ada baiknya memahami posisi model ini.
- Pengembang: Inception.
- Jenis: model proprietary, bobotnya tidak dirilis terbuka.
- Rilis: September 2026.
- Penalaran: ya. Halaman profil yang diukur adalah varian reasoning, dan dicatat bahwa varian non-reasoning mungkin juga tersedia.
- Modalitas: masukan teks, keluaran teks. Tidak multimodal.
- Jendela konteks: 260 ribu token, setara sekitar 390 halaman A4 berukuran huruf 12.
Jendela konteks 260 ribu token menempatkannya di kelas yang cukup luas untuk pekerjaan dokumen panjang, meski bukan yang terbesar di pasar. Karena modalitasnya hanya teks, model ini tidak bisa dipakai untuk tugas yang butuh membaca gambar atau audio secara langsung.
Angka yang membuatnya menonjol
Ada empat metrik dari profil tersebut yang paling layak diperhatikan.
- Kecepatan keluaran 780,8 token per detik. Peringkat 2 dari 173 model. Untuk perbandingan, Artificial Analysis mencatat nilai tipikal di kelas ini sekitar 110 token per detik. Artinya kecepatannya beberapa kali lipat di atas kebanyakan model yang diukur.
- Harga 0,25 dolar per juta token masukan dan 0,75 dolar per juta token keluaran. Keduanya digambarkan sebagai harga sedang, dengan median pembanding 0,25 dolar untuk masukan dan 0,91 dolar untuk keluaran.
- Diskon cache 90 persen. Dengan diskon itu, biaya token masukan yang tersimpan di cache turun menjadi sekitar 0,06 dolar per juta token. Ini penting untuk aplikasi yang mengirim konteks panjang berulang kali.
- Biaya 0,06 dolar per tugas pada Intelligence Index. Ini ukuran biaya rata-rata untuk menyelesaikan satu tugas dalam rangkaian evaluasi tersebut, bukan harga per token.
Satu metrik tambahan yang jarang dibahas tapi relevan untuk perhitungan biaya: verbositas. Mercury 2.5 menghasilkan 35 juta token selama evaluasi Intelligence Index, sementara median model lain mencapai 85 juta token. Model yang lebih ringkas bicara lebih sedikit untuk mencapai hasil yang sama, dan pada harga keluaran yang dihitung per token, ringkas berarti lebih murah dalam praktik.
Kenapa kecepatan tinggi bisa lebih penting dari skor
Kecepatan keluaran yang tinggi sering diremehkan karena terasa seperti urusan infrastruktur, bukan kualitas. Padahal pada beberapa pola pemakaian, kecepatan menentukan apakah sebuah fitur layak dibangun atau tidak.
Pertama, pada agen yang memanggil alat secara berulang. Setiap putaran percakapan menambah token, dan model yang lambat membuat waktu tunggu menumpuk. Pada alur kerja yang butuh lima sampai sepuluh putaran, perbedaan kecepatan per putaran berlipat menjadi perbedaan pengalaman pengguna yang nyata.
Kedua, pada pemrosesan volume besar. Kalau pekerjaannya mengklasifikasi, mengekstrak, atau merapikan ribuan dokumen, throughput menentukan berapa lama pekerjaan itu selesai. Model yang skornya sedikit lebih tinggi tapi berjalan beberapa kali lebih lambat bisa jadi pilihan yang salah kalau tugasnya sederhana.
Ketiga, pada fitur yang berhadapan langsung dengan pengguna. Antarmuka yang menunggu terlalu lama akan ditinggalkan, apa pun kualitas jawabannya. Di titik ini, model cepat dengan jawaban cukup sering mengalahkan model lambat dengan jawaban sempurna.
Di mana skor kecerdasannya berada
Sisi lain dari Mercury 2.5 adalah skor Intelligence Index sebesar 12, dengan peringkat 89 dari 173 model. Artificial Analysis menyebutnya di bawah rata-rata di antara model sekelasnya, sekaligus mencatat bahwa median kelas pembandingnya juga 12. Kesimpulan yang mereka tulis cukup jelas: model ini di bawah rata-rata dalam hal kecerdasan, tapi harganya baik kalau dibandingkan dengan model di rentang harga serupa, dan modelnya jelas cepat serta relatif ringkas.
Angka itu perlu dibaca dengan konteks, bukan sebagai vonis. Skor 12 berarti model ini bukan model penalaran kelas atas. Ia tidak dirancang untuk memecahkan soal matematika kompetisi, membedah argumen hukum yang rumit, atau menangani tugas rekayasa yang butuh rantai penalaran panjang. Kalau beban kerja Anda menuntut hal-hal itu, model dengan skor lebih tinggi akan menghemat waktu dan revisi, meskipun tarifnya lebih mahal per token.
Sebaliknya, sebagian besar pekerjaan produksi tidak menuntut penalaran kelas atas. Merapikan teks, mengubah format, mengekstrak field dari dokumen, memberi label kategori, membuat ringkasan pendek, atau menjalankan perintah alat yang sudah jelas: semua itu pekerjaan yang volumenya besar dan tingkat kesulitannya menengah. Di wilayah itulah kombinasi kecepatan tinggi dan harga sedang menjadi bernilai.
Metodologi yang perlu dipahami sebelum menyimpulkan
Artificial Analysis menghitung Intelligence Index versi 4.3.2 dari sepuluh evaluasi: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, dan AA-LCR v1.1. Rangkaian ini mencakup pekerjaan pengetahuan agen, tugas kerja dunia nyata, alur kerja SaaS, penggunaan terminal dan koding, penalaran dokumen profesional, penalaran fisika, akurasi pengetahuan, dan penalaran konteks panjang.
Ada dua hal yang penting dicatat dari daftar itu. Pertama, sepuluh evaluasi ini adalah satu kumpulan uji dengan satu metodologi. Skor 12 berlaku untuk kumpulan itu, bukan untuk semua pekerjaan. Kedua, komposisi indeks condong ke tugas penalaran dan pekerjaan profesional, yang justru bukan kekuatan model jenis ini.
Karena itu, satu angka tunggal tidak cukup untuk memutuskan adopsi. Yang lebih berguna adalah menjalankan kumpulan uji kecil yang mewakili pekerjaan nyata di tim Anda, lalu membandingkan hasil, biaya, dan waktu penyelesaian antar kandidat model. Artificial Analysis sendiri menyediakan pemeringkatan per kemampuan, seperti indeks keuangan dan akuntansi, strategi dan operasi, hukum, dan rekayasa, yang bisa dipakai sebagai titik awal sebelum menguji sendiri.
Untuk konteks industri yang lebih luas, perdebatan soal model cepat versus model pintar ini juga terkait dengan pergeseran perangkat keras inferensi, seperti yang dibahas pada catatan mengenai dominasi LPU dan pergeseran arsitektur NPU pada 2026. Kecepatan keluaran bukan hanya hasil optimasi perangkat lunak, tapi juga konsekuensi dari pilihan arsitektur dan silikon.
Kapan model ini masuk akal dipakai
Dari angka yang ada, beberapa pola pemakaian berikut terasa paling cocok.
- Klasifikasi dan pelabelan volume besar. Pekerjaan yang jawabannya satu label pendek tidak butuh penalaran mendalam, tapi sangat sensitif terhadap throughput dan harga.
- Ekstraksi data terstruktur. Mengubah dokumen menjadi format terstruktur adalah pekerjaan pola, bukan penalaran.
- Putaran alat pada agen. Agen yang memanggil fungsi secara berulang mendapat manfaat langsung dari kecepatan per putaran.
- Fitur antarmuka yang menuntut respons cepat. Saran otomatis, pelengkapan kalimat, atau balasan pendek yang muncul sambil pengguna mengetik.
- Sulih suara dan produksi konten berskala. Pekerjaan yang volumenya besar dan toleransi kesalahannya masih dapat dikoreksi.
Sebaliknya, ada beberapa situasi yang sebaiknya dihindari. Tugas yang menuntut rantai penalaran panjang, analisis kode yang rumit, penyusunan argumen berlapis, atau pekerjaan yang kesalahannya mahal untuk diperbaiki. Pada situasi itu, menghemat biaya per token justru berakhir mahal karena waktu yang habis untuk memeriksa dan memperbaiki hasilnya.
Cara mengukur sendiri di beban kerja Anda
Ada satu metrik yang lebih berguna daripada akurasi mentah maupun harga per token: biaya per tugas yang berhasil. Caranya sederhana.
- Ambil lima puluh sampai seratus contoh pekerjaan nyata dari produksi, lengkap dengan jawaban yang benar.
- Jalankan setiap kandidat model pada kumpulan contoh yang sama, dengan prompt yang identik.
- Hitung total biaya token, termasuk token yang terbuang pada percobaan yang gagal.
- Hitung persentase hasil yang benar menurut kriteria yang bisa diperiksa mesin, bukan penilaian rasa.
- Bagi total biaya dengan jumlah hasil yang benar. Itulah biaya per tugas berhasil.
Pendekatan ini sering membalik kesimpulan awal. Model dengan tarif lebih mahal per token bisa menang kalau ia menyelesaikan tugas dalam satu percobaan, sementara model murah yang perlu tiga percobaan dan satu pemeriksaan manusia justru lebih boros. Pada gilirannya, hasil pengukuran seperti ini juga menentukan layanan mana yang layak dipakai untuk menjalankan beban kerja tersebut, sebagaimana pola yang dibahas pada pilihan runtime serverless untuk aplikasi Python.
Pola pemakaian campuran yang lebih hemat
Cara paling praktis memanfaatkan model seperti ini bukan memakainya untuk semuanya, melainkan membagi pekerjaan berdasarkan tingkat kesulitan. Langkah pertama dalam sebuah alur bisa dikerjakan model cepat dan murah: menyaring masukan, mengklasifikasi permintaan, mengekstrak bagian yang relevan, dan menolak yang jelas tidak perlu diproses. Hanya sebagian kecil permintaan yang lolos ke model penalaran yang lebih mahal.
Pola ini bekerja karena distribusi pekerjaan di produksi biasanya miring. Sebagian besar permintaan pengguna ternyata sederhana dan berulang, sementara hanya sebagian kecil yang benar-benar rumit. Kalau semua permintaan dikirim ke model paling pintar, biayanya membengkak tanpa manfaat sepadan. Kalau semua dikirim ke model paling murah, kualitasnya jatuh di bagian yang justru paling terlihat pengguna.
Mercury 2.5 masuk akal ditempatkan di lapisan pertama pola tersebut. Ia cukup cepat untuk memproses seluruh trafik, cukup murah untuk dijalankan pada volume penuh, dan cukup ringkas sehingga biaya keluarannya tidak membengkak karena jawaban yang bertele-tele. Lapisan kedua diisi model dengan skor lebih tinggi, dan hanya menerima porsi trafik yang sudah tersaring.
Kesimpulan
Mercury 2.5 adalah contoh model yang dirancang untuk satu tujuan tertentu dan berhasil di tujuan itu. Kecepatan keluaran 780,8 token per detik menempatkannya di peringkat kedua dari 173 model yang diukur, dengan harga yang tergolong sedang dan diskon cache yang besar. Skor kecerdasannya sebesar 12 menempatkannya di bawah rata-rata untuk tugas penalaran berat.
Keputusan memakainya karena itu bergantung sepenuhnya pada bentuk pekerjaan, bukan pada peringkat umum. Kalau pekerjaannya bervolume besar, relatif sederhana, dan sensitif terhadap waktu, model ini layak diuji serius. Kalau pekerjaannya menuntut penalaran mendalam, cari model lain dan jangan menawar pada sumbu yang salah.
Sumber
- Artificial Analysis, profil model Mercury 2.5 oleh Inception, diakses 24 September 2026: https://artificialanalysis.ai/models/mercury-2-5
- Diskusi publik atas profil tersebut di Hacker News, September 2026: https://news.ycombinator.com/item?id=44670000
Catatan: seluruh angka dalam artikel ini berasal dari halaman profil Artificial Analysis dan berlaku untuk metodologi Intelligence Index versi 4.3.2 pada saat pengambilan data. Angka dapat berubah saat lembaga tersebut memperbarui pengukuran.
💬 Komentar (0)
Belum ada komentar. Jadilah yang pertama! 💬