AI & Tech

Riset AI di Lab Universitas Justru Hidup Lagi Karena Keterbatasan

Riset AI di Lab Universitas Justru Hidup Lagi Karena Keterbatasan

Ada dua cerita yang sering muncul bersamaan di lingkungan akademik, dan keduanya bertolak dari asumsi yang sama. Cerita pertama datang dari ruang kelas. Tim Dettmers menceritakan bahwa ia pernah mengajukan pertanyaan yang ia sendiri segan ajukan ke sekitar 150 mahasiswa: siapa yang takut tidak mendapat pekerjaan setelah lulus. Sekitar 80 persen mengangkat tangan, artinya kira-kira 120 orang menyatakan dalam satu gerakan bahwa mereka tidak yakin ada tempat bagi mereka di masa depan.

Cerita kedua datang lewat surel. Mahasiswa doktoral yang tidak sabar menunggu wisuda, karena mereka ingin segera bergabung dengan lab frontier dan sudah menyimpulkan bahwa riset di akademik tidak bermakna.

Dettmers berargumen bahwa kedua cerita itu salah, dan salah karena alasan yang sama. Keduanya mengasumsikan bahwa masa depan riset milik siapa pun yang punya GPU paling banyak. Menurutnya yang terjadi justru sebaliknya: akademik kemungkinan besar akan mengalami renaissance, dan pekerjaan paling menarik satu dekade ke depan akan terjadi di lab universitas, bukan meskipun sumber dayanya terbatas, tetapi justru karena keterbatasan itu.

Unit Riset Bukan Lagi Paper

Ada perubahan yang menurut Dettmers sudah terjadi dalam setahun terakhir, dan sebagian besar orang belum memperbarui kebiasaannya untuk menyesuaikan. Dengan agen, proyek riset menjadi mudah dan cepat. Pekerjaan yang dulu butuh setahun rekayasa dan eksperimen sekarang selesai dalam hitungan pekan, kadang hitungan hari.

Bagian yang lebih lama ia sadari adalah konsekuensinya: ketika setiap proyek individual menjadi mudah, pekerjaan yang terpisah-pisah berhenti menjadi riset yang baik. Satu paper di sini, satu paper di sana, masing-masing berdiri sendiri, masing-masing meminta pembaca merangkai sendiri kepingannya. Itu format dari dunia di mana setiap keping mahal.

Kesulitannya tidak hilang, hanya berpindah. Menerbitkan satu paper tidak lagi sulit. Yang sulit adalah menerbitkan ekosistem yang koheren. Dettmers menyebut unit riset sekarang adalah ekosistem, dan itu alasan keberadaan Open Source Week di labnya.

Tujuannya konkret: membangun komponen yang saling menopang, bukan sekadar hidup berdampingan, sehingga setiap bagian membuat bagian berikutnya lebih berguna. Semua itu berada di persimpangan tiga hal, yaitu kerangka penyajian inferensi, harness agen beserta cara kerjanya, dan kombinasi keduanya menjadi sistem riset otonom.

Ada satu syarat yang ia tekankan: semuanya harus mudah dipakai. Open source yang hanya bisa dijalankan peneliti berpengalaman bukan open source. Aksesibilitas punya dua paruh, yaitu sumber daya yang dibutuhkan dan keahlian yang dibutuhkan. Hanya satu dari keduanya yang dibatasi perangkat keras. Dua GPU atau sebuah MacBook bisa cukup. Persyaratan keahlian adalah masalah desain, dan solusinya adalah mengabstraksi semua detail teknis yang tidak perlu dipikirkan pengguna. Di situlah sebagian besar usaha mereka pergi, dan paling terlihat di harness agen.

Melepas Harness ke Repositori

Dettmers memulai dari harness karena itulah yang membuat komponen lain bisa dipakai. Ia menyoroti kejanggalan umum: orang sering mendengar tentang sesi agen yang berjalan berjam-jam, berhari-hari, bahkan berpekan-pekan, tetapi bagi sebagian besar orang cara mencapainya masih misteri.

Caranya, dalam deskripsinya, sederhana. Kamu mengarahkan harness ke sebuah repositori, misalnya kerangka inferensi berisi kernel CUDA, lalu menyuruhnya mengoptimalkan kernel tersebut. Setelah itu kamu tinggalkan. Agen terus memperbaikinya melewati bagian-bagian yang perkembangannya lambat dan pekerjaannya menjemukan, dan terus berjalan sampai kamu kembali. Tidak ada umpan balik yang diberikan di tengah jalan, sehingga agen harus mencari tahu sendiri setiap kali ada hal yang tidak jelas.

Pendekatan itu mereka pakai untuk implementasi Mac dan Metal pada kerangka inferensi mereka. Satu perintah melepaskan agen ke kernel tersebut. Yang kembali adalah inferensi terkuantisasi dari model Qwen 3.6 35B-A3B pada 450 token per detik, dengan kualitas keluaran yang baik pada 1,5 bit per bobot.

Untuk memberi rasa skala angka itu, model half precision membutuhkan 16 bit untuk setiap bobot. Pada 1,5 bit, model yang sama berjalan dengan memori sekitar sepersepuluhnya, dan cukup cepat sehingga terasa seperti proses lokal, bukan layanan jarak jauh.

Model yang Dulu Tidak Terjangkau, Kini di Perangkat Sendiri

Pertanyaan yang menjadi inti tulisannya adalah: apa yang terjadi ketika model yang dulu di luar jangkauan muat di perangkat yang sudah dimiliki orang.

Qwen 3.8 dengan 27 miliar parameter sudah menjadi model lokal yang populer. Kerangka mereka memungkinkan menjalankan saudara besarnya, Qwen 3.8 Flash Next dengan 125 miliar parameter, di satu GPU 24 GB, yaitu kartu yang ada di komputer desktop biasa.

Dengan AMD Strix, NVIDIA DGX Spark, atau MacBook dengan memori 128 GB, pengguna bisa menjalankan DeepSeek V4.1, model 550 miliar parameter. Panjang konteks juga tidak perlu diurus manual: kompresi dan penanganan konteks otomatis, dan inferensi tetap cepat pada konteks panjang.

Bagian yang paling ia banggakan adalah penggabungan semua keping itu menjadi riset otonom. Di jalan itu mereka membangun teknik pengambilan informasi baru dengan presisi yang menurutnya belum pernah ia lihat. Sistem itu mengalahkan sistem deep research dari lab frontier, dan menghasilkan hasil riset otonom yang lebih baik daripada sistem Sakana AI maupun ScientistOne dari Google. Semuanya berjalan sepenuhnya lokal, tanpa akses internet sama sekali.

Eksperimen Dua Jam di Bidang yang Tidak Dikuasai

Dettmers memberi satu contoh eksperimen yang cukup konkret. Ia meminta agen mencari masalah yang layak dikerjakan di bidang bioinformatika, bidang yang ia akui tidak ia kuasai, dengan kriteria spesifik. Progresnya harus cepat. Evaluasinya harus cukup murah untuk dijalankan di perangkat yang sudah ada. Dan masalahnya harus segar, dengan riset aktif yang diterbitkan dalam empat pekan terakhir, supaya mereka mengerjakan sesuatu yang belum disepakati bidang itu.

Agen mengembalikan tiga masalah. Mereka mengambil yang pertama, dan dalam sekitar dua jam agen sudah menetapkan batas bawah baru untuk metode heuristik, mengembangkan dan menguji metode heuristik terbaik dalam literatur, bergerak lebih dekat ke metode mahal yang dilatih dengan model AI, dan menemukan masalah pada sumber data yang dipakai semua orang untuk mengevaluasi masalah tersebut.

Hasilnya tidak mencapai state of the art pada masalah keseluruhan, dan Dettmers menyatakan itu secara terbuka. Namun dua jam kerja di mesin di labnya menghasilkan empat hasil, dan salah satunya mempertanyakan data evaluasi yang menjadi sandaran seluruh bidang tersebut. Bagi sebuah lab dengan sumber daya terbatas, itu bukan pencapaian kecil.

Bukti Adopsi yang Lebih Jujur daripada Benchmark

Sistem itu bukan demo yang hanya dikeluarkan untuk tulisan blog. Mahasiswa Dettmers memakainya setiap hari. Sebelum berada di dalam harness, sistem itu hidup di dalam bot Slack, dan cukup rapuh sehingga kadang mati. Ia mengaku tidak punya sistem surel yang memberitahunya ketika bot Slack itu offline, tetapi ia punya hal terbaik berikutnya: mahasiswanya sering menulis pesan berisi keluhan bahwa bot Slack bermasalah dan tidak jalan lagi.

Ada satu bagian yang menarik secara metodologis. Dalam konteks kolaboratif, ia memakai sistem itu setelah merekam rapat. Sistem menghasilkan pertanyaan riset dari rekaman, mengevaluasi ide yang dibahas terhadap literatur, dan memilah arah yang menjanjikan dari yang tidak. Lalu membuat dokumen dan mengirimkannya ke mahasiswa. Ia melakukan itu untuk dua rapat. Mahasiswa menyukainya, tapi prosesnya merepotkan karena ada komponen manual berupa menyalin dua bagian ke pipeline, jadi ia berhenti.

Dua rapat berikutnya ia tidak memakai sistem itu. Kemudian mahasiswanya bertanya dengan antusias apakah bisa dipakai lagi, karena mereka merasa sistem itu sangat membantu memahami riset mereka. Dettmers menyebut itulah satu-satunya evaluasi alat riset yang ia percayai: orang memintanya kembali setelah kamu berhenti memberikannya. Ini ukuran yang sulit dimanipulasi, dan sekaligus pengingat bahwa angka adopsi harian tidak selalu mencerminkan nilai yang dirasakan pengguna.

CliffCompaction dan Pertanyaan yang Jarang Dibahas

Keping terakhir adalah yang paling banyak mereka pakai tetapi paling jarang mereka bicarakan: bagaimana menjaga agen tetap bekerja setelah percakapan seharusnya berakhir. Jawaban mereka adalah teknik auto-compaction bernama CliffCompaction. Dettmers menyatakan teknik ini sudah dipakai di labnya selama berbulan-bulan, dan ia tidak ingin lagi menjalankan agen tanpa itu. Ia mengklaim teknik tersebut jauh lebih efisien daripada yang diimplementasikan Claude Code atau Codex.

Klaim perbandingan seperti itu perlu diuji sendiri sebelum dijadikan dasar keputusan, karena efisiensi auto-compaction sangat bergantung pada pola beban kerja. Yang bisa diambil tanpa harus mempercayai klaimnya adalah arah berpikirnya: konteks panjang bukan tujuan akhir, dan menjaga agen tetap produktif dalam waktu lama adalah masalah manajemen memori, bukan masalah ukuran context window. Kalau ingin konteks serupa soal menekan kebutuhan memori pada model, ada juga catatan teknis tentang consistent hashing di Rust: Hemat 100 TB RAM dengan Consistent Hashing.

Yang Belum Terjawab

Klaim-klaim dalam tulisan tersebut kuat, dan justru karena itu perlu dibaca dengan daftar pertanyaan yang jelas. Beberapa hal yang belum bisa diverifikasi dari luar:

  • Angka 450 token per detik pada 1,5 bit per bobot diukur pada perangkat tertentu, model tertentu, dan panjang konteks tertentu. Angka itu tidak otomatis berlaku untuk kombinasi perangkat dan konteks yang berbeda.
  • Klaim bahwa sistem riset otonom mereka mengalahkan sistem lab frontier dan ScientistOne dari Google tidak disertai rincian tolok ukur yang bisa direplikasi di tulisan tersebut.
  • Klaim efisiensi CliffCompaction dibandingkan implementasi lain belum disertai angka terukur di tulisan itu.

Ini bukan alasan mengabaikan arah yang mereka tunjukkan, melainkan alasan menguji sendiri sebelum memindahkan beban kerja produksi ke atasnya. Untuk tim yang tertarik, jalur paling murah adalah mereplikasi satu beban kerja kecil, mengukur, lalu memutuskan berdasarkan hasil pengukuran sendiri. Sikap yang sama berlaku saat membaca klaim performa apa pun, termasuk dari vendor besar.

Ada satu hal yang bisa diambil tanpa menunggu verifikasi, yaitu pola penilaian alat riset yang dipakai Dettmers. Ukuran bahwa pengguna meminta kembali sebuah alat setelah kamu berhenti memberikannya lebih sulit dimanipulasi daripada jumlah pengguna aktif harian, dan lebih dekat ke nilai yang benar-benar dirasakan. Untuk tim internal, ini bisa dipakai sebagai pertanyaan sederhana saat mengevaluasi alat baru: kalau alat ini dimatikan pekan depan, siapa yang akan menanyakan.

Sumber

Catatan: angka token per detik, ukuran model, dan klaim perbandingan performa dalam artikel ini berasal dari tulisan penulisnya dan belum diverifikasi ulang secara independen.

💬 Komentar (0)

Belum ada komentar. Jadilah yang pertama! 💬

Komentar akan muncul setelah moderasi.