AI & Tech

Dust: Pretraining Transformer Tanpa Backpropagation, Kompetitif di Populasi Besar

Dust: Pretraining Transformer Tanpa Backpropagation, Kompetitif di Populasi Besar

QLabs mempublikasikan Dust, sebuah metode zeroth-order yang diklaim sebagai algoritma pertama yang kompetitif dengan backpropagation untuk pretraining model bahasa berbasis transformer. Dust tidak butuh backward pass; ia mengganggu aktivasi secara independen di setiap token, sehingga satu forward pass mengevaluasi seluruh populasi secara paralel. Menurut makalahnya, Dust sekitar 1.000 sampai 10.000 kali lebih efisien dibanding metode evolution strategies berbasis bobot seperti EGGROLL untuk anggaran token 1 juta ke atas.

TL;DR

  • Dust adalah metode zeroth-order yang menghindari backward pass sepenuhnya saat pretraining transformer.
  • Ia mengganggu aktivasi, bukan bobot, dan memakai setiap token sebagai anggota populasi virtual.
  • Pada 1 juta token ke atas, Dust diperkirakan 10^3 sampai 10^4 kali lebih efisien dibanding EGGROLL.
  • Model yang lebih besar justru lebih efisien secara populasi: model 243 juta parameter mengalahkan model 120 kali lebih kecil.
  • Estimasi gradien Dust makin mendekati backprop seiring bertambahnya populasi, stabil hingga 1 miliar token.

Apa itu Dust dan apa bedanya dengan backpropagation?

Dust adalah algoritma kredit asesmen berbasis pencarian yang menggantikan backprop dengan brute-force komputasi, bukan dengan struktur analitik. Alih-alih menghitung gradien lewat aturan rantai, Dust menambahkan derau Gaussian ke keluaran setiap lapisan linear, menjalankan forward pass, lalu memberi hadiah pada setiap token berdasarkan seberapa besar derau itu menurunkan loss. Rata-rata derau yang dibobot hadiah menjadi estimasi error di keluaran lapisan, dan hasil kali luarnya dengan masukan lapisan menjadi gradien bobot.

Perbedaan konseptualnya penting. Backprop memerlukan jaringan yang dapat diturunkan dan menghasilkan gradien orde pertama, dan seluruh arsitektur, optimizer, serta perangkat keras deep learning modern dibangun di sekitar batasan itu. Dust melepas batasan itu: karena tidak butuh backward pass, ia membuka ruang arsitektur yang selama ini sulit dilatih dengan backprop, misalnya komputasi rekuren atau model yang diulang banyak langkah. Penulisnya menyebut tujuan makalah ini adalah meletakkan dasar algoritma kredit asesmen berbasis pencarian, bukan menggantikan backprop hari ini.

Kenapa Dust jauh lebih efisien dibanding metode evolution strategies?

Bottleneck utama evolution strategies adalah ukuran populasi. Setiap anggota butuh salinan bobot yang terganggu dan forward pass sendiri, sehingga populasi dibatasi oleh jumlah forward pass yang mampu dibiayai. EGGROLL membuat salinan itu murah lewat perturbasi low-rank, tetapi tiap anggota tetap satu elemen batch. Dust memindahkan gangguan ke aktivasi dan melakukannya independen per token, sehingga satu sekuens berisi ribuan token setara ribuan anggota populasi dalam satu forward pass.

Efeknya terukur. Menurut makalahnya, dari 1 juta token ke atas Dust berada pada kisaran 10^3 sampai 10^4 kali lebih efisien dibanding implementasi transformer dari EGGROLL, berdasarkan ekstrapolasi penulis. Pada eksperimen 16.000 populasi, EGGROLL bahkan tidak mencapai hasil Dust pada 64 draw. Artinya, dengan populasi 256 kali lebih besar, baseline berbasis bobot itu masih tertinggal, dan untuk menyamai populasi terkecil Dust, ia memerlukan populasi sekitar beberapa ribu sampai 10^4 kali lipat. Ini membuat metode perturbasi aktivasi lebih menarik pada rezim komputasi yang melimpah.

Apakah model yang lebih besar justru lebih efisien dengan Dust?

Ya, dan temuan ini menantang kebijaksanaan umum. Pandangan lama menyatakan metode zeroth-order tidak bisa menskalakan ke jaringan besar, karena satu forward pass hanya mengembalikan satu skalar sehingga varians estimasi gradien tumbuh seiring jumlah dimensi. Dust menguji langsung anggapan itu dengan melatih empat ukuran model pada anggaran tetap 10 juta token: 2 juta, 7 juta, 38 juta, dan 243 juta parameter, sebuah rentang 120 kali lipat.

Hasilnya berlawanan dengan dugaan. Pada hampir semua ukuran populasi, loss turun dari 2 juta ke 7 juta ke 38 juta parameter, dan model 243 juta parameter hanya sedikit lebih buruk. Bahkan pada populasi terkecil yang diuji, model 120 kali lebih besar memberi hasil setara, dan lebih baik pada setiap populasi lain. Selain itu, model besar terus membaik saat populasi ditambah, sementara model kecil cepat jenuh. Setelah 1.000 draw, model 38 juta dan 243 juta parameter memperoleh sekitar 30 persen lebih banyak perbaikan dibanding model 2 juta dan 7 juta parameter. Penulis menafsirkan overparameterization sebagai ruang pencarian yang lebih luas dengan geometri yang berpotensi lebih baik.

Seberapa dekat estimasi gradien Dust dengan backprop?

Untuk mengukur kedekatan itu, penulis menghitung kosinus antara estimasi Dust dan gradien backprop pada batch yang sama, per jenis lapisan, pada checkpoint yang dilatih dengan backprop dari 10 juta hingga 1 miliar token. Kosinusnya naik seiring bertambahnya populasi untuk setiap jenis lapisan dan setiap tahap pelatihan, mengikuti hukum dua parameter dengan galat RMSE di bawah 0,06. Artinya, gradien yang berguna muncul murni dari populasi besar, tanpa aturan rantai yang ditanam, hanya dengan penyetelan ringan hyperparameter.

Yang menarik, kosinus itu tetap stabil melintasi dua orde besaran token pada populasi besar. Ini memberi harapan untuk penskalaan, karena populasi yang dibutuhkan untuk menyamai backprop bisa jadi tidak terus bertambah seiring token. Penulis juga mencatat bahwa estimasi Dust yang mendekati namun tidak persis sama dengan gradien backprop justru menguntungkan: arahnya mirip tetapi lintasan optimisasinya berbeda, dan pada beberapa pengaturan lintasan itu bahkan lebih baik.

Bagaimana perbandingan Dust, backprop, dan EGGROLL?

Ketiganya diuji pada protokol yang sama dengan model GPT bergaya 8 lapisan lebar 512, tokenizer BPE 4096 token, dan data FineWeb. Perbandingan berikut merangkum posisi masing-masing berdasarkan hasil yang dilaporkan penulis, dan perlu dicatat bahwa efisiensi komputasi bukan fokus utama makalah ini.

AspekDustBackpropEGGROLL
Butuh backward passTidakYaTidak
Ruang perturbasiAktivasi per tokenTidak berlakuBobot
Efisiensi relatif10^3 sampai 10^4 lebih efisienBaselineBaseline pembanding
Perilaku saat model membesarLebih efisien secara populasiStabilTertinggal
Respons terhadap AdamMembaikMembaikNyaris tidak berubah

Pada anggaran 100 ribu dan 1 juta token, Dust berakhir di bawah backprop. Pada 10 juta dan 20 juta token, jaraknya menyusut seiring populasi. Di 20 juta token, kecocokan hukum pangkatnya menempatkan batas di angka 4,431 dengan interval 95 persen 3,89 sampai 4,58, di bawah angka backprop 4,633, meski penulis menegaskan itu bacaan yang longgar karena tangganya masih menurun. Yang jelas, Dust masih memerlukan peningkatan efisiensi komputasi beberapa orde besaran sebelum praktis menggantikan backprop.

Apa keterbatasan Dust dan kapan ia belum layak dipakai?

Penulisnya sendiri menegaskan bahwa efisiensi komputasi bukan fokus makalah ini, dan Dust masih butuh peningkatan efisiensi beberapa orde besaran sebelum praktis menggantikan backprop pada tingkat komputasi saat ini. Artinya, untuk produksi sehari-hari, backprop tetap pilihan yang lebih murah dan matang. Dust lebih tepat dipandang sebagai arah riset yang membuka pertanyaan baru, bukan alat siap pakai.

Keterbatasan kedua menyangkut skala eksperimen. Hasil yang dilaporkan berasal dari model berukuran jutaan parameter dan anggaran token hingga puluhan juta, dengan pengukuran kosinus yang diperluas sampai checkpoint 1 miliar token. Model bahasa produksi saat ini jauh lebih besar, sehingga belum ada bukti publik bahwa keunggulan Dust bertahan pada skala tersebut. Klaim penskalaan masih berupa ekstrapolasi, dan penulisnya menandai batas yang dihitung sebagai bacaan longgar.

Keterbatasan ketiga adalah ketergantungan pada komputasi besar. Dust menukar kebutuhan backward pass dengan kebutuhan populasi besar, dan populasi besar berarti biaya komputasi tinggi. Untuk tim tanpa akses ke kluster besar, keuntungan teoretis ini belum bisa direalisasikan. Karena itu, membaca hasil ini sebagai kabar bahwa backprop akan segera digantikan adalah keliru; yang lebih akurat adalah bahwa ruang desain algoritma pelatihan kini terbukti lebih luas dari yang lama diyakini.

FAQ

Apakah Dust bisa menggantikan backprop sekarang?

Belum. Penulisnya sendiri menyatakan efisiensi komputasi bukan fokus makalah ini, dan Dust masih butuh peningkatan efisiensi beberapa orde besaran sebelum layak menggantikan backprop pada tingkat komputasi saat ini.

Apa itu populasi virtual di Dust?

Populasi virtual adalah gagasan mengevaluasi banyak anggota populasi tanpa mewujudkan bobot tiap anggota. Dust menambahkan derau ke aktivasi setiap token, sehingga satu forward pass sebuah sekuens mengevaluasi ribuan anggota sekaligus.

Mengapa model besar justru lebih efisien?

Menurut hasil eksperimennya, model besar punya ruang pencarian lebih luas dengan geometri yang lebih baik, sehingga keuntungan dari ukuran melebihi kerugian akibat varians. Model kecil cepat jenuh dan tidak lagi membaik meski populasi ditambah.

Data apa yang dipakai untuk eksperimennya?

Penulis melatih transformer bergaya GPT pada dataset FineWeb dengan tokenizer BPE 4096 token, batch 16 ribu token, dan SGD dengan momentum. Setiap metode memakai protokol sama dengan tiga seed per sel percobaan.

Kesimpulan

Dust menarik karena menyerang asumsi yang jarang dipertanyakan: bahwa pelatihan transformer harus melewati backward pass. Dengan mengganggu aktivasi alih-alih bobot, ia mengubah setiap token menjadi anggota populasi, dan hasilnya kompetitif dengan backprop pada anggaran token kecil serta stabil hingga 1 miliar token. Temuan bahwa model besar justru lebih efisien secara populasi menambah bobot argumen bahwa metode berbasis pencarian layak dieksplorasi lebih jauh.

Untuk peneliti dan praktisi, kontribusi Dust yang paling berharga mungkin bukan angkanya, melainkan pertanyaan yang dibukanya. Jika kredit asesmen bisa muncul dari populasi besar tanpa aturan rantai, maka asumsi yang selama ini membatasi desain arsitektur layak ditinjau ulang. Namun penerapan praktisnya menuntut komputasi yang jauh lebih besar, sehingga relevansinya saat ini lebih besar bagi laboratorium riset daripada bagi tim produksi. Bagi pembaca yang ingin mendalami, langkah paling berguna adalah mereplikasi eksperimen kecil pada anggaran token terbatas, karena detail implementasi seperti cara mengurangi interferensi antar-perturbasi justru menentukan hasilnya.

Rujukan utama artikel ini adalah makalah Dust, makalah EGGROLL, makalah MeZO tentang fine-tuning dengan forward pass, serta dataset FineWeb. Semua angka yang dikutip berasal dari hasil yang dilaporkan penulis dan belum direplikasi independen dalam artikel ini.

Sumber dan referensi

💬 Komentar (0)

Belum ada komentar. Jadilah yang pertama! 💬

Komentar akan muncul setelah moderasi.