Google memperkenalkan dua model text-to-speech baru ke dalam keluarga Gemini pada 23 September 2026: Gemini 3.8 Flash TTS dan Gemini 3.8 Flash-Lite TTS. Pengumuman resmi di blog Google menyebut keduanya sebagai model generasi audio paling ekspresif yang mereka rilis sejauh ini. Perubahan yang paling penting bukan pada kualitas suaranya, melainkan pada pergeseran cara kerja: dari sekadar memilih preset suara yang tersedia menjadi menyusun suara sendiri lewat deskripsi bahasa natural.
Bagi pengembang yang membangun produk berbasis audio, pergeseran ini mengubah beberapa hal sekaligus. Suara berhenti menjadi daftar pilihan terbatas dan menjadi parameter yang bisa diarahkan, dari aksen sampai gaya penyampaian per baris dialog.
Dua model, dua tujuan yang berbeda
Google memisahkan dua model ini berdasarkan pola pemakaian, bukan sekadar ukuran.
- Gemini 3.8 Flash TTS ditujukan untuk pengarahan kreatif dan desain karakter. Model ini dipakai untuk membuat suara yang benar-benar baru dari nol memakai prompt bahasa natural, untuk kebutuhan game, audiobook imersif, podcast, dan media interaktif. Setiap penampilan bisa diarahkan baris per baris, termasuk tempo, pergeseran dialek, dan respons pendek yang menyela pembicaraan.
- Gemini 3.8 Flash-Lite TTS ditujukan untuk volume tinggi dengan biaya efisien. Fokusnya pada sulih suara berskala besar, produksi konten audio, dan agen suara ekspresif yang butuh kendali atas nada, tempo, dan nuansa ekspresi.
Pembagian ini mengikuti pola yang sudah lazim di keluarga model besar: satu varian untuk kualitas dan kendali maksimal, satu varian untuk biaya per satuan yang lebih murah pada beban kerja besar. Kalau produk Anda menjalankan agen suara yang melayani ribuan percakapan per hari, pilihan yang masuk akal adalah varian Lite. Kalau yang dibangun adalah konten berdurasi panjang yang kualitasnya jadi pembeda, varian penuh lebih relevan.
Membuat suara dari nol lewat prompt
Kemampuan yang paling menandai kedua model ini adalah desain suara generatif. Menurut pengumuman Google, kapasitas suara asli yang tadinya berjumlah 30 kini berkembang menjadi perpustakaan yang tidak terbatas. Pengembang bisa membuat suara karakter yang sepenuhnya orisinal, atau suara duta merek yang konsisten, dengan mengustomisasi peran, aksen, dan karakteristik suara memakai prompt bahasa natural.
Cakupan bahasanya disebut mencakup lebih dari 100 bahasa dan dialek. Contoh yang dipakai Google cukup menggambarkan rentangnya: suara naga yang dramatis, narator karismatik dengan irama daerah tertentu, sampai suara robot monoton yang sengaja dibuat tipis. Semua itu dihasilkan dari deskripsi, bukan dari pemilihan preset yang sudah disiapkan.
Untuk tim produk, implikasi praktisnya jelas. Kalau sebelumnya identitas suara sebuah aplikasi dibatasi oleh apa yang tersedia di perpustakaan vendor, sekarang suara itu bisa dijadikan bagian dari desain produk sejak awal, sama seperti palet warna atau tipografi.
Perpustakaan suara dan replikasi yang diawasi
Selain membuat suara baru, tersedia juga perpustakaan suara siap pakai berisi lebih dari 2.000 suara dengan cakupan bahasa yang luas, termasuk variasi regional seperti Spanyol Meksiko, Prancis Quebec, dan Inggris Skotlandia.
Yang menarik dari sisi tata kelola adalah fitur replikasi suara. Model dapat membuat profil vokal yang konsisten hanya dari sampel audio berdurasi 30 detik, baik suara pengguna sendiri maupun suara yang memang haknya dimiliki. Google menyatakan fitur ini dilindungi verifikasi persetujuan yang dibangun di dalamnya, penandaan air SynthID, dan kredensial C2PA. Tujuannya melindungi pengembang sekaligus talenta vokal yang suaranya direplikasi.
Ada juga kemampuan menyimpan dan mengelola suara kustom yang sudah dibuat agar performanya tetap konsisten dengan penyimpangan minimal antar proyek. Untuk pengembangan berikutnya, Google menyiapkan fitur remix suara yang memungkinkan pemilihan suara dari perpustakaan lalu penyesuaian timbre, nada, tempo, dan aksen lewat prompt, misalnya menambahkan aksen tertentu atau melembutkan penyampaian.
Mengarahkan penampilan baris per baris
Setelah suara dipilih atau dibuat, kedua model memberi kendali atas cara setiap baris disampaikan. Pengembang bisa menulis arahan panggung sendiri, atau membiarkan Gemini mengarahkan penyampaian berdasarkan isyarat naskah, dari agen layanan pelanggan yang tenang sampai adegan ketegangan yang dibisikkan.
Untuk konten berdurasi panjang, Google menyatakan kualitas suara, tempo, dan timbre karakter tetap terjaga hingga berjam-jam audio berkelanjutan dengan penyimpangan pembicara yang minimal. Ini poin yang penting untuk audiobook dan podcast, karena masalah yang paling sering muncul pada generasi audio panjang justru bukan suara di awal, melainkan perubahan karakter suara setelah puluhan menit.
Ada juga kemampuan menyusun adegan dua pembicara secara native. Percakapan multi-giliran bisa diarahkan dari satu naskah, dengan kedua suara tetap terpisah jelas dan pergantian bicara yang terdengar alami. Selain itu, model mendukung isyarat vokal dan respons pendengar yang tertulis langsung di naskah, seperti <laughs>, <sigh>, dan <gasp> untuk tawa, desahan, dan tarikan napas, plus interjeksi mendengarkan seperti |mhm| atau |yeah| untuk mengatur waktu komedi dan reaksi. Detail kecil seperti ini yang biasanya menentukan apakah hasilnya terdengar seperti rekaman studio atau seperti pembacaan teks.
Di mana model ini bisa dipakai
Menurut pengumuman Google, kedua model tersedia di beberapa permukaan: Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook, dan Google Vids. Model ini melengkapi keluarga Gemini Audio yang sudah lebih dulu ada, termasuk 3.5 Live Translate untuk terjemahan langsung, 3.5 Transcribe, 3.8 Live, dan 3.8 Live Extended Thinking.
Bagi pengembang, ketersediaan di Gemini API adalah bagian yang paling praktis. Artinya kemampuan ini bisa dipanggil dari aplikasi sendiri tanpa perlu membangun pipeline audio terpisah, dan bisa dikombinasikan dengan kemampuan lain di keluarga model yang sama. Untuk yang sudah memakai pendekatan arsitektur reasoning real-time di keluarga Gemini, penambahan lapisan suara ini menutup salah satu celah terakhir antara teks dan interaksi bersuara, seperti yang dibahas pada catatan mengenai arsitektur Gemini Live dan pemrosesan multimodal.
Apa artinya untuk produk berbahasa Indonesia
Klaim cakupan lebih dari 100 bahasa dan dialek adalah hal pertama yang perlu diuji sendiri sebelum diandalkan. Daftar bahasa yang didukung dan kualitas pelafalan untuk bahasa Indonesia, termasuk perbedaan intonasi sehari-hari dan istilah teknis campuran, tidak dirinci dalam pengumuman tersebut. Untuk tim yang membangun produk lokal, langkah paling masuk akal adalah membuat serangkaian sampel uji dengan kalimat yang benar-benar dipakai pengguna, lalu menilai hasilnya sendiri sebelum menjadikannya fitur produksi.
Hal kedua yang belum jelas adalah harga. Pengumuman resmi Google yang jadi sumber artikel ini tidak mencantumkan tarif per karakter atau per detik untuk kedua model, jadi angka biaya belum bisa diperkirakan dari sumber tersebut. Karena pembagian Flash dan Flash-Lite umumnya mencerminkan perbedaan harga, ada baiknya menunggu halaman harga resmi sebelum menghitung kelayakan ekonomi sebuah fitur.
Untuk kebutuhan sulih suara dan konten volume besar, kombinasi yang masuk akal adalah memakai varian Lite untuk produksi massal dan varian penuh hanya untuk segmen yang benar-benar menentukan pengalaman pengguna. Pendekatan campuran semacam ini jauh lebih hemat dibanding memakai satu model untuk semua kebutuhan, dan sejalan dengan kebiasaan memilih model berdasarkan beban kerja seperti pada pembahasan strategi memindahkan sebagian beban inferensi ke lingkungan sendiri.
Risiko yang perlu diantisipasi
Kemampuan mereplikasi suara dari sampel 30 detik adalah fitur yang paling berpotensi disalahgunakan. Google sudah menyiapkan tiga lapis pengaman: verifikasi persetujuan, penandaan air SynthID pada audio yang dihasilkan, dan kredensial C2PA. Ketiganya berguna, tapi tidak satu pun menggantikan kewaspadaan pengembang.
- Pastikan ada bukti persetujuan tertulis sebelum mereplikasi suara siapa pun, termasuk suara yang direkam untuk keperluan internal.
- Simpan catatan tentang suara mana yang dipakai di produk mana, supaya bisa ditelusuri kalau ada keluhan.
- Sampaikan kepada pengguna akhir bahwa audio yang mereka dengar dihasilkan model, bukan rekaman manusia.
- Perhatikan implikasi hukum lokal. Penandaan air SynthID membantu identifikasi, tapi tidak mengubah kewajiban yang berlaku di yurisdiksi Anda.
Cara menguji sebelum dipakai di produksi
Karena pengumuman resmi tidak merinci kualitas per bahasa, pengujian sendiri menjadi bagian wajib dari rencana adopsi. Urutan pengujian yang masuk akal adalah dari yang paling murah ke yang paling mahal.
- Uji pelafalan dasar. Susun sekitar dua puluh kalimat yang memuat singkatan, angka, nama merek, dan istilah teknis campuran bahasa Inggris dan Indonesia. Perhatikan apakah model membaca singkatan sebagai huruf atau sebagai kata.
- Uji kendali arahan. Kirim naskah yang sama dengan arahan berbeda, misalnya tempo lambat dan nada serius, lalu bandingkan hasilnya. Kalau perbedaan arahannya tidak terlihat pada audio, kendali per barisnya belum bisa diandalkan.
- Uji konsistensi panjang. Hasilkan audio berdurasi beberapa puluh menit dengan satu suara, lalu dengarkan bagian awal, tengah, dan akhir. Perubahan timbre di tengah rekaman adalah masalah yang paling sering muncul dan paling mahal diperbaiki setelah produksi.
- Uji adegan dua pembicara. Buat naskah percakapan cepat dengan pergantian bicara dan respons pendek, lalu nilai apakah kedua suara tetap terpisah jelas.
- Uji jalur biaya. Setelah halaman harga resmi tersedia, hitung biaya per menit audio untuk kedua varian dan bandingkan dengan biaya perekaman atau sulih suara yang sekarang dipakai.
Hasil pengujian ini sebaiknya disimpan sebagai berkas sampel yang bisa diputar ulang, bukan hanya berupa catatan. Ketika model diperbarui, sampel yang sama bisa diuji lagi dan perubahannya terlihat langsung. Tanpa itu, perbaikan atau kemunduran kualitas hanya akan terasa setelah pengguna mengeluh.
Kesimpulan
Gemini 3.8 Flash TTS dan Flash-Lite TTS memindahkan generasi suara dari daftar preset ke ruang desain yang bisa diarahkan. Untuk pengembang, nilai terbesarnya bukan pada suara yang lebih bagus, melainkan pada kendali yang lebih halus: suara kustom dari prompt, arahan per baris, adegan dua pembicara, dan konsistensi pada konten panjang.
Yang perlu ditunggu sebelum masuk produksi ada dua: pengujian kualitas untuk bahasa Indonesia dan angka harga resmi. Keduanya belum bisa dijawab dari pengumuman saja, dan keduanya menentukan apakah kemampuan ini layak dijadikan fitur inti atau sekadar pelengkap.
Sumber
- Google, "Gemini 3.8 text-to-speech says hello", 23 September 2026: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/
Catatan: seluruh klaim kemampuan, jumlah suara, dan cakupan bahasa dalam artikel ini bersumber dari pengumuman resmi Google tersebut dan belum diverifikasi lewat pengujian independen. Harga tidak dicantumkan karena tidak tersedia di sumber.
💬 Komentar (0)
Belum ada komentar. Jadilah yang pertama! 💬