Google Rilis Gemini 3.5 Transcribe, Bisa Ubah Suara Jadi Teks Presisi

Gemini 3,5 transcribe telah rilis, Google klaim menjadi AI ubah suara menjadi teks terpresisi yang mereka pernah buat. Benarkah demikian?

Diterbitkan 27 Agustus 2026, 17:00 WIB
Share
Copy Link
Batalkan

Liputan6.com, Jakarta - Google meluncurkan Gemini 3.5 Transcribe, model AI yang dirancang untuk menghasilkan transkripsi suara yang lebih akurat sekaligus memahami konteks percakapan.

Dikutip dari Ars Technica, Kamis (27/8/2026), Gemini 3.5 Transcribe dikembangkan untuk menangani ucapan sehari-hari dan menghasilkan teks lebih rapi. Google menyebutnya sebagai model speech-to-text paling presisi yang mereka buat.

Model ini tidak hanya menyalin perkataan pengguna secara mentah. Gemini 3.5 Transcribe dapat menghapus filler words dan memperbaiki ucapan ketika seseorang mengoreksi perkataannya sendiri di tengah kalimat.

Kemampuan itu membuat hasil transkripsi lebih menyerupai teks yang sudah diedit. Pengguna tidak perlu terlalu banyak mengoreksi hasil rekaman secara manual setelah proses transkripsi selesai.

Gemini 3.5 Transcribe juga bisa digunakan untuk kebutuhan secara langsung maupun memproses rekaman yang sudah ada.

Untuk penggunaan langsung, model AI bekerja dengan mengubah suara menjadi teks kurang dari satu detik. Sementara audio rekaman dapat diproses dengan tambahan informasi seperti siapa yang berbicara dan kapan perkataan tersebut disampaikan.

Google mengatakan, AI tersebut mampu mengenali lebih dari 85 bahasa. Sistem ini juga dirancang untuk menghadapi perbedaan aksen, dialek, serta istilah khusus yang digunakan.

Model ini bahkan dapat mengenali hingga tiga pembicara dalam audio rekaman. Kemampuan itu membuatnya berpotensi digunakan untuk transkripsi rapat, wawancara, maupun percakapan dengan beberapa orang.

Transcribe Hadir Pada Produk Google Lainnya

Google juga menghadirkan kemampuan transkripsi ini ke sejumlah produk mereka. Di Android, Gemini 3.5 Transcribe digunakan dalam fitur Rambler untuk menghasilkan teks dari ucapan dan membantu pengguna melakukan penyuntingan melalui suara.

Pada aplikasi Gemini untuk macOS, pengguna dapat berbicara untuk membuat, mengedit, dan merangkum teks secara langsung di layar yang sedang digunakan. Google juga menyiapkan integrasi ke Chrome agar pengguna dapat mengetik dengan suara pada berbagai kolom di situs web.

Untuk developer, Gemini 3.5 Transcribe tersedia dalam public preview melalui Gemini API, Google AI Studio, dan Google Antigravity. Sementara perusahaan dapat mengaksesnya melalui Gemini Enterprise Agent Platform.

 

Tingkat Kesalahan Cuma 4 Persen

Google juga mengklaim berdasarkan pengukuran Artificial Analysis, model ini memiliki tingkat kesalahan kata rata-rata 4% untuk penggunaan streaming dan 2,6% untuk audio yang tidak terjadi secara langsung.

Dengan kemampuan ini, Google tidak hanya ingin membuat AI yang mampu mendengar.

Gemini 3.5 Transcribe dirancang agar dapat memahami cara manusia berbicara dan mengubahnya menjadi teks yang lebih siap digunakan.