Lewati ke konten utama
SlashJournalSlashJournal
Beranda
SeriGlosariumTentangKontak
SlashJournalSlashJournal

Catatan produksi tentang sistem terdistribusi, rekayasa antarmuka, dan keputusan teknis yang layak dipahami.

Baca

TulisanSeriGlosariumTentang

Dukungan & legal

KontakDaftar menjadi penulisPrivasiKetentuanCookie
© 2026 SlashJournalRSS feed
Beranda/Kecerdasan Buatan & Produktivitas/Inovasi Tools Developer/Gemini 3.5 Transcribe Rilis: AI Penyelamat Buat Lu yang Suka Ngomong Belibet!
Kecerdasan Buatan & ProduktivitasSeri: Inovasi Tools Developer · Bagian 32

Gemini 3.5 Transcribe Rilis: AI Penyelamat Buat Lu yang Suka Ngomong Belibet!

Google baru aja ngerilis keluarga Gemini 3.5 Audio (Live Translate & Transcribe). Nggak cuma jago ngetik omongan lu, AI ini sekarang bisa otomatis ngefilter kata-kata "um", "ah", sampai ralat dadakan pas lu lagi ngomong belibet. Goodbye ketikan berantakan!

C

Choirul Humam

Penulis & Arsitek

27 Agustus 20264 mnt baca6 pembaca
Gemini 3.5 Transcribe Rilis: AI Penyelamat Buat Lu yang Suka Ngomong Belibet!

Sumber visual: Stok Lisensi Bebas Royalty

Kita semua tahu penderitaannya. Lagi meeting atau dapet ide dadakan, lu nyalain fitur Voice Typing (Dikte) di HP, terus ngomong, "Eh, tambahin tombol itu dong, warna merah... eh bukan deng, warna biru aja, umm.. taruh di kanan atas."

Hasil ketikannya? Beneran persis sama persis kayak orang mabuk. Hancur lebur.

Tapi tenang, Agustus 2026 ini Google DeepMind akhirnya ngerilis solusi dari penderitaan itu lewat lini model Gemini 3.5 Audio. Dari sekian banyak turunan model ini, ada satu varian yang paling bikin developer dan end-user kegirangan: Gemini 3.5 Transcribe.

Tukang Sapu Kata "Umm" dan "Eh"

Gemini 3.5 Transcribe (dan varian Live-nya) dirancang dengan satu pemahaman dasar: manusia itu kalau ngomong berantakan banget.

Ketimbang menuntut kita untuk bicara kaku kayak news anchor, AI ini yang bakal menyesuaikan diri. Model ini punya kemampuan "Self-Correction" tingkat dewa secara real-time.

Fitur AjaibKalau Pake Dikte JadulKalau Pake Gemini 3.5 Transcribe
Filter Kata Pengisi (Filler)Ketikannya penuh kata "Umm", "Ehh", "Ah".Bersih total, kata filler langsung di-drop.
Ralat Dadakan (Self-Correction)"Meeting hari Selasa, eh Rabu deng."Langsung ngetik: "Meeting hari Rabu."
Identifikasi Pembicara (Diarization)Suara 3 orang nyampur jadi 1 paragraf raksasa.Otomatis dipecah jadi Pembicara A, B, dan C plus timestamp.

Berdasarkan Model Card resminya, tingkat kesalahannya (Word Error Rate / WER) beneran sinting: cuma 4% untuk streaming real-time dan 2.6% buat audio rekaman. Padahal dia ngedukung aksen lokal, bahasa gaul, sampai istilah teknis kodingan!

Gemini 3.5 Transcribe Rilis: AI Penyelamat Buat Lu yang Suka Ngomong Belibet!
contoh ilustrasi nyata penggunaan google transcribe

Bedah Visual: Mitigasi Risiko & Keamanan (Analisis Gambar)

Berdasarkan dokumen internal Google yang gue telusuri dari gambar rilis mereka, Google DeepMind ternyata lumayan parno sama penyalahgunaan AI berbasis audio ini. Dari dua gambar tabel mitigasi risiko tersebut, ada beberapa hal menarik yang wajib kita highlight:

  1. Gambar 1 (Safety Policies): Google menerapkan filter super ketat untuk ujaran kebencian (Hate Speech), pelecehan seksual, manipulasi pemilu, hingga saran medis ngawur. Kalau lu nyoba mendiktekan hal-hal yang melanggar policy ini, sistem bakal ngeblokir output-nya di level API.
Grafik menunjukkan perbandingan tingkat error sistem speech recognition non-streaming pada berbagai bahasa. Gemini 3.5 Transcribe mencatat tingkat error terendah sebesar 5,04%, diikuti Google Cloud Chirp 3 sebesar 5,66%.
Perbandingan akurasi speech recognition non-streaming dari Gemini, Google Cloud Chirp 3, ElevenLabs, OpenAI, dan Deepgram berdasarkan tingkat error FLEURS.
  1. Gambar 2 (Risk Mitigations): Ada perhatian khusus untuk ancaman PII (Personally Identifiable Information). Gemini 3.5 Transcribe diklaim sudah di-training khusus agar tidak gampang membocorkan atau menyimpan data sensitif seperti password atau NIK yang mungkin nggak sengaja terekam di latar belakang audio lu. Mereka nyebutnya "Frontier Safety Framework".
Grafik membandingkan performa speech recognition streaming berdasarkan tingkat error FLEURS. Gemini 3.5 Transcribe Live menunjukkan tingkat error terendah sebesar 5,50%, sementara Google Cloud Chirp 3 mencapai 7,32%.
Perbandingan tingkat error speech recognition streaming dari Gemini, Google Cloud Chirp 3, ElevenLabs, OpenAI, dan Deepgram pada berbagai bahasa.

💻 API & Implementasi: Nggak Cuma di HP

Bagi pengguna biasa, kalian udah bisa nyicip AI ini lewat fitur Rambler di keyboard Android (Gboard) dan aplikasi Gemini di macOS. Tapi buat kaum developer, pintu sandbox udah dibuka lebar-lebar.

Varian Live Translate (bisa input 128K token) dan Transcribe (96K token) sudah nangkring manis di Google AI Studio, Vertex AI, dan Antigravity (agentic coding platform).

Buat startup yang mau bikin asisten customer service suara, tech stack-nya bakal semulus ini:

1
2
3
4
1. User ngomong -> Lempar ke API Speech-to-Text (STT) eksternal.
2. Hasil STT (yang berantakan) -> Lempar ke LLM buat dibersihin / dijawab.
3. Jawaban LLM -> Lempar lagi ke API Text-to-Speech (TTS).
// Latensi bengkak, delay panjang, user keburu kabur.
ERA LAMA • 4 barisGunakan Shift+Scroll untuk scroll horizontal
Peringatan Sistem

Kelemahan Bawaan: Sekeren-kerennya model ini, Google ngaku kalau fitur Live Translate-nya masih bisa "tersandung" kalau ada suara background noise yang bocor kencang, atau kalau pembicaranya gonta-ganti bahasa terlalu cepat. Oh ya, knowledge cutoff model ini berhenti di Januari 2025, jadi jangan suruh dia merangkum berita bulan lalu!

Ke depannya, model ini bakal masuk ke ekosistem Chrome, Google Docs, dan Gmail. Siap-siap aja ngelihat temen kantor lu yang biasanya males ngetik panjang, sekarang kerjaannya cuma ngedumel di depan laptopnya karena AI-nya yang bakal ngetikin semuanya dengan rapi.

Lu sendiri, tim yang suka ngetik pake jari atau tim yang lebih milih ngomong ke Voice Typing?

Kata Kunci:#gemini api#gemini 3.5 audio#gemini 3.5 transcribe#speech to text ai#google rambler#gboard dictation#ai filter suara

Sumber

  1. [1]Google

Apresiasi & Reaksi Pembaca

Klik untuk memberikan apresiasi
Bab SebelumnyaKabar Gembira! Fitur Auto-Jadwal ChatGPT Kini Gratis (Plus Trik Webhook buat Akun Pro)

Catatan Mingguan

Bawa naskah baru ke inbox Anda.

Satu email berkala saat naskah baru terbit. Tanpa spam, tanpa promosi kosong.

Fokus minat:

Diskusi & Catatan Teknis (0)

Login diperlukan
Masuk untuk mengirim catatan arsitektur
Markdown format didukung

Daftar Isi

Tukang Sapu Kata "Umm" dan "Eh"Bedah Visual: Mitigasi Risiko & Keamanan (Analisis Gambar)💻 API & Implementasi: Nggak Cuma di HP
C

Choirul Humam

Penulis & Arsitek

Menulis panduan arsitektur perangkat lunak dengan fokus pada keandalan sistem dan kesederhanaan desain.

Profil Lengkap →
Ruang iklan manual SlashJournal
Pasang Iklan Terkurasi

Indeks bacaan

Eksplorasi berikutnya

Lanjutkan dari konteks tulisan ini, pembahasan terbaru, atau naskah yang paling banyak dibaca.

Rekomendasi

  1. Kecerdasan Buatan & ProduktivitasKabar Gembira! Fitur Auto-Jadwal ChatGPT Kini Gratis (Plus Trik Webhook buat Akun Pro)26 Agustus 2026
  2. Kecerdasan Buatan & PemrogramanClaude Gak Lagi Pikun: Update Memori Lintas Platform Bikin AI Makin "Manusia"26 Agustus 2026
  3. Hardware & AI InfrastructurePerplexity Rilis "Portable Computer": Agen AI Lokal Anti-Ngelag, Bebas Tagihan Token API!26 Agustus 2026

Sedang trending

  1. Kecerdasan Buatan & KeamananMembongkar Rahasia Watermark Claude: Bagaimana Anthropic Menyisipkan Jejak Gaib di Teks AI?499 pembaca
  2. Keamanan Siber & Industri GamePetaka Data Rockstar: Hacker Bobol GTA VI Demi Protes "Kiamat Kaset Fisik"149 pembaca
  3. Hardware & AI InfrastructureApple Menggila! Mac Studio M5 Ultra Tembus 512GB RAM, Solusi "Ternak" LLM Lokal70 pembaca

Terpopuler

  1. 01Strategi Bisnis & AISejarah Baru: Model AI Terkuat Anthropic (Fable 5) Mulai Ditinggalkan Perusahaan. Kenapa?66 pembaca
  2. 02Strategi Bisnis & AIElon Musk Ngaku Kalah dari Anthropic, Langsung "Bakar" $60 Miliar Buat Beli Cursor!46 pembaca
  3. 03Kecerdasan Buatan & PemrogramanOx Alpha Terungkap: Model "Siluman" Zhipu yang Babat 42 Triliun Token dalam 6 Hari di Opencode!26 pembaca
#
ai voice agent