Microsoft Rilis Transkripsi Streaming, Lengkapi Pipa Agen Suara
MAI-Transcribe-2-Streaming menempati peringkat pertama akurasi di Artificial Analysis dengan 60 bahasa dan latensi sekitar 100 milidetik, melengkapi dua model suara baru MAI-Voice-2.1.

Microsoft AI meluncurkan tiga model suara pada 1 Oktober 2026: MAI-Transcribe-2-Streaming, model speech-to-text real-time pertamanya, bersama dua model text-to-speech MAI-Voice-2.1 dan MAI-Voice-2.1-Flash. Ketiganya tersedia melalui Microsoft Foundry dan Azure AI Speech, serta diumumkan bersamaan oleh kemitraan Vercel AI Gateway. Seperti lazimnya rilis Azure AI, ketiganya berstatus pratinjau publik tanpa perjanjian tingkat layanan untuk beban produksi.
MAI-Transcribe-2-Streaming adalah saudara real-time dari model batch MAI-Transcribe-2 yang rilis September lalu. Model ini mentranskripsikan 60 bahasa dengan deteksi bahasa otomatis yang berjalan terus-menerus, tanpa perlu diberi tahu bahasa apa yang akan datang. Hipotesis pertama — disebut partial — muncul sedikit di atas 100 milidetik setelah audio mengalir, lalu direvisi seiring konteks bertambah hingga menjadi transkrip final yang stabil. Pengujian internal Microsoft menyebut kata-kata muncul dua kali lebih cepat dibanding pesaing terdekatnya.
Di papan peringkat Artificial Analysis, model ini menempati posisi pertama dari 38 model streaming untuk akurasi: tingkat kesalahan kata 2,5 persen pada transkrip final, siap 0,13 detik setelah pembicara berhenti. Pesaing terdekatnya adalah Grok Voice Transcribe 2.0 (2,7 persen, 0,49 detik) dan Muse Voice Transcribe (3,1 persen, 0,16 detik). Microsoft memasang harga perkenalan US$0,54 per jam audio hingga akhir 2026. Dua model suara pendampingnya: MAI-Voice-2.1 yang berbicara 23 bahasa dengan satu identitas suara yang konsisten lintas bahasa seharga US$22 per juta karakter, serta varian Flash yang mulai bersuara dalam 150 milidetik dengan harga US$15 per juta karakter. Keduanya mendukung kloning suara dengan pemeriksaan persetujuan bawaan.
Yang membuat rilis ini menarik adalah matematikanya. Tambahkan 130 milidetik agar mesin mendengar ucapan, sekitar 350 milidetik agar AI merumuskan balasan, dan 150 milidetik agar ia mulai berbicara — maka agen suara yang dibangun sepenuhnya di atas tumpukan first-party Microsoft dapat menyelesaikan satu putaran percakapan jauh di bawah satu detik. Itulah ambang di mana suara AI berhenti terdengar seperti walkie-talkie dan mulai terdengar seperti panggilan telepon.
Analisis X AWD:
Perlombaan model suara kini bergeser dari sekadar akurasi ke latensi putaran penuh. Angka 100 milidetik Microsoft penting bukan karena rekornya, melainkan karena ia mengubah apa yang bisa dilakukan agen: ketika model mulai bernalar di tengah kalimat penelepon, arsitektur agen berubah dari "dengar-dulu-baru-berpikir" menjadi "berpikir-sambil-mendengar" — dan itu membuka interupsi alami, klarifikasi proaktif, serta percakapan yang terasa hidup. Bagi pembaca di Indonesia, relevansinya konkret: 60 bahasa dengan deteksi otomatis berarti satu nomor layanan pelanggan bisa melayani belasan bahasa daerah tanpa operator memilih bahasa dulu.
Namun dua catatan perlu dipegang. Pertama, klaim peringkat pertama datang dari tolok ukur yang dikutip Microsoft sendiri dan belum direproduksi independen. Kedua, harga US$9 per 1.000 menit menempatkannya di antara model termahal di papan peringkat — 28 dari 38 model lebih murah. Microsoft bertaruh bahwa akurasi plus latensi membenarkan premi. Hipotesis kami: dalam 12 bulan, pasar akan terbelah — model murah-menang untuk transkripsi massal (rapat, subtitle), model mahal-menang untuk agen suara yang berhadapan dengan pelanggan, di mana satu detik jeda berarti panggilan yang ditutup.
Sumber: MarkTechPost — baca artikel asli