Tavus Griffin: Avatar Video AI yang Menipu 48% Lawan Bicaranya
Startup Tavus memperkenalkan Griffin, model video-ke-video full-duplex yang dalam studi internal meyakinkan 26 dari 54 peserta panggilan video bahwa lawan bicara mereka adalah manusia.

Startup Tavus mengumumkan Griffin pada 1 Oktober 2026, model percakapan video real-time yang mereka sebut sebagai Human Interaction Model pertama. Dalam studi internal perusahaan, 26 dari 54 peserta (48 persen) yang melakukan panggilan video satu menit dengan varian Griffin-Lite meyakini lawan bicara mereka adalah manusia sungguhan.
Lompatan ini dramatis: tumpukan teknologi Tavus sebelumnya — Phoenix-4.5, Sparrow-2, dan Raven-1 — hanya menipu 1 dari 41 peserta (2,4 persen). Perbedaannya ada pada arsitektur full-duplex. Avatar lama bekerja seperti walkie-talkie: menunggu pengguna selesai bicara, berhenti memproses, lalu menjawab dalam bentuk monolog. Griffin mendengar dan melihat secara terus-menerus bahkan saat ia sedang berbicara, sehingga bisa mengangguk, menyela kalimat di tengah jalan, atau mengucapkan kata penegas seperti "mm-hm" tanpa kehilangan konteks.
Secara teknis, model ini menghasilkan video 720p dalam potongan 320 milidetik dari satu gambar referensi, mengkloning suara dari sekitar 10 detik audio, dan mencapai jeda audio-ke-video rata-rata 0,43 detik pada GPU NVIDIA H100. Pengujian independen pada benchmark VideoFDB milik NVIDIA memberinya skor 3,83 dari 5 untuk kualitas generasi — tipis di bawah rekaman manusia sungguhan yang mendapat 3,92, dan jauh di atas kombinasi Gemini 2.5 dan Anam yang hanya mencapai 2,80.
Tavus justru menahan diri untuk merilisnya ke publik. Perusahaan membatasi Griffin-Lite untuk kalangan penguji tepercaya sebagai pratinjau riset, dengan alasan avatar serealistis ini dapat dipakai untuk penipuan. Para insinyurnya kini mengerjakan mekanisme yang memaksa sistem memberitahu lawan bicara bahwa ia sedang berbicara dengan jaringan saraf. Harga produk ini belum dipublikasikan.
Analisis X AWD: Angka 48 persen memang berasal dari studi perusahaan dengan durasi panggilan satu menit — bukan ujian independen yang panjang — tetapi arahnya sudah jelas: hambatan teknis terakhir menuju avatar yang tak terbedakan dari manusia telah runtuh. Risikonya kini bukan lagi soal "apakah bisa", melainkan "kapan disalahgunakan". Untuk Indonesia, di mana penipuan lewat panggilan video dan pemalsuan suara sudah marak, Griffin adalah peringatan dini: dalam satu-dua tahun ke depan, "melihat wajahnya saat video call" tidak lagi bisa dijadikan bukti identitas. Solusinya bukan melarang teknologinya, melainkan membangun lapisan verifikasi — fitur pengungkapan wajib yang sedang dikerjakan Tavus adalah langkah minimum, dan regulator perlu mengejar ketertinggalan sebelum teknologi ini mencapai pasar massal.
Sumber: ExplainX — baca artikel asli