Google Rilis VeriHarness, Kerangka Verifikasi Output Agen AI
Peneliti Google Cloud AI Research dan Cambridge merilis VeriHarness, kerangka yang mengubah model dasar agen menjadi pemverifikasi agenik, dengan temuan bahwa perbedaan pendapat antar pengerjaan justru mengungkap jawaban benar.

Para peneliti Google Cloud AI Research bersama Universitas Cambridge mempublikasikan kerangka kerja baru bernama VeriHarness, yang mengubah model bahasa dasar milik sebuah agen menjadi pemverifikasi agenik yang mampu memeriksa kebenaran keluaran tugas-tugas berjangka panjang. Makalah berjudul "VeriHarness: Scaling Agentic Verification for Long-Horizon Tasks" diunggah ke arXiv pada 1 Oktober 2026. Alih-alih mengandalkan model yang lebih besar atau kunci jawaban acuan, sistem ini memberi model yang sama alat kerja, perangkat bukti, dan keterampilan verifikasi yang dapat dipakai ulang.
VeriHarness bekerja dengan dua mekanisme yang saling melengkapi. Yang pertama adalah penyelesai perbedaan pendapat (disagreement resolver), yang memeriksa klaim-klaim yang saling bersaing antar beberapa hasil pengerjaan (rollout) terhadap bukti dari lingkungan. Yang kedua adalah penantang konsensus (consensus challenger), yang menguji asumsi-asumsi yang disepakati bersama dan mencari persyaratan yang terlewat. Sebuah tahap ajudikasi kemudian menggabungkan temuan keduanya untuk memilih atau merevisi artefak akhir. Kritisnya, seluruh proses berjalan tanpa akses ke jawaban acuan atau rubrik penilaian saat pengujian.
Temuan empiris utama makalah ini menantang praktik umum di lapangan. Selama ini, ketika beberapa pengerjaan ulang menghasilkan jawaban yang sama, jawaban itu dipercaya. Para penulis menemukan bahwa perbedaan pendapat justru kerap mengungkap alternatif yang benar, sementara konsensus dapat menyembunyikan kesalahan. Diuji pada lima tolok ukur ruang kerja berjangka panjang dan dua model frontier, VeriHarness mencatat skor seleksi tertinggi di antara semua pembanding, dengan peningkatan hingga 8,9 poin atas garis dasar pengerjaan tunggal. Revisi berbasis bukti menambah rata-rata 6,2 poin pada Gemini 3.5 Flash dan 6,4 poin pada Claude Opus 4.8.
Para penulis juga merilis seluruh kumpulan sekitar 26.000 pengerjaan ulang dari seluruh tolok ukur dan kedua model, yang produksinya menelan biaya lebih dari 100.000 dolar AS, untuk mendukung riset verifikasi agenik di masa depan. Mereka menunjukkan bahwa keterampilan verifikasi dapat memperbaiki diri dari umpan balik kegagalan. Karya ini mendapat perhatian komunitas, termasuk amplifikasi dari DAIR.AI, komunitas edukasi dan riset AI terbuka.
Analisis X AWD: VeriHarness menggeser perbincangan keandalan agen dari "model yang lebih pintar" ke "pengawas yang lebih baik". Ini penting karena tugas berjangka panjang, seperti rekayasa perangkat lunak dan riset mendalam, adalah justru medan di mana agen paling berguna sekaligus paling rawan salah diam-diam. Hipotesis redaksi: lapisan verifikasi akan menjadi standar seperti lapisan evaluasi saat ini, terutama di perusahaan yang menuntut jejak audit. Namun ada batas ekonominya: verifikasi agenik mengonsumsi komputasi ekstra untuk banyak pengerjaan ulang dan ajudikasi, sehingga penerapannya akan terkonsentrasi pada tugas berisiko tinggi. Temuan bahwa konsensus bisa menyesatkan juga punya implikasi sosial: dalam pengambilan keputusan manusia, kesepakatan bulat sering dianggap bukti kebenaran, padahal mesin pun menunjukkan sebaliknya.
Sumber: arXiv / The Agent Times — baca artikel asli