← Semua berita
LLMjurnal

Harga Berpikir Bagian 2: Siapa Sebenarnya Membayar Token Penalaran

Bagian 2 seri Harga Berpikir: memetakan siapa menanggung biaya token penalaran AI — dari strategi harga lab hingga anggaran agen otonom — dan mengapa metrik harga akan bergeser ke biaya per tugas.

Harga Berpikir Bagian 2: Siapa Sebenarnya Membayar Token Penalaran

Ini adalah Bagian 2 dari seri "Harga Berpikir: Ekonomi Komputasi Penalaran AI". Bagian 1 (news-20261006-0814, slug jurnal-harga-berpikir-token-penalaran-bagian-1) memperkenalkan gagasan bahwa token penalaran — token yang dibakar model untuk "berpikir" sebelum menjawab — telah menjadi biaya baru yang terpisah dari harga token keluaran biasa. Bagian ini menjawab pertanyaan lanjutannya: siapa sebenarnya yang membayar tagihan itu, dan bagaimana mereka mengakalinya?

Peta pembayarnya berlapis tiga. Lapisan pertama adalah laboratorium: mereka menanggung biaya pelatihan model penalaran yang jauh lebih mahal karena reinforcement learning atas rantai berpikir yang panjang. Lapisan kedua adalah penyedia API dan platform: mereka membeli komputasi inferensi, lalu menjualnya kembali per token. Lapisan ketiga adalah pengguna akhir — dan di sinilah kejutan muncul: pengguna tidak pernah benar-benar tahu berapa banyak token penalaran yang dibakar untuk satu jawabannya. Tagihannya tiba sebagai angka agregat, seperti tagihan listrik tanpa meteran per ruangan.

Strategi laboratorium untuk menekan biaya ini sudah terlihat jelas pada Oktober 2026. OpenAI memposisikan GPT-6.1 Sol dengan harga sekitar seperlima Astra per token, sambil mengklaim skor coding yang mendekati — arbitrase harga di dalam rumah sendiri. Anthropic mengambil jalur berbeda dengan Claude Sonnet 5.5: bukan menurunkan harga token, melainkan mengurangi jumlah langkah yang dibutuhkan. Model yang menyelesaikan tugas dalam langkah lebih sedikit dan mengelompokkan pemanggilan tool dengan efektif akan lebih murah total, meski tarif per tokennya sama. Ada detail menarik dari catatan evaluasi: memutar "usaha" hingga maksimum justru kadang memperburuk hasil — agen peninjau kehabisan waktu atau mengubah hal di luar permintaan. Efisiensi, ternyata, bukan sekadar soal kecepatan.

Di sisi konsumen, ilusi terbesar adalah menyamakan harga token dengan harga tugas. Model murah yang butuh tiga kali percobaan, plus satu jam perbaikan manusia, bisa jauh lebih mahal daripada model mahal yang selesai sekali jalan. Inilah alasan metrik "biaya per tugas terselesaikan" mulai menggantikan "dolar per juta token" dalam percakapan para pembeli enterprise. Token hanyalah bahan bakar; yang dibeli adalah hasil.

Lalu datanglah agen AI — konsumen token penalaran yang paling rakus. Satu tugas agen otonom dapat membakar ribuan token penalaran dalam loop rencana-aksi-observasi, dan tidak ada pengguna yang mengawasinya per langkah. Di sinilah anggaran agen menjadi disiplin baru: batas belanja komputasi per tugas, sama seperti batas belanja iklan per kampanye. Kegagalan menganggarkan berarti agen yang "berpikir" tanpa henti atas tagihan Anda.

Penyedia infrastruktur merespons dengan arbitrase mereka sendiri: memindahkan beban penalaran ke model yang lebih murah untuk sub-tugas sederhana, mengelompokkan permintaan, dan menyimpan cache rantai penalaran yang sering muncul. Ini adalah ekonomi klasik — persis seperti maskapai yang mengisi kursi kosong — hanya saja komoditasnya adalah langkah berpikir mesin.

Ada lapisan yang lebih dalam, yang menghubungkan seri ini dengan seri "Silicon Finance" kami: di ujung rantai, seseorang membayar listrik dan depresiasi GPU. Utang ratusan miliar dolar yang membiayai pusat data AI harus dilunasi dari margin inferensi. Jika harga per token terus ditekan oleh persaingan sementara biaya modal tetap tinggi, margin akan terjepit — dan yang terjepit duluan adalah pemain tanpa skala.

Hipotesis redaksi untuk penutup seri ini: dalam dua tahun, tidak ada lagi perusahaan serius yang membeli AI berdasarkan harga per token. Kontrak akan ditulis dalam dolar per tugas terselesaikan, dengan SLA keandalan sebagai pasangannya. Pemenangnya bukan model termurah per token, melainkan sistem yang biayanya paling bisa diprediksi. "Harga berpikir" pada akhirnya bukan soal berapa mahal mesin berpikir — melainkan soal siapa yang berani menjamin tagihannya.

Sumber: Redaksi X AWD