Skor benchmark kecerdasan buatan melonjak cepat, tetapi lonjakan itu bukan bukti otomatis bahwa AI sudah bekerja andal di kantor, sekolah, rumah sakit, atau layanan publik. Di sinilah hype AI tumbuh: satu hasil tes yang sempit berubah menjadi cerita tentang “kecerdasan umum”, penggantian pekerjaan, atau ancaman yang seolah sudah berada di depan pintu.
Dalam sebuah opini di MIT Technology Review, Timnit Gebru dan Emily M. Bender mengingatkan bahwa klaim perusahaan tentang peretasan, matematika, dan “superintelligence” perlu diperiksa setelah pakar bidang terkait menilai bukti. Kritik itu berguna sebagai alarm, tetapi tidak cukup dijadikan kesimpulan. Cara yang lebih kuat adalah membandingkan skor model, hasil penggunaan nyata, dan risiko yang benar-benar dapat diukur.
Fakta: kemampuan AI memang maju, tetapi tidak merata
Menyebut seluruh kemajuan AI sebagai ilusi juga keliru. AI Index 2025 dari Stanford HAI mencatat kenaikan dalam satu tahun sebesar 18,8 poin persentase pada MMMU, 48,9 poin pada GPQA, dan 67,3 poin pada SWE-bench. Biaya inferensi untuk sistem dengan tingkat kinerja setara GPT-3.5 juga turun lebih dari 280 kali antara November 2022 dan Oktober 2024.
Namun laporan yang sama menyebut penalaran kompleks masih menjadi masalah. Model dapat tampil kuat pada jenis soal tertentu, tetapi belum konsisten pada tugas logika dan perencanaan yang menuntut ketepatan. Jadi, dua hal bisa benar sekaligus: kemampuan dan efisiensi meningkat pesat, sementara keandalan untuk konteks tertentu tetap terbatas.
Data: benchmark mengukur model, deployment mengukur sistem
Benchmark biasanya memberi model kumpulan soal, format instruksi, dan aturan penilaian yang relatif terkendali. Deployment memasukkan variabel yang tidak hadir di papan skor: kualitas data organisasi, bahasa pengguna, integrasi perangkat lunak, biaya, latensi, pengawasan manusia, serta konsekuensi ketika jawaban salah.
Investigasi independen The Markup menemukan sejumlah benchmark populer berusia lama, menggunakan soal pilihan ganda, atau bersumber dari konten internet seperti WikiHow, Reddit, dan situs trivia. Masalahnya bukan bahwa seluruh benchmark tidak berguna. Skor tetap bermanfaat untuk perbandingan terkontrol, tetapi tidak membuktikan bahwa model memahami bidang, aman menggantikan ahli, atau tahan terhadap ragam pertanyaan pengguna.
Eksperimen lapangan memperlihatkan jurang itu. Dalam uji acak METR pada 2025, 16 pengembang berpengalaman menyelesaikan 246 tugas pada proyek sumber terbuka yang sudah mereka kenal. Mereka memperkirakan AI akan menghemat waktu, tetapi penggunaan alat AI justru berkaitan dengan waktu pengerjaan 19% lebih lama dalam konteks tersebut.
Angka itu bukan vonis universal. METR sendiri kemudian menyatakan hasil lama tersebut tidak lagi mewakili alat terbaru. Pembaruan eksperimennya pada 2026 memberi sinyal kemungkinan percepatan, tetapi peneliti menilai estimasinya tidak andal karena bias seleksi, perubahan bayaran peserta, dan kesulitan mengukur kerja dengan beberapa agen sekaligus. Pelajarannya justru penting: hasil AI bergantung pada model, tugas, pengguna, dan desain pengukuran—bukan pada satu angka abadi.
Konteks: risiko nyata berbeda dari cerita kiamat
Ketakutan futuristis sering menyedot perhatian karena dramatis, sedangkan kerugian hari ini lebih mudah diuji. NIST AI 600-1 mendefinisikan risiko sebagai gabungan peluang kejadian dan besarnya konsekuensi. Dokumen itu memetakan risiko generatif seperti keluaran keliru yang disampaikan dengan percaya diri, privasi, bias berbahaya, keamanan informasi, dan dampak lingkungan. NIST juga meminta kinerja diuji dalam kondisi yang mirip dengan lingkungan deployment serta dipantau setelah sistem digunakan.
Pendekatan tersebut lebih operasional daripada debat abstrak tentang mesin yang suatu hari mungkin mengambil alih dunia. Untuk chatbot layanan kesehatan, misalnya, metrik yang relevan bukan hanya nilai ujian medis, melainkan tingkat jawaban salah, kelompok pengguna yang paling sering dirugikan, mekanisme eskalasi ke manusia, dan dampak kesalahan. Risiko sosial menjadi terukur ketika ada probabilitas, tingkat keparahan, populasi terdampak, dan jalur pertanggungjawaban.
Bagi Indonesia, kebutuhan itu mendesak. asesmen kesiapan AI UNESCO untuk Indonesia, yang melibatkan lebih dari 500 peserta di lima wilayah, menyoroti masih rendahnya kesadaran bahwa AI dapat memperkuat bias dan diskriminasi. Optimisme tinggi bukan alasan untuk panik atau percaya penuh; itu alasan untuk meminta bukti yang relevan dengan bahasa, kelompok sosial, dan infrastruktur Indonesia.
Analisis: pola hype muncul saat klaim melompati tiga jembatan
Pertama, skor tugas tertentu diperlakukan sebagai kecerdasan umum. Kedua, kemampuan model diperlakukan sebagai hasil sistem di dunia nyata. Ketiga, kemungkinan teknis diperlakukan sebagai dampak sosial yang pasti. Setiap lompatan menghapus variabel penting: distribusi kasus, manusia yang mengoperasikan alat, insentif perusahaan, dan biaya kesalahan.
Karena itu, “AI hebat” dan “AI berbahaya” sama-sama merupakan klaim yang terlalu longgar. Pertanyaan yang dapat diuji adalah: AI mana, versi kapan, untuk tugas apa, dibandingkan dengan siapa, memakai data apa, pada biaya berapa, dan salah dalam kondisi apa? Jawaban yang tidak menyebut batasan itu lebih dekat ke pemasaran atau spekulasi daripada evaluasi.
Insight: checklist membaca klaim AI
- Cari objek uji: apakah yang dinilai model dasar, aplikasi lengkap, atau manusia yang dibantu AI?
- Periksa pembanding: “mengalahkan manusia” harus menyebut manusia mana, jumlah peserta, keahlian, waktu, dan aturan penilaian.
- Bedakan benchmark dan deployment: minta hasil pada data lokal, bahasa Indonesia, beban nyata, serta kasus gagal—bukan hanya skor rata-rata.
- Ukur risiko saat ini: catat tingkat kesalahan, dampak, kelompok terdampak, biaya koreksi, privasi, konsumsi sumber daya, dan siapa yang bertanggung jawab.
- Cek insentif dan replikasi: bedakan klaim vendor, paper, model card, serta evaluasi independen; waspadai demo pilihan yang belum direplikasi.
- Tuntut tanggal dan versi: kemampuan model berubah cepat, sehingga hasil lama tidak boleh dipakai tanpa konteks.
Kesimpulannya bukan “AI cuma hype”. Bukti menunjukkan kemajuan nyata sekaligus batas nyata. Sikap yang waras adalah menolak dua jalan pintas: mengubah benchmark menjadi janji deployment dan mengubah skenario spekulatif menjadi kepastian bencana. Untuk pembaca, perusahaan, dan pembuat kebijakan Indonesia, ukuran terbaik bukan seberapa dramatis klaimnya, melainkan seberapa jelas metode, konteks, kegagalan, serta dampaknya dapat diperiksa.

