Selama ini, pengembang kecerdasan buatan (AI) selalu mengasumsikan bahwa kesalahan informasi atau halusinasi pada model bahasa besar (LLM) disebabkan oleh kurangnya data pelatihan. Ketika sebuah model memberikan jawaban salah, solusi standar yang diambil biasanya adalah memperbesar ukuran model, menambah volume dataset, atau membangun arsitektur pencarian informasi yang lebih rumit. Namun, penelitian terbaru dari Google Research dan Technion membalikkan asumsi tersebut.
Studi ini mengungkapkan bahwa masalah utama pada model frontier seperti GPT-5 atau Gemini-3 bukanlah ketidakmampuan menyimpan informasi, melainkan kegagalan dalam memanggil kembali data yang sudah ada. Sebanyak 95 hingga 98 persen fakta yang diuji sebenarnya telah tersimpan dalam parameter model. Masalahnya, model tersebut sering kali gagal mengakses informasi yang sudah mereka 'ketahui' saat diminta untuk merespons.
Para peneliti memperkenalkan metode 'profiling fakta' untuk memetakan kesenjangan antara penyimpanan dan pengambilan data. Dengan menguji fakta di berbagai kondisi, mereka menemukan bahwa model sering kali mengalami kondisi serupa dengan fenomena 'tip of the tongue' atau sulit mengingat sesuatu yang sebenarnya sudah ada di kepala manusia. Hal ini membuktikan bahwa penambahan parameter model saja tidak cukup untuk meningkatkan akurasi, karena kapasitas penyimpanan yang besar justru menciptakan tumpukan data yang sulit diakses secara efisien.
Fenomena ini memberikan tantangan baru bagi pengembang AI. Memperbesar model hanya akan menambah jumlah fakta yang tersimpan, namun jika mekanisme aksesnya tidak diperbaiki, model tersebut tetap akan terjebak dalam kegagalan recall. Penelitian menunjukkan bahwa memberikan waktu komputasi lebih lama saat inferensi—misalnya dengan teknik Chain-of-Thought—dapat meningkatkan akurasi hingga 65 persen pada fakta yang sebelumnya gagal diingat.
Bagi ekosistem teknologi di Indonesia, temuan ini sangat krusial. Banyak startup lokal yang sedang mengembangkan aplikasi berbasis LLM kini tidak perlu lagi memaksakan diri membangun atau menyewa model dengan parameter raksasa yang mahal. Fokus pengembangan justru bisa dialihkan pada optimasi cara model berpikir atau memanggil informasi, yang jauh lebih efisien secara biaya komputasi.
Pengguna di Indonesia yang sering berinteraksi dengan chatbot AI mungkin sering merasakan jawaban yang tidak konsisten. Jika pertanyaan diajukan dengan gaya bahasa yang berbeda, AI terkadang memberikan jawaban berbeda pula untuk fakta yang sama. Pemahaman bahwa ini adalah masalah 'recall'—bukan 'knowledge'—memungkinkan pengembang lokal menciptakan aplikasi yang lebih stabil dengan teknik prompt engineering yang tepat.
Kesenjangan antara fakta populer dan fakta langka juga menjadi poin menarik dalam studi ini. Meskipun model mampu menyimpan data langka dengan baik, kemampuan untuk memanggilnya kembali masih jauh di bawah fakta populer. Hal ini menjelaskan mengapa AI sering kali sangat akurat dalam topik umum, namun tampak 'linglung' saat membahas topik yang spesifik atau bersifat lokal.
Strategi ke depan bagi para insinyur AI adalah beralih dari sekadar menambah data, menuju pengembangan mekanisme 'recall facilitation'. Dengan membiarkan model melakukan proses berpikir internal sebelum memberikan jawaban, tingkat kepercayaan pengguna terhadap hasil AI akan meningkat signifikan. Langkah ini diprediksi menjadi standar baru dalam desain aplikasi AI yang lebih andal.
Para peneliti menekankan bahwa kegagalan encoding dan kegagalan recall memerlukan solusi yang sangat berbeda. Jika encoding gagal, intervensi pada pra-pelatihan memang diperlukan. Namun, jika masalahnya adalah recall, maka intervensi pasca-pelatihan seperti optimasi inferensi adalah kunci untuk membuka potensi penuh dari model yang sudah ada.
Ke depannya, tren pengembangan AI akan bergeser dari perlombaan ukuran parameter menuju efisiensi kognitif model. Ini adalah kabar baik bagi keberlanjutan teknologi AI, karena fokus pada kualitas akses data akan menekan kebutuhan daya komputasi yang masif, sekaligus memberikan hasil yang lebih akurat bagi pengguna akhir di seluruh dunia.