Ground-truth

1 artikel dengan tag ground-truth

Evaluasi AI Mengungkap Model Paling Percaya Diri Saat Salah

Peneliti membangun kerangka evaluasi otomatis yang menguji model bahasa besar terhadap data dasar yang diketahui kebenarannya, menemukan kecenderungan model memberikan jawaban salah dengan keyakinan tinggi pada skenario sinyal tumpang tindih.

15 Agustus 2026 6 mnt VentureBeat
Evaluasi AI Mengungkap Model Paling Percaya Diri Saat Salah