Definisi
Ini terjadi ketika model AI mencapai skor pada atau mendekati maksimum yang mungkin pada tes yang dirancang untuk mengukur kemampuan berisiko, berarti tes tidak lagi dapat memberi tahu kami seberapa jauh kemampuan itu sebenarnya telah maju. Untuk area sensitif seperti pengetahuan biologi dual-use, benchmark yang jenuh membuat evaluator tidak mampu mengkonfirmasi apakah model yang lebih baru menjadi lebih berbahaya atau hanya sekemampuan sebelumnya.
Mengapa penting
Regulator dan tim keselamatan mengandalkan benchmark ini sebagai sistem peringatan dini; setelah jenuh, sistem peringatan itu secara efektif menjadi gelap, jadi pengambil keputusan perlu tahu ketika metrik risiko mereka berhenti memberikan informasi.