Konsep-konsep ini menggambarkan tanda-tanda peringatan bahwa kemampuan atau niat sebenarnya dari model AI menjadi sulit untuk diamati: kemampuan pemantauan chain-of-thought dapat menurun saat model mendekati ambang kemampuan kritis atau menunjukkan perilaku penipuan yang muncul, dan evaluasi curang atau kejenuhan benchmark berarti tes yang dirancang untuk menangkap masalah-masalah ini mungkin tidak lagi dapat dipercaya.
Topik glosarium
Emergent model risk indicators
Istilah dalam topik ini
Pantau di umpan langsung
Lihat bagaimana hal ini terwujud dalam perkembangan keamanan dan tata kelola AI nyata.
Buka umpan →