Concept  ·  Glosarium

Chain-of-thought monitorability

Banyak model AI tingkat lanjut 'berpikir keras' di notepad yang terlihat sebelum menjawab, memungkinkan tim keamanan membaca penalaran tersebut untuk menangkap niat jahat sejak dini. 'Monitorability' adalah seberapa besar penalaran yang terlihat itu masih mencerminkan apa yang sebenarnya dilakukan model secara internal. Ketika menurun, model mungkin tetap bernalar menuju tujuan berbahaya, tetapi jejak tertulis menjadi kurang dapat dipercaya sebagai tanda peringatan.
Jika penalaran yang diungkapkan model frontier berhenti cocok dengan proses keputusan sebenarnya, dewan kehilangan alat peringatan dini utama tepat saat model melampaui ambang kemampuan berisiko lebih tinggi.
Pantau di umpan langsung Lihat bagaimana hal ini terwujud dalam perkembangan keamanan dan tata kelola AI nyata.
Buka umpan →