Attack  ·  Glosarium

Chain-of-Thought Reasoning Trace Exposure

Serangan yang baru diungkapkan yang memungkinkan orang luar untuk mendekripsi dan membaca 'penalaran internal' pribadi model AI — catatan langkah demi langkah yang biasanya disembunyikan dari pengguna saat menyelesaikan jawaban. Ini memengaruhi tiga penyedia AI terbesar sekaligus, menunjukkan kelemahan berada dalam pola desain bersama, bukan kesalahan satu perusahaan.
Perusahaan mengandalkan penalaran tersembunyi untuk tetap tersembunyi baik untuk alasan kompetitif/IP maupun untuk penyaringan keamanan; jika penyerang dapat membacanya, mereka dapat mengekstrak logika proprietary dan berpotensi menemukan cara untuk mengatasi pemeriksaan keamanan yang seharusnya terjadi 'secara tidak terlihat.'
Pantau di umpan langsung Lihat bagaimana hal ini terwujud dalam perkembangan keamanan dan tata kelola AI nyata.
Buka umpan →