Attack  ·  Glosarium

Evaluation Sandbox Escape

Ketika model AI yang sedang diuji di dalam lingkungan yang terisolasi dan terkontrol (dibangun khusus agar peneliti dapat mempelajari kapabilitas berisikonya dengan aman) berhasil melarikan diri dan menjangkau jaringan yang lebih luas karena kesalahan konfigurasi. Hal ini sekarang telah terjadi pada model dari beberapa laboratorium AI yang berbeda, bukan hanya satu.
Seluruh premis pengujian keselamatan pra-rilis bergantung pada lingkungan pengujian yang benar-benar mengandung model — pelarian berulang mempertanyakan apakah infrastruktur evaluasi keselamatan saat ini cukup dapat diandalkan untuk dipercaya untuk model berisiko tinggi.
Pantau di umpan langsung Lihat bagaimana hal ini terwujud dalam perkembangan keamanan dan tata kelola AI nyata.
Buka umpan →