Apa yang terjadi
Peneliti dari CITP Princeton (Sayash Kapoor, Arvind Narayanan dan kolaborator, termasuk co-author afiliasi UK AISI) memperkenalkan 'evaluasi bayangan' — memberikan agen AI frontier pertanyaan penelitian terbuka pusat dari makalah berkualitas tinggi yang belum dipublikasikan, enam hari, dan ribuan dolar komputasi, kemudian memiliki penulis manusia asli menilai kebutaan output AI terhadap mereka sendiri. Di seluruh dua pengajuan NeurIPS 2026 yang belum dipublikasikan, agen menyelesaikan semua pekerjaan teknik (tinjauan literatur, debugging, ratusan eksperimen, LaTeX siap kamera) tanpa bantuan manusia tetapi 'jelas ditolak' oleh penulis asli pada substansi penelitian. Tim mengidentifikasi lima mode kegagalan berulang: penilaian buruk tentang bar publikasi, respons tidak kreatif terhadap cacat desain, backtracking tidak efektif, kesadaran sumber daya yang buruk, dan pergeseran instruksi; pemeriksaan robustness dengan model/scaffold kedua mereproduksi pola tersebut. Ini adalah preprint, bukan peer-reviewed.
Mengapa penting
Secara langsung menginformasikan debat recursive-self-improvement/garis waktu-AGI yang semakin sering ditanyakan oleh tim dewan dan kebijakan: agen menunjukkan eksekusi teknik yang lancar tetapi kesenjangan penilaian penelitian yang asli, meredam asumsi risiko otomasi AI R&D jangka pendek yang digunakan dalam diskusi penskalaan dan kebijakan keselamatan.
Tindakan yang diperlukan
Bagikan dengan kepemimpinan keselamatan/penelitian AI teknis yang mengevaluasi klaim kemampuan AI R&D otonom; gabungkan taksonomi mode kegagalan ke dalam penilaian risiko kemampuan agen internal.