Kerentanan  ·  2026-08-13

Serangan lintas penyedia novel mendekripsi jejak penalaran chain-of-thought tersembunyi dalam API LLM OpenAI, Anthropic, dan Google

KerentananHigh dampakGlobal
Tim penelitian bersama dari ELLIS Institute Tübingen, Max Planck Institute, MATS Research, dan Snyk mempublikasikan 'Stealing Reasoning Traces from Proprietary LLM APIs' (arXiv 2608.09867) yang mengungkapkan cacat arsitektural dalam cara OpenAI, Anthropic, dan Google menerapkan penyembunyian chain-of-thought terenkripsi, memungkinkan jailbreak dekripsi yang dapat diskalakan di seluruh ekosistem model penalaran ketiga penyedia.
Ini adalah kelas serangan lintas penyedia yang baru, mempengaruhi ketiga vendor model frontier terbesar secara bersamaan — bukan bug penyedia tunggal. Ini mengalahkan perlindungan kekayaan intelektual pada jejak penalaran proprietary, mengungkapkan PII/kredensial yang bocor di dunia nyata dalam skala besar dari repositori publik, dapat mengungkapkan informasi berbahaya yang dirancang untuk ditahan output yang terlihat, dan menciptakan saluran untuk injeksi prompt tak terlihat ke dalam dataset agentic publik. Penyedia dilaporkan menerima pengungkapan berbulan-bulan sebelumnya dan tidak memperlakukannya sebagai dapat direproduksi/dapat ditindaklanjuti.
Blok penalaran terenkripsi yang dikembalikan oleh API model penalaran sepenuhnya kompatibel/dapat ditukar di seluruh sesi, pengguna, dan model dalam ekosistem penyedia. Penyerang menyuntikkan jejak penalaran terenkripsi yang ditangkap dari model yang lebih kuat dan lebih terlindungi ke model saudara yang lebih lemah dan kurang terlindungi dari penyedia yang sama; model yang lebih lemah mendekode dan mengeluarkan jejak secara verbatim dalam teks biasa, tanpa pernah secara langsung melakukan jailbreak pada model yang lebih kuat. Vektor serangan yang ditunjukkan termasuk bypass anti-distilasi, ekstraksi PII/kredensial dalam skala besar dari log sesi yang dibagikan secara publik (367 artefak PII dan 182 kredensial dipulihkan dari 315.320 blok penalaran yang ditambang), pengungkapan informasi berbahaya yang tersembunyi dalam penalaran bahkan ketika output final menolak, dan injeksi prompt tak terlihat yang tertanam sepenuhnya dalam blok terenkripsi untuk meracuni peluncuran agentic publik.
OpenAI GPT-5.6 API, Anthropic Claude Opus 4.8 API, Google Gemini 3 API (arsitektur blok penalaran chain-of-thought terenkripsi/opak)
Peneliti melakukan pengungkapan bertanggung jawab kepada penyedia dan mengusulkan mitigasi kriptografi/tingkat sistem (misalnya, mengikat blok penalaran ke identitas sesi/pengguna/model, menonaktifkan pemutaran ulang lintas model); tidak ada patch vendor publik yang dikonfirmasi pada saat pengungkapan — organisasi yang membagikan log sesi secara publik harus memperlakukan blok penalaran terenkripsi sebagai sensitif dan menyensor mereka.
arXiv: Stealing Reasoning Traces from Proprietary LLM APIsHugging Face Papers listing
Lihat di umpan langsung Jelajahi temuan keamanan dan tata kelola AI terkait — diperbarui setiap pagi.
Buka umpan →