事件经过
2026年10月7日,OpenAI在GPT-6 Sol和GPT-6 Luna向全球所有ChatGPT用户推出之际,发布了其部署安全系统卡,更新了此前9月的版本。该卡披露,“ChatGPT中的GPT-6融入了Astra的安全进展”,并且与GPT-5.6模型相比,“对越狱攻击(包括跨多轮适应的攻击)表现出更强的抵抗力,同时在减少不诚实、欺骗和规避护栏方面也有所改善”;出现退步的领域经过了人工审查和红队测试,并“发现被禁止的响应通常严重程度较低”。根据《预备框架》,10月版本在“网络安全”和“生物与化学”两个领域均被视为“高能力”,而两个模型在“AI自我改进”方面均未达到高风险等级,因此该版本延续了GPT-5.6系统卡中详述的相同安全保障措施。
影响分析
该卡是前沿实验室对其旗舰模型当前安全与能力状况的权威声明——包括公司将哪些网络和生物滥用阈值视为高风险——为安全、合规和采购团队评估前沿模型风险提供了有用的基准背景。
建议行动
使用已准备好的评估(网络和生物化学高能力分类)来校准贵企业针对GPT-6的护栏、红队测试和可接受使用假设,使其与OpenAI自身声明的威胁模型保持一致。