무슨 일이 있었나
RAND의 AI, 보안 및 기술 센터는 프론티어 개방형 가중치 LLM이 악의적인 생물학적 목적으로 수정될 수 있는지 테스트했으며, 반거부 변조, 능력 향상 및 공개적으로 이용 가능한 검열 해제 모델 변형을 검토했습니다. 주요 발견: LLM의 안전 훈련 제거는 '매우 실행 가능'하지만, LLM의 생물학적 능력을 기본선 이상으로 향상시키는 것은 더 어렵습니다. 맞춤 생물 보안 평가는 능력 향상 없이 안전 제거만으로도 현실적인 생물무기 위협 경로를 지원할 수 있음을 시사합니다.
왜 중요한가
개방형 대 폐쇄형 AI 출시 정책 논쟁 및 수출 통제 논의를 직접 알리고, 보안 및 정책 지도자들이 모델 출시 보호장치에 대한 결정을 내리기 위해 이 증거 기반이 필요합니다.
필요한 조치
개방형 모델 출시 또는 배포에 대한 반변조 보호장치에 대해 국가 보안 및 신뢰 및 안전 팀에 브리핑합니다.