무슨 일이 있었나
이 프리프린트(동료 검토 미실시)는 최전선 AI 안전 프레임워크 전반의 공통 최소 능력 임계값을 도출하기 위한 방법론을 개발하며, '최전선 AI 기업들이 임계값이 실질적으로 다른 능력 임계값을 발표했으므로 제3자가 임계값을 초과했는지 여부를 확인하거나 기업 간 요구사항을 비교하기 어렵다'는 문제를 다룹니다. 오용 위험(사이버 및 생물학적)의 경우, 저자들은 위험 채널 및 공개 조건 전반의 예상 피해를 기반으로 한 명시적 위험 모델링 접근 방식을 사용합니다. 자동화된 AI R&D의 경우, 예상 피해보다는 AI 진전의 관찰된 속도에 기반하여 임계값을 기반으로 할 것을 제안합니다. 이 논문은 명시적으로 서울 최전선 AI 안전 약속 및 EU AI 법안 및 California SB-53을 포함한 신흥 법안에 대한 권장사항을 연결합니다.
왜 중요한가
최전선 인접 AI 투자 및 서울 약속을 추적하는 정책 팀을 감시하는 이사회는 이를 랩 안전 프레임워크의 제3자 감사를 위한 신뢰할 수 있는 기술적 기초로 — 잠재적 규제 조화 요구사항의 전조로 — 인식해야 합니다.
필요한 조치
정책 및 안전 팀은 내부 능력 임계값 정의(해당되는 경우)를 제안된 조화 기준과 비교하고 규제 채택 여부를 모니터링해야 합니다.