SECURITY (보안·안전)
Anthropic '책임 있는 확장 정책' 3.0 발표
Anthropic이 AI의 치명적 위험을 관리하는 자체 규칙인 '책임 있는 확장 정책(RSP)'을 3.0으로 고쳤습니다. 핵심은 솔직한 자기 평가입니다. 2년 반 동안 일부는 기대대로 됐지만, '능력 기준선을 넘으면 업계와 정부가 함께 움직일 것'이라는 기대는 이뤄지지 않았다고 인정했습니다. 그래서 회사 혼자 지킬 수 있는 약속과, 업계 전체가 해야 할 일에 대한 권고를 분리했습니다.
핵심 사실 · 한눈에 보기
- 2월 24일 Anthropic이 Responsible Scaling Policy 3.0을 발표했습니다. 첫 RSP는 2023년 9월에 나왔습니다.
- RSP는 '모델이 특정 능력 수준을 넘으면 더 엄격한 안전장치(AI Safety Level, ASL)를 적용한다'는 조건부 약속 구조입니다. Anthropic은 ASL-3 안전장치를 자체적으로 적용해 왔다고 밝혔습니다.
- 새 RSP는 회사가 다른 회사와 관계없이 추진할 조치와, 업계 전체에 필요하다고 보는 '능력-대응 지도'를 따로 제시합니다.
- 보안·정렬·안전장치·정책 분야의 구체적 목표를 담은 'Frontier Safety Roadmap'을 공개하고, 진척도를 공개적으로 평가하기로 했습니다. 구속력 있는 약속이 아닌 공개 목표입니다.
- 모델의 안전 상태를 설명하는 위험 보고서(Risk Report)를 3~6개월마다 공개하고, 일정 조건에서는 외부 전문가가 거의 가리지 않은 원본을 검토하게 했습니다.
Anthropic이 인정한 한계
- 모호한 구간: 모델 능력이 기준선에 가까워졌는지는 분명한데, 넘었는지는 평가 과학이 판단할 만큼 발전하지 않음. 생물학 위험이 대표 사례
- 정부 대응: 3년간 AI 능력은 빠르게 발전했지만 안전 관련 정부 대응은 느렸고, 정책 환경은 경쟁력과 성장 쪽으로 기울었다고 평가
- 혼자 하기 어려운 기준: 상위 단계 보안 요건은 한 회사가 단독으로 달성하기 어려울 수 있음. RAND 보고서의 최고 보안 등급은 '현재 불가능'으로 평가됨
3.0에서 바뀐 세 가지
- 회사 계획과 업계 권고를 분리: 자사가 실제로 할 일과 업계 전체에 필요한 일을 따로 제시
- Frontier Safety Roadmap: 정보 보안 '문샷' 연구, 버그 바운티를 넘는 자동화 레드팀, Claude가 헌법대로 행동하도록 하는 체계적 조치, 위험에 비례하는 '규제 사다리' 정책 제안 등
- 위험 보고서와 외부 검토: 3~6개월마다 공개, 조건에 따라 이해 상충 없는 외부 검토자 지정
AI마중 POINT · 해석
봐야 할 지점
AI 회사가 자기 안전 정책의 '실패한 부분'을 공개적으로 적은 드문 사례입니다. Anthropic은 상위 단계 기준을 쉽게 지킬 수 있게 정의할 수도 있었지만 그러면 정책의 취지가 무너진다며, 대신 구조를 바꾸는 쪽을 택했다고 설명했습니다.
Anthropic은 RSP 같은 자율 기준이 캘리포니아 SB 53, 뉴욕 RAISE 법, EU AI 법 실천 강령처럼 '위험 관리 체계를 공개하라'는 법적 요구로 이어졌다고 평가했습니다. 법이 기술을 따라가지 못하는 동안 회사의 자율 정책이 사실상 기준 역할을 하는 구조는 계속되고 있으며, 그만큼 그 정책이 어떻게 바뀌는지가 중요합니다.
그래서 나한테는?
누구에게 의미가 있나
- 일반 Claude 사용자: 사용 방식이나 기능에 바로 나타나는 변화는 없습니다.
- AI 정책·규제 담당자: 위험 보고서와 로드맵이 공개되므로, 회사가 스스로 정한 목표를 얼마나 지키는지 외부에서 추적할 수 있습니다.
- AI를 도입하는 기업: 공급사의 안전 정책을 비교할 때 공개 보고 주기와 외부 검토 여부를 기준으로 삼을 수 있습니다.
미확인 · 공식 발표만으로 알 수 없는 것
확인할 것
- 로드맵 목표는 구속력이 없어, 달성하지 못해도 제재는 없습니다.
- 외부 검토가 필요한 '일정 조건'은 정책 원문에 정의돼 있으며, 현재 모델은 아직 해당하지 않는다고 밝혔습니다.
SOURCE공식 원문 확인
- PRIMARY · 공식Responsible Scaling Policy Version 3.0Anthropic · anthropic.com · 발표 2026.02.24 · 확인 2026.10.05
수집 2026.09.30 · 정리 2026.10.01 · 수정 2026.10.05 · 원문 본문은 옮기지 않았습니다. 회사가 밝힌 수치·성능은 본문에서 출처를 붙여 구분했습니다.