본문으로 건너뛰기

← 2026.02.24 뉴스레터

2026.02.24 발표 · Anthropic

SECURITY (보안·안전)

Anthropic '책임 있는 확장 정책' 3.0 발표

Anthropic이 AI의 치명적 위험을 관리하는 자체 규칙인 '책임 있는 확장 정책(RSP)'을 3.0으로 고쳤습니다. 핵심은 솔직한 자기 평가입니다. 2년 반 동안 일부는 기대대로 됐지만, '능력 기준선을 넘으면 업계와 정부가 함께 움직일 것'이라는 기대는 이뤄지지 않았다고 인정했습니다. 그래서 회사 혼자 지킬 수 있는 약속과, 업계 전체가 해야 할 일에 대한 권고를 분리했습니다.

핵심 사실 · 한눈에 보기

  • 2월 24일 Anthropic이 Responsible Scaling Policy 3.0을 발표했습니다. 첫 RSP는 2023년 9월에 나왔습니다.
  • RSP는 '모델이 특정 능력 수준을 넘으면 더 엄격한 안전장치(AI Safety Level, ASL)를 적용한다'는 조건부 약속 구조입니다. Anthropic은 ASL-3 안전장치를 자체적으로 적용해 왔다고 밝혔습니다.
  • 새 RSP는 회사가 다른 회사와 관계없이 추진할 조치와, 업계 전체에 필요하다고 보는 '능력-대응 지도'를 따로 제시합니다.
  • 보안·정렬·안전장치·정책 분야의 구체적 목표를 담은 'Frontier Safety Roadmap'을 공개하고, 진척도를 공개적으로 평가하기로 했습니다. 구속력 있는 약속이 아닌 공개 목표입니다.
  • 모델의 안전 상태를 설명하는 위험 보고서(Risk Report)를 3~6개월마다 공개하고, 일정 조건에서는 외부 전문가가 거의 가리지 않은 원본을 검토하게 했습니다.

Anthropic이 인정한 한계

  • 모호한 구간: 모델 능력이 기준선에 가까워졌는지는 분명한데, 넘었는지는 평가 과학이 판단할 만큼 발전하지 않음. 생물학 위험이 대표 사례
  • 정부 대응: 3년간 AI 능력은 빠르게 발전했지만 안전 관련 정부 대응은 느렸고, 정책 환경은 경쟁력과 성장 쪽으로 기울었다고 평가
  • 혼자 하기 어려운 기준: 상위 단계 보안 요건은 한 회사가 단독으로 달성하기 어려울 수 있음. RAND 보고서의 최고 보안 등급은 '현재 불가능'으로 평가됨

3.0에서 바뀐 세 가지

  • 회사 계획과 업계 권고를 분리: 자사가 실제로 할 일과 업계 전체에 필요한 일을 따로 제시
  • Frontier Safety Roadmap: 정보 보안 '문샷' 연구, 버그 바운티를 넘는 자동화 레드팀, Claude가 헌법대로 행동하도록 하는 체계적 조치, 위험에 비례하는 '규제 사다리' 정책 제안 등
  • 위험 보고서와 외부 검토: 3~6개월마다 공개, 조건에 따라 이해 상충 없는 외부 검토자 지정

AI마중 POINT · 해석

봐야 할 지점

AI 회사가 자기 안전 정책의 '실패한 부분'을 공개적으로 적은 드문 사례입니다. Anthropic은 상위 단계 기준을 쉽게 지킬 수 있게 정의할 수도 있었지만 그러면 정책의 취지가 무너진다며, 대신 구조를 바꾸는 쪽을 택했다고 설명했습니다.

Anthropic은 RSP 같은 자율 기준이 캘리포니아 SB 53, 뉴욕 RAISE 법, EU AI 법 실천 강령처럼 '위험 관리 체계를 공개하라'는 법적 요구로 이어졌다고 평가했습니다. 법이 기술을 따라가지 못하는 동안 회사의 자율 정책이 사실상 기준 역할을 하는 구조는 계속되고 있으며, 그만큼 그 정책이 어떻게 바뀌는지가 중요합니다.

그래서 나한테는?

누구에게 의미가 있나

  • 일반 Claude 사용자: 사용 방식이나 기능에 바로 나타나는 변화는 없습니다.
  • AI 정책·규제 담당자: 위험 보고서와 로드맵이 공개되므로, 회사가 스스로 정한 목표를 얼마나 지키는지 외부에서 추적할 수 있습니다.
  • AI를 도입하는 기업: 공급사의 안전 정책을 비교할 때 공개 보고 주기와 외부 검토 여부를 기준으로 삼을 수 있습니다.

미확인 · 공식 발표만으로 알 수 없는 것

확인할 것

  • 로드맵 목표는 구속력이 없어, 달성하지 못해도 제재는 없습니다.
  • 외부 검토가 필요한 '일정 조건'은 정책 원문에 정의돼 있으며, 현재 모델은 아직 해당하지 않는다고 밝혔습니다.

SOURCE공식 원문 확인

수집 2026.09.30 · 정리 2026.10.01 · 수정 2026.10.05 · 원문 본문은 옮기지 않았습니다. 회사가 밝힌 수치·성능은 본문에서 출처를 붙여 구분했습니다.

같은 주제 · Anthropic

Anthropic 전체 →