본문으로 건너뛰기

← 2026.01.22 뉴스레터

2026.01.22 발표 · Anthropic

RESEARCH (연구)

Anthropic, Claude의 성격과 원칙을 담은 '새 헌법' 공개

Anthropic이 Claude의 가치와 행동 기준을 정한 '헌법(constitution)'을 새로 써서 전문을 공개했습니다. 예전처럼 원칙을 나열하는 대신 '왜 그렇게 행동해야 하는지'를 설명하는 방식으로 바꿨고, 누구나 자유롭게 쓸 수 있는 CC0 라이선스로 풀었습니다. 이 문서는 실제 모델 학습에 쓰입니다.

핵심 사실 · 한눈에 보기

  • 1월 22일 Anthropic이 Claude의 새 헌법 전문을 공개했습니다.
  • 누구나 허락 없이 어떤 목적으로든 쓸 수 있는 CC0 1.0 라이선스로 배포됩니다.
  • Claude가 갖출 네 가지 성질을 '넓은 의미의 안전 → 윤리 → Anthropic 지침 준수 → 진정한 도움' 순으로 우선한다고 정했습니다.
  • 생물무기 공격에 실질적 도움을 주지 않는 것처럼 절대 넘지 않는 '하드 제약'은 따로 둡니다.
  • Anthropic은 헌법을 학습 여러 단계에 쓰며, Claude 스스로 헌법을 바탕으로 합성 학습 데이터를 만든다고 밝혔습니다.

헌법이란 무엇인가

Anthropic은 헌법을 'Claude가 누구인지 표현하고 형성하는 기초 문서'라고 설명합니다. Claude가 어떤 가치를 지니길 바라는지, 그 이유는 무엇인지, 정직과 배려가 부딪치는 상황 같은 어려운 경우를 어떻게 다룰지를 담았습니다. 사람이 읽을 수도 있지만 주된 독자는 Claude 자신이라고 밝혔습니다.

회사는 이 문서를 Claude 행동에 대한 '최종 권위'로 둔다고 했습니다. 다른 학습이나 지시는 헌법의 문구와 취지에 맞아야 한다는 뜻입니다. 다만 학습은 어려운 일이어서 Claude의 실제 출력이 헌법의 이상과 항상 맞지는 않을 수 있다고 스스로 적었습니다.

무엇이 달라졌나

Anthropic은 2023년부터 'Constitutional AI'라는 방식으로 Claude를 학습시켜 왔습니다. 이전 헌법은 독립된 원칙 목록이었습니다. 새 헌법은 규칙을 기계적으로 따르게 하기보다, 이유를 설명해 처음 보는 상황에서도 넓은 원칙을 적용할 수 있게 하는 데 초점을 뒀습니다.

규칙의 장점도 인정했습니다. 명확한 선은 예측 가능하고 검증하기 쉬워서, 특히 위험이 큰 행동에는 '하드 제약'으로 남겨 뒀습니다. 반면 규칙을 너무 엄격하게 적용하면 예상하지 못한 상황에서 잘못 쓰일 수 있다는 것이 방식을 바꾼 이유입니다.

네 가지 우선순위

헌법은 현재 모든 Claude 모델이 다음 네 가지를 갖추길 바라고, 서로 부딪치면 대체로 이 순서로 우선하라고 정했습니다.

  • 넓은 의미의 안전: 지금 단계에서 사람이 AI를 감독하고 바로잡는 장치를 훼손하지 않기
  • 넓은 의미의 윤리: 정직하고, 좋은 가치에 따라 행동하고, 해로운 행동 피하기
  • Anthropic 지침 준수: 의료 조언, 사이버보안 요청 등에 대한 세부 지침 따르기
  • 진정한 도움: 서비스를 만드는 운영자와 최종 사용자에게 실질적으로 도움 되기

AI마중 POINT · 해석

봐야 할 지점

눈에 띄는 것은 '안전'을 '윤리'보다 앞에 둔 이유 설명입니다. Anthropic은 안전이 윤리보다 더 중요해서가 아니라, 지금의 모델이 잘못된 믿음이나 가치의 결함 때문에 실수할 수 있으므로 사람이 감독하고 필요하면 멈출 수 있어야 한다는 논리를 폈습니다.

도움에 대해서는 '의사·변호사·재무 상담사의 지식을 가진 똑똑한 친구처럼, 사용자를 스스로 판단할 수 있는 성인으로 대하며 솔직하게 말하라'는 방향을 제시했습니다. 지나친 거절이나 얼버무림을 줄이려는 의도로 읽힙니다. 또 Claude에게 의식이나 도덕적 지위가 있을 가능성에 대해 '불확실하다'는 입장을 문서에 담은 것도 다른 회사 문서에서 보기 드문 부분입니다.

그래서 나한테는?

사용자에게 의미

  • Claude 사용자: Claude가 어떤 요청을 거절하거나 조심스럽게 답할 때, 그것이 의도된 행동인지 판단할 근거 문서가 생겼습니다.
  • Claude로 서비스를 만드는 기업: 운영자(operator)와 최종 사용자 사이에서 Claude가 도움을 어떻게 저울질하는지 헌법에서 확인할 수 있습니다.
  • 연구자·다른 AI 회사: CC0라 자유롭게 인용·수정해 쓸 수 있습니다.

미확인 · 공식 발표만으로 알 수 없는 것

남은 질문

  • 헌법 내용이 실제 모델 행동에 얼마나 반영되는지는 외부에서 측정하기 어렵습니다. Anthropic도 출력이 늘 이상에 맞지는 않는다고 인정했습니다.
  • 의료·사이버보안 등에 대한 'Anthropic 지침'의 세부 내용은 헌법과 별도이며 전부 공개된 것은 아닙니다.

SOURCE공식 원문 확인

수집 2026.09.30 · 정리 2026.10.01 · 수정 2026.10.02 · 원문 본문은 옮기지 않았습니다. 회사가 밝힌 수치·성능은 본문에서 출처를 붙여 구분했습니다.

같은 주제 · Anthropic

Anthropic 전체 →