SECURITY (보안·안전)
Anthropic "가짜 계정 2만4천 개로 Claude 능력 빼내려는 시도 적발"
Anthropic이 중국 AI 연구소 세 곳, DeepSeek·Moonshot·MiniMax가 가짜 계정 약 2만4천 개로 Claude와 1,600만 건 넘는 대화를 주고받으며 능력을 빼내 갔다고 공개했습니다. 강한 모델의 답변으로 약한 모델을 학습시키는 '증류'는 흔한 기법이지만, 경쟁사 모델을 몰래 대량으로 증류하는 것은 이용약관 위반이자 안보 문제라는 것이 Anthropic의 주장입니다. 회사가 경쟁 연구소의 이름을 직접 지목했다는 점에서 이례적인 발표입니다.
핵심 사실 · 한눈에 보기
- 2월 23일 Anthropic은 DeepSeek, Moonshot, MiniMax 세 연구소가 약 2만4천 개의 부정 계정으로 Claude와 1,600만 건 이상의 대화를 생성했다고 밝혔습니다.
- Anthropic 집계로 Moonshot(Kimi 모델)은 340만 건 이상, MiniMax는 1,300만 건 이상이며, 세 곳 모두 에이전트 추론·도구 사용·코딩 같은 Claude의 차별화된 능력을 노렸습니다.
- IP 주소 상관관계, 요청 메타데이터, 인프라 지표, 일부 업계 파트너의 교차 확인으로 각 캠페인을 특정 연구소에 '높은 확신'으로 귀속했다고 설명했습니다.
- Anthropic은 중국에서 Claude를 상업적으로 제공하지 않으며, 이들 연구소는 Claude 접근권을 대량 재판매하는 프록시 서비스를 거쳤다고 밝혔습니다. 한 프록시 네트워크는 부정 계정 2만 개 이상을 동시에 운영했습니다.
- 대응으로 탐지 분류기·행동 지문, 다른 AI 연구소·클라우드·당국과의 정보 공유, 교육·연구·스타트업 계정 인증 강화, 모델 출력의 증류 효율을 낮추는 대응책을 내놨습니다.
어떻게 빼내 갔나
Anthropic에 따르면 하나하나는 평범해 보이는 프롬프트가 수백 개 계정에서 수만 번 반복되며 같은 능력만 집중적으로 겨냥한 것이 특징이었습니다. 정상 사용과 구분되는 신호는 좁은 영역에 몰린 거대한 양, 매우 반복적인 구조, 그리고 AI 모델 학습에 가장 값진 내용이라는 점이었습니다.
- DeepSeek: 계정 간 동기화된 트래픽, 공유 결제 수단. 완성된 답변 뒤의 추론 과정을 단계별로 써 달라고 해 사고 과정 학습 데이터를 대량 생성. 반체제 인사·당 지도자 등 민감한 질문의 '검열 안전' 대체 답변도 생성
- Moonshot: 여러 접근 경로에 걸친 수백 개 계정, 후반엔 Claude의 추론 흔적 복원 시도
- MiniMax: 진행 중에 탐지. Anthropic이 새 모델을 내자 24시간 안에 트래픽 절반 가까이를 새 모델로 돌렸다고 설명
AI마중 POINT · 해석
봐야 할 지점
Anthropic은 이 문제를 수출 통제와 직접 연결했습니다. 중국 연구소의 빠른 발전이 '수출 통제가 효과 없다'는 증거로 잘못 읽히지만, 실제로는 미국 모델에서 빼낸 능력에 상당 부분 기대고 있으며, 이런 대규모 증류에도 첨단 칩이 필요하다는 주장입니다. 불법 증류된 모델은 생물무기·사이버 공격 방지 장치가 빠진 채 퍼질 수 있다는 점도 강조했습니다.
이것은 Anthropic의 주장이고, 지목된 세 연구소의 반론은 이 발표에 담겨 있지 않습니다. 다만 경쟁사를 실명으로 지목하고 탐지 근거까지 밝힌 것은, AI 회사들이 모델 출력 자체를 지켜야 할 자산으로 보기 시작했다는 신호입니다. 이 사이트 기록상 DeepSeek는 4월 V4를 Hugging Face에 공개했습니다.
그래서 나한테는?
누구에게 영향이 있나
- 평소처럼 Claude를 쓰는 사람: 바뀌는 것은 없습니다.
- 교육·연구·스타트업 프로그램으로 계정을 만드는 사람: 이 경로가 가장 많이 악용됐다며 인증을 강화했으므로 가입 절차가 까다로워질 수 있습니다.
- API로 대량 데이터를 생성하는 개발사: 정상 목적이라도 반복적인 대량 호출은 탐지 대상 패턴과 겹칠 수 있어, 이용약관의 허용 범위를 확인해 둘 필요가 있습니다.
미확인 · 공식 발표만으로 알 수 없는 것
확인할 것
- 지목된 연구소들의 입장은 이 발표에 포함되지 않았습니다.
- 출력의 증류 효율을 낮추는 '대응책'이 구체적으로 무엇인지는 공개되지 않았습니다.
SOURCE공식 원문 확인
- PRIMARY · 공식Detecting and preventing distillation attacksAnthropic · anthropic.com · 발표 2026.02.23 · 확인 2026.10.05
수집 2026.09.30 · 정리 2026.10.01 · 수정 2026.10.05 · 원문 본문은 옮기지 않았습니다. 회사가 밝힌 수치·성능은 본문에서 출처를 붙여 구분했습니다.