본문으로 건너뛰기

← 뉴스레터 전체

AI NEWSLETTER

2026년 2월 23일 (월)

이 날 발표된 공식 원문을 2026.10.01에 확인해 소급 정리한 호입니다.

01BENCHMARK (벤치마크)

OpenAI "SWE-bench Verified는 더 이상 평가에 쓰지 않는다"

유명 코딩 벤치마크가 오염되어 실제 실력을 잘못 잰다며, SWE-bench Pro를 권했습니다.

핵심 사실

  • OpenAI는 SWE-bench Verified가 점점 오염되어 최신 코딩 성능을 잘못 측정한다고 밝혔습니다.
  • 분석 결과 결함 있는 테스트와 학습 데이터 유출이 있었다며 SWE-bench Pro를 권장했습니다.

왜 중요한가 · AI마중 해석

모델 발표마다 나오는 벤치마크 점수가 얼마나 믿을 만한지 모델 회사가 직접 문제를 제기했습니다. 점수 비교만으로 모델을 고르면 안 되는 이유입니다.

그래서 나한테는?

'○○ 벤치마크 1위' 같은 홍보 문구는 어떤 시험인지, 그 시험이 아직 유효한지 함께 봐야 합니다.

SOURCE공식 원문 확인

수집 2026.09.30 · 정리 2026.10.01 · 원문 본문은 옮기지 않았습니다.

02SECURITY (보안·안전)

Anthropic "가짜 계정 2만4천 개로 Claude 능력 빼내려는 시도 적발"

Anthropic이 중국 AI 연구소 세 곳, DeepSeek·Moonshot·MiniMax가 가짜 계정 약 2만4천 개로 Claude와 1,600만 건 넘는 대화를 주고받으며 능력을 빼내 갔다고 공개했습니다. 강한 모델의 답변으로 약한 모델을 학습시키는 '증류'는 흔한 기법이지만, 경쟁사 모델을 몰래 대량으로 증류하는 것은 이용약관 위반이자 안보 문제라는 것이 Anthropic의 주장입니다. 회사가 경쟁 연구소의 이름을 직접 지목했다는 점에서 이례적인 발표입니다.

핵심 사실 · 한눈에 보기

  • 2월 23일 Anthropic은 DeepSeek, Moonshot, MiniMax 세 연구소가 약 2만4천 개의 부정 계정으로 Claude와 1,600만 건 이상의 대화를 생성했다고 밝혔습니다.
  • Anthropic 집계로 Moonshot(Kimi 모델)은 340만 건 이상, MiniMax는 1,300만 건 이상이며, 세 곳 모두 에이전트 추론·도구 사용·코딩 같은 Claude의 차별화된 능력을 노렸습니다.
  • IP 주소 상관관계, 요청 메타데이터, 인프라 지표, 일부 업계 파트너의 교차 확인으로 각 캠페인을 특정 연구소에 '높은 확신'으로 귀속했다고 설명했습니다.
  • Anthropic은 중국에서 Claude를 상업적으로 제공하지 않으며, 이들 연구소는 Claude 접근권을 대량 재판매하는 프록시 서비스를 거쳤다고 밝혔습니다. 한 프록시 네트워크는 부정 계정 2만 개 이상을 동시에 운영했습니다.
  • 대응으로 탐지 분류기·행동 지문, 다른 AI 연구소·클라우드·당국과의 정보 공유, 교육·연구·스타트업 계정 인증 강화, 모델 출력의 증류 효율을 낮추는 대응책을 내놨습니다.

어떻게 빼내 갔나

Anthropic에 따르면 하나하나는 평범해 보이는 프롬프트가 수백 개 계정에서 수만 번 반복되며 같은 능력만 집중적으로 겨냥한 것이 특징이었습니다. 정상 사용과 구분되는 신호는 좁은 영역에 몰린 거대한 양, 매우 반복적인 구조, 그리고 AI 모델 학습에 가장 값진 내용이라는 점이었습니다.

  • DeepSeek: 계정 간 동기화된 트래픽, 공유 결제 수단. 완성된 답변 뒤의 추론 과정을 단계별로 써 달라고 해 사고 과정 학습 데이터를 대량 생성. 반체제 인사·당 지도자 등 민감한 질문의 '검열 안전' 대체 답변도 생성
  • Moonshot: 여러 접근 경로에 걸친 수백 개 계정, 후반엔 Claude의 추론 흔적 복원 시도
  • MiniMax: 진행 중에 탐지. Anthropic이 새 모델을 내자 24시간 안에 트래픽 절반 가까이를 새 모델로 돌렸다고 설명
전체 내용 보기이전과 달라진 점 · 나에게 미치는 영향 · 아직 모르는 것

SOURCE공식 원문 확인

수집 2026.09.30 · 정리 2026.10.01 · 수정 2026.10.05 · 원문 본문은 옮기지 않았습니다. 회사가 밝힌 수치·성능은 본문에서 출처를 붙여 구분했습니다.

03AI AGENT (AI 에이전트)

Claude Cowork·플러그인 기업용 업데이트… 사내 전용 플러그인 마켓 구축

직무·부서별 전문 에이전트를 플러그인으로 만들어 회사 안에서 나눠 씁니다.

핵심 사실

  • Anthropic이 기업이 업무 방식에 맞게 Claude를 조정하는 Cowork·플러그인 업데이트를 발표했습니다.
  • 플러그인으로 직무·부서별 전문 에이전트를 만들고, 사내 전용(프라이빗) 마켓플레이스를 만들 수 있습니다. 같은 날 재무용 Cowork·플러그인도 소개했습니다.

왜 중요한가 · AI마중 해석

회사마다 다른 업무 방식을 AI에 가르치는 방법이 '프롬프트 공유'에서 '플러그인 배포'로 바뀌고 있습니다.

그래서 나한테는?

사내에서 잘 쓰는 업무 방식을 플러그인으로 만들어 팀 전체가 같은 방식으로 쓸 수 있습니다.

SOURCE공식 원문 + 추가 출처

수집 2026.10.01 · 정리 2026.10.01 · 원문 본문은 옮기지 않았습니다.

04BUSINESS (비즈니스)

OpenAI 'Frontier Alliance Partners'… 기업 에이전트 도입을 돕는 파트너 프로그램

시범 사업을 실제 운영 단계로 옮기도록 돕는 파트너사들입니다.

핵심 사실

  • OpenAI가 기업이 AI 시범 사업에서 실제 운영으로 넘어가도록 안전하고 확장 가능한 에이전트 배치를 돕는 Frontier Alliance Partners를 발표했습니다.

왜 중요한가 · AI마중 해석

3월 Anthropic의 1억 달러 파트너 네트워크와 같은 흐름입니다. 기업 AI는 구축을 도와줄 파트너가 필요합니다.

그래서 나한테는?

기업 고객 대상 프로그램입니다. 회사에서 AI 에이전트 도입을 검토 중이라면 참여 컨설팅사 목록을 참고할 수 있습니다.

SOURCE공식 원문 확인

수집 2026.09.30 · 정리 2026.10.01 · 원문 본문은 옮기지 않았습니다.