MODEL RELEASE (모델 출시)
DeepSeek-V4 공개… 에이전트가 실제로 쓸 수 있는 100만 토큰 맥락
중국 DeepSeek이 공개 모델 DeepSeek-V4를 내놨고, Hugging Face가 기술적 의미를 정리한 글을 냈습니다. 1조6천억 파라미터의 V4-Pro와 2,840억 파라미터의 V4-Flash 두 종으로, 모두 100만 토큰 맥락을 지원합니다. Hugging Face는 벤치마크 점수는 '경쟁력 있지만 최고는 아니다'라고 평가하면서, 진짜 혁신은 긴 맥락을 싸게 돌리는 구조에 있다고 봤습니다.
핵심 사실 · 한눈에 보기
- 4월 24일 DeepSeek이 V4를 공개했고, Hugging Face Hub에 V4-Pro와 V4-Flash 두 체크포인트가 올라왔습니다.
- V4-Pro는 전체 1조6천억 파라미터 중 490억 개, V4-Flash는 2,840억 개 중 130억 개가 작동하는 전문가 혼합(MoE) 모델이며, 둘 다 100만 토큰 맥락을 지원합니다.
- Hugging Face에 따르면 100만 토큰에서 V4-Pro는 이전 V3.2 대비 토큰당 연산 27%, KV 캐시 메모리 10%만 씁니다. V4-Flash는 연산 10%, KV 캐시 7%입니다.
- 도구를 쓰는 대화에서는 사용자 메시지가 바뀌어도 이전 추론 내용을 유지하도록 바꿨습니다.
- 도구 호출에 전용 특수 토큰과 XML 형식을 도입해, JSON 문자열 안의 이스케이프 오류를 줄였다고 설명했습니다.
왜 '에이전트가 실제로 쓸 수 있는' 100만 토큰인가
Hugging Face는 '100만 토큰 맥락은 용량일 뿐 성능이 아니다'라고 짚었습니다. 에이전트가 도구를 수백 번 부르는 작업에서는 결과가 계속 맥락에 쌓이고, 새 토큰을 만들 때마다 앞의 모든 내용에 대한 계산 비용을 냅니다. 맥락이 길어질수록 연산량과 KV 캐시(앞 내용을 기억하는 메모리)가 함께 커져, GPU 메모리가 차거나 작업 중간에 품질이 떨어지는 문제가 생깁니다.
V4는 주의(attention) 방식을 두 가지로 나눠 층마다 번갈아 씁니다. 하나는 KV를 4배 압축하고 필요한 블록만 골라 보는 방식(CSA), 다른 하나는 128배 압축한 뒤 전부 보는 방식(HCA)입니다. 여기에 FP8·FP4 저장을 더해, 일반적인 구조 대비 KV 캐시를 약 2% 수준으로 줄였다는 것이 Hugging Face 설명입니다.
에이전트를 위한 학습 변화
- 추론 유지: 도구를 쓰는 대화에서는 사용자의 새 메시지가 와도 앞선 추론을 버리지 않음. 도구 없는 대화는 기존처럼 매번 정리
- 도구 호출 형식: 전용 특수 토큰과 XML 형식으로 중첩 따옴표 오류 감소
- 강화학습 환경: 함수 호출부터 컨테이너, 마이크로VM, 전체 VM까지 하나의 SDK로 다루는 샌드박스 플랫폼(DSec)에서 수십만 개 동시 실행
AI마중 POINT · 해석
봐야 할 지점
공개 모델 경쟁의 초점이 '점수'에서 '긴 작업을 끝까지 하는 능력과 비용'으로 옮겨가고 있습니다. Hugging Face가 벤치마크가 최고는 아니어도 '중요하지 않다'고까지 쓴 것은, 에이전트로 오래 돌릴 때 실제로 부딪히는 문제를 구조로 풀었다는 평가 때문입니다.
다만 V4-Pro는 1조6천억 파라미터로, 효율이 좋아졌다고 해도 직접 운영하려면 대규모 GPU가 필요합니다. 중국 회사 모델이라는 점에서 기업 도입 시 라이선스 조건, 데이터 처리 위치, 각 조직의 보안 정책을 따로 검토해야 합니다. 이 글의 수치는 DeepSeek 논문을 인용한 Hugging Face 정리 기준입니다.
그래서 나한테는?
누구에게 의미가 있나
- 공개 모델로 에이전트를 만드는 개발자: 긴 도구 사용 작업에서 비용과 메모리를 줄일 수 있는 후보가 생겼습니다. 상대적으로 작은 V4-Flash부터 시험해 볼 만합니다.
- 연구자: 주의 구조와 학습 환경이 논문으로 공개돼 다른 모델 설계에 참고할 수 있습니다.
- 기업: 직접 설치형으로 쓸 경우 데이터가 외부로 나가지 않지만, 라이선스와 내부 규정 검토가 먼저입니다.
미확인 · 공식 발표만으로 알 수 없는 것
확인하지 못한 것
- DeepSeek 공식 발표문은 이 사이트가 직접 확인하지 않았고, Hugging Face의 기술 정리 글을 기준으로 했습니다.
- 라이선스 조건과 DeepSeek API 가격은 이 글에 나오지 않습니다.
- DeepSeek이나 Hugging Face 글에 한국어 평가 결과는 없습니다.
SOURCE공식 원문 확인
- PRIMARY · 공식DeepSeek-V4: a million-token context that agents can actually useHugging Face Blog · huggingface.co · 발표 2026.04.24 · 확인 2026.10.05
수집 2026.09.30 · 정리 2026.10.01 · 수정 2026.10.05 · 원문 본문은 옮기지 않았습니다. 회사가 밝힌 수치·성능은 본문에서 출처를 붙여 구분했습니다.