MODEL RELEASE (모델 출시)
엔비디아 'Nemotron 3 Nano Omni'… 시각·음성·언어를 하나로 묶은 공개 모델
엔비디아가 영상·음성·이미지·글을 하나의 모델로 이해하는 공개 모델 Nemotron 3 Nano Omni를 내놨습니다. 에이전트가 시각·음성·언어 모델을 따로 부르면 느리고 맥락이 끊기는 문제를 하나로 합쳐 풀겠다는 것입니다. 엔비디아는 같은 응답 속도에서 다른 공개 멀티모달 모델보다 처리량이 최대 9배 높다고 밝혔습니다.
핵심 사실 · 한눈에 보기
- 4월 28일 엔비디아가 공개 멀티모달 모델 Nemotron 3 Nano Omni를 발표했습니다.
- 언어 모델 Nemotron 3 Nano 30B-A3B(전체 300억, 작동 30억 파라미터)에 C-RADIOv4-H 시각 인코더와 Parakeet-TDT-0.6B-v2 음성 인코더를 붙인 구조입니다.
- 엔비디아는 같은 상호작용 속도 기준 다른 공개 옴니 모델보다 처리량이 최대 9배라고 밝혔습니다(문서 작업 7.4배, 영상 작업 9.2배).
- 가중치·데이터셋·학습 기법을 공개했고, Hugging Face에 BF16·FP8·NVFP4 체크포인트가 올라왔습니다.
- Foxconn, Palantir, H Company 등이 도입했고 Dell, Oracle, Docusign 등이 평가 중이라고 밝혔습니다.
무엇에 쓰도록 만들었나
Hugging Face 기술 글에 따르면 이미지를 조각내 처리하던 이전 방식 대신 원래 비율 그대로 해상도를 조절해 처리하고, 백본은 Mamba 층 23개, 전문가 128개짜리 MoE 층 23개, 주의 층 6개를 섞었습니다.
- 문서 분석: 표·그림·수식·쪽 사이 참조가 얽힌 100쪽 넘는 계약서·보고서·매뉴얼
- 음성 인식: 화자·억양·배경 소음이 섞인 긴 음성 받아쓰기
- 음성+영상 이해: 설명이 붙은 화면 녹화, 슬라이드가 있는 회의, 제품 시연
- 컴퓨터 사용: 스크린샷 해석, 화면 상태 추적, 다음 행동 선택
- 일반 멀티모달 추론: 글·이미지·표를 엮은 여러 단계 추론
AI마중 POINT · 해석
봐야 할 지점
에이전트 구조가 '큰 모델 하나'에서 '역할별 하위 모델 조합'으로 가는 흐름에서, 눈과 귀를 맡을 작은 공개 모델을 겨냥했습니다. 엔비디아도 이 모델을 상위 Nemotron 3 Super(실행)·Ultra(계획)나 다른 회사의 상용 모델과 함께 하위 에이전트로 쓰는 그림을 제시했습니다. 화면을 빨리 읽어야 하는 컴퓨터 사용 에이전트가 대표적인 예로, H Company는 풀HD 화면 녹화를 실시간으로 해석할 수 있게 됐다고 밝혔습니다.
처리량 '9배'는 엔비디아가 정한 조건(같은 사용자당 응답 속도)에서 다른 공개 옴니 모델과 비교한 수치입니다. 비교 대상으로 Qwen3-Omni를 언급했지만, 하드웨어와 설정에 따라 결과는 달라질 수 있습니다.
그래서 나한테는?
누구에게 쓸모 있나
- 문서·영상 분석 에이전트를 만드는 개발자: Hugging Face, OpenRouter, build.nvidia.com에서 내려받거나 바로 써 볼 수 있습니다.
- 데이터를 밖으로 보내기 어려운 기업: 공개 가중치라 자체 서버나 Jetson, DGX Spark 같은 로컬 장비에 설치할 수 있습니다.
- 일반 사용자: 이 모델을 쓴 서비스가 나와야 체감할 수 있습니다.
미확인 · 공식 발표만으로 알 수 없는 것
확인이 필요한 것
- '6개 순위표 1위' 같은 표현은 발표 시점 기준이며 이후 바뀔 수 있습니다.
- 한국어 음성 인식·문서 이해 성능은 따로 공개되지 않았습니다.
- 라이선스 세부 조건은 모델 페이지에서 확인해야 합니다.
SOURCE공식 원문 + 추가 출처
- PRIMARY · 공식NVIDIA Launches Nemotron 3 Nano Omni Model, Unifying Vision, Audio and Language for up to 9x More Efficient AI AgentsNVIDIA Blog · blogs.nvidia.com · 발표 2026.04.28 · 확인 2026.10.05
- SECONDARY · 공식Introducing NVIDIA Nemotron 3 Nano Omni: Long-Context Multimodal Intelligence for Documents, Audio and Video AgentsHugging Face Blog · huggingface.co · 발표 2026.04.28 · 확인 2026.10.05
수집 2026.09.30 · 정리 2026.10.01 · 수정 2026.10.05 · 원문 본문은 옮기지 않았습니다. 회사가 밝힌 수치·성능은 본문에서 출처를 붙여 구분했습니다.