엔비디아가 Vera Rubin 랙 시스템에 붙는 추론 가속기 Groq 3 LPX가 본격 생산에 들어갔다고 밝혔습니다. 에이전트가 답을 한 토큰씩 만들어 내는 '디코드' 단계의 지연을 줄이는 장비로, 긴 맥락은 Rubin GPU가, 빠른 토큰 생성은 LPX가 나눠 맡는 구조입니다. 엔비디아는 공개 모델 Gemma 4 31B를 10만 토큰 맥락으로 돌린 Artificial Analysis 시험에서 초당 3,400토큰, 가장 가까운 대안의 4배 속도를 냈다고 밝혔습니다.
핵심 사실 · 한눈에 보기
8월 24일 엔비디아가 Vera Rubin용 Groq 3 LPX의 본격 생산을 발표했습니다(Hot Chips 학회 주간).
Rubin GPU가 대규모 맥락 처리를, LPX가 지연에 민감한 토큰 생성(디코드)을 맡아 에이전트 응답을 빠르고 예측 가능하게 한다고 설명했습니다.
Artificial Analysis 시험에서 Gemma 4 31B, 10만 토큰 맥락 기준 초당 3,400 출력 토큰으로 가장 가까운 대안 플랫폼의 4배였다고 밝혔습니다.
AI 클라우드 Nebius가 Groq 3 LPX를 처음 도입했고, CoreWeave는 Vera Rubin 랙을 잇는 Spectrum-X Multiplane 네트워크를 운영에 들였습니다.
SpaceXAI는 차세대 에이전트 AI에 엔비디아 Vera CPU를 쓰겠다고 발표했다고 엔비디아가 밝혔습니다.
왜 '디코드'를 따로 가속하나
엔비디아는 에이전트 시대의 새 성능 과제로 '디코드 지연'을 꼽았습니다. 에이전트는 추론하고, 도구를 쓰고, 다른 시스템과 주고받으며 답을 한 토큰씩 만들어 내는데, 작은 지연이 복잡한 작업 사슬을 거치며 몇 배로 불어난다는 것입니다. 그래서 맥락을 읽어 들이는 일과 토큰을 하나씩 생성하는 일을 서로 다른 장비에 나눴습니다.
Groq는 빠른 토큰 생성에 특화된 추론 칩으로 알려진 회사로, 그 기술이 엔비디아 랙 시스템 안으로 들어온 것입니다.