본문으로 건너뛰기

← 2026.08.24 뉴스레터

2026.08.24 발표 · NVIDIA Blog

CHIPS · INFRA (칩·인프라)

엔비디아 'Groq 3 LPX' 본격 생산… Vera Rubin에 에이전트용 고속 추론 추가

엔비디아가 Vera Rubin 랙 시스템에 붙는 추론 가속기 Groq 3 LPX가 본격 생산에 들어갔다고 밝혔습니다. 에이전트가 답을 한 토큰씩 만들어 내는 '디코드' 단계의 지연을 줄이는 장비로, 긴 맥락은 Rubin GPU가, 빠른 토큰 생성은 LPX가 나눠 맡는 구조입니다. 엔비디아는 공개 모델 Gemma 4 31B를 10만 토큰 맥락으로 돌린 Artificial Analysis 시험에서 초당 3,400토큰, 가장 가까운 대안의 4배 속도를 냈다고 밝혔습니다.

핵심 사실 · 한눈에 보기

  • 8월 24일 엔비디아가 Vera Rubin용 Groq 3 LPX의 본격 생산을 발표했습니다(Hot Chips 학회 주간).
  • Rubin GPU가 대규모 맥락 처리를, LPX가 지연에 민감한 토큰 생성(디코드)을 맡아 에이전트 응답을 빠르고 예측 가능하게 한다고 설명했습니다.
  • Artificial Analysis 시험에서 Gemma 4 31B, 10만 토큰 맥락 기준 초당 3,400 출력 토큰으로 가장 가까운 대안 플랫폼의 4배였다고 밝혔습니다.
  • AI 클라우드 Nebius가 Groq 3 LPX를 처음 도입했고, CoreWeave는 Vera Rubin 랙을 잇는 Spectrum-X Multiplane 네트워크를 운영에 들였습니다.
  • SpaceXAI는 차세대 에이전트 AI에 엔비디아 Vera CPU를 쓰겠다고 발표했다고 엔비디아가 밝혔습니다.

왜 '디코드'를 따로 가속하나

엔비디아는 에이전트 시대의 새 성능 과제로 '디코드 지연'을 꼽았습니다. 에이전트는 추론하고, 도구를 쓰고, 다른 시스템과 주고받으며 답을 한 토큰씩 만들어 내는데, 작은 지연이 복잡한 작업 사슬을 거치며 몇 배로 불어난다는 것입니다. 그래서 맥락을 읽어 들이는 일과 토큰을 하나씩 생성하는 일을 서로 다른 장비에 나눴습니다.

Groq는 빠른 토큰 생성에 특화된 추론 칩으로 알려진 회사로, 그 기술이 엔비디아 랙 시스템 안으로 들어온 것입니다.

  • Rubin GPU: 긴 맥락 처리
  • Groq 3 LPX: 지연에 민감한 토큰 생성
  • Spectrum-X 이더넷: AI 팩토리 안 대규모 데이터 이동
  • Vera CPU: 오케스트레이션, 도구 사용, 코드 실행, 시뮬레이션

AI마중 POINT · 해석

봐야 할 지점

AI 인프라 경쟁의 초점이 학습에서 추론으로, 그중에서도 '얼마나 빨리 토큰을 내놓느냐'로 옮겨가고 있습니다. 이 사이트 기록상 OpenAI는 GPT-5.6 Sol·GPT-6 Astra에 표준보다 훨씬 빠른 Ultrafast 처리 방식을 내놨고, 엔비디아는 이를 뒷받침하는 하드웨어를 랙 단위로 내놓고 있습니다. 빠른 처리에는 더 높은 가격이 붙는 구조라, 속도 자체가 상품이 되고 있습니다.

'4배 빠름'은 특정 모델(Gemma 4 31B)과 맥락 길이(10만 토큰) 조건의 결과입니다. 다른 모델이나 짧은 대화에서 같은 차이가 나는지는 따로 봐야 하고, 비교 대상 '가장 가까운 대안 플랫폼'이 무엇인지 엔비디아 글에는 나오지 않습니다.

그래서 나한테는?

누구에게 의미가 있나

소비자가 직접 보는 변화는 없습니다. 다만 이런 장비가 AI 서비스에 들어가면, 에이전트가 여러 단계를 거치는 작업의 대기 시간이 줄어드는 형태로 체감될 수 있습니다.

  • AI 서비스 개발사: Nebius 같은 클라우드에서 빠른 토큰 생성을 상품으로 쓸 수 있게 됐습니다.
  • 인프라 담당자: 맥락 처리와 토큰 생성을 분리하는 구조가 새 추론 설계의 기준으로 자리 잡는지 지켜볼 만합니다.

미확인 · 공식 발표만으로 알 수 없는 것

발표에 없는 것

  • Groq 3 LPX의 가격과 공급 물량은 공개되지 않았습니다.
  • 엔비디아와 Groq의 거래 구조(기술 라이선스, 인수 등)는 이 글에서 설명되지 않습니다.

SOURCE공식 원문 확인

수집 2026.09.30 · 정리 2026.10.01 · 수정 2026.10.05 · 원문 본문은 옮기지 않았습니다. 회사가 밝힌 수치·성능은 본문에서 출처를 붙여 구분했습니다.

같은 주제 · NVIDIA

NVIDIA 전체 →