NVIDIA, Groq 3 LPX AI 추론 가속기 풀 프로덕션 돌입... Vera Rubin과 결합해 역대 최고 토큰 생성 속도 달성
·2026.08.25 09:00
핵심 내용
NVIDIA가 Groq 3 LPX 양산을 시작하며 Vera Rubin 플랫폼의 추론 속도를 대폭 끌어올렸다.
1 / 2
자세히 보기
NVIDIA는 Hot Chips 2026에서 Groq 3 LPX AI 추론 가속기 칩의 풀 프로덕션(양산) 돌입을 공식 발표했다. 이는 Vera CPU와 Vera Rubin 서버의 대량 생산 발표에 이어 NVIDIA의 AI 로드맵이 순조롭게 진행되고 있음을 보여준다.
Groq 3 LPX는 Vera Rubin NVL72 플랫폼의 확장 요소로 작용하며, 에이전틱 AI 워크로드에서 요구되는 초고속 토큰 생성을 지원한다. NVIDIA Rubin GPU가 대규모 컨텍스트 처리를 담당하고, LPX가 지연 시간(latency)에 민감한 디코딩 워크로드를 가속화하는 구조다.
실제 벤치마크에서는 Gemma 4 31B 오픈 모델을 구동하며 **초당 3,400개(3,400 TPS)**의 토큰을 생성하는 기록을 세웠다. 이는 100,000 토큰 컨텍스트 윈도우 기준 해당 모델에서 기록된 가장 빠른 성능이다.
이러한 조합은 코딩 등 에이전틱 AI 작업의 응답 시간을 기존 대비 4배 단축시켜, 수 시간 걸리던 작업을 수 분 내로 처리할 수 있게 한다. 이를 통해 AI 팩토리는 더 빠르고 예측 가능한 추론 및 원활한 에이전트 상호작용을 제공할 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.