Date: 2026-08-25 Topic: AI Semiconductors Primary source: NVIDIA Newsroom
NVIDIA는 미국 현지시간 8월 24일 Hot Chips 2026에서 에이전틱 AI용 추론 가속기 Groq 3 LPX가 본격 양산에 들어갔다고 발표했다. 한국어 발표는 8월 25일 공개됐다. 이 장비는 범용 GPU를 대체하는 단일 칩이 아니라, 차세대 Vera Rubin NVL72 시스템 옆에서 응답 생성 구간을 빠르게 처리하는 랙 단위 가속기다.
AI 클라우드 사업자 Nebius가 첫 도입사로 이름을 올렸으며 자사 추론 서비스 Token Factory에 LPX를 연결할 계획이다. 개발자와 기업 입장에서는 모델의 크기뿐 아니라 응답 속도와 긴 작업의 대기 시간이 AI 서비스 품질을 가르는 요소가 됐다는 뜻이다.
NVIDIA는 외부 벤치마크 기관 Artificial Analysis가 자사 데이터센터의 LPX 시스템을 측정한 결과도 함께 공개했다. 다만 양산 발표가 곧바로 일반 고객의 즉시 이용이나 실제 운영 비용 개선을 보장하는 것은 아니며, 가격과 공급 일정은 아직 확인해야 할 부분으로 남아 있다.
What Happened
Groq 3 LPX는 NVIDIA가 Groq 기술을 Vera Rubin 플랫폼에 결합해 만든 대화형 AI 추론 가속기다. NVIDIA는 이번 발표에서 제품 개발 단계를 넘어 양산에 들어갔다고 밝혔고, Nebius를 첫 AI 클라우드 도입사로 소개했다. Nebius는 개발자가 기존 추론 API를 통해 빠른 토큰 생성 성능을 이용할 수 있도록 Token Factory에 LPX를 배치할 계획이다.
에이전틱 AI는 질문 한 번에 답을 한 번 내놓는 데 그치지 않는다. 파일을 읽고, 도구를 호출하고, 결과를 검증한 뒤 다음 행동을 정하는 과정을 여러 차례 반복한다. 각 단계에서 모델이 토큰을 생성해야 하므로 한 번의 응답 차이는 작아 보여도 수백 번의 반복에서는 전체 작업 시간으로 누적된다. NVIDIA가 LPX를 '대화형 추론' 장비로 내세우는 이유다.
Key Details
LPX 한 랙에는 256개의 Groq 3 LP30 칩이 연결된다. NVIDIA가 공개한 시스템 사양은 FP8 기준 315 PFLOPS의 추론 연산 성능, 총 128GB SRAM, 초당 40PB의 칩 내부 SRAM 대역폭, 초당 640TB의 랙 내부 확장 대역폭이다. 핵심은 대용량 범용 메모리보다 컴파일러가 연산과 데이터 이동 시점을 미리 정하는 결정론적 실행 구조에 있다.
NVIDIA가 공개한 주요 측정 결과는 다음과 같다.
- Artificial Analysis의 10만 토큰 문맥 시험에서 Gemma 4 31B 모델은 초당 3,431개의 출력 토큰을 생성했다.
- 1만 토큰 문맥 시험의 중앙값은 초당 3,382개로 발표됐다.
- 코딩 과제용 공개 벤치마크 SPEED-Bench에서는 중앙값 초당 4,767개를 기록했다고 NVIDIA가 밝혔다.
- Artificial Analysis가 측정했지만, 시험 대상 시스템은 NVIDIA 데이터센터에 설치된 구성이다. NVIDIA가 자체 수행한 SPEED-Bench 결과와도 구분해 볼 필요가 있다.
이 숫자는 특정 모델과 구성에서 나온 생성 속도다. 모델 정확도, 동시 사용자 수, 전력 소비, 네트워크 지연까지 포함한 서비스 전체의 성능이나 비용을 그대로 나타내지는 않는다.
How the Architecture Works
대규모 언어 모델의 추론은 크게 입력을 읽고 계산하는 프리필(prefill)과 답을 한 토큰씩 만드는 디코드(decode)로 나눌 수 있다. Vera Rubin NVL72는 긴 입력 처리와 어텐션처럼 유연성과 대용량 메모리가 필요한 일을 맡고, LPX는 반복적인 토큰 생성에서 지연에 민감한 부분을 가속한다.
두 장비가 같은 일을 경쟁하는 방식이 아니라 각자 잘하는 구간을 나누는 이기종 구조인 셈이다. NVIDIA는 기본적인 프리필·디코드 분리 외에도 Rubin이 어텐션과 KV 캐시를 담당하고 LPX가 FFN 계층을 계산하는 방식, LPX가 작은 초안 모델을 먼저 실행한 뒤 Rubin이 결과를 검증하는 추측 디코딩 구성을 제시했다.
Core Lens
이번 발표의 핵심은 더 큰 범용 GPU 한 종류가 아니라, AI 응답 과정의 병목마다 다른 연산 장비를 배치하는 방향으로 추론 인프라가 바뀌고 있다는 점이다.
Why It Matters
그동안 AI 반도체 경쟁은 모델 학습에 필요한 GPU 수와 연산량에 집중됐다. 그러나 실제 서비스가 늘어나면 같은 전력과 서버 공간으로 얼마나 많은 요청을 빠르고 안정적으로 처리하는지가 중요해진다. 특히 코딩 에이전트나 음성 서비스처럼 응답을 기다리며 다음 행동을 수행하는 제품은 평균 처리량이 높아도 한 단계의 지연이 길면 사용성이 떨어진다.
LPX의 양산은 NVIDIA가 GPU 중심의 단일 가속 방식에서 CPU, GPU, LPU와 네트워크를 묶은 시스템 판매로 범위를 넓히고 있음을 보여준다. 클라우드 사업자는 작업 성격에 따라 장비를 나눠 운영할 수 있지만, 그만큼 스케줄링 소프트웨어와 랙 간 데이터 이동, 장애 대응은 복잡해진다. 개발자가 체감할 변화는 결국 Nebius 같은 사업자가 이 구성을 어떤 가격과 지연 보장 수준으로 제공하느냐에 달려 있다.
What To Watch
- Nebius가 LPX 기반 Token Factory 서비스를 실제로 제공하는 시점과 지원 모델
- 공개 API의 가격, 지연 보장 수준, 기존 애플리케이션의 이전 필요성
- 다양한 모델과 동시 사용자 조건에서 재현되는 독립 벤치마크
- 토큰 생성 속도뿐 아니라 전력, 랙 사용률, 첫 토큰 지연을 포함한 전체 비용
- 양산 물량과 일반 고객 공급 일정
현재 확인된 것은 NVIDIA의 양산 발표와 Nebius의 도입 계획이다. 실제 서비스가 시작된 뒤에는 홍보용 최고 속도보다 일정한 응답 시간, 모델 품질, 비용을 함께 비교해야 이번 구조의 효과를 판단할 수 있다.
Sources
- NVIDIA Groq 3 LPX, 에이전틱 AI 위한 세계적 수준의 속도로 본격 양산에 돌입하다
- NVIDIA Groq 3 LPX Now in Full Production With World-Class Speed for Agentic AI
- How NVIDIA Groq 3 LPX Unlocks Ultrafast Interactivity at Long Context on NVIDIA Vera Rubin
- Inside NVIDIA Groq 3 LPX: The Low-Latency Inference Accelerator for the NVIDIA Vera Rubin Platform