Date: 2026-09-17 Topic: AI Infrastructure Primary source: NVIDIA, MLCommons
엔비디아는 2026년 9월 16일 차세대 AI 시스템 ‘Vera Rubin NVL72’의 첫 MLPerf Inference 결과를 공개했다. 프리뷰 제출에서 Qwen3-VL 처리량은 기존 GB300 NVL72보다 최대 3.7배, DeepSeek-R1 처리량은 최대 2.5배 높았다고 밝혔다.
같은 날 벤치마크 운영기관 MLCommons도 Inference v6.1 결과를 발표했다. 이번 회차에는 30개 기관이 참여했고, Vera Rubin은 아직 출시 전 또는 초기 단계 장비를 뜻하는 프리뷰 시스템으로 분류됐다.
따라서 이번 결과는 완제품의 가격이나 전력 효율까지 확정한 평가는 아니다. 다만 차세대 AI 인프라가 단순히 GPU 수를 늘리는 방식에서 벗어나, 칩과 메모리·연결망·추론 소프트웨어를 함께 최적화하는 방향으로 가고 있음을 보여준다.
What Happened
MLPerf Inference는 학습이 끝난 AI 모델이 실제 요청을 얼마나 빠르게 처리하는지 측정하는 업계 공통 벤치마크다. 운영 주체인 MLCommons는 특정 칩 구조에 유리하지 않도록 규칙과 정확도 기준, 측정 방식을 공개하고 제출 결과를 검토한다.
이번 v6.1에서 엔비디아는 72개의 GPU가 하나의 랙 시스템으로 연결된 Vera Rubin NVL72의 프리뷰 결과를 처음 제출했다. 비교 대상은 현재 세대인 GB300 NVL72였으며, 두 시스템 모두 대규모 언어·비전 모델의 추론 성능을 중심으로 시험됐다.
엔비디아가 강조한 수치는 다음과 같다.
| 시험 항목 | 엔비디아가 밝힌 비교 결과 | 사용한 주요 소프트웨어 |
|---|---|---|
| Qwen3-VL | GB300 NVL72 대비 처리량 최대 3.7배 | vLLM, NVIDIA Dynamo |
| DeepSeek-R1 | GB300 NVL72 대비 처리량 최대 2.5배 | TensorRT-LLM |
| GB300 4개 랙 확장 | 288개 GPU에서 99% 확장 효율 | 랙 간 네트워킹·요청 분산 |
| GB300 소프트웨어 개선 | v6.0보다 일부 시험에서 최대 1.6배 | 캐시 정밀도 조정, 커널 융합 등 |
Key Details
Qwen3-VL은 글과 이미지를 함께 이해하는 비전·언어 모델이고, DeepSeek-R1은 여러 단계를 거쳐 답을 찾는 추론형 모델이다. 생성형 AI 서비스가 단순 문장 생성에서 이미지 이해와 복잡한 추론으로 넓어지면서, 두 작업은 데이터센터의 실제 부담을 가늠하는 중요한 시험 항목이 됐다.
Vera Rubin 시스템은 계산을 시작하는 ‘프리필’ 단계와 토큰을 연속 생성하는 ‘디코드’ 단계를 나눠 처리했다. 여러 전문가 모델 가운데 필요한 일부만 동작시키는 MoE 구조도 대규모 병렬 처리했다. 엔비디아는 향상된 텐서 코어, NVFP4 저정밀 연산, 6세대 NVLink와 소프트웨어 최적화가 함께 성능 차이를 만들었다고 설명한다.
MLCommons의 전체 발표도 함께 볼 필요가 있다.
- v6.1에는 역대 가장 많은 30개 기관이 결과를 제출했다.
- Rubin과 Vera Rubin NVL72는 프리뷰 시스템으로 등록됐다.
- 검색·재정렬·생성을 묶어 평가하는 종단 간 RAG 시험이 새로 추가됐다.
- 엣지 기기에서 여러 차례 대화를 이어 가며 코딩 문제를 푸는 에이전트형 추론 시험도 도입됐다.
- MLCommons가 발표한 회차 전체 최고 개선 폭은 DeepSeek-R1의 GPU당 서버 성능 기준으로 1년 전보다 5.7배였다. 이는 특정 업체 한 곳이 아니라 해당 시험의 전체 제출 결과를 비교한 수치다.
How to Read the Benchmark
‘최대 3.7배’는 Vera Rubin이 모든 AI 작업에서 항상 3.7배 빠르다는 뜻이 아니다. Qwen3-VL의 오프라인·서버·대화형 시나리오에서 나온 최대 비교치이며, 모델과 지연시간 조건, 배치 방식이 달라지면 결과도 달라질 수 있다.
또한 프리뷰 제출은 정식 판매 시스템의 비용과 운영 조건을 그대로 보여주지 않는다. 이번 공개 자료만으로는 랙 가격, 실제 전력 사용량, 냉각 비용을 포함한 ‘토큰당 총비용’을 판단하기 어렵다. MLPerf는 동일 규칙 아래 처리량을 비교하는 데 강점이 있지만, 기업이 체감하는 경제성은 하드웨어 가격과 전력, 모델 품질, 가동률을 함께 봐야 한다.
Core Lens
이번 결과의 핵심은 GPU 한 개의 속도보다, 72개 가속기와 메모리·네트워크·추론 소프트웨어를 하나의 시스템처럼 맞추는 능력이 AI 인프라 경쟁의 중심이 됐다는 데 있다.
What It Means
AI 서비스 사업자에게 처리량 증가는 같은 시간에 더 많은 이용자 요청을 처리하거나, 복잡한 추론을 더 낮은 비용으로 제공할 가능성을 뜻한다. 특히 에이전트형 AI는 한 번의 질문에도 검색과 도구 호출, 검증을 반복하므로 기존 챗봇보다 훨씬 많은 추론 연산을 요구한다. 하드웨어와 소프트웨어를 함께 최적화하려는 이유가 여기에 있다.
다만 엔비디아가 칩부터 랙 연결망, 추론 프레임워크까지 수직으로 묶을수록 고객은 높은 성능과 함께 플랫폼 의존성도 검토해야 한다. MLPerf에 AMD·인텔·구글과 여러 서버 업체가 참여하는 이유 역시 단일 회사의 발표가 아니라 공통 조건의 결과를 통해 선택지를 비교하기 위해서다.
What To Watch
- 프리뷰 결과가 실제 공급 가능한 시스템의 결과로 이어지는지
- 경쟁 가속기와 동일 모델·동일 지연시간 조건에서 어느 정도 차이가 나는지
- 처리량뿐 아니라 랙 전체 전력과 냉각을 포함한 비용 지표가 공개되는지
- 새 RAG·에이전트 시험이 실제 기업용 AI 작업을 얼마나 잘 반영하는지
- v6.1 제출 코드와 세부 설정을 외부에서 재현했을 때 비슷한 결과가 나오는지
Vera Rubin의 첫 성적은 차세대 추론 인프라의 잠재력을 보여주는 신호다. 그러나 구매 판단에 필요한 답은 ‘최고 속도’ 하나가 아니라, 같은 품질의 결과를 얼마의 전력과 비용으로 안정적으로 제공하느냐에서 나올 것이다.