- 무슨 일: NVIDIA가 Vera Rubin NVL72의 에이전트형 AI 처리량 측정치를 공개했습니다.
- 왜 중요한가: ‘30배’는 칩 이름만 바꿔 비교한 숫자가 아니라, 특정 워크로드와 전력 기준을 둔 최대치입니다.
- 아직 모르는 것: 이 결과는 NVIDIA 측정치이며 SemiAnalysis 검토가 진행 중입니다.
NVIDIA 공식 발표와 기술 설명을 함께 보면, 숫자의 범위를 확인할 수 있습니다.
NVIDIA가 2026년 8월 24일 공개한 Vera Rubin NVL72의 ‘최대 30배’는 SemiAnalysis AgentX 에이전트형 코딩 워크로드에서 DeepSeek V4-Pro를 사용자당 160토큰/초 조건으로 처리할 때, GB300 NVL72보다 메가와트당 처리량이 높았다는 NVIDIA의 측정 결과입니다.

이번 발표가 눈에 띄는 이유는 일반적인 짧은 대화가 아니라 실제 코딩 에이전트의 긴 문맥, 도구 호출, 하위 에이전트 실행까지 보존한 세션을 비교 대상으로 삼았기 때문입니다. AI 인프라의 ‘더 빠르다’는 표현을 읽을 때도 어떤 작업을 재생했는지부터 봐야 하는 이유입니다.
다만 30배를 모든 모델과 모든 상황에 적용되는 성능 차이로 읽으면 안 됩니다. NVIDIA는 이 수치를 ‘최대’ 결과로 제시했고, SemiAnalysis 검토가 아직 끝나지 않았으며, Vera CPU의 도구 호출 성능은 이 초기 결과에 포함되지 않았다고 밝혔습니다.
30배는 무엇과 무엇을 비교한 값인가
비교의 한쪽은 Vera Rubin NVL72, 다른 한쪽은 NVIDIA GB300 NVL72입니다. 기준은 단순한 초당 토큰 수가 아니라 AI 팩토리가 같은 전력 예산에서 처리하는 에이전트형 작업량, 즉 메가와트당 처리량입니다.
NVIDIA 기술 블로그는 DeepSeek V4-Pro AgentX 시험에서 사용자당 160토큰/초의 상호작용 목표를 유지했을 때 Vera Rubin NVL72이 GB300 NVL72보다 최대 30배 높은 AI 팩토리 처리량을 냈다고 설명합니다. 따라서 숫자에는 모델, 상호작용 수준, 전력 기준이 함께 붙습니다.
여기서 메가와트당 처리량은 전력 제약이 있는 데이터센터가 같은 전력 예산으로 얼마나 많은 에이전트 작업을 처리할 수 있는지를 보는 지표입니다. 단일 요청의 응답 시간이 더 짧은지와는 같은 질문이 아니므로, 서비스 지연시간이나 전체 도입 비용을 한 숫자로 치환해서는 안 됩니다.
AgentX 워크로드가 일반 챗봇 시험과 다른 이유
AgentX는 SemiAnalysis의 InferenceX 안에서 에이전트형 코딩 추론을 다루는 벤치마크입니다. NVIDIA 설명에 따르면 재생되는 세션에는 긴 문맥의 입력 처리, KV 캐시 재사용, 도구 호출 사이의 간격, 동적으로 달라지는 동시성이 포함됩니다.
이 조건은 고정된 길이의 질문과 답변을 반복하는 시험보다 실제 에이전트 사용에 가깝다는 것이 NVIDIA의 설명입니다. 하지만 그 점이 곧바로 모든 기업의 배포 환경에서 같은 비율의 절감이 나온다는 뜻은 아닙니다.
발표 수치를 읽을 때 함께 확인할 세 가지
첫째, 비교 대상이 GB300 NVL72인지 이전 세대 시스템인지 확인해야 합니다. 둘째, 처리량인지 토큰 비용인지, 그리고 메가와트당 수치인지 지표를 구분해야 합니다. 셋째, 해당 수치가 어떤 모델·워크로드·상호작용 목표에서 나온 것인지 원문 표와 설명에서 확인해야 합니다.
NVIDIA는 같은 발표에서 Vera Rubin NVL72이 GB300 NVL72보다 최대 35배 낮은 백만 토큰당 비용을 보였다고도 적었습니다. 이 역시 AgentX와 공개된 조건 안의 NVIDIA 측정치이므로, 구매 비용이나 실제 운영비를 단정하는 근거로 확대하기보다 비교 범위를 확인하는 자료로 보는 편이 정확합니다.
결론: ‘30배’보다 먼저 읽어야 할 문장
이번 숫자의 핵심은 Vera Rubin NVL72이 GB300 NVL72보다 언제나 30배 빠르다는 선언이 아니라, AgentX의 DeepSeek V4-Pro 조건에서 메가와트당 처리량이 최대 30배였다는 NVIDIA의 초기 측정 공개입니다. 검토 상태와 측정 범위를 함께 보아야 이 발표를 과장 없이 읽을 수 있습니다.
세부 조건과 원문 그래프는 NVIDIA 공식 블로그 및 NVIDIA Technical Blog에서 직접 확인할 수 있습니다.