NVIDIA가 Hot Chips 2026 무대에서 다음 세대 GPU인 Rubin을 공개했어. 근데 이번 발표는 칩 하나를 소개하는 자리가 아니었어. NVIDIA는 GPU부터 네트워크, 전력, 유지보수까지 랙 전체를 다시 설계했다고 말했고, 그 이유로 든 게 하나야. 에이전틱 AI.1

에이전틱 AI는 지금까지 NVIDIA가 겨냥한 워크로드 중 가장 복잡하다는 게 회사 설명이야. 관찰하고, 추론하고, 행동하는 과정을 LLM·CPU·DPU·오케스트레이션·보안·메모리·네트워킹에 걸쳐 이어붙이는 일이거든.1 이 넓이가 실리콘만이 아니라 플랫폼 전체를 다시 짜야 하는 이유라는 거야.

왜 벤치마크부터 다시 짜야 하나

기존 추론 워크로드는 예측 가능한 입출력에 맞춰 하드웨어를 고정 튜닝하면 됐어. 에이전틱 워크로드는 다르지. 도구 호출이 섞이고, 시퀀스 길이가 매 턴 바뀌고, 하나의 작업이 여러 턴에 걸쳐 이어져. 입력 시퀀스 길이도 1천~3만2천 토큰 범위에서 10만~40만 토큰 범위로 늘어났어.1 짧고 고정된 프롬프트에 맞춰 튜닝된 하드웨어로는 감당이 안 되는 길이야.

확인된 스펙

랙의 이름은 Vera Rubin NVL72야. NVIDIA는 이걸 7개 칩과 5개 랙에 걸친 “풀스택 AI 팩토리 플랫폼”이라고 부르는데, Vera CPU·Rubin GPU·BlueField-4·Spectrum-6에 Blackwell 세대에는 없던 Groq LPU까지 얹었어.1

Rubin GPU 자체 스펙은 이래. NVFP4 추론 기준 2 ZFLOPS, NVFP4 학습 기준 1.4 ZFLOPS, 여기에 11PB의 HBM4 메모리와 800PB/s 대역폭을 100MW 규모의 AI 팩토리 단위로 묶었어.1 NVLink 6세대와 NVLink-C2C, 5세대 x16 PCIe 호스트 인터페이스를 함께 쓴다는 것도 확인돼.1

연산을 줄이는 쪽도 손을 봤어. Rubin은 2:4 sparsity 포맷으로 트랜스포머 블록의 QKV·attention projection·MLP feed-forward 레이어에서 값이 거의 0인 항목을 건너뛰어.1 GPU 간 동기화 방식도 바뀌었어. Blackwell까지 쓰던 MEMBAR 방식(플래그를 폴링하고 갱신하는 방식) 대신 counted-write 기반 동기화로 NVLink 지연을 줄였다는 게 확인된 부분이야.1

스케일업 쪽 수치도 나왔어. 6세대 NVLink는 72개 GPU를 하나의 스케일업 도메인으로 묶고, GPU당 3.6TB/s의 all-to-all 대역폭을 낸다는 게 스펙이야.1 랙 바깥의 오픈 플랫폼 쪽도 확장됐어. 3세대 MGX 플랫폼에는 80개 넘는 파트너사가 30개국 350곳 넘는 사이트에서 참여하고 있고, 이 랙은 45도 액체 냉각과 800V 직류, 리타이머 없는 핫스왑 케이블-프리 트레이 구조를 쓴다는 것도 확인돼.1

전력 쪽 수치는 이래. NVIDIA는 Vera Rubin NVL72 랙에서 LLM 학습 시 최대 전력을 13% 줄이고, 공급 전력당 GPU 수를 최대 40% 늘릴 수 있다고 밝혔어.1 장애 대응 쪽에도 2세대 RAS 엔진(RIST)이 들어갔는데, 워크로드를 멈추지 않고 GPU 상태 점검을 할 수 있다는 게 확인된 변화야 — 1세대는 점검하려면 노드 전체를 몇 시간씩 꺼야 했거든.1

NVIDIA가 주장하는 것

여기부터는 NVIDIA가 자체적으로 낸 배율이야. 회사가 공개한 그래프에서 Vera Rubin NVL72는 MW당 토큰 처리량 기준으로 Blackwell NVL72보다 위, Hopper NVL8 세대보다 훨씬 위에 놓여.1 NVIDIA는 sparse attention 경로 덕분에 SoftMax·BMM2 연산이 약 2배 빨라지고, 이더넷 스케일업과 비교하면 지연은 10배 낮고 in-network compute는 130 TFLOPS 늘어난다고도 주장해.1

가장 큰 숫자는 서드파티 인용에서 나와. NVIDIA는 SemiAnalysis의 벤치마크를 근거로, DeepSeek-v4-PRO를 14만 토큰 넘는 컨텍스트로 돌리는 AgentX 워크로드에서 Vera Rubin NVL72가 GB300 NVL72 대비 MW당 토큰 처리량을 10배, 최대 30배까지 끌어올렸다고 말해.1 다만 이 수치가 나온 조건과 실제 출하 후 재현 여부는 발표문에 나와 있지 않아 — 지금은 NVIDIA가 고른 벤치마크와 고른 조건 위에서 나온 수치라는 것만 확실해.

컴퓨트 트레이 얘기도 마찬가지야. NVIDIA는 케이블과 팬이 없는 새 트레이가 GB200 NVL72 트레이보다 첫 토큰 도달 시간과 평균 장애 간격을 개선한다고 밝혔는데, 이 역시 회사의 설명이지 독립 측정치는 아니야.1

각주

  1. ServeTheHome, 「NVIDIA Vera Rubin NVL72 Rack at Hot Chips 2026」(2026) 원문 ↩︎ ↩︎2 ↩︎3 ↩︎4 ↩︎5 ↩︎6 ↩︎7 ↩︎8 ↩︎9 ↩︎10 ↩︎11 ↩︎12 ↩︎13 ↩︎14 ↩︎15 ↩︎16