AI 서버를 설명할 때 가장 먼저 떠올리는 건 GPU야. 그런데 NVIDIA가 2026년 7월 21일 공개한 Vera Rubin 관련 자료에서 반복해서 강조한 건 GPU 한 장의 속도가 아니라, 수천~수십만 개 가속기가 서로 기다리지 않게 만드는 네트워크였어.12
NVIDIA는 이를 AI 팩토리라고 불러. 대규모 학습과 추론에서는 여러 가속기가 데이터를 계속 주고받고, 집단 통신 과정에서 한 링크가 느려지면 전체 작업이 멈출 수 있다는 설명이야. 그래서 이 규모에서는 최고 GPU 성능만으로 실제 처리 성능을 예측하기 어렵다는 게 발표의 출발점이지.1
Spectrum-6은 무엇을 바꾸려 하나
NVIDIA의 Spectrum-6은 102.4Tbps 대역폭을 내세운 이더넷 스위치 시스템이야. 회사는 이전 세대보다 용량이 2배이고, Vera Rubin 플랫폼의 일부로 설계됐다고 설명해. Spectrum-6 스위치 칩은 ConnectX-9 SuperNIC, 적응형 라우팅·혼잡 제어·텔레메트리·네트워크 소프트웨어와 함께 Spectrum-X 이더넷 플랫폼을 이뤄.12
여기서 중요한 건 부품 하나의 교체가 아니야. NVIDIA는 Vera CPU, Rubin GPU, NVLink 6 Switch, ConnectX-9 SuperNIC, BlueField-4 DPU, Spectrum-6 이더넷 스위치를 한 시스템으로 함께 설계했다고 말해. 서버와 네트워크를 따로 조립한 뒤 맞추는 방식보다, 칩·랙·소프트웨어를 처음부터 묶어 AI 작업의 데이터 흐름을 조정하겠다는 접근이야.12
NVIDIA가 말하는 수치도 이 지점에 붙어 있어. Spectrum-X는 상용 이더넷보다 최대 1.6배 높은 AI 네트워킹 성능과 10만 개가 넘는 GPU 배치에서 최대 95%의 네트워크 효율을 낸다고 발표했어. 또 하드웨어 가속 멀티플레인 토폴로지는 데이터센터에 필요한 스위치 수를 1.7배 줄일 수 있다고 설명해.1 이 숫자들은 NVIDIA의 자체 플랫폼 설명이지, 모든 환경에서 독립적으로 확인된 평균값은 아니야.
GPU만 빨라져서는 부족해
Vera Rubin 자료에서 CoreWeave는 DeepSeek-R1 벤치마크를 근거로 Grace Blackwell NVL72보다 메가와트당 초당 토큰 처리량이 10배 높았다고 밝혔어. NVIDIA는 이 지표가 같은 전력 예산에서 더 많은 추론을 하거나 같은 작업을 더 적은 전력으로 처리할 수 있는지를 보여준다고 설명해.2
다만 이 결과를 GPU 세대의 단순한 속도 차이로 읽기는 어려워. 같은 자료는 Vera Rubin NVL72의 260TB/s all-to-all NVLink 6 패브릭과 Spectrum-6 기반 스위칭 패브릭을 함께 소개해. 즉 발표가 보여주는 성능은 가속기, 랙 내부 연결, 랙 밖 scale-out 네트워크를 묶은 시스템 결과에 가까워.2
네트워크는 전력과 냉각 문제와도 이어져. Spectrum-6은 플러그형 광학 부품과 co-packaged optics를 지원하고 액체 냉각 설계를 포함해. NVIDIA는 자사의 포토닉스 구성에서 플러그형 트랜시버보다 전력 효율이 5배 높고 사고 사이 평균 시간이 10배 개선된다고 설명하지만, 이 역시 발표 주체가 제시한 비교야.12
아직 모르는 것
NVIDIA는 Vera Rubin이 30개국 350곳이 넘는 공장 사이트에서 생산을 확장하고 있으며, CoreWeave·Google Cloud·Microsoft Azure·Oracle Cloud Infrastructure 등에 랙이 가동 중이라고 밝혔어. Spectrum-6을 먼저 도입할 인프라 사업자로는 CoreWeave, Microsoft, Nebius, SpaceXAI, Tesla 등을 들었지.12
하지만 공개된 자료만으로는 각 사업자가 몇 개의 랙과 스위치를 어떤 조건으로 배치하는지, 네트워크 효율 수치가 어떤 모델·트래픽·토폴로지에서 나왔는지 알 수 없어. CoreWeave의 10배 벤치마크도 DeepSeek-R1, Vera Rubin NVL72, Grace Blackwell NVL72를 비교한 특정 측정 결과야. 모든 학습·추론 작업에 같은 차이가 난다는 뜻은 아니야.2
다음에 볼 것은 GPU의 다음 세대 발표가 아니야. 실제 AI 팩토리에서 메가와트당 토큰 처리량, GPU 집단 통신 중 네트워크 효율, 장애 복구 시간, 그리고 냉각·물 사용량이 함께 어떻게 기록되는지야. NVIDIA의 설명처럼 AI 시스템이 하나의 거대한 컴퓨터처럼 움직이려면, 계산 칩과 그 사이를 잇는 패브릭을 따로 떼어 보기 어려워질 테니까.
각주
-
NVIDIA/Scot Schultz, 「Built for Vera Rubin, NVIDIA Spectrum-6 Arrives in Gigascale AI Factories」(2026-07-21) NVIDIA Blog. ↩︎ ↩︎2 ↩︎3 ↩︎4 ↩︎5 ↩︎6 ↩︎7
-
NVIDIA, 「NVIDIA Vera Rubin Driving Performance Per Watt, Lowest Token Cost for Partners Worldwide」(2026-07-21) NVIDIA Blog. ↩︎ ↩︎2 ↩︎3 ↩︎4 ↩︎5 ↩︎6 ↩︎7 ↩︎8
댓글