GPU 세대가 바뀔 때마다 회사가 내놓는 배율은 늘 화려해. NVIDIA는 Blackwell Ultra가 이전 세대 대비 에이전틱 AI에서 최대 50배 빠르고 비용은 35분의 1이라고 말해.1 그런데 독립 연구자가 같은 칩을 직접 벤치마크로 재면 그 배율은 다르게 나와 — 델라웨어 대학교 연구진이 Blackwell(B200)을 이전 세대 H200과 비교한 결과는 혼합정밀도 처리량 1.56배, 에너지 효율 42% 개선이었어.2 숫자가 다른 건 거짓말이 아니라 재는 대상이 다르기 때문이야 — 하나는 특정 에이전틱 워크로드의 최적 시나리오, 다른 하나는 정밀도 전반을 포괄하는 마이크로벤치마크야.
이 글은 Blackwell을 두 문서로 짚어. NVIDIA가 스스로 설명하는 아키텍처의 뼈대와, 그 뼈대를 실측으로 검증한 외부 논문이야.
| 항목 | 내용 |
|---|---|
| 개발사 | NVIDIA |
| 세대 | 5세대 Tensor Core 아키텍처, 코드명 B2002 |
| 제조 공정 | [[Entities/tsmc |
| 트랜지스터 | 다이 2개 합산 2080억 개12 |
| 메모리 | HBM3e 8스택, 통합 192GB2 |
| 대표 시스템 | GB200 NVL72, GB300 NVL72, DGX SuperPOD, DGX Spark1 |
| 주요 클라우드 배치 | [[Entities/microsoft |
다이 두 개를 하나의 GPU처럼 묶는 설계
Blackwell의 출발점은 물리적으로 쪼갠 칩을 소프트웨어에는 하나로 보이게 만드는 것이야. GPU 한 개가 두 개의 reticle-limited 다이로 이뤄지고, 이 둘을 10TB/s 칩투칩 인터커넥트로 연결해 단일 GPU로 묶어.1 델라웨어대 논문은 이 구조를 더 뜯어봐 — 다이 두 개를 합쳐 148개의 SM이 8개 GPC에 나뉘어 있고, L2 캐시 파티션은 4개로 이전 세대 Hopper의 2배이며, 이 모든 걸 NV-HBI라는 링크가 물리적으로는 나뉜 두 다이를 소프트웨어에 하나의 일관된 장치로 보이게 한다고 확인했어.2
연산 코어 안에서도 구조가 바뀌었어. 이전 세대(Volta·Ampere·Hopper)는 워프 안의 스레드 32개가 동기화된 뒤에야 행렬곱 명령(mma.sync·wgmma)을 실행했는데, Blackwell은 이 워프 동기화 방식을 tcgen05.mma라는 스레드 단위 단일 명령으로 대체했어 — 스레드마다 독립적으로 행렬곱 연산을 발행할 수 있게 됐다는 뜻이야.2 연산에 쓰는 데이터도 새 경로를 얻었어. SM마다 256KB짜리 전용 온칩 메모리인 텐서 메모리(TMEM)를 두고, 캐시가 빗나가는 상황에서도 종단 간 접근 지연이 420클록 사이클로 Hopper의 1000사이클 대비 58% 줄었어.2 TMEM은 SM당 읽기 16TB/s·쓰기 8TB/s 대역폭을 내는데, 이는 기존 ld.global 경로가 L1/L2를 거치며 3.8TB/s에서 정체되는 것과 비교해 실측 2.1배 개선이야.2
숫자를 다루는 정밀도 쪽도 넓어졌어. Blackwell의 Transformer Engine은 micro-tensor scaling 기법으로 4비트 부동소수점(FP4) 연산을 지원하고,1 델라웨어대 실측에서는 정밀도가 177배(FP64 44.8 TFLOPS 대 FP4 7702.5 TFLOPS) 벌어져도 명령 지연시간 차이는 1.27배(11.2~14.2사이클)에 그쳤어 — 처리량은 정밀도를 낮출수록 크게 벌지만, 지연시간은 거의 안 줄어든다는 뜻이야.2 다만 정밀도를 낮추는 데는 대가가 있어 — FP8은 모델의 perplexity를 1.9~2.4% 늘리고 FP4는 7.7~9.1% 늘려.2
메모리에서 압축을 푸는 일도 전용 하드웨어로 넘어갔어. Blackwell은 전용 하드웨어 압축 해제 엔진(Decompression Engine)을 도입했는데, 이전 세대 H100은 이 작업을 소프트웨어로만 했어.2 포맷별 처리량은 42~462GB/s로 편차가 크고, 정수 데이터에 최적화된 Bitcomp 포맷이 462.4GB/s의 출력과 0.227ms의 최소 지연시간으로 가장 빨랐어.2 이 엔진은 Grace CPU와 900GB/s 양방향 대역폭으로 연결돼 있어, 데이터베이스 질의처럼 메모리 접근이 많은 작업의 파이프라인 전체를 가속해.1
왜 중요한가 — 학습 최대화에서 추론 효율로
Hopper까지의 세대는 대형 모델을 학습시키는 초당 연산량(FLOPS)을 최대화하는 데 초점을 맞췄지만, Blackwell은 방향을 바꿔 학습 이후의 추론 효율을 겨눠.2 이 방향 전환은 개별 GPU 성능이 아니라 GPU를 몇 개나 하나의 도메인으로 묶을 수 있는가로도 이어져. 5세대 NVLink 인터커넥트는 최대 576개 GPU까지 확장하고,1 NVLink Switch Chip은 72-GPU 도메인(NVL72) 안에서 130TB/s의 GPU 대역폭을 내며 단일 8-GPU 시스템 대비 9배의 GPU 처리량을 지원해.1 GB200 NVL72는 이 구조를 실제 랙으로 구현한 제품으로, Grace CPU 36개와 Blackwell GPU 72개를 액체 냉각 랙 하나로 묶어.1
이 방향 전환이 실제로 쓰이는 자리도 확인돼 — Microsoft·CoreWeave·Oracle Cloud Infrastructure가 저지연·긴 컨텍스트가 필요한 에이전틱 코딩 같은 용도로 GB300 NVL72 시스템을 대규모로 배치하고 있어.1
이 대상을 볼 때의 핵심 축
- 정밀도별 처리량과 지연시간을 분리해서 본다. FP4·FP8 채택 소식이 나오면, 그 워크로드가 처리량 이득이 큰 자리인지(정밀도를 낮출수록 크게 벌기 때문에) 아니면 지연시간이 병목인 자리인지(정밀도를 낮춰도 별로 안 줄기 때문에)를 갈라서 봐야 이득의 실체가 보여.
- NVIDIA의 배율과 독립 벤치마크의 배율을 같은 저울에 올리지 않는다. 회사가 발표하는 수치(50배·65배·30배류)는 특정 워크로드의 최적 시나리오이고, 독립 실측(1.56배·2.5~2.69배류)은 더 포괄적인 조건에서 잰 값이야. 둘 다 거짓은 아니지만 같은 것을 재지 않는다.
- NVL72·NVL576 같은 도메인 규모 확산을 클라우드 배치 소식으로 추적한다. GPU 개별 성능보다 몇 개를 하나의 저지연 도메인으로 묶어 파는지가 에이전틱 AI 인프라 전환 속도를 보여주는 지표야.
- 압축 해제·메모리 접근 같은 비-연산 병목의 개선치를 따로 챙긴다. Decompression Engine·TMEM처럼 겉으로 잘 안 보이는 구조가 실제로는 데이터 이동 병목을 풀어주는 몫이 커.
헷갈리지 말아야 할 점
Blackwell 관련 소식에서 나오는 “50배”, “65배”, “35분의 1 비용” 같은 배율을 보면 이게 이 칩 전체의 일반적인 성능 향상이라고 오해하기 쉬워. 하지만 이 수치들은 NVIDIA가 에이전틱 AI라는 특정 워크로드를 기준으로 이전 세대(Hopper) 시스템과 비교한 값이야.1 독립적으로 여러 정밀도·워크로드를 포괄해 잰 델라웨어대 벤치마크에서는 같은 세대 비교에서 혼합정밀도 처리량 1.56배, LLM 추론에서 FP8 기준 1.73배·FP4 기준 2.5~2.69배 같은 훨씬 좁은 배율이 나왔어.2 맞는 그림은 이렇다 — 회사가 내놓는 배율은 최적 조건의 상한선이고, 실제 워크로드에서 체감하는 개선폭은 그보다 좁게, 정밀도와 작업 종류에 따라 갈린다.
이어서 읽기
Blackwell을 만드는 회사의 사업 구조와 수출통제 리스크는 NVIDIA에서 다룬다.
남은 질문들
- Blackwell 세대가 NVIDIA 매출에서 차지하는 비중과 GB200·GB300의 실제 출하 규모는 얼마나 될까.
- 다음 세대 Rubin 플랫폼은 Blackwell의 어떤 구조(TMEM·DE·NVLink 도메인)를 이어받고 무엇을 바꿀까.
- AMD MI300 계열 같은 경쟁 가속기와 견줬을 때 이 독립 벤치마크의 배율은 어떻게 달라질까.
각주
-
NVIDIA, 「NVIDIA Blackwell Architecture」(2026-08-18 확인) 공식 아키텍처 페이지 ↩︎ ↩︎2 ↩︎3 ↩︎4 ↩︎5 ↩︎6 ↩︎7 ↩︎8 ↩︎9 ↩︎10 ↩︎11
-
Aaron Jarmusch·Sunita Chandrasekaran(델라웨어 대학교), 「Microbenchmarking NVIDIA’s Blackwell Architecture: An in-depth Architectural Analysis」(2026-08-23 확인) arXiv ↩︎ ↩︎2 ↩︎3 ↩︎4 ↩︎5 ↩︎6 ↩︎7 ↩︎8 ↩︎9 ↩︎10 ↩︎11 ↩︎12 ↩︎13 ↩︎14
댓글