델라웨어 대학교의 Aaron Jarmusch와 Sunita Chandrasekaran이 5세대 텐서 코어를 갖춘 NVIDIA의 Blackwell(B200)을 오픈소스 마이크로벤치마크 스위트로 직접 재봤어. 메모리 서브시스템·텐서 코어 파이프라인·부동소수점 정밀도(FP32/FP16/FP8/FP6/FP4)를 이전 세대 H200과 나란히 비교했어.1
결과부터 보면 이렇다. B200의 텐서 코어 개선은 ResNet-50 혼합정밀도 학습에서 H200 대비 1.85배, GPT-1.3B 학습에서 1.55배 처리량을 냈고, 에너지 효율은 32% 좋았어.1 이 논문은 2025년 12월 1일 처음 제출됐고, 2026년 3월 2일 세 번째 개정판(v3)까지 나왔어.2
두 개의 다이를 하나처럼 쓴다
B200 하나는 물리적으로 다이 두 개로 쪼개져 있어. 두 다이를 합치면 트랜지스터가 2080억 개, SM은 148개가 8개의 GPC에 나뉘어 있고, L2 캐시 파티션은 4개로 이전 세대(Hopper)의 두 배야. 여기에 HBM3e 메모리 스택 8개가 붙어.1
연산 명령도 바뀌었어. 이전 세대는 워프(32개 스레드 묶음)가 동기화된 뒤에야 행렬곱 명령을 실행했는데, Blackwell은 이걸 tcgen05.mma라는 스레드 단위 단일 명령으로 대체했어. 스레드마다 독립적으로 행렬곱 연산을 낼 수 있게 되면서 워프 수준 동기화가 사라졌어.1 실측 지연시간도 줄었어 — 같은 타일 크기(m64n64k16)에서 이전 명령(wgmma)은 32.0사이클이 걸렸는데 tcgen05.mma는 11.0사이클이면 끝났어.1 이 연산이 쓰는 데이터는 SM마다 256KB씩 붙은 전용 온칩 메모리 TMEM에 담기는데, 64×64 크기 타일에서 가장 효율이 좋아.1
정밀도를 낮추면 빨라지지만 공짜는 아니다
정밀도별로 재보면 격차가 뚜렷해. FP8 텐서 코어 연산은 3850.6 TFLOPS로 이론 최대치의 96.3%까지 올라갔고, H200보다 1.27배 빨랐어.1 반대로 정밀도를 섞어 쓰면 병목이 생겨 — FP16 입력에 FP32 누산기를 쓰면 처리량이 964.8에서 482.4 TFLOPS로 정확히 절반이 돼.1
실제 LLM 추론에서도 같은 그림이 보여. Mistral-7B를 FP16으로 돌리면 B200이 초당 56,028토큰, H200은 28,500토큰으로 1.97배 차이가 났고, Mixtral-8x7B는 B200 31,033토큰 대 H200 18,100토큰으로 1.71배였어.1 여기서 정밀도를 FP4까지 낮추면 Mixtral-8x7B는 FP16 대비 2.69배 처리량(76,900 대 31,033토큰)으로 뛰어.1 다만 공짜는 아니야 — 모델 정확도를 뜻하는 퍼플렉시티가 FP8에서는 1.9~2.4%, FP4에서는 7.7~9.1% 늘어난다고 논문은 밝혀.1
배정밀도 연산과 메모리 대역폭은 또 다른 이야기
정수·배정밀도 연산(FP64)에서는 격차가 좁아져. B200은 대형 행렬 기준 36.3 TFLOPS로 이론 최대치(40 TFLOPS)의 80.7%를 냈고, H200은 18.9 TFLOPS로 이론 최대치(34 TFLOPS)의 55.6%에 그쳤어.1 메모리 대역폭은 4~16GB 작업셋 기준 STREAM Triad 벤치마크에서 약 4.14TB/s로, 이론 최대 대역폭(8TB/s)의 52% 수준이었어.1
배율은 하나가 아니다
논문 저자들은 TMEM·듀얼모드 텐서 코어·압축 엔진이 트랜지스터 수를 늘리는 대신 1.5~3.9배의 성능 이득을 준다고 평가해.1 이 논문이 보여주는 것도 하나의 배율이 아니야. FP8 텐서 코어는 1.27배, LLM 추론은 1.71~1.97배, FP4 양자화는 2.69배로 정밀도와 워크로드마다 숫자가 갈려. 어떤 배율을 볼 때는 “무엇을 어떤 정밀도로 쟀는지”부터 확인해야 하는 이유가 여기 있어.
각주
-
Aaron Jarmusch, Sunita Chandrasekaran, 「Microbenchmarking NVIDIA’s Blackwell Architecture: An in-depth Architectural Analysis」(arXiv:2512.02189) 논문 원문 ↩︎ ↩︎2 ↩︎3 ↩︎4 ↩︎5 ↩︎6 ↩︎7 ↩︎8 ↩︎9 ↩︎10 ↩︎11 ↩︎12 ↩︎13 ↩︎14
-
Aaron Jarmusch, Sunita Chandrasekaran, 「Microbenchmarking NVIDIA’s Blackwell Architecture: An in-depth Architectural Analysis」(arXiv:2512.02189, v3 2026-03-02) 초록 페이지 ↩︎
댓글