에이전트가 답을 낼 때는 토큰을 한 개씩 순서대로 뱉어. 이 과정을 디코드라고 하는데, 여기서 지연이 조금만 생겨도 여러 단계를 거치는 작업 전체에서 그 지연이 쌓여.1 NVIDIA는 이 문제를 풀려고 GPU 옆에 토큰 생성만 전담하는 가속기를 붙였어. 이름은 NVIDIA Groq 3 LPX고, 지난 8월 24일 완전 양산에 들어갔다고 발표했어.1

Groq 3 LPX가 하는 일

Groq 3 LPX는 NVIDIA의 Vera Rubin NVL72 랙과 함께 설계된 저지연 추론 아키텍처야.1 역할을 나눠서 봐야 이해가 빨라. Rubin GPU는 긴 컨텍스트를 읽어들이는 대규모 처리를 맡고, LPX는 그다음 토큰을 하나씩 뱉는 디코드 작업을 맡아.1 랙 하나에는 칩투칩으로 직접 연결된 LP30 가속기 256개가 들어갈 수 있어.1

성능은 Artificial Analysis의 벤치마크로 확인됐어. 오픈소스 에이전틱 모델 Gemma 4 31B를 10만 토큰짜리 롱컨텍스트로 돌렸을 때 초당 3,400개의 토큰을 냈고, 이건 가장 가까운 대안 플랫폼보다 4배 빠른 수치야.1 10만 토큰이면 에이전트가 여러 턴에 걸쳐 도구를 호출하고 문서를 참조하는 실제 작업 규모에 가깝다는 뜻이고, NVIDIA는 이 조건을 골라서 벤치마크를 냈어.

누가 먼저 쓰나

발표에 이름을 올린 채택사는 셋이야. Nebius가 Groq 3 LPX를 도입한 첫 AI 클라우드고, 자사 Token Factory에 Vera Rubin NVL72와 함께 얹어 개발자용 에이전트·코딩 도구의 응답 속도를 끌어올린다는 계획이야.1 CoreWeave는 Vera Rubin 랙을 여러 개 연결하는 Spectrum-X Multiplane을 이미 프로덕션에 배포했어.1 SpaceXAI는 지구 데이터센터부터 궤도 위성까지 미래 아키텍처를 Vera Rubin 중심으로 짓겠다고 밝히면서, 오케스트레이션·툴 사용·코드 실행·데이터 처리·시뮬레이션 같은 CPU 집약 작업을 가속할 Vera CPU를 배치할 계획이라고 했어.1

네트워크도 한 단 늘리지 않고 커진다

Groq 3 LPX가 칩 쪽 이야기라면, Spectrum-X Multiplane은 그 칩들을 잇는 네트워크 이야기야. 지금까지 AI 팩토리를 최대 규모 클러스터 너머로 키우려면 보통 네트워크 계층을 하나 더 추가해야 했고, 그럴 때마다 지연·비용·케이블링 복잡도가 같이 늘었어.1 Spectrum-X Multiplane은 서버 하나의 네트워크 연결을 여러 개의 독립된 경로(“plane”)로 쪼개는 방식으로 이 문제를 피해가. 각 plane이 자기 몫의 2계층 네트워크를 따로 돌리기 때문에, 세 번째 계층 없이도 최대 51만 2천 개 GPU까지 평평한 네트워크로 확장돼.1

이 전환은 자동으로 일어나. ConnectX SuperNIC 안의 전용 하드웨어 엔진이 여러 plane에 걸친 트래픽을 관리하고 장애가 나면 즉시 우회 경로를 잡아. 8-plane 구성에서 plane 하나가 죽어도 네트워크는 전체 대역폭의 약 90%를 유지하고, 이 하드웨어 복구는 소프트웨어 기반 방식보다 11배 빠르다는 게 NVIDIA 설명이야.1 이 구조로 얻는 이득을 NVIDIA는 AI 팩토리 산출량 1.6배로 표현했어.1

스위치 쪽 스펙도 나왔어. Spectrum-X SN6000 시리즈는 102.4Tb/s급 Spectrum-6 이더넷 ASIC과 ConnectX-9 SuperNIC을 기반으로 GPU당 최대 1,600Gb/s를 지원해.1 데이터센터 하나를 넘어서는 확장도 준비돼 있어 — Spectrum-XGS Ethernet은 여러 시설을 하나의 AI 슈퍼팩토리처럼 묶어서 사이트 간 NCCL collective 연산을 1.9배 가속한다고 밝혔어.1

다섯 번째 축, Scale-In

같은 자리에서 NVIDIA는 NVIDIA Scale-In이라는 새 인프라 계층도 소개했어. 컴퓨트·네트워킹·스토리지·보안에 이어 NVIDIA AI 네트워킹의 다섯 번째 축으로 부르는 이 계층은, 전통적으로 남북(north-south) 방향 접근 네트워크가 처리하던 보안·관리·운영 서비스를 가속하는 데 목적이 있어.1 BlueField-4 프로세서와 DOCA 소프트웨어를 기반으로 Spectrum-X Ethernet에 연결되는 구조야.1 NVIDIA는 이걸로 멀티테넌트 네트워킹, 고성능 스토리지 접근, 실시간 관측을 인프라 처리 전용 실리콘에서 처리해 호스트 컴퓨트 자원과 분리하겠다고 설명해.1

이번 발표에는 커스텀 XPU를 NVIDIA 인프라에 연결하는 NVLink Fusion 소식도 함께 나왔는데, 그 내용은 다른 글에서 이미 정리했어.

다음에 볼 것

지금까지 나온 건 발표와 3400토큰/초라는 벤치마크 숫자 하나뿐이야. 다음으로 확인할 건 두 가지야. 하나는 Nebius Token Factory에서 실제 서비스로 나온 Groq 3 LPX의 응답 속도가 이 벤치마크와 얼마나 가까운지, 다른 하나는 CoreWeave의 Spectrum-X Multiplane 프로덕션 배포가 8-plane 구성이 약속한 90% 대역폭 유지·11배 빠른 장애 복구를 실제 트래픽에서도 보여주는지야.

각주

  1. NVIDIA, 「With Groq 3 LPX in Full Production, NVIDIA Extends Vera Rubin Inference for Agents」(2026-08-24) NVIDIA 블로그 ↩︎ ↩︎2 ↩︎3 ↩︎4 ↩︎5 ↩︎6 ↩︎7 ↩︎8 ↩︎9 ↩︎10 ↩︎11 ↩︎12 ↩︎13 ↩︎14 ↩︎15 ↩︎16 ↩︎17 ↩︎18