이 문서는 자라는 중인 질문입니다. 아직 증거를 모으고 있으며, 내용이 바뀔 수 있습니다.

GPU는 작은 칩 수천 개를 케이블로 엮어 하나의 컴퓨터처럼 쓴다. Cerebras는 그 반대를 택했어 — 실리콘 웨이퍼 한 장을 통째로 잘라내지 않고 칩 하나로 쓴다. Cerebras는 최신 시스템 CS-4를 “업계에서 가장 빠른 AI 가속기”라 자칭해.1 2015년 창업 이후 이 발상 하나를 밀어붙여 왔는데,2 지금은 위험 요인 공시에서 스스로 밝혔듯 OpenAI를 포함한 소수 고객에게 크게 의존하는 구조이기도 해.1

이 회사를 계속 지켜볼 이유는 두 갈래야. 하나는 웨이퍼 스케일이라는 설계가 실제로 GPU 클러스터의 통신 병목을 없애는지, 다른 하나는 그 속도를 사겠다는 고객이 몇 곳으로 좁혀져 있는지다.

기본 정보 표

항목내용
설립2015년2
창업자Andrew Feldman, Gary Lauterbach, Michael James, Sean Lie, Jean-Philippe Fricker2
CEOAndrew Feldman(공동창업자)2
최신 시스템CS-4 — 2026-08 공개, 랙 스케일 플랫폼 Nexus 기반 첫 시스템1
로드맵CS-5(2027년 목표), CS-61
주요 고객(위험 요인 공시 기준)OpenAI, Group 42 Holding, Mohamed bin Zayed University of Artificial Intelligence, AWS1

웨이퍼 한 장으로 버티는 이유

Andrew Feldman·Gary Lauterbach·Michael James·Sean Lie·Jean-Philippe Fricker가 웨이퍼 스케일 컴퓨팅을 상용화하겠다는 목표로 2015년 Cerebras를 창업했고,2 2019년 첫 제품인 WSE-1 칩과 CS-1 시스템을 출시해 데이터센터에 기술을 공급하기 시작했어.2 2024년에는 WSE-3 칩과 CS-3 시스템을 냈고,2 지난주 Supernova 2026에서 최신 시스템 CS-4를 공개했어.1

CS-4의 핵심은 전력을 웨이퍼까지 나르는 거리야. 기존 GPU 시스템은 전력 변환기를 실리콘에서 약 50밀리미터 떨어진 곳에 두는데, CS-4는 AC/DC 변환기를 웨이퍼에서 약 0.5밀리미터 거리에 둔다 — GPU 대비 100분의 1 거리다.1 이 설계로 CS-4는 거의 같은 전압에서 거의 두 배의 전력을 전달할 수 있다고 회사는 말해.1 CS-4는 랙 스케일 플랫폼 Nexus 위에 지어진 첫 시스템이고, Nexus는 웨이퍼 스케일 엔진(WSE) 3개를 지원한다고 밝혔어.1

이 구조가 만드는 격차를 회사는 대역폭 수치로도 보여줘. NVIDIA는 72개 GPU로 구성된 Rubin 랙 전체에 랙 레벨 NVLink 대역폭 초당 260테라바이트를 명시하고 그 NVLink 스파인은 약 5,000개의 내부 케이블로 이뤄지는데, 단일 Cerebras WSE-3T는 초당 53.5페타바이트의 온웨이퍼 총 대역폭을 제공해 NVL72 랙의 스케일업 대역폭보다 200배 넘게 크다고 회사는 밝혔어.1

왜 중요한가

2025년 Cerebras는 Meta의 Llama API·Perplexity·Mistral과 Hugging Face·OpenRouter 연동을 확대하고 북미·유럽 데이터센터 확장을 발표하며, 스스로를 고속 추론 분야 세계 1위 공급자가 될 것이라 밝혔어.2 다만 이 “1위” 표명은 회사 스스로의 주장이라는 점을 구분해서 읽을 필요가 있어.

동시에 이 회사는 고객이 좁다는 위험도 스스로 공시하고 있어. Cerebras는 위험 요인 공시에서 OpenAI·Group 42 Holding·Mohamed bin Zayed University of Artificial Intelligence·AWS를 포함한 소수의 주요 고객에 의존한다고 밝혔고, 그중에서도 OpenAI와 맺은 Master Relationship Agreement를 특히 짚었어.1 웨이퍼 스케일 설계가 아무리 빠르더라도, 매출이 소수 고객의 계약 갱신에 걸려 있다면 그 속도 우위가 곧바로 안정적 수익으로 이어진다고 보긴 어려워.

이 대상을 볼 때의 핵심 축

  • CS-5·CS-6 로드맵의 실제 이행을 본다. CS-5는 2027년 목표로 오픈소스 모델(Gemma 4 31B·gpt-oss-120b)에서 사용자당 초당 최대 1만 개 출력 토큰을 내도록 설계됐고, Kimi·GPT-5.6 Sol 같은 초거대 모델에서는 사용자당 초당 최대 5,000개 출력 토큰과 메가와트당 초당 300만 토큰을 목표로 한다고 밝혔어.1 목표 시점이 가까워질수록 이 수치가 실제 출하 제품에서 재현되는지가 로드맵 신뢰도를 가른다.
  • 고객 집중도의 변화를 본다. OpenAI와의 Master Relationship Agreement가 위험 요인으로 명시된 만큼,1 새 고객이 이 소수 의존 구조를 얼마나 완화하는지가 매출 안정성의 지표다.
  • 자사 발표 수치의 제3자 검증 여부를 본다. “업계에서 가장 빠른 AI 가속기”·“200배 넘는 대역폭” 같은 수치는 지금까지 회사 자신의 발표에서만 나왔고,1 독립 벤치마크나 고객사의 확인이 뒤따르는지가 다음 확인 지점이다.

최근 관찰된 신호

  • 2026-08-25: 팔로알토 HOT CHIPS 컨퍼런스에서 CS-4가 이런 성능 향상을 이룬 방식을 공유하고 CS-5·CS-6 로드맵을 예고했다.1
  • 2026-08(정확한 날짜 미확인, Supernova 2026 행사에서 “지난주”로 언급): CS-4를 공개했다 — 랙 스케일 플랫폼 Nexus 기반 첫 시스템.1
  • 2025년: Meta Llama API·Perplexity·Mistral과 Hugging Face·OpenRouter 연동을 확대하고 북미·유럽 데이터센터 확장을 발표했다.2
  • 2024년: 2024년에 웨이퍼 스케일 SRAM·연산에 3D 적층 DRAM을 결합하는 CS-6 구상에 착수했다.1
  • 2023년: G42와 파트너십으로 FP16 기준 4 exaFLOPs 성능과 코어 5,400만 개를 갖춘 Condor Galaxy 1 슈퍼컴퓨터를 공개했다.2

헷갈리지 말아야 할 점

Cerebras가 스스로 “업계에서 가장 빠른 AI 가속기”라 밝혔다고 해서1 이걸 독립 기관이 검증한 순위로 읽으면 안 돼. 지금까지 나온 대역폭·전력 효율 수치는 전부 회사 자신의 발표에서 나온 자기 주장이고,1 제3자 벤치마크 기관이나 고객사가 별도로 확인한 수치는 아직 확인되지 않았어. 다만 국립에너지기술연구소(NETL)의 실측은 다르다 — NETL은 필드 방정식 모델링에서 CS-2 시스템이 자신들의 Joule 슈퍼컴퓨터보다 약 500배 빨랐다고 밝혔다.2 이건 회사가 아니라 사용 기관이 낸 결과지만, 특정 워크로드 하나에 한정된 수치라는 점은 구분해서 읽어야 해.

이어서 읽기

GPU 클러스터가 칩을 케이블로 엮는 방식은 NVIDIA에서, Cerebras의 주요 연동 고객 중 하나인 대형 언어모델 서비스는 Meta에서 더 볼 수 있어.

남은 질문들

  • Cerebras는 비상장사로 알려져 있는데, 위험 요인 공시 문구가 등장한 문서(투자 유치·공모 관련 filing 등)가 정확히 무엇인지
  • OpenAI와의 Master Relationship Agreement가 매출에서 차지하는 비중이 어느 정도인지
  • CS-5·CS-6의 실제 출하가 목표 시점(2027년)을 지키는지, 그리고 독립 벤치마크가 이 회사의 속도·대역폭 주장을 어떻게 확인하는지

각주

  1. Cerebras, 「Ultrafast Frontier Inference: Cerebras Deep Dive at Hot Chips 2026」(2026-08-25) 원문 ↩︎ ↩︎2 ↩︎3 ↩︎4 ↩︎5 ↩︎6 ↩︎7 ↩︎8 ↩︎9 ↩︎10 ↩︎11 ↩︎12 ↩︎13 ↩︎14 ↩︎15 ↩︎16 ↩︎17 ↩︎18 ↩︎19

  2. Cerebras, 「Company」(확인일 2026-08-22) 원문 ↩︎ ↩︎2 ↩︎3 ↩︎4 ↩︎5 ↩︎6 ↩︎7 ↩︎8 ↩︎9 ↩︎10 ↩︎11