Cerebras와 OpenAI가 새 서비스 등급 Ultrafast Mode를 공개했어. OpenAI API에 처음 올라가는 이 등급에서, Cerebras가 구동하는 GPT-5.6 Sol은 초당 최대 750개의 출력 토큰을 뽑아내면서도 품질은 떨어뜨리지 않는다고 밝혔어.1 지금은 일부 고객에게만 열려 있고, 접근 범위는 시간이 지나며 넓어질 예정이야.1

경쟁 모델보다 몇 배 빠른가

Artificial Analysis가 집계한 출력 속도를 기준으로, Ultrafast 모드의 GPT-5.6 Sol이 Fable 5보다 11배, Fast 모드의 Opus 4.8보다 5배 빠르다는 게 두 회사의 설명이야.1 다만 이 배수는 Cerebras와 OpenAI가 직접 낸 숫자야. 제3자가 두 서비스를 나란히 돌려 확인한 결과는 이 발표 안에 없어.

박사급 문제 2,500개를 하루 만에

Cerebras는 속도를 증명하려고 자체 벤치마크를 돌렸어. 무대는 Humanity’s Last Exam(HLE)이야. 화학·경제학·문학 같은 분야에서 박사급 지식이 있어야 풀리는 문제 2,500개짜리 시험이지.1

결과는 이래. GPT-5.6 Sol Ultrafast가 2,500문제를 11시간 11분 만에 다 풀었고, Claude Fable 5는 같은 결론에 도달하는 데 78시간 27분 — 사흘 넘는 연속 연산이 걸렸어.1 두 모델의 실행 환경도 같지 않았어. GPT-5.6 Sol Ultrafast는 xhigh reasoning으로 Codex 안에서 7월 10일에, Claude Fable 5는 xhigh reasoning으로 Claude Code 안에서 7월 13~15일에 걸쳐 벤치마크를 돌렸다고 Cerebras는 밝혔어.1 두 벤치마크 다 Cerebras가 직접 수행했다는 점은 이 숫자를 읽을 때 감안할 지점이야.

경제적으로 유의미한 지식노동 작업을 평가하는 GDP-Val 벤치마크에서도 비슷한 패턴이 나와. Ultrafast는 품질 저하 없이 종단 간 5.6배 속도 향상을 냈다고 하는데, 이 측정 역시 7월 31일 Cerebras가 Codex 안에서 medium reasoning으로 직접 진행한 결과야.1

속도의 비밀은 칩에 박아 넣은 SRAM

Cerebras는 이 속도가 웨이퍼 스케일 엔진이라는 자체 칩 구조에서 나온다고 설명해. 일반 GPU에서는 모델을 돌릴 때마다 가중치를 온칩 메모리와 오프칩 저장소 사이로 계속 옮겨야 하고, 이 데이터 이동이 속도의 병목이 돼. Cerebras는 웨이퍼 크기 칩 하나에 SRAM 44GB를 얹어서 가중치를 아예 칩 위에 붙박아두고, 토큰이 여러 웨이퍼에 걸쳐 파이프라인처럼 흘러가게 만들었어.1

아직 모르는 것

Ultrafast는 지금 일부 고객에게만 미리 공개된 상태고, 용량이 늘어나는 대로 접근 범위를 넓히겠다는 게 Cerebras의 설명이야.1 언제 일반 고객까지 열리는지, 어떤 조건으로 확대되는지는 이번 발표에 없어. 제한 공개가 실제로 넓어지는 시점이, 이 등급이 시연을 넘어서는지를 보여줄 다음 신호야.

각주

  1. Cerebras, 「Accelerating GPT-5.6 Sol Ultrafast」(2026-08-14 확인) 블로그 ↩︎ ↩︎2 ↩︎3 ↩︎4 ↩︎5 ↩︎6 ↩︎7 ↩︎8 ↩︎9