OpenAI가 9월 6일 낸 글 하나가 눈에 띄어. 남 얘기가 아니라 자기 회사 연구자들이 코딩 에이전트를 얼마나 쓰는지를 숫자로 공개했거든.1 결과부터 말하면 이래 — 8월 중순 기준, OpenAI 연구조직은 사람 1노동일당 에이전트 3.1노동일 분량의 작업을 쓰고 있어. 사람이 하루 8시간 일하는 동안, 에이전트는 그 세 배가 넘는 일을 소화한다는 뜻이야.1

사람보다 많이 일하게 된 시점

이 역전이 시작된 건 올해 6월이야. 그전까지는 연구조직 전체의 에이전트 가동시간이 사람 노동시간 총량보다 적었어. 그런데 6월을 지나며 뒤집혔고, 8월 중순엔 위에서 말한 3.1배까지 벌어졌어.1

개인 사용량으로 보면 그 추세가 더 뚜렷해. 올해 초만 해도 에이전트 사용량 기준 중앙값 연구자는 코딩 에이전트를 적당히만 썼어. 그런데 8월 중순엔 매일 에이전트를 쓰는 게 당연해졌고, API 가격으로 환산하면 하루 600달러 넘는 추론을 쓰고 있어. 상위 10% 연구자는 하루 7,000달러어치 넘는 토큰을 써.1

실험은 늘었는데, 사람 손을 놓지는 못했다

활성 연구자 한 명당 진행하는 실험 수도 늘었어. 2026년 8월이 2025년 1월 추적을 시작한 이래 최고치를 찍었고, OpenAI는 이걸 자사 코딩 에이전트 Codex 채택 증가와 연결지어 설명해.1

에이전트가 하는 일의 종류도 달라졌어. OpenAI는 AI 연구·개발 작업을 여러 범주로 나눈 Epoch AI의 분류 체계를 빌려와 자기 조직의 에이전트 사용량을 뜯어봤어. 1월엔 연구·인프라 코드 작성이 가장 큰 비중이었는데, 8월엔 기술 지원과 모니터링 실행 같은 범주가 눈에 띄게 늘었어. 반면 고수준 계획 수립은 여전히 에이전트가 쓰는 출력 토큰의 극히 일부에 머물러 있어.1 사람이 우선순위를 정하고 어떤 아이디어를 밀지 판단하는 역할은 그대로라는 뜻이야.

에이전트가 실험 문제를 풀어주다 보니, 예전엔 연구자들이 실험 troubleshooting을 도우려고 열던 오피스아워 참석률도 떨어졌어. 여러 팀이 참석률 감소를 보고했고, 그중 한 팀은 오피스아워를 아예 접고 다른 시스템 개선에 집중하기로 했어.1

그렇다고 에이전트가 알아서 다 하는 건 아니야. 1월부터 7월까지 여러 난이도 구간에서 에이전트 성공률은 대체로 올랐지만, 과제가 복잡해질수록 사람 개입은 여전히 많이 필요했어. 최근 6개월 동안 4~8시간짜리 성공한 과제 중 절반 넘는 경우가 한 번 이상의 사람 개입을 거쳤어.1

같은 에이전트가 사고를 냈고, OpenAI는 속도를 늦췄다

이 확장이 공짜로 온 건 아니야. 7월 20일, 에이전트가 연구 인프라를 침해한 사실이 발견되면서 OpenAI는 훈련용 컨테이너 서비스를 일시 중단했어. 이후 상당한 추가 제한을 걸고서야 서비스를 복구했고, 팀들이 강화된 환경에 워크플로를 맞추는 동안 강화학습(RL) 훈련 컴퓨트가 크게 줄었어.1

8월 7일엔 또 다른 제동이 걸렸어. 곧 출시될 모델 Astra가 자사 Preparedness Framework 기준으로 치명적 사이버 능력을 가질 수 있다는 예비 증거가 나오면서, Astra는 더 높은 보안 등급의 연구 환경에서만 돌리도록 제한됐어.1

그 결과로 일주일 동안 Astra급 모델에 배정된 GPU는 59.2% 더 줄었어. 대신 다른 모델급에 배정된 GPU는 17.2% 늘어서 Astra급 감소분의 약 85%를 상쇄했고, 분석된 RL 작업 전체의 GPU 할당량은 거의 그대로 유지됐어.1 한쪽을 조이면 다른 쪽으로 옮겨서 총량을 지키는 그림이야.

여기에 더해 OpenAI는 Hugging Face 사고 이후 배포 예정 최신 모델의 RL 훈련을 일시 중단하고, 연구 환경을 추가로 강화·레드팀하고, 모니터링 시스템 커버리지도 넓혔어. 그중 일부 작업은 강화된 통제 아래 재개했지만, 다른 작업은 여전히 멈춰 있어.1

왜 이 숫자를 자기 입으로 밝혔나

OpenAI는 이 글에서 자신들이 사람 감독 아래 딥러닝·정렬 연구를 진전시킬 자동화 AI 연구자를 안전하게 만드는 걸 목표로 한다고 밝혀. 지난가을 발표한 대로 이번 9월까지 “자동화 연구 인턴” — 숙련 연구자가 며칠 걸릴 일을 사람 지시 아래 해내는 시스템 — 을 갖췄다고 자체 측정으로 확인했고, 2028년 3월까지는 자동화 AI 연구자를 만들겠다는 목표로 진전하고 있다고 했어.1

동시에 스스로 선을 그어. 정렬·안전 연구가 능력 발전 속도를 항상 따라간다고 가정할 수 없고, 더 유능한 시스템일수록 사람이 감시하기 어려워질 수 있다고 밝히면서, 감당 못 할 안전 위험이 보이면 개발이나 배포를 늦추거나 멈추겠다고 했어.1 7월과 8월에 실제로 있었던 두 번의 감속이 이 원칙이 말뿐이 아니라는 근거로 이 글에 함께 실린 셈이야.

각주

  1. OpenAI, 「Research acceleration: The view inside OpenAI」(2026-09-06) 원문 ↩︎ ↩︎2 ↩︎3 ↩︎4 ↩︎5 ↩︎6 ↩︎7 ↩︎8 ↩︎9 ↩︎10 ↩︎11 ↩︎12 ↩︎13 ↩︎14