AI 모델에 질문을 던질 때마다 반복해서 드는 추론 비용이 처리량·지연시간·장비 활용률·운영비 중 무엇에 좌우되는지, 왜 토큰 값이 떨어져도 마진이 저절로 늘지 않는지 짚는다.
언어모델이 매 토큰마다 이전 계산을 다시 하지 않도록 저장해 두는 KV 캐시가 왜 GPU 메모리를 가장 크게, 가장 예측 불가능하게 잡아먹는지, 그리고 그 낭비를 줄이는 PagedAttention이 무엇을 하는지 짚는다.
콘텐츠 전달·엣지 컴퓨팅·보안을 한 플랫폼으로 묶어 파는 Fastly(FSLY)가 무엇을 팔고, agentic AI 트래픽 관리로 어디를 노리는지 정리한다.
대용량 하드디스크로 AI발 데이터 폭증을 매출로 연결하는 시게이트의 FY2026 실적과 사업 구조를 짚는다.
아마존 2분기 실적 콜에서 Andy Jassy가 든 AWS 성장 가속의 구조를 짚고, 같은 글에서 그가 인정한 프로덕션 에이전트 배포 정체 신호를 같이 읽는다.