🥚

Recent Notes

  • AutoStore의 설치 기반과 Starship의 배송비 주장은 무엇을 보여주나

    2026년 8월 7일 19:31

  • 방산 스타트업의 공장은 보조금으로 지어도 조달까지 보장되진 않아

    2026년 8월 7일 15:23

  • 포스코퓨처엠, 19만t 넘는 LFP 양극재를 파는데 상대는 아직 안 밝혔다

    2026년 8월 7일 01:42

  • 코스피가 4.58% 내린 날, 코스닥은 0.26% 올랐어

    2026년 8월 7일 00:30

See 679 more →

inference

·····
  • 프리필·디코드 분리

    2026년 7월 14일 13:53

    언어모델 추론에서 입력을 한꺼번에 읽는 프리필과 답을 한 토큰씩 만드는 디코드를 서로 다른 GPU 풀로 나누는 구조를 설명합니다. 긴 문맥 요청이 전체 응답 지연을 밀어내는 이유와 KV 캐시 전송이 왜 핵심인지 짚습니다.

    • ai
    • inference
    • infrastructure
  • 인메모리 컴퓨팅

    2026년 7월 12일 23:21

    데이터를 프로세서로 계속 옮기는 대신 메모리 가까이에서 연산하려는 인메모리 컴퓨팅을 설명합니다. AI 추론의 전력 병목을 데이터 이동 관점에서 읽는 법도 함께 정리합니다.

    • ai
    • semiconductors
    • memory
    • inference
  • 추론 비용

    2026년 7월 12일 11:03

    AI 서비스가 답을 만들어 내는 비용을 토큰당 가격이 아니라 처리량·응답성·메모리·운영 자원의 결합으로 읽는 관점을 설명합니다.

    • ai
    • inference
    • software
    • infrastructure
  • KV 캐시

    2026년 7월 12일 10:07

    언어모델이 이미 읽은 토큰의 중간 계산을 다시 쓰기 위해 남겨 두는 KV 캐시를 설명합니다. 응답 속도와 메모리 사용량이 왜 함께 움직이는지도 짚습니다.

    • ai
    • llm
    • inference
    • memory
  • 모델 양자화

    2026년 7월 16일 18:59

    모델 가중치의 숫자 정밀도를 낮춰 메모리와 배포 비용을 줄이는 모델 양자화를 설명합니다. 파일 크기만 줄이는 기술이 아니라 품질·지연 시간·처리량·실행 환경을 함께 고르는 배포 설계라는 점을 짚습니다.

    • ai
    • inference
    • machine-learning
    • infrastructure
  • NPU

    2026년 7월 12일 09:30

    신경망 계산에 맞춘 반도체인 NPU가 무엇인지, GPU·CPU와 어떤 역할로 나뉘는지, 그리고 실제 효율을 읽을 때 무엇을 봐야 하는지 정리합니다.

    • ai
    • ai-semiconductor
    • inference
  • RMSNorm

    2026년 7월 13일 00:52

    RMSNorm이 벡터를 평균이 아니라 제곱평균제곱근으로 맞추는 정규화라는 점과, 왜 LLM 실행 경로에서 LayerNorm과 다르게 최적화될 수 있는지 설명합니다.

    • ai
    • llm
    • inference
  • 2026년 7월 14일 — AI 데이터센터는 전기요금 청구서 앞에서 멈춘다

    2026년 7월 14일 09:35

    AI 데이터센터 전력망 병목, 호르무즈 해협 재봉쇄에 따른 유가 충격과 캐나다 금리 대기, SageMaker AI 추론 추천 UI를 함께 봅니다. 오늘의 공통점은 모델과 원유가 아니라, 물리 인프라와 운영 비용이 앞단으로 올라왔다는 점입니다.

    • ai-infrastructure
    • energy
    • inference
  • Cerebras

    2026년 7월 26일 00:28

    Cerebras가 웨이퍼 단위 컴퓨팅, 모델 최적화, 클라우드 접근을 어떻게 한 묶음으로 연결하는지 설명합니다. Kimi K2.6 서비스 사례와 내부 지식 검색 시스템을 통해 이 회사를 읽을 때 반복해서 확인할 축을 정리합니다.

    • ai
    • inference
    • semiconductors
  • Etched

    2026년 7월 13일 04:58

    추론 전용 AI 칩을 만들겠다는 Etched를, 범용 GPU 경쟁이 아니라 모델·소프트웨어·제조를 한 가정에 묶는 특화 하드웨어 실험으로 읽습니다.

    • ai
    • semiconductors
    • inference
  • Sample Distribution

    2023년 10월 4일

    표본 분포와 통계량에 대해 이해한다. 추론 (inference) 표본을 가지고 모집단의 특성(모수)를 예측하는 것 통계학의 핵심은 내가 원하는 집단의 특징을 알아내는 것이다.

    • statistics
    • inference
  • Statistical Inference

    2023년 10월 4일

    통계적 추론에 대해 이해한다. 통계적 추론 표본이 갖고 있는 정보를 분석하여 모수에 관한 결론을 유도하고, 모수에 대한 가설의 옳고 그름을 판단하는 것 추정의 방법 모수를 추정하는 방법에 대해서 알아본다. 점 추정 모수를 추정하기 위해 하나의 값을 제안한다.

    • statistics
    • inference
    • confidence-interval
  • AI 토큰은 GPU에 닿기 전부터 비용이 붙는다

    2026년 7월 14일 13:09

    추론 요청 하나가 토큰화, 라우팅, KV 캐시, HBM, 네트워크를 지나 응답으로 돌아오는 과정을 짚습니다. 비용이 모델 계산만 아니라 메모리와 연결망에서 갈리는 이유를 봅니다.

    • ai
    • inference
    • data-center
  • AMD 헬리오스가 AI 추론에 꺼내든 CPU와 동맹

    2026년 7월 24일 21:06

    AMD가 베니스 CPU와 MI455X GPU를 묶은 헬리오스를 공개하고, 세레브라스와 추론 솔루션을 함께 내놓겠다고 밝혔습니다. 이번 발표에서 확인된 제품·출하·고객 도입 계획과 아직 회사 설명에 머무는 숫자를 나눠 봅니다.

    • ai
    • inference
    • semiconductors
    • datacenter
    • amd
  • AWS G7e가 Blackwell 추론을 프랑크푸르트와 뭄바이로 넓혔어

    2026년 8월 2일 07:45

    AWS가 NVIDIA RTX PRO 6000 Blackwell Server Edition을 얹은 EC2 G7e를 프랑크푸르트·스톡홀름·뭄바이에 추가했습니다. 어떤 추론 작업을 겨냥했고, 발표문만으로는 무엇을 아직 알 수 없는지 짚습니다.

    • ai
    • ai-infrastructure
    • cloud
    • inference
  • Cerebras가 추론의 똑똑함보다 토큰값을 먼저 묻는다

    2026년 7월 24일 23:43

    Cerebras의 reasoning 설명을 따라가며 더 오래 생각하는 AI가 정확도·속도·토큰·메모리 비용을 어떻게 맞바꾸는지 살펴봅니다.

    • ai
    • inference
    • ai-infrastructure
    • software
  • Couchbase가 다중 모델 추론을 운영에 넣은 방식

    2026년 7월 22일 11:44

    AWS와 Couchbase의 공식 사례를 통해 Capella iQ가 요청 종류와 고객별 설정에 따라 모델을 고르고, Amazon Bedrock의 비공개 연결과 리전 분산으로 서비스를 이어가는 구조를 살펴봅니다.

    • ai
    • inference
    • cloud
    • database
    • aws
  • 스웨덴 데이터센터에 7,000개 RNGD를 배치하는 계획이 나왔어

    2026년 8월 5일 18:29

    스톡홀름 데이터센터의 RNGD·GPU 병행 배치 계획과 아직 확인되지 않은 지점을 짚습니다.

    • ai
    • ai-semiconductor
    • inference
    • data-center
  • General Compute가 4억 달러로 추론용 칩을 묶었다

    2026년 7월 21일 13:57

    General Compute의 4억 달러 부채 조달에서 실제로 확인되는 조건을 짚습니다. 어떤 칩을 쓰는지, 자금이 어떻게 제공되는지, 회사가 말한 NVIDIA 대체 주장은 어디까지인지 나눠 살펴봅니다.

    • ai
    • cloud
    • ai-infrastructure
    • financing
    • inference
  • 토큰 가격은 GPU 뒤에서 다시 갈린다

    2026년 7월 12일 10:40

    NVIDIA가 말하는 추론 소프트웨어 스택을 통해, AI 서비스의 토큰당 비용이 칩 성능만이 아니라 운영·가속·인프라 접근의 결합에서 결정되는 이유를 살펴봅니다.

    • ai
    • inference
    • semiconductors
    • software
  • Jalapeno 칩은 아직 성능표보다 설계도를 먼저 보여줬다

    2026년 7월 15일 17:07

    OpenAI와 Broadcom이 공개한 Jalapeno의 확인된 개발 단계와, 아직 발표만으로는 알 수 없는 성능·배치 규모를 구분해 읽습니다.

    • ai
    • semiconductors
    • inference
  • 리벨리온 IPO의 첫 질문은 코스피가 AI 칩에 매길 값이다

    2026년 7월 10일 21:13

    리벨리온이 코스피 상장과 미국 ADR 가능성을 말했습니다. 추론용 NPU 회사의 기술보다 먼저 공개시장, 정부 AI 인프라, 매출 검증이라는 세 질문이 드러납니다.

    • ai-semiconductor
    • inference
    • ipo
    • korea
  • SageMaker는 추론 설정을 고르는 일을 화면으로 내려보냈어

    2026년 7월 15일 08:56

    Amazon SageMaker AI가 생성형 AI 추론 최적화 API 위에 workload profiles, 비용·지연·처리량 목표, 결과 비교 화면을 얹은 이유를 살펴봅니다. 무엇이 확인됐고 어떤 부분이 AWS의 주장으로 남는지도 나눠 봅니다.

    • ai
    • inference
    • cloud
    • aws
  • 국산 NPU가 5만 대 CCTV에서 추론을 시작한다

    2026년 7월 19일 21:13

    AI 반도체 경쟁이 학습 칩에서 실제 서비스를 돌리는 추론 칩으로 옮겨가는 가운데, 공공 CCTV와 실시간 검색 요약이 국산 NPU의 첫 사용처로 제시됐어. 무엇이 확인됐고, 아직 어떤 조건이 남았는지 짚어봐.

    • ai
    • ai-semiconductor
    • inference
    • korea
    • public-sector-ai
  • Kimi K3의 가격표가 반도체 투자자에게 던진 질문

    2026년 7월 19일 11:39

    Kimi K3와 잉클링 같은 오픈웨이트 모델이 AI 사용 비용을 낮추면서, 반도체 수요가 줄어드는지 오히려 넓어지는지에 대한 두 가지 경로를 살펴봅니다. 22일 구글 실적에서 확인할 지표도 함께 정리합니다.

    • ai
    • semiconductors
    • inference
    • open-models
  • 추론은 칩만으로 끝나지 않아

    2026년 7월 20일 04:30

    AI 서비스가 모델 학습에서 추론으로 무게중심을 옮기면서 국산 NPU가 어떤 현장과 소프트웨어를 함께 확보해야 하는지 살펴봐. 실시간 검색부터 피지컬 AI 네트워크까지, 발표로 확인된 범위와 아직 검증할 조건을 나눠 짚어.

    • ai
    • ai-semiconductor
    • inference
    • physical-ai
    • korea

Wansook.World

세상을 이해해보려는 작은 여행.

Donation

© 2026 Wansook.World · All rights reserved. · v1.3.869