• AI가 지금 해야 할 일을 놓치지 않도록 지시, 자료, 도구 결과, 기억을 골라 배치하는 설계를 설명합니다. 프롬프트 한 줄과 장기 기억, 검색을 어떻게 구분해 봐야 하는지도 짚습니다.

  • 언어모델이 이미 읽은 토큰의 중간 계산을 다시 쓰기 위해 남겨 두는 KV 캐시를 설명합니다. 응답 속도와 메모리 사용량이 왜 함께 움직이는지도 짚습니다.

  • 검색 증강 생성이 모델의 내부 기억과 외부 자료 저장소를 어떻게 나누는지 설명합니다. 환각 완화, 최신성, 저장장치 수요를 함께 볼 때 필요한 기본 구조입니다.

  • RMSNorm이 벡터를 평균이 아니라 제곱평균제곱근으로 맞추는 정규화라는 점과, 왜 LLM 실행 경로에서 LayerNorm과 다르게 최적화될 수 있는지 설명합니다.

  • Chat GPT Plus 구독 현재로서 가장 가성비가 좋은 건 이것임 (240403) Video, Audio, Summary, Code Generation 등 가장 많은 기능을 처리할 수 있음 GPTs를 통해 특화된 기능도 사용가능 Copilot 구독 가장 유명한 것 일단 써봄.

  • Anthropic이 Fable 5를 유료 플랜에서 7월 19일까지 더 열어두면서 모델의 인기는 곧바로 계산 자원 문제가 됐습니다. 접근 한도와 경쟁사의 대응을 따라가며, 발표로 확인되는 것과 해석을 나눠 봅니다.

  • Google Research의 사실 회상 실험을 통해 reasoning 토큰이 단순 질문에서도 왜 도움이 되는지 짚습니다. 추가 계산 시간, 관련 사실 점화, hallucination 위험을 나눠 봅니다.

  • LayerNorm과 RMSNorm이 메모리를 기다리며 생기는 지연을, 행렬 곱과 겹쳐 줄이려는 PyTorch의 커널 기법을 살펴봅니다.