AI 안전장치가 모델의 거절 학습, 접근 권한, 도구 실행 통제에서 각각 무엇을 막는지와 탈옥이 왜 그 경계를 시험하는지 정리합니다.
언어모델이 출력하지 않은 중간 개념을 잠시 공유해 추론에 쓰는지 살피는 J-space를 설명합니다. 말로 쓴 reasoning과 무엇이 다른지도 짚습니다.
AI 에이전트가 도구를 실행할 때 보안의 초점이 어떻게 바뀌는지 보고, Rocket Lab의 VICTUS HAZE와 미국 석유 수출 기록으로 국방 우주·에너지 안보의 병목을 짚습니다.
Claude를 만드는 AI 회사 Anthropic이 왜 계속 뉴스에 등장하는지 짚습니다. 기업 시장으로 확장하려는 힘과 배포를 통제하려는 정부의 힘이 이 회사에서 어떻게 부딪히는지, 무엇을 보면 다음 국면을 읽을 수 있는지 살펴봅니다.
Anthropic과 AE Studio의 GRAM 연구가 왜 거절 규칙이 아니라 모델 안의 지식 배치 문제를 건드리는지 짚습니다. 무엇이 확인됐고, 아직 무엇이 실험실 밖으로 나오지 않았는지 갈라 봅니다.
Boko Haram 전직 구성원 인터뷰 연구가 보여 준 것은 챗봇 이름 목록보다 전담 조직과 네트워크입니다. 동시에 자기보고 연구라는 한계도 함께 짚습니다.
Anthropic의 J-space 연구가 단순한 의식 논쟁이 아니라, 모델이 말하지 않는 중간 생각을 읽고 바꾸는 안전 도구로 왜 중요한지 짚습니다.
미국 정부가 국가안보를 이유로 최신 AI 모델의 접근을 갑자기 막았다가 18일 만에 풀었습니다. 그 사이 무슨 일이 오갔는지, 발표문이 주장하는 것과 실제로 확인되는 것을 갈라 짚습니다.
Google DeepMind의 AI Control Roadmap과 multi-agent safety 연구 지원을 묶어, AI 에이전트 안전이 모델 정렬을 넘어 감시·차단·집단 행동 연구로 넓어지는 이유를 짚습니다.
Google Research의 사실 회상 실험을 통해 reasoning 토큰이 단순 질문에서도 왜 도움이 되는지 짚습니다. 추가 계산 시간, 관련 사실 점화, hallucination 위험을 나눠 봅니다.
Anthropic의 Mythos 사건 뒤에 남은 문제는 모델 하나의 위험성이 아니라, 다음 고위험 AI를 앞두고 정부와 기업이 같은 사실을 볼 통로가 없다는 점입니다.
OpenAI가 캘리포니아·뉴욕·일리노이의 주정부 법안과 연방정부의 평가 체계를 하나의 안전 기준으로 연결하자고 제안한 이유를 살펴봅니다.