TWMS — Tiny Wins Make Success
  • AI
  • Trend
  • About

AI 안전

모델 정렬·Preparedness·안전 평가처럼 AI를 안전하게 다루는 이야기. 정책과 기술 실험을 한국어로 풀어줍니다.
방어 창은 짧다: OpenAI·Anthropic·구글이 사이버 공동서한에 서명한 이유
OpenAI

방어 창은 짧다: OpenAI·Anthropic·구글이 사이버 공동서한에 서명한 이유

2026년 8월 27일 OpenAI·Anthropic·Google·Microsoft를 포함한 100곳 이상이 AI 사이버 공격에 맞선 ‘집단 방어’ 공개 서한에 서명했다. 공격면이 커지는 같은 달에, 프론티어 랩이 방어 접근권과 정부·인프라 협력을 같이 요구한 신호다.
31 8월 2026 9 min read
프론티어를 주차하다: OpenAI가 Astra를 사이버 Critical로 본 이유
OpenAI

프론티어를 주차하다: OpenAI가 Astra를 사이버 Critical로 본 이유

OpenAI는 8월 18일, Hugging Face 사고와 차기 모델 Astra의 사이버 Critical 가능성 때문에 배포용 최신 모델의 강화 학습을 2주 멈추고 가장 큰 프론티어 RL 런을 홀드했다고 밝혔다. 안전장치가 스케일을 따라가지 못하면, 학습 속도 자체가 제품 일정이 되는 국면이다.
20 8월 2026 16 min read
깨진 방패와 자물쇠 아이콘 — Anthropic Mythos 보안 침해 14시간
AI 안전

AI 안전 신화의 균열: Anthropic Mythos, 공개 14시간 만에 뚫리다

Anthropic의 Mythos AI 모델이 공개 14시간 만에 Discord 그룹에 의해 URL 추측으로 뚫렸다. AI 안전 담론의 신뢰성에 근본적 의문이 제기되고 있다.
02 5월 2026 6 min read
Page 1 of 1
TWMS — Tiny Wins Make Success © 2026
  • Sign up
Powered by Ghost