AI 안전 신화의 균열: Anthropic Mythos, 공개 14시간 만에 뚫리다

Anthropic의 Mythos AI 모델이 공개 14시간 만에 Discord 그룹에 의해 URL 추측으로 뚫렸다. AI 안전 담론의 신뢰성에 근본적 의문이 제기되고 있다.

깨진 방패와 자물쇠 아이콘 — Anthropic Mythos 보안 침해 14시간

핵심 요약 (TL;DR)

Anthropic이 "너무 위험해 일반 공개가 어렵다"며 Project Glasswing이라는 제한 배포 프로그램으로 풀어둔 사이버보안 특화 모델 Mythos가, 공식 출시 14시간 만에 외부 Discord 그룹에 의해 뚫렸다. 침투 방법은 정교한 해킹이 아니라 단순한 URL 추측이었다. Mythos는 자율적으로 제로데이 취약점을 발견하고 연쇄 익스플로잇까지 구성할 수 있는 능력을 갖춘 것으로 알려져 있어, 사고의 의미는 단순한 인증 우회를 넘는다. AI 업계가 반복해온 "안전 우선" 메시지의 신뢰성이 정면으로 흔들렸고, 미국·EU의 AI 규제 논의는 다시 가열되고 있다.

배경 및 맥락

Anthropic은 자사 정체성의 핵심에 "AI 안전성"을 두어온 회사다. Constitutional AI, Responsible Scaling Policy, ASL(AI Safety Levels) 같은 용어들은 이 회사가 만들고 업계 표준 어휘로 자리 잡았다. 그 중심에는 "강력한 모델일수록 더 많은 제어 장치를 거쳐 배포한다"는 원칙이 있었다.

Mythos는 그 원칙이 가장 강하게 작동했어야 할 모델이다. 보도에 따르면 Mythos는 사이버보안 도메인에 특화된 모델로, 코드베이스를 스캔해 알려지지 않은(zero-day) 취약점을 찾아내고 이를 다단계 공격으로 엮는 자동화된 추론이 가능하다. 위험을 우려한 Anthropic은 일반 API로 공개하는 대신, 검증된 보안 연구 기관과 정부 파트너에게만 폐쇄형으로 제공하는 Project Glasswing을 통해 배포해 왔다.

문제는, '폐쇄'가 실제로 폐쇄적이지 않았다는 점이다.

주요 내용 분석

14시간이라는 숫자

TechCrunch, CBS News, Fortune이 잇따라 보도한 내용을 종합하면 사건의 시간선은 다음과 같다. Project Glasswing 정식 배포 당일, 한 Discord 커뮤니티가 모델 엔드포인트의 URL 패턴을 분석하기 시작했다. 토큰 발급 흐름과 리소스 식별자에 일정한 규칙성이 있었고, 이를 자동화 스크립트로 변형해 가며 반복 시도하던 중 실제로 응답하는 접근 경로를 확보했다고 한다. 공개부터 무단 접근까지 걸린 시간은 약 14시간이었다.

모델이 가진 능력

이 사건이 단순한 무단 접근 이상으로 다뤄지는 이유는 Mythos의 능력 때문이다. 보도된 바에 따르면 Mythos는 단일 함수 단위 취약점을 찾는 정적 분석기가 아니라, (1) 대상 시스템 코드를 읽고 (2) 의심스러운 패턴을 가설로 정리한 뒤 (3) 실제 익스플로잇 체인까지 자율적으로 시도하는 '자율 보안 연구원' 성격의 도구다.

Anthropic은 "현재까지 실제 공격에 사용된 흔적은 없다"고 밝혔지만, 외부 그룹이 여전히 모델에 접근 중이라는 점은 인정했다. 즉, '사용되지 않았다'가 곧 '사용될 수 없다'는 의미는 아니다.

Anthropic의 대응

회사는 사고 인지 후 추가 인증 계층을 도입하고, 해당 Discord 그룹과 연결된 토큰을 회수했다고 발표했다. 다만 '추측 가능한 URL 구조'라는 가장 기초적인 설계 결함이 어떻게 정식 배포 단계까지 살아남았는지에 대한 구체적 사후 분석은 아직 공개되지 않은 상태다.

실사용자 반응

Hacker News와 X(구 Twitter)의 보안 커뮤니티 반응은 크게 세 갈래로 나뉜다.

  • 회의적: "Constitutional AI와 RSP를 외쳐온 회사가 토큰 URL 하나 보호하지 못했다는 건, 그 모든 안전 프레임워크가 결국 마케팅 언어였다는 방증"이라는 강한 비판이 다수다.
  • 온건: "보안 사고는 어느 조직이든 겪을 수 있다. 중요한 것은 사후 대응과 책임 있는 공개 절차"라며 Anthropic의 후속 조치를 지켜보자는 의견.
  • 기술적: 일부 보안 연구자들은 "Mythos급 모델을 외부 인프라에 두는 한 URL 보호만으로 안전을 담보할 수 없다. 이 등급의 모델은 격리된 온프레미스에서만 작동해야 한다"고 지적했다.

Reddit r/MachineLearning에서는 "안전 담론을 가장 강하게 펼친 회사에서 가장 기초적인 사고가 났다"는 아이러니에 주목하는 글들이 상위에 노출되고 있다.

의미와 시사점

이번 사건이 던지는 핵심 질문은 분명하다. AI 안전(safety)과 실용(utility) 사이의 균형은 누가, 어떤 책임으로 검증하는가. Mythos 사건은 "모델이 위험하다는 사실을 회사가 안다"는 것 자체가, 그 모델을 안전하게 운영한다는 보장과는 다른 차원의 문제임을 드러냈다.

규제 측면에서는 EU AI Act의 고위험 시스템 조항, 미국 NIST AI Risk Management Framework가 다시 도마 위에 오를 가능성이 크다. 자율적 공격 능력을 가진 모델을 어떤 통제 수준에서 배포할지, 그리고 그 통제가 실패했을 때의 법적 책임은 누구에게 있는지에 대한 논의가 가속될 것으로 보인다.

기업 관점에서는 한 가지 교훈이 더 또렷해졌다. 제한 배포(restricted release)는 그 자체로 보안이 아니다. 진짜 보안은 인증 흐름, 키 관리, 엔드포인트 노출 표면 같은 평범한 보안 위생에서 나온다. AI 모델이 강력해질수록, 그 모델을 감싸는 인프라가 모델 자체보다 더 단순한 약점이 되곤 한다.

마치며

"너무 위험해서 공개하지 않는다"는 말은 강한 메시지다. 동시에 그 말이 진실이 되려면, 그 위험을 가둬둘 만큼의 운영 역량이 뒷받침되어야 한다. Mythos 사건은 두 가지 사이의 거리가 우리가 생각해 온 것보다 훨씬 멀다는 사실을 보여줬다.

이 글은 AI가 작성하여 자동 발행된 콘텐츠입니다.