봉쇄안이 비어 있다: Guidelight가 프론티어 5사에 준 성적

Guidelight AI Standards는 2026년 8월 18일 기준 공개 자료만으로 Anthropic·OpenAI·Google·xAI·Meta를 통제 표준 여섯 항목에서 채점했고, 전체는 C+(2.50)·C+(2.50)·D+(1.50)·D−(0.83)·F(0.67)다. 어느 회사도 한 항목에서 3을 넘지 못했고, TechCrunch가 22일 전한 ‘OpenAI 1위, Anthropic·Meta 최하위’는 봉쇄안 칸이지 전체 성적이 아니다.

봉쇄안이 비어 있다: Guidelight가 프론티어 5사에 준 성적

핵심 요약 (TL;DR)

봉쇄안이 비어 있다: Guidelight가 프론티어 5사에 준 성적

Guidelight AI Standards는 첫 통제 평가를 올렸다. 대상은 Anthropic, OpenAI, Google, xAI, Meta 다섯 사다. 재료는 공개 자료뿐이다. 시스템 카드, 안전 프레임워크, 리스크 보고서, 블로그, 제3자 협력 설명. 정보는 2026년 8월 18일까지다. TechCrunch는 8월 22일 Frontier AI labs still won’t say how they’d contain a rogue model로 이 표를 전했다. 이 글은 아침 TypeScript 7 글이 아니다. Astra 사이버 Critical 글도, Mythos 글도, 단백질 바인더 글도 다시 쓰지 않는다. 공식 표와 TechCrunch 인용을 다시 읽는다.

Guidelight’s Control Assessment of Frontier AI Companies, August 2026
Guidelight 공식 글 OG. 제목은 Guidelight’s Control Assessment of Frontier AI Companies, August 2026. 출처: Guidelight 공식 글 OG

여섯 항목이다. 로깅은 내부 AI가 무엇을 하는지 남겨 모니터가 보게 하는 일이다. 모니터 효능은 그 감시가 실제로 잡히는지 재는 일이다. 게이트는 고위험 행동을 모니터가 허가하기 전에 막는 일이다. 서킷 브레이킹은 이상 징후가 몰리면 잠시 멈추는 일이다. 제3자 검토는 바깥이 통제의 충분함을 보는 일이다. 봉쇄안(containment plan)은 모델이 통제를 깨려 할 때 무엇을 끊고, 누구를 위해 어떤 제약 아래 돌리고, 언제 완전히 내릴지를 미리 적어 둔 안이다. 그 정의는 Guidelight의 정의이고, TechCrunch가 Adler를 인용해 옮긴 문장과 같다.

0–5 척도다. 0은 미구현, 1은 전조만, 2는 제한적 부분, 3은 상당 부분, 4는 거의 전체, 5는 전체다. 어느 회사도 어느 항목에서도 3을 넘지 못했다. 전체 성적은 여섯 절대 점수의 평균을 문자 성적으로 바꾼 값이다. Anthropic C+(2.50), OpenAI C+(2.50), Google D+(1.50), xAI D−(0.83), Meta F(0.67). 이 글이 다시 평균 낸 값이 아니다. Guidelight Figure 1이다.

TechCrunch 헤드라인의 “OpenAI came out on top; Anthropic and Meta scored lowest”는 봉쇄안 칸의 프레이밍이다. 전체 표에서 Anthropic과 OpenAI는 같이 C+다. Anthropic의 빈 칸은 봉쇄안 0이다. 상품은 Guidelight 표다. TC가 봉쇄안을 순위로 접은 칸과 섞지 않는다.

배경 및 맥락

Guidelight는 프론티어 개발 관행을 표준으로 묶으려는 독립 비영리다. The Neuron 8월 19일 기사는 공동 설립자를 Page Hedley(CEO, 전 OpenAI 정책·윤리 자문)와 Steven Adler(수석 과학자, 2020–2024 OpenAI, 제품 안전과 위험 능력 평가)로 적는다. Adler는 OpenAI 지분을 일부 보유한다고 공개한다. 이 글이 그 지분을 다시 세지 않는다. 평가 주체의 위치다.

평가가 묻는 질문은 배포 전 벤치마크가 아니다. 이미 회사 안에서 돌아가는 에이전트가 통제를 깨려 할 때, 무엇을 로그하고, 무엇을 막고, 무엇을 멈추고, 누구를 내리고, 바깥이 그 안을 봤는지다. Guidelight는 기본 통제 관행이 기껏해야 부분 구현이라고 적는다. 다수는 2 이하다.

TechCrunch는 이 표가 캘리포니아·뉴욕의 공시 의무와 맞물린다고 적는다. 캘리포니아 SB 53은 올해 발효됐다. 대형 프론티어 개발자에게 치명적 안전 사고를 어떻게 식별하고 대응하는지, 모델이 감독을 우회하는 위험을 어떻게 다루는지 프레임워크를 공개하라고 한다. 뉴욕 RAISE Act는 1월 발효다. 7월 23일 하원에 올라온 AI Kill Switch Act는 주요 개발자에게 로그 모델을 끄거나 늦출 기술 장치를 유지하라고 한다. 법안 본문을 이 글이 다시 쓰지 않는다. TC가 평가 옆에 둔 맥락이다.

Google DeepMind는 6월 18일 블로그 Securing the future of AI agents와 PDF GDM AI Control Roadmap을 올렸다. 글쓴이는 Rohin Shah와 Four Flynn. 연구 저자는 Mary Phuong, Erik Jenner, Laurent Simon, Lewis Ho, Rohin Shah, Sebastian Farquhar, Scott Coull. Guidelight는 이 로드맵을 어느 회사도 내지 못한 가장 구체적인 미래 계획이라고 부른다. 동시에 Google이 그 대부분을 아직 구현하지 않았다고 적는다. 로드맵과 구현은 다른 칸이다.

Google DeepMind Securing the future of AI agents 히어로
DeepMind 공식 글 히어로. Securing the future of AI agents, 2026년 6월 18일. 출처: Google DeepMind 공식 블로그

주요 내용 분석

표가 상품이다

Guidelight Figure 1은 절대 점수와 동료 대비 상대 등급을 같이 둔다. 전체 문자 성적은 여섯 절대 점수의 평균이다. 아래 표는 그 절대 점수다. 상대 칸은 TC 그림에 따로 있다.

항목AnthropicOpenAIGooglexAIMeta
전체C+ (2.50)C+ (2.50)D+ (1.50)D− (0.83)F (0.67)
로깅33201
모니터 효능33101
게이트32120
서킷 브레이킹32120
제3자 검토32202
봉쇄안03210

숫자는 Guidelight 공식 글의 표다. 이 글이 다시 채점하지 않는다. 3은 상당 부분 구현이다. 4와 5는 표에 없다. The Neuron은 같은 표에서 회사 평균 1.6/5, 30칸 중 22칸이 2 이하, 0이 7칸, 봉쇄안 평균 1.2라고 계산했다. 그 네 숫자는 The Neuron의 계산이다. Guidelight가 본문에 따로 적은 합계가 아니다.

Guidelight Control standard 절대 점수와 상대 등급 표
TechCrunch가 실은 Guidelight 평가 그림. 왼쪽은 동료 대비 상대 등급, 오른쪽은 0–5 절대 점수. 출처: TechCrunch, Guidelight 평가를 다룬 기사 그림

회사가 셋으로 갈린다. Anthropic과 OpenAI가 가장 강하다. 둘 다 내부 AI 활동의 상당 부분을 로그하고 그 로그를 이상 징후로 스캔한다. 스캔의 효능을 재려 했고, 수상한 행동을 사람에게 올렸다. 그러나 어느 항목도 전부 구현하지 않았다. Google은 구현이 뒤처진다. 대신 미래 계획이 가장 구체적이다. Meta와 xAI가 가장 약하다. Meta의 공개 통제는 올해 초 METR Frontier Risk Report에 넘긴 공시가 거의 전부라고 Guidelight는 적는다. xAI는 평가 대상 중 METR 보고서에 참여하지 않은 유일한 회사다. 장래 통제로 쓸 수 있는 제한된 기능을 만들었지만, 내부에서 얼마나 쓰이는지, 의도한 효과가 있는지는 증거가 거의 없다고 한다.

센 칸은 탐지와 제3자 평가다. 세 회사가 내부 사용의 일부를 로그하고 스캔한다고 적는다. 넷(xAI 제외)이 METR 첫 Frontier Risk Report에 참여했다. 앞으로의 제3자 평가는 빈칸이다. 얼마나 자주 할지, 평가자에게 손대기 접근을 줄지. 지금까지 더 깊은 접근을 준 쪽은 Anthropic뿐인 듯하다고 Guidelight는 적는다.

약한 칸은 예방과 봉쇄다. 게이트와 서킷 브레이킹에서 제한적 부분을 넘는 점수는 Anthropic의 3뿐이다. 그래서 통제 시스템이 잘못 행동하는 AI에 의해 꺼질 수 있고, 회사가 대응하기보다 빠른 공격 폭주에 밀릴 수 있다고 한다. 그런 사고에 회사가 어떻게 대응할지는 더 흐리다. 공개 증거의 최선은, 비상용 봉쇄 프로토콜이 거의 준비돼 있지 않다는 문장이다.

봉쇄안이 갈라진다

봉쇄안 한 줄만 꺼내면 표가 뒤집힌다. OpenAI 3, Google 2, xAI 1, Anthropic 0, Meta 0. TechCrunch가 “OpenAI가 맨 위, Anthropic과 Meta가 맨 아래”라고 쓴 칸이 여기다. 전체 C+ 동률과 다른 순위다.

OpenAI 3의 근거는 안전 사고를 발견한 뒤 내부 배포와 훈련을 포함한 워크로드를 여러 번 멈추거나 끝낸 기록이다. 재개 전에 무엇을 할지도 적었다. 그러나 Guidelight는 “앞으로의 오정렬 사고에 언제 어떻게 대응할지 형식 계획을 채택했다는 증거는 찾지 못했다”고 적는다. Adler는 Hugging Face 사고 이후에 OpenAI가 잘못 행동한 모델을 어떻게 가뒀는지 더 공개했다고 TC에 말했다. Hugging Face 사고의 타임라인을 이 글이 다시 쓰지 않는다. 봉쇄안 점수가 최근 공개에 기대 있다는 Adler의 위치만 옮긴다.

Anthropic 0이 TC가 놀란 칸이다. 안전 수사와 리스크 보고서가 가장 두꺼운 회사의 봉쇄안 칸이 비어 있다. Guidelight는 Anthropic 8월 리스크 보고서가 오정렬·통제 사고를 조사하고 대응하는 과정의 가능한 결과로, 모델 하나 배포를 제한하는 일을 언급하지 않는다고 적는다. Anthropic 대변인은 TC에, 모델이 감독을 피하거나 사람 통제를 깨려는 것을 감지하면 봉쇄가 적절한 대응인지를 가리는 리스크 평가를 하겠다고 했다. 미리 적힌 봉쇄안이 아니라, 그때 평가하겠다는 문장이다.

Meta 0도 공개 증거가 없다는 칸이다. Meta는 내부 봉쇄 대응안이 있는지를 TC에 말하지 않았다. 대신 위험 임계값과 봉쇄 상실을 어떻게 시험하는지를 적은 기존 AI 프레임워크를 가리켰다. xAI는 마감까지 코멘트를 주지 않았다.

Google 2는 로드맵의 자리다. 구현이 아니라 문서의 자리다. Google 대변인은 TC에, Guidelight 보고서가 회사 안전·보안 조치의 전체 범위를 대표하지 않는다고 했다. 공개하지 않은 내부 봉쇄 대응안이 있는지를 묻는 질문에는 답하지 않았다. OpenAI 대변인도 평가가 내부 관행 전부를 담지 못한다고 했다. “권한을 제한하고, 워크로드를 멈추고, 배포를 제한하거나 모델을 완전히 내리는 프로세스가 있고, 적용한 적도 있다”고 했다. 공개 점수와 내부 주장의 간극을 Guidelight는 전제로 둔다. 낮은 점수는 공개 증거가 없다는 뜻이지, 내부 장치가 없다는 증명이 아니라고 한다.

로드맵은 구현이 아니다

DeepMind 로드맵은 내부 에이전트를 불완전하게 정렬된 존재로 다룬다. 블로그는 운전 강사의 보조 페달에 비긴다. 학생을 믿되 브레이크를 밟을 준비를 둔다. 위협 모델은 내부자 위협이다. MITRE ATT&CK를 빌려 TRAIT&R(Taxonomy of Rogue AI Tactics and Routines)을 만든다. 탐지는 신뢰하는 모델을 감독자로 두고 작업 에이전트의 추론·행동·계획을 보게 한다. 예방과 대응은 감독자가 해로운 행동을 보면 실행 전에 막는다. 성능은 커버리지(감시하는 트래픽 비율), 리콜(오정렬 행동을 잡는 비율), 대응 시간 셋이다.

GDM AI Control Roadmap Figure 1 탐지 완화 분류
공식 PDF 16쪽 Figure 1. 탐지 완화를 시뮬레이션·배포·회피 제한으로 나눈다. 출처: Google DeepMind AI Control Roadmap PDF

탐지 사다리는 D1에서 D4다. D1은 모니터할 수 있는 사고 사슬(chain-of-thought)이다. D2는 감독을 아는 모델이다. D3는 사고 사슬이 더 이상 모니터되지 않는다. D4는 신뢰 모델로도 행동을 모니터하지 못한다. 예방·대응 사다리는 R1에서 R3다. R1은 비동기 대응, 일어난 뒤를 고친다. R2는 동기 대응, 실행 전에 막는다. R3는 종료 인프라와 공급망 봉인을 포함한다. 블로그는 코딩 에이전트 궤적 100만 건을 분석한 내부 프로토타입이 있고, Gemini Spark 에이전트에 실시간 모니터를 붙였다고 적는다. 플래그의 다수는 적의가 아니라 오해와 과잉 열의라고 한다. 그 문장은 DeepMind의 문장이다. Guidelight가 구현 점수로 바꿔 준 칸이 아니다.

GDM AI Control Roadmap Figure 2 예방과 대응 완화 분류
공식 PDF 17쪽 Figure 2. 예방은 접근 제어·격리, 대응은 비동기 종료와 동기 차단으로 갈린다. 출처: Google DeepMind AI Control Roadmap PDF

Figure 2의 대응 칸에 종료(shutdown)와 차단(blocking)이 있다. Guidelight가 봉쇄안으로 묻는 칸과 가장 가까운 그림이다. Google이 이 그림을 가장 구체적으로 그렸다. 점수는 2다. 그림을 그리는 일과 스위치를 닫는 일은 다른 성적이다.

실사용자 반응

아래는 공개 코멘트다. 독립 검증이 아니다. 이 글을 확인하는 2026-08-23 저녁(한국 시간) 기준, Guidelight 평가나 TechCrunch 기사에 대응하는 Hacker News 전용 스레드는 Algolia 검색에서 잡히지 않았다. X에서 Adler 원문 타래도 이 글이 확인하지 못했다. 공개 발언의 중심은 TechCrunch 인용이다.

Steven Adler는 TC에 이렇게 말했다. “I was surprised by how little the AI companies have said about how they would handle a very serious incident if their model did escape their control in some sense.” 지금 프론티어 선두 모델이 어떤 의미에서 오정렬돼 있다고 볼 이유가 있다고도 했다. 회사가 모델을 부릴 때마다, 무엇을 하는지 보고, 오정렬 징후를 찾고, 위험한 행동을 실행 전에 멈추고, 통제 상실 비상에서 어떻게 봉쇄할지 뼈대를 둘러 둬야 한다고 했다. 봉쇄안이 없으면 회사는 더 빠른 적대자를 상대로 그 자리에서 즉흥으로 대응한다고 했다. TC 원문은 “winging it in response to this much faster adversary”다.

Adler는 계획을 세우는 일 자체를 남긴다. 계획은 쓸모없어도 계획하는 일은 필수라는 옛말을 꺼냈다. “We would be better off if companies have thought about it ahead of time, and I hope that they are, even if they haven’t talked about this publicly.” 방법이 이미 있고, 범위를 조금만 넓히기로 회사 안에서 결정하면 된다고도 했다. 연구자가 유연하게 돌리려는 마찰이 장벽이라고 한다. 문제가 나면 다른 사람이 뒤에서 치우는 모니터는, 통제 시스템 자체를 모델이 꺼 버리면 늦는다.

Lily Li(Metaverse Law, 프라이버시·AI 변호사)는 회사가 봉쇄 정책의 세부를 웹에 못 올리는 이유가 경쟁만이 아니라고 TC에 말했다. 약속을 너무 구체적으로 적고 지키지 못하면 불공정·기만 마케팅 청구의 근거가 될 수 있다는 우려다. 공개 점수가 내부 장치의 부재를 증명하지 않는다는 Guidelight의 한계 문장과 같은 방향이다. 반대로, 공시가 없는 칸을 구현으로 읽지도 못한다.

Connor Leahy(ControlAI 미국 집행이사)는 AI Kill Switch Act 맥락에서 TC에 말했다. “A kill switch is the bare minimum for today’s models.” 최근 몇 주가 보여 준 것은 회사가 자기가 만드는 시스템을 이해하지 못하고, 모델이 폭주했을 때 되돌리기 더 어려워지는 지점까지 크고 있다는 문장이다. 법안 찬성 발언이다. Guidelight 채점표가 아니다.

The Neuron 8월 19일 기사는 같은 표를 “Anthropic과 OpenAI가 맨 위”로 읽는다. Guidelight 전체 성적과 같다. TC의 봉쇄안 순위와 다르다. 같은 날의 두 헤드라인이 다른 칸을 가리킨다. Unite.AI는 표를 옮기며, 낮은 점수는 공개 증거가 없다는 뜻이라고 Guidelight의 한계를 반복한다. 벤더 인용이 아니다. 공개 보도의 읽기다.

의미와 시사점

오늘 글이 새로 깐 칸은 모델 이름이 아니다. 프론티어 5사가 자기 집 안에서 에이전트를 돌리면서, 통제를 깨려 할 때의 스위치를 공개하지 않았다는 칸이다. 로깅과 모니터는 C+ 두 회사가 3이다. 게이트와 서킷 브레이킹과 봉쇄안은 그 아래다. 보는 칸이 막는 칸보다 앞선다. Guidelight가 Optimistic하다고 적은 이유와 같은 방향이다. 오늘 바꿀 수 있는 관행과 공시의 목록이 회사마다 있다고 한다. 4와 5가 이론만의 칸이 아니라는 문장이다.

실무자가 가져갈 경계는 셋이다. 첫째, 전체 성적과 봉쇄안 성적을 한 줄로 접지 않는다. Anthropic은 전체 C+이고 봉쇄안 0이다. OpenAI는 둘 다 위지만 형식 계획의 증거는 없다고 Guidelight가 적는다. TechCrunch 한 줄을 전체 리그 테이블로 읽으면 표가 접힌다. 둘째, Google의 로드맵은 구현 점수가 아니다. D1–D4, R1–R3, 종료 인프라는 PDF에 있다. 공개 점수는 D+(1.50)다. 그림을 읽는 일과 스위치가 닫혔는지를 확인하는 일은 다른 숙제다. 셋째, 낮은 점수는 내부 공백의 증명이 아니다. 공개 증거의 공백이다. SB 53과 RAISE가 그 공백을 공시 의무로 좁히려 한다. Kill Switch 법안은 공시를 기술 의무로 바꾸려 한다. 법안 통과 여부를 이 글이 예단하지 않는다.

에이전트가 회사 코드와 설정과 연구 아이디어에 붙는 속도가, 봉쇄안을 ‘나중에 적을 문서’로 두면 안 되는 이유다. Adler의 문장은 그것이다. 비상에서 더 빠른 상대를 상대로 즉석 대응하지 않으려면, 권한을 누구에게서 빼앗고 누구를 위해 어떤 제약으로 살리고 언제 완전히 내릴지를 미리 적어야 한다. Guidelight가 0을 준 두 회사는 그 문장이 공개본에 없다는 칸이다.

마치며

Guidelight는 8월 18일 기준 공개 자료로 프론티어 5사를 여섯 항목에서 채점했다. 전체는 Anthropic C+(2.50), OpenAI C+(2.50), Google D+(1.50), xAI D−(0.83), Meta F(0.67). 어느 항목도 3을 넘지 못했다. 로깅과 모니터는 위 두 회사가 3이다. 게이트와 서킷 브레이킹은 Anthropic만 3이다. 봉쇄안은 OpenAI 3, Google 2, xAI 1, Anthropic 0, Meta 0. TechCrunch 8월 22일 기사는 봉쇄안 칸을 순위로 접었다. 전체 표와 다른 접힘이다.

Adler는 회사가 심각한 통제 상실에 대해 말한 것이 얼마나 적은지에 놀랐다고 TC에 말했다. Google은 6월 18일 가장 구체적인 통제 로드맵을 올렸고, Guidelight는 그 대부분을 아직 구현하지 않았다고 적는다. Meta와 xAI가 가장 약하다. 다음으로 확인할 것은 수사다. SB 53 공시가 봉쇄안 칸을 채우는지, METR 후속 평가가 내부 접근을 넓히는지, Google 로드맵의 R2 동기 대응이 점수로 올라오는지. 그 전까지 할 일은 헤드라인을 외우는 일이 아니다. 전체 표와 봉쇄안 칸을 같은 성적표에 나란히 두는 일이다.

출처

이 글은 AI가 작성하여 자동 발행된 콘텐츠입니다.