환각을 샌드박스로 잡는다: 구글이 Mantis 하네스를 연 이유

2026년 9월 2일 Google Cloud가 Mantis를 오픈소스 보안 리뷰 하네스로 공개했다. 참양성 7% 미만 문제를 계층 요약·비판·샌드박스 재현으로 줄이려는 설계다.

환각을 샌드박스로 잡는다: 구글이 Mantis 하네스를 연 이유

핵심 요약 (TL;DR)

환각을 샌드박스로 잡는다: 구글이 Mantis 하네스를 연 이유
생성 커버. 환각 신호와 샌드박스 검증을 대비한 개념도. 로고·텍스트 없음.

2026년 9월 2일, Google Cloud가 Mantis를 오픈소스 보안 리뷰 하네스(harness, 에이전트를 감싸 스킬·기억·보안을 붙이는 뼈대)로 공개했다. 한 줄로 정리하면 이렇다. 코딩 에이전트용 모듈형 보안 스킬 모음이 저장소 맥락을 쌓고, 비판·리뷰 에이전트로 노이즈를 걸러내며, 격리된 샌드박스에서 재현해 검증한 뒤에야 패치 후보로 넘긴다.

공식 글이 강조한 숫자는 두 개다. 단순한 AI 코드 스캔의 참양성(true positive)이 7% 미만으로 떨어질 수 있다는 문제 인식, 그리고 파일→디렉터리→저장소로 쌓는 계층형 보안 요약 트리로 토큰 오버헤드를 85% 이상 줄였다는 설계 주장. GitHub는 google/mantis, 설치는 npx skills add google/mantis. 라이선스는 Apache-2.0. README는 “공식 지원 Google 제품이 아니다”고 명시한다.

배경 및 맥락

환각을 샌드박스로 잡는다: 구글이 Mantis 하네스를 연 이유
Mantis 공식 일러스트. 출처: Google Cloud Blog (Getting started with the Mantis harness)

공격 쪽 AI가 취약점을 기계 속도로 찾는 환경에서, 방어도 같은 속도로 맞춰야 한다는 게 Google Cloud CISO Perspectives(2026-06-29)의 전제다. 그 글에서 Mantis는 내부 자율 SDLC 보안의 핵심 프레임으로 소개됐고, 핵심 스킬을 오픈소스로 공개한다고 예고했다. 9월 2일 Nick Galloway·Yulong Zhang의 Getting Started 글이 그 공개를 실행 단계로 옮긴 셈이다.

문제의 핵심은 “AI가 코드를 읽는다”가 아니다. 그럴듯한 취약점 서사를 많이 만들어 내면서도, 실제로 도달 가능한 결함은 적다는 점이다. 공식 표현대로라면 환각 버그와 낮은 참양성이 기본값에 가깝다. Mantis의 설계 포인트는 모델 하나를 더 세게 돌리는 게 아니라, 맥락 구축 → 조사 → 중복 제거 → 리뷰/비판 → 샌드박스 재현 → 패치라는 파이프라인으로 검증 단계를 강제하는 쪽에 있다.

환각을 샌드박스로 잡는다: 구글이 Mantis 하네스를 연 이유
에이전트 기반 Secure SDLC 흐름(디자인·스캔·퍼즈·패치·포스처). 출처: Google Cloud Blog (Cloud CISO Perspectives)

주요 내용 분석

항목내용
공개2026-09-02 · Google Cloud Blog (Getting started with the Mantis harness)
성격코딩 에이전트용 보안 리뷰 스킬·하네스. 고정 제품보다 시작점·튜닝 가능한 모음
저장소github.com/google/mantis · Apache-2.0 · 스타 약 1천(조회 시점)
설치npx skills add google/mantis 또는 클론 후 에이전트에 경로를 알려 사용
문제 인식단순 AI 코드 스캔의 참양성 <7%, 환각 버그
맥락 압축계층형 보안 요약 트리로 토큰 오버헤드 85%+ 감소 주장
검증critic·review 에이전트 + 격리 샌드박스 재현으로 근거(grounding)
모델 전략분류·중복제거는 flash/lite, 재현·패치는 더 강한 모델 — 단계별 티어링
호환Gemini CLI · Antigravity CLI · Google ADK 등 코딩 에이전트 프레임
한계·주의공식 지원 제품 아님 · 전문가 수동 검증 필수 · 격리 환경에서만 실행 권고

계층 요약이 먼저다

대형 저장소를 통째로 넣으면 토큰이 먼저 터진다. Mantis는 파일 단위를 디렉터리·루트 요약으로 말려 계층형 보안 요약 트리를 만든다. 에이전트는 요약으로 전체 지도를 보고, 필요한 구간에만 원문을 파고든다. 공식 수치는 “구조 정보를 지키면서 토큰 오버헤드 85% 이상 감소”. 숫자가 절대 벤치마크라기보다, 브루트포스 인제스트를 거부한다는 설계 선언에 가깝다.

그 앞단에는 히스토리·아키텍처·위협 모델 스킬이 있다. 과거 보안 수정, 의존성 그래프, 위협 모델을 마크다운 지식 베이스로 쌓은 뒤 조사 로드맵을 짠다. 전략가(strategist)가 우선순위를 고르고, 리서치 에이전트가 데이터·제어 흐름과 살균(sanitization) 로직을 깊게 본다 — CISO 글과 README_AGENTS가 같은 뼈대를 그린다.

리뷰·비판·재현이 ‘참양성’을 만든다

환각을 샌드박스로 잡는다: 구글이 Mantis 하네스를 연 이유
google/mantis GitHub Open Graph. 출처: GitHub

파이프라인 후반은 노이즈 제거다. mantis-dedupe로 겹치는 이슈를 묶고, mantis-review가 규칙 기반 네거티브 필터로 흔한 오탐을 걸러내며, mantis-critic이 운영에 의미 있는 이슈인지 다시 본다. 그다음이 핵심이다. 모델의 “있을 법한 설명”만으로 끝내지 않고, 격리된 환경에서 재현해 근거를 남긴다. 재현이 된 뒤에야 패치 후보(mantis-patch)로 넘어가는 구조다.

공식 가이드는 모델도 단계별로 나누라고 한다. 빠른 분류·중복 제거에는 flash/lite, 재현·패치처럼 깊은 문맥이 필요한 단계에는 더 강한 모델을 쓰라는 식이다. HydraFusion이 “요청마다 워크플로를 고른다”면, Mantis는 보안 파이프라인의 단계마다 모델 등급을 고른다.

환각을 샌드박스로 잡는다: 구글이 Mantis 하네스를 연 이유
Getting Started 글 배너. 출처: Google Cloud Blog (Getting started with the Mantis harness)

시작은 쉽고, 운영은 엄하다

Getting Started의 진입 장벽은 낮다. 저장소를 클론하거나 npx skills add google/mantis로 스킬을 넣은 뒤, 코딩 에이전트에 “이 경로의 Mantis로 내 코드를 리뷰해 달라”고 요청하면 된다. 내부에서도 같은 프롬프트로 실제 취약점을 찾았다고 적혀 있다. 다만 README의 경고는 길고 강하다. 격리·제한된 환경에서만, 자동 승인 플래그 없이, 생성 코드는 호스트가 아니라 네트워크 차단 컨테이너/샌드박스에서, 모든 결과는 보안 전문가가 수동 검증. 오픈소스 메인테이너에게 미검증 AI 리포트를 대량 접수하지 말라는 문장도 있다.

공개 범위도 짚을 필요가 있다. CISO 글은 “내부에는 더 풀스펙 버전이 돌고, 지금 연 것은 핵심 스킬”이라고 구분한다. README도 “공식 지원 Google 제품이 아니며 Google OSS VRP 대상이 아니다”고 못 박는다. 즉 이 드롭은 방어 쪽 에이전트 보안 리뷰의 레시피 공개에 가깝고, Google 내부 가드레일 전체를 그대로 내놓은 것은 아니다.

실사용자 반응

공개 직후 1차 반응은 세 갈래로 읽힌다. 첫째, 스킬·하네스 물결과의 정합. 최근 GitHub Daily가 에이전트 스킬·하네스로 채워진 가운데, Google이 보안 도메인 스킬 모음을 npx skills add 경로로 푼 점이 눈에 띈다. 둘째, 참양성·샌드박스 강조에 대한 환영. InfoQ 등 2차 보도도 “재현 루프로 오탐을 줄인다”는 메시지를 전면에 올렸다. 셋째, 운영 비용·책임. 격리 VM, gVisor, 전문가 검증, 네거티브 필터 튜닝이 전제라 “클론만 하면 끝나는 보안 제품”으로 읽으면 공식 README와 어긋난다. 장기 현장 리뷰는 아직 얇다. 스타는 빠르게 늘었지만, 실제 파이프라인을 조직에 맞게 잘라 쓴 사례가 쌓이는 구간이다.

의미와 시사점

첫째, 코딩 에이전트 경쟁의 단위가 다시 한 번 모델이 아니라 하네스로 이동한다. 무엇을 입히고(스킬), 어떻게 감싸며(격리·승인), 어떤 단계에 어떤 모델을 쓸지가 제품 차이다.

둘째, 보안 AI의 성적표가 “찾은 이슈 수”에서 참양성·재현 근거로 바뀐다. 7% 미만이라는 자기 고백은 마케팅보다 설계 동기에 가깝다. 재현 없는 리포트는 부채라는 메시지다.

셋째, 오픈과 내부의 경계가 분명하다. 핵심 스킬은 열렸고, 풀스펙·상시 가드레일은 내부에 남는다. 조직이 가져갈 것은 완성품보다 파이프라인 계약(스테이지 간 입출력)·네거티브 필터·샌드박스 기준이다.

넷째, 책임 있는 사용이 기능 목록만큼 길다. 미검증 AI 리포트 남발 금지, 격리 실행, 인간 검증 — 이게 빠진 채 “자동 버그헌팅”으로만 소비되면 방어 도구가 소음 생성기로 뒤집힌다.

마치며

Mantis의 헤드라인은 새 스캐너가 아니다. 환각을 파이프라인과 샌드박스로 묶는 보안 리뷰 하네스다. 9월 2일 Getting Started와 google/mantis 드롭은, 내부에서 쓰던 기계 속도 방어의 핵심 스킬을 밖으로 내놓은 사건이다. 숫자(참양성 <7%, 토큰 −85%)는 방향을 보여 주고, README의 경고문은 운영 조건을 보여 준다. 클론은 쉽고, 안전하게 돌리는 일은 여전히 팀의 몫이다.

출처: Google Cloud Blog — Getting started with the Mantis harness · Cloud CISO Perspectives (2026-06-29) · github.com/google/mantis · InfoQ

이 글은 AI가 작성하여 자동 발행된 콘텐츠입니다.