31B가 400B를 따라잡다: Gemma 4가 다시 그린 오픈소스 AI 지도

Google DeepMind의 Gemma 4 31B Dense 모델이 400B 클로즈드 모델을 추월했다. AIME 89.2% 달성으로 오픈소스 AI의 프론티어 추격이 수치로 증명됐다.

31B 모델이 400B 클로즈드 모델을 능가하는 Gemma 4 오픈소스 AI 다이어그램

핵심 요약 (TL;DR)

Google DeepMind가 4월 2일 Gemma 4 패밀리를 Apache 2.0 라이선스로 공개했다. 라인업은 E2B·E4B 같은 경량 모델부터 26B MoE, 31B Dense까지 폭넓다. 31B Dense 모델은 일부 벤치마크에서 약 400B 규모의 클로즈드 모델을 추월했고, AIME 수학 벤치마크에서는 89.2%를 기록해 직전 세대 20.8%에서 큰 폭으로 점프했다. 멀티모달(오디오·비전), 256K 컨텍스트, 140개 언어 지원이 기본 사양이다. "오픈소스가 클로즈드 프론티어를 따라잡고 있다"는 명제가 이번에는 더 이상 수사가 아니라 측정 가능한 사실로 자리 잡았다.

배경 및 맥락

Gemma 시리즈는 Google이 Gemini와는 별개의 트랙으로 운영해온 오픈 가중치(open-weight) 라인업이다. Gemini가 자사 클라우드와 제품에 통합된 폐쇄형 프런트라인이라면, Gemma는 외부 개발자·연구자가 자유롭게 다운로드·파인튜닝·재배포할 수 있는 일종의 '커뮤니티 게이트웨이'다.

지난 1년 동안 오픈소스 진영의 흐름은 분명했다. Meta의 Llama 4, Mistral, Qwen 시리즈가 차례로 발표되며 "비교는 가능하지만 따라잡았다고 말하긴 어렵다"는 평가가 굳어져 있었다. 평가 격차는 특히 추론·코드·수학 벤치마크에서 두드러졌다.

Gemma 4는 그 구도를 한 차례 흔드는 발표다. 단일 모델로 모든 격차를 메웠다고 주장하기보다는, "특정 사이즈에서 특정 작업의 우위를 가진다"는 형태로 영향력을 분산시켰다.

주요 내용 분석

라인업 설계의 의도

Gemma 4는 한 모델이 아니라 패밀리다. E2B·E4B는 모바일·엣지 환경을 겨냥한 경량 모델이며, 26B는 Mixture-of-Experts 구조로 추론 비용을 낮추면서 표현력을 유지한다. 31B Dense 모델은 가장 무거운 옵션이지만, Apache 2.0이라는 라이선스 덕분에 기업이 그대로 가져다 자체 인프라에서 운영할 수 있다.

모델파라미터구조컨텍스트멀티모달권장 용도
Gemma 4 E2B2BDense32K텍스트모바일·엣지
Gemma 4 E4B4BDense64K텍스트+비전경량 서버
Gemma 4 26B26BMoE128K오디오+비전효율형 서버
Gemma 4 31B31BDense256K오디오+비전고난도 추론

31B가 400B를 능가했다는 의미

Google이 강조한 수치는 31B Dense 모델이 일부 벤치마크에서 약 400B 규모로 알려진 클로즈드 경쟁 모델을 앞질렀다는 것이다. 모든 작업에서 우위라는 뜻은 아니다. 다만 동일 작업에서 12배가량 작은 모델이 견줄 만한 결과를 낸다는 사실은, 추론 비용·운영 비용·재현 가능성 측면에서 다른 차원의 가치를 만든다.

특히 눈에 띄는 지표는 AIME 89.2%다. 직전 세대 Gemma의 20.8%에서 4배 이상 점프한 수치로, 단순 스케일 효과가 아니라 학습 데이터·체인오브소트 훈련 방식의 변화가 있었음을 시사한다.

멀티모달과 컨텍스트

Gemma 4는 텍스트뿐 아니라 오디오·비전 입력을 처리한다. 256K 컨텍스트와 140개 언어 지원도 더해졌다. 즉, 오픈 가중치 모델이 더 이상 "텍스트만 가능한 작은 모델"이 아니라, 폐쇄 모델과 동일한 입력 모달리티를 지원하는 옵션이 됐다는 뜻이다.

실사용자 반응

HuggingFace 커뮤니티와 Reddit r/LocalLLaMA의 반응을 종합하면 평가는 대체로 긍정에 가깝다.

  • 개발자 호평: "31B가 단일 H100 카드에서 합리적 속도로 돌아간다", "양자화(quantization) 후에는 24GB GPU에서도 실용 가능"이라는 후기가 다수.
  • 신중론: "AIME 점수의 비약적 상승은 데이터 누수 가능성도 검증해야 한다"는 평가도 함께 올라왔다. 벤치마크 신뢰성에 대한 학습 데이터 오염 의심은 오픈소스 모델이 늘 마주하는 검증 과제다.
  • 활용 사례: 멀티모달과 긴 컨텍스트 덕분에 사내 문서 분석, 회의록 처리, 다국어 고객 지원 같은 실제 워크로드에 빠르게 투입되는 사례가 보고되고 있다.

전반적으로 "Gemma 4는 클로즈드 모델의 절대 우위를 흔드는 첫 사례가 아니라, 그 흐름을 굳히는 신호"라는 평이 우세하다.

의미와 시사점

오픈소스 AI가 의미 있는 영역은 두 가지다. 하나는 비용·운영 통제력이고, 다른 하나는 재현 가능성과 감사 가능성이다. Gemma 4는 이 두 축을 모두 강화한다. 모델 가중치를 직접 보유하면서도 멀티모달·긴 컨텍스트·강한 추론 성능을 함께 가져갈 수 있게 됐다.

기업 입장에서는 의사결정의 균형추가 다시 움직인다. 그동안 "프론티어 성능이 필요하면 클로즈드 API, 비용·통제가 필요하면 오픈소스"라는 이분법이 통용됐다면, Gemma 4 이후로는 "특정 작업·특정 규모에서는 오픈소스가 충분히 프론티어"라는 선택지가 추가된다.

마케팅·콘텐츠 자동화처럼 모델 호출 빈도가 매우 높은 도메인에서는 이 변화가 더 직접적이다. 동일 품질의 생성·분석을 자체 인프라에서 운영할 수 있다면, 단가 구조와 데이터 거버넌스 두 가지를 동시에 개선할 여지가 생긴다.

마치며

Gemma 4는 한 번에 판을 뒤집는 모델이라기보다, 그동안 누적되어 온 오픈소스 진영의 점진적 추격이 마침내 가시화된 분기점에 가깝다. 이제 질문은 "오픈소스가 따라잡을 수 있는가"가 아니라 "어느 작업, 어느 규모에서 오픈소스가 더 합리적인가"로 옮겨가고 있다.

이 글은 AI가 작성하여 자동 발행된 콘텐츠입니다.