프론티어가 로컬로 내려오다: Qwen3.8-27B가 다시 쓴 배포의 공식
Alibaba Qwen 팀이 8월 14일 Apache 2.0으로 27B 밀집 멀티모달 모델 Qwen3.8-27B의 가중치를 공개했다. 독립 벤치마크에서 클라우드 전용 모델과 같은 점수대에 올라서며, 프론티어급 코딩·에이전트 작업이 더 이상 API 뒤에만 있지 않음을 보여줬다.
핵심 요약 (TL;DR)

Alibaba Qwen 팀이 8월 14일 Hugging Face와 ModelScope에 Qwen3.8-27B 가중치를 Apache 2.0으로 공개했다. 27B 밀집 멀티모달 모델은 텍스트·이미지·비디오를 받고, 262,144토큰 네이티브 컨텍스트를 YaRN으로 100만 토큰까지 확장할 수 있다. 사측 벤치마크에서 SWE-bench Pro 61.7, LiveCodeBench v6 90.3, OSWorld-Verified 84.3을 기록했고, 독립 평가사 Artificial Analysis의 Intelligence Index에서는 52점을 받아 클라우드 전용 모델 GPT-5.6 Luna(최대 추론 설정)와 같은 점수대에 올라섰다. 같은 주 공개된 플래그십 Qwen3.8-2.4T-A95B는 커스텀 라이선스로 매출 상한을 걸었다. 27B가 실제로 돌아가는 모델이고, Max가 통행료인 이 이중간이 이번 발표의 핵심이다.
배경 및 맥락
2026년 오픈 가중치 경쟁은 더 이상 "클로즈드 프론티어를 따라잡을 수 있는가"라는 한 줄짜리 질문이 아니다. 4월 Gemma 4가 31B Dense로 그 질문을 수치화했다면, 그 이후의 쟁점은 배포였다. Hugging Face가 올해 상반기 다운로드를 집계한 결과, 70B를 넘는 거대 모델의 실제 사용 비중은 작다. 개발자가 매일 돌리는 모델은 워크스테이션과 단일 GPU에 들어가는 쪽이다.
Qwen 시리즈는 그 지점을 가장 집요하게 공략해 온 라인업이다. Alibaba Cloud는 8월 17일 공식 블로그에서 Hugging Face 기준 Qwen 파생 모델이 151,448개, 올해 1~7월 다운로드가 20억 4,500만 회라고 인용했다. "개발자가 파인튜닝·배포할 기본 모델"이 되었다는 자체 평가다. Qwen3.8-27B는 그 기본 모델을 에이전트 코딩과 컴퓨터 사용 쪽으로 한 단계 밀어 올린 버전이다.
동시에 Alibaba는 같은 세대의 플래그십 Qwen3.8-2.4T-A95B(총 2.4조, 활성 950억) 가중치도 공개했다. 오픈 가중치처럼 보이지만 라이선스는 Apache 2.0이 아니다. 27B는 자유롭게 돌리고, Max는 일정 규모 이상에서 따로 계약하라는 구조다.
주요 내용 분석
27B가 실제로 하는 일
공식 모델 카드에 따르면 Qwen3.8-27B는 비전 인코더를 붙인 Causal Language Model이다. 64층, 은닉 차원 5120, Gated DeltaNet과 Gated Attention을 섞은 하이브리드 레이아웃이다. Multi-Token Prediction을 훈련에 넣었고, thinking 모드는 기본 켜짐이다. 추론 깊이는 reasoning_effort로 xhigh(기본값)·medium·low를 고를 수 있다.
사측이 모델 카드에 올린 비교표에서 눈에 띄는 숫자는 코딩과 컴퓨터 사용이다. SWE-bench Pro 61.7은 표에 적힌 Claude Opus 4.6 Max(53.4, 공식 발표치)를 웃돈다. DeepSWE 1.1은 직전 세대 Qwen3.6-27B의 13.3에서 42.2로 뛰었다. OSWorld-Verified는 84.3으로 Opus 4.6 Max의 72.7을 앞선다. 반대로 Terminal Bench 2.1(73.0 vs 78.2), GPQA Diamond(89.2 vs 91.3), Humanity's Last Exam(30.8 vs 40.0)에서는 Opus가 앞선다. 즉 사측 표만 봐도 "모든 면에서 프론티어를 꺾었다"는 말은 성립하지 않는다. 이긴 축은 에이전트 코딩과 화면 조작이고, 가장 어려운 추론은 아직 클로즈드 쪽이 강하다.
게다가 SWE-bench Pro 각주는 중요하다. Opus를 제외한 나머지 모델은 Claude Code 하네스, temperature 1.0, 256K 컨텍스트로 다시 돌린 값이다. 하네스가 다르면 순위가 움직인다. 사측 숫자는 출발점이지 확정 순위가 아니다.
독립 평가가 바꾼 대화
대화가 바뀐 것은 사측 표가 아니라 사흘 뒤 올라온 제3자 점수다. Artificial Analysis는 Qwen3.8-27B에 Intelligence Index 52점을 줬다. 코딩·과학·추론·직무 과제를 묶은 9개 평가의 합성 지수로, 같은 사이즈 오픈 가중치 중앙값 9를 크게 웃돈다. VentureBeat는 이 점수가 OpenAI의 저가 티어 GPT-5.6 Luna(최대 추론 설정)와 같고, Agentic Index 51점은 Claude Opus 4.8(최대 추론)을 앞선다고 전했다.
같은 페이지가 같이 보여 주는 숫자는 대가다. Intelligence Index 평가에서 이 모델이 만든 출력 토큰은 1억 6,000만 개로, 비교군 중앙값 4,300만 개의 약 3.7배다. 품질의 일부를 긴 사고 과정으로 사고 있다는 뜻이다.
라이선스가 갈라진 이유
27B는 Apache 2.0이다. 수정·재배포·상업적 사용이 라이선스 조건 안에서 가능하다. 반면 플래그십 2.4T 모델은 Qwen3.8-Max 라이선스를 쓴다. 사우스차이나모닝포스트와 eWeek에 따르면, Model as a Service 또는 AI 워크 어시스턴트 사업의 연속 12개월 합산 매출이 5천만 달러를 넘으면 별도의 상업 라이선스를 받아야 한다. 내부 사용은 제외다. 국제 API 가격은 입력 100만 토큰당 2달러, 출력 6달러로 보도됐다.
| 항목 | Qwen3.8-27B | Qwen3.8-Max (2.4T-A95B) |
|---|---|---|
| 구조 | 27B Dense + 비전 인코더 | 2.4T MoE, 활성 95B |
| 라이선스 | Apache 2.0 | Qwen3.8-Max 커스텀 |
| 상용 조건 | 상업적 사용·재배포 가능 | MaaS·AI 어시스턴트 연매출 5천만 달러 초과 시 별도 계약 |
| 컨텍스트 | 262,144 (YaRN으로 1M) | 최대 1M |
| 입력 | 텍스트·이미지·비디오 | 공개 가중치는 텍스트 |
| 현실적 배포 | 양자화 시 고사양 워크스테이션 | 대규모 GPU 클러스터 |
이 표가 보여주는 것은 성능 차이가 아니라 제품 설계다. 실제로 다운로드되고 로컬에서 도는 모델에는 자유를 주고, 인프라 사업이 될 수 있는 거대 모델에는 통행료를 다는 방식이다. 오픈소스 선언과 플랫폼 과금이 한 세대 안에 공존한다.
실사용자 반응
개발자 반응은 벤치마크 표보다 배포 경험에서 갈렸다.
- 코딩 에이전트 진영: 오픈소스 코딩 에이전트 Cline은 VentureBeat 보도 기준으로 "로컬 모델이 프론티어급 점수를 받은 것은 이번이 처음"이라고 평가했다. 클라우드 API 없이 에이전트 루프를 돌릴 수 있다는 점이 핵심이었다.
- 로컬 실사용자: 개발자 Simon Willison은 약 17GB Q4_K_M 양자화본을 M5 Max MacBook Pro와 NVIDIA DGX Spark에서 돌려, 코드 작성·이미지 해석·코딩 에이전트 루프를 확인했다. "17GB 파일이 집 컴퓨터에서 이 모든 일을 한다"는 반응이 나왔다. 다만 기본값 xhigh에서는 간단한 SVG 요청에 21분, 추론 토큰 2만 개 이상이 쓰였다고 했다. 일상 사용에는 low 또는 non-thinking을 권했다.
- 속도·비용 회의: Artificial Analysis의 토큰 과다 수치와 맞물려, 품질은 올라도 벽시계 시간과 토큰 비용이 커진다는 지적이 반복됐다. VentureBeat가 전한 Tomasz Tunguz의 소규모 비교에서는 추론을 켠 Qwen이 DeepSeek V4 Flash보다 품질은 앞섰지만 약 30배 느리고 4.5배 비쌌다. 표본 9개는 결론을 내기엔 부족하다는 단서가 붙었다.
사용량 자체는 빠르다. Alibaba는 공개 이틀 만에 Hugging Face 좋아요 상위 5위에 들었다고 밝혔고, VentureBeat는 Cybernews를 인용해 사흘 만에 다운로드 300만을 넘겼다고 전했다. Reddit r/LocalLLaMA에는 양자화·설정·비교를 모으는 전용 스레드가 열렸다.
의미와 시사점
이번 공개가 중요한 이유는 새 벤치마크 한 줄 때문이 아니다. 프론티어급에 가까운 코딩·에이전트 작업이, 검사하고 수정하고 방화벽 뒤에 둘 수 있는 파일로 내려왔다는 점이다. VentureBeat가 정리한 메모리 규모는 BF16 약 56GB, FP8 약 28GB, 4비트 양자화 약 17GB다. 기업 관점의 비교 대상은 "Claude를 이겼는가"가 아니라 "어떤 업무를 API 호출 없이 내부에서 끝낼 수 있는가"다. 개인정보, 코드베이스, 규제 데이터가 밖으로 나가지 않는다는 조건이 가격보다 클 때가 있다.
동시에 라이선스 이중간은 오픈 가중치 전략의 다음 문법을 보여 준다. 27B는 유입 경로이고, Max는 규모가 커진 뒤의 과금 지점이다. 스타트업과 내부 도구에는 자유를 주고, 경쟁 인프라가 될 수 있는 사업에는 계약을 요구한다. "오픈소스인가"라는 이분법보다 "어느 사이즈까지 자유인가"가 더 정확한 질문이 됐다.
실무적으로는 기본 추론 설정을 그대로 쓰면 안 된다. 공식 카드도 멀티턴 에이전트에서 추론을 낮추면 재시도가 늘어 총 지연이 커질 수 있다고 적었다. 반대로 단순 질의에 xhigh를 켜 두면 토큰과 시간만 낭비한다. 모델 선택이 아니라 추론 깊이 운영이 비용의 변수가 된 것이다. vLLM·SGLang·TokenSpeed 서빙 레시피가 공개되어 있으므로, 도입 판단은 리더보드가 아니라 자체 워크로드에서 thinking on/off를 나눠 재는 쪽이 맞다.
마치며
Qwen3.8-27B의 점수는 앞으로 몇 주 안에 독립 재현과 하네스 차이에 따라 움직일 것이다. 사라지지 않을 사실은 다른 쪽에 있다. 프론티어처럼 보이던 코딩·에이전트 작업이 워크스테이션 메모리 안으로 들어왔고, 그 바로 위 칸에는 통행료가 붙었다. 오픈소스 AI의 다음 단계는 더 큰 모델이 아니라, 자유롭게 돌릴 수 있는 모델과 계약해야 하는 모델이 한 세대 안에서 갈라지는 일이다.
이 글은 AI가 작성하여 자동 발행된 콘텐츠입니다.