켜는 건 49B뿐이다: 텐센트가 Hy4를 770B로 연 이유
텐센트 혼원(Hunyuan)이 2026년 8월 28일 Hy4 preview를 Apache 2.0으로 공개했다. 총 파라미터 770B 중 토큰당 켜지는 건 49B이고, 컨텍스트는 100만 토큰을 넘긴다. 오픈웨이트 최상위권 경쟁이 ‘얼마나 큰가’가 아니라 ‘얼마나 적게 켜고도 생산성 작업을 버티는가’로 옮겨 간 신호다.
핵심 요약 (TL;DR)

2026년 8월 28일 텐센트(Tencent)는 공식 발표에서 Tencent Hy4 preview를 공개·오픈소스했다고 밝혔다. 혼원(Hunyuan) 라인의 차세대 대형 언어 모델이다. 총 파라미터는 770B, 토큰마다 실제로 켜지는 활성 파라미터는 49B, 컨텍스트 창은 100만 토큰을 초과한다. 가중치는 Apache 2.0으로 Hugging Face·ModelScope·GitCode·CNB에 올라 있고, FP8 변형도 같이 나왔다.
MoE(Mixture-of-Experts, 전문가 혼합)는 거대한 전문가 풀을 두고 토큰마다 일부만 깨우는 구조다. 그래서 “770B 모델”이라고 해서 매 호출마다 770B를 다 돌리는 게 아니다. 텐센트는 코딩·오피스·연구 같은 생산성 작업에 맞춰 설계했다고 쓰고, WorkBuddy·CodeBuddy에서 2주 무료 체험을 열며 Hy3 무료도 9월 30일까지 연장했다. API는 텐센트 클라우드 TokenHub 기준 입력 백만 토큰당 약 $0.834, 출력 $2.501이다. 내부 블라인드 평가와 코딩 벤치 숫자는 텐센트 측 자기보고이므로, 이 글도 그렇게 표시한다.
배경 및 맥락
중국 오픈웨이트 경쟁은 2026년 들어 두 달 안팎 주기로 플래그십이 바뀌는 속도다. Hy4 preview는 그 줄에 770B급 MoE와 1M 컨텍스트를 한꺼번에 올린 카드다. TechNode는 같은 날 보도에서 총 770B·활성 49B·1M+ 컨텍스트, WorkBuddy·CodeBuddy·Yuanbao·ima 접근과 TokenHub·OpenRouter API를 정리했다.

모델 카드는 Hugging Face의 tencent/Hy4-preview에 있다. 텐센트 Hy 팀 개발이라고 명시하고, 아키텍처 표에서 백본만 770B/49B·78층·컨텍스트 1M·어휘 120832를 적는다. 백본 밖에는 투기적 디코딩용 MTP(Multi-Token Prediction, 다중 토큰 예측) 레이어가 붙어 있다. 총 약 10B·활성 약 0.7B다. 투기적 디코딩은 초안 토큰을 먼저 뽑고 검증해 처리량을 올리는 기법이다. 별도 드래프트 모델을 안 올려도 MTP를 쓸 수 있게 넣어 둔 셈이다.

배포 쪽은 발표 당일 런타임이 따라온 점이 눈에 띈다. 모델 카드는 vLLM 이미지 vllm/vllm-openai:hy4-preview와 SGLang 이미지 lmsysorg/sglang:hy4-preview를 안내한다. OrcaRouter는 이를 day-zero 지원으로 정리했다. 770B급 오픈웨이트가 보도만 하고 서빙 레시피가 몇 주 뒤인 경우와 결이 다르다. 다만 공식 레시피가 가정하는 건 텐서 병렬 8장급 GPU다. 데스크톱 한 장으로 돌리는 모델이 아니다.

주요 내용 분석
숫자의 핵은 “크다”가 아니라 “얼마나 적게 켜는가”다. Hugging Face 모델 소개에 따르면 78층 중 첫 층은 일반 dense FFN이고, 나머지 77층은 MoE다. 층마다 라우팅 전문가 256개와 공유 전문가 1개가 있고, 토큰은 상위 8개 라우팅 전문가와 공유 전문가를 함께 켠다. 활성 비율은 대략 49/770 ≈ 6.4%다.
| 항목 | 내용 | 출처·비고 |
|---|---|---|
| 총 / 활성 파라미터 | 770B total / 49B active per token | Tencent 공식, Hugging Face 모델 카드 |
| 층·MoE 라우팅 | 78층(첫 dense FFN + 77 MoE). 층당 256 routed + 1 shared, top-8 + shared | Hugging Face |
| MTP | 네이티브 MTP 1층 ≈10B total / 0.7B active (투기적 디코딩) | Hugging Face |
| 컨텍스트 | >1M 토큰(모델 카드 표기는 1M) | Tencent 공식 / HF |
| 라이선스·배포 | Apache 2.0. HF·ModelScope·GitCode·CNB. BF16·FP8 | Hugging Face |
| API 가격 | TokenHub: $0.834/M in, $2.501/M out, cache hit $0.042/M | Tencent 공식(USD 표기) |
| 체험 | WorkBuddy·CodeBuddy 2주 무료. Hy3 무료 연장 ~2026-09-30 | Tencent 공식 |
| 내부 블라인드 | 163명 / 203 과제, Hy4 2.99/4 vs GLM 5.3 2.92, Kimi K3 2.94 | 텐센트 자기보고 |
| 추론 최적화 | 자체 스택 e2e 처리량 +31.8%(베이스라인 대비) | 텐센트 자기보고 |
생산성 포지션도 발표문이 직접 적는다. 소프트웨어 엔지니어링(긴 맥락의 이해·계획·디버그·검증, 프론트엔드 품질), 오피스·분석(문서·스프레드시트·프레젠테이션 산출), 게임 프로토타입, 과학 연구(AI R&D·분자동역학·응집물질·기초수학)다. 모델이 학습 방법·데이터 전략·평가 틀·저수준 연산자 자동 최적화에 참여했다는 재귀적 자기개선 서술, 그리고 추론 시스템의 연산자 융합·통신 최적화로 e2e 처리량 31.8%를 올렸다는 서술도 공식 글에 있다. 둘 다 텐센트 내부 측정이다.
코딩 벤치 숫자는 공식 영문 발표 본문보다 모델 카드·2차 보도에 더 자세히 잡힌다. OrcaRouter와 Winzheng이 정리한 텐센트 자기보고 표에 따르면 Terminal Bench 2.1 85.4, DeepSWE 64.3(Hy3 28.0에서 상승), SWE-bench Pro 65.7 등이 언급된다. 독립 랩 재현이 아직 없다는 점을 OrcaRouter도 명시한다. 이 글은 그 숫자를 1위 확정이 아니라 벤더가 올린 천장으로만 읽는다.
실사용자 반응
반응이 갈리는 축은 세 곳이다. 첫째는 열 수 있는가다. Apache 2.0 가중치와 당일 vLLM/SGLang 레시피는 셀프호스팅 팀을 움직인다. 동시에 FP8 체크포인트가 테라바이트에 가깝고 TP=8을 가정한다는 점에서, 오픈소스니까 노트북에서라는 말은 성립하지 않는다. API·2주 체험이 실질 입구다.
둘째는 벤치 신뢰다. 163명 전문가 블라인드와 Terminal Bench 동률 주장은 헤드라인을 만들지만, 채점자가 텐센트 쪽이고 과제도 생산성 시나리오에 맞춰져 있다. GLM 5.3·Kimi K3와의 0.05~0.07점 차이는 Winzheng이 지적하듯 통계적으로 얇을 수 있다. 오픈소스가 Opus와 동급이라는 문장은 출처를 붙이는 순간 조건부가 된다.
셋째는 체감 마찰이다. Hugging Face Known Limitations는 미리보기임을 인정하고, 복잡한 과제에서 필요 이상으로 길게 추론하며 자기 작업을 과검증(over-verify)하는 경향을 적는다. 비전·멀티모달 입력은 프리뷰에 없다. OrcaRouter는 이를 지연에 민감한 채팅에는 불리하고, 오프라인 배치 엔지니어링에는 견딜 만하다고 정리한다. 미리보기 전략 자체는 Hy3 때와 같다. 일찍 풀고 깨지는 지점을 듣겠다는 선언이다.
의미와 시사점
첫째, 오픈웨이트 경쟁의 단위가 총 파라미터에서 활성 파라미터 × 컨텍스트 × 라이선스로 바뀌고 있다. 770B 헤드라인은 마케팅이고, 실제 청구서와 지연을 결정하는 쪽은 49B 활성과 1M 창, 그리고 Apache 2.0이다.
둘째, day-zero 서빙은 보도의 일부다. 희소 어텐션(Gated DSA)·MTP·커스텀 툴/추론 파서가 필요한 모델은, 프레임워크 지원 없이 가중치만 풀면 실험실 밖 채택이 늦어진다. 텐센트가 vLLM·SGLang 이미지를 같이 낸 것은 그 병목을 의식한 선택으로 읽힌다.
셋째, 가격은 닫힌 프론티어 대비 낮게 잡혀 있다. 출력 백만 토큰당 약 $2.5는, 에이전트 루프처럼 긴 접두어를 반복하는 작업에서 캐시 히트($0.042/M)와 맞물릴 때 의미가 커진다. 다만 과검증이 토큰을 두 번 태우면 싸 보이는 단가와 일 하나 끝내는 총비용이 어긋난다.
넷째, 미리보기 라벨은 면피가 아니라 제품 신호다. 비전 부재·느린 시작·과검증을 공식 카드에 적어 둔 팀은, 다음 배치에서 그 목록을 지울 의무를 스스로 만든 것이다. 텐센트도 Hy4 시리즈 다음 배치가 곧이라고 적었다.
마치며
Hy4 preview는 2026년 8월 28일, 770B 중 49B만 켜는 MoE와 1M+ 컨텍스트를 Apache 2.0으로 연 텐센트 혼원의 미리보기다. TokenHub 단가, 2주 무료 체험, vLLM day-zero는 접근 경로를 넓힌다. 내부 블라인드 2.99/4와 Terminal Bench 85.4 같은 코딩 숫자는 아직 벤더 자기보고다. 과검증과 비전 부재는 알려진 한계다.
지금 할 일은 헤드라인의 770B를 외우는 일이 아니다. 자기 워크로드에서 활성 49B·1M 창·과검증 지연이 실제로 맞는지, API든 8-GPU 노드든 한 경로로만 시험해 보는 일이다. 점수가 먼저가 아니라, 일이 끝나는지가 먼저다.
출처
- Tencent: Releases and Open-Sources Tencent Hy4 preview (2026-08-28)
- TechNode: Tencent open-sources Hy4 preview (2026-08-28)
- Hugging Face: tencent/Hy4-preview
- GitHub: Tencent-Hunyuan/Hy4-preview
- OrcaRouter: Tencent Hy4 Preview in vLLM (day-zero, self-reported benches)
- Winzheng: Hy4 Preview coding benchmarks overview (secondary)
이 글은 AI가 작성하여 자동 발행된 콘텐츠입니다.