엣지에 백만 토큰: SparkLLM이 X2.5-4B·1.7B를 연 이유
iFLYTEK 계열 SparkLLM이 2026-09-01 Spark X2.5-4B·1.7B를 Apache 2.0으로 공개했다. 네이티브 1M 토큰 컨텍스트를 가진 온디바이스 범용 모델로 내세우며, 하이브리드 어텐션과 Ascend 학습·에이전트 하네스 통합을 내건다.
핵심 요약 (TL;DR)

2026-09-01, 중국 iFLYTEK(科大讯飞) 계열 SparkLLM(자회사 词源星火 / Ciyuan Xinghuo)이 Spark X2.5-4B와 Spark X2.5-1.7B를 Apache 2.0으로 공개했다. 공식 주장은 단호하다. 네이티브 100만 토큰(1M) 컨텍스트 창(한 번에 모델이 붙잡고 있는 입력 길이)을 가진, 알려진 온디바이스·엣지(기기 안에서 도는) 범용 모델로는 처음—또는 유일—이라는 것이다.
무게는 4B·1.7B로 작다. 그런데 구조는 하이브리드 어텐션(한 층의 풀 어텐션 + 세 층의 슬라이딩 윈도 어텐션·SWA)이고, 사전학습은 약 20조(20T) 토큰, 장문 단계는 “수억 단위” 토큰을 1M 시퀀스까지 늘린다. NVIDIA·화웨이 Ascend·Hygon·Houmo 하드웨어와 vLLM·SGLang·llama.cpp·MLX를 지원한다. Ollama·LM Studio는 공식 빌드가 아니라 커스텀 llama.cpp가 필요하다. 9월 7일에는 플래그십 Spark X2.5-293B가 예고돼 있다.
배경 및 맥락

엣지·온디바이스 모델의 병목은 예전에 “작은 파라미터”만이 아니었다. 컨텍스트 창이 짧으면 매뉴얼·회의록·레포 전체를 한 번에 못 넣고, 조각을 나눠 물으면 맥락이 끊긴다. 클라우드 쪽은 이미 1M 컨텍스트가 흔해졌지만, 기기 안에 넣는 작은 모델은 그 길이를 네이티브로 버티기 어려웠다. KV 캐시(어텐션 키·값을 쌓아 두는 메모리)가 길이에 비례해 불어나기 때문이다.
Spark X2.5는 그 간극을 제품 문장으로 잡았다. DEV 발표와 Hugging Face 모델 카드가 같은 축을 반복한다. (1) 하이브리드 어텐션으로 긴 컨텍스트 비용을 줄인다. (2) 코딩·에이전트(도구를 쓰며 일을 이어 가는 AI 워커) 하네스(에이전트를 감싸 세션·도구·검증을 맡기는 실행 틀)—Codex, Claude Code, OpenClaw, Hermes 등—과 깊게 붙인다. (3) 학습은 화웨이 Ascend 클러스터에서 끝냈고, 사후학습에 MOPD를 썼다. (4) 가중치·코드·배포 문서를 GitHub·Hugging Face에 열고, iFlytek 성신(星辰) MaaS API는 한시 무료다.
이름 표기도 한 번에 정리하자. 영문·HF는 Spark-X2.5, 중국어 보도는 성화(星火) X2.5, 조직은 SparkLLM / 词源星火다. 이 글은 HF·GitHub 표기 Spark X2.5를 쓴다.
주요 내용 분석

핵심은 세 겹이다. (1) 1M 네이티브 컨텍스트를 가능하게 한 하이브리드 어텐션, (2) 벤더 보고 벤치에서 보이는 에이전트·코드 점수, (3) “빨리 돌린다”와 “커스텀 빌드가 필요하다”가 같이 적힌 배포 현실.
하이브리드 어텐션과 1M
모델 카드 문장은 짧다. 풀 어텐션 1층 + 슬라이딩 윈도 어텐션(SWA) 3층. SWA는 모든 토큰이 서로를 보는 대신, 가까운 창 안의 토큰만 보게 해 계산과 KV 캐시를 줄인다. 풀 어텐션 층이 전역 의존성을 남기고, SWA 층이 길이를 버틴다. 카드는 이 설계로 “긴 컨텍스트 모델에 흔히 붙는 오버헤드를 크게 줄이면서” 1M까지 네이티브로 지원한다고 적는다. 언어는 200개 이상.
사전학습은 웹·책·논문·코드·백과를 섞은 약 20T 토큰. 장문 전용 단계는 “수백억(hundreds of billions) 토큰” 규모로, 시퀀스 길이를 1M까지 올린다. 사후학습은 SFT로 지시 따르기를 굳힌 뒤, 이해·추론·프로그래밍·도구 에이전트·지시 따르기 영역에 대규모 RL을 돌리고, 도메인별 교사 정책을 MOPD로 한 모델에 합친다.
벤치: 몇 줄만 읽어도 되는 표
아래 숫자는 Hugging Face 모델 카드 표에서 옮긴다. 평가 모드는 모두 thinking mode. 권장 샘플링은 temperature=1.0, top_p=0.95, top_k=-1. *는 공개 모델 카드·논문에서 가져온 비교군 점수다. 벤더 보고이므로 독립 재현 전에는 순위로만 읽지 말 것.
| 벤치마크 | Spark‑X2.5‑4B | Spark‑X2.5‑1.7B | Qwen3.5‑4B | Gemma4‑E4B | 비고 |
|---|---|---|---|---|---|
| SWE‑Bench Pro | 44.4 | 10.4 | 29.4* | 4.0* | 에이전트 코딩 |
| BrowseComp | 40.9 | 29.7 | 14.3 | 8.3 | 브라우징·탐색 |
| AIME 2026 | 90.7 | 69.4 | 83.0 | 42.5* | 수학 |
| BFCL‑V4 | 65.1 | 46.9 | 50.3* | 36.9 | 함수 호출 (Qwen3.5‑9B 66.1*) |
| MCP‑Atlas | 54.6 | 23.4 | 40.8* | 15.0* | MCP 도구 사용 |
| IFEval | 93.0 | 89.5 | 89.8* | 45.3 | 지시 따르기 (Gemma4‑12B 94.8) |
4B가 눈에 띄는 칸은 SWE-Bench Pro 44.4와 BrowseComp 40.9다. 같은 표에서 Qwen3.5-4B는 각각 29.4*·14.3, Gemma4-E4B는 4.0*·8.3이다. AIME 2026 90.7도 4B급에선 공격적이다. 반대로 SWE-Bench Verified는 Qwen3.5-9B 53.1*이 앞서고 Spark 4B는 41.6이다. BFCL-V4도 Qwen3.5-9B 66.1*에 4B가 65.1로 붙는다. “모든 칸 1위”가 아니라, 작은 파라미터로 에이전트·장문·코드 쪽을 밀어 올린 프로필에 가깝다. 1.7B는 스마트홈 Domux 테스트셋에서 종단 명령 정확도 90.3%·평균 지연 0.85초라는 DEV 발표 수치를 따로 든다(HF 표와는 별 축).
배포 현실: 넓지만 한 칸은 가시밭

지원 목록은 넓다. 하드웨어는 NVIDIA, Huawei Ascend, Hygon, Houmo. 추론은 vLLM, SGLang, llama.cpp(커스텀 포크), MLX. 파인튜닝은 LLaMA-Factory. SGLang 예제는 컨텍스트 길이 1048576(1,048,576)을 명시하고, 메모리 부족 시 줄이라고 적는다. 1M은 “켜면 된다”가 아니라 장치 메모리가 받쳐 줄 때의 상한이다.
Ollama·LM Studio 문장은 조심해서 읽어야 한다. 마케팅은 “빠르게 배포”를 말하지만, HF·Ollama 페이지는 공식 Ollama 런타임이 아직 spark2_5 아키텍처를 못 받는다고 못 박는다. ollama run으로 가중치만 받아 두고 추론이 안 뜨는 함정이 있다. 해결은 XHToken의 llama.cpp 포크를 빌드해 Ollama/LM Studio 백엔드에 덮어쓰는 경로다. “다운로드 한 줄”이 아니라 “포크 빌드”가 온디바이스 진입 비용이다.

실사용자 반응
공개 직후라 장기 현장 후기보다, 채널별 반응이 먼저 쌓인다. Hugging Face 컬렉션·모델 카드 쪽은 벤치 표와 1M·Apache 2.0·Ascend 학습을 그대로 인용하는 공유가 많다. DEV 발표 댓글·리포스트 축은 “엣지에 1M이 진짜냐”와 “Ollama가 바로 되냐”로 갈린다. 후자는 문서가 이미 커스텀 빌드를 요구하므로, 기대와 설치 경로의 간극이 첫 마찰이다.
중국어 보도(예: AIBase 9/1)는 “국내 연산으로 끝낸 엣지 백만 토큰” 프레임을 앞에 둔다. 영문 SparkLLM 채널은 on-device + agent harness 통합을 앞에 둔다. 같은 가중치를 두고도, 읽는 시장의 첫 문장이 다르다.
실사용 체크리스트로 줄이면 셋이다. (1) 1M을 실제로 넣을 메모리·프레임워크가 있는가. (2) Ollama/LM Studio를 쓸 거면 포크 빌드 준비가 됐는가. (3) 벤치의 thinking mode 점수와, 내 하네스(Codex·Claude Code 등)에서의 체감이 같은 축인가.
의미와 시사점
첫째, 엣지 경쟁의 단위가 파라미터 수에서 컨텍스트·에이전트로 이동한다. 4B·1.7B는 “작다”가 헤드라인이 아니라, 1M과 도구 사용이 헤드라인이다. 클라우드 1M이 익숙해진 뒤에야, 기기 안 1M이 제품 문장으로 팔리기 시작한다.
둘째, 하이브리드 어텐션이 온디바이스 장문의 기본 레시피로 자리 잡는 신호다. 풀 어텐션만으로 1M을 기기에서 버티기 어렵다는 전제를, Spark는 1+3 층 비율로 답한다. 앞으로 비슷한 크기 모델이 “네이티브 장문”을 말할 때 이 구조를 벤치마크로 삼을 가능성이 크다.
셋째, 오픈 가중치와 런타임 락인의 간극이 남는다. Apache 2.0 가중치는 열렸지만, 대중 런타임(Ollama 공식)은 아직 못 따라온다. “열린 모델”과 “한 줄로 도는 모델”은 같은 날이 아니다. 배포 문서가 커스텀 llama.cpp를 요구하는 한, 얼리 어답터와 일반 로컬 사용자 사이 장벽이 남는다.
넷째, 9월 7일 Spark X2.5-293B 예고는 이 Twin Stars(4B·1.7B)를 엣지 첨병으로, 293B를 클라우드·에이전트 플래그십으로 나누는 포트폴리오 신호다. 작은 형제가 연 1M·에이전트 서사가, 큰 형에서 코드·에이전트 점수로 이어지는지 보면 된다.
마치며
Spark X2.5-4B·1.7B는 “또 하나의 작은 오픈 모델”이 아니다. 엣지에 네이티브 1M을 걸겠다는 주장, 하이브리드 어텐션이라는 수단, Ascend에서 끝낸 학습, Apache 2.0 공개, 그리고 Ollama 공식 미지원이라는 현실 조건이 한 묶음이다. 벤치 표의 44.4·40.9·90.7은 벤더 보고다. 그래도 방향은 분명하다. 기기 안에서 긴 문서와 에이전트 루프를 같이 돌리려는 수요가, 파라미터 수보다 컨텍스트와 하네스를 고르게 만들기 시작했다.
가중치와 카드는 Hugging Face 컬렉션·GitHub·DEV 발표에 있다. API는 iFlytek 성신 MaaS(maas.xfyun.cn)에서 한시 무료다. 로컬로 바로 돌려 보려면, 먼저 SGLang/vLLM 경로인지 커스텀 llama.cpp 경로인지부터 고르면 된다.
이 글은 AI가 작성하여 자동 발행된 콘텐츠입니다.