AREX Feed Article
词元星火开源 Spark X2.5-4B/1.7B 端侧模型,SGLang day-0 接入
9 月 1 日 11 时 21 分(北京时间),科大讯飞旗下词元星火(SparkLLM)的,并称它们是「唯一原生支持最高 1,000,000 token(词元)上下文的端侧模型」,采用混合注意力架构,面向 agent(智能体)、代码、数学与指令遵循场景优化。约 40 分钟后,开源推理框架 SGLang 的,附上启动命令,并称 X2.5-4B 在实际 agentic coding(智能体编程)任务中可与 2~3 倍规模的云端模型相当。这两条口径都未经独立验证。
同日上午,,两款模型原生支持最长 100 万 Token 上下文窗口,基于全国产算力平台完成全流程训练,使用约 20 万亿 Token 多样化数据预训练;模型权重已在 Hugging Face、GitHub 等平台开放,对应 API 已上线讯飞星辰 MaaS 平台,限时免费。
「唯一」宣传语与社区的 needle 质疑
SparkLLM 在中解释了 1M 上下文对端侧模型的意义:模型可以一次读完一整本产品手册、整个代码库或一批文档,在多步任务中保持完整视野,全部在本地完成,「不再需要把文档切成碎片」。IT之家转述了配套场景:用户把完整售后手册导入模型后,可以针对「购买 10 天后设备故障且使用过第三方耗材」这类跨章节问题做综合判断;在个人办公场景中,星火 X2.5-4B 可完成从原始数据分析到双语报告的全流程。
IT之家还给出一个量化结果:在 Domux 智能家居测试集上,星火 X2.5-1.7B 控制指令端到端执行正确率达 90.3%,平均响应时间 0.85 秒;模型同时被描述为适用于机器人操作控制、目标追踪、导航决策,可部署于机器人本体或边缘设备。
「唯一」本身是发布方宣传语。社区里已经有人对这一数字提出质疑:在 SparkLLM 推文评论区,,「1M 上下文塞进 1.7B,这数字本身就有股『先报再跑』的味道。谁先贴个 800k needle,谁才算交差」——needle 指长上下文检索测试(needle-in-a-haystack),即在超长文本中埋入一条特定信息、检验模型能否找回。
混合注意力:每组 1 层全局注意力配 3 层滑窗
:一层全注意力(Global Attention)与三层滑窗注意力(Sliding Window Attention)组成一组、重复堆叠,滑窗负责高效处理局部信息,全局层负责跨位置整合,目的是在支撑长上下文的同时控制计算开销与 KV 缓存占用。规格表显示,两款模型滑窗大小均为 512、上下文长度均为 1M:Spark X2.5-4B 参数量 4,112,079,360(约 41 亿),36 层,隐藏维度 2,560,16 个注意力头、4 个 KV 头(GQA 分组查询注意力);Spark X2.5-1.7B 参数量 1,707,657,216(约 17 亿),28 层,隐藏维度 2,048,8 个注意力头、2 个 KV 头。
两款模型词表均为 131,072,覆盖 200 多种语言。训练侧,模型卡称预训练数据约 20 万亿 Token,随后用专门的长上下文阶段把序列长度扩展到 1M,后训练包含监督微调、大规模强化学习与 MOPD 等步骤,训练在华为昇腾集群上完成——与 IT之家「基于全国产算力平台完成全流程训练」的表述一致。
模型卡自报了与 Qwen3.5-2B/4B/9B、Gemma4-E2B/E4B/12B 的对比成绩(未经第三方复现):Spark X2.5-4B 在 AIME 2026 数学竞赛上拿到 90.7 分,高于表中 Qwen3.5-9B 的 88.2;在 τ²-bench 智能体任务上为 75.1 分,低于 Qwen3.5-4B 的 79.9 和 Qwen3.5-9B 的 79.1;在 SWE-Bench Verified 代码任务上为 41.6 分,低于 Qwen3.5-9B 的 53.1,高于 Qwen3.5-4B 的 38.8。
SGLang day-0:服务先行,附两款启动命令
SGLang 官方账号在 12 时 02 分(北京时间)发文确认 day-0 支持,称「长上下文处理和端到端智能体工作流,在这个体量上过去是够不着的」,并形容这是「可以跑在各种设备上、随时在线的智能体模型」。推文以(),同时称 X2.5-4B 在实际 agentic coding 任务中可与 2~3 倍规模的云端模型相当。
评论区出现了两种态度。「这个上下文长度下真的可用吗?」;:「day-0 就把 sub-5B 的 1M 接上 serving,这才像开源。权重丢出来 serving 跟不上,等于给同事留作业。」
成立不到三个月的词元星火与 10 亿元赌注
今年 6 月,在科大讯飞 27 周年司庆现场,,,正式入局 Token 经济市场。「在面向开发者的代码与复杂智能体能力上,讯飞决心以前所未有的力度迎头赶上」,刘庆峰当时说,词元星火是讯飞在主战场上「现场集结的『冲锋队』和『特战队』」。今年 4 月,科大讯飞发布 MoE 架构的星火 X2-Flash(总参数 30B,最大支持 256K 上下文)。与本次发布对应的账号体系也已就位:,介绍称公司提供 Spark 模型家族与 AStudio、Loomy 两套配套 harness(智能体执行框架)。
权重先于官宣一天上线,本地部署还差一块拼图
开源物料并非官宣当天才上线:,Ollama 模型卡中架构图的上传文件名也标注为 20260831,均早于 9 月 1 日的推文。模型卡列出的兼容范围包括 NVIDIA、华为、海光与后摩等硬件平台,vLLM、SGLang、llama.cpp、MLX 等推理框架,以及 Ollama、LM Studio 等部署工具,并称已与 Codex、Claude Code、OpenClaw、Hermes 等智能体 harness 集成。
但「下载即用」还不成立:模型卡注明,Ollama 官方运行时尚未支持 spark2_5 架构,用官方版本执行 ollama run SparkLLM/Spark-X2.5-4B 只会下载权重、无法开始推理,需要自行编译 XHToken/llama.cpp 分支与对应的 Ollama 运行时。Ollama 库中 Spark-X2.5-4B 条目标注为 8.2 GB、1M 上下文窗口。
下一站:9 月 7 日的星火 X2.5-293B
IT之家在报道中透露,9 月 7 日科大讯飞还将正式发布星火 X2.5-293B 通用大模型,进一步升级代码和智能体等核心能力,距今还有 6 天。1M 上下文在 1.7B 端侧模型上是否真的可用,尚需一份 800k needle 测试来回答。