Skip to content

认识星火 X2.5:端侧首个原生百万上下文的开源模型

一个 4B 的小模型,能一口气读完 100 万 Token。

100 万 Token 是什么概念?粗略换算,差不多是把《三体》三部曲整整齐齐塞进去,还能剩点地方放你手头那份 300 页的产品手册。而这么干活的模型,权重文件只有 8.23 GB——一张入门级显卡就能装下。

2026 年 9 月 1 日,科大讯飞全资子公司词元星火(对外 XHToken / SparkLLM)开源了 Spark-X2.5-4BSpark-X2.5-1.7B,官方给的头衔是"业界首个原生支持 100 万 Token 上下文的端侧模型"。

说句实话,我第一反应是警惕。"百万上下文"这词这两年快被用烂了,很多模型的做法是:训练时只吃了 32K,上线前靠位置插值硬拉到 1M,跑分好看,真塞满长文档就开始胡言乱语。所以我先去翻了 GitHub 仓库的架构说明——结果是我多虑了。

长上下文解决的是"信息能不能看全",Agent 和工具调用解决的才是"看完之后能不能动手"。只堆前者,模型就是个记忆力超群的废物。

什么是星火 X2.5

星火 X2.5 是词元星火推出的端侧通用大模型系列,2026 年 9 月 1 日发布并开源,首批两个尺寸:

型号参数量原生上下文权重体积定位
Spark-X2.5-4B4,112,079,360(约 41 亿)1,048,576 Token约 8.23 GB(BF16)主力,跑代码和 Agent
Spark-X2.5-1.7B约 17 亿1,048,576 Token更小智能家居、机器人这类低延迟场景

协议是 Apache 2.0,没有月活阈值、没有"年营收超 XX 亿要报备"的附加条款,权重、代码仓库、部署文档全部开放,商用基本不用操心授权链。

两款模型基于全国产算力平台完成全流程训练,预训练用了约 20 万亿 Token 的多样化数据,再用高质量监督微调和大规模强化学习(官方提到 MOPD 后训练算法)打磨推理、代码、智能体和指令遵循能力。GitHub README 里明确写了训练跑在华为昇腾集群上。

有个细节挺有意思:这次开源的操盘主体是"词元星火",科大讯飞的全资子公司,不是讯飞直接下场。而按官方预告,9 月 7 日还会发布星火 X2.5-293B 旗舰通用大模型。也就是说,4B 和 1.7B 是先头部队,真正的大菜在一周后。

星火 X2.5 有什么特点

  • 1 层全注意力 + 3 层滑动窗口注意力的混合架构:这是它敢喊"原生 1M"的底气。全注意力层负责抓住全局关键信息,三层滑动窗口层负责把长文本的计算开销压下来。纯全注意力跑 1M 上下文,计算量是长度的平方级,4B 模型根本扛不住;这么一掺,开销断崖式下降。这不是插值撑出来的 1M,是训练时就按 1M 设计的架构。
  • 原生 1,048,576 Token 上下文:官方 SGLang 启动命令里直接写 --context-length 1048576,单卡、tp-size 1。注意是"能力上限",不是"随便跑满",下面部署那节会细说。
  • 覆盖 200 多种语言:官方 README 原话是 "support for more than 200 languages"。
  • 小而硬的代码能力:官方口径是 X2.5-4B 在算法实现、代码补全与生成上,可对标参数规模大 2 到 3 倍的云端模型。这个说法下面有 benchmark 佐证。
  • 天生为 Agent 设计:官方明确说模型已深度集成 Codex、Claude Code、OpenClaw、Hermes 等主流 Agent Harness。这点很关键——说明他们不是先训个模型再想着怎么接工具,而是训练目标里就带工具调用。
  • 多硬件、多框架通吃:硬件支持 NVIDIA、华为、海光(Hygon)、后摩(HOUMO.AI);推理框架兼容 vLLM、SGLang、llama.cpp、MLX;Ollama 和 LM Studio 也能跑;微调可以走 LLaMA-Factory。
  • Apache 2.0 协议:想塞进自己的商业产品里,不用做署名手续。

把参数从 100B 卷到 1T 是一条路,把 1M 上下文塞进 4B 是另一条路。前者的账单是显卡,后者的账单是架构。星火 X2.5 选了后者。

星火 X2.5 能用在哪(真实案例)

个人办公:从一张表到双语报告,全自动

科大讯飞在 Loomy(讯飞自家的办公产品)上给了一个完整案例,流程是这样的:

用户上传一张销售明细表,提的需求是"做销售分析 + 出中英文双语部门业绩报告"。X2.5-4B 干了四件事:先写脚本完成数据汇总、关键指标提取和趋势分析 → 生成约 3000 字的中文部门业绩报告沿用原有结构和格式生成英文版 → 最后回头校验内容、结构和排版

注意最后那步。很多模型交付完就完了,它自己会回头检查一遍。这才是"能干活"和"能聊天"的分界线。

代码开发:4B 打 8B~12B

官方给的口径是对标大 2~3 倍的云端模型。benchmark 上(全部在 thinking mode 下测)X2.5-4B 的几个亮眼成绩:

BenchmarkX2.5-4BX2.5-1.7BQwen3.5-9BGemma4-E4B
SWE-Bench Pro44.410.433.830.5
SWE-Bench Multilingual53.323.343.3
SciCode34.718.232.727.5
AIME 202690.769.488.242.5
HMMT Feb 202681.248.470.834.2
IMO-AnswerBench74.245.469.826.9
MCP-Atlas(MCP 工具调用)54.623.447.415.0
BrowseComp(网页浏览)40.929.78.38.3
τ²-bench(Agent)75.165.379.142.2
BFCL-V4(函数调用)65.146.966.136.9
IFEval(指令遵循)93.089.591.545.3
GPQA67.443.877.254.5

数学是它最离谱的部分——AIME 2026 拿到 90.7,比 Qwen3.5-9B 的 88.2 还高,而后者参数量是它的两倍多。网页浏览 BrowseComp 40.9 对 Qwen3.5-9B 的 8.3,接近 5 倍差距,这大概率是长上下文带来的直接收益。

先泼盆冷水:这些数据全部来自官方 README,发布当天没有第三方独立复现。而且 τ²-bench、BFCL-V4、GPQA 三项它输给了 Qwen3.5-9B——它不是全能冠军,是偏科生。数学、代码、长文档是强项,工具调用的稳定性还差点意思。数字先看着,等社区实测。

智能家居:0.85 秒响应,这才是端侧的意义

Domux 智能家居测试集上,X2.5-1.7B 的控制指令端到端执行正确率达 90.3%,平均响应时间仅 0.85 秒

0.85 秒这个数字比正确率更重要。你对着音箱说"关灯",等三秒才响应,体感就是坏了。云端往返一趟的延迟,天然做不进这个场景——这就是端侧模型存在的理由。

机器人:断网也能持续感知

两个尺寸都可以部署在机器人本体或边缘设备上,支持操作控制、目标追踪、导航决策。官方的说法是"减少对云端连接和固定预设程序的依赖"。

长文档:一次读完,不用切段

官方举的是产品售后场景:把完整售后手册导入 X2.5-4B,模型先梳理各场景规则并标注章节;你再问"购买 10 天后设备故障、且使用过第三方耗材,符合换货要求吗",它能跨章节关联退换货、故障处理、例外条件给出综合判断。你继续追加"用户住偏远地区、设备存有家庭地图",它还能保持前文情境,结合物流、数据清除、费用承担、处理时限接着给建议。

这个能力以前只有云端大模型有。现在 8GB 的权重就能干。

初体验:怎么上手星火 X2.5

最省事:直接用 API

模型 API 已上线讯飞星辰 MaaS 平台https://maas.xfyun.cn/modelSquare),限时免费。不想折腾环境的话,这是最快的路径。

权重在哪下

平台地址适合谁
Hugging FaceXHToken/spark-x25海外 / 网络通畅
ModelScope(魔搭)搜 XHToken 的 Spark-X25 合集国内用户推荐
Modelersmodelers.cn/user/XHToken昇腾芯片用户
SCNet搜 XHToken/Spark-X2.5-4B海光芯片用户
Ollamaollama.com/SparkLLM想直接 ollama run

SGLang 起服务(官方主推,单卡 1M 上下文)

官方给的是预构建 nightly 镜像:

bash
docker pull lmsysorg/sglang:nightly-dev-cu13-20260827-20621aa1
bash
docker run -it \
  --gpus '"device=0"' \
  --ipc=host \
  -p 30000:30000 \
  -v "$MODEL_PATH":/root/Spark-X2.5-4B \
  lmsysorg/sglang:nightly-dev-cu13-20260827-20621aa1 \
  python -m sglang.launch_server \
    --model-path /root/Spark-X2.5-4B \
    --served-model-name spark2.5 \
    --tool-call-parser spark25 \
    --reasoning-parser qwen3 \
    --tp-size 1 \
    --mem-fraction-static 0.8 \
    --context-length 1048576 \
    --chat-template /root/Spark-X2.5-4B/chat_template.jinja \
    --host 0.0.0.0 \
    --port 30000

调它:

bash
curl -s http://localhost:30000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "spark2.5",
    "messages": [{"role": "user", "content": "安徽的省会在哪里?"}],
    "max_tokens": 131072,
    "temperature": 1,
    "top_k": -1,
    "top_p": 0.95
  }'

官方推荐的采样参数是 temperature=1.0、top_p=0.95、top_k=-1,别照着别的模型习惯去调,容易跑偏。默认开思考模式,想关掉传 "chat_template_kwargs": {"enable_thinking": false}

vLLM 起服务

注意:vLLM 需要先装官方插件,不是开箱即用:

bash
pip install uv
uv venv ~/spark2_5
source ~/spark2_5/bin/activate
git clone https://github.com/XHToken/Spark-plugin.git
cd ./Spark-plugin
uv pip install .
bash
vllm serve "./Spark-X2.5-4B" \
  --port 30000 \
  --trust-remote-code \
  --served-model-name spark25 \
  --tensor-parallel-size 1 \
  --gpu-memory-utilization 0.7 \
  --enable-prefix-caching \
  --chat-template Spark-X2.5-4B/chat_template.jinja

Mac 用户:走 MLX,不用转 GGUF

官方的 Spark-MLX-LLM 可以直接跑 Hugging Face 原版 checkpoint,支持 Apple Silicon GPU、Linux CPU 和 NVIDIA CUDA,不需要先转 GGUF

bash
git clone https://github.com/XHToken/Spark-MLX-LLM.git
cd Spark-MLX-LLM
python3 -m venv .venv && source .venv/bin/activate
python -m pip install -e .        # Apple silicon
bash
spark-mlx-generate \
  --device gpu \
  --dtype bfloat16 \
  --model XHToken/Spark-X2.5-1.7B \
  --prompt "安徽的省会在哪里?" \
  --max-tokens 512 \
  --temp 0

想微调:LLaMA-Factory

官方建议用他们的 LLaMA-Factory 分支(https://github.com/XHToken/LlamaFactory)做增量训练。

诚实说:几个坑

  • "支持 1M"不等于"你的设备能跑满 1M"。4B 的 BF16 权重是 8.23 GB,但 KV Cache 会随上下文长度线性增长——真塞满 100 万 Token,显存需求会远超模型本身。官方命令里 --mem-fraction-static 0.8 就是留了余量。日常用 128K~256K 更现实。
  • Ollama 和 LM Studio 不是开箱即用。两者都依赖词元星火的定制版 llama.cppXHToken/llama.cpp),得自己编译。README 里的 Build 步骤是实打实的 cmake 流程,不是 ollama pull 一行完事。
  • 框架支持属于"刚适配完"状态。SGLang 要指定 nightly 镜像,vLLM 要装插件,llama.cpp 要用分支。这套组合拳意味着生产环境上之前得先在测试环境完整跑一遍。
  • 所有 benchmark 都是官方自述,发布当天没有第三方复现。数学能力看着漂亮,但 τ²-bench 和 BFCL-V4 输给 Qwen3.5-9B 也是事实。
  • 9 月 7 日还有 293B 旗舰。如果你不是非端侧不可,建议等等看,一周后的大版本可能更值得投入。

进阶

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

遇码MeetCoding 开源技术社区