认识星辰 Xing4.0-29B-A4B:第一个"从芯片到框架全栈国产"训出来的开源智能体模型
过去两年,国产算力在 AI 圈的出场方式基本固定:模型在英伟达上训完,再搬到国产芯片上跑推理。 能跑,是好事;但"能跑"和"能训"之间,隔着一整套软件生态的成熟度——芯片、互联、并行框架、算子库、编译器、容错机制,任何一环掉链子,几万张卡的训练就直接崩给你看。
所以当我看到 2026 年 9 月 17 日这条消息时,第一反应不是"又一个小模型开源了",而是愣了一下:
中国电信旗下中电信人工智能科技有限公司,把新一代星辰大模型 Xing4.0-29B-A4B 开源了,而且是全程用昇腾 910C 芯片 + 昇思 MindSpore 框架训出来的。
不是训完再移植,是从第一天就在国产算力上训。更有意思的是那个数字:通过多级协同优化,训练吞吐比"开箱即用"状态提升了约 96%——同一批硬件,靠框架层和算子层的打磨,把效率几乎翻了一倍。
我一直觉得,国产算力真正的短板不在"卡够不够多",而在"能不能把卡的性能榨出来"。硬件可以堆,工程能力只能熬。96% 这个数字,熬的正是后者。
什么是星辰 Xing4.0-29B-A4B
Xing4.0-29B-A4B 是中国电信"星辰"系列(前身 TeleChat)的新一代大模型,定位很明确:面向智能体时代的轻量级代码智能体模型。
拆解一下这个名字里的密码:29B 是总参数量,A4B 是每生成一个 token 实际激活的参数量——29B 的体量,只干 4B 的活。这是典型的 MoE(混合专家)架构套路:模型里养着一大群专家,每次推理只叫醒最相关的几个。
具体规格是这样的(数据来自官方模型卡):
| 项目 | 参数 |
|---|---|
| 总参数 / 激活参数 | 29B / 4B |
| 架构 | mHC + MLA + MTP |
| 层数 | 40 层 |
| 隐藏维度 | 3584 |
| 注意力类型 | MLA(多头潜在注意力) |
| 路由专家 / 共享专家 | 64 个 / 1 个,每 token 激活 4 个 |
| 原生上下文 | 256K,可扩展至 512K |
mHC + MLA + MTP 这套组合,是冲着"干活"去的。 多步骤规划、工具调用、复杂推理链执行——这三样恰恰是智能体场景最吃力、也最容易掉链子的能力。官方的说法是,这套架构重点保证了长上下文下任务连贯性和执行稳定性。
换句话说,Xing4.0 系列和上一代星辰最大的区别,是从"会回答"转向"会做事"。以前你问它一个问题,它给你一段话;现在你给它一个目标,它自己规划路径、调工具、把活干完。从信息助手到任务执行者,这半步比参数涨十倍重要得多。
它有什么特点
- 国内首个基于国产算力和国产框架完成训练、面向复杂工程任务深度优化的百亿参数大模型。 全程跑在昇腾 910C 集群上,用的是 MindSpore / MindFormers,不是"训完再适配"。
- 训练吞吐提升约 96%。 靠的是四层协同优化:细粒度 MoE 通信优化、选择性重计算、DVM 自动图算融合、Ascend C mHC 融合算子。这是把框架和芯片一起打磨出来的结果,不是加卡加上去的。
- 29B / 4B 的 MoE,轻得有点过分。 每 token 只激活 4B,意味着推理成本对标的是小模型,能力却往 30B+ 那一档够。
- 256K 原生上下文,可扩到 512K。 长文档、整仓代码、多轮复杂工作流,塞得进去。
- 低比特量化后,消费级显卡就能跑。 官方明确说通过量化把显存占用大幅压低,开发者不用依赖大型服务器就能本地部署——这对想玩 Agent 但只有一张游戏卡的人,是真友好。
- 开放生态路线,不绑自家框架。 微调支持 LLaMA-Factory 和 MindFormers;推理支持 SGLang、vLLM、KTransformers;还针对 OpenCode、Claude Code、OpenClaw、Hermes 等 Agent 框架做了格式对齐适配,能直接接进现有工作流。
- 多平台同步上线。 GitHub、Hugging Face、Gitee、魔搭、魔乐,五个社区都能拿到,不用翻墙不用求人。
- 面向垂直场景好微调。 意图分类、表格理解、合同审核、知识问答这类下游任务,用自己的数据做轻量定制成本很低。
先泼盆冷水,也给自己降降温:29B 的体量决定了它的能力上限。 它不可能去对标千亿级旗舰模型,定位很清楚——够用、可控、便宜。想拿它当万能底座的,趁早收手。
它能用在哪(真实案例与数据)
空口无凭,先看硬指标。官方公布的基准成绩(模型卡数据):
| 基准 | 得分 | 说明 |
|---|---|---|
| SWE-bench Verified | 75.00 | 真实工程 Issue 修复,硬指标 |
| SWE-bench Multilingual | 66.00 | 多语言代码能力 |
| Terminal-Bench 2.1 | 57.50 | 终端环境操作,官方称超过同规模 Gemma4-26B-A4B |
| AIME2026 | 90.00 | 数学竞赛题,这个分数在 29B 量级相当能打 |
| Claw-Eval | 76.55 | 工具调用 / 智能体能力 |
| IFBench | 69.67 | 指令遵循 |
| Tau3-Bench | 64.63 | 多轮工具交互 |
| AA.LCR | 61.00 | 长上下文检索 |
| DeepresearchBII | 60.80 | 深度研究能力 |
整体水平,官方口径是与 Qwen3.6-35B-A3B 大致相当——注意,那是个 35B 的模型,而 Xing4.0 激活参数只有 4B。用更少的激活量换到接近的效果,这就是 MoE 的账。
落地侧,中国电信自己就有一张现成的答卷:星辰超级智能体 TeleAgent。
- 注册用户突破 118 万,Skill 技能数量从最初的几千个扩展到 5 万余个——从技术原型验证走到规模化商业落地,这条路它自己在跑。
- IDC 近日发布的《中国企业级通用 Agent 产品技术评估》报告显示,TeleAgent 在成本效率、安全可控、任务表现等多个关键维度上显著高于行业普遍水平。
场景上,官方给的两类例子挺接地气:
工作场景:你直接说"把这份销售数据做个分析"或者"整理一下这批材料",Agent 自己去读文件、分析数据、调工具、产出结果,而不是给你一段"你可以这样做"的建议。
生活场景:积分兑换、观影推荐、游戏选择、出行规划——它理解意图之后直接调服务把事办了。
垂直行业这边,官方点名了四个方向:意图分类、表格理解、合同审核、知识问答。这四个的共同点是——数据敏感、格式固定、需要私有化部署。一个 29B 的、能在国产算力上跑的开源模型,对这些场景来说几乎是量身定做。
说个我自己的观察:国产大模型这两年在"政务/国企/金融"这类场景里推进慢,卡点从来不是模型效果,而是能不能在自己可控的硬件上从头到尾跑一遍。Xing4.0 把训练的那一环也走通了,这件事的意义比基准表上那几个分数大得多。
顺带提一句口径问题,免得打架:本站之前写过的 LongCat-2.0 是"业界首个完全依靠国产算力完成训练与推理全流程的万亿参数开源大模型",而 Xing4.0 是"百亿参数量级首个全栈国产训练、且面向复杂工程任务深度优化"的模型。两个"首个"限定条件不同,不冲突——看这类宣传语,先把定语读完再下结论。
初体验:怎么上手星辰 Xing4.0-29B-A4B
三种玩法,从省事到硬核:
第一种:不想装环境,先在线体验。 中国电信自家和多家社区平台都已上线体验入口,急着看效果的可以先去点几下;想拿权重就直接从 Hugging Face(XingChen-AGI/Xing4.0-29B-A4B)、魔搭、魔乐、Gitee 拉。国内用户建议优先走魔搭,速度体感差很多。
第二种:本地跑起来。 官方支持 SGLang、vLLM、KTransformers 三家推理框架。以 vLLM 起一个 OpenAI 兼容服务为例(版本号以官方仓库 README 为准,别照抄我这里的):
# 从魔搭拉取权重
pip install modelscope
modelscope download --model XingChen-AGI/Xing4.0-29B-A4B --local_dir ./Xing4.0-29B-A4B
# 用 vLLM 起服务,暴露 OpenAI 兼容接口
vllm serve ./Xing4.0-29B-A4B \
--served-model-name xing4 \
--max-model-len 262144 \
--enable-auto-tool-choice \
--tool-call-parser hermes \
--port 8000调它跟调 OpenAI 没什么两样:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
resp = client.chat.completions.create(
model="xing4",
messages=[
{"role": "user", "content": "读一下 ./report.csv,算出各区域环比增速,把结果写成一段结论"}
],
)
print(resp.choices[0].message.content)第三种:接进 Agent 框架。 官方已经对 OpenCode、Claude Code、OpenClaw、Hermes 做了格式对齐适配,配好 base_url 和模型名即可,不用自己写工具调用解析器。
三个必须注意的坑:
一是显存要算清楚。29B 全参数模型 FP16 推理,第三方估算大约需要 68GB 显存——单张 A100 80GB 才勉强够。想上消费级显卡,得走 INT4 / 低比特量化(约 17GB 量级),记得预留 10% 余量给 KV Cache 和激活值。
二是工具调用解析器要选对。上面示例用了 hermes,如果你用的框架不是 Hermes 系,照着官方 README 换对应的 parser,别硬套,套错了会出现"模型明明调了工具但客户端解析不出来"的玄学问题。
三是**"96% 吞吐提升"目前是官方自报口径,相对的是"开箱即用"状态,缺少第三方复现**。这个数字说明的是软件栈优化潜力,不是"训练成本直接打对折"的承诺。看到厂商自报的效率数字,脑子里自动打个折,是这行的基本素养。
进阶
如果这篇文章你只记住一件事,我希望是这个判断:国产算力的竞争,正在从"能不能跑"转到"能不能训",再从"能不能训"转到"训得多快"。
推理环节这两年被啃得差不多了——把训好的模型搬到国产芯片上跑,工程难度相对可控。但训练是另一回事:它要求芯片、互联、并行框架、算子库、编译器、容错机制全链路配合,任何一环躺平,几万张卡的集群就变成几万块电暖器。所以"能训"这四个字的含金量,比"能跑"高一个数量级。
而"训得快"又是再上一层。同一批硬件,把吞吐拉高 96%,等于把单位算力的成本砍掉近一半。在百万卡级训练需求面前,这 96% 换算成的是真金白银,也是国产算力从"能用"走向"划算"的分水岭。
冷水照例要泼,这次泼三盆:
第一,29B 的体量摆在这儿。 它不可能对标千亿级旗舰,别拿它去做需要顶级通用能力的活。它的价值区间是"够用、可控、便宜",不是"最强"。
第二,那些基准分数是厂商自报的。 尤其是 SWE-bench Verified、Terminal-Bench 这类对脚手架、工具权限、评测 harness 极度敏感的指标,换个 harness 跑一遍,掉个十几分很正常。在第三方复现出来之前,把这些数字当"声明"看,别当"事实"。
第三,"全栈国产"的边界还没划清。 训练环节的国产化是明确的,但数据清洗、评测环境、部分工具链是否也完全国产,公开信息里没有交代。这个词值得肯定,但不值得神话。
我的建议很具体:如果你手上有一张 24GB 或 48GB 的卡,拉一个量化版本,拿你真实业务里最烦人的一件"多步骤脏活"去试它——不是"帮我写个快排",而是"把这批合同里的违约责任条款抽出来,按风险等级排个序"。看它能不能自己走完"规划 → 调工具 → 产出"这条链。
这一步能不能走完,决定了 Agent 对你到底是玩具还是生产力。 走完了,29B 也是宝贝;走不完,744B 也只是个聊天窗口。
再往深一层,如果你关心的是国产算力本身,我更推荐顺着这条线去看 MindSpore 的 DVM 自动图算融合和 Ascend C 融合算子是怎么写的——框架和芯片之间那层"胶水",才是这 96% 真正的出处,也是接下来几年最值钱的技术栈。
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
