---
url: /lm/xing4/introduction.md
description: >-
  星辰 Xing4.0-29B-A4B 是中电信人工智能科技有限公司于 2026 年 9 月 17 日开源的轻量级代码智能体大模型，29B 总参数 MoE、每
  token 仅激活 4B，原生 256K 上下文可扩展至 512K，全程基于昇腾 910C 与昇思 MindSpore 训练、训练吞吐较开箱状态提升约
  96%，是国内首个全栈国产算力训成的百亿参数开源大模型。本文带你快速认识它是什么、强在哪、怎么上手。
---

# 认识星辰 Xing4.0-29B-A4B：第一个"从芯片到框架全栈国产"训出来的开源智能体模型

过去两年，国产算力在 AI 圈的出场方式基本固定：**模型在英伟达上训完，再搬到国产芯片上跑推理。** 能跑，是好事；但"能跑"和"能训"之间，隔着一整套软件生态的成熟度——芯片、互联、并行框架、算子库、编译器、容错机制，任何一环掉链子，几万张卡的训练就直接崩给你看。

所以当我看到 2026 年 9 月 17 日这条消息时，第一反应不是"又一个小模型开源了"，而是愣了一下：

**中国电信旗下中电信人工智能科技有限公司，把新一代星辰大模型 Xing4.0-29B-A4B 开源了，而且是全程用昇腾 910C 芯片 + 昇思 MindSpore 框架训出来的。**

不是训完再移植，是**从第一天就在国产算力上训**。更有意思的是那个数字：通过多级协同优化，**训练吞吐比"开箱即用"状态提升了约 96%**——同一批硬件，靠框架层和算子层的打磨，把效率几乎翻了一倍。

> 我一直觉得，国产算力真正的短板不在"卡够不够多"，而在"能不能把卡的性能榨出来"。硬件可以堆，工程能力只能熬。96% 这个数字，熬的正是后者。

## 什么是星辰 Xing4.0-29B-A4B

**Xing4.0-29B-A4B 是中国电信"星辰"系列（前身 TeleChat）的新一代大模型，定位很明确：面向智能体时代的轻量级代码智能体模型。**

拆解一下这个名字里的密码：`29B` 是总参数量，`A4B` 是每生成一个 token 实际激活的参数量——**29B 的体量，只干 4B 的活**。这是典型的 MoE（混合专家）架构套路：模型里养着一大群专家，每次推理只叫醒最相关的几个。

具体规格是这样的（数据来自官方模型卡）：

| 项目 | 参数 |
| --- | --- |
| 总参数 / 激活参数 | 29B / 4B |
| 架构 | mHC + MLA + MTP |
| 层数 | 40 层 |
| 隐藏维度 | 3584 |
| 注意力类型 | MLA（多头潜在注意力） |
| 路由专家 / 共享专家 | 64 个 / 1 个，每 token 激活 4 个 |
| 原生上下文 | 256K，可扩展至 512K |

**mHC + MLA + MTP 这套组合，是冲着"干活"去的。** 多步骤规划、工具调用、复杂推理链执行——这三样恰恰是智能体场景最吃力、也最容易掉链子的能力。官方的说法是，这套架构重点保证了**长上下文下任务连贯性和执行稳定性**。

> 换句话说，Xing4.0 系列和上一代星辰最大的区别，是从"会回答"转向"会做事"。以前你问它一个问题，它给你一段话；现在你给它一个目标，它自己规划路径、调工具、把活干完。**从信息助手到任务执行者，这半步比参数涨十倍重要得多。**

## 它有什么特点

* **国内首个基于国产算力和国产框架完成训练、面向复杂工程任务深度优化的百亿参数大模型。** 全程跑在昇腾 910C 集群上，用的是 MindSpore / MindFormers，不是"训完再适配"。
* **训练吞吐提升约 96%。** 靠的是四层协同优化：细粒度 MoE 通信优化、选择性重计算、DVM 自动图算融合、Ascend C mHC 融合算子。这是把框架和芯片一起打磨出来的结果，不是加卡加上去的。
* **29B / 4B 的 MoE，轻得有点过分。** 每 token 只激活 4B，意味着推理成本对标的是小模型，能力却往 30B+ 那一档够。
* **256K 原生上下文，可扩到 512K。** 长文档、整仓代码、多轮复杂工作流，塞得进去。
* **低比特量化后，消费级显卡就能跑。** 官方明确说通过量化把显存占用大幅压低，开发者不用依赖大型服务器就能本地部署——这对想玩 Agent 但只有一张游戏卡的人，是真友好。
* **开放生态路线，不绑自家框架。** 微调支持 LLaMA-Factory 和 MindFormers；推理支持 SGLang、vLLM、KTransformers；还针对 OpenCode、Claude Code、OpenClaw、Hermes 等 Agent 框架做了格式对齐适配，能直接接进现有工作流。
* **多平台同步上线。** GitHub、Hugging Face、Gitee、魔搭、魔乐，五个社区都能拿到，不用翻墙不用求人。
* **面向垂直场景好微调。** 意图分类、表格理解、合同审核、知识问答这类下游任务，用自己的数据做轻量定制成本很低。

> 先泼盆冷水，也给自己降降温：**29B 的体量决定了它的能力上限。** 它不可能去对标千亿级旗舰模型，定位很清楚——**够用、可控、便宜**。想拿它当万能底座的，趁早收手。

## 它能用在哪（真实案例与数据）

空口无凭，先看硬指标。官方公布的基准成绩（模型卡数据）：

| 基准 | 得分 | 说明 |
| --- | --- | --- |
| SWE-bench Verified | 75.00 | 真实工程 Issue 修复，硬指标 |
| SWE-bench Multilingual | 66.00 | 多语言代码能力 |
| Terminal-Bench 2.1 | 57.50 | 终端环境操作，官方称超过同规模 Gemma4-26B-A4B |
| AIME2026 | 90.00 | 数学竞赛题，这个分数在 29B 量级相当能打 |
| Claw-Eval | 76.55 | 工具调用 / 智能体能力 |
| IFBench | 69.67 | 指令遵循 |
| Tau3-Bench | 64.63 | 多轮工具交互 |
| AA.LCR | 61.00 | 长上下文检索 |
| DeepresearchBII | 60.80 | 深度研究能力 |

整体水平，官方口径是与 **Qwen3.6-35B-A3B 大致相当**——注意，那是个 35B 的模型，而 Xing4.0 激活参数只有 4B。**用更少的激活量换到接近的效果，这就是 MoE 的账。**

落地侧，中国电信自己就有一张现成的答卷：**星辰超级智能体 TeleAgent**。

* **注册用户突破 118 万**，Skill 技能数量从最初的几千个扩展到 **5 万余个**——从技术原型验证走到规模化商业落地，这条路它自己在跑。
* IDC 近日发布的《中国企业级通用 Agent 产品技术评估》报告显示，TeleAgent 在**成本效率、安全可控、任务表现**等多个关键维度上显著高于行业普遍水平。

场景上，官方给的两类例子挺接地气：

**工作场景**：你直接说"把这份销售数据做个分析"或者"整理一下这批材料"，Agent 自己去读文件、分析数据、调工具、产出结果，而不是给你一段"你可以这样做"的建议。

**生活场景**：积分兑换、观影推荐、游戏选择、出行规划——它理解意图之后直接调服务把事办了。

垂直行业这边，官方点名了四个方向：**意图分类、表格理解、合同审核、知识问答**。这四个的共同点是——数据敏感、格式固定、需要私有化部署。一个 29B 的、能在国产算力上跑的开源模型，对这些场景来说几乎是量身定做。

> 说个我自己的观察：国产大模型这两年在"政务/国企/金融"这类场景里推进慢，卡点从来不是模型效果，而是**能不能在自己可控的硬件上从头到尾跑一遍**。Xing4.0 把训练的那一环也走通了，这件事的意义比基准表上那几个分数大得多。

顺带提一句口径问题，免得打架：本站之前写过的 **LongCat-2.0** 是"业界首个完全依靠国产算力完成训练与推理全流程的**万亿参数**开源大模型"，而 Xing4.0 是"**百亿参数**量级首个全栈国产训练、且面向复杂工程任务深度优化"的模型。两个"首个"限定条件不同，不冲突——**看这类宣传语，先把定语读完再下结论。**

## 初体验：怎么上手星辰 Xing4.0-29B-A4B

三种玩法，从省事到硬核：

**第一种：不想装环境，先在线体验。** 中国电信自家和多家社区平台都已上线体验入口，急着看效果的可以先去点几下；想拿权重就直接从 Hugging Face（`XingChen-AGI/Xing4.0-29B-A4B`）、魔搭、魔乐、Gitee 拉。国内用户建议优先走魔搭，速度体感差很多。

**第二种：本地跑起来。** 官方支持 SGLang、vLLM、KTransformers 三家推理框架。以 vLLM 起一个 OpenAI 兼容服务为例（版本号以官方仓库 README 为准，别照抄我这里的）：

```bash
# 从魔搭拉取权重
pip install modelscope
modelscope download --model XingChen-AGI/Xing4.0-29B-A4B --local_dir ./Xing4.0-29B-A4B

# 用 vLLM 起服务，暴露 OpenAI 兼容接口
vllm serve ./Xing4.0-29B-A4B \
  --served-model-name xing4 \
  --max-model-len 262144 \
  --enable-auto-tool-choice \
  --tool-call-parser hermes \
  --port 8000
```

调它跟调 OpenAI 没什么两样：

```python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

resp = client.chat.completions.create(
    model="xing4",
    messages=[
        {"role": "user", "content": "读一下 ./report.csv，算出各区域环比增速，把结果写成一段结论"}
    ],
)
print(resp.choices[0].message.content)
```

**第三种：接进 Agent 框架。** 官方已经对 OpenCode、Claude Code、OpenClaw、Hermes 做了格式对齐适配，配好 base\_url 和模型名即可，不用自己写工具调用解析器。

**三个必须注意的坑：**

一是**显存要算清楚**。29B 全参数模型 FP16 推理，第三方估算大约需要 **68GB 显存**——单张 A100 80GB 才勉强够。想上消费级显卡，得走 INT4 / 低比特量化（约 17GB 量级），**记得预留 10% 余量给 KV Cache 和激活值**。

二是**工具调用解析器要选对**。上面示例用了 `hermes`，如果你用的框架不是 Hermes 系，照着官方 README 换对应的 parser，**别硬套**，套错了会出现"模型明明调了工具但客户端解析不出来"的玄学问题。

三是\*\*"96% 吞吐提升"目前是官方自报口径，相对的是"开箱即用"状态，缺少第三方复现\*\*。这个数字说明的是软件栈优化潜力，不是"训练成本直接打对折"的承诺。**看到厂商自报的效率数字，脑子里自动打个折，是这行的基本素养。**

## 进阶

如果这篇文章你只记住一件事，我希望是这个判断：**国产算力的竞争，正在从"能不能跑"转到"能不能训"，再从"能不能训"转到"训得多快"。**

推理环节这两年被啃得差不多了——把训好的模型搬到国产芯片上跑，工程难度相对可控。但训练是另一回事：它要求芯片、互联、并行框架、算子库、编译器、容错机制全链路配合，**任何一环躺平，几万张卡的集群就变成几万块电暖器**。所以"能训"这四个字的含金量，比"能跑"高一个数量级。

而"训得快"又是再上一层。同一批硬件，把吞吐拉高 96%，等于把单位算力的成本砍掉近一半。**在百万卡级训练需求面前，这 96% 换算成的是真金白银，也是国产算力从"能用"走向"划算"的分水岭。**

冷水照例要泼，这次泼三盆：

**第一，29B 的体量摆在这儿。** 它不可能对标千亿级旗舰，别拿它去做需要顶级通用能力的活。它的价值区间是"够用、可控、便宜"，不是"最强"。

**第二，那些基准分数是厂商自报的。** 尤其是 SWE-bench Verified、Terminal-Bench 这类对脚手架、工具权限、评测 harness 极度敏感的指标，**换个 harness 跑一遍，掉个十几分很正常**。在第三方复现出来之前，把这些数字当"声明"看，别当"事实"。

**第三，"全栈国产"的边界还没划清。** 训练环节的国产化是明确的，但数据清洗、评测环境、部分工具链是否也完全国产，公开信息里没有交代。**这个词值得肯定，但不值得神话。**

我的建议很具体：**如果你手上有一张 24GB 或 48GB 的卡，拉一个量化版本，拿你真实业务里最烦人的一件"多步骤脏活"去试它**——不是"帮我写个快排"，而是"把这批合同里的违约责任条款抽出来，按风险等级排个序"。看它能不能自己走完"规划 → 调工具 → 产出"这条链。

**这一步能不能走完，决定了 Agent 对你到底是玩具还是生产力。** 走完了，29B 也是宝贝；走不完，744B 也只是个聊天窗口。

再往深一层，如果你关心的是国产算力本身，我更推荐顺着这条线去看 MindSpore 的 **DVM 自动图算融合**和 **Ascend C 融合算子**是怎么写的——**框架和芯片之间那层"胶水"，才是这 96% 真正的出处，也是接下来几年最值钱的技术栈。**

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
