---
url: /openpangu/introduction.md
description: >-
  openPangu 2.0 是什么？华为开源盘古大模型的预训练、SFT 与后训练 RL 代码于 2026 年 9 月 28 日正式上线，Apache 2.0
  协议。505B 总参数、18B 激活、512K 上下文的 MoE 大模型全程在昇腾 910B 上训练，零 A100/H100。一文讲清
  openPangu-2.0-Training 与 openPangu-2.0-RL 的能力、架构、行业案例与上手姿势
---

# 认识华为盘古 openPangu 2.0 —— 505B 大模型的训练栈，今天全量开源了

先说一件有点荒诞的事。

你去翻现在市面上叫得上号的开源大模型——DeepSeek、Qwen、Kimi、Llama——不管许可证写得多自由，**它们全都是在同一家公司的 GPU 上训练出来的**。开源的是权重，训练过程永远是个黑盒。想复现？对不起，请自己攒几万张卡、自己写分布式框架、自己踩通信和 loss 突刺的坑。

所以"开源"这两个字，其实一直有个没说出口的上限：**给你鱼，不给你渔；给你模型，不给你厨房。**

然后今天，**2026 年 9 月 28 日**，华为把厨房也拆了给你看——开源盘古 openPangu-2.0 的**预训练代码、SFT 代码、后训练 RL 代码**正式上线，Apache 2.0，托管在 GitCode 的 Ascend Tribe 社区。

而这套厨房做出来的菜，是一个 **5050 亿参数**的 MoE 大模型，全程跑在昇腾 910B 上，**没有用过一张 A100 或 H100**。

> 开源权重是"你可以用我"，开源训练栈是"你可以变成我"。这两句话之间的距离，就是今天这一次发布的意义。

## 什么是 openPangu

先理清命名，不然很容易绕晕：

* **盘古**：华为的大模型品牌，从 2021 年用到现在，气象、矿山、铁路、金融、制造、医药这些行业模型都挂这个名字。
* **openPangu**：华为的**开源** AI 模型品牌，定位很明确——"通过昇腾原生训练与推理技术，为业界用好昇腾提供最佳实践参考"。说白了，盘古是卖解决方案的，openPangu 是给开发者抄作业的。
* **openPangu-2.0**：2026 年 6 月 12 日华为开发者大会上，余承东首次对外发布的版本，当场撂下一句"做全世界最好的盘古大模型"。

这次开源的两个仓库，各管一段：

| 仓库 | 管什么 | 一句话定位 |
| --- | --- | --- |
| **openPangu-2.0-Training** | 预训练 + SFT | 面向大规模基础模型训练的统一训练框架，覆盖 LLM、VLM、多模态，为百亿到万亿参数模型提供训练基础设施 |
| **openPangu-2.0-RL** | 后训练强化学习 | 以 VERL 为编排内核的昇腾原生 RL 加速框架，在昇腾集群上完成 Actor / Rollout / Reward 协同训练 |

两个都是 **Apache-2.0**。

### 三个月拼完的七件套

openPangu-2.0 不是一次性放出来的，是拆成零件、按节奏往外发的：

* **6 月 12 日**：HDC 大会发布 openPangu-2.0
* **6 月 30 日**：**openPangu-2.0-Flash** 开源——92B 总参数、每 token 激活 6B、512K 上下文
* **7 月 31 日**：**openPangu-2.0-Pro** 开源——505B 总参数、每 token 激活 18B、512K 上下文，同期放出技术报告
* **9 月 24 日前后**：**openPangu-2.0-Infer** 推理源码上线
* **9 月 28 日**：**openPangu-2.0-Training** + **openPangu-2.0-RL** 上线，训练栈收官
* **同期**：**openPangu-2.0-Op** 昇腾亲和高性能自定义算子仓库（AscendC / PyPTO / Triton 多种实现）

> 从权重、推理、算子到训练，七件套拼齐——这是目前公开模型里把训练链路开得最彻底的一家。注意是"最彻底"，不是"最强"，别自动脑补。

## 核心特点

### 一、训练侧：一体化，从预训练到持续优化

官方对 openPangu-2.0-Training 的能力描述是这么写的：

* **多维分布式并行**：数据并行、张量并行、流水线并行、专家并行按需组合，这是训 MoE 的入场券
* **高效数据流水线**：不让 GPU/NPU 等数据，这是大规模训练里最容易被低估的一环
* **混合精度训练**：FP16/BF16 等精度策略
* **自定义算子优化**：直接对接 openPangu-2.0-Op 里的 AscendC / PyPTO / Triton 融合算子
* **高可用训练**：长周期训练里的故障恢复与断点续跑——训过千卡的人都知道，这一条比什么都值钱

预训练侧支持**从头训练**、**基于已有 Checkpoint 持续训练**、**大规模分布式训练**与**长上下文训练**；SFT 侧支持指令对齐、多轮对话数据、领域数据微调、参数高效微调（LoRA 这类）与多任务训练。

翻译成人话：**你可以拿它做领域续训。** 医院、法院、工厂把自己的语料喂进去，在 Flash 或 Pro 的底座上长出一个自己的行业模型——这才是开源训练代码最实际的用途，而不是复现一个 505B。

### 二、RL 侧：站在 VERL 肩膀上，但不 Fork

openPangu-2.0-RL 的架构选择挺聪明：**以字节跳动的开源 RL 框架 VERL 作为训练编排内核**，然后通过运行时补丁 + 昇腾亲和优化来适配。

关键一句——**非侵入式适配**。它靠一个环境变量在运行时注入补丁：

```bash
export VERL_USE_EXTERNAL_MODULES=omni_rl.patches
```

不 Fork VERL 主线。这意味着 VERL 上游迭代了，它能相对无痛地跟上。对做过类似适配的人来说，这是个相当克制的工程决策——Fork 一时爽，merge 火葬场。

`omni_rl/rl` 下两块核心：

* **timely\_agent**：多轮 Agent、工具调用、奖励与数据流
* **verl\_adapt**：昇腾侧的算法优化，包括 **Prefill/Decode 分离**、**张量压缩**、**路由重放**

算法层面支持 **GSPO**（组序列策略优化）与 **GRPO**（组相对策略优化），两个典型场景：

* **数学推理**：单轮 Rollout，模型一次生成完整长思维链，规则奖励核对答案与格式
* **面向推理的代码生成（Code-For-Reasoning）**：多轮 Rollout（ReAct），模型写 Python、调解释器执行、看结果继续推理

### 三、模型侧：把稀疏做到 28:1

训练栈服务的两个模型，架构上有一堆自研名词，挑重点说：

* **28:1 稀疏比**：Pro 总参数 505B，每 token 只激活 18B。用大模型的能力，付小模型的算力钱
* **512K 上下文**：靠 **DSA + SWA 分层混合超稀疏注意力**（约 1:2 配比），主流开源模型普遍停在 128K~256K
* **MLA**（多头潜在注意力）+ **mHC** 四分支残差拓扑 + **三头 MTP**（多 token 预测）
* **Muon 优化器**：微软提出的二阶动量方案，大规模训练下的稳定性更好
* 两个模型训练预算都在 **34 万亿 token** 量级

华为技术报告里给出的几个数字：

| 指标 | openPangu-2.0 表现 |
| --- | --- |
| 昇腾单卡吞吐 | 主流开源模型的 **2 倍** |
| 超节点训练效率 | **+30%** |
| 512K 长序列训练吞吐 | **+50%** |
| 训推一致性 | **>99%** |
| Flash-Int8（W4A8） | 显存 **-40%**（对比 BF16） |

> 训推一致性 >99% 这条，做过 MoE 生产部署的人都懂有多痛——路由在训练和推理时漂一点，效果就莫名其妙地掉。这是工程问题，不是论文问题。

### 四、许可证：Apache 2.0，可以商用

两个仓库都是 Apache-2.0，没有 copyleft 传染，改完闭源卖也行。这点比不少"权重开源、代码非商用"的模型痛快。

但要提醒一句：**模型和代码是两回事。** openPangu 系列权重走的是自己的 openPangu 许可证，不是标准 Apache，商用前一定去读对应仓库的 LICENSE。别看到训练框架 Apache-2.0 就默认权重也能随便卖。

## 谁在用：真实案例，带硬数据

这里必须把话说清楚，免得误导：**下面这些是"盘古"行业大模型的公开落地成绩，属于华为的行业解决方案线，不等于 openPangu-2.0 开源版本身的成绩。** 开源版是 2026 年 6 月才起步的新系列，公开的一线数据目前主要是下载量。但这两个数字能说明热度：

> 截至 2026 年 9 月 28 日，AtomGit（GitCode）数据显示：**openPangu-2.0-Flash 下载 22,068 次，openPangu-2.0-Pro 下载 8,834 次。**

盘古这条线在行业里到底干了什么，几个被广泛引用的公开案例：

* **气象（登上《Nature》正刊）**：盘古气象大模型是首个精度超过传统数值预报的 AI 预测模型。原来预测台风未来 10 天路径，需要在 **3000 台服务器**的高性能集群上仿真 **5 小时**；现在**单台服务器单卡、10 秒内**拿到更精确的结果，速度提升万倍以上。曾提前 10 天预测出台风"玛娃"路径。
* **矿山（山东能源集团）**：盘古矿山大模型已在全国 **8 个矿井**规模使用，覆盖采、掘、机、运、通、洗选 **7 大业务流程、1000 多个细分场景**。洗选煤参数优化场景里，精煤回收率提升 **0.1%~0.2%**，让山能集团济二煤矿每年多产出 **8000 吨精煤**；推广到全国，可让每个煤矿年均多产 **2000 吨**。防冲卸压施工孔深智能监管让人工核验工作量**降低 80%**；兴隆庄一期危险区域人员入侵识别率达 **90% 以上**，比传统小模型精度高 10%。
* **铁路**：盘古铁路大模型精准识别现网 **67 种货车、430 多种故障**，无故障图片筛除率 **95%**，把列检员从每天**数百万张**图片的"图海"里捞出来，效率提升约 **20 倍**。
* **金融**：盘古金融大模型对银行政策、操作、案例文档预训练，柜员平均 **5 次操作降到 1 次**，办结时间**缩短 5 分钟以上**。
* **制造**：单产线制定器件分配计划，过去要 **3 小时以上**才能做齐 1 天的生产计划；盘古制造大模型学会华为供应链数据与规则后，**1 分钟**做出未来 **3 天**的生产计划。
* **医药**：盘古药物分子大模型助力西安交大第一附属医院团队发现全球 **40 年来首个新靶点、新类别抗生素**（肉桂酰菌素），先导药物研发周期从以年计**缩短至 1 个月**、研发成本**降低 70%**，目前该药物已进入临床阶段。

### 但有句实话必须说

我不想只念好话。openPangu-2.0 现在有几条硬伤，你得知道：

1. **硬件绑定是双刃剑**。整套栈为昇腾优化，`import torch_npu` 才能跑。你手上要是几千张 NVIDIA 卡，这套东西基本跟你没关系——反过来，你如果本来就在昇腾上，那它就是目前最完整的原生训练栈。**选它，本质是在选算力阵营。**
2. **训练侧第三方基准还缺位**。2 倍吞吐、+30% 效率这些是华为技术报告的口径，目前公开的独立第三方复现结果还不多，看到数字请保持一点健康的怀疑。
3. **代码非常新**。Training 仓库 3 天前建，RL 仓库 9 小时前刚更新，Star 数还在个位数到十几的量级，社区、踩坑记录、中文教程几乎为零。**你现在进去，就是第一批踩坑的人**——可能很爽，也可能很痛。
4. **门槛是真的高**。这是给百亿到万亿参数模型准备的框架，最小可用规模也是多机多卡昇腾集群。没有算力的人，最好的姿势是读代码学架构，别幻想在笔记本上跑起来。

> 我的建议：有昇腾集群、要做领域续训或后训练的团队——现在就可以认真评估，这是目前唯一一套能让你完整复现"国产算力训出万亿级 MoE"的公开代码。纯 NVIDIA 环境或者只想调 API 的——先围观，别急着换栈。

## 初体验：从 clone 到跑起来

先把预期管理好：**这套东西不是 pip install 完就能在笔记本上跑的**，它需要昇腾 NPU、CANN、以及一个像样的集群。下面给的是官方 README 明确写出的路径。

### 训练侧：openPangu-2.0-Training

仓库结构很干净，看一眼就知道是标准 Python 工程：

```text
openPangu-2.0-Training/
├── PanGu/          # 盘古模型实现
├── config/         # 训练配置
├── docs/           # 使用文档
├── tools/          # 工具脚本
├── launch.py       # 训练启动入口
├── pyproject.toml  # 包管理配置
├── setup.py        # 安装脚本
└── LICENSE         # Apache-2.0
```

标准上手姿势：

```bash
# 1. 拉代码
git clone https://gitcode.com/ascend-tribe/openPangu-2.0-Training.git
cd openPangu-2.0-Training

# 2. 安装（仓库带 pyproject.toml 与 setup.py，按 Python 包方式安装）
pip install -e .

# 3. 按 config/ 下的配置文件启动训练（具体配置项见 docs/）
python launch.py --config <你的配置文件>
```

具体支持哪些并行组合、混合精度怎么配、长上下文训练怎么开，以仓库 `docs/` 目录为准——**这块我建议你直接读文档，比看任何二手教程都准**，毕竟仓库才三天大，网上那些"教程"大概率还没人写过。

### RL 侧：openPangu-2.0-RL

RL 这边的流程更重，要**先做镜像**：

```bash
# 必须带 --recurse-submodules，否则 third_party（含 VERL）不完整
# -c core.autocrlf=input 统一换行符为 LF，避免 Windows 转成 CRLF 炸脚本
git clone -c core.autocrlf=input --recurse-submodules \
  https://gitcode.com/ascend-tribe/openPangu-2.0-RL.git

# 构建镜像：依赖含 CANN、昇腾驱动的基础镜像，
# 并需手动放入 tools/docker/copy_data/ 下的外部包
cd openPangu-2.0-RL
bash tools/docker/build.sh
```

数据准备支持 **JSONL / JSON / Parquet**，每条样本需要对话 `prompt`；规则奖励场景还要在 `meta` 里给出标准答案（`gt` / `solution`）。多机训练时**所有节点的数据路径必须一致**——这种小细节不提前知道，能让你在半夜调半天。

两个场景的作业入口：

```text
Reasoning             → tests/system_tests/e2e/pangu92b/reasoning/
Code-For-Reasoning    → tests/system_tests/e2e/pangu92b/code4math/
```

核心包 `omni_rl/` 的目录也值得看一眼，基本能猜出整个 RL 的数据流：

```text
omni_rl/
├── config/     # Hydra 配置：算法、Agent、模型、工具、HCCL
├── dataset/    # 数据集加载（PanguDataset、JSONL）
├── engines/    # 推理引擎适配（Omni-Infer 等）
├── models/     # 盘古模型适配与 Chat Template
├── patches/    # 运行时补丁（VERL / Megatron / Pangu / Torch）
├── reward/     # 奖励适配
├── rl/         # RL 核心：Timely Agent、VERL 算法与混合引擎适配
├── utils/      # 日志、补丁管理、指标
└── workers/    # Rollout Worker
```

### 三条安全红线，官方专门写了

这段别跳过，因为 **Code-For-Reasoning 场景会执行大模型自己写的代码**：

1. **必须跑在隔离网络里**。训练依赖 Ray、gRPC 等服务，集群内服务（Ray Dashboard、对象存储）**没有内建认证**，全靠网络边界把门。别把端口暴露给不受信网络。
2. **模型生成的代码会被执行**。Python 解释器工具默认在独立子进程里跑并带超时保护，但不受信数据集可能通过 prompt 注入诱导模型生成恶意代码——**只在可信数据集上训练**。
3. **Checkpoint 来源要可信**。框架按 legacy Megatron pickle 格式加载 checkpoint，并启用 tokenizer 自定义代码（`trust_remote_code`）。pickle 加载的风险不用我多说了吧。

### 只想先看看模型？

没有昇腾也能玩，去华为云 ModelArts 订阅 API 就行，或者直接在 GitCode 下权重用推理代码跑。社区入口都在 [Ascend Tribe](https://gitcode.com/ascend-tribe)。有问题可以提 issue，或直接发邮件给 openPangu@huawei.com。

> 入门别贪多：没算力就先读代码学架构（MoE 路由怎么做的、512K 怎么训的、训推一致性怎么保的），有算力再谈复现。前者对 99% 的人更有价值。

## 进阶

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
