认识华为盘古 openPangu 2.0 —— 505B 大模型的训练栈,今天全量开源了
先说一件有点荒诞的事。
你去翻现在市面上叫得上号的开源大模型——DeepSeek、Qwen、Kimi、Llama——不管许可证写得多自由,它们全都是在同一家公司的 GPU 上训练出来的。开源的是权重,训练过程永远是个黑盒。想复现?对不起,请自己攒几万张卡、自己写分布式框架、自己踩通信和 loss 突刺的坑。
所以"开源"这两个字,其实一直有个没说出口的上限:给你鱼,不给你渔;给你模型,不给你厨房。
然后今天,2026 年 9 月 28 日,华为把厨房也拆了给你看——开源盘古 openPangu-2.0 的预训练代码、SFT 代码、后训练 RL 代码正式上线,Apache 2.0,托管在 GitCode 的 Ascend Tribe 社区。
而这套厨房做出来的菜,是一个 5050 亿参数的 MoE 大模型,全程跑在昇腾 910B 上,没有用过一张 A100 或 H100。
开源权重是"你可以用我",开源训练栈是"你可以变成我"。这两句话之间的距离,就是今天这一次发布的意义。
什么是 openPangu
先理清命名,不然很容易绕晕:
- 盘古:华为的大模型品牌,从 2021 年用到现在,气象、矿山、铁路、金融、制造、医药这些行业模型都挂这个名字。
- openPangu:华为的开源 AI 模型品牌,定位很明确——"通过昇腾原生训练与推理技术,为业界用好昇腾提供最佳实践参考"。说白了,盘古是卖解决方案的,openPangu 是给开发者抄作业的。
- openPangu-2.0:2026 年 6 月 12 日华为开发者大会上,余承东首次对外发布的版本,当场撂下一句"做全世界最好的盘古大模型"。
这次开源的两个仓库,各管一段:
| 仓库 | 管什么 | 一句话定位 |
|---|---|---|
| openPangu-2.0-Training | 预训练 + SFT | 面向大规模基础模型训练的统一训练框架,覆盖 LLM、VLM、多模态,为百亿到万亿参数模型提供训练基础设施 |
| openPangu-2.0-RL | 后训练强化学习 | 以 VERL 为编排内核的昇腾原生 RL 加速框架,在昇腾集群上完成 Actor / Rollout / Reward 协同训练 |
两个都是 Apache-2.0。
三个月拼完的七件套
openPangu-2.0 不是一次性放出来的,是拆成零件、按节奏往外发的:
- 6 月 12 日:HDC 大会发布 openPangu-2.0
- 6 月 30 日:openPangu-2.0-Flash 开源——92B 总参数、每 token 激活 6B、512K 上下文
- 7 月 31 日:openPangu-2.0-Pro 开源——505B 总参数、每 token 激活 18B、512K 上下文,同期放出技术报告
- 9 月 24 日前后:openPangu-2.0-Infer 推理源码上线
- 9 月 28 日:openPangu-2.0-Training + openPangu-2.0-RL 上线,训练栈收官
- 同期:openPangu-2.0-Op 昇腾亲和高性能自定义算子仓库(AscendC / PyPTO / Triton 多种实现)
从权重、推理、算子到训练,七件套拼齐——这是目前公开模型里把训练链路开得最彻底的一家。注意是"最彻底",不是"最强",别自动脑补。
核心特点
一、训练侧:一体化,从预训练到持续优化
官方对 openPangu-2.0-Training 的能力描述是这么写的:
- 多维分布式并行:数据并行、张量并行、流水线并行、专家并行按需组合,这是训 MoE 的入场券
- 高效数据流水线:不让 GPU/NPU 等数据,这是大规模训练里最容易被低估的一环
- 混合精度训练:FP16/BF16 等精度策略
- 自定义算子优化:直接对接 openPangu-2.0-Op 里的 AscendC / PyPTO / Triton 融合算子
- 高可用训练:长周期训练里的故障恢复与断点续跑——训过千卡的人都知道,这一条比什么都值钱
预训练侧支持从头训练、基于已有 Checkpoint 持续训练、大规模分布式训练与长上下文训练;SFT 侧支持指令对齐、多轮对话数据、领域数据微调、参数高效微调(LoRA 这类)与多任务训练。
翻译成人话:你可以拿它做领域续训。 医院、法院、工厂把自己的语料喂进去,在 Flash 或 Pro 的底座上长出一个自己的行业模型——这才是开源训练代码最实际的用途,而不是复现一个 505B。
二、RL 侧:站在 VERL 肩膀上,但不 Fork
openPangu-2.0-RL 的架构选择挺聪明:以字节跳动的开源 RL 框架 VERL 作为训练编排内核,然后通过运行时补丁 + 昇腾亲和优化来适配。
关键一句——非侵入式适配。它靠一个环境变量在运行时注入补丁:
export VERL_USE_EXTERNAL_MODULES=omni_rl.patches不 Fork VERL 主线。这意味着 VERL 上游迭代了,它能相对无痛地跟上。对做过类似适配的人来说,这是个相当克制的工程决策——Fork 一时爽,merge 火葬场。
omni_rl/rl 下两块核心:
- timely_agent:多轮 Agent、工具调用、奖励与数据流
- verl_adapt:昇腾侧的算法优化,包括 Prefill/Decode 分离、张量压缩、路由重放
算法层面支持 GSPO(组序列策略优化)与 GRPO(组相对策略优化),两个典型场景:
- 数学推理:单轮 Rollout,模型一次生成完整长思维链,规则奖励核对答案与格式
- 面向推理的代码生成(Code-For-Reasoning):多轮 Rollout(ReAct),模型写 Python、调解释器执行、看结果继续推理
三、模型侧:把稀疏做到 28:1
训练栈服务的两个模型,架构上有一堆自研名词,挑重点说:
- 28:1 稀疏比:Pro 总参数 505B,每 token 只激活 18B。用大模型的能力,付小模型的算力钱
- 512K 上下文:靠 DSA + SWA 分层混合超稀疏注意力(约 1:2 配比),主流开源模型普遍停在 128K~256K
- MLA(多头潜在注意力)+ mHC 四分支残差拓扑 + 三头 MTP(多 token 预测)
- Muon 优化器:微软提出的二阶动量方案,大规模训练下的稳定性更好
- 两个模型训练预算都在 34 万亿 token 量级
华为技术报告里给出的几个数字:
| 指标 | openPangu-2.0 表现 |
|---|---|
| 昇腾单卡吞吐 | 主流开源模型的 2 倍 |
| 超节点训练效率 | +30% |
| 512K 长序列训练吞吐 | +50% |
| 训推一致性 | >99% |
| Flash-Int8(W4A8) | 显存 -40%(对比 BF16) |
训推一致性 >99% 这条,做过 MoE 生产部署的人都懂有多痛——路由在训练和推理时漂一点,效果就莫名其妙地掉。这是工程问题,不是论文问题。
四、许可证:Apache 2.0,可以商用
两个仓库都是 Apache-2.0,没有 copyleft 传染,改完闭源卖也行。这点比不少"权重开源、代码非商用"的模型痛快。
但要提醒一句:模型和代码是两回事。 openPangu 系列权重走的是自己的 openPangu 许可证,不是标准 Apache,商用前一定去读对应仓库的 LICENSE。别看到训练框架 Apache-2.0 就默认权重也能随便卖。
谁在用:真实案例,带硬数据
这里必须把话说清楚,免得误导:下面这些是"盘古"行业大模型的公开落地成绩,属于华为的行业解决方案线,不等于 openPangu-2.0 开源版本身的成绩。 开源版是 2026 年 6 月才起步的新系列,公开的一线数据目前主要是下载量。但这两个数字能说明热度:
截至 2026 年 9 月 28 日,AtomGit(GitCode)数据显示:openPangu-2.0-Flash 下载 22,068 次,openPangu-2.0-Pro 下载 8,834 次。
盘古这条线在行业里到底干了什么,几个被广泛引用的公开案例:
- 气象(登上《Nature》正刊):盘古气象大模型是首个精度超过传统数值预报的 AI 预测模型。原来预测台风未来 10 天路径,需要在 3000 台服务器的高性能集群上仿真 5 小时;现在单台服务器单卡、10 秒内拿到更精确的结果,速度提升万倍以上。曾提前 10 天预测出台风"玛娃"路径。
- 矿山(山东能源集团):盘古矿山大模型已在全国 8 个矿井规模使用,覆盖采、掘、机、运、通、洗选 7 大业务流程、1000 多个细分场景。洗选煤参数优化场景里,精煤回收率提升 0.1%~0.2%,让山能集团济二煤矿每年多产出 8000 吨精煤;推广到全国,可让每个煤矿年均多产 2000 吨。防冲卸压施工孔深智能监管让人工核验工作量降低 80%;兴隆庄一期危险区域人员入侵识别率达 90% 以上,比传统小模型精度高 10%。
- 铁路:盘古铁路大模型精准识别现网 67 种货车、430 多种故障,无故障图片筛除率 95%,把列检员从每天数百万张图片的"图海"里捞出来,效率提升约 20 倍。
- 金融:盘古金融大模型对银行政策、操作、案例文档预训练,柜员平均 5 次操作降到 1 次,办结时间缩短 5 分钟以上。
- 制造:单产线制定器件分配计划,过去要 3 小时以上才能做齐 1 天的生产计划;盘古制造大模型学会华为供应链数据与规则后,1 分钟做出未来 3 天的生产计划。
- 医药:盘古药物分子大模型助力西安交大第一附属医院团队发现全球 40 年来首个新靶点、新类别抗生素(肉桂酰菌素),先导药物研发周期从以年计缩短至 1 个月、研发成本降低 70%,目前该药物已进入临床阶段。
但有句实话必须说
我不想只念好话。openPangu-2.0 现在有几条硬伤,你得知道:
- 硬件绑定是双刃剑。整套栈为昇腾优化,
import torch_npu才能跑。你手上要是几千张 NVIDIA 卡,这套东西基本跟你没关系——反过来,你如果本来就在昇腾上,那它就是目前最完整的原生训练栈。选它,本质是在选算力阵营。 - 训练侧第三方基准还缺位。2 倍吞吐、+30% 效率这些是华为技术报告的口径,目前公开的独立第三方复现结果还不多,看到数字请保持一点健康的怀疑。
- 代码非常新。Training 仓库 3 天前建,RL 仓库 9 小时前刚更新,Star 数还在个位数到十几的量级,社区、踩坑记录、中文教程几乎为零。你现在进去,就是第一批踩坑的人——可能很爽,也可能很痛。
- 门槛是真的高。这是给百亿到万亿参数模型准备的框架,最小可用规模也是多机多卡昇腾集群。没有算力的人,最好的姿势是读代码学架构,别幻想在笔记本上跑起来。
我的建议:有昇腾集群、要做领域续训或后训练的团队——现在就可以认真评估,这是目前唯一一套能让你完整复现"国产算力训出万亿级 MoE"的公开代码。纯 NVIDIA 环境或者只想调 API 的——先围观,别急着换栈。
初体验:从 clone 到跑起来
先把预期管理好:这套东西不是 pip install 完就能在笔记本上跑的,它需要昇腾 NPU、CANN、以及一个像样的集群。下面给的是官方 README 明确写出的路径。
训练侧:openPangu-2.0-Training
仓库结构很干净,看一眼就知道是标准 Python 工程:
openPangu-2.0-Training/
├── PanGu/ # 盘古模型实现
├── config/ # 训练配置
├── docs/ # 使用文档
├── tools/ # 工具脚本
├── launch.py # 训练启动入口
├── pyproject.toml # 包管理配置
├── setup.py # 安装脚本
└── LICENSE # Apache-2.0标准上手姿势:
# 1. 拉代码
git clone https://gitcode.com/ascend-tribe/openPangu-2.0-Training.git
cd openPangu-2.0-Training
# 2. 安装(仓库带 pyproject.toml 与 setup.py,按 Python 包方式安装)
pip install -e .
# 3. 按 config/ 下的配置文件启动训练(具体配置项见 docs/)
python launch.py --config <你的配置文件>具体支持哪些并行组合、混合精度怎么配、长上下文训练怎么开,以仓库 docs/ 目录为准——这块我建议你直接读文档,比看任何二手教程都准,毕竟仓库才三天大,网上那些"教程"大概率还没人写过。
RL 侧:openPangu-2.0-RL
RL 这边的流程更重,要先做镜像:
# 必须带 --recurse-submodules,否则 third_party(含 VERL)不完整
# -c core.autocrlf=input 统一换行符为 LF,避免 Windows 转成 CRLF 炸脚本
git clone -c core.autocrlf=input --recurse-submodules \
https://gitcode.com/ascend-tribe/openPangu-2.0-RL.git
# 构建镜像:依赖含 CANN、昇腾驱动的基础镜像,
# 并需手动放入 tools/docker/copy_data/ 下的外部包
cd openPangu-2.0-RL
bash tools/docker/build.sh数据准备支持 JSONL / JSON / Parquet,每条样本需要对话 prompt;规则奖励场景还要在 meta 里给出标准答案(gt / solution)。多机训练时所有节点的数据路径必须一致——这种小细节不提前知道,能让你在半夜调半天。
两个场景的作业入口:
Reasoning → tests/system_tests/e2e/pangu92b/reasoning/
Code-For-Reasoning → tests/system_tests/e2e/pangu92b/code4math/核心包 omni_rl/ 的目录也值得看一眼,基本能猜出整个 RL 的数据流:
omni_rl/
├── config/ # Hydra 配置:算法、Agent、模型、工具、HCCL
├── dataset/ # 数据集加载(PanguDataset、JSONL)
├── engines/ # 推理引擎适配(Omni-Infer 等)
├── models/ # 盘古模型适配与 Chat Template
├── patches/ # 运行时补丁(VERL / Megatron / Pangu / Torch)
├── reward/ # 奖励适配
├── rl/ # RL 核心:Timely Agent、VERL 算法与混合引擎适配
├── utils/ # 日志、补丁管理、指标
└── workers/ # Rollout Worker三条安全红线,官方专门写了
这段别跳过,因为 Code-For-Reasoning 场景会执行大模型自己写的代码:
- 必须跑在隔离网络里。训练依赖 Ray、gRPC 等服务,集群内服务(Ray Dashboard、对象存储)没有内建认证,全靠网络边界把门。别把端口暴露给不受信网络。
- 模型生成的代码会被执行。Python 解释器工具默认在独立子进程里跑并带超时保护,但不受信数据集可能通过 prompt 注入诱导模型生成恶意代码——只在可信数据集上训练。
- Checkpoint 来源要可信。框架按 legacy Megatron pickle 格式加载 checkpoint,并启用 tokenizer 自定义代码(
trust_remote_code)。pickle 加载的风险不用我多说了吧。
只想先看看模型?
没有昇腾也能玩,去华为云 ModelArts 订阅 API 就行,或者直接在 GitCode 下权重用推理代码跑。社区入口都在 Ascend Tribe。有问题可以提 issue,或直接发邮件给 openPangu@huawei.com。
入门别贪多:没算力就先读代码学架构(MoE 路由怎么做的、512K 怎么训的、训推一致性怎么保的),有算力再谈复现。前者对 99% 的人更有价值。
进阶
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
