Skip to content

认识华为盘古 openPangu 2.0 —— 505B 大模型的训练栈,今天全量开源了 ​

先说一件有点荒诞的事。

你去翻现在市面上叫得上号的开源大模型——DeepSeek、Qwen、Kimi、Llama——不管许可证写得多自由,它们全都是在同一家公司的 GPU 上训练出来的。开源的是权重,训练过程永远是个黑盒。想复现?对不起,请自己攒几万张卡、自己写分布式框架、自己踩通信和 loss 突刺的坑。

所以"开源"这两个字,其实一直有个没说出口的上限:给你鱼,不给你渔;给你模型,不给你厨房。

然后今天,2026 年 9 月 28 日,华为把厨房也拆了给你看——开源盘古 openPangu-2.0 的预训练代码、SFT 代码、后训练 RL 代码正式上线,Apache 2.0,托管在 GitCode 的 Ascend Tribe 社区。

而这套厨房做出来的菜,是一个 5050 亿参数的 MoE 大模型,全程跑在昇腾 910B 上,没有用过一张 A100 或 H100。

开源权重是"你可以用我",开源训练栈是"你可以变成我"。这两句话之间的距离,就是今天这一次发布的意义。

什么是 openPangu ​

先理清命名,不然很容易绕晕:

  • 盘古:华为的大模型品牌,从 2021 年用到现在,气象、矿山、铁路、金融、制造、医药这些行业模型都挂这个名字。
  • openPangu:华为的开源 AI 模型品牌,定位很明确——"通过昇腾原生训练与推理技术,为业界用好昇腾提供最佳实践参考"。说白了,盘古是卖解决方案的,openPangu 是给开发者抄作业的。
  • openPangu-2.0:2026 年 6 月 12 日华为开发者大会上,余承东首次对外发布的版本,当场撂下一句"做全世界最好的盘古大模型"。

这次开源的两个仓库,各管一段:

仓库管什么一句话定位
openPangu-2.0-Training预训练 + SFT面向大规模基础模型训练的统一训练框架,覆盖 LLM、VLM、多模态,为百亿到万亿参数模型提供训练基础设施
openPangu-2.0-RL后训练强化学习以 VERL 为编排内核的昇腾原生 RL 加速框架,在昇腾集群上完成 Actor / Rollout / Reward 协同训练

两个都是 Apache-2.0。

三个月拼完的七件套 ​

openPangu-2.0 不是一次性放出来的,是拆成零件、按节奏往外发的:

  • 6 月 12 日:HDC 大会发布 openPangu-2.0
  • 6 月 30 日:openPangu-2.0-Flash 开源——92B 总参数、每 token 激活 6B、512K 上下文
  • 7 月 31 日:openPangu-2.0-Pro 开源——505B 总参数、每 token 激活 18B、512K 上下文,同期放出技术报告
  • 9 月 24 日前后:openPangu-2.0-Infer 推理源码上线
  • 9 月 28 日:openPangu-2.0-Training + openPangu-2.0-RL 上线,训练栈收官
  • 同期:openPangu-2.0-Op 昇腾亲和高性能自定义算子仓库(AscendC / PyPTO / Triton 多种实现)

从权重、推理、算子到训练,七件套拼齐——这是目前公开模型里把训练链路开得最彻底的一家。注意是"最彻底",不是"最强",别自动脑补。

核心特点 ​

一、训练侧:一体化,从预训练到持续优化 ​

官方对 openPangu-2.0-Training 的能力描述是这么写的:

  • 多维分布式并行:数据并行、张量并行、流水线并行、专家并行按需组合,这是训 MoE 的入场券
  • 高效数据流水线:不让 GPU/NPU 等数据,这是大规模训练里最容易被低估的一环
  • 混合精度训练:FP16/BF16 等精度策略
  • 自定义算子优化:直接对接 openPangu-2.0-Op 里的 AscendC / PyPTO / Triton 融合算子
  • 高可用训练:长周期训练里的故障恢复与断点续跑——训过千卡的人都知道,这一条比什么都值钱

预训练侧支持从头训练、基于已有 Checkpoint 持续训练、大规模分布式训练与长上下文训练;SFT 侧支持指令对齐、多轮对话数据、领域数据微调、参数高效微调(LoRA 这类)与多任务训练。

翻译成人话:你可以拿它做领域续训。 医院、法院、工厂把自己的语料喂进去,在 Flash 或 Pro 的底座上长出一个自己的行业模型——这才是开源训练代码最实际的用途,而不是复现一个 505B。

二、RL 侧:站在 VERL 肩膀上,但不 Fork ​

openPangu-2.0-RL 的架构选择挺聪明:以字节跳动的开源 RL 框架 VERL 作为训练编排内核,然后通过运行时补丁 + 昇腾亲和优化来适配。

关键一句——非侵入式适配。它靠一个环境变量在运行时注入补丁:

bash
export VERL_USE_EXTERNAL_MODULES=omni_rl.patches

不 Fork VERL 主线。这意味着 VERL 上游迭代了,它能相对无痛地跟上。对做过类似适配的人来说,这是个相当克制的工程决策——Fork 一时爽,merge 火葬场。

omni_rl/rl 下两块核心:

  • timely_agent:多轮 Agent、工具调用、奖励与数据流
  • verl_adapt:昇腾侧的算法优化,包括 Prefill/Decode 分离、张量压缩、路由重放

算法层面支持 GSPO(组序列策略优化)与 GRPO(组相对策略优化),两个典型场景:

  • 数学推理:单轮 Rollout,模型一次生成完整长思维链,规则奖励核对答案与格式
  • 面向推理的代码生成(Code-For-Reasoning):多轮 Rollout(ReAct),模型写 Python、调解释器执行、看结果继续推理

三、模型侧:把稀疏做到 28:1 ​

训练栈服务的两个模型,架构上有一堆自研名词,挑重点说:

  • 28:1 稀疏比:Pro 总参数 505B,每 token 只激活 18B。用大模型的能力,付小模型的算力钱
  • 512K 上下文:靠 DSA + SWA 分层混合超稀疏注意力(约 1:2 配比),主流开源模型普遍停在 128K~256K
  • MLA(多头潜在注意力)+ mHC 四分支残差拓扑 + 三头 MTP(多 token 预测)
  • Muon 优化器:微软提出的二阶动量方案,大规模训练下的稳定性更好
  • 两个模型训练预算都在 34 万亿 token 量级

华为技术报告里给出的几个数字:

指标openPangu-2.0 表现
昇腾单卡吞吐主流开源模型的 2 倍
超节点训练效率+30%
512K 长序列训练吞吐+50%
训推一致性>99%
Flash-Int8(W4A8)显存 -40%(对比 BF16)

训推一致性 >99% 这条,做过 MoE 生产部署的人都懂有多痛——路由在训练和推理时漂一点,效果就莫名其妙地掉。这是工程问题,不是论文问题。

四、许可证:Apache 2.0,可以商用 ​

两个仓库都是 Apache-2.0,没有 copyleft 传染,改完闭源卖也行。这点比不少"权重开源、代码非商用"的模型痛快。

但要提醒一句:模型和代码是两回事。 openPangu 系列权重走的是自己的 openPangu 许可证,不是标准 Apache,商用前一定去读对应仓库的 LICENSE。别看到训练框架 Apache-2.0 就默认权重也能随便卖。

谁在用:真实案例,带硬数据 ​

这里必须把话说清楚,免得误导:下面这些是"盘古"行业大模型的公开落地成绩,属于华为的行业解决方案线,不等于 openPangu-2.0 开源版本身的成绩。 开源版是 2026 年 6 月才起步的新系列,公开的一线数据目前主要是下载量。但这两个数字能说明热度:

截至 2026 年 9 月 28 日,AtomGit(GitCode)数据显示:openPangu-2.0-Flash 下载 22,068 次,openPangu-2.0-Pro 下载 8,834 次。

盘古这条线在行业里到底干了什么,几个被广泛引用的公开案例:

  • 气象(登上《Nature》正刊):盘古气象大模型是首个精度超过传统数值预报的 AI 预测模型。原来预测台风未来 10 天路径,需要在 3000 台服务器的高性能集群上仿真 5 小时;现在单台服务器单卡、10 秒内拿到更精确的结果,速度提升万倍以上。曾提前 10 天预测出台风"玛娃"路径。
  • 矿山(山东能源集团):盘古矿山大模型已在全国 8 个矿井规模使用,覆盖采、掘、机、运、通、洗选 7 大业务流程、1000 多个细分场景。洗选煤参数优化场景里,精煤回收率提升 0.1%~0.2%,让山能集团济二煤矿每年多产出 8000 吨精煤;推广到全国,可让每个煤矿年均多产 2000 吨。防冲卸压施工孔深智能监管让人工核验工作量降低 80%;兴隆庄一期危险区域人员入侵识别率达 90% 以上,比传统小模型精度高 10%。
  • 铁路:盘古铁路大模型精准识别现网 67 种货车、430 多种故障,无故障图片筛除率 95%,把列检员从每天数百万张图片的"图海"里捞出来,效率提升约 20 倍。
  • 金融:盘古金融大模型对银行政策、操作、案例文档预训练,柜员平均 5 次操作降到 1 次,办结时间缩短 5 分钟以上。
  • 制造:单产线制定器件分配计划,过去要 3 小时以上才能做齐 1 天的生产计划;盘古制造大模型学会华为供应链数据与规则后,1 分钟做出未来 3 天的生产计划。
  • 医药:盘古药物分子大模型助力西安交大第一附属医院团队发现全球 40 年来首个新靶点、新类别抗生素(肉桂酰菌素),先导药物研发周期从以年计缩短至 1 个月、研发成本降低 70%,目前该药物已进入临床阶段。

但有句实话必须说 ​

我不想只念好话。openPangu-2.0 现在有几条硬伤,你得知道:

  1. 硬件绑定是双刃剑。整套栈为昇腾优化,import torch_npu 才能跑。你手上要是几千张 NVIDIA 卡,这套东西基本跟你没关系——反过来,你如果本来就在昇腾上,那它就是目前最完整的原生训练栈。选它,本质是在选算力阵营。
  2. 训练侧第三方基准还缺位。2 倍吞吐、+30% 效率这些是华为技术报告的口径,目前公开的独立第三方复现结果还不多,看到数字请保持一点健康的怀疑。
  3. 代码非常新。Training 仓库 3 天前建,RL 仓库 9 小时前刚更新,Star 数还在个位数到十几的量级,社区、踩坑记录、中文教程几乎为零。你现在进去,就是第一批踩坑的人——可能很爽,也可能很痛。
  4. 门槛是真的高。这是给百亿到万亿参数模型准备的框架,最小可用规模也是多机多卡昇腾集群。没有算力的人,最好的姿势是读代码学架构,别幻想在笔记本上跑起来。

我的建议:有昇腾集群、要做领域续训或后训练的团队——现在就可以认真评估,这是目前唯一一套能让你完整复现"国产算力训出万亿级 MoE"的公开代码。纯 NVIDIA 环境或者只想调 API 的——先围观,别急着换栈。

初体验:从 clone 到跑起来 ​

先把预期管理好:这套东西不是 pip install 完就能在笔记本上跑的,它需要昇腾 NPU、CANN、以及一个像样的集群。下面给的是官方 README 明确写出的路径。

训练侧:openPangu-2.0-Training ​

仓库结构很干净,看一眼就知道是标准 Python 工程:

text
openPangu-2.0-Training/
├── PanGu/          # 盘古模型实现
├── config/         # 训练配置
├── docs/           # 使用文档
├── tools/          # 工具脚本
├── launch.py       # 训练启动入口
├── pyproject.toml  # 包管理配置
├── setup.py        # 安装脚本
└── LICENSE         # Apache-2.0

标准上手姿势:

bash
# 1. 拉代码
git clone https://gitcode.com/ascend-tribe/openPangu-2.0-Training.git
cd openPangu-2.0-Training

# 2. 安装(仓库带 pyproject.toml 与 setup.py,按 Python 包方式安装)
pip install -e .

# 3. 按 config/ 下的配置文件启动训练(具体配置项见 docs/)
python launch.py --config <你的配置文件>

具体支持哪些并行组合、混合精度怎么配、长上下文训练怎么开,以仓库 docs/ 目录为准——这块我建议你直接读文档,比看任何二手教程都准,毕竟仓库才三天大,网上那些"教程"大概率还没人写过。

RL 侧:openPangu-2.0-RL ​

RL 这边的流程更重,要先做镜像:

bash
# 必须带 --recurse-submodules,否则 third_party(含 VERL)不完整
# -c core.autocrlf=input 统一换行符为 LF,避免 Windows 转成 CRLF 炸脚本
git clone -c core.autocrlf=input --recurse-submodules \
  https://gitcode.com/ascend-tribe/openPangu-2.0-RL.git

# 构建镜像:依赖含 CANN、昇腾驱动的基础镜像,
# 并需手动放入 tools/docker/copy_data/ 下的外部包
cd openPangu-2.0-RL
bash tools/docker/build.sh

数据准备支持 JSONL / JSON / Parquet,每条样本需要对话 prompt;规则奖励场景还要在 meta 里给出标准答案(gt / solution)。多机训练时所有节点的数据路径必须一致——这种小细节不提前知道,能让你在半夜调半天。

两个场景的作业入口:

text
Reasoning             → tests/system_tests/e2e/pangu92b/reasoning/
Code-For-Reasoning    → tests/system_tests/e2e/pangu92b/code4math/

核心包 omni_rl/ 的目录也值得看一眼,基本能猜出整个 RL 的数据流:

text
omni_rl/
├── config/     # Hydra 配置:算法、Agent、模型、工具、HCCL
├── dataset/    # 数据集加载(PanguDataset、JSONL)
├── engines/    # 推理引擎适配(Omni-Infer 等)
├── models/     # 盘古模型适配与 Chat Template
├── patches/    # 运行时补丁(VERL / Megatron / Pangu / Torch)
├── reward/     # 奖励适配
├── rl/         # RL 核心:Timely Agent、VERL 算法与混合引擎适配
├── utils/      # 日志、补丁管理、指标
└── workers/    # Rollout Worker

三条安全红线,官方专门写了 ​

这段别跳过,因为 Code-For-Reasoning 场景会执行大模型自己写的代码:

  1. 必须跑在隔离网络里。训练依赖 Ray、gRPC 等服务,集群内服务(Ray Dashboard、对象存储)没有内建认证,全靠网络边界把门。别把端口暴露给不受信网络。
  2. 模型生成的代码会被执行。Python 解释器工具默认在独立子进程里跑并带超时保护,但不受信数据集可能通过 prompt 注入诱导模型生成恶意代码——只在可信数据集上训练。
  3. Checkpoint 来源要可信。框架按 legacy Megatron pickle 格式加载 checkpoint,并启用 tokenizer 自定义代码(trust_remote_code)。pickle 加载的风险不用我多说了吧。

只想先看看模型? ​

没有昇腾也能玩,去华为云 ModelArts 订阅 API 就行,或者直接在 GitCode 下权重用推理代码跑。社区入口都在 Ascend Tribe。有问题可以提 issue,或直接发邮件给 openPangu@huawei.com。

入门别贪多:没算力就先读代码学架构(MoE 路由怎么做的、512K 怎么训的、训推一致性怎么保的),有算力再谈复现。前者对 99% 的人更有价值。

进阶 ​

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

遇码MeetCoding 开源技术社区