Technical Report · Architecture · Ascend Systems · Provenance

openPangu 2.0
架构、训练与昇腾系统全景解读

从 MLA、DSA–SWA、PAS、ModAttn、mHC 与 Muon,到 34T 级预训练、多专家 OPD、Felix CP、Omni Cache 和 W8A8:沿原报告重建 openPangu 2.0 的端到端技术路线。

Pro · 505B / 18B active Flash · 92B / 6B active 512K native context 论文原图 + 官方配置核对
505B / 18BPro 总参数 / 每 token 激活参数
92B / 6BFlash 总参数 / 每 token 激活参数
≈34.4T三阶段主预训练 token 处理量
524,288两款模型的原生上下文长度

00 · Executive reading核心判断:贡献重心在“组合、迁移与昇腾落地”

openPangu 2.0 并未把主要贡献包装成一种全新的 Transformer 主干。它把 MLA、DSA、SWA、MoE、mHC、MTP、Muon 等已有路线组合为面向 512K 上下文与 Agent 工作负载的模型,再围绕 Ascend NPU 重做长序列训练、MoE 通信、算子融合、量化、缓存和异步调度。模型创新与系统工程必须放在一起解读。

Architecture

全局检索 + 局部窗口

主体按 DSA–SWA–SWA 重复;PAS 提供可学习 attention sink,ModAttn 用短程因果卷积补充局部归纳偏置。

Training

34T 级课程 + 后置稀疏化

从 4K 逐步扩到 512K,先训练 FULL–SWA,再用 108B replay 将 FULL 层转换成 DSA。

Post-training

四类 RL 专家 + OPD

Reasoning、General、Agent、Coding 专家并行优化,最终通过多教师 on-policy distillation 融合到统一模型。

Inference

Ascend 全栈共设计

Felix CP、W8A8、融合算子、多流、Omni Cache、vLLM V1 异步调度与 MTP full graph 共同支撑部署。

一句话总结 openPangu 2.0 最具辨识度的成果,是把稀疏长上下文模型完整落到昇腾训练与推理系统上;最薄弱的披露则是训练卡数与时长、后训练数据量、主模型模块级消融,以及与外部模型或系统的严格同条件对比。

证据等级

明确采用技术报告直接写明 built upon、adopt、following,或官方配置可直接确认。
再设计上游技术明确,但 openPangu 对结构、训练流程或系统实现做了实质改造。
可比较解决相近问题或结构相似,但报告没有确认来源关系。
分析推断由参数、公式或系统约束推得,与作者直接结论分开。

01 · Model positioning两款主模型、端侧分支、checkpoint 口径与许可证

Relative positioning · 本文概括

openPangu-2.0-Flash

92B / 6B active

46 层主干、2 层 Dense + 44 层 MoE;256 个 routed experts,Top-8;面向低延迟和较小部署规模。

Relative positioning · 本文概括

openPangu-2.0-Pro

505B / 18B active

50 层主干、3 层 Dense + 47 层 MoE;384 个 routed experts,Top-8;面向更强推理与 Agent 能力。

结构参数FlashPro
论文口径总参数 / 激活参数92B / 6B505B / 18B
Hugging Face 完整 checkpoint 自动统计100B541B
主干层 / Dense / MoE46 / 2 / 4450 / 3 / 47
hidden size / attention heads2,560 / 485,120 / 64
MLA Q rank / KV rank1,024 / 5121,536 / 512
QK NoPE / RoPE dim;V head dim128 / 64;128128 / 64;128
Dense FFN intermediate9,21616,128
routed / shared experts256 / 1384 / 1
每 token routed Top-k88
单 expert intermediate1,0241,792
DSA indexer heads / head dim / Top-k24 / 128 / 2,04832 / 128 / 2,048
DSA:SWA / SWA window1:2 / 5121:2 / 512
PAS / mHC streams / Sinkhorn128 / 4 / 20128 / 4 / 20
最终 MTP layers33
原生上下文 / 最终 RoPE theta512K / 6.4M512K / 6.4M
架构词表大小151,552151,552
92B/505B 与 100B/541B 都没有写错 论文和模型卡使用主干模型口径;Hugging Face 对完整发布 checkpoint 的自动统计还包含 3 层 MTP 辅助层。权重索引中 Flash 为 46+3 层,Pro 为 50+3 层,因此差额很可能主要来自 MTP,但官方没有专门解释两个统计口径。

Pro model card Pro config Flash model card Flash config

许可证不是 Apache-2.0 模型权重采用 OpenPangu Model License Agreement 2.0,包含欧盟地域限制、再分发通知、“Powered by openPangu”展示要求及诉讼终止条款;推理源码仓库另以 Apache-2.0 发布。因而可以说“模型权重开放下载”,但不宜把整套权重与代码笼统描述为 Apache-2.0 开源。

1.3 报告还列出一款 30B / 2B active 端侧模型

这款 MoE 分支面向资源受限设备,并围绕 Kirin 硬件做量化、剪枝、专家复用与预取。它不是 Pro/Flash 的简单缩小版:系统瓶颈从数据中心的跨卡通信,转成设备内存容量、expert 频繁换入换出和加载停顿。

Scale

30B / 2B active

报告只披露总参数与激活参数,没有层数、专家数或上下文配置。

Kirin-aware

量化 + 剪枝

作者报告推理速度提高 50%、内存占用降低 20%。

Expert reuse

相邻 token 复用专家

专门的 reuse loss 使 expert switching frequency 降低 50%。

Prediction

预测并预取专家

提前加载后续 token 可能选择的专家,作者报告吞吐最高提高 5×。

这些是作者报告的端侧收益,不是可独立复现的完整 benchmark 报告没有公开具体 Kirin 型号、精度口径、baseline、输入输出长度、并发、功耗、量化位宽或端侧 checkpoint;因此只能保留“作者报告”限定,不能把 50%、20%、5× 外推到任意设备。

02 · Architecture overview主干数据流:四路残差流包住混合注意力与 MoE

openPangu 2.0 architecture
原报告 Figure 1,p.3。主体采用 DSA–SWA–SWA 注意力循环;Flash 前 2 层、Pro 前 3 层为 Dense FFN,其余为 MoE;四路 mHC 残差流贯穿主干,尾部附加 3 层 MTP。
Tokens
Embedding
4-way mHC
residual state
DSA / SWA
PAS + ModAttn
Dense / MoE
Top-8 experts
LM head
+ MTP-3
DSA
稀疏全局检索
SWA 512
局部连续建模
SWA 512
局部连续建模
mHC · 4 streams Shared + routed MoE Ascend system co-design

架构的四层含义

Attention range

全局与局部职责分离

约三分之一层承担 DSA 全局检索,其余层只维护 512-token 窗口,降低 indexer、cache scan 与长序列通信的平均成本。

Residual topology

信息在四条流之间动态混合

mHC 不只是增宽 hidden size;它在残差状态层面保留四路表示,再通过受约束矩阵读取、写回和混合。

Conditional compute

绝大多数层采用 MoE

每个 token 只激活 8 个 routed experts 与 1 个 shared expert,以激活参数显著小于总参数的方式扩展容量。

Self speculation

MTP 既是训练目标也是推理草稿器

训练后期使用 3 个 MTP 层,一次额外预测三个位置;推理系统进一步为 MTP-3 做 full-graph 和异步调度。

03 · Hybrid attentionMLA + DSA–SWA:让少数层找远处,多数层看近处

openPangu 的注意力底座明确建立在 Multi-head Latent Attention(MLA) 上:Q 与 KV 先压缩到低秩 latent,再上投影为多头注意力需要的表示。这里不能把 num_attention_heads 误读成普通 GQA 的 Q-head/KV-head 数量;KV 的压缩由 latent rank 表达。

3.1 SWA:512-token 的局部工作马

Sliding-Window Attention 对真实历史 token 只读取最近 512 个,同时仍可访问固定的 128 对 PAS,负责局部语法、短程实体关系与连续状态更新。对单个 decode query,真实 token 的 cache read 和 attention compute 不随历史长度增长;但处理整段长度为 S 的 prefill 仍需 O(S·512)=O(S) 的总工作量。

3.2 DSA:Lightning Indexer 先选 2,048 个历史 token

DSA 先用轻量 indexer 为历史 token 打分,再从因果可见历史中选 Top-k,随后只对这些 token 做稀疏注意力。论文正文使用“例如 K=2,048”的措辞,而官方 Pro/Flash 配置均确认 index_topk=2048;因此该值可作为发布 checkpoint 的实际配置,而不是仅凭论文例子推断。

LI score → causal TopK2,048 → sparse MLA attention

3.3 为什么不是每层都用 DSA

长上下文主导项纯 DSAFULL–SWADSA–SWA
Prefill 二次项系数每层都跑 indexer约 1/3 层 full attention约 1/3 层跑 indexer
Decode cache read 线性项每层读 indexer cache约 1/3 层读 full KV约 1/3 层读 indexer cache
Cache memory 线性项KV + indexer约 1/3 full KV约 1/3 (KV + indexer)
局部层成本仍需全局选择SWA 固定窗口SWA 固定窗口

关键不是“稀疏注意力天然便宜”,而是 DSA 的 indexer 自身仍随历史长度工作。把 DSA 只放到周期性全局层,可以把全局检索成本摊薄到约三分之一层。

3.4 后置稀疏化:先学好 FULL,再迁移到 DSA

FULL–SWA
主预训练
8B replay
dense warm-up
LR 1e-3
100B replay
sparse adaptation
LR 8e-6
DSA–SWA
发布模型

只有原 FULL 层被替换成 DSA,SWA 层保持不变;Lightning Indexer 通过权重 0.1 的辅助目标拟合原 full-attention score。作者称 100B adaptation 后“mostly recovers”下游性能,但未提供 92B/505B 主模型的完整恢复曲线,因此不应写成无损迁移已经被充分证明。

04 · Local inductive biasPAS 与 ModAttn:为混合注意力补上“无处可看”和短程顺序

4.1 PAS:把 attention sink 显式参数化

每层增加 128 对可训练 latent K/V。它们不代表真实 token,而是为注意力提供稳定的“空操作”出口:当某个 query 没有值得关注的内容时,模型可以把 attention mass 分配给 PAS,而不是迫使序列开头或窗口内某个真实 token 充当 sink。

PAS gradient norm comparison
Figure 9,p.40。15B 代理模型、250B tokens;PAS 使 gradient-norm spike 更少。
PAS loss comparison
Figure 10,p.40。FULL:SWA=1:2 代理模型中,PAS 的 loss 低于无 sink 与论文实现的 gpt-oss sink。
消融边界 PAS 的主要曲线来自 MoE15B-A2B,而非 92B/505B 主模型;对纯 full-attention baseline,PAS 没有显示明显 loss 收益。它的价值与混合 SWA 场景密切相关。

4.2 ModAttn:在压缩分支和注意力输出上做深度因果卷积

Modtheta(Z) = Z + CausalConv1Dtheta(Z)

该模块分别用于 MLA 的 compressed-Q 分支、compressed-KV 分支,以及 FlashAttention 聚合后、output projection 前。卷积为 depthwise causal Conv1D,groups=Hkernel=3,只引入极短程状态,却能为 DSA 的远程稀疏检索和 SWA 的固定窗口补充稳定的相邻 token 归纳偏置。

ModAttn communication and convolution
Figure 4,p.13。Sequence/Context Parallel 下只交换跨 rank 卷积边界,避免恢复完整相邻分区;Vector 核上的 rolling-state kernel 使模块计算时间降低 79%。
与 Mamba 的关系 报告把缓存语义称为“Mamba-like”,并指出 cache 方案可推广到 Gated DeltaNet;这说明状态组织相近,不足以证明 ModAttn 直接来源于 Mamba 或线性注意力。更稳妥的说法是:ModAttn 是报告定义的短程因果卷积组件。

05 · Conditional capacity & topologyMoE 与 mHC:扩容量,同时约束四路残差传播

5.1 Shared + routed experts

除 Flash 开头 2 个、Pro 开头 3 个 Dense FFN 层外,主干其余层均为 MoE。每个 token 始终经过一个 shared expert,同时从 256/384 个 routed experts 中激活 8 个。该结构与 DeepSeekMoE 路线高度相近,但报告在 MoE 结构处没有足够明确的“继承 DeepSeekMoE”声明,因此技术谱系中应标为结构相近,而非确定直接来源。

5.2 自适应 auxiliary-loss-free bias

bi ← bi - gamma · (Fi - Qi) / RMS(F - Q)
RMS(F - Q) = sqrt[(1 / Nr) · sumj(Fj - Qj)2]

Q_i=1/N_r 是目标负载,F_i 是 global batch 中实际专家负载。相较原 sign update,RMS 归一化保留了过载幅度的相对大小。bias update LR 为 1e-3;另有权重 2e-4 的 EP-group auxiliary loss 和 1e-6 的 router z-loss。这些稳定项只在 General 阶段启用。

Adaptive auxiliary-loss-free routing comparison
Figure 11,p.41。两种方法的 LM loss 接近,但 RMS-normalized update 得到更低的 batch-level MaxVio。

5.3 mHC:四条残差流的读取、写回与受约束混合

x_bar = RMSNorm(h_bar)
[rpre, rpost, rres] = x_bar WmHC
Hpre = sigmoid(rpre);Hpost = 2 sigmoid(rpost);Hres = Sinkhorn(reshape(rres, 4, 4))

H_pre 决定子层从哪几条流读;H_post 决定输出写回哪几条流;H_res 在残差路径上做跨流混合,并经 20 轮 Sinkhorn-Knopp 投影到近似双随机矩阵集合。它的目的不是让 residual 任意放大,而是提升表示多样性的同时控制深层传播。

5.4 openPangu 对原 mHC 的稳定性修正

  • 在子层输出写回 H_post 之前加入 sandwich normalization;
  • 第一层之后以及每隔五层,对多流主干做 block-level post-normalization;
  • 针对浅层 H_pre/H_post 同时趋近 0 的 gate collapse 做专门修复。
MoE15B-A2B,1T tokensMMLUCEvalBigBenchMATHMBPP+平均
baseline.765.708.591.459.532.594
mHC.799.743.622.472.553.615

平均提高 0.021,但这是 15B 代理模型的消融;不能据此精确拆分 mHC 对 92B/505B 最终成绩的贡献。

06 · Prediction & optimizationMTP 与 Muon:训练目标、投机草稿器和矩阵正交化

6.1 三层 MTP 的阶段调度

L = Lmain + sumk=1..D lambdak LMTP(k)
阶段上下文MTP 层数loss 权重
General4K10.3
Reasoning8K10.1
Annealing32K / 128K / 512K3每层 0.1,合计 0.3

所有 MTP 内部注意力均为 window=2,048 的 SWA。训练后期逐步增加 MTP 深度,使最终 checkpoint 可作为三层 self-speculative drafter;但论文未披露主模型的接受率、每轮平均接受 token 数或 MTP 单独带来的吞吐收益。

6.2 Muon + AdamW 混合优化

Muon

二维及更高维矩阵

momentum 0.95、Nesterov;Newton–Schulz 固定 5 轮;update 乘 gamma=0.2。MLA Q/KV up-projection 按 attention head 分成四组再正交化。

AdamW

向量与敏感参数

embedding、prediction head、PAS、RMSNorm、mHC gate coefficient 等使用 AdamW;beta=(0.9,0.95),epsilon=1e-8。

论文称 Muon 只维护一阶 momentum,因此 optimizer state memory 相比 AdamW 减半。全局 weight decay 为 0.1,但 embedding 与 RMSNorm 不衰减。

Attention logits stability with Muon
Figure 12,p.42。Pro 全训练期间最大 attention logits 大致稳定在 20 附近。作者推测 sandwich norm 与 block post-norm 有帮助,但明确承认尚缺系统消融。
不要把经验解释写成因果结论 图中只证明 openPangu-2.0-Pro 在该训练配置下没有出现 QK logit explosion,不能独立证明是某一个 normalization 模块造成的。

07 · Pre-training34T 级数据课程:4K → 8K → 32K → 128K → 512K

General
25T @ 4K
Reasoning
8T @ 8K
Annealing
0.8T @ 32K
0.4T @ 128K
0.2T @ 512K

7.1 数据构成

公开类别包括网页、图书、PDF、多语言文本、代码仓库、STEM、行业数据、agentic tasks 和 synthetic data。数据工程同时使用规则过滤与模型评估,为文档打 quality、difficulty、topic、educational value 标签,并对含长尾知识但格式较差的文本做语义保留式重写。

论文没有给出各类别或语言比例、去重率、污染检查、合成数据占比、具体数据集名单和版权分布。因而“34T”主要是 token 处理规模,不等于可审计的唯一语料量。

7.2 学习率、batch 与长度课程

阶段长度与 tokenFlashProRoPE base
General25T @ 4Kbatch→36M;peak LR 3e-4batch→64M;peak LR 2e-410K
Reasoning8T @ 8KLR 1e-4 → 3e-5;增加 STEM 与代码100K
Annealing-1800B @ 32KLR 从 3e-5 开始继续 cosine400K
Annealing-2400B @ 128K长文档和复杂 Agent trajectory1.6M
Annealing-3200B @ 512K最终 LR 8e-66.4M
三个论文内部口径需要保留 三阶段相加为 34.4T,而摘要写“roughly 34T”;General 段落的“500B warm-up + next 17T plateau + final 8T decay”按字面是 25.5T,与 25T 阶段总量不一致;Tokenizer Table 4 为 149,600,而架构与官方 config 为 151,552,差出的 1,952 个 token 未解释。

7.3 Tokenizer:牺牲少量压缩率,换取规则的数字表示

Tokenizer 由中文、英文、代码、行业文档和 188 种低资源语言的重平衡混合重新训练。报告比较两种数字预切分:3-digit 以三位数字为组,压缩率更好;single-digit 把连续阿拉伯数字逐位切分,数字模式更规则。最终采用 single-digit,以服务数值推理、多模态坐标和工具参数,代价是平均字符/token 从 3-digit 的 2.71 降到 2.59。

TokenizerVocab中文英文多语言代码行业平均字符/token
openPangu-1.0153,3763.824.302.802.804.182.56
2.0 · 3-digit150,4004.044.273.372.774.512.71
2.0 · single-digit(最终)149,6003.824.153.322.564.272.59

Table 4 的 tokenizer vocab 是 149,600,而模型架构表与公开 config 是 151,552;两者差 1,952,报告没有解释是否来自特殊 token、padding 或发布配置扩展。

7.4 训练算力没有披露

报告确认基于 Ascend NPU 训练,并按 CloudMatrix 384 supernode 拓扑做 TP/CP/EP 亲和分组;但没有给出实际 NPU 总数、使用多少个超节点、训练天数、NPU-hours、总 FLOPs、MFU、吞吐、成本或能耗。“CloudMatrix 384”是产品/拓扑名称,不能被解释为“使用了 384 张卡训练”。

08 · Training systems长上下文、Muon、MTP 与 ModAttn 的系统协同

8.1 512K Context Parallelism

FULL 阶段使用 Ulysses + KV CP 的 Hybrid CP;DSA 阶段默认 KV CP。对 SWA,系统把全局 AllGather 改成相邻 rank P2P,通信量由与序列长度相关的 S·B·H 降到窗口相关的 W·B·H。对 FULL/DSA,只交换同一 packed sub-sequence 的因果历史 KV,并以 AllToAllV 替代 AllGather。

Context parallel AllToAllV
Figure 2,p.11。CP=4 时,rank 只接收本地 query 真正需要的同一文档历史 K/V,避免把其他 packed sequence 的冗余 KV 全部复制过来。

8.2 FA Rescale:在没有原生 PAS kernel 时精确合并两次 attention

O(A+B) = O(A) alphaA + O(B) alphaB
alphaX = lX exp(mX-m*) / [lA exp(mA-m*) + lB exp(mB-m*)]

两次 FlashAttention 分别处理真实序列和 PAS,利用 softmax max/sum 统计在 FP32 中合并。数学上等价于一次全局 softmax,差异只来自最终 BF16 rounding;DSA 的 KL 辅助目标还能只观察不含 sink 的主序列统计。

8.3 HyperParallel Muon+

在 DDP bucket ZeRO 下,系统根据 bucket/参数边界选择 AllGather 或 AllToAllV,并把 DP 拆成 DPouter × DPinner:outer 做跨 hyperplane 对称 AllGather,inner 控制 AllToAllV 范围。bucket i 的通信与 bucket i-1 的 Newton–Schulz 正交化和参数更新重叠。

Muon communication computation overlap
Figure 3,p.12。只有首个 bucket 的通信和最后一个 bucket 的计算无法遮蔽。报告说其两级通信思想参考了 DeepEP,但这不等于直接使用 DeepEP 框架。

8.4 mHC 与 MTP 的流水线优化

  • 无 PP 时做 intra-layer recomputation;PP+VPP 时跨层递归恢复,仅保留必要 activation。
  • PP 边界只传 mHC-expanded backbone hidden state,而不额外发送三个 MTP auxiliary payload;MTP state 到目标 stage 后本地展开。
  • 最终 3 层 MTP 由 4 条跨 stage stream 降到 1 条,相关 P2P 下降 75%。
  • MTP layers 分散到 PP/VPP stages;projection/loss 按 sequence chunk 即时 forward-backward。
  • 相较 unbalanced MTP layout,作者报告训练吞吐提高约 20%。

8.5 ModAttn kernel

跨 rank 只交换卷积边界;反向时从 attention output 重建 padding,避免缓存 padded tensor;因果卷积从 Cube 改到 Vector 核,以 rolling state 把三个局部状态保存在寄存器中。作者报告该模块计算时间降低 79%,这是模块级 latency,不是端到端训练提速。

09 · Post-training512K SFT、四类 RL 专家与多教师 OPD

9.1 统一 SFT

SFT 上下文直接设为 512K,同时混合 thinking 与 non-thinking 数据。四类数据覆盖 Reasoning、General Chat、Coding 和 Long-Trajectory Agent;Agent 轨迹来自真实 HarmonyOS 与模拟 sandbox,错误步骤由环境反馈与 reward model 定位并在训练时 mask。

9.2 四个并行 GRPO 专家

Reasoning RL

数学、科学与工具

LLM quality filter、标签平衡,并对 Jupyter/Python parse error 施加惩罚。

General RL

通用对话

指令遵循、事实、长上下文、多轮交互;规则 reward 与 generative reward model 结合。

Agentic RL

长轨迹环境

TITO、动态移除持续解出的样本、工具语法惩罚、环境外确定性验证,从 General RL checkpoint warm start。

Code RL

真实执行反馈

gateway 捕获 prompt/completion/logprob,重建完整 trajectory;monitor agent 在线监控 reward hacking。

四类专家均采用 GRPO,且不使用 KL regularization。报告没有披露各专家的 episode/token 数、batch、训练步数、奖励权重、NPU 规模与时长。

9.3 Multi-expert On-Policy Distillation

Ai,t = stopgrad[ log piexperttrain(yi,t|x,y<t) - log pistudenttrain(yi,t|x,y<t) ]
当前 policy
on-policy rollout
按领域选择
RL expert
对已生成 token
计算 log-prob gap
mask / clip
更新统一 policy

优势不再来自独立 reward,而来自领域 expert 与当前 policy 对实际生成 token 的概率差。近零优势 token 被 mask,极端 ratio 被 clip;多个教师不同时常驻,而是在共享 NPU pool 上顺序加载、分组打分。当前 expert probability 来自 training-engine forward,不是 inference backend。

10 · Train–infer consistency当前缓解方案与“Full Alignment”预览必须分开

10.1 当前 openPangu 2.0 使用的缓解

  • 训练从 BF16 改为 FP16,并使用 dynamic loss scaling;
  • KPop 替代大部分 IcePop / 普通 rejection sampling;
  • 根据 train–rollout PCC 使用更严格或更宽松的 token mask;
  • R3 记录 rollout 时实际使用的 MoE routing,在训练端重放;
  • Masked R3 只对训练/推理专家重合足够高的 token replay;Cached R3 为多轮 Agent 保存首次生成时的 route record。

10.2 三类 mismatch

A · Definition

模型定义不同

训练与推理侧算子、精度或状态定义不一致。

B · Graph

计算图重排

融合、并行分块和归约顺序改变数值路径。

C · Scheduling

硬件 tiling 非确定性

SplitK、聚合顺序、batch/shape 变化带来数值漂移。

Training inference full alignment preview
Figure 13–14,p.43。Phase I 用 tensor hook 和统一 FlashAttention 逐层定位差异;Phase II 构造单步 decode 输入并修改 CANN SplitK、聚合顺序与 tiling,再重新编译验证。
这是未来版本的技术预览 Introduction 明确把 full-alignment solution 放在 later model iterations,正文标题也使用 Preview。它不能被写成 openPangu 2.0 当前全部训练与 rollout 已经实现 bit-level 全栈对齐。

11 · Ascend inference并行、量化、融合、多级缓存与异步调度

11.1 官方部署栈与两种拓扑

一手资料确认的路径是 Ascend 910C/A3 上的 omni-infer,结合 AscendC、CANN、HCCL、ACL Graph、npugraph_exomni-npuomni-ops,并扩展 vLLM V1 的异步调度与混合 KV cache。

部署形态PrefillDecode公开参考拓扑
Ultra-low latencyPD-mix;SWA 用 TP、MoE 用 EP、DSA 用 CPSWA 保持 TP、MoE 保持 EP;DSA 用 redundant weights 切到 TPA3 单节点 latency 测试
Low latency / high throughputPD-disaggregated;prefill topology 与 ultra-low 的 prefill 完全相同Attention DP + MoE EPFlash 1P1D / 2 nodes;Pro 2P1D / 8 nodes

Pro 官方 2P1D inventory 横跨 8 台主机、每台暴露 NPU 0–15,即 128 个可见 device;这是从参考拓扑推得的可见设备数,不是理论最低硬件门槛。HF 模型仓库也未提供普通 Transformers 单机 quickstart,目前没有一手证据支持通用 GPU/vLLM/SGLang 即插即用。

11.2 W8A8:不是全模型 INT8

权重采用 static symmetric per-output-channel INT8,激活采用 dynamic per-token INT8。对 SmoothQuant 的输入/输出平滑指数分别做二维搜索,并对 up projection 的输入/输出 smoothing 交替优化。

量化为 INT8/INT8保留 BF16/BF16原因
MLA o_proj、q_b_projkv_b、q_a、kv_a小矩阵收益有限或对残差/双向使用敏感
Dense MLP gate/up/downLightning Indexer 全部投影TopK 前的微小误差可能改变离散选择
Routed expert gate/up/downshared expert、router gate共享路径和路由对误差更敏感
embedding、LM head、mHC输出质量与残差累计

论文分析口径中 Pro 权重约从 1009GB 降到 517GB,1.95×;HF 完整 INT8 仓库约 551GB。两者分别是模型权重分析与发布包体积,不能混作同一口径。

Pro INT8 checkpoint w8a8_dynamic config HF storage metadata BF16 deployment README INT8 deployment README

11.3 融合算子、MoE 通信与 Graph

mHC

关键路径拆分

融合上一层 merge、RMSNorm 与 Hpre;Hpost/Hres 放低优先级侧流,Sinkhorn 可独立重叠。

SWA / PAS

L1 micro-tile

无效 tile 在搬入 L0 前跳过,PAS 常驻 L1;作者报告 SWA operator 提升 30%–40%。

MoE dispatch

Non-BSP + token-centric

AtomicAdd 顺序化减少 barrier;每 token 只读取和量化一次,再发送给 Top-k experts。

ACL Graph

静态编译 + Superkernel

static compilation 改善 TPOT 1.2ms,Superkernel 再改善 2ms,合计约 3.2ms。

不同数字的分母并不相同:有 operator latency、dispatch latency、module time、TPOT 和端到端 latency,不能把 79%、40%、30%、20%、5% 直接相加。

11.4 Felix CP:不同注意力层使用不同并行

Felix CP
Figure 5,p.24。DSA 用 absorbed-weight + CP;SWA 用 non-absorbed mode + TP;ModAttn 在其间做 sequence-parallel 状态转换与 cache 更新。

DSA 只交换本 rank query 需要的 KV cache;SWA 在低维 ModAttn 后再 AllGather,并把 attention output 用 All2All 转回 SP。论文声称这是首个支持 APC 的开源 Mamba-like SP 实现,该“first”应保留作者限定。

11.5 Omni Cache:DRAM 保存历史,HBM 只放当前 buffer

Omni Cache layout
Figure 6,p.25。历史 KV 主体驻留 host DRAM;HBM 只保留当前 attention 使用的 KV buffer,prefill 还可跨层复用一个 layer-shared buffer。

D2H scatter 与 H2D gather 和每层计算重叠。作者报告 native KV space 超过 10×、APC hit rate 3×、prefill max-batch-tokens 4×,并可在单个 A3 node 上继续支持 512K;但没有给绝对命中率、DRAM 带宽需求或传输无法完全隐藏时的退化曲线。

11.6 Hybrid page、异步调度与 Multi-MTP full graph

  • DSA、SWA/MLA、ModAttn/Mamba-like cache 使用异构页面,并用统一 padded physical page + torch.as_strided 视图管理。
  • 扩展 vLLM Single BlockPool、MambaSpec、prefix-cache negotiation 和 hybrid KV manager。
  • sampling/draft token 走独立 async copy stream;CPU tiling 下放 AICPU;DP batch coordination 改为 AICPU 上的 HCCL ProcessGroup。
  • 启用 MTP-3 后,即使某次执行仅包含 1–3 个 token,也强制进入 static full graph;draft/target 统一 shape,减少额外 DP 同步。

11.7 LoPT:基于原文字符位置的无损并行 tokenization

LoPT tokenization
Figure 15,p.45。长文本重叠切块、多进程 tokenization,再依据 token 对应的原文字符起止位置合并;边界匹配失败时动态扩大 chunk。

作者报告与串行 tokenizer 100% 一致,16-core CPU 提速 3–5×,overlap overhead 低于 5%。这里讨论的是 tokenization 到 1M 的系统能力,不代表模型原生上下文从 512K 升级为 1M。

12 · Evaluation速度、能力与证据边界分别看

12.1 理论长上下文收益不是端到端加速

相对 full-attention MLAHybrid DSA–SWA 理论系数含义
Prefill 二次 attention FLOPs约 1/15只比较二次主导项,包含约三分之一层运行 Lightning Indexer 的二次成本;不代表端到端提速,也未计 core sparse attention、KV gather、projection、通信和 batching
KV cache growth约 40.7%8-bit hybrid 对 16-bit full 理想口径约 20.4%
Decode length-dependent cache scan约 7.4%8-bit 对 16-bit 理想口径约 3.7%

12.2 Ascend 实测

openPangu inference results
Table 6–7 与 Figure 7–8,p.28–29。随着输入增长,per-NPU TPS 下降、TTFT 上升;图表同时给出 8K–128K 的趋势。
模式模型 / ISL+OSLTPOT并发或 batch 口径TPS/NPU
Ultra-low,A3 单节点Flash / 8K+1K5.27msglobal concurrency=1
Ultra-lowFlash / 128K+1K5.63msglobal concurrency=1
Ultra-lowPro / 8K+1K9.53msglobal concurrency=1
Ultra-lowPro / 128K+1K9.55msglobal concurrency=1
ThroughputFlash / 8K+1K16.2msper-NPU batch=482,963
ThroughputFlash / 128K+8K13.0msper-NPU batch=241,846
ThroughputPro / 8K+1K23.2msper-NPU batch=401,727
ThroughputPro / 128K+8K18.1msper-NPU batch=241,326

128K single-batch prefill:Flash 单 A3 node TTFT 2.6s,Pro 两个 A3 nodes TTFT 3.0s。报告没有给同硬件外部 baseline、功耗、成本、MTP 接受率或完整 E2E server utilization;TPS/NPU 也不等于集群总吞吐。

12.3 能力评测怎么读:以下只是 Table 5 的部分代表性结果

BenchmarkFlash non-thinkingFlash thinkingPro non-thinkingPro thinking
IFEval · PromptStrict89.395.990.494.5
AIME 2026 · Avg@1686.593.387.395.4
GPQA-Diamond · Avg@479.883.781.187.9
BrowseComp · Acc57.065.7
LiveCodeBench V6 · Avg@350.985.174.585.7
SWE-bench Verified · Avg@357.663.166.868.5
GDPVal · Acc51.451.274.9

Table 5 统一使用 top-p=0.8、temperature=1.0,但只比较 openPangu 自身四种模式,没有外部模型列;粗体表示四个 openPangu 变体中最好,不代表行业最优。Claw-Eval 只测非多模态 splits;BrowseComp 使用 discard-all 且最多 300 iterations;SkillsBench、FeatBench、DeepCodeBench 使用 OpenCode,SWE-bench 使用 OpenHands;GDPVal 数据与 rubric 公开,但运行的是内部评测 pipeline。Deep Research 和全栈 mini-app 还依赖内部 pipeline 或 showcase,复现性弱于标准公开 benchmark。

13 · Technical provenance哪些可以画实线,哪些只能做横向比较

DeepSeek-V2 · MLA
报告明确 built upon
openPangu MLA base
DeepSeek-V3.2 · DSA
Longformer · SWA
明确采用两类组件
Hybrid DSA–SWA
1:2 interleaving
Attention Sink literature
问题与现象基础;非结构祖先
PAS · 128 latent K/V
Hyper-Connections
明确演进
mHC
mHC
采用并做稳定化
openPangu stabilized mHC
4 streams + sandwich / block postnorm
Aux-loss-free MoE balancing
明确采用并修改更新式
RMS-normalized bias update
MTP · Gloeckle et al.
DeepSeek-V3 practice
明确技术上游
stage-adaptive MTP-3
Muon
明确采用
HyperParallel Muon+
Muon is Scalable for LLM Training
相关规模化前作与稳定性观察
openPangu Muon stability discussion
GRPO
明确用于专家 RL
Reasoning / General / Agent / Coding experts
On-Policy Distillation / MiniLLM
及报告引用的后续 OPD 工作
报告明确引用的蒸馏上游
multi-expert OPD fusion
SmoothQuant
量化基线
2D exponent search W8A8
vLLM Hybrid KV / Single BlockPool / APC
明确扩展缓存管理
Pangu hybrid cache manager
vLLM V1 scheduler
明确适配
openPangu async scheduler
Mamba / Gated DeltaNet
缓存语义可类比,未确认算法来源
ModAttn state cache
DeepEP
明确借鉴两级通信设计;未确认使用 DeepEP 框架
HyperParallel Muon+
Mooncake / LMCache
同类外部系统;报告未提及或未确认采用
Omni Cache
实线:报告明确采用、继承或扩展 虚线:同类背景、结构可比较或来源未确认
技术点前序工作openPangu 2.0 的变化证据等级
MLADeepSeek-V2作为 DSA/SWA 的共同压缩注意力底座报告明确建立在其上
DSADeepSeek-V3.2与 SWA 按 1:2 编排,后置稀疏化明确采用 + 组合/迁移再设计
PASAttention Sink 研究每层 128 对持久化 latent KV现象来源明确;结构为本文方案
ModAttn无明确直接祖先MLA 压缩分支与输出上的 kernel-3 因果卷积报告提出
MoE 主体与 DeepSeekMoE 路线高度相近shared + routed experts、Top-8结构相近;直接来源未确认
MoE 路由平衡Auxiliary-Loss-Free Balancing;RMS 归一化更新RMS-normalized load-balance bias路线明确
mHCHyper-Connections → mHCsandwich norm + block postnorm明确继承 + 稳定化改造
MTPBetter & Faster LLMs;DeepSeek-V31→3 层阶段调度与 MTP-3 系统优化明确上游 + 本文配方
MuonMuon;Muon is Scalable 为相关规模化前作head grouping、HyperParallel Muon+Muon 明确采用;前作为相关观察
OPDOn-Policy Distillation、MiniLLM 及报告引用的后续 OPD 实践四领域专家、training-engine 概率、多教师调度报告引用 + 工程化
Felix CPUlysses / KV CP 背景DSA CP、SWA TP、ModAttn SP 的逐层编排报告新系统方案
Omni CachevLLM Hybrid KV / APCDRAM-centric KV 与统一异构 page明确扩展 + 自身缓存体系

14 · Evidence boundaries报告没有回答什么

Compute

训练账单缺失

没有实际 NPU 数、超节点数、训练天数、NPU-hours、FLOPs、成本、能耗、吞吐或 MFU。

Data

数据构成不可审计

没有来源比例、去重率、污染检查、许可证构成、合成数据占比和后训练 token/episode 数。

Ablation

主模型拆解不足

PAS、mHC 的消融明确来自 15B 代理模型;routing-bias 曲线未注明模型规模;三者均缺少 92B/505B 的完整独立拆解。

Long context

512K 原生训练不等于无损

缺少从短上下文到 512K 的专门 accuracy 曲线,也没有完整展示 DSA 转换的恢复程度。

Post-training

RL 规模与预算不透明

没有各专家训练量、GRPO 超参、thinking 输出预算、工具成本和 MTP 接受率。

Evaluation

没有外部同表对比

Table 5 只比较自身四种模式,内部 Deep Research 与 mini-app showcase 难以独立复现。

Inference

Ascend 特定口径

缺同硬件外部 baseline、功耗和成本;operator、dispatch、TPOT 与 E2E 改善不能直接相加。

Release

部署与许可存在边界

官方验证路径是 omni-infer + Ascend;权重许可证有地域和再分发限制,并非通用 Apache-2.0。

总评 openPangu 2.0 的可信度最高之处是架构参数、预训练日程和昇腾推理系统的细节披露;最需要保留折扣的,是“各模块分别贡献了多少”、训练资源账单、后训练规模,以及性能相对于其他模型和其他硬件栈的可迁移性。

15 · Primary sources一手资料与技术溯源链接

  1. openPangu-2.0: Towards Reliable and Efficient Agentic Reasoning
  2. openPangu-2.0-Pro model card · config
  3. openPangu-2.0-Flash model card · config
  4. openPangu-2.0-Pro-Int8 · w8a8_dynamic config · HF storage metadata
  5. openPangu-2.0-Infer / omni-infer deployment · BF16 README · INT8 README
  6. Pro 2P1D reference inventory
  7. openPangu-2.0-Op · omni-ops · OmniInfer
  8. OpenPangu Model License Agreement Version 2.0
  9. Attention Is All You Need
  10. DeepSeek-V2 / Multi-head Latent Attention
  11. DeepSeek-V3.2 / DeepSeek Sparse Attention
  12. Longformer / Sliding-Window Attention
  13. StreamingLLM / Attention Sinks · When Attention Sink Emerges
  14. DeepSeekMoE · Auxiliary-Loss-Free MoE Balancing
  15. Hyper-Connections · mHC
  16. CogView / Sandwich normalization
  17. Better & Faster LLMs via Multi-token Prediction · DeepSeek-V3
  18. Muon · Muon is Scalable for LLM Training
  19. DeepSpeed-Ulysses · ZeRO · DeepEP
  20. FlashAttention · FlashAttention-2
  21. DeepSeekMath / GRPO · On-Policy Distillation of Language Models · MiniLLM
  22. Rollout Routing Replay · IcePop
  23. SmoothQuant · vLLM
  24. LoPT
  25. Mooncake · LMCache(同类外部缓存系统对照;报告未提及或未确认采用)