智东西
作者 | 程茜
编辑 | 李水青
智东西7月31日消息,华为近日开源了基于昇腾NPU训练的盘古MoE模型openPangu-2.0-Pro。这是openPangu-2.0系列中的最新开源模型,其总参数规模达到5050亿,激活参数规模为180亿,能够支持512K上下文长度,训练数据总量约34T tokens。早先在6月12日,华为开源了参数为92亿的轻量化模型openPangu-2.0-Flash,该模型中6亿为激活参数。
今年6月12月,在华为开发者大会现场,余承东发布了openPangu-2.0-Flash,并宣布了openPangu-2.0-Pro的即将开源,当时他提到要将盘古大模型做到世界第一。从余承东的豪言到如今的开源,openPangu-2.0-Pro成为他放狠话后的首次重磅成果。
技术报告并未提供第三方模型对比数据,仅披露了openPangu-2.0系列模型的数据。报告中指出,这两个模型在通用能力、逻辑推理、智能体相关的主流评测基准中均展现出强大的对标实力。
在模型架构上,openPangu-2.0-Pro进行了全面升级:Attention架构方面,采用了高效MLA,并结合DSA+SWA独立分层混合架构,其中层配比为1:2。SWA层负责局部窗口建模,DSA层负责稀疏全局聚合,这一设计在保持精度的同时显著降低了长序列推理的计算、显存与访存开销。拓扑架构将传统残差连接升级为4支流mHC架构,以提升表征多样性与泛化能力。自投机模块则采用了3头MTP架构,实现一次额外预测3个token,有效提升模型的推理速度。训练过程中使用Muon优化器,获得了更快的收敛速度。
研究表明,openPangu-2.0-Pro和openPangu-2.0-Flash之间形成了一套正向协同反馈机制。基础推理能力的强劲性能可以直接支持复杂智能体行为的运行,而智能体的持续运行反过来又能够迭代优化模型的多阶任务规划能力与长轨迹上下文处理水平。
openPangu-2.0-Pro的模型权重、基础推理代码及技术报告已全面开源,可供下载使用。
开源链接:
技术报告:https://huggingface.co/openpangu/openPangu-2.0-Pro/blob/main/openPangu-2.0%20Tech%20Report.pdf
一、长上下文智能体任务的特别设计,软件工程与顶尖模型的差距
智能体应用对模型提出了高标准,要求模型不仅能够执行长程任务,还要能够精准调用外部工具,并且长时间运行时保持认知一致性。然而,在部署时,模型常常暴露出若干问题。例如,现有通用框架会造成不必要的推理资源损耗,增加上下文长度会削弱模型表现;同时,传统对齐手段的稳定性不足,导致在长周期任务中经常出现时间逻辑、层级结构方面的推理失误。
针对这些问题,华为融合了自研硬件内核、整机系统架构、训推一体化智能体强化学习算法,并配合专属推理加速方案,构建了一套完整的软硬件协同设计体系,专门针对长上下文智能体任务进行优化。openPangu-2.0系列模型包括了新开源的openPangu-2.0-Pro,以及早先开源的轻量化模型openPangu-2.0-Flash(参数92亿,其中6亿为激活参数)。
在发布openPangu-2.0-Flash时,余承东强调,这个盘古模型针对昇腾算力进行了深入优化,并且更加开放地共享源代码。通过昇腾原生的训练,训练效率提升了30%,这是业界首个采用DSA+SWA独立分层混合架构的模型。余承东还特别指出,这是首个开源包括预训练代码、后训练代码、训推算子的模型。
Hugging Face的数据显示,本地离线模型openPangu-2.0-Flash GGUF在上个月的下载量达到了399次。






