大模型之家讯 7月31日,华为正式开源基于昇腾NPU训练的盘古MoE大模型openPangu-2.0-Pro,涵盖模型权重、基础推理代码及技术报告。该模型总参数规模5050亿(505B),每Token激活参数180亿,支持512K上下文长度,训练数据总量约34T tokens,是余承东在HDC 2026上喊话把盘古做到世界第一后的首次重磅发布。技术架构上,openPangu-2.0-Pro采用DSA+SWA独立分层混合注意力架构(层配比1:2)、4支流mHC拓扑、3头MTP自投机模块及Muon优化器,是专为长上下文智能体任务打造的软硬件协同设计体系。在128K上下文下,其最低TPOT时延为9.55ms,单卡吞吐达1326 token/s。技术报告坦承,该模型在处理复杂现实世界软件工程任务时,与顶尖模型仍存在明显差距。