据动察 Beating 监测，在大规模 MoE 架构演进中，利用国产昇腾 (Ascend) 芯片训练大模型已成为构建自主可控 AI 算力的关键方向。然而，主流大模型框架多基于英伟达 CUDA 生态开发，直接移植至昇腾平台时易面临硬件队列调度不均、算力利用率低等挑战。中科大、华为与北大等联合推出编译调度框架 HyperParallel-MoE，针对昇腾 A3 独特的硬件队列进行瓦片级 (tile-level) 调控，旨在突破异构算力在并行调度上的能效瓶颈。

昇腾 A3 拥有两类核心，AIC 负责矩阵乘法，AIV 则处理向量计算与通信。但在传统的算子串行调度下，两类核心只能交替工作、轮流闲置。实测数据显示，在 256 节点集群跑 671B 的 DeepSeek 风格大模型时，AIC 利用率仅为 67%，且 39% 的专家路由通信延迟暴露在关键计算路径上。

HyperParallel-MoE 核心改动有三项。第一，设计 AIV 驱动的单边写原语，使数据瓦片到达即触发计算，无需等待整批到齐。第二，引入依赖感知瓦片任务生成，将通信与计算算子统一抽象。第三，以静态调度器预生成任务序列，在单个 kernel 内驱动两类核心并行，并利用高速 L2 缓存共享中间结果，减少回写与读取 HBM 慢速内存的延迟。

测试显示，在 64 节点平衡路由下，负责专家计算的核心模块（MoE-FFN）延迟缩短约 36%，相当于数据处理速度最高提升了 58%（即提速 1.49 至 1.58 倍）。在整机端到端运行中，单步训练速度也同步提升了 8% 至 9%。这说明，昇腾的实际能效不只取决于硬件规格，更在编译器与运行时能否把 AIC/AIV 核心高效调度起来。

此页面可能包含第三方内容，仅供参考（非陈述/保证），不应被视为 Gate 认可其观点表述，也不得被视为财务或专业建议。详见声明。

9人点赞了这条动态

赞赏
9
6
转发
分享

请输入评论内容

把收益当零食

· 1小时前

CUDA生态护城河太深，国产替代不能硬搬，得这种底层重构

茶杯里的资金流

· 2小时前

自主可控不是口号，是这种一行行代码抠出来的

Liquidity Lifeguard

· 2小时前

北大做系统，中科大做架构，华为落地，产学研这模式才对味

BridgeSideEyes

· 2小时前

算力利用率低一直是昇腾的痛点，这次能提多少？有数据吗

GateUser-de0b9e3b

· 2小时前

华为搞编译器是认真的，从MindSpore到这套框架，生态在慢慢补

GateUser-26374bb4

· 2小时前

MoE本来就吃调度，国产芯片想追上必须在这种细节下功夫

热门话题
查看更多
#
股票交易挑战最高赢17000U
1616.82万热度
#
美伊协议草案
28.44万热度
#
交易CFD送黄金
302.9万热度
#
HYPE市值超越DOGE
1264.29万热度
#
PlatinumCard作者专属
15.45万热度

华为中科大联手突破英伟达垄断，昇腾A3跑大模型专家计算提速58%

热门话题

股票交易挑战最高赢17000U

美伊协议草案

交易CFD送黄金

HYPE市值超越DOGE

PlatinumCard作者专属

置顶