近日,在上海举办的PyTorch Conference China 2026大会上,昇腾公布与PyTorch社区的合作最新进展。昇腾上线PyTorch官网,成为PyTorch官方支持的第一个中国算力底座,双方的合作也成为共建AI产业生态的新里程碑。
当前AI产业进入大模型与智能体快速迭代阶段,算力集群化、架构集约化、开发智能化成为行业发展趋势。开源框架是连接算力硬件与模型开发的关键中间层,硬件能否被主流开源社区原生接纳,直接关系硬件算力能否被广大开发者便捷使用,也影响算力底座的产业落地规模。过去较长一段时间,主流AI开源框架对国内硬件的支持大多以第三方插件形式实现,原生适配、社区CI质量看护、标准化测试等方面存在短板,给开发者带来额外适配成本。
据会上披露,昇腾与PyTorch的合作已经从简单硬件适配,演进到社区共建阶段。昇腾完成社区全量特性、测试用例的硬件后端解耦改造,PyTorch核心API实现对昇腾硬件100%支持,功能、精度、性能层面实现对齐。PyTorch官网后端页面已经纳入昇腾入口,开发者可以通过一行命令完成昇腾环境的下载安装。同时,昇腾正式接入PyTorch社区CI/CD体系,2000多张昇腾算力卡接入社区,实现7×24小时自动化质量看护,保障版本迭代过程中的代码兼容性,降低开发者调试成本。
“硬件接入开源框架,不只是完成代码适配,更要参与社区标准共建。”华为昇腾计算产品线副总裁张良在主题演讲中表示,八年开源实践过程中,昇腾累计向PyTorch社区贡献超过20万行核心代码,参与重构社区约100万个测试用例,推动硬件后端解耦等底层架构改造工作,以此实现硬件真正意义上的原生支持。
技术层面,双方围绕算子编译、分布式训练、推理引擎等方向开展多项协同工作。算子层面,Inductor‑Ascend实现昇腾亲和融合算子生成,实现模型级端到端图模式,兼容Triton编程能力,降低算子迁移工作量;框架层面,HyperParallel分布式组件完成对PyTorch的FSDP、Muon优化器深度优化,相关成果也将向PyTorch生态社区贡献。在训练负载测试中,同等配置条件下,HyperParallel方案在维持损失收敛一致的前提下,提升大模型训练吞吐量。面向推理场景,昇腾团队向vLLM、SGLang等主流推理社区贡献调度、高可靠运行、部署编排相关特性;训练方面,孵化类似TransferQueue、MindSpeed MM等项目,补充数据传输、模型定义等基础组件能力,接入PyTorch生态社区。
本次大会上,华为深度主导的PyTorch TAC加速器集成工作组对外公布阶段性成果。工作组面向行业硬件异构化难题,输出硬件接入指南、跨代码库CI测试机制、设备感知测试套件等标准化内容,推动建立多后端硬件统一接入路径,减少不同硬件适配框架的重复开发工作,为更多算力硬件接入PyTorch生态提供参考范式。
从产业视角看,AI异构计算时代,单一硬件很难覆盖全部应用场景,开源社区正在探索一套可以兼容多元算力的技术体系。以往不少硬件厂商主要在自身内部完成框架适配,较少向上游社区输出底层改造逻辑,不同硬件适配方案分散,开发者切换硬件平台时需要做大量迁移工作。而将硬件能力原生合入上游社区,硬件厂商需要遵循社区开发规范,共同维护测试体系,对厂商的开源贡献能力提出更高要求。
大会现场设置技术展区,展出昇腾950超节点、开源开放生态成果,开放真机实操体验,面向开发者提供算子开发、分布式训练、推理部署、Agent开发等实操任务。专题论坛与多场技术分享活动中,来自多个开源项目的技术人员围绕跨平台训练、AI编译器、MoE大规模训练、Agent场景缓存优化等议题分享工程实践,推动经过大规模集群验证的技术方案对外开源共享。
据悉,面向Agentic AI发展方向,双方后续将围绕超节点Runtime、分布式执行、智能体框架开展进一步协同,打造面向智能体的原生超节点软件栈。行业人士认为,国产硬件完成主流开源框架原生适配共建,为国内开发者提供更多算力选择,同时也为全球AI开源社区带来来自中国产业侧的技术实践,推动异构算力生态进一步完善。但硬件生态建设是长期过程,后续还需要持续开展社区协同,补齐工具链、案例、开发者文档等配套内容,让算力能力真正落地到各类AI业务场景。




