2026年7月8日,pytorch官方在github release页正式推送v2.13.0版本。这次更新一次性打包了flexattention、inductor后端、分布式通信优化,还有多平台python wheel支持好几块内容。对平时做训练、推理的开发者来说,最直观的变化就是flexattention现在已经适配apple silicon的mps后端了。官方发布记录里明确写了,稀疏模式下它比sdpa最高能快12倍左右,同时还给cuda端加了确定性反向路径,方便大家复现实验里的梯度计算结果。

来源:PyTorch 官方 GitHub Release
之前FlexAttention基本都是做高性能注意力计算、稀疏注意力、长序列模型训练的开发者用得比较多。这次适配Apple Silicon MPS之后,用Mac工作站做模型原型验证的团队,直接在本地设备上就能拿到和正式训练栈差不多的注意力算子能力。不过要注意,官方给出的加速数据是对应稀疏模式的,不是所有模型、所有batch size,或者所有MPS设备都能拿到同幅度的提速。实际能涨多少速度,还是要看你的注意力模式、张量形状、模型结构,有没有刚好命中对应的后端路径。

来源:PyTorch 官方 GitHub Release
这次v2.13.0的更新列表里,还包含了CuTeDSL原生DSL后端、nn.LinearCrossEntropyLoss、torchcomms、FSDP2通信重叠,还有Python 3.15的官方wheel包等内容。能看出来PyTorch 2.13不是只更了单个功能,是围绕编译优化、训练内存、分布式通信、平台支持做的一次集中迭代。之所以把FlexAttention适配MPS放在最受关注的位置,是它把开发者本地调试设备和大模型注意力性能优化打通了,影响范围不止局限在数据中心的GPU集群。
查询 Apple 开发者文档、API 与 2014‑2025 年 WWDC 视频,搜索 SwiftUI、UIKit、Objective‑C、Swift 框架及 watch 会话。
这里要提个已知问题:PyTorch官方在v2.13.0的发布说明里特别标注了,ROCm的wheel包在没有GPU的环境下运行torch.compile会出现回归问题,临时解决方法是用ROCm官方镜像,或者安装标准的CPU/CUDA版本安装包。大家升级到2.13的时候,别只看新功能亮点,一定要结合自己当前的硬件环境、wheel包来源,还有生产部署环境做一遍回归测试。后续相关功能会不会扩展到更多后端,一切以PyTorch官方博客、文档和GitHub Release的更新内容为准。
对企业的研发流程来说,这次更新建议先放到小范围验证环境里测。不管是Mac本地调试、CUDA训练、ROCm镜像还是分布式任务,都可能触发不同的代码路径,统一全量升级之前,一定要做好依赖锁定,留好可回滚的方案。










