2026-07-09
来源: pytorch.org
50
PyTorch 2.13 发布的一个关键信号是:FlexAttention 开始支持 Apple Silicon 上的 MPS 后端。对于在 MacBook、Mac Studio 上做模型原型、调试注意力机制或跑中小规模实验的开发者来说,这意味着部分原本更依赖 CUDA 环境的注意力优化路径,正在向本地 Apple GPU 迁移。 这不是“Mac 可以...
2026-07-07
来源: pytorch.org
44
大模型训练已经不是“把脚本丢到几张卡上跑完”这么简单。数十亿参数模型往往要跨数百甚至数千张 GPU 训练,在这个规模下,硬件故障、节点掉线、通信抖动都不是意外,而是日常。PyTorch Monarch 被带到 AMD GPU 和 ROCm 生态中,重点并不只是“多支持一种硬件”,而是把单控制器分布式训练的编排方式带进 AMD GPU 集群。 传统分布式...
2026-07-03
来源: pytorch.org
40
PyTorch 的测试体系有一个很容易让新贡献者困惑的特点:很多测试不是静态写在文件里的,而是在导入测试模块时动态生成的。于是你在 CI 日志里看到的失败用例,可能带着设备、dtype 或参数组合后缀,看起来和源码里的模板函数并不完全一致。 这不是 CI 在“乱报错”,而是 PyTorch 为了覆盖多设备、多 dtype、多后端行为而采用的测试生成机制...
2026-07-03
来源: pytorch.org
29
过去一个周末,旧金山的 ExecuTorch Hackathon 把构建者、研究人员、移动开发者和 AI 从业者聚到了一起。这个两天的线下活动指向一个很明确的趋势:端侧 AI 不再只是“把模型塞进手机”的炫技,而是在延迟、隐私、离线可用性和成本压力下,变成越来越实际的工程选择。 ExecuTorch 的核心价值,正是让 PyTorch 生态里的模型更顺...
2026-07-01
来源: pytorch.org
25
PyTorch 基金会宣布 Shopify 以白金会员身份加入。这个消息不只是“又一家大公司加入基金会”那么简单:PyTorch 作为 Linux Foundation 旗下的开源 AI 社区枢纽,正在被越来越多直接承载线上业务的公司视为基础设施,而不只是研究工具。 Shopify 提供的是电商领域的互联网基础设施:商家建站、交易、库存、营销、支付、履...
2026-07-01
来源: pytorch.org
35
LLM 后训练正在从“单机脚本调参”走向“分布式系统工程”。Miles 的定位很明确:用 PyTorch 原生的方式,把 SGLang 的 rollout、NVIDIA Megatron-LM 的训练、Ray 的编排能力组合起来,做大规模 LLM RL post-training,同时保留一个较小、可插拔的扩展面。 这类框架的价值不在于发明一个全新的训...
2026-06-29
来源: pytorch.org
27
PyTorch 新引入的 Cross-Repository CI Relay,简称 CRCR,解决的是一个很现实的问题:当 的 PR 打开或提交更新时,树外后端仓库也需要尽早知道这次变化会不会把自己打坏。过去这类验证往往靠人工触发、定期同步或维护者事后排查;CRCR 的目标是把“主仓库变化”和“下游仓库 CI”连成一条自动链路,并能追踪结果。 PyTo...
2026-06-11
来源: pytorch.org
36
大模型推理的算力瓶颈从来不在模型本身,而在底层 kernel。vLLM 社区长期依赖手写 CUDA kernel 来榨取 GPU 性能,但每换一代硬件就得重写一遍——H100 上的优化到了 B200 可能就不再是最优路径。Helion 的思路很直接:用 PyTorch 原生的方式写 kernel,让同一份代码在 H100 和 B200 上都能跑出接近手...
2026-06-03
来源: pytorch.org
30
Muon 优化器在过去几个月里迅速获得了前沿 AI 实验室的青睐——Moonshot AI 等团队已经在大规模训练中采用它。现在 DeepSpeed 完成了对 Muon 的原生支持,意味着用 DeepSpeed 做分布式训练的开发者可以直接在配置文件里切换到这个优化器,不再需要自己魔改训练循环。 传统 AdamW 对每个参数维护一阶动量和二阶动量(逐元...
2026-06-01
来源: pytorch.org
34
LinkedIn 每天要处理数以亿计的分配决策——广告投放、通知推送、内容推荐,背后都指向同一类数学问题:线性规划(LP)。当变量规模从几千膨胀到几十亿,传统求解器要么跑不完,要么跑不起。LinkedIn 的做法很硬核:把整个分布式 LP 求解器 DuaLip 用 PyTorch 重写,让 GPU 来扛最重的计算。这不是"换个框架跑跑看"的实验,而是生...