标签

PyTorch

从 KV Cache 到生产服务:vLLM 在 PyTorch Conference 2026 的技术路线

来源: pytorch.org 49
PyTorch Conference North America 2026 将 vLLM 放在一组相互连接的技术议题中:KV cache 管理、分离式服务、硬件可移植性、内核优化、PyTorch 集成、Mixture-of-Experts(MoE)推理、注意力机制,以及生产环境服务。这个议程传递出一个清晰信号:高性能推理已经不只是“把模型跑起来”,而是...

从编译器到贡献者基础设施:PyTorch Conference North America 2026 核心议题指南

来源: pytorch.org 34
PyTorch Conference North America 2026 的 Core PyTorch sessions,关注的不是某个单一模型或应用案例,而是支撑整个 PyTorch 生态运行的工程基础:编译器与运行时、分布式通信、设备可移植性、发布工程、CI、可观测性、加速器集成,以及贡献者基础设施。对每天训练和部署模型的开发者来说,这些议题决定...

PyTorch Conference North America 2026 主题公布:从框架更新到 Trainium 原生支持

来源: pytorch.org 44
PyTorch Conference North America 2026 的主题演讲阵容已经公布。大会将于 2026 年 10 月 20 日至 21 日在美国加州圣何塞举行,议程聚焦 PyTorch 的最新进展,以及如何在 AWS Trainium 上使用原生 PyTorch 等方向。 对于正在维护训练平台、模型代码或推理基础设施的开发者来说,这类议...

用 AI 缩短新模型适配周期:从算子缺口到首日可运行

来源: pytorch.org 36
模型架构、算子组合和精度格式持续变化,而负责导入、优化和执行模型的编译栈往往需要更长的适配周期。即使底层系统已经成熟,一个新模型也可能因为少数未知算子、动态形状约束或图变换错误而无法运行。AI 的价值不只是生成一段补丁,而是把故障归类、最小化复现、查找相似实现和验证候选改动串成一条受控流水线。 团队容易把“模型可以导入”误认为“模型已经支持”。更实用的...

从 CUDA 到自动驾驶:圣克鲁兹首场 PyTorch Meetup 带来的工程启示

来源: pytorch.org 44
圣克鲁兹首场 PyTorch Meetup 聚集了 45 位本地工程师、学生与技术负责人。活动一边讨论 GPU 与 CUDA 这类底层工程问题,一边通过闪电演讲展示 PyTorch 在化学、植物健康和自动驾驶等领域的应用。这样的议程说明,机器学习社区真正需要的并不只是模型结构分享,还需要把硬件、框架和具体行业问题放在同一张桌子上讨论。 对 PyTorc...

FBTriton 如何在快速创新与上游 Triton 同步之间建立工程闭环

来源: pytorch.org 44
定制 GPU 编译器基础设施常见的难题,不是完成一次漂亮的优化,而是让优化在上游持续变化时仍然可用。Meta 的 FBTriton 一边承载 TLX、autoWS 等编译器创新,一边通过代理式上游摄取和分层的 L1/L2/L3 验证体系保持与 Triton 同步。真正值得借鉴的,是它把“跟进上游”从临时救火变成了一条可重复执行、可以逐层建立信心的工程流...

为 2026 PyTorch 大会设计一枚真正能被制造出来的 Flare Pin

来源: pytorch.org 54
PyTorch Foundation 正在征集 2026 年 PyTorch Conference North America 的 flare pin 设计。获胜者将获得一张该大会的免费门票。对开发者和技术设计师来说,这不只是一次画图比赛:一枚合格的徽章既要传达 PyTorch 社区的气质,也要经得起缩小、制版和实体生产。 会议徽章的展示面积有限。屏幕...

在 AWS 上构建可解释的银行下一最佳产品推荐系统

来源: aws.amazon.com 55
银行的下一最佳产品(Next-Best-Product,NBP)推荐,不能只追求点击率或转化率。模型需要同时处理客户画像、账户行为、产品属性和交互上下文,并且能对每一条推荐说明理由。基于 Amazon SageMaker AI、PyTorch、多塔神经网络和学习式注意力机制,可以把准确性与监管所需的可解释性放进同一条推荐链路。 传统推荐模型常把所有特征...