标签

机器学习

PyTorch Monarch 登上 AMD GPU:用单控制器思路管理 ROCm 分布式训练

来源: pytorch.org 44
大模型训练已经不是“把脚本丢到几张卡上跑完”这么简单。数十亿参数模型往往要跨数百甚至数千张 GPU 训练,在这个规模下,硬件故障、节点掉线、通信抖动都不是意外,而是日常。PyTorch Monarch 被带到 AMD GPU 和 ROCm 生态中,重点并不只是“多支持一种硬件”,而是把单控制器分布式训练的编排方式带进 AMD GPU 集群。 传统分布式...

Hugging Face 模型一键进 SageMaker Studio:从发现到实验少走一步

来源: aws.amazon.com 39
Hugging Face 和 Amazon SageMaker AI 增加了深度链接集成:开发者在 Hugging Face 上发现模型后,可以通过一次选择直接进入 SageMaker Studio 做实验。这个变化不在于多了一个按钮,而在于把“找模型”和“动手验证”之间那段容易断掉的流程接了起来。 很多团队的模型评估流程都卡在同一个地方:研究人员在 ...

在 Amazon Bedrock 上调用 MiniMax:从长上下文到 Agent 工作流

来源: aws.amazon.com 39
MiniMax 模型进入 Amazon Bedrock 后,开发者可以在 AWS 的托管边界内使用这些模型构建 Agent 应用、长上下文文档分析流水线,以及软件工程辅助流程。变化的重点不只是“多了一个模型”,而是模型访问、扩缩容、安全控制和运维接入都可以走 Bedrock 这一套成熟路径。 直接接入模型 API 时,团队通常要自己处理鉴权、网络边界、...

用 SageMaker HyperPod 搭起 Amazon Nova 多轮强化学习流水线

来源: aws.amazon.com 43
多轮强化学习的麻烦不只在算法本身,还在训练基础设施:数据来了以后谁触发任务、集群资源怎么准备、训练脚本如何拿到 S3 数据、一次 Wordle 这种多轮环境的交互日志如何进入训练闭环。这个方案的核心变化是把 Amazon Nova Forge 和 Amazon SageMaker HyperPod 组合起来,用两阶段基础设施部署出一个事件驱动流水线:向...

用 Amazon Nova 编排图像 PII 自动遮盖流水线

来源: aws.amazon.com 33
图像里的 PII 不只是一串文字。身份证、车牌、指纹、斜着拍的证件、照片角落里的姓名牌,都可能绕过单纯 OCR。这个方案的关键变化是:让 Amazon Nova 做视觉上下文推理和流程编排,再把像素级分割交给部署在 Amazon SageMaker AI 上的 Meta Segment Anything Model 3,把文字识别交给 Amazon T...

把 SageMaker 推理基准结果实时流进 MLflow

来源: aws.amazon.com 22
Amazon SageMaker AI 的优化推理推荐作业和基准测试作业现在可以和 MLflow 集成,把指标、参数和图表实时写入 serverless Amazon SageMaker MLflow App。对做模型上线的人来说,这个变化很实用:压测、实例规格对比、延迟和吞吐结果不再散落在作业日志、Notebook 和截图里,而是进入同一个实验追踪界...

读懂 PyTorch 测试基础设施:为什么 CI 里的测试名和源码不一样

来源: pytorch.org 41
PyTorch 的测试体系有一个很容易让新贡献者困惑的特点:很多测试不是静态写在文件里的,而是在导入测试模块时动态生成的。于是你在 CI 日志里看到的失败用例,可能带着设备、dtype 或参数组合后缀,看起来和源码里的模板函数并不完全一致。 这不是 CI 在“乱报错”,而是 PyTorch 为了覆盖多设备、多 dtype、多后端行为而采用的测试生成机制...

ExecuTorch 黑客松背后:端侧 AI 正在从演示走向工程现场

来源: pytorch.org 30
过去一个周末,旧金山的 ExecuTorch Hackathon 把构建者、研究人员、移动开发者和 AI 从业者聚到了一起。这个两天的线下活动指向一个很明确的趋势:端侧 AI 不再只是“把模型塞进手机”的炫技,而是在延迟、隐私、离线可用性和成本压力下,变成越来越实际的工程选择。 ExecuTorch 的核心价值,正是让 PyTorch 生态里的模型更顺...

用 Amazon Bedrock 识别 AI 生成的钓鱼邮件:从提示词到自动化拦截

来源: aws.amazon.com 30
钓鱼邮件一直是攻击链里最便宜、最常见的入口。生成式 AI 改变了它的规模和质量:攻击者可以结合公开情报(OSINT),批量生成语气自然、上下文贴合、几乎不重复的邮件。对安全团队来说,传统基于关键字、黑名单和固定模板的检测方式会越来越吃力。Amazon Bedrock 的价值在于:把大语言模型接入邮件安全流水线,让系统不只看“有没有可疑词”,还看“这封邮...