分类

文章

PyTorch Monarch 登上 AMD GPU:用单控制器思路管理 ROCm 分布式训练

来源: pytorch.org 46
大模型训练已经不是“把脚本丢到几张卡上跑完”这么简单。数十亿参数模型往往要跨数百甚至数千张 GPU 训练,在这个规模下,硬件故障、节点掉线、通信抖动都不是意外,而是日常。PyTorch Monarch 被带到 AMD GPU 和 ROCm 生态中,重点并不只是“多支持一种硬件”,而是把单控制器分布式训练的编排方式带进 AMD GPU 集群。 传统分布式...

Hugging Face 模型一键进 SageMaker Studio:从发现到实验少走一步

来源: aws.amazon.com 41
Hugging Face 和 Amazon SageMaker AI 增加了深度链接集成:开发者在 Hugging Face 上发现模型后,可以通过一次选择直接进入 SageMaker Studio 做实验。这个变化不在于多了一个按钮,而在于把“找模型”和“动手验证”之间那段容易断掉的流程接了起来。 很多团队的模型评估流程都卡在同一个地方:研究人员在 ...

PostgreSQL 20 将锁等待统计细化到每个后端进程

来源: postgr.es 39
PostgreSQL 20 的开发分支加入了一项很实用的可观测性改进:后端进程级别的锁统计。过去我们可以通过 看到锁等待次数、等待时间、fast-path exceeded count 等信息;这次改动把同类数据下钻到了 per-backend 维度,让排查“到底是哪条连接在等锁、等了多久、是否频繁撞上 fast-path 限制”变得更直接。 很多人排...

在 Amazon Bedrock 上调用 MiniMax:从长上下文到 Agent 工作流

来源: aws.amazon.com 42
MiniMax 模型进入 Amazon Bedrock 后,开发者可以在 AWS 的托管边界内使用这些模型构建 Agent 应用、长上下文文档分析流水线,以及软件工程辅助流程。变化的重点不只是“多了一个模型”,而是模型访问、扩缩容、安全控制和运维接入都可以走 Bedrock 这一套成熟路径。 直接接入模型 API 时,团队通常要自己处理鉴权、网络边界、...

用 SageMaker HyperPod 搭起 Amazon Nova 多轮强化学习流水线

来源: aws.amazon.com 43
多轮强化学习的麻烦不只在算法本身,还在训练基础设施:数据来了以后谁触发任务、集群资源怎么准备、训练脚本如何拿到 S3 数据、一次 Wordle 这种多轮环境的交互日志如何进入训练闭环。这个方案的核心变化是把 Amazon Nova Forge 和 Amazon SageMaker HyperPod 组合起来,用两阶段基础设施部署出一个事件驱动流水线:向...

用 Amazon Nova 编排图像 PII 自动遮盖流水线

来源: aws.amazon.com 33
图像里的 PII 不只是一串文字。身份证、车牌、指纹、斜着拍的证件、照片角落里的姓名牌,都可能绕过单纯 OCR。这个方案的关键变化是:让 Amazon Nova 做视觉上下文推理和流程编排,再把像素级分割交给部署在 Amazon SageMaker AI 上的 Meta Segment Anything Model 3,把文字识别交给 Amazon T...

把 SageMaker 推理基准结果实时流进 MLflow

来源: aws.amazon.com 22
Amazon SageMaker AI 的优化推理推荐作业和基准测试作业现在可以和 MLflow 集成,把指标、参数和图表实时写入 serverless Amazon SageMaker MLflow App。对做模型上线的人来说,这个变化很实用:压测、实例规格对比、延迟和吞吐结果不再散落在作业日志、Notebook 和截图里,而是进入同一个实验追踪界...

PRX 的数据策略:先把事件、血缘和质量闸门立住

来源: huggingface.co 37
“PRX Part 4: Our Data Strategy”这个标题透露的信息很克制:这是一组系列文章里的第四篇,主题从产品或架构推进到了数据策略。摘要没有给出实现细节,所以本文不把具体方案包装成原文事实,而是围绕一个工程团队在 PRX 这类项目中可以如何落地数据策略来拆解:先定义数据契约,再建立可追踪的数据流,最后用质量检查挡住坏数据进入核心指标。...