标签

AI

用 SkyPilot 跑多云 AI 任务,把数据零出口留在 Hugging Face

来源: huggingface.co 42
AI 训练和批量推理越来越像一门调度生意:GPU 在哪便宜、哪有空,就把任务跑到哪。但数据搬来搬去很快会变成账单黑洞。这个主题的关键变化是:用 SkyPilot 在任意云上运行 AI workload,同时把存储放在 Hugging Face,通过“zero-egress storage”的思路减少跨云数据出口成本和数据复制负担。 很多团队做多云 AI...

AP+ 用 ChatGPT Enterprise 和 Codex 加速支付系统交付

来源: openai.com 32
支付系统的复杂度不在“写几行代码”,而在规则、兼容性、审计、异常路径和人工判断同时存在。Australian Payments Plus(AP+)把 ChatGPT Enterprise 和 Codex 放进工程与业务协作流程里,目标不是让 AI 替人拍板,而是在复杂支付场景中更快梳理问题、生成候选实现、提升交付质量,并把最终判断留给人。 AP+ 面对...

PyTorch Monarch 登上 AMD GPU:用单控制器思路管理 ROCm 分布式训练

来源: pytorch.org 44
大模型训练已经不是“把脚本丢到几张卡上跑完”这么简单。数十亿参数模型往往要跨数百甚至数千张 GPU 训练,在这个规模下,硬件故障、节点掉线、通信抖动都不是意外,而是日常。PyTorch Monarch 被带到 AMD GPU 和 ROCm 生态中,重点并不只是“多支持一种硬件”,而是把单控制器分布式训练的编排方式带进 AMD GPU 集群。 传统分布式...

Hugging Face 模型一键进 SageMaker Studio:从发现到实验少走一步

来源: aws.amazon.com 39
Hugging Face 和 Amazon SageMaker AI 增加了深度链接集成:开发者在 Hugging Face 上发现模型后,可以通过一次选择直接进入 SageMaker Studio 做实验。这个变化不在于多了一个按钮,而在于把“找模型”和“动手验证”之间那段容易断掉的流程接了起来。 很多团队的模型评估流程都卡在同一个地方:研究人员在 ...

PostgreSQL 20 将锁等待统计细化到每个后端进程

来源: postgr.es 36
PostgreSQL 20 的开发分支加入了一项很实用的可观测性改进:后端进程级别的锁统计。过去我们可以通过 看到锁等待次数、等待时间、fast-path exceeded count 等信息;这次改动把同类数据下钻到了 per-backend 维度,让排查“到底是哪条连接在等锁、等了多久、是否频繁撞上 fast-path 限制”变得更直接。 很多人排...

在 Amazon Bedrock 上调用 MiniMax:从长上下文到 Agent 工作流

来源: aws.amazon.com 40
MiniMax 模型进入 Amazon Bedrock 后,开发者可以在 AWS 的托管边界内使用这些模型构建 Agent 应用、长上下文文档分析流水线,以及软件工程辅助流程。变化的重点不只是“多了一个模型”,而是模型访问、扩缩容、安全控制和运维接入都可以走 Bedrock 这一套成熟路径。 直接接入模型 API 时,团队通常要自己处理鉴权、网络边界、...

用 SageMaker HyperPod 搭起 Amazon Nova 多轮强化学习流水线

来源: aws.amazon.com 43
多轮强化学习的麻烦不只在算法本身,还在训练基础设施:数据来了以后谁触发任务、集群资源怎么准备、训练脚本如何拿到 S3 数据、一次 Wordle 这种多轮环境的交互日志如何进入训练闭环。这个方案的核心变化是把 Amazon Nova Forge 和 Amazon SageMaker HyperPod 组合起来,用两阶段基础设施部署出一个事件驱动流水线:向...

用 Amazon Nova 编排图像 PII 自动遮盖流水线

来源: aws.amazon.com 33
图像里的 PII 不只是一串文字。身份证、车牌、指纹、斜着拍的证件、照片角落里的姓名牌,都可能绕过单纯 OCR。这个方案的关键变化是:让 Amazon Nova 做视觉上下文推理和流程编排,再把像素级分割交给部署在 Amazon SageMaker AI 上的 Meta Segment Anything Model 3,把文字识别交给 Amazon T...