标签

AI

软件供应链安全:你的依赖里藏着多少把刀

来源: docker.com 48
2025 年,开源仓库里冒出了超过 454,000 个恶意包——这不是漏洞数量,是有人故意投毒的包数量。Sonatype 的 2026 年《软件供应链状态报告》把累计数字摆到了桌面上:自 2019 年以来,恶意包总量突破 120 万。绝大多数团队根本没意识到自己装了多少依赖,更不知道这些依赖的上游是否还安全。供应链攻击的爆炸半径正在随依赖深度指数级膨胀...

在 SageMaker JumpStart 上部署 Fundamental NEXUS 大表格模型,跑通企业数据预测

来源: aws.amazon.com 46
表格数据是企业里最常见的数据形态——客户画像、交易流水、设备日志,几乎都落在结构化表格里。传统做法是逐任务训练 XGBoost 或 LightGBM,每个模型只管一个场景,换个任务就要重新调参。Fundamental 推出的 NEXUS(Large Tabular Model)试图用"预训练 + 微调"的范式把表格数据也拉进大模型路线:先在海量表格数据...

数据中心断电零预警:Meta 的"瞬时断电风暴"验证体系

来源: engineering.fb.com 35
数据中心最怕的不是慢故障,而是"灯突然全灭了"——电网跳闸、UPS 失效、整排机柜瞬间掉电,零预警、零缓冲。传统灾备演练往往假设"有几分钟优雅关机时间",但现实中的断电不会给你这个窗口。Meta 近期公开了他们应对这类极端场景的测试范式 Instantaneous PowerLoss Storm,以及围绕它构建的纵深防御体系和验证方法。这篇文章拆解其核...

用 SOCI 索引加速深度学习容器冷启动:DLAMI 与 DLC 实战指南

来源: aws.amazon.com 49
深度学习容器动辄数 GB,拉取镜像往往成为冷启动的瓶颈。AWS 推出的 SOCI(Seekable OCI)通过"懒加载"让容器不必等整个镜像下载完就能启动——镜像层按需拉取,启动后再后台补齐剩余数据。这篇文章聚焦如何在公开的 Deep Learning AMI(DLAMI)和 Deep Learning Containers(DLC)上使用 SOCI...

用 SFT + DPO 双阶段训练,让小模型的工具调用不再"胡说八道"

来源: aws.amazon.com 48
大模型做 Agent 时,最让人头疼的不是推理能力不够,而是工具调用不准——该调 API 时不调,不该调时瞎调,参数拼错、格式乱写,整个工作流直接断掉。Amazon SageMaker AI 最近的一篇实践文章给出了一个清晰的解法:先用监督微调(SFT)教会模型"怎么正确调用工具",再用直接偏好优化(DPO)让它学会"哪种调用方式更好",两步叠加,小语...

用 Amazon FSx for NetApp ONTAP 搭建高可用 Oracle 数据库

来源: aws.amazon.com 62
Oracle 数据库的高可用架构,核心难题一直是共享存储。传统做法依赖 SAN 或 NFS,在云上要么成本高,要么恢复慢。Amazon FSx for NetApp ONTAP(简称 FSxN)把 ONTAP 的数据管理能力搬进 AWS,配合 Auto Scaling 和无服务器编排,可以把故障恢复从"人肉重启"压缩到分钟级自动化。 下面拆解这套架构的...

写代码不再是瓶颈:Spotify 如何把开发者体验扩展到团队与 AI Agent

来源: engineering.atspotify.com 54
Spotify 首席架构师在 Code with Claude 大会上抛出一个判断:写代码本身已经不再是约束了。真正卡住交付速度的,是团队协作摩擦、重复的基建搭建、以及工具链对 AI Agent 的不友好。他们的应对方式是——用平台工程把开发者体验(DevEx)从"个人写代码"的维度,拉升到"团队+Agent 高效运转"的维度。 这个判断值得认真对待。...

DeepSpeed 正式集成 Muon 优化器:从原理到上手配置

来源: pytorch.org 32
Muon 优化器在过去几个月里迅速获得了前沿 AI 实验室的青睐——Moonshot AI 等团队已经在大规模训练中采用它。现在 DeepSpeed 完成了对 Muon 的原生支持,意味着用 DeepSpeed 做分布式训练的开发者可以直接在配置文件里切换到这个优化器,不再需要自己魔改训练循环。 传统 AdamW 对每个参数维护一阶动量和二阶动量(逐元...

Google 全球服务舰队上的大规模 A/B 实验系统:如何让分布式实验不再打架

来源: infoq.com 41
Google 每天同时跑着成千上万个 A/B 实验——搜索、YouTube、Maps、Ads,每个产品都有自己的服务集群,每个集群又拆成几十个微服务。实验多了,问题就来了:用户在搜索页被分到实验 A,跳到结果页却被分到实验 B;曝光日志漏记了一条,结论就偏了;两个实验同时改同一个按钮的颜色,数据谁也说不清。 最近 Google 公开了它跨舰队的大规模 ...