标签

云原生

SageMaker SDK v3 脚本模式:不重建镜像也能带上自己的训练代码

来源: aws.amazon.com 29
Amazon SageMaker Python SDK v3 重新设计了 script mode:训练和部署流程分别围绕统一的 与 组织,而 可以在任务运行时把本地代码同步进指定容器。对于已有自定义训练脚本、又不想每次改一行代码就重新构建 Docker 镜像的团队,这会明显缩短迭代回路。 传统的 bring-your-own-container 流程,...

AI 智能体时代的动态容量管理:预订、回退与资源切片

来源: cloud.google.com 46
企业开始把大量 AI 智能体接入业务系统,基础设施面对的已不只是推理流量增长。智能体会持续调用模型、数据库和内部应用,负载既消耗 GPU、TPU 等稀缺资源,又具有明显的突发性。若仍把应用绑定到单一机型、单一区域或整块加速卡,结果通常是两个极端:高峰期申请不到容量,低谷期则有大量资源闲置。 动态容量管理的核心不是无限扩容,而是把需求分成可预测与不可预测...

AI Agent 时代的 FinOps:让创新速度和成本边界同时可控

来源: cloud.google.com 34
AI Agent 开始承担持续运行、批量执行和多步骤协作的任务后,企业面对的成本问题已经不同于传统的软件订阅。业务用户可能每天稳定使用生产力工具,开发团队却可能在发布前集中运行大量代码 Agent,后台 Agent 还会在夜间持续消耗模型推理资源。只按“每个用户多少钱”来管理,往往看不见真实的运行成本,也很难在创新和预算之间取得平衡。 面向 Gemin...

从 72 个 CNCF 项目复盘中提炼治理结构:按规模和阶段设计,而不是照抄模板

来源: cncf.io 35
项目治理很容易走向两个极端:小团队过早建立复杂委员会,或者项目已经拥有大量维护者和用户,却仍依赖少数创始人的口头决定。对 72 个 CNCF 项目的治理审查显示,更可靠的做法是区分两类问题:当前成熟度需要满足什么,以及为了长期健康还应该提前建设什么。 CNCF 成熟度评估关注项目在相应阶段是否具备必要的治理能力,但最低要求并不等同于理想终点。一个项目通...

Kubernetes v1.37 Garhwal:扩缩容、控制面韧性与 AI 调度进入新阶段

来源: kubernetes.io 25
Kubernetes v1.37 代号 Garhwal,包含 67 项增强:16 项进入 Stable、23 项进入 Beta、27 项进入 Alpha,另有 1 项弃用或移除。相比单纯增加 API,这一版本更值得关注的是几条清晰的工程主线:控制面在大规模集群中更能承受启动和恢复压力,HPA 可以按外部需求缩容到零,工作负载感知调度开始服务 AI/HP...

Minimus Registry 下线前:迁移到 Docker Hardened Images 的实用路径

来源: docker.com 31
Minimus registry 将于 10 月 22 日下线。对仍在 CI、Kubernetes 清单或基础镜像中引用 Minimus 镜像的团队而言,这不是一次可以延后的镜像整理,而是一次供应链依赖迁移:下线后,新的构建、部署扩容和灾难恢复都可能因拉取镜像失败而中断。 Docker 给出的替代方向是 Docker Hardened Images(D...

把 gVisor 变成 Ray 集群里的沙箱原语:为强化学习安全执行动态代码

来源: cloud.google.com 44
强化学习和后训练工作流正在大量采用 Ray:训练器、推理引擎、rollout worker、数据管道和评估任务可以由同一个分布式运行时统一调度。但随着 agentic workflow 变得更复杂,模型生成的代码、工具调用和多轮交互也带来了新的问题:如何在不暴露宿主机的前提下,大规模、低延迟地执行不可信代码? Google 与 Anyscale 正在推...

懒人也能做到的代码可观测性实践指南

来源: cncf.io 40
开发者被要求把越来越多的问题“左移”:更早发现、更早验证、更早修复。现在,可观测性也开始进入开发阶段。它不只是线上平台团队的工作,而是代码作者在提交代码时就应该留下的诊断入口。 这里的重点不是给每个函数都加日志,而是让开发者能够回答几个实际问题:这段代码什么时候执行?输入和结果是什么?它为什么变慢或失败?出现问题时,是否能把一次请求串回完整的调用路径?...

别试图一次学完 Kubernetes:用一条可运行的路径建立全局认知

来源: cncf.io 20
Kubernetes 难学,往往不是因为每个概念都特别复杂,而是因为它把容器、网络、存储、调度、发布和可观测性放进了同一个系统。面对几十种资源类型和大量命令,最有效的起点不是背完整词汇表,而是先沿着一次真实的应用交付流程,建立一条能运行、能观察、能排错的主线。 可以把第一阶段的学习范围压缩成四个问题: 应用镜像如何运行成 Pod? Pod 如何被稳定地...