来源: aws.amazon.com
29
Amazon SageMaker Python SDK v3 重新设计了 script mode:训练和部署流程分别围绕统一的 与 组织,而 可以在任务运行时把本地代码同步进指定容器。对于已有自定义训练脚本、又不想每次改一行代码就重新构建 Docker 镜像的团队,这会明显缩短迭代回路。 传统的 bring-your-own-container 流程,...
来源: cloud.google.com
46
企业开始把大量 AI 智能体接入业务系统,基础设施面对的已不只是推理流量增长。智能体会持续调用模型、数据库和内部应用,负载既消耗 GPU、TPU 等稀缺资源,又具有明显的突发性。若仍把应用绑定到单一机型、单一区域或整块加速卡,结果通常是两个极端:高峰期申请不到容量,低谷期则有大量资源闲置。 动态容量管理的核心不是无限扩容,而是把需求分成可预测与不可预测...
来源: cloud.google.com
34
AI Agent 开始承担持续运行、批量执行和多步骤协作的任务后,企业面对的成本问题已经不同于传统的软件订阅。业务用户可能每天稳定使用生产力工具,开发团队却可能在发布前集中运行大量代码 Agent,后台 Agent 还会在夜间持续消耗模型推理资源。只按“每个用户多少钱”来管理,往往看不见真实的运行成本,也很难在创新和预算之间取得平衡。 面向 Gemin...
来源: cncf.io
35
项目治理很容易走向两个极端:小团队过早建立复杂委员会,或者项目已经拥有大量维护者和用户,却仍依赖少数创始人的口头决定。对 72 个 CNCF 项目的治理审查显示,更可靠的做法是区分两类问题:当前成熟度需要满足什么,以及为了长期健康还应该提前建设什么。 CNCF 成熟度评估关注项目在相应阶段是否具备必要的治理能力,但最低要求并不等同于理想终点。一个项目通...
来源: postgr.es
28
DocumentDB 把 BSON 类型、文档 CRUD API 和 MongoDB Wire Protocol 网关带进了 PostgreSQL。对应用侧而言,、PyMongo 和 Node.js MongoDB Driver 仍然是在连接 MongoDB;对基础设施侧而言,底层实际运行的是 PostgreSQL。这套能力也是 Azure Docum...
来源: kubernetes.io
25
Kubernetes v1.37 代号 Garhwal,包含 67 项增强:16 项进入 Stable、23 项进入 Beta、27 项进入 Alpha,另有 1 项弃用或移除。相比单纯增加 API,这一版本更值得关注的是几条清晰的工程主线:控制面在大规模集群中更能承受启动和恢复压力,HPA 可以按外部需求缩容到零,工作负载感知调度开始服务 AI/HP...
来源: docker.com
31
Minimus registry 将于 10 月 22 日下线。对仍在 CI、Kubernetes 清单或基础镜像中引用 Minimus 镜像的团队而言,这不是一次可以延后的镜像整理,而是一次供应链依赖迁移:下线后,新的构建、部署扩容和灾难恢复都可能因拉取镜像失败而中断。 Docker 给出的替代方向是 Docker Hardened Images(D...
来源: cloud.google.com
44
强化学习和后训练工作流正在大量采用 Ray:训练器、推理引擎、rollout worker、数据管道和评估任务可以由同一个分布式运行时统一调度。但随着 agentic workflow 变得更复杂,模型生成的代码、工具调用和多轮交互也带来了新的问题:如何在不暴露宿主机的前提下,大规模、低延迟地执行不可信代码? Google 与 Anyscale 正在推...
来源: cncf.io
40
开发者被要求把越来越多的问题“左移”:更早发现、更早验证、更早修复。现在,可观测性也开始进入开发阶段。它不只是线上平台团队的工作,而是代码作者在提交代码时就应该留下的诊断入口。 这里的重点不是给每个函数都加日志,而是让开发者能够回答几个实际问题:这段代码什么时候执行?输入和结果是什么?它为什么变慢或失败?出现问题时,是否能把一次请求串回完整的调用路径?...
来源: cncf.io
20
Kubernetes 难学,往往不是因为每个概念都特别复杂,而是因为它把容器、网络、存储、调度、发布和可观测性放进了同一个系统。面对几十种资源类型和大量命令,最有效的起点不是背完整词汇表,而是先沿着一次真实的应用交付流程,建立一条能运行、能观察、能排错的主线。 可以把第一阶段的学习范围压缩成四个问题: 应用镜像如何运行成 Pod? Pod 如何被稳定地...