标签

云原生

Amazon EKS 支持升级后 7 天内回滚 Kubernetes 版本

来源: infoq.com 57
Amazon EKS 新增了 Kubernetes 版本回滚能力:集群控制平面升级后,如果出现兼容性或稳定性问题,团队可以在 7 天内退回升级前的 Kubernetes 版本。这项能力降低了原地升级的恢复成本,但它不是跳过测试、备份和工作负载验证的理由。 过去,托管 Kubernetes 的控制平面版本升级通常被视为单向操作。应用、准入控制器或平台组件...

Agentic AI 落地不能靠猜:给 AI Agent 加上可执行的安全护栏

来源: docker.com 51
AI Agent 不只是生成文本,它还可能读取内部数据、调用 API、修改配置,甚至代表用户执行操作。随着企业开始把 Agent 放进真实业务流程,核心问题也从“模型能不能完成任务”变成了“它在什么边界内可以行动”。 Docker 汇集企业安全负责人讨论这一问题时,结论指向一个实际矛盾:企业需要治理 Agent,但治理不能变成开发者每次调用模型都要填写...

从发布首日发现漏洞:用 Percona MongoDB 工具内置 SBOM 扫描 CVE

来源: percona.com 61
从 PBM 2.15.0 和 PCSM 0.9.0 开始,二进制压缩包、RPM、DEB 和 Docker 镜像等发布制品都会附带 CycloneDX 1.6 JSON 格式的软件物料清单(SBOM)。这意味着团队不必等到软件部署后再猜测其中包含哪些依赖,可以在下载、构建或准入阶段立即扫描已知 CVE。 传统漏洞扫描通常直接检查文件系统、软件包数据库或容...

从 Kubernetes 工程师到 kgateway 贡献者:一次 LFX 导师项目的工程化路径

来源: cncf.io 60
开源经历可以持续多年,但进入一个新的云原生项目仍然需要重新学习:代码如何组织、控制器如何协调资源、测试如何运行,以及维护者如何判断一次修改是否可以合并。围绕 kgateway 展开的 LFX Mentorship 经历,值得关注的不只是“完成了多少代码”,而是如何把 Kubernetes 经验转化为稳定、可审查的上游贡献。 云原生项目通常横跨 Kube...

OpenTelemetry 已从 CNCF 毕业,团队接下来该做什么?

来源: cncf.io 46
OpenTelemetry(OTel)正式成为 CNCF 毕业项目,与 Kubernetes、Prometheus 等成熟开源项目处于同一项目阶段。对开发团队而言,这不只是一个社区里程碑,也意味着一个更实际的问题:既然遥测标准已经趋于成熟,我们是否应该把分散的日志、指标和追踪接入方式收拢到 OpenTelemetry? 答案通常不是“立刻替换全部监控系...

CNCF 日本社区成立 AI Infra SIG:把 AI Agent 基础设施问题带进云原生协作

来源: cncf.io 53
AI 应用正在从单轮生成式调用走向能够规划、调用工具并持续执行任务的 Agent。工作负载随之发生变化:推理请求持续时间更长,GPU 等加速资源更紧张,模型服务需要弹性伸缩,任务还可能跨越多个服务和集群。CNCF 日本社区成立 AI Infra SIG,并通过首次 meetup 和讲者招募启动交流,正是为了把这些问题放到 Kubernetes 与 Cl...

用协作式时间切片填平 RL 流水线的 GPU 空窗

来源: cloud.google.com 60
大模型强化学习后训练并不总是缺 GPU,很多时候真正的问题是 GPU 已经分配,却在等待下一阶段。同步 RL 在 rollout 采样与梯度训练之间严格交替;异步 RL 虽然允许两者重叠,训练器仍可能因新鲜轨迹不足而停顿。llm-d 引入的协作式时间切片把这些阶段变成可调度单元,让多个独立 RL 作业共享同一组物理加速器。 初步基准显示,这种平台级复用...

十周贡献者计划如何帮助 OpenTelemetry 从依赖管理走向长期治理

来源: cncf.io 57
OpenTelemetry 已经成为云原生可观测性体系中的关键公共依赖,但“广泛使用”并不自动等于“可持续维护”。2026 年 4 月,CNCF、OpenTelemetry 项目与 Bloomberg 开源项目办公室共同推动了一项为期十周的贡献者 cohort。它延续了一个重要转变:企业不能只管理自己引入了哪些开源依赖,还需要思考如何参与这些依赖的长期...

Kubeflow 任务正常,GPU 却闲置 60%:从 NCCL 到 Cilium 的排障路径

来源: cncf.io 54
分布式训练最难排查的故障,往往不是 Pod 崩溃,而是所有组件看起来都正常:Kubeflow 任务处于 Running,Pod 没有重启,也没有 OOMKill,但 GPU 大部分时间没有计算。来源摘要描述的正是这种反直觉现象:训练任务健康运行,GPU 却有约 60% 的时间处于空闲状态。 这类问题不能只看 Kubernetes 控制面。分布式训练依赖...

开放社区正在把 Kubernetes 变成 AI 的通用运行底座

来源: cncf.io 38
AI 基础设施正在从少数团队维护的专用平台,转向由开放社区共同定义的通用运行环境。CNCF 2025 年度云原生调查显示,82% 的容器用户已经在生产环境运行 Kubernetes;在托管生成式 AI 的组织中,66% 使用 Kubernetes。对工程团队而言,这意味着模型服务、GPU 调度、扩缩容和可观测性正逐渐进入同一套云原生控制面。 把 Kub...