标签

CNCF

跨集群联邦:让 Kubernetes 区域故障真正做到无停机切换

来源: cncf.io 24
多区域部署最容易制造一种危险的安全感:服务已经在两个 Kubernetes 集群中运行,但其中一个集群消失时,用户流量仍然固执地发往故障区域。副本存在,不等于故障转移已经成立。要让备用集群真正接管请求,必须把工作负载、流量入口、健康判断和数据状态一起纳入设计。 跨集群联邦的核心目标,是把多个独立集群视为同一个服务的运行位置,同时保留故障隔离边界。每个集...

从 Kubernetes 工程师到 kgateway 贡献者:一次 LFX 导师项目的工程化路径

来源: cncf.io 34
开源经历可以持续多年,但进入一个新的云原生项目仍然需要重新学习:代码如何组织、控制器如何协调资源、测试如何运行,以及维护者如何判断一次修改是否可以合并。围绕 kgateway 展开的 LFX Mentorship 经历,值得关注的不只是“完成了多少代码”,而是如何把 Kubernetes 经验转化为稳定、可审查的上游贡献。 云原生项目通常横跨 Kube...

OpenTelemetry 已从 CNCF 毕业,团队接下来该做什么?

来源: cncf.io 21
OpenTelemetry(OTel)正式成为 CNCF 毕业项目,与 Kubernetes、Prometheus 等成熟开源项目处于同一项目阶段。对开发团队而言,这不只是一个社区里程碑,也意味着一个更实际的问题:既然遥测标准已经趋于成熟,我们是否应该把分散的日志、指标和追踪接入方式收拢到 OpenTelemetry? 答案通常不是“立刻替换全部监控系...

CNCF 日本社区成立 AI Infra SIG:把 AI Agent 基础设施问题带进云原生协作

来源: cncf.io 28
AI 应用正在从单轮生成式调用走向能够规划、调用工具并持续执行任务的 Agent。工作负载随之发生变化:推理请求持续时间更长,GPU 等加速资源更紧张,模型服务需要弹性伸缩,任务还可能跨越多个服务和集群。CNCF 日本社区成立 AI Infra SIG,并通过首次 meetup 和讲者招募启动交流,正是为了把这些问题放到 Kubernetes 与 Cl...

十周贡献者计划如何帮助 OpenTelemetry 从依赖管理走向长期治理

来源: cncf.io 35
OpenTelemetry 已经成为云原生可观测性体系中的关键公共依赖,但“广泛使用”并不自动等于“可持续维护”。2026 年 4 月,CNCF、OpenTelemetry 项目与 Bloomberg 开源项目办公室共同推动了一项为期十周的贡献者 cohort。它延续了一个重要转变:企业不能只管理自己引入了哪些开源依赖,还需要思考如何参与这些依赖的长期...

Kubeflow 任务正常,GPU 却闲置 60%:从 NCCL 到 Cilium 的排障路径

来源: cncf.io 33
分布式训练最难排查的故障,往往不是 Pod 崩溃,而是所有组件看起来都正常:Kubeflow 任务处于 Running,Pod 没有重启,也没有 OOMKill,但 GPU 大部分时间没有计算。来源摘要描述的正是这种反直觉现象:训练任务健康运行,GPU 却有约 60% 的时间处于空闲状态。 这类问题不能只看 Kubernetes 控制面。分布式训练依赖...

开放社区正在把 Kubernetes 变成 AI 的通用运行底座

来源: cncf.io 16
AI 基础设施正在从少数团队维护的专用平台,转向由开放社区共同定义的通用运行环境。CNCF 2025 年度云原生调查显示,82% 的容器用户已经在生产环境运行 Kubernetes;在托管生成式 AI 的组织中,66% 使用 Kubernetes。对工程团队而言,这意味着模型服务、GPU 调度、扩缩容和可观测性正逐渐进入同一套云原生控制面。 把 Kub...

Confidential Containers 进入 CNCF 孵化阶段:把云原生数据保护延伸到运行时

来源: cncf.io 28
CNCF 技术监督委员会(TOC)已投票接纳 Confidential Containers 为孵化项目。这次状态变化的重要性不只在于项目成熟度提升,更在于一个长期存在的云安全缺口正在进入云原生基础设施的主航道:数据落盘时可以加密,网络传输时可以使用 TLS,但数据被工作负载实际处理时,如何避免云平台、宿主机或高权限运维人员直接读取? Confiden...

在 Kubernetes 上部署跨集群数据库:从区域故障到安全切换

来源: cncf.io 25
单个 Kubernetes 集群中的数据库高可用已经有成熟做法,但它通常无法覆盖整片区域不可用、控制平面损坏或集群间网络中断。跨集群数据库要解决的不是“多运行几个 Pod”,而是如何划分故障域、复制数据、隔离旧主库,并在异常情况下恢复服务且不产生双主写入。 跨集群架构的起点是让依赖真正独立。两个 Kubernetes 集群如果共享同一个区域、网络出口、...

让 Kyverno“进入生产环境”:用真实准入上下文验证 Kubernetes 策略

来源: cncf.io 22
Kyverno 可以在工作负载进入集群前校验、修改或生成 Kubernetes 资源,并直接使用 YAML 表达规则,不需要再引入一门独立的策略语言。真正棘手的问题往往不是把规则写出来,而是让测试环境提供足够真实的生产上下文:命名空间标签、准入请求、调用者身份以及集群内对象都可能改变策略结果。 “让策略引擎以为自己在生产环境”不应理解为伪造一个简单的环...