标签

Kubernetes

Airbnb 如何用 Sitar-agent 给 Kubernetes Pod 动态下发配置

来源: infoq.com 52
Airbnb 披露了 Sitar-agent 的架构:它是运行在 Kubernetes 服务旁边的 sidecar,用来把动态配置稳定地下发到数以万计的 Pod。这个系统每分钟要处理多次配置更新,核心挑战不是“能不能推送配置”,而是当规模、启动风暴、网络抖动和存储故障同时出现时,应用还能不能拿到可用配置。 这次重构的几个关键词很明确:Java 重写、用...

etcd 3.7:RangeStream、v3store 启动与升级时真正要检查的事

来源: kubernetes.io 48
etcd v3.7.0 是一个不小的 minor release。它解决了大范围查询一次性缓冲带来的延迟和内存问题,引入 RangeStream;继续压低 Kubernetes 控制平面的 CPU 开销;同时把启动链路从遗留 v2store 中抽离出来,并完成 protobuf 依赖的大规模更新。对只运行官方镜像的团队来说,这更像一次需要认真读升级说明...

ingress-nginx 退场倒计时下,如何评估 F5 NGINX Ingress Controller 5.3.0

来源: my.oschina.net 38
F5 NGINX Ingress Controller 5.3.0 的发布赶上了一个很现实的时间点:Kubernetes 社区已经宣布,社区维护的 ingress-nginx 项目将在 2026 年 3 月停用。对很多集群来说,Ingress 不是边缘组件,而是生产流量进入服务的第一道门。现在需要做的不是临时换个镜像,而是重新盘点 ingress 策略...

kpt 回到视野:用包的方式管理 Kubernetes 配置

来源: cncf.io 46
kpt 的定位很明确:它不是另一个只会 的包装器,而是一套以“包”为中心的基础设施自动化工具链。它面向 Kubernetes 平台和 KRM,也就是 Kubernetes Resource Model 驱动的配置,把配置编写、自动化处理和交付流程放进同一个工作流里。 对于已经在用 YAML、Kustomize、GitOps 或平台工程流水线的团队来说,...

PostgreSQL 16.8 Checkpointer 卡死:一次由 fsync 队列触发的生产事故

来源: postgr.es 47
一次 PostgreSQL 16.8 生产库事故,最初看起来像内存问题:日志里出现了 。直觉上,很多人会先怀疑物理内存不足,或者某处发生了内存损坏。但真正的根因更隐蔽:checkpointer 进程遇到了一个已知缺陷,被困在 fsync 请求队列的无限重试循环里。 这类问题危险的地方在于,它不会立刻把数据库打挂,而是让 checkpoint 长时间无法...

Kubernetes DRA GA:GPU 不再只是一个整数资源

来源: cncf.io 44
Kubernetes v1.35 中,Dynamic Resource Allocation(DRA)进入 GA。这个变化的意义不只是“又多了一个 API”,而是 Kubernetes 开始用更细粒度的方式描述和分配设备资源:GPU、网卡、加速卡、带拓扑约束的硬件,都可以从简单的 走向“我要哪类设备、带什么属性、如何绑定给 Pod”。 同时,NVIDI...

Higress 进入 CNCF Sandbox 后,v2.2.3 把重点放在 AI Gateway 与 Gateway API

来源: my.oschina.net 42
Higress 最近发布 v2.2.3,同时项目迈入 CNCF Sandbox。这个节点值得关注:它不只是一次版本号更新,主仓库有 48 项更新,Higress Console 有 8 项更新,方向也很明确——继续扩展 AI Gateway 能力,并增强对 Kubernetes Gateway API 的兼容。 对正在把大模型能力接入生产流量的团队来说...

etcd-operator 进入 Cozystack:v1alpha2 API 值得怎么用

来源: cncf.io 34
etcd-operator 项目已经捐赠给 Cozystack,同时发布了一个从零实现的新版本,并引入新的 API。对 Kubernetes 平台团队来说,这件事的重点不只是“项目换了归属”,而是 etcd 集群的声明式生命周期管理有了一个新的演进起点。 etcd 是 Kubernetes 控制面的关键依赖,也常被业务系统用作强一致元数据存储。它的部署...

Flipkart 用 LitmusChaos 给 Kubernetes 做混沌工程:大规模电商的可靠性实战

来源: cncf.io 45
印度最大电商平台 Flipkart 刚拿下 CNCF 终端用户案例研究大赛的奖项,核心看点只有一个:把 LitmusChaos 深度嵌入 Kubernetes 原生架构,在生产环境系统性注入故障,用可控的混乱换取真实的可靠性。这对任何跑在 K8s 上的业务都有直接参考价值。 大规模电商的流量峰值极端——大促期间秒级请求量可以翻几十倍。传统做法是压测 +...