标签

Kubernetes

Inspektor Gadget 首次安全审计:eBPF 可观测性工具的信任基石

来源: cncf.io 31
eBPF 正在重塑 Kubernetes 可观测性的底层逻辑——内核级钩子、零侵入采集、近乎无开销的运行时洞察。Inspektor Gadget 正是这一浪潮中的代表项目:它把数十种 eBPF 小工具打包成 Kubernetes 原生资源,一条命令就能追踪网络包、监控文件访问、抓取进程执行事件。但 eBPF 工具本身跑在内核态,权限极高,如果实现有漏洞...

当 tmpfs 遇上硬亲和力:Spark 在 Kubernetes 上的 OOM 连环杀

来源: infoq.com 32
把 Spark 作业从传统集群搬上 Kubernetes,看起来只是换了个运行环境——实际上底层资源模型的差异远比想象中大。Pranav Bhasker 在将 Spark 管道迁移到 Azure Kubernetes Service(AKS)后,遇到了一种标准诊断手段几乎无法捕捉的 OOM 故障:作业反复被杀,日志里没有明显的内存溢出线索,Spark ...

Kubernetes Dashboard 已归档,Headlamp 接棒——迁移思路与上手实战

来源: kubernetes.io 49
Kubernetes Dashboard 正式归档了。对很多人来说,它是第一个让集群"看得见、摸得着"的工具,帮无数开发者和运维从 的纯命令世界迈出了第一步。Dashboard 的贡献值得尊重,但单集群、功能固定、扩展性有限的架构,已经跟不上今天多集群、多团队的实际用法。Headlamp 不是简单换了个名字的替代品——它在保留 Dashboard 熟悉...

云原生 Swift 服务的动态配置实践

来源: cncf.io 31
Swift 已经不再只是 iOS 开发者的专属语言。随着 Swift 在服务端的成熟,越来越多的团队把 Swift 服务部署到 Kubernetes 上,和 Java、Go 服务共享同一套云原生基础设施——ConfigMaps、声明式部署、Prometheus 监控、OpenTelemetry 可观测性。但 Swift 服务要真正融入这套体系,第一步就...

用 AI 辅助迁移,30 分钟把 ingress-nginx 配置搬到 Higress

来源: infoq.com 34
Kubernetes 网关基础设施的迁移历来是体力活——逐条比对 Ingress 资源、手动转换注解、反复测试路由是否生效。CNCF 最近分享了一个案例:工程师借助 AI 辅助迁移工具,将 60 条 ingress-nginx 资源迁移到 Higress,全程仅用了大约 30 分钟。这不是噱头,而是 AI 在云原生基础设施现代化中的一次真实落地。 in...

用 Kubernetes 与 GitOps 搭建云原生内部开发者平台:从集群到软件供应链的安全闭环

来源: cncf.io 50
现代软件交付的瓶颈早已不在应用代码本身——它卡在跑代码的平台上。团队写好了服务,却要花大量时间处理集群配置、权限审批、镜像签名、环境漂移。内部开发者平台(Internal Developer Platform,IDP)的目标就是把这些摩擦抹掉:开发者声明"我要一个生产环境的前端服务",平台自动完成从集群分配到镜像构建到安全校验到部署的全链路。 下面拆解...

Kubernetes 的集成税:当 Prometheus 搭不上 Cilium 的指标列车

来源: cncf.io 39
凌晨两点,Grafana 面板一片空白——不是服务挂了,不是网络断了,Hubble 的 DNS 可视化和 TCP 流量追踪一切正常。唯独 Cilium 的网络指标在 Prometheus 里消失了。这不是 bug,是集成出了问题。 这类"明明组件都在跑,数据就是串不起来"的场景,在 Kubernetes 生产环境中反复上演。每引入一个新组件,你以为获得...

用 KEDA 外部扩展器实现 Kubernetes GPU 自动伸缩

来源: cncf.io 47
跑 GPU 工作负载的开发者迟早会撞上同一堵墙:Kubernetes 默认的 HPA 只看 CPU 和内存,而你的瓶颈在 GPU。vLLM 推理服务排队不是因为 CPU 满了,而是显存吃紧、SM 占用率拉满;Triton 模型服务在 GPU 利用率 90% 时还在被 HPA 判定为"负载正常"。训练任务更离谱——一个 job 占满整张卡,HPA 对此毫...

Kubernetes 三个「不修」的 CVE 记录即将更正:你的扫描器可能突然报警

来源: kubernetes.io 44
Kubernetes 安全响应委员会(SRC)发现,几个已公开多年的 CVE 记录存在一个关键错误——它们标注了"已修复版本",但实际漏洞从未被修补。2026 年 6 月 1 日,这些记录将被更正为"所有版本受影响"。这意味着你的漏洞扫描器可能在原本"安全"的集群上突然报出新的告警。本文拆解三个未修复 CVE 的技术机理,并给出可立即执行的缓解配置。 ...

Koordinator v1.8:作业排队、资源预占与调度协同三箭齐发

来源: oschina.net 39
Kubernetes 集群跑久了,总会撞上几堵墙:高优先级作业排队没章法、低优先级 Pod 占着资源不放、调度器和重调度器各自为政。Koordinator v1.8.0 针对这三个痛点同时出手——新增 Koord-Queue 作业排队系统、强化 Reservation 预占能力、引入 Scheduling Hint 调度协同协议,还把异构设备支持拓展到...