来源: cncf.io
42
传统 APM 擅长回答“接口为什么慢”“哪个服务报错”,却很难解释另一类生产问题:为什么 Agent 对同一个问题调用了三次模型、为什么一次任务的成本突然翻倍、又为什么它在几个工具之间来回循环。Agent 的故障往往不是单点异常,而是一条仍然返回成功状态的错误决策链。 要理解这类系统,仅记录延迟和 HTTP 状态码还不够。团队需要把一次 Agent 运...
来源: cncf.io
46
统一的 在 PyPI 上正式突破 100 万次下载。这个数字不只代表社区关注度,也说明开发者正在接受一种更集中的 Kubeflow 使用方式:用统一入口承载常见能力,减少在多个独立包、不同导入路径和重复配置之间切换的成本。 由于来源摘要没有列出具体 API,下面不会假定尚未明确的类名或方法。实践部分从安装验证、依赖审计和渐进迁移入手,并把示例性封装明确...
来源: cncf.io
51
Open Source Technology Improvement Fund(OSTIF)公布了 Cortex 安全审计的完成情况,审计工作由 Quarkslab 参与实施。Cortex 为 Prometheus 和 OpenTelemetry 提供长期、可扩展的多租户开源存储,因此它不仅承载监控数据,还承担租户隔离、身份传递、对象存储访问和内部服务...
来源: cncf.io
57
在事件驱动系统里,CPU 和内存并不总能反映真实压力。一个消费者 Pod 可能只占用很少的 CPU,但 Amazon SQS 中已经堆积了数千条消息。此时如果只依赖 Kubernetes HPA 的资源指标,扩容往往发生得太晚。 KEDA 可以把 SQS 队列深度转换成 Kubernetes 扩缩容信号,让 Worker 副本数跟随待处理消息数量变化。...
来源: cncf.io
39
Kyverno、OPA Gatekeeper 和 Sigstore Policy Controller 等工具通常在 Kubernetes API 层拦截 Pod 创建,并检查镜像签名与证明材料。这道准入关卡很重要,但它验证的是控制面当时看到的声明。Node Resource Interface(NRI)把策略执行点推进到节点和容器运行时附近,使验证器...
来源: cncf.io
52
Scale-to-zero 的目标很直接:没有业务流量时不运行 Pod,从而减少空闲资源消耗。但在真实集群里,负载均衡器、外部 uptime monitor 或平台探测器仍会定期请求 、 等端点。对支持按请求激活工作负载的系统来说,这些探测流量和普通业务请求没有区别,于是刚缩到零的服务又被唤醒。 KubeElasti 的 针对的正是这类流量:在请求真正...
来源: cncf.io
38
Lima v2.1 已经扩展到 macOS 和 FreeBSD 来宾系统,v2.2 又补上了 Windows。现在,Linux、macOS、FreeBSD 和 Windows 虚拟机可以进入同一套 工作流。与此同时,TPM 2.0 模拟为需要可信平台模块的 Windows 安装、测试和自动化场景补上了关键能力。 过去,开发团队经常为不同来宾系统维护不同...
来源: cncf.io
47
CoHDI 已正式成为 CNCF Sandbox 项目。这个里程碑不仅意味着项目进入云原生社区的公开治理与孵化轨道,也指向一个更具体的问题:当计算、内存、加速器和网络资源不再固定封装在同一台服务器里,Kubernetes 应该如何发现、组合并调度这些资源? 传统 Kubernetes 调度以节点为中心。Pod 声明 CPU、内存等需求,调度器寻找一台满...
来源: cncf.io
53
2025 年 6 月,首届 KubeCon + CloudNativeCon Japan 在东京举行。此后,日本的云原生技能学习明显升温,相关培训与考试活动出现约 250% 的增长。这不只是 Kubernetes 社区规模扩大的信号,也反映出 AI 产业正在重新定义基础设施人才:企业需要的不再只是会调用模型 API 的开发者,还需要能够部署、扩缩容、监...
来源: cncf.io
39
KubeCon + CloudNativeCon Japan 2026 释放出的 Kubeflow 动向,重点不只是增加功能,而是推动项目向 CNCF Graduation 迈进。这意味着社区正在把注意力放到更严格的生产要求上:稳定治理、可维护组件、可观测运行方式,以及能够被团队长期采用的机器学习平台工程实践。 CNCF Graduation 不是简单...