来源: cncf.io
17
AI 基础设施正在从少数团队维护的专用平台,转向由开放社区共同定义的通用运行环境。CNCF 2025 年度云原生调查显示,82% 的容器用户已经在生产环境运行 Kubernetes;在托管生成式 AI 的组织中,66% 使用 Kubernetes。对工程团队而言,这意味着模型服务、GPU 调度、扩缩容和可观测性正逐渐进入同一套云原生控制面。 把 Kub...
来源: cncf.io
29
CNCF 技术监督委员会(TOC)已投票接纳 Confidential Containers 为孵化项目。这次状态变化的重要性不只在于项目成熟度提升,更在于一个长期存在的云安全缺口正在进入云原生基础设施的主航道:数据落盘时可以加密,网络传输时可以使用 TLS,但数据被工作负载实际处理时,如何避免云平台、宿主机或高权限运维人员直接读取? Confiden...
来源: cncf.io
25
单个 Kubernetes 集群中的数据库高可用已经有成熟做法,但它通常无法覆盖整片区域不可用、控制平面损坏或集群间网络中断。跨集群数据库要解决的不是“多运行几个 Pod”,而是如何划分故障域、复制数据、隔离旧主库,并在异常情况下恢复服务且不产生双主写入。 跨集群架构的起点是让依赖真正独立。两个 Kubernetes 集群如果共享同一个区域、网络出口、...
来源: cncf.io
23
Kyverno 可以在工作负载进入集群前校验、修改或生成 Kubernetes 资源,并直接使用 YAML 表达规则,不需要再引入一门独立的策略语言。真正棘手的问题往往不是把规则写出来,而是让测试环境提供足够真实的生产上下文:命名空间标签、准入请求、调用者身份以及集群内对象都可能改变策略结果。 “让策略引擎以为自己在生产环境”不应理解为伪造一个简单的环...
来源: cncf.io
27
把智能体嵌进产品,只解决了“用户在哪里提问”的问题,并没有解决“智能体依据什么回答”。来源材料提到,一个部署类产品在 Web 应用中上线智能体,并分析了 1,192 次对话。这个场景揭示了一个关键工程事实:当问题涉及产品配置、部署状态和版本差异时,模型的通用知识远远不够,智能体需要在回答前检索产品自己的知识库。 用户不会总按文档标题提问。他们更可能输入...
来源: cncf.io
32
云原生时代的平台工程,最初解决的是 Kubernetes、微服务、GitOps 和分布式架构带来的交付复杂度。随着 AI Agent 进入企业应用,平台面对的对象不再只有容器、数据库和流水线,还包括模型、提示词、工具权限、知识源与运行时策略。平台工程正在从“提供基础设施自助服务”演变为“管理应用、资源和智能体的统一控制面”。 传统内部开发者平台通常围绕...
来源: cncf.io
27
2026 年 7 月 28 日,ArgoCon Japan 将在日本横滨举办一场特别的半日活动,时间为 13:30 至 18:30,并与 KubeCon + CloudNativeCon 同期举行。除了现场接触 Argo 项目维护者,来源标题还把企业实践和 Argo CD 3.5 的演进方向列为重点。对于已经在生产环境使用 GitOps 的团队,这类活...
来源: cncf.io
23
评测大语言模型服务时,最常见的数字是吞吐量:系统每秒处理多少请求,或者每秒生成多少 token。这个指标容易采集,也方便横向比较,但它可能掩盖真正影响用户体验的问题。一个服务即使吞吐量很高,如果大量请求超时、首 token 等待过久,或者在高负载下频繁失败,这些工作对用户并没有实际价值。 因此,生产环境更值得关注的是 goodput(有效吞吐量):在给...
来源: cncf.io
29
2026 年 6 月 18 日至 19 日,KubeCon + CloudNativeCon India 在孟买举行。对 LitmusChaos 而言,这不只是一次常规参会,而是其迄今最重要的活动之一。来源摘要没有展开具体议程和现场成果,但 Flipkart、LitmusChaos 与 KubeCon 同时出现,本身就指向一个值得工程团队关注的趋势:混...
来源: cncf.io
28
托管模型 API 仍然是许多业务的合适选择:接入快、运维负担低,也容易按调用量扩展。自托管并不是要取代它,而是提供另一种部署路径。当团队需要控制模型版本、数据流向、推理配置或基础设施成本时,可以考虑在 Kubernetes 中运行 vLLM,把 GPU 推理服务纳入现有的调度、发布和监控体系。 调用托管 API 时,团队主要管理请求、密钥、配额和业务降...