2026-08-28
来源: cncf.io
38
Kubernetes 已经为平台团队提供了一套统一的容器部署、扩缩容和运维方式。现在,越来越多团队又被要求把 AI 工作负载放进同一套平台。问题在于:能稳定运行 Web 服务的 Kubernetes 集群,并不一定已经具备运行训练、推理和 GPU 密集型任务的条件。 AI 转型不只是给现有 Deployment 加一块 GPU。平台团队还需要重新审视资...
2026-08-28
来源: kubernetes.io
35
Kubernetes v1.37 将资源指标 API 正式提升为稳定版本:。这意味着节点与 Pod 的 CPU、内存使用量查询接口获得了稳定 API 的兼容性承诺。对日常使用 、依赖资源指标的自动扩缩容,以及直接调用聚合 API 的平台团队而言,重点不在于理解一套新指标,而在于完成一次明确的 API 版本迁移。 需要特别澄清的是:这次升级没有改变指标的...
2026-08-27
来源: cncf.io
42
AI 工厂不只是一个模型,也不只是一个 Kubernetes 集群。它更像一条共享生产线:一组 GPU 同时被多个团队使用,有人进行微调,有人提供在线推理,有人运行评测,还有人提交临时实验。真正的难点不在于把一个 Pod 调度到 GPU 节点,而在于让这组昂贵资源能够被隔离、排队、观测和持续交付。 Kubernetes 提供了统一的资源编排基础,但 G...
2026-08-27
来源: istio.io
37
Istio 发布的 同时涉及捆绑的 Envoy 代理、Istiod 控制面以及 。问题覆盖 HTTP/2、HTTP/3、QUIC、、RBAC、路径匹配和管理端统计页面等组件,最高 CVSS 评分为 7.7。运行 Istio 至 或 至 的集群,应把升级作为优先安全维护事项。 本次公告列出了 14 个 Envoy 相关 CVE,风险类型包括: HTTP/...
2026-08-27
来源: istio.io
28
Istio 1.30.4 是从 1.30.3 升级而来的安全修订版本。它集中修复了 Envoy 中多项 HTTP/2、HTTP/3、RBAC、 与响应处理漏洞,同时补上 Istio 控制面、注入模板、JWKS 拉取和多集群同步中的安全与稳定性问题。对于运行公网入口、跨集群流量、Gateway API 或细粒度授权策略的团队,这不是适合长期搁置的补丁版本...
2026-08-27
来源: istio.io
30
Istio 1.29.7 是一次以安全修复为核心的补丁版本,主要针对 Envoy、istiod、istio-cni、Gateway API 和 ambient mode 做了加固与稳定性修复。对于运行生产集群的团队,这次升级不应只理解为替换镜像,还需要同步检查节点 nftables、Webhook 就绪状态、JWKS 拉取策略以及 XDS 访问控制。 ...
2026-08-26
来源: cloud.google.com
44
企业开始把大量 AI 智能体接入业务系统,基础设施面对的已不只是推理流量增长。智能体会持续调用模型、数据库和内部应用,负载既消耗 GPU、TPU 等稀缺资源,又具有明显的突发性。若仍把应用绑定到单一机型、单一区域或整块加速卡,结果通常是两个极端:高峰期申请不到容量,低谷期则有大量资源闲置。 动态容量管理的核心不是无限扩容,而是把需求分成可预测与不可预测...
2026-08-26
来源: cloud.google.com
32
AI Agent 开始承担持续运行、批量执行和多步骤协作的任务后,企业面对的成本问题已经不同于传统的软件订阅。业务用户可能每天稳定使用生产力工具,开发团队却可能在发布前集中运行大量代码 Agent,后台 Agent 还会在夜间持续消耗模型推理资源。只按“每个用户多少钱”来管理,往往看不见真实的运行成本,也很难在创新和预算之间取得平衡。 面向 Gemin...
2026-08-26
来源: kubernetes.io
24
Kubernetes v1.37 代号 Garhwal,包含 67 项增强:16 项进入 Stable、23 项进入 Beta、27 项进入 Alpha,另有 1 项弃用或移除。相比单纯增加 API,这一版本更值得关注的是几条清晰的工程主线:控制面在大规模集群中更能承受启动和恢复压力,HPA 可以按外部需求缩容到零,工作负载感知调度开始服务 AI/HP...
2026-08-25
来源: cncf.io
20
Kubernetes 难学,往往不是因为每个概念都特别复杂,而是因为它把容器、网络、存储、调度、发布和可观测性放进了同一个系统。面对几十种资源类型和大量命令,最有效的起点不是背完整词汇表,而是先沿着一次真实的应用交付流程,建立一条能运行、能观察、能排错的主线。 可以把第一阶段的学习范围压缩成四个问题: 应用镜像如何运行成 Pod? Pod 如何被稳定地...