标签

Kubernetes

Kubernetes v1.37 工作负载感知调度:从 Pod 逐个排队到分层 Gang Scheduling

来源: kubernetes.io 41
AI 训练、分布式推理和复杂批处理任务很难用“每个 Pod 独立调度”的模型表达。一个包含 8 个 worker 和 1 个 driver 的训练任务,即使先启动了 3 个 worker,通常也无法产生有效进展,反而会长期占用 GPU、网络和 DRA 资源。 Kubernetes v1.37 继续推进 Workload-Aware Scheduling...

让 kubectl 接入企业身份源:为什么应该使用 Public Client

来源: cncf.io 39
网络、存储和监控经常出现在 Kubernetes 集群的 day-zero 清单里,身份接入却容易被拖到上线之后。托管 Kubernetes 通常已经连接云 IAM 或企业 SSO,而自建集群如果继续依赖共享 kubeconfig、长期客户端证书或静态 Token,不仅离职回收困难,审计也很难回答“谁在什么时间操作了集群”。 通过 OIDC 把 Kub...

从默认放行到零信任:用 Kubernetes NetworkPolicy 隔离三层应用

来源: postgr.es 21
Kubernetes 集群中的 Pod 通常可以彼此通信。部署了 Frontend、Backend 和 Database,并不意味着三层之间天然存在网络边界。要实现零信任,需要先把命名空间切换为默认拒绝,再基于标签、端口和方向逐条开放业务真正需要的链路。 NetworkPolicy 是标准 Kubernetes API,但 API 对象本身不会拦截数据...

Kubernetes v1.37:KubeletInUserNamespace Beta 化,Rootless 节点走向生产

来源: kubernetes.io 47
Kubernetes v1.37 将 特性门控提升到 Beta,并默认开启。这个变化不会自动把现有集群变成 rootless 集群,但它标志着 Kubernetes 节点组件以非 root 用户运行的方案已经从长期实验阶段进入更稳定的使用阶段。 Rootless 模式的核心目标很明确:即使 kubelet、CRI、OCI runtime、CNI 插件或...

TPU 上的 LLM 推理为何会撞墙:Gemma 3 分类与生成负载实测解析

来源: cloud.google.com 39
把大语言模型从实验环境搬到生产系统后,模型参数量并不能单独决定吞吐和成本。同一套 TPU、同一个服务框架,面对“长输入、短输出”的分类请求和“短输入、长输出”的生成请求,可能呈现完全不同的扩展曲线。 这组测试在 Google Cloud TPU v6e 上运行 Gemma 3 12B 与 27B,使用 GKE Autopilot、单主机 2×2 TPU...

AI 让 Kubernetes 再次令人畏惧:复杂的不是容器,而是工作负载

来源: cncf.io 49
Kubernetes 已经不是新技术。它的核心对象、调度机制和运维模式相当成熟,也逐渐成为生产软件与 AI 工作负载的重要基础设施。但对许多团队来说,引入 Kubernetes 仍像一次高风险迁移;当 GPU、模型文件、推理延迟和成本控制叠加进来,这种压力会进一步放大。 真正需要回答的问题不是“AI 项目要不要上 Kubernetes”,而是“哪些运行...

Kubernetes 1.37 DRA:用原生资源请求平滑接管 GPU、网卡与拓扑设备

来源: kubernetes.io 41
Kubernetes 1.37 中,动态资源分配(Dynamic Resource Allocation,DRA)已经不再只是 ResourceClaim 的新接口。DRA Extended Resource 支持进入 GA 后,现有工作负载仍可通过 这类传统扩展资源申请设备,而集群底层可以改由 DRA 驱动完成发现、筛选和分配。这给生产集群提供了一条...

零停机迁移:把关键 Kubernetes 工作负载移出 default 命名空间

来源: cncf.io 42
很多集群里都存在这样的历史遗留:一个关键 Deployment 长期运行在 命名空间。直接修改 YAML 中的 并不能完成迁移,因为命名空间属于 Kubernetes 对象身份的一部分;所谓“迁移”,本质上是在目标命名空间重建资源、切换流量,再删除旧资源。 要做到业务无中断,核心不是某条神奇的 命令,而是让新旧两套实例并行运行,并把部署、依赖和流量切换...

Google Cloud 的智能体时代底座:从 AI 全栈协同到动态基础设施与数字主权

来源: cloud.google.com 23
Google 表示,Gartner 已连续第九年将其列入战略云平台服务魔力象限的领导者,并在“愿景完整性”维度上处于最远位置。比排名更值得工程团队关注的,是 Google Cloud 对下一阶段云基础设施的判断:企业需要把模型、智能体、应用、数据和算力放进同一个可调度、可治理的平台,同时控制性能、成本与合规边界。 这套思路可以归纳为三个设计原则:软硬件...

Kubernetes v1.37:让 HPA 真正把工作负载缩容到零

来源: kubernetes.io 29
Kubernetes v1.37 将 HPA 缩容到零副本推进到 Beta,并默认启用。对于队列消费者、批处理器这类并非持续接收 HTTP 请求的工作负载,空闲时可以不保留任何 Pod,有任务到来时再自动拉起。 这项能力减少了空闲资源消耗,尤其适合预留专用 CPU 或 GPU 的 Pod。但它也带来明确代价:从零恢复需要重新读取指标、调度 Pod、启动...