标签

CNCF

零停机迁移:把关键 Kubernetes 工作负载移出 default 命名空间

来源: cncf.io 42
很多集群里都存在这样的历史遗留:一个关键 Deployment 长期运行在 命名空间。直接修改 YAML 中的 并不能完成迁移,因为命名空间属于 Kubernetes 对象身份的一部分;所谓“迁移”,本质上是在目标命名空间重建资源、切换流量,再删除旧资源。 要做到业务无中断,核心不是某条神奇的 命令,而是让新旧两套实例并行运行,并把部署、依赖和流量切换...

Metal3 遇上 KubeVirtBMC:把 KubeVirt 虚拟机当作裸金属来部署

来源: cncf.io 47
上一篇内容介绍了 KubeVirtBMC:它为 KubeVirt 虚拟机提供虚拟 BMC 端点,并通过原始 IPMI 和 Redfish 命令验证了这些端点。真正有价值的地方在于,BMC 不必只服务于人工运维,也可以接入 Metal3,让 Metal3 按照管理裸金属服务器的方式管理 KubeVirt 虚拟机。 这意味着开发者可以在 Kubernete...

平台工程成熟度:从工具链走向真正的自助服务

来源: cncf.io 43
平台工程的讨论,往往很快分成两个房间:一个房间里的团队还没有平台,依赖零散脚本、口口相传的经验,以及每个团队各自重复建设的流程;另一个房间已经搭建了工具链,却发现开发者仍然需要找平台团队开工单。真正的成熟,不是工具越多越好,而是平台能否把常见交付路径变成清晰、可发现、可重复的自助服务。 没有平台时,团队通常会自行维护部署脚本、云资源配置、监控接入和权限...

OpenTelemetry 正式毕业之后,团队下一步该做什么?

来源: cncf.io 37
OpenTelemetry(OTel)正式成为 CNCF 毕业项目,和 Kubernetes、Prometheus 等成熟开源项目站在了同一行列。这不是“所有团队明天都必须迁移”的信号,而是一个更清晰的判断依据:OTel 的标准、生态和治理已经足够成熟,值得被纳入长期可观测性规划。 真正的问题因此从“要不要关注 OTel”变成了“如何把它落到现有服务、...

Kubernetes 可观测性:别只收集指标,要还原一次请求发生了什么

来源: cncf.io 29
Kubernetes 让基础设施更容易编排、扩缩容和自愈,却也改变了故障的形态:Pod 会漂移,副本会频繁替换,服务依赖持续增长,一次用户请求可能依次穿过 Ingress、多个 Service、消息队列、存储系统和后台任务。此时,单张 CPU 曲线只能告诉你“某处变忙了”,无法解释用户为什么超时。 真正有用的可观测性,不是把更多数据塞进仪表盘,而是把指...

别等流量打爆 GPU:Kubernetes 预测式自动扩缩容实践

来源: cncf.io 29
GPU 工作负载的扩容,往往不是把副本数从 2 调到 10 那么简单。节点启动、GPU 资源调度、镜像拉取和模型加载都需要时间。如果等队列已经堆积、GPU 利用率已经飙高,扩容动作可能已经来不及了。 一次生产事故很能说明问题:服务不是逐渐变慢,而是在流量上升后直接崩溃;大量 Pod 处于 Pending,用户错误率达到 15%~20%。这类事故的关键通...

你的 Kubernetes 能跑容器,但已经准备好承载 AI 了吗?

来源: cncf.io 38
Kubernetes 已经为平台团队提供了一套统一的容器部署、扩缩容和运维方式。现在,越来越多团队又被要求把 AI 工作负载放进同一套平台。问题在于:能稳定运行 Web 服务的 Kubernetes 集群,并不一定已经具备运行训练、推理和 GPU 密集型任务的条件。 AI 转型不只是给现有 Deployment 加一块 GPU。平台团队还需要重新审视资...

在 Kubernetes 上搭建 AI 工厂:让 GPU 资源服务多个团队

来源: cncf.io 42
AI 工厂不只是一个模型,也不只是一个 Kubernetes 集群。它更像一条共享生产线:一组 GPU 同时被多个团队使用,有人进行微调,有人提供在线推理,有人运行评测,还有人提交临时实验。真正的难点不在于把一个 Pod 调度到 GPU 节点,而在于让这组昂贵资源能够被隔离、排队、观测和持续交付。 Kubernetes 提供了统一的资源编排基础,但 G...

从 72 个 CNCF 项目复盘中提炼治理结构:按规模和阶段设计,而不是照抄模板

来源: cncf.io 33
项目治理很容易走向两个极端:小团队过早建立复杂委员会,或者项目已经拥有大量维护者和用户,却仍依赖少数创始人的口头决定。对 72 个 CNCF 项目的治理审查显示,更可靠的做法是区分两类问题:当前成熟度需要满足什么,以及为了长期健康还应该提前建设什么。 CNCF 成熟度评估关注项目在相应阶段是否具备必要的治理能力,但最低要求并不等同于理想终点。一个项目通...

懒人也能做到的代码可观测性实践指南

来源: cncf.io 38
开发者被要求把越来越多的问题“左移”:更早发现、更早验证、更早修复。现在,可观测性也开始进入开发阶段。它不只是线上平台团队的工作,而是代码作者在提交代码时就应该留下的诊断入口。 这里的重点不是给每个函数都加日志,而是让开发者能够回答几个实际问题:这段代码什么时候执行?输入和结果是什么?它为什么变慢或失败?出现问题时,是否能把一次请求串回完整的调用路径?...