标签

CNCF

从“能申请 GPU”到真正可靠:分布式 AI 训练的云原生基础

来源: cncf.io 28
当 AI 训练从单机 GPU 扩展到多个节点时,平台团队面对的问题就不再只是“有没有足够的显卡”。节点之间的网络、数据读取、任务调度、故障恢复、可观测性和资源隔离,都会直接影响训练是否能稳定完成。 因此,给集群装上 GPU 驱动只是起点。真正的 AI-ready 平台,需要把一次分布式训练当成一个完整的云原生工作负载来设计。 单节点训练失败时,排查范围...

Kubernetes 灾难恢复实战:用三个故障场景检验备份是否真的可用

来源: cncf.io 35
备份任务显示成功,只能证明某些数据被写到了某个位置;灾难恢复要求的则是,在明确的时间内,把应用、数据和依赖关系恢复到可服务状态。两者之间隔着完整性、兼容性、恢复顺序和操作权限等一整条链路。 真正有效的 Kubernetes 灾难恢复方案,不应只检查“有没有备份”,而应通过可重复的故障注入回答三个问题:备份产物能否读取,集群对象与持久化数据能否一致恢复,...

多租户 Kubernetes 里的 GPU 到底归谁:从成本归属到安全自助指标

来源: cncf.io 28
GPU 往往是基础设施账单中最醒目的一项,但“集群用了多少 GPU”和“这些 GPU 分别归谁、是否真正被使用”是两类完全不同的问题。在多租户 Kubernetes 环境里,仅有一张全局利用率图表并不能回答成本评审中的关键问题:哪个团队申请了资源、哪个工作负载占用了设备、利用率如何,以及租户是否只能看到自己的数据。 要回答这些问题,需要同时处理指标采集...

从云原生走向 AI 原生:当销售、设计师和工程师都能构建软件

来源: cncf.io 27
“销售在写代码”过去常被当作笑话的铺垫,设计师也往往要等工程师把原型变成产品。生成式 AI 正在改变这条边界:业务人员可以描述需求、生成原型,设计师可以直接验证交互,工程师则把更多精力放到架构、约束和质量上。 这并不意味着专业开发者不再重要,也不是用一个聊天窗口替换 Kubernetes。更准确地说,云原生解决了软件如何可靠地构建、交付和运行;AI 原...

让 kubectl 接入企业身份源:为什么应该使用 Public Client

来源: cncf.io 39
网络、存储和监控经常出现在 Kubernetes 集群的 day-zero 清单里,身份接入却容易被拖到上线之后。托管 Kubernetes 通常已经连接云 IAM 或企业 SSO,而自建集群如果继续依赖共享 kubeconfig、长期客户端证书或静态 Token,不仅离职回收困难,审计也很难回答“谁在什么时间操作了集群”。 通过 OIDC 把 Kub...

不改 GitHub Actions 工作流,用分布式追踪看清排队、慢任务与不稳定构建

来源: cncf.io 29
GitHub Actions 在组织里铺开后,账单通常比可观测性增长得更快。团队能看到某次构建失败,却很难立即回答:时间消耗在排队还是执行?哪个 job 长期拖慢流水线?失败后重跑成功的概率有多高? 解决这类问题不一定要给每个仓库修改 workflow YAML。更低侵入的做法,是从 GitHub 的控制面采集 Webhook,再通过 Actions ...

小型开源项目如何接住漏洞报告:一套可执行的响应流程

来源: cncf.io 36
漏洞处理最危险的时刻,往往不是修复代码,而是报告刚到达项目时:维护者不知道由谁回复、讨论转移到公开 Issue、复现材料散落在私人邮箱里,最终让一个可控问题变成仓促发布。 这套流程面向中小型、并非以安全为核心的项目。它的目标不是建立一支完整安全团队,而是让维护者在收到漏洞报告时有一张可以照着执行的“操作卡”。如果项目处理密钥、支付、身份认证、基础设施控...

别只盯着 GPU:生产级 AI 平台是一套异构计算系统

来源: cncf.io 29
谈到 AI 基础设施,GPU 往往最先进入讨论:需要多少张卡、显存多大、训练吞吐是多少。但生产工作负载并不是把张量送入 GPU 就结束了。数据读取、解压、清洗、分词、请求编排、结果后处理和可观测性通常运行在 CPU 上,并持续依赖内存、网络与存储。平台工程真正要解决的,是这些资源如何协同,而不只是如何分配加速卡。 一条典型的推理链路可以拆成以下阶段: ...

AI 让 Kubernetes 再次令人畏惧:复杂的不是容器,而是工作负载

来源: cncf.io 49
Kubernetes 已经不是新技术。它的核心对象、调度机制和运维模式相当成熟,也逐渐成为生产软件与 AI 工作负载的重要基础设施。但对许多团队来说,引入 Kubernetes 仍像一次高风险迁移;当 GPU、模型文件、推理延迟和成本控制叠加进来,这种压力会进一步放大。 真正需要回答的问题不是“AI 项目要不要上 Kubernetes”,而是“哪些运行...