标签

Kubernetes

别把每个 AI Agent 都做成一个 Pod:Kubernetes 上的 Actor 与 Worker 思路

来源: infoq.com 53
在 Kubernetes 上运行 AI Agent,最直觉的设计是“一个 Agent 一个 Pod”。但 Agent 往往具有突发性、短生命周期、可派生子 Agent,以及等待人工审批等特征。把这些逻辑实体直接绑定到 Pod,会让调度、扩缩容和资源利用都变得笨重。 kagent 项目提出了一个值得借鉴的方向:Pod 更适合承担长期运行的 Worker,...

从按需扩容到共享 GPU 池:UiPath 如何支撑企业级 Agentic AI

来源: cloud.google.com 53
当自动化系统从执行固定步骤,升级为能够理解文档、识别界面、调用模型并自主决策的 Agentic AI,基础设施面对的已经不只是“多部署几张 GPU”。训练任务需要大量高性能算力,在线推理要求稳定低延迟,全球化服务还要兼顾区域容量与成本。 UiPath 为智能文档处理和自主智能体重新设计了 GPU 平台:不再为每个产品维护独立集群,而是通过机器学习服务平...

OpenCost 1.121.0:把 Kubernetes 推理成本拆到每个 Token

来源: cncf.io 47
GPU 账单正在上涨,模型服务每天处理数十亿个 Token,但很多平台团队仍然只能回答“这组 GPU 花了多少钱”,却无法回答“每个模型、每个团队,甚至每个 Token 到底花了多少钱”。OpenCost 1.121.0 将 Kubernetes 成本分析推进到推理工作负载,重点解决的正是这类归因问题。 这件事的难点不在于把 GPU 小时价格乘起来,而...

用 CloudNativePG 声明式管理 PostgreSQL 配置:从 postgresql.conf 到 pg_hba.conf

来源: postgr.es 48
对于习惯 SSH 登录虚拟机、编辑 和 的 DBA 来说,迁移到 Kubernetes 后,最明显的变化不是 SQL,而是配置方式变了:Pod 可能随时重建,容器内手工修改的文件也不会成为可靠的事实来源。 CloudNativePG(CNPG)把 PostgreSQL 集群配置放进 Kubernetes 自定义资源(CRD)中。DBA 只需要声明目标状...

PostgreSQL 真死锁还是连接池失活?五分钟完成故障定性

来源: postgr.es 53
凌晨告警里,“应用连不上数据库”通常会被直接翻译成“PostgreSQL 挂了”。但这个现象至少对应两类完全不同的故障:数据库主机真的无法响应,或者应用连接池里保存了一条早已失效的 TCP 连接。两者需要不同的处理方式,混淆它们,很容易浪费事故发生后的关键十分钟。 真正的 PostgreSQL 卡死发生在服务端或更底层。此时无论从哪个应用、连接池或网络...

AI 基础设施进入编排深水区:从高性能存储到智能体密度优化

来源: cloud.google.com 36
2026 年 5 月至 7 月,Google Cloud 的 AI 基础设施更新呈现出一个清晰趋势:竞争重点已经从“能不能运行模型”转向“能否在大规模、低延迟、可观测且可控成本的条件下持续运行模型和智能体”。 这组更新覆盖存储、网络、TPU/GPU 编排、推理网关、AI 供应链安全以及智能体运行时。它们共同指向一个现实问题:Agentic AI 不只是...

Kubernetes v1.37 升级前瞻:IPVS 退场、cgroup v2 迁移与 SELinuxMount GA

来源: kubernetes.io 53
Kubernetes v1.37 计划于 2026 年 8 月 26 日发布。相比单纯增加 API,这一版本更值得平台团队关注的是几项运行时约束变化:静态 Pod 不再允许引用 Secret 或 ConfigMap,kube-proxy 的 IPVS 模式进入退场周期,cgroup v1 的兼容窗口继续收窄,而 SELinux 卷挂载策略可能直接改变部...

让积压量决定副本数:用 KEDA 按 Amazon SQS 队列深度扩缩 Kubernetes Worker

来源: cncf.io 57
在事件驱动系统里,CPU 和内存并不总能反映真实压力。一个消费者 Pod 可能只占用很少的 CPU,但 Amazon SQS 中已经堆积了数千条消息。此时如果只依赖 Kubernetes HPA 的资源指标,扩容往往发生得太晚。 KEDA 可以把 SQS 队列深度转换成 Kubernetes 扩缩容信号,让 Worker 副本数跟随待处理消息数量变化。...