来源: infoq.com
53
在 Kubernetes 上运行 AI Agent,最直觉的设计是“一个 Agent 一个 Pod”。但 Agent 往往具有突发性、短生命周期、可派生子 Agent,以及等待人工审批等特征。把这些逻辑实体直接绑定到 Pod,会让调度、扩缩容和资源利用都变得笨重。 kagent 项目提出了一个值得借鉴的方向:Pod 更适合承担长期运行的 Worker,...
来源: cloud.google.com
53
当自动化系统从执行固定步骤,升级为能够理解文档、识别界面、调用模型并自主决策的 Agentic AI,基础设施面对的已经不只是“多部署几张 GPU”。训练任务需要大量高性能算力,在线推理要求稳定低延迟,全球化服务还要兼顾区域容量与成本。 UiPath 为智能文档处理和自主智能体重新设计了 GPU 平台:不再为每个产品维护独立集群,而是通过机器学习服务平...
来源: cncf.io
47
GPU 账单正在上涨,模型服务每天处理数十亿个 Token,但很多平台团队仍然只能回答“这组 GPU 花了多少钱”,却无法回答“每个模型、每个团队,甚至每个 Token 到底花了多少钱”。OpenCost 1.121.0 将 Kubernetes 成本分析推进到推理工作负载,重点解决的正是这类归因问题。 这件事的难点不在于把 GPU 小时价格乘起来,而...
来源: postgr.es
48
对于习惯 SSH 登录虚拟机、编辑 和 的 DBA 来说,迁移到 Kubernetes 后,最明显的变化不是 SQL,而是配置方式变了:Pod 可能随时重建,容器内手工修改的文件也不会成为可靠的事实来源。 CloudNativePG(CNPG)把 PostgreSQL 集群配置放进 Kubernetes 自定义资源(CRD)中。DBA 只需要声明目标状...
来源: kubernetes.io
44
Gateway API v1.6.0 把 Kubernetes 服务网络向前推进了一层:TCPRoute 和 UDPRoute 从实验通道毕业,进入 标准 API。数据库、DNS、VoIP、游戏服务器和 IoT 遥测等原始 TCP/UDP 工作负载,现在可以使用可移植、面向角色的 Gateway API 模型,不必只依赖 或某个控制器的私有 CRD。 ...
来源: postgr.es
53
凌晨告警里,“应用连不上数据库”通常会被直接翻译成“PostgreSQL 挂了”。但这个现象至少对应两类完全不同的故障:数据库主机真的无法响应,或者应用连接池里保存了一条早已失效的 TCP 连接。两者需要不同的处理方式,混淆它们,很容易浪费事故发生后的关键十分钟。 真正的 PostgreSQL 卡死发生在服务端或更底层。此时无论从哪个应用、连接池或网络...
来源: infoq.com
44
HashiCorp 发布了 Vault Kubernetes Key Management 公测版。这是一个兼容 Kubernetes KMS v2 的插件,让 API Server 把信封加密操作委托给 Vault Enterprise。变化的核心不是“再加一层加密”,而是把保护 etcd 数据的密钥加密密钥(KEK)移出 Kubernetes 集群...
来源: cloud.google.com
36
2026 年 5 月至 7 月,Google Cloud 的 AI 基础设施更新呈现出一个清晰趋势:竞争重点已经从“能不能运行模型”转向“能否在大规模、低延迟、可观测且可控成本的条件下持续运行模型和智能体”。 这组更新覆盖存储、网络、TPU/GPU 编排、推理网关、AI 供应链安全以及智能体运行时。它们共同指向一个现实问题:Agentic AI 不只是...
来源: kubernetes.io
53
Kubernetes v1.37 计划于 2026 年 8 月 26 日发布。相比单纯增加 API,这一版本更值得平台团队关注的是几项运行时约束变化:静态 Pod 不再允许引用 Secret 或 ConfigMap,kube-proxy 的 IPVS 模式进入退场周期,cgroup v1 的兼容窗口继续收窄,而 SELinux 卷挂载策略可能直接改变部...
来源: cncf.io
57
在事件驱动系统里,CPU 和内存并不总能反映真实压力。一个消费者 Pod 可能只占用很少的 CPU,但 Amazon SQS 中已经堆积了数千条消息。此时如果只依赖 Kubernetes HPA 的资源指标,扩容往往发生得太晚。 KEDA 可以把 SQS 队列深度转换成 Kubernetes 扩缩容信号,让 Worker 副本数跟随待处理消息数量变化。...