标签

云原生

别把每个 AI Agent 都做成一个 Pod:Kubernetes 上的 Worker 与 Actor 分离

来源: infoq.com 46
在 Kubernetes 上运行 AI Agent 时,一个直觉方案是“一个 Agent 对应一个 Pod”。但 Agent 的运行方式并不像传统 Web 服务:它们可能突然产生大量请求,执行时间很短,也可能创建子 Agent,或者停下来等待人工审批。把每个逻辑 Agent 固定绑定到一个 Pod,容易造成资源浪费和调度僵化。 kagent 项目提出了...

别把每个 AI Agent 都做成一个 Pod:Kubernetes 上的 Actor 与 Worker 思路

来源: infoq.com 53
在 Kubernetes 上运行 AI Agent,最直觉的设计是“一个 Agent 一个 Pod”。但 Agent 往往具有突发性、短生命周期、可派生子 Agent,以及等待人工审批等特征。把这些逻辑实体直接绑定到 Pod,会让调度、扩缩容和资源利用都变得笨重。 kagent 项目提出了一个值得借鉴的方向:Pod 更适合承担长期运行的 Worker,...

从按需扩容到共享 GPU 池:UiPath 如何支撑企业级 Agentic AI

来源: cloud.google.com 53
当自动化系统从执行固定步骤,升级为能够理解文档、识别界面、调用模型并自主决策的 Agentic AI,基础设施面对的已经不只是“多部署几张 GPU”。训练任务需要大量高性能算力,在线推理要求稳定低延迟,全球化服务还要兼顾区域容量与成本。 UiPath 为智能文档处理和自主智能体重新设计了 GPU 平台:不再为每个产品维护独立集群,而是通过机器学习服务平...

Filestore 搭载 Colossus:为 GKE 与 AI Agent 集群重新定义共享存储

来源: cloud.google.com 48
企业存储正在从“预先买足容量”转向按工作负载动态匹配性能与规模。Google Cloud Filestore 近期将云原生后端存储层直接构建在 Colossus 之上,并通过 GKE 深度集成、独立 IOPS 配置和 multishares for GKE,为容器化应用、海量数据集以及 AI Agent 协作工作空间提供了新的共享存储基础。 Files...

AI 治理不是审批流程,而是开发者体验设计

来源: docker.com 49
很多团队把 AI 治理理解为安全审查、模型白名单和风险审批。它们当然重要,但如果治理规则只能存在于文档、会议和工单里,开发者就很难在日常开发中正确执行。结果通常不是 AI 停止扩散,而是团队绕过正式平台,自行管理 API 密钥、提示词和数据流向。 要让 AI 在组织内规模化落地,治理需要成为开发者可以理解、调用和验证的产品能力。清晰的边界建立信任,自动...

OpenCost 1.121.0:把 Kubernetes 推理成本拆到每个 Token

来源: cncf.io 47
GPU 账单正在上涨,模型服务每天处理数十亿个 Token,但很多平台团队仍然只能回答“这组 GPU 花了多少钱”,却无法回答“每个模型、每个团队,甚至每个 Token 到底花了多少钱”。OpenCost 1.121.0 将 Kubernetes 成本分析推进到推理工作负载,重点解决的正是这类归因问题。 这件事的难点不在于把 GPU 小时价格乘起来,而...

用 Amazon Bedrock AgentCore 构建可搜索的网页洞察流水线

来源: aws.amazon.com 35
人工浏览几十个网站、筛选新文章并整理结论,很快就会变成一项难以持续的工作。更可靠的做法是把任务拆成一条自动化流水线:RSS 负责发现变化,Amazon Bedrock AgentCore Browser 负责稳定渲染网页,Amazon Bedrock 提取结构化洞察,Amazon OpenSearch Serverless 建立检索入口,AWS Lam...

软件供应链正遭受攻击,开发者仍是第一道防线

来源: docker.com 41
软件供应链风险已经从安全团队的专项议题,变成每个提交代码、引入依赖和发布版本的开发者都必须面对的工程问题。Omdia 的最新研究显示,过去一年有 77% 的组织经历过软件供应链事件。这个数字说明,攻击面并不只存在于生产环境,也存在于依赖包、构建脚本、CI/CD 流程和开发工具中。 现代应用通常依赖大量第三方组件、开源库、基础镜像和自动化 Action。...

AI Agent 可观测性:看清重复调用、成本失控与决策链路

来源: cncf.io 43
传统 APM 擅长回答“接口为什么慢”“哪个服务报错”,却很难解释另一类生产问题:为什么 Agent 对同一个问题调用了三次模型、为什么一次任务的成本突然翻倍、又为什么它在几个工具之间来回循环。Agent 的故障往往不是单点异常,而是一条仍然返回成功状态的错误决策链。 要理解这类系统,仅记录延迟和 HTTP 状态码还不够。团队需要把一次 Agent 运...

用 CloudNativePG 声明式管理 PostgreSQL 配置:从 postgresql.conf 到 pg_hba.conf

来源: postgr.es 48
对于习惯 SSH 登录虚拟机、编辑 和 的 DBA 来说,迁移到 Kubernetes 后,最明显的变化不是 SQL,而是配置方式变了:Pod 可能随时重建,容器内手工修改的文件也不会成为可靠的事实来源。 CloudNativePG(CNPG)把 PostgreSQL 集群配置放进 Kubernetes 自定义资源(CRD)中。DBA 只需要声明目标状...