标签

架构设计

把闲置时间变成容量:GKE 如何将单个 AI Agent 成本降低 75%

来源: cloud.google.com 44
AI Agent 的资源曲线通常不是平滑直线:它们会集中推理、调用工具或执行代码,随后等待用户输入和外部事件。如果每个 Agent 始终占用固定 CPU 和内存,大量预算最终会消耗在空闲时间上。 一次基于 GKE 节点和 OpenClaw 工作负载模型的测试展示了三层优化效果:从每个 Agent 独占 microVM,到使用 GKE Agent San...

AlloyDB IAM 组认证:用企业身份管住工程师与 AI Agent 的数据库访问

来源: cloud.google.com 33
数据库权限管理长期存在一个难解的规模问题:权限分得越细,账号开通、密码轮换、员工离职回收和审计的成本就越高;为了降低管理成本而共享高权限账号,又会扩大泄露影响范围,并让审计日志失去具体责任人。 AlloyDB 新增预览版 IAM 组认证后,企业可以把 Google Groups 映射到数据库访问策略。权限不再围绕数千个独立用户逐一配置,而是围绕财务分析...

开源依赖成为主战场:给软件供应链加上隔离、冷却与验证

来源: cloud.google.com 49
软件供应链攻击的重心正在发生变化。相比入侵大型软件厂商并篡改更新渠道,攻击者越来越多地盯上 npm、PyPI、Docker Hub、GitHub Actions 和开发者工具:接管维护者账号、投放恶意版本、利用安装脚本窃取凭据,再借助被盗令牌继续污染其他项目。 来源材料指出,2025 年至 2026 年上半年出现了一批规模显著扩大的开源供应链攻击,部分...

AngelSpec 全链路开源:从 Drafter 训练到投机解码部署

来源: oschina.net 44
大模型推理优化不只是在算子层面压缩几毫秒。对于自回归生成,模型通常需要逐个 token 完成前向计算,显存带宽、调度开销和并发压力会共同限制吞吐。投机解码的思路,是让一个成本更低的 drafter 先提出多个候选 token,再由目标模型批量验证,从而减少昂贵的串行解码步骤。 腾讯混元团队此次开源 AngelSpec,覆盖 drafter 训练、架构设...

controller-runtime Cache 深入解析:为什么你的 Reconcile 不会打爆 API Server

来源: kubernetes.io 48
很多 Go 开发者第一次写 Kubernetes Controller 时,会自然地把 和 理解成一次次对 kube-apiserver 的查询。这个理解一旦带入生产环境,就很容易误判控制器的性能、数据一致性和内存开销。 在典型的 controller-runtime Controller 中,Reconcile 的读取通常来自进程内的本地缓存,而不是...

用 Agents CLI 把 AI Agent 从原型推进到受治理的生产服务

来源: cloud.google.com 51
许多 Agent 项目并不是模型效果不够,而是卡在从本地脚本走向生产环境的路上:开发者需要在代码编辑器、IAM 控制台、部署平台、评测系统和企业应用之间来回切换。Agents CLI 的定位正是把这些生命周期能力作为技能交给编码助手,让开发、部署、安全治理、评测和发布能够在同一个 coding agent 对话里完成。 本文以一个“行业观察员”Agen...

无边界 Lakehouse:让跨云数据真正服务于 AI Agent

来源: cloud.google.com 68
数据湖仓正在从“存放数据的地方”变成“执行动作的系统”。AI Agent 不再只是定期生成报表,而是持续监控供应链、识别异常、解释业务指标,并在满足条件时触发后续流程。要让这种系统稳定运行,Agent 必须访问分散在 AWS、Databricks、Snowflake、企业本地系统和 SaaS 应用中的数据,同时还要理解字段含义、数据血缘和访问边界。 G...

2.8 万亿参数塞进 M1 Max:Kimi K3 本地运行真正验证了什么

来源: oschina.net 42
月之暗面放出 Kimi K3 完整权重后,Deltafin 项目很快展示了在 Apple Silicon Mac 上运行这个 2.8 万亿参数模型的可能性。真正值得关注的不是约 0.3 token/s 的速度,而是一个更具体的工程问题:当模型规模远远超过机器内存时,推理系统怎样利用稀疏激活、量化、统一内存与外部存储,把一次原本“不可能装下”的推理变成可...