Google Cloud 本月的 AI 更新,重点已经从“模型还能做什么”转向“企业如何把 AI 真正部署起来”。主题很明确:让智能体进入金融服务和法律等专业工作流,同时用更灵活的计费方式、预算控制和工程化指南,解决 AI 成本、治理与生产落地问题。
AI 正在进入具体行业流程
本月公布的 Gemini Enterprise for Financial Services,面向资本市场和企业银行业务,把 agentic AI 放进更明确的金融工作流中。对于这类场景,通用聊天能力并不够,系统还必须理解行业术语、业务流程、权限边界以及审计要求。
Gemini Enterprise for Legal 则针对律所和企业法务部门,提供集成且受治理的环境,帮助团队更快部署法律相关智能体。法律场景尤其依赖文档检索、上下文引用、权限隔离和结果可追溯性,智能体的“会回答”只是起点。
这两个方向传达出一个重要信号:企业 AI 的竞争点,正在从单一模型的通用能力,转向模型、企业数据、工作流和治理机制的组合。可以这样拆解一个行业智能体的最小边界:
- 只允许访问完成任务所需的数据源。
- 对高风险动作设置人工审批,例如付款、合同发送或交易执行。
- 保存输入、检索文档、工具调用和最终输出,便于审计。
- 为不同任务选择不同模型,不让所有请求都使用最高规格模型。
AI 成本进入 FinOps 管理范围
Google Cloud 本月还强调了 AI 时代的 FinOps:围绕 Gemini Enterprise、开发工具和智能体工作负载,提供更灵活的计费方式与成本管理工具。
智能体的成本和传统 API 调用不同。一次用户请求可能触发多轮推理、检索、工具调用、代码执行和结果校验。如果团队只按“用户请求数”看账单,很容易忽略真正的成本驱动因素:输入 token、输出 token、上下文长度、调用次数、模型规格以及并发量。
“Tokenomics”可以理解为把 token 当作一种需要经营的资源。更多 token 不一定带来更好的结果。一个更长的提示词、更多历史上下文或多次重复调用,可能只带来很小的质量提升,却显著增加延迟和费用。
可以先用一个简单的本地账本观察智能体成本。下面的 Python 示例不依赖第三方库,保存为 ai_cost_ledger.py 后即可运行。示例价格是占位值,接入真实环境时应替换为云平台当前价目表,并按实际模型和区域校准。
from dataclasses import dataclass
@dataclass
class AgentRun:
name: str
input_tokens: int
output_tokens: int
tool_calls: int = 0
# 示例单价:每百万 token 的美元价格,仅用于演示成本核算方法。
INPUT_PRICE_PER_MILLION = 0.30
OUTPUT_PRICE_PER_MILLION = 2.50
TOOL_CALL_PRICE = 0.001
runs = [
AgentRun("contract-review", 18_000, 3_000, 2),
AgentRun("sales-summary", 6_000, 1_200, 1),
AgentRun("contract-review", 42_000, 8_000, 5),
]
def estimate_cost(run: AgentRun) -> float:
input_cost = run.input_tokens / 1_000_000 * INPUT_PRICE_PER_MILLION
output_cost = run.output_tokens / 1_000_000 * OUTPUT_PRICE_PER_MILLION
tool_cost = run.tool_calls * TOOL_CALL_PRICE
return input_cost + output_cost + tool_cost
total = 0.0
for run in runs:
cost = estimate_cost(run)
total += cost
print(f"{run.name:16} ${cost:.4f} tools={run.tool_calls}")
print(f"total{' ':11} ${total:.4f}")
在生产环境中,这个账本至少应增加 project、team、agent_version、model、environment 和 request_id 等字段。这样才能回答“哪个智能体最贵”“成本上涨来自模型还是上下文”“一次工具调用是否值得”等具体问题。
从开发工具到企业级智能体平台
Google Antigravity 正扩展到符合条件的 Gemini Enterprise 应用订阅中,并提供开箱即用的管理与支出控制能力。这个变化的价值不只是让更多员工使用开发型智能体,而是让组织能够在统一的订阅、权限和成本边界内管理它们。
对于工程团队,智能体平台的关键能力可以归纳为四类:
- 构建:提供模型、工具、连接器和工作流编排能力。
- 扩展:支持运行时、身份、并发和长流程任务。
- 治理:管理权限、审批、审计、数据访问和安全策略。
- 优化:观测质量、延迟、token 使用和单位任务成本。
Google Cloud 前几个月公布的 Gemini Enterprise Agent Platform,也围绕构建、扩展、治理和优化展开。相关更新包括 Agent Runtime、Agent Identity、托管智能体、开发生命周期自动化,以及帮助发现和修复代码漏洞的 CodeMender。AlphaEvolve 则面向更复杂的算法优化和代码发现任务。
这些能力组合起来,意味着智能体不应再被当作一个孤立的聊天窗口,而应像服务一样被运营:拥有版本、身份、预算、SLO、回滚策略和故障记录。
生产化之前要问的几个问题
Google Cloud 本月推荐的生产化指南,集中在原型进入生产环境时最容易被忽略的决策。团队可以在发布前用以下问题做一次检查:
- 智能体的成功标准是什么?是准确率、任务完成率、人工接管率,还是单位任务成本?
- 哪些动作可以自动执行,哪些动作必须经过人工确认?
- 发生异常数据、工具超时或模型拒答时,系统如何降级?
- 输入和输出是否包含个人信息、财务数据、客户机密或受监管内容?
- 如何限制每次任务的最大 token、最大工具调用次数和最长运行时间?
- 是否能按团队、项目、智能体版本和模型拆分成本?
- 如何验证检索内容确实支持回答,而不是让模型凭空补全?
- 发布新提示词、工具或模型后,是否有固定的回归测试集?
幻觉问题仍然是企业采用大模型时的核心边界。模型在缺少事实时,可能用很确定的语气生成错误答案。因此,生产系统需要让“没有足够证据”成为一种正常结果,而不是强迫模型在任何情况下都给出结论。检索引用、结构化输出、工具结果校验、人工审批和离线评测,都比单纯增加上下文更可靠。
采用建议:把 AI 当作一项可计量的业务能力
本月信息可以浓缩为一条工程路线:先选一个边界清晰的行业流程,再为智能体建立身份与权限,接着记录每次运行的质量、延迟和成本,最后再扩大自动化范围。
建议团队保留三条底线:
- 成本有上限:为项目和智能体设置预算、告警以及单次运行限制。
- 权限可撤销:智能体使用最小权限,敏感操作必须有审批或双人确认。
- 结果可验证:关键结论需要引用来源、工具证据或规则校验,不能只依赖模型自述。
AI 的成熟度,不体现在一次演示能否生成漂亮答案,而体现在系统能否在真实业务中稳定运行、解释自己的行为,并让团队知道每个结果花了多少钱。