用治理控制 AI Agent 成本,并把 ROI 变成可审计的经营指标

2026-09-11 18 预计阅读时间: 1 分钟
来源: azure.microsoft.com AI 摘要 Original link

Disclaimer: This article is an AI-assisted summary. Read it together with the original source when precision matters. The summary may omit context, version differences, or edge cases and is not official documentation.

预计阅读时间:10 分钟

当 AI Agent 从试验项目进入生产环境,问题就不再只是“模型能不能完成任务”,而是每一次调用花了多少钱、带来了多少业务价值,以及团队能否持续证明这笔投入值得。围绕 Microsoft Foundry 的 Agent 优化思路,可以把 AI 视为一种需要预算、监控、治理和复盘的受管投资系统。

这也是 Agent 经济学讨论的落点:成本优化不是单纯压低 token 数,而是建立从使用量到业务结果的完整证据链。

从调用成本走向投资管理

一个生产 Agent 的总成本通常不只包含模型费用,还包括工具调用、检索、存储、网络、评估和人工兜底等开销。可以先用一个简单模型统一团队口径:

总成本 = 模型调用成本 + 工具与基础设施成本 + 人工介入成本
单位价值 = 可归因业务收益 / 总成本
ROI = (可归因业务收益 - 总成本) / 总成本

这里最容易被忽略的是“可归因业务收益”。例如,客服 Agent 的收益可以来自处理时长下降、自动解决率提升或人工工单减少;代码 Agent 的收益可以来自交付周期缩短,但不能直接把所有开发产出都算成 Agent 的收益。

实践中,建议为每个 Agent 建立成本中心或项目标签,并至少记录以下字段:

  • agent_id:Agent 或版本标识
  • model:使用的模型
  • environment:开发、测试或生产环境
  • tokens_intokens_out:输入和输出 token
  • tool_calls:工具调用次数
  • human_handoffs:转人工次数
  • business_events:完成订单、关闭工单等结果事件
  • estimated_value:按照业务规则估算的收益

这些字段把“模型使用量”和“业务结果”连接起来,为预算控制和 ROI 复盘提供基础。

治理要解决的四个问题

谁在使用,使用了什么

没有身份、项目和环境维度的用量数据,成本报表只能回答“花了多少”,不能回答“为什么花”。生产环境应将 Agent、模型、工具和调用方纳入统一的资源标识体系,区分实验流量与真实业务流量。

模型选择也应该成为治理策略的一部分。低风险、结构化任务可以采用成本更低的模型;涉及复杂推理或高风险决策的任务,则需要更严格的模型、提示词和人工审核策略。具体模型组合应根据组织的评估结果和价格配置确定,而不是凭经验固定下来。

如何设置预算和护栏

治理控制可以从软性提醒开始,逐步增加硬性限制:

  • 按团队、产品和 Agent 设置月度预算
  • 为单次任务设置最大 token 或工具调用次数
  • 对异常增长、重复循环和失败重试设置告警
  • 对高风险动作要求人工确认
  • 在达到预算阈值后切换到降级流程或暂停非关键任务

护栏不应只盯着 token。一个 Agent 可能 token 消耗正常,却因为工具循环、重复查询或大量人工转交而成本失控。因此,模型、工具、重试和人工介入都应纳入同一套监控。

如何证明效果

ROI 证明需要稳定的基线和一致的度量口径。可以将上线前的人工处理时长、单位任务成本、错误率和吞吐量作为基线,再与 Agent 上线后的同类任务进行比较。

一个可执行的评估表可以包含:

指标 基线 Agent 上线后 解释
单位任务成本 由历史数据计算 按调用与人工成本计算 观察成本是否下降
自动完成率 人工或旧系统数据 Agent 运行数据 需要明确“完成”的定义
人工介入率 历史转交率 human_handoffs / tasks 不能只追求自动化率
质量指标 错误率、满意度等 相同口径采集 防止用低质量换成本
单位业务价值 业务团队确认 结果事件归因 避免重复计算收益

重点不是追求一个漂亮的 ROI 百分比,而是让每个数字都能追溯到调用记录、业务事件和明确的计算规则。

一个可运行的成本与 ROI 估算器

下面的 Python 示例使用一组假设价格和业务规则,演示如何按 Agent 汇总成本并计算 ROI。价格和收益参数只是示例,运行前应替换为组织实际的模型价格、基础设施成本和业务估值。

将代码保存为 agent_economics.py,使用 Python 3 运行:

from collections import defaultdict

# 示例费率:请替换为实际计费配置。
INPUT_PRICE_PER_MILLION = 2.0
OUTPUT_PRICE_PER_MILLION = 8.0
TOOL_CALL_COST = 0.01
HUMAN_HANDOFF_COST = 1.50

records = [
    {
        "agent_id": "support-agent",
        "tokens_in": 1_200_000,
        "tokens_out": 300_000,
        "tool_calls": 1800,
        "human_handoffs": 120,
        "completed_cases": 2400,
        "value_per_case": 2.20,
    },
    {
        "agent_id": "support-agent-v2",
        "tokens_in": 900_000,
        "tokens_out": 210_000,
        "tool_calls": 1100,
        "human_handoffs": 70,
        "completed_cases": 2300,
        "value_per_case": 2.20,
    },
]

summary = defaultdict(lambda: {"cost": 0.0, "value": 0.0, "cases": 0})

for item in records:
    model_cost = (
        item["tokens_in"] / 1_000_000 * INPUT_PRICE_PER_MILLION
        + item["tokens_out"] / 1_000_000 * OUTPUT_PRICE_PER_MILLION
    )
    tool_cost = item["tool_calls"] * TOOL_CALL_COST
    human_cost = item["human_handoffs"] * HUMAN_HANDOFF_COST
    total_cost = model_cost + tool_cost + human_cost
    value = item["completed_cases"] * item["value_per_case"]

    row = summary[item["agent_id"]]
    row["cost"] += total_cost
    row["value"] += value
    row["cases"] += item["completed_cases"]

for agent_id, row in summary.items():
    roi = (row["value"] - row["cost"]) / row["cost"] if row["cost"] else 0
    cost_per_case = row["cost"] / row["cases"] if row["cases"] else 0
    print(
        f"{agent_id}: cost=${row['cost']:.2f}, "
        f"value=${row['value']:.2f}, "
        f"cost_per_case=${cost_per_case:.4f}, ROI={roi:.2%}"
    )

这个脚本适合做早期经营测算,但不应直接替代生产计费系统。真实环境还需要处理价格版本、折扣、缓存、失败重试、共享基础设施分摊以及收益归因的不确定性。

把治理嵌入发布流程

Agent 治理不应在月底结算时才出现。可以在每次 Agent 或提示词版本发布时执行一组检查:

agent_governance:
  agent_id: support-agent
  environment: production
  monthly_budget_usd: 5000
  per_run_limits:
    max_input_tokens: 12000
    max_output_tokens: 3000
    max_tool_calls: 8
    max_retries: 2
  alerts:
    daily_cost_increase_percent: 30
    human_handoff_rate_percent: 20
    failure_rate_percent: 5
  required_metrics:
    - total_cost
    - cost_per_completed_case
    - task_success_rate
    - human_handoff_rate
    - attributed_business_value
  approval:
    high_risk_actions_require_human: true

这类配置的价值在于把隐含约定变成可检查的合同。发布系统可以验证预算和上限是否存在,运行平台可以发出告警,运营团队则可以按统一指标比较不同版本。

采用建议:先建立证据链,再扩大规模

可以按下面的顺序推进:

  1. 为每个 Agent、模型、工具调用和业务结果建立可关联的标识。
  2. 先计算真实的单位任务成本,再讨论降本目标。
  3. 为 token、工具、重试和人工介入设置预算与护栏。
  4. 用固定基线评估质量、成本和业务收益,避免只看自动化率。
  5. 将成本与 ROI 指标加入版本发布、月度运营和模型评估流程。
  6. 对无法稳定证明价值的 Agent 限制流量或停留在实验环境。

Agent 优化的终点不是让每次调用都最便宜,而是让组织知道钱花在哪里、风险由谁承担、结果如何验证。只有当成本控制和业务价值使用同一套可审计数据时,AI 才真正从一次性实验变成可以持续管理的投资。


相关推荐