当 AI Agent 从试验项目进入生产环境,问题就不再只是“模型能不能完成任务”,而是每一次调用花了多少钱、带来了多少业务价值,以及团队能否持续证明这笔投入值得。围绕 Microsoft Foundry 的 Agent 优化思路,可以把 AI 视为一种需要预算、监控、治理和复盘的受管投资系统。
这也是 Agent 经济学讨论的落点:成本优化不是单纯压低 token 数,而是建立从使用量到业务结果的完整证据链。
从调用成本走向投资管理
一个生产 Agent 的总成本通常不只包含模型费用,还包括工具调用、检索、存储、网络、评估和人工兜底等开销。可以先用一个简单模型统一团队口径:
总成本 = 模型调用成本 + 工具与基础设施成本 + 人工介入成本
单位价值 = 可归因业务收益 / 总成本
ROI = (可归因业务收益 - 总成本) / 总成本
这里最容易被忽略的是“可归因业务收益”。例如,客服 Agent 的收益可以来自处理时长下降、自动解决率提升或人工工单减少;代码 Agent 的收益可以来自交付周期缩短,但不能直接把所有开发产出都算成 Agent 的收益。
实践中,建议为每个 Agent 建立成本中心或项目标签,并至少记录以下字段:
agent_id:Agent 或版本标识model:使用的模型environment:开发、测试或生产环境tokens_in、tokens_out:输入和输出 tokentool_calls:工具调用次数human_handoffs:转人工次数business_events:完成订单、关闭工单等结果事件estimated_value:按照业务规则估算的收益
这些字段把“模型使用量”和“业务结果”连接起来,为预算控制和 ROI 复盘提供基础。
治理要解决的四个问题
谁在使用,使用了什么
没有身份、项目和环境维度的用量数据,成本报表只能回答“花了多少”,不能回答“为什么花”。生产环境应将 Agent、模型、工具和调用方纳入统一的资源标识体系,区分实验流量与真实业务流量。
模型选择也应该成为治理策略的一部分。低风险、结构化任务可以采用成本更低的模型;涉及复杂推理或高风险决策的任务,则需要更严格的模型、提示词和人工审核策略。具体模型组合应根据组织的评估结果和价格配置确定,而不是凭经验固定下来。
如何设置预算和护栏
治理控制可以从软性提醒开始,逐步增加硬性限制:
- 按团队、产品和 Agent 设置月度预算
- 为单次任务设置最大 token 或工具调用次数
- 对异常增长、重复循环和失败重试设置告警
- 对高风险动作要求人工确认
- 在达到预算阈值后切换到降级流程或暂停非关键任务
护栏不应只盯着 token。一个 Agent 可能 token 消耗正常,却因为工具循环、重复查询或大量人工转交而成本失控。因此,模型、工具、重试和人工介入都应纳入同一套监控。
如何证明效果
ROI 证明需要稳定的基线和一致的度量口径。可以将上线前的人工处理时长、单位任务成本、错误率和吞吐量作为基线,再与 Agent 上线后的同类任务进行比较。
一个可执行的评估表可以包含:
| 指标 | 基线 | Agent 上线后 | 解释 |
|---|---|---|---|
| 单位任务成本 | 由历史数据计算 | 按调用与人工成本计算 | 观察成本是否下降 |
| 自动完成率 | 人工或旧系统数据 | Agent 运行数据 | 需要明确“完成”的定义 |
| 人工介入率 | 历史转交率 | human_handoffs / tasks |
不能只追求自动化率 |
| 质量指标 | 错误率、满意度等 | 相同口径采集 | 防止用低质量换成本 |
| 单位业务价值 | 业务团队确认 | 结果事件归因 | 避免重复计算收益 |
重点不是追求一个漂亮的 ROI 百分比,而是让每个数字都能追溯到调用记录、业务事件和明确的计算规则。
一个可运行的成本与 ROI 估算器
下面的 Python 示例使用一组假设价格和业务规则,演示如何按 Agent 汇总成本并计算 ROI。价格和收益参数只是示例,运行前应替换为组织实际的模型价格、基础设施成本和业务估值。
将代码保存为 agent_economics.py,使用 Python 3 运行:
from collections import defaultdict
# 示例费率:请替换为实际计费配置。
INPUT_PRICE_PER_MILLION = 2.0
OUTPUT_PRICE_PER_MILLION = 8.0
TOOL_CALL_COST = 0.01
HUMAN_HANDOFF_COST = 1.50
records = [
{
"agent_id": "support-agent",
"tokens_in": 1_200_000,
"tokens_out": 300_000,
"tool_calls": 1800,
"human_handoffs": 120,
"completed_cases": 2400,
"value_per_case": 2.20,
},
{
"agent_id": "support-agent-v2",
"tokens_in": 900_000,
"tokens_out": 210_000,
"tool_calls": 1100,
"human_handoffs": 70,
"completed_cases": 2300,
"value_per_case": 2.20,
},
]
summary = defaultdict(lambda: {"cost": 0.0, "value": 0.0, "cases": 0})
for item in records:
model_cost = (
item["tokens_in"] / 1_000_000 * INPUT_PRICE_PER_MILLION
+ item["tokens_out"] / 1_000_000 * OUTPUT_PRICE_PER_MILLION
)
tool_cost = item["tool_calls"] * TOOL_CALL_COST
human_cost = item["human_handoffs"] * HUMAN_HANDOFF_COST
total_cost = model_cost + tool_cost + human_cost
value = item["completed_cases"] * item["value_per_case"]
row = summary[item["agent_id"]]
row["cost"] += total_cost
row["value"] += value
row["cases"] += item["completed_cases"]
for agent_id, row in summary.items():
roi = (row["value"] - row["cost"]) / row["cost"] if row["cost"] else 0
cost_per_case = row["cost"] / row["cases"] if row["cases"] else 0
print(
f"{agent_id}: cost=${row['cost']:.2f}, "
f"value=${row['value']:.2f}, "
f"cost_per_case=${cost_per_case:.4f}, ROI={roi:.2%}"
)
这个脚本适合做早期经营测算,但不应直接替代生产计费系统。真实环境还需要处理价格版本、折扣、缓存、失败重试、共享基础设施分摊以及收益归因的不确定性。
把治理嵌入发布流程
Agent 治理不应在月底结算时才出现。可以在每次 Agent 或提示词版本发布时执行一组检查:
agent_governance:
agent_id: support-agent
environment: production
monthly_budget_usd: 5000
per_run_limits:
max_input_tokens: 12000
max_output_tokens: 3000
max_tool_calls: 8
max_retries: 2
alerts:
daily_cost_increase_percent: 30
human_handoff_rate_percent: 20
failure_rate_percent: 5
required_metrics:
- total_cost
- cost_per_completed_case
- task_success_rate
- human_handoff_rate
- attributed_business_value
approval:
high_risk_actions_require_human: true
这类配置的价值在于把隐含约定变成可检查的合同。发布系统可以验证预算和上限是否存在,运行平台可以发出告警,运营团队则可以按统一指标比较不同版本。
采用建议:先建立证据链,再扩大规模
可以按下面的顺序推进:
- 为每个 Agent、模型、工具调用和业务结果建立可关联的标识。
- 先计算真实的单位任务成本,再讨论降本目标。
- 为 token、工具、重试和人工介入设置预算与护栏。
- 用固定基线评估质量、成本和业务收益,避免只看自动化率。
- 将成本与 ROI 指标加入版本发布、月度运营和模型评估流程。
- 对无法稳定证明价值的 Agent 限制流量或停留在实验环境。
Agent 优化的终点不是让每次调用都最便宜,而是让组织知道钱花在哪里、风险由谁承担、结果如何验证。只有当成本控制和业务价值使用同一套可审计数据时,AI 才真正从一次性实验变成可以持续管理的投资。