企业进入智能体时代后,AI 成本不再只是一次模型调用的价格。一个智能体可能规划任务、查询系统、调用工具、反复重试,最后还需要人工审核。此时,只看 token 单价、调用次数或演示效果,很容易低估成本,也无法回答管理层真正关心的问题:每投入一美元,究竟完成了多少可用工作?
更合适的管理单位是“每美元有效工作量”。它把业务结果、质量门槛和全链路成本放在同一个指标里,用于比较工作流、定位浪费,并决定哪些项目值得扩大规模。
不要把模型调用当成业务成果
智能体可以成功返回答案,不代表它完成了有价值的工作。例如,客服智能体生成了一封回复,但客户随后再次来电;采购智能体填写了订单,却选错了供应商;研发智能体提交了代码,但没有通过测试。这些都不能计入完整的有效工作。
企业可以按工作流定义一个可验证的“工作单元”:
- 客服:一次无需升级给人工、且在观察期内没有重复联系的已解决工单。
- 财务:一张通过规则校验和抽样复核的已处理发票。
- 研发:一个通过测试、代码审查并成功合并的变更。
- 销售运营:一条字段完整、来源可追踪且通过去重检查的客户记录。
在此基础上,可以使用一个简单指标:
每美元有效工作量 = 完成数量 × 质量通过率 × 业务价值权重 / 全链路成本
业务价值权重不是必需项。如果不同工作单元的价值相近,可以直接省略;如果同一平台处理的任务差异很大,则可以用节省时间、降低损失或带来的收入作为权重。权重应由业务负责人确认,避免团队为了提高指标自行调整口径。
成本分母必须覆盖整个智能体链路
智能体系统的成本通常分散在多个位置。除了模型输入和输出 token,还应记录:
- 搜索、数据库、浏览器、代码执行器等工具调用费用。
- 向量数据库、运行容器、网络和可观测性基础设施。
- 失败重试、超时恢复和重复执行产生的成本。
- 人工审核、异常处理和升级接管所花费的时间。
- 安全检查、评估任务以及维护提示词和工具接口的工程投入。
如果只统计模型账单,一个大量重试、频繁转人工的智能体可能看起来非常便宜。全链路成本能暴露真正的效率问题,也便于比较“小模型加严格流程”和“大模型直接处理”等不同方案。
建议同时观察中位数和 P95 成本。平均成本可能掩盖少量失控任务,而智能体的长尾执行往往正是预算超支和用户等待的来源。
可以这样实践:建立最小化投资记分卡
下面是一个可直接运行的 Python 示例。它假设每条记录代表一个工作流在某个统计周期内的汇总结果,并用“质量调整后的有效工作量 / 全链路成本”排序。实际接入时,可以把示例数据替换为数据仓库查询结果。
将代码保存为 ai_portfolio_scorecard.py,然后运行 python ai_portfolio_scorecard.py:
from dataclasses import dataclass
@dataclass
class Workflow:
name: str
completed: int
quality_pass_rate: float
value_weight: float
model_cost: float
tool_cost: float
infrastructure_cost: float
review_hours: float
reviewer_hourly_cost: float
@property
def useful_work(self) -> float:
return self.completed * self.quality_pass_rate * self.value_weight
@property
def total_cost(self) -> float:
human_cost = self.review_hours * self.reviewer_hourly_cost
return (
self.model_cost
+ self.tool_cost
+ self.infrastructure_cost
+ human_cost
)
@property
def useful_work_per_dollar(self) -> float:
return self.useful_work / self.total_cost if self.total_cost else 0.0
workflows = [
Workflow("客服工单分类", 12000, 0.97, 1.0, 180, 90, 120, 18, 35),
Workflow("供应商尽调", 420, 0.91, 8.0, 260, 340, 180, 42, 55),
Workflow("销售邮件生成", 5000, 0.62, 0.5, 310, 70, 100, 65, 40),
]
ranked = sorted(
workflows,
key=lambda item: item.useful_work_per_dollar,
reverse=True,
)
print(f"{'workflow':<20} {'useful_work':>12} {'cost':>10} {'work/$':>10}")
for item in ranked:
print(
f"{item.name:<20} "
f"{item.useful_work:>12.2f} "
f"{item.total_cost:>10.2f} "
f"{item.useful_work_per_dollar:>10.4f}"
)
这份记分卡适合做初步比较,但不能代替业务判断。不同价值权重的工作流不应直接比较,除非企业已经建立统一的价值换算规则。对于合规、风控和安全任务,还要设置硬性质量门槛:即使单位成本很低,只要错误率超过上限,也不能扩大部署。
提升效率时,优化整个循环
当指标偏低时,不要立刻更换模型。应先拆解单次任务的执行轨迹,寻找成本和失败集中出现的位置:
- 检查任务是否适合自动化。输入缺失、规则模糊的流程会迫使智能体猜测并反复调用工具。
- 限制规划深度、工具调用次数和最大重试次数,为异常任务设置预算上限。
- 将确定性步骤交给普通代码,例如格式校验、金额计算、权限检查和去重。
- 按任务难度路由模型,让小模型处理分类和提取,把复杂推理交给能力更强的模型。
- 缓存稳定的检索结果,并缩短重复发送的上下文。
- 分析人工接管原因,把高频问题转化为规则、工具改进或输入校验。
效率优化不能以牺牲质量为代价。每次调整都应在固定评估集上比较质量通过率、总成本、延迟和人工接管率,而不是只比较 token 使用量。
从试点走向规模化的投资纪律
扩展智能体工作流之前,可以使用一组明确的准入条件:
- 工作单元有清晰定义,并能由系统或抽样审核验证。
- 全链路成本可追踪,包括人工审核和失败重试。
- 质量达到业务门槛,关键风险有阻断机制和人工接管路径。
- 在真实流量下,每美元有效工作量优于现有流程或可接受的基线。
- 成本、延迟和错误率在峰值负载下没有明显失控。
- 工作流负责人能够解释价值权重、数据来源和评估周期。
对达到门槛的高价值工作流,应逐步扩大流量并继续监控边际回报;对长期无法改善的试点,则应缩减、重新设计或停止投入。智能体时代的 AI 投资管理,不是寻找一次性的最佳模型,而是建立一套持续回答“钱花在哪里、产生了多少有效工作、下一美元应该投向哪里”的运营机制。