智能体时代的 AI 投资管理:用“每美元有效工作量”衡量真实回报

2026-07-14 27 预计阅读时间: 1 分钟
来源: openai.com AI 摘要 Original link

Disclaimer: This article is an AI-assisted summary. Read it together with the original source when precision matters. The summary may omit context, version differences, or edge cases and is not official documentation.

预计阅读时间:9 分钟

企业进入智能体时代后,AI 成本不再只是一次模型调用的价格。一个智能体可能规划任务、查询系统、调用工具、反复重试,最后还需要人工审核。此时,只看 token 单价、调用次数或演示效果,很容易低估成本,也无法回答管理层真正关心的问题:每投入一美元,究竟完成了多少可用工作?

更合适的管理单位是“每美元有效工作量”。它把业务结果、质量门槛和全链路成本放在同一个指标里,用于比较工作流、定位浪费,并决定哪些项目值得扩大规模。

不要把模型调用当成业务成果

智能体可以成功返回答案,不代表它完成了有价值的工作。例如,客服智能体生成了一封回复,但客户随后再次来电;采购智能体填写了订单,却选错了供应商;研发智能体提交了代码,但没有通过测试。这些都不能计入完整的有效工作。

企业可以按工作流定义一个可验证的“工作单元”:

  • 客服:一次无需升级给人工、且在观察期内没有重复联系的已解决工单。
  • 财务:一张通过规则校验和抽样复核的已处理发票。
  • 研发:一个通过测试、代码审查并成功合并的变更。
  • 销售运营:一条字段完整、来源可追踪且通过去重检查的客户记录。

在此基础上,可以使用一个简单指标:

每美元有效工作量 = 完成数量 × 质量通过率 × 业务价值权重 / 全链路成本

业务价值权重不是必需项。如果不同工作单元的价值相近,可以直接省略;如果同一平台处理的任务差异很大,则可以用节省时间、降低损失或带来的收入作为权重。权重应由业务负责人确认,避免团队为了提高指标自行调整口径。

成本分母必须覆盖整个智能体链路

智能体系统的成本通常分散在多个位置。除了模型输入和输出 token,还应记录:

  • 搜索、数据库、浏览器、代码执行器等工具调用费用。
  • 向量数据库、运行容器、网络和可观测性基础设施。
  • 失败重试、超时恢复和重复执行产生的成本。
  • 人工审核、异常处理和升级接管所花费的时间。
  • 安全检查、评估任务以及维护提示词和工具接口的工程投入。

如果只统计模型账单,一个大量重试、频繁转人工的智能体可能看起来非常便宜。全链路成本能暴露真正的效率问题,也便于比较“小模型加严格流程”和“大模型直接处理”等不同方案。

建议同时观察中位数和 P95 成本。平均成本可能掩盖少量失控任务,而智能体的长尾执行往往正是预算超支和用户等待的来源。

可以这样实践:建立最小化投资记分卡

下面是一个可直接运行的 Python 示例。它假设每条记录代表一个工作流在某个统计周期内的汇总结果,并用“质量调整后的有效工作量 / 全链路成本”排序。实际接入时,可以把示例数据替换为数据仓库查询结果。

将代码保存为 ai_portfolio_scorecard.py,然后运行 python ai_portfolio_scorecard.py

from dataclasses import dataclass


@dataclass
class Workflow:
    name: str
    completed: int
    quality_pass_rate: float
    value_weight: float
    model_cost: float
    tool_cost: float
    infrastructure_cost: float
    review_hours: float
    reviewer_hourly_cost: float

    @property
    def useful_work(self) -> float:
        return self.completed * self.quality_pass_rate * self.value_weight

    @property
    def total_cost(self) -> float:
        human_cost = self.review_hours * self.reviewer_hourly_cost
        return (
            self.model_cost
            + self.tool_cost
            + self.infrastructure_cost
            + human_cost
        )

    @property
    def useful_work_per_dollar(self) -> float:
        return self.useful_work / self.total_cost if self.total_cost else 0.0


workflows = [
    Workflow("客服工单分类", 12000, 0.97, 1.0, 180, 90, 120, 18, 35),
    Workflow("供应商尽调", 420, 0.91, 8.0, 260, 340, 180, 42, 55),
    Workflow("销售邮件生成", 5000, 0.62, 0.5, 310, 70, 100, 65, 40),
]

ranked = sorted(
    workflows,
    key=lambda item: item.useful_work_per_dollar,
    reverse=True,
)

print(f"{'workflow':<20} {'useful_work':>12} {'cost':>10} {'work/$':>10}")
for item in ranked:
    print(
        f"{item.name:<20} "
        f"{item.useful_work:>12.2f} "
        f"{item.total_cost:>10.2f} "
        f"{item.useful_work_per_dollar:>10.4f}"
    )

这份记分卡适合做初步比较,但不能代替业务判断。不同价值权重的工作流不应直接比较,除非企业已经建立统一的价值换算规则。对于合规、风控和安全任务,还要设置硬性质量门槛:即使单位成本很低,只要错误率超过上限,也不能扩大部署。

提升效率时,优化整个循环

当指标偏低时,不要立刻更换模型。应先拆解单次任务的执行轨迹,寻找成本和失败集中出现的位置:

  1. 检查任务是否适合自动化。输入缺失、规则模糊的流程会迫使智能体猜测并反复调用工具。
  2. 限制规划深度、工具调用次数和最大重试次数,为异常任务设置预算上限。
  3. 将确定性步骤交给普通代码,例如格式校验、金额计算、权限检查和去重。
  4. 按任务难度路由模型,让小模型处理分类和提取,把复杂推理交给能力更强的模型。
  5. 缓存稳定的检索结果,并缩短重复发送的上下文。
  6. 分析人工接管原因,把高频问题转化为规则、工具改进或输入校验。

效率优化不能以牺牲质量为代价。每次调整都应在固定评估集上比较质量通过率、总成本、延迟和人工接管率,而不是只比较 token 使用量。

从试点走向规模化的投资纪律

扩展智能体工作流之前,可以使用一组明确的准入条件:

  • 工作单元有清晰定义,并能由系统或抽样审核验证。
  • 全链路成本可追踪,包括人工审核和失败重试。
  • 质量达到业务门槛,关键风险有阻断机制和人工接管路径。
  • 在真实流量下,每美元有效工作量优于现有流程或可接受的基线。
  • 成本、延迟和错误率在峰值负载下没有明显失控。
  • 工作流负责人能够解释价值权重、数据来源和评估周期。

对达到门槛的高价值工作流,应逐步扩大流量并继续监控边际回报;对长期无法改善的试点,则应缩减、重新设计或停止投入。智能体时代的 AI 投资管理,不是寻找一次性的最佳模型,而是建立一套持续回答“钱花在哪里、产生了多少有效工作、下一美元应该投向哪里”的运营机制。


相关推荐