最贵的模型为什么卖不动:企业 AI 采购正在回到投入产出比

2026-08-26 39 预计阅读时间: 1 分钟
来源: oschina.net AI 摘要 Original link

Disclaimer: This article is an AI-assisted summary. Read it together with the original source when precision matters. The summary may omit context, version differences, or edge cases and is not official documentation.

预计阅读时间:9 分钟

Anthropic 最贵的模型 Fable 发布两个多月后,企业支出占比仍稳定在约 11%。根据 Ramp 收集的 7 万家公司支出数据,另外约 89% 的支出流向了旧款、更便宜的模型。

这组数字刺眼的地方,不只是“旗舰模型卖得不好”,而是它提醒 AI 团队重新审视一个问题:企业采购模型时,真正购买的到底是能力上限,还是单位任务的可交付结果?

旗舰能力不等于企业主流需求

从模型厂商的视角看,最强模型通常承担技术标杆的角色。它需要在复杂推理、长上下文、代码生成、工具调用或专业任务上达到更高上限,因此价格也往往更高。

但企业的实际调用量通常由另一组因素决定:

  • 请求是否高频、稳定且可预测;
  • 输出是否足够好,而不是理论上最好;
  • 延迟是否满足交互式产品要求;
  • 单次调用成本能否纳入预算;
  • 是否容易限流、监控、缓存和审计。

如果一个便宜模型已经能完成客服摘要、工单分类、字段提取、营销文案初稿或内部搜索,那么企业没有理由为每一次请求都支付旗舰价格。

这也解释了为什么“最强模型”与“最大用量”经常不是同一个产品。旗舰模型可能处理少量高价值任务,例如复杂代码审查、关键决策材料分析或困难问题兜底;更便宜的模型则负责大量重复性工作。

企业买的是结果,不是排行榜名次

模型评测通常强调准确率、推理能力和综合排名,但企业采购还需要看一组运营指标:

  1. 单个有效结果的成本,而不是单次请求价格。
  2. 任务完成率,而不是孤立测试集分数。
  3. 端到端延迟,包括重试、工具调用和人工介入。
  4. 失败后的补救成本,例如重新生成、人工复核和错误业务动作。
  5. 迁移与锁定成本,包括 API 兼容性、日志格式和供应商切换难度。

一个模型即使单价更低,如果经常需要重试,也可能并不便宜。反过来,一个价格更高的模型如果能显著减少人工审核,也可能在特定流程中更划算。

因此,企业不应只问“哪个模型最强”,而应该问:

对这个具体任务,哪个模型能以可接受的成本稳定地产出合格结果?

用实际数据做模型路由

可以把模型选择从一次性的技术偏好,变成基于任务和成本的路由策略。下面是一个可以直接运行和改造的 Python 示例。它用一个简单的评分函数,在质量、延迟和成本之间做权衡。

运行前只需要修改 models 中的示例数据,以及 task 对质量、延迟和成本的权重。实际系统中,这些数据应来自线上日志、离线评测和财务账单。

from dataclasses import dataclass


@dataclass
class Model:
    name: str
    quality: float       # 0-100,来自任务评测
    latency_ms: float    # 平均端到端延迟
    cost_per_1k: float   # 每 1,000 次调用的成本,单位:美元


def choose_model(models, quality_weight, latency_weight, cost_weight):
    max_latency = max(model.latency_ms for model in models)
    max_cost = max(model.cost_per_1k for model in models)

    ranked = []
    for model in models:
        latency_score = 100 * (1 - model.latency_ms / max_latency)
        cost_score = 100 * (1 - model.cost_per_1k / max_cost)
        total = (
            quality_weight * model.quality
            + latency_weight * latency_score
            + cost_weight * cost_score
        )
        ranked.append((total, model))

    return max(ranked, key=lambda item: item[0])


models = [
    Model("fable", quality=96, latency_ms=1800, cost_per_1k=18.0),
    Model("balanced", quality=91, latency_ms=900, cost_per_1k=5.0),
    Model("fast-cheap", quality=84, latency_ms=350, cost_per_1k=1.2),
]

# 客服摘要更看重成本和延迟;复杂代码审查可以提高质量权重。
for task_name, weights in {
    "ticket_summary": (0.45, 0.20, 0.35),
    "code_review": (0.70, 0.15, 0.15),
}.items():
    score, model = choose_model(models, *weights)
    print(f"{task_name}: {model.name}, score={score:.2f}")

这个示例没有把“最强模型”永久绑定到所有任务,而是允许不同工作流使用不同策略。生产环境还应补充以下约束:

  • 对高风险任务设置最低质量分,低于阈值时禁止路由到便宜模型;
  • 对输出格式严格的任务增加结构化校验和自动重试;
  • 对涉及隐私或合规的数据增加供应商、区域和留存策略过滤;
  • 记录模型版本,避免供应商升级后无法解释成本和质量变化;
  • 使用抽样人工审核验证线上质量,而不是只看 API 成功率。

11% 不是失败,而是产品分层的信号

如果 Fable 的企业支出占比稳定在约 11%,这并不必然意味着旗舰模型没有价值。它可能说明旗舰模型更适合高价值、低频、难以自动化的任务,而不是企业的默认模型。

真正值得关注的是产品分层是否清晰:

  • 便宜模型负责规模化和高频调用;
  • 中档模型覆盖大多数通用工作流;
  • 旗舰模型解决复杂任务和质量兜底;
  • 路由、缓存、批处理和评测系统把三者连接起来。

对模型厂商来说,这意味着不能只靠发布更强模型来推动收入,还要提供让企业容易控制成本、验证质量和迁移工作流的产品能力。对企业来说,则意味着采购合同和技术架构都应避免“全量默认旗舰”的简单方案。

给 AI 团队的落地清单

在扩大模型预算之前,可以先完成一轮小规模审计:

  • 按业务任务统计调用量、成功率、延迟和实际成本;
  • 为每类任务建立最低可接受质量标准;
  • 用便宜模型、中档模型和旗舰模型进行盲测;
  • 计算“每个合格结果”的成本,而不是只比较 token 单价;
  • 为高风险请求保留升级到旗舰模型的路径;
  • 每月检查模型版本变化、账单变化和人工补救成本。

企业 AI 的竞争重点正在从“谁的模型最强”转向“谁能把正确的模型用在正确的任务上”。当 89% 的支出仍然流向更便宜的模型时,市场传递出的信息很直接:能力上限重要,但可持续的单位经济性更接近真实采购决策。


相关推荐