Anthropic 最贵的模型 Fable 发布两个多月后,企业支出占比仍稳定在约 11%。根据 Ramp 收集的 7 万家公司支出数据,另外约 89% 的支出流向了旧款、更便宜的模型。
这组数字刺眼的地方,不只是“旗舰模型卖得不好”,而是它提醒 AI 团队重新审视一个问题:企业采购模型时,真正购买的到底是能力上限,还是单位任务的可交付结果?
旗舰能力不等于企业主流需求
从模型厂商的视角看,最强模型通常承担技术标杆的角色。它需要在复杂推理、长上下文、代码生成、工具调用或专业任务上达到更高上限,因此价格也往往更高。
但企业的实际调用量通常由另一组因素决定:
- 请求是否高频、稳定且可预测;
- 输出是否足够好,而不是理论上最好;
- 延迟是否满足交互式产品要求;
- 单次调用成本能否纳入预算;
- 是否容易限流、监控、缓存和审计。
如果一个便宜模型已经能完成客服摘要、工单分类、字段提取、营销文案初稿或内部搜索,那么企业没有理由为每一次请求都支付旗舰价格。
这也解释了为什么“最强模型”与“最大用量”经常不是同一个产品。旗舰模型可能处理少量高价值任务,例如复杂代码审查、关键决策材料分析或困难问题兜底;更便宜的模型则负责大量重复性工作。
企业买的是结果,不是排行榜名次
模型评测通常强调准确率、推理能力和综合排名,但企业采购还需要看一组运营指标:
- 单个有效结果的成本,而不是单次请求价格。
- 任务完成率,而不是孤立测试集分数。
- 端到端延迟,包括重试、工具调用和人工介入。
- 失败后的补救成本,例如重新生成、人工复核和错误业务动作。
- 迁移与锁定成本,包括 API 兼容性、日志格式和供应商切换难度。
一个模型即使单价更低,如果经常需要重试,也可能并不便宜。反过来,一个价格更高的模型如果能显著减少人工审核,也可能在特定流程中更划算。
因此,企业不应只问“哪个模型最强”,而应该问:
对这个具体任务,哪个模型能以可接受的成本稳定地产出合格结果?
用实际数据做模型路由
可以把模型选择从一次性的技术偏好,变成基于任务和成本的路由策略。下面是一个可以直接运行和改造的 Python 示例。它用一个简单的评分函数,在质量、延迟和成本之间做权衡。
运行前只需要修改 models 中的示例数据,以及 task 对质量、延迟和成本的权重。实际系统中,这些数据应来自线上日志、离线评测和财务账单。
from dataclasses import dataclass
@dataclass
class Model:
name: str
quality: float # 0-100,来自任务评测
latency_ms: float # 平均端到端延迟
cost_per_1k: float # 每 1,000 次调用的成本,单位:美元
def choose_model(models, quality_weight, latency_weight, cost_weight):
max_latency = max(model.latency_ms for model in models)
max_cost = max(model.cost_per_1k for model in models)
ranked = []
for model in models:
latency_score = 100 * (1 - model.latency_ms / max_latency)
cost_score = 100 * (1 - model.cost_per_1k / max_cost)
total = (
quality_weight * model.quality
+ latency_weight * latency_score
+ cost_weight * cost_score
)
ranked.append((total, model))
return max(ranked, key=lambda item: item[0])
models = [
Model("fable", quality=96, latency_ms=1800, cost_per_1k=18.0),
Model("balanced", quality=91, latency_ms=900, cost_per_1k=5.0),
Model("fast-cheap", quality=84, latency_ms=350, cost_per_1k=1.2),
]
# 客服摘要更看重成本和延迟;复杂代码审查可以提高质量权重。
for task_name, weights in {
"ticket_summary": (0.45, 0.20, 0.35),
"code_review": (0.70, 0.15, 0.15),
}.items():
score, model = choose_model(models, *weights)
print(f"{task_name}: {model.name}, score={score:.2f}")
这个示例没有把“最强模型”永久绑定到所有任务,而是允许不同工作流使用不同策略。生产环境还应补充以下约束:
- 对高风险任务设置最低质量分,低于阈值时禁止路由到便宜模型;
- 对输出格式严格的任务增加结构化校验和自动重试;
- 对涉及隐私或合规的数据增加供应商、区域和留存策略过滤;
- 记录模型版本,避免供应商升级后无法解释成本和质量变化;
- 使用抽样人工审核验证线上质量,而不是只看 API 成功率。
11% 不是失败,而是产品分层的信号
如果 Fable 的企业支出占比稳定在约 11%,这并不必然意味着旗舰模型没有价值。它可能说明旗舰模型更适合高价值、低频、难以自动化的任务,而不是企业的默认模型。
真正值得关注的是产品分层是否清晰:
- 便宜模型负责规模化和高频调用;
- 中档模型覆盖大多数通用工作流;
- 旗舰模型解决复杂任务和质量兜底;
- 路由、缓存、批处理和评测系统把三者连接起来。
对模型厂商来说,这意味着不能只靠发布更强模型来推动收入,还要提供让企业容易控制成本、验证质量和迁移工作流的产品能力。对企业来说,则意味着采购合同和技术架构都应避免“全量默认旗舰”的简单方案。
给 AI 团队的落地清单
在扩大模型预算之前,可以先完成一轮小规模审计:
- 按业务任务统计调用量、成功率、延迟和实际成本;
- 为每类任务建立最低可接受质量标准;
- 用便宜模型、中档模型和旗舰模型进行盲测;
- 计算“每个合格结果”的成本,而不是只比较 token 单价;
- 为高风险请求保留升级到旗舰模型的路径;
- 每月检查模型版本变化、账单变化和人工补救成本。
企业 AI 的竞争重点正在从“谁的模型最强”转向“谁能把正确的模型用在正确的任务上”。当 89% 的支出仍然流向更便宜的模型时,市场传递出的信息很直接:能力上限重要,但可持续的单位经济性更接近真实采购决策。