Claude Fable 5.1 登顶 Artificial Analysis 智能指数,但尽管缓存读取价格下调 75%,其单任务成本仍比 Fable 5 高出 20%
我们与 @AnthropicAI 合作,对 Claude Fable 5.1 进行了发布前评测。在最大推理强度下,它在 Artificial Analysis 智能指数上取得 66 分,这是我们测得的最高分数,领先于 Claude Opus 5(最大强度,63 分)、Claude Fable 5(最大强度,62 分)、GPT-5.6 Sol(最大强度,61 分)和 Grok 4.6(高强度,61 分)。我们使用 Anthropic 的“默认”服务端回退机制对模型进行了评测,该机制会将触发安全标记的请求路由至 Claude Opus 4.8 或 Claude Opus 5;在智能指数评测中,回退机制处理了约 4% 的输出 token。
核心要点
➤ 前沿智能水平,各基准测试均有提升:Fable 5.1 在智能指数上较 Fable 5 提升 4 分。在 HLE 上,Fable 5.1 取得 59.1% 的成绩,超过此前由 Claude Fable 5 保持的 55.5% 最佳成绩。它在 Terminal-Bench v2.1(91.4%)和 SciCode(62.0%)上取得了我们所见过的最高分(微弱领先),在 τ³-Banking 上较 Fable 5 提升 9 分
➤ 缓存读取价格下调 75%,但 Fable 5.1 的单任务成本仍然更高:Anthropic 已将缓存读取价格从每 100 万缓存输入 token 1 美元下调至 0.25 美元,标准定价保持不变,仍为每 100 万输入/输出 token 10 美元/50 美元。Fable 5.1(最大强度)在智能指数上的单任务成本为 3.76 美元,比 Fable 5(最大强度)高出 20%,原因是其输出 token 使用量约为后者的 1.7 倍。缓存价格下调使每个任务节省约 1.40 美元,这部分节省主要集中在智能体评测中,因为其中大部分输入 token 为缓存读取。在 xhigh 推理强度下,Fable 5.1 取得 65 分,单任务成本为 2.72 美元,比最大强度低 1.04 美元,但仍高于 Claude Opus 5(最大强度,63 分)的 2.34 美元
➤ Claude Fable 5.1 占据了“智能 vs 每任务输出 token”帕累托前沿的高端位置:在智能指数上得分高于 GPT-5.6 Sol (medium) 的每一个模型变体,在智能和 token 使用量两方面都会被某个 Fable 5.1 努力级别所匹配或超越
➤ 在智能体工作任务上得分最高,但与 Opus 5 实际持平:Fable 5.1 在我们所测得的智能体知识工作评测中创下最高分——GDPval-AA v2(1,853 Elo,较 Fable 5 高出 +130)和 AA-Briefcase(1,694 Elo,较 Fable 5 高出 +122)。与 Claude Opus 5 相比,GDPval-AA v2 的领先幅度在置信区间内,而 AA-Briefcase(1,685)则实际持平;Fable 5.1 在分析质量和评分标准正确性上领先,但在演示呈现方面落后
其他模型细节:
➤ 上下文窗口:100 万 token,与 Anthropic 近期发布的其他模型一致,支持图像和文本输入。
➤ 定价:Fable 5.1 保留了 Fable 5 的输入、输出和缓存写入价格,分别为每百万 token $10、$50 和 $12.5,但缓存命中价格已降至每百万 token $0.25,相对之前降低了 75%,这将显著降低智能体工作负载的成本。
—— 本文由 AIHOT 聚合整理,完整版与更多 AI 动态见 https://aihot.virxact.com/items/cmtj484a00592roh9jjdf5xkd