Claude Opus 5 vs Claude Fable 5:8 项同题实测

Fable 5 是 Anthropic 新的 Mythos 级模型,定位在 Opus 之上,价格也是 Opus 5 的两倍($10/$50 vs $5/$25 每百万 token)。但 7 月的公开榜单上 Opus 5 反而在多数基准反超了它:Frontier-Bench 43.3% vs 33.7%,Artificial Analysis 61 vs 60。Fable 5 的优势区集中在 SWE-bench Pro(80.0 vs 79.2)和长时程自主任务。
榜单归榜单,我自己搭了一套小测试,让两个模型在完全相同的提示词和工作条件下跑一遍,看看日常干活场景里到底差多少。
说明:单次运行(n=1)的个人测试记录,无法度量方差,结论只能作方向性参考,不是严谨评测。
测试方法
- 执行环境:Claude Code 的 Agent 工具,分别指定 model=opus 和 model=fable,两边提示词逐字相同
- 8 项测试覆盖:数学推理、逻辑约束、算法实现、代码找 bug、指令遵循、信息提取、决策备忘录、Agentic 文件任务
- 判分尽量机械化:数学/逻辑答案经暴力枚举验证,算法用 9 个隐藏 pytest 用例,指令遵循和 ETL 用脚本校验
- 唯一的主观题(决策备忘录)用双评委盲评:sonnet 和 opus 各评一次,A/B 位置互换,评委不知道作者是谁
结果总表
| 测试项 | 满分 | Opus 5 | Fable 5 |
|---|---|---|---|
| T1 数学推理(禁工具) | 3 | 3 | 3 |
| T2 逻辑约束求解(禁工具) | 5 | 5 | 5 |
| T3 算法实现(隐藏测试) | 9 | 9 | 9 |
| T4 代码找 bug(6 个埋点) | 6 | 5 | 5 |
| T5 指令遵循(7 条硬约束) | 7 | 7 | 7 |
| T6 信息提取 + 日期推算 | 8 | 8 | 8 |
| T7 决策备忘录(盲评) | 10 | 8.63 | 9.25 |
| T8 Agentic ETL | 7 | 7 | 7 |
| 总分 | 55 | 52.63 | 53.25 |
总耗时:Opus 5 用了 344.1 秒,Fable 5 用了 332.5 秒,基本相当。
几个有意思的观察
客观题完全打平,连漏掉的 bug 都是同一个
45 分的客观题两边都拿了 44。丢的那 1 分在找 bug 环节:6 个埋点里双方都找到了同样的 5 个,都漏掉了同一个,int(latency_s) 把小数延迟记录静默丢弃(应为 float)。
两个模型的盲区高度重合,这可能比分数本身更说明问题。显眼的 bug 敏感度一致,「类型转换吃掉数据」这类安静的 bug 也一起迟钝。
工作风格有差异:验证方式和工具调用次数
算法题两边都全过隐藏测试,但自测风格完全不同。Fable 5 写了 300 组随机对拍来验证自己的实现,Opus 5 手写了 11 个用例。
ETL 任务两边输出完全正确(10 行合并订单、总收入分毫不差),Opus 5 用了 11 次工具调用,Fable 5 用了 9 次。方向性地看,Fable 更倾向重验证,动作也稍微省一点。
主观题是唯一拉开差距的地方
决策备忘录题目是个经典架构选型:pgvector p95 180ms 要压到 100ms 以下,2000 万向量一年翻三倍,在「深度优化 pgvector / 自建向量库 / 云托管」三个方案里选一个写给 CTO。
两个模型都选了自建 Qdrant,结构也都齐整。差别在策略。Fable 5 给出的是双轨方案:先用 30 天对 pgvector 做止血优化(halfvec 量化、ef_search 调参)压到 120ms 左右,为迁移争取从容窗口,同时并行建设 Qdrant 终局,结尾一句「用 A 买时间,用 B 建终局」。Opus 5 是纯迁移路径加决策闸门,严谨但没管过渡期。
盲评出了个插曲。opus 评委的评审任务跑了两轮,给出两份分差不同的记分卡(9.5 vs 8.5 和 8.5 vs 8.25),聚合时取了它的最终轮。
但要点是,包括 sonnet 评委在内,三张记分卡在 A/B 位置互换下全部把 Fable 的备忘录排在前面,理由都指向同一点:双轨策略更有工程现实感。排名很稳,分差本身倒是印证了「模型当裁判自己也有方差」。
都不太守「不要输出其他内容」
好几项测试要求「只输出答案」。Opus 5 在 3 项里加了被禁止的前言或推理过程,Fable 5 在 2 项里加了。不过这项有个混杂因素:子代理框架本身要求返回结果摘要,可能诱导附加文本,只能作参考。
怎么看
这套测试里两个模型几乎不可区分:客观能力打平,速度打平,唯一差距是主观题上 Fable 5 的决策质量小胜一筹。
结合价格看,结论比较清晰。
日常的数学、逻辑、代码、提取、ETL 类任务,Opus 5 用一半的价格给出同等结果,还有 Fast Mode 可用,是性价比选项。
Fable 5 的差异化在开放式判断题。它在备忘录里那种「先止血再建终局」的策略感,和公开基准里它擅长长时程自主任务的画像对得上。选型时还要记得它附带 30 天数据留存要求和更高的安全分类器触发率。
单次运行的小样本,以上都是方向性参考。等有空跑 n=5 再看方差。