怎么给两个模型出一套自己信得过的题
榜单跑分和你的活不是一回事。这是我给 Opus 5 和 Fable 5 出 8 道题的完整方法:判分怎么机械化、主观题怎么盲评、以及我把题出砸了的那部分。
3 篇文章
榜单跑分和你的活不是一回事。这是我给 Opus 5 和 Fable 5 出 8 道题的完整方法:判分怎么机械化、主观题怎么盲评、以及我把题出砸了的那部分。
用完全相同的提示词让 Opus 5 和 Fable 5 跑 8 项测试:数学、逻辑、算法、找 bug、指令遵循、信息提取、决策备忘录、Agentic ETL。总分 52.63 vs 53.25,差距比价格差小得多。
GPT-5.6 Sol、Terra、Luna 各推理档位的 Juice 值测试记录。