先比较新模型与已有档位
例如先比较 GPT-6.1 Sol 与 GPT-6 Sol,再比较新模型的 High 与 Max。优先看自己需要的分项,不把不同模型之间的分差当成同一模型的时间趋势。
实测完成时间与快照发布时间要分开。一次发布可能汇集不同日期的已有结果;换了连接或评分规则后,也不能直接延续原来的趋势。
需要排查回退时,再查历史证据
在榜单展开模型,查看各思考档位的成绩;在对比页查看任务和学科细项。需要判断随时间发生的变化时,可从 API 页的发布索引获取历史结果。
- 观察协议一致的多个批次是否重复下降,不因一个孤立低分下结论。
- 确认变化集中在某一道题、某个思考深度、某条路由,还是整个模型系列。
- 质量稳定但延迟升高,与得分下降且伴随失败,应按不同问题处理。
切换前用自己的路由复核
公开榜单来自 ModelDial 的评测。如果你自己用起来表现不同,还需要检查账号登录、连接方式和端点是否正常。
如果分数持续下降,可以在本机再测一次,并检查错误记录。也可以试试相邻档位或备用连接,确认候选模型达到要求后再切换。