不同供应商的档位没有统一标准
有些 API 用 reasoning effort 参数设置档位;有些则把 Max 写在模型名称里,effort 参数仍显示 default。因此,不能只看一个参数就判断实际档位。
ModelDial 会保留实际请求的模型 ID、思考档位和路由,方便你核对每项成绩对应的设置。
固定其他条件,逐级比较
固定模型、路由和任务,先比较 Low 与 Medium,再比较 Medium 与 High。如果同时换了路由,就很难判断差异是由档位还是连接方式造成的。
- 同时看综合分和分项成绩,确认哪些任务提高了、哪些下降了。
- 比较成功完成的总耗时,不能只看首 Token 时间。
- 没有重复的可比观测时,小分差只说明当前记录中的差异,不能视为稳定。
更高档位是否值得多花时间
更高档位可能花更久,却没有改善你在意的题目。相邻档位的得分也可能因单次波动而反转;先比较已有分项,再按需验证自己的任务。
选择能够稳定满足任务要求的最低档位即可。只负责固定任务的 Agent,可以单独测试合适的档位,不必沿用主力模型的设置。
保存测试时的完整设置
至少保存供应商、原始模型 ID、思考深度、服务档位、路由类型和评测时间。端点或供应商配置发生变化后,只写一个 High 无法复现原结果。
提高档位后的实际变化
查看 gpt-6-astra 相邻实测档位的得分、参考费用与评测用时。切换档位组合,观察投入增加后成绩的变化。