思考深度

Low、High、Max,思考档位怎么选

提高思考档位,通常意味着给模型更多推理空间,但是否值得多等一会儿,要看实际成绩。不同供应商的同名档位也不一定相同。

判断方法

比较档位时,保持模型、路由和任务不变,逐级尝试。如果得分没有明显改善,却花了更多时间或费用,就没有必要继续提高档位。

不同供应商的档位没有统一标准

有些 API 用 reasoning effort 参数设置档位;有些则把 Max 写在模型名称里,effort 参数仍显示 default。因此,不能只看一个参数就判断实际档位。

ModelDial 会保留实际请求的模型 ID、思考档位和路由,方便你核对每项成绩对应的设置。

固定其他条件,逐级比较

固定模型、路由和任务,先比较 Low 与 Medium,再比较 Medium 与 High。如果同时换了路由,就很难判断差异是由档位还是连接方式造成的。

  • 同时看综合分和分项成绩,确认哪些任务提高了、哪些下降了。
  • 比较成功完成的总耗时,不能只看首 Token 时间。
  • 没有重复的可比观测时,小分差只说明当前记录中的差异,不能视为稳定。

更高档位是否值得多花时间

更高档位可能花更久,却没有改善你在意的题目。相邻档位的得分也可能因单次波动而反转;先比较已有分项,再按需验证自己的任务。

选择能够稳定满足任务要求的最低档位即可。只负责固定任务的 Agent,可以单独测试合适的档位,不必沿用主力模型的设置。

保存测试时的完整设置

至少保存供应商、原始模型 ID、思考深度、服务档位、路由类型和评测时间。端点或供应商配置发生变化后,只写一个 High 无法复现原结果。

结合实测结果看

提高档位后的实际变化

查看 gpt-6-astra 相邻实测档位的得分、参考费用与评测用时。切换档位组合,观察投入增加后成绩的变化。