从任务与评分依据开始
比较标准必须一致。在更简单或不同标准下更快,不能说明它完成同一任务更快。
同时留意连接方式。即使模型相同,服务排队、地区网络和服务档位也会影响实际耗时。
比较成功完成耗时,不要使用误导性平均值
很快报错不等于完成得快。比较速度时,应分别查看成功请求的耗时、失败次数和重试情况。
首 Token 时间适合判断交互体感,但编程任务还取决于完整答案和终止事件何时到达。应选择与实际决策一致的时间指标。
费用缺失代表未知,不代表零费用
估算费用需要完整的 Token 用量和适用的价格表。订阅套餐、缓存折扣或用量缺失,都可能让费用无法准确估算。此时显示为空,不代表免费。
- 质量优先:在耗时和预算上限内,选择实测质量最高的配置。
- 综合平衡:在较窄质量区间内,再选更快或参考费用更低的配置。
- 执行 Agent:按它负责的具体任务测试,确认达标后再考虑降低费用。
参考费用与实际账单要分开
榜单参考费用根据本次 API 用量和保存的价格表估算。你的实际账单还可能受到订阅、缓存优惠、地区定价或第三方加价的影响,应以所用服务的账单为准。
把得分与费用放在一起看
费用图展示实测得分与参考费用的关系。可以切换评测分类或筛选提供商,缩小候选范围。