ModelDial · 模型实测

gpt-5.6-terra

比较各思考档位在私有数据集上的表现。分项成绩与费用均来自对应的实测记录。

最高综合分71.7

gpt-5.6-terra · max

后端与测试
81
前端与交互
76
知识与推理
55
评测用时
133m 2s
参考费用
$1.94

同一配置的三项评测合计;费用按 API 用量估算。

综合第 14 / 33 个模型 · 最高分档位

后端实测 · 2026/9/21

上方已发布成绩来自同一档位。各项评测可能在不同时间完成;后端日期仅对应后端实测。

查看任务范围与评分依据 →

档位收益与代价

比较相邻实测档位的得分、费用与用时。

xhigh max
综合分
+12.8 分
58.9 71.7
参考费用
+$0.40
$1.54 $1.94
评测用时
+97.7%
67m 17s 133m 2s
查看完整对比 →

各档位实测成绩

选择两到三个配置,比较分数与费用。

左右滑动查看完整成绩 →

模型 / 档位综合后端与测试前端与交互知识与推理评测用时参考费用对比
low36.553213043m 42s$0.71
medium49.649505046m 2s$0.75
high59.665674553m 5s$1.03
xhigh58.967723567m 17s$1.54
max71.7817655133m 2s$1.94

如何理解结果

上方分项成绩采用最高综合分所在的同一配置。完整综合分需要三项成绩,缺失结果显示为横线。

数据快照发布于 2026/10/1