AI 模型评测与比较

在私有数据集上,
比较模型的实际表现。

查看新模型的成绩,比较换代前后的提升,以及提高思考档位带来的得分、耗时和费用变化。

35 个模型 · 83 个配置

综合前五名

满分 100
1
2
3
4
5

代际与档位差异

综合得分

后端 40% · 前端 30% · 推理 30%,采用同一实测配置。

按任务看成绩

查看评测说明 →

基于自建私有数据集,成绩反映本次任务范围。 为什么这样测 →

模型表现与评测费用

完整榜单 →

左上方:费用更低,得分更高 · 每个点对应一个模型与档位

帕累托前沿新模型实测其他配置已绘制 66 / 83 个配置
综合得分 ↑020406080100$0.030$0.10$0.30$1.00$3.00$10.00$30.00三项评测合计参考费用(美元,对数刻度)

点选查看成绩与费用

gpt-6-astra
OpenAImax
综合分95.5参考费用$8.35

三项评测 API 参考费用合计;对数刻度,仅展示费用完整且大于零的配置。 比较方法 →