模型实测榜单

比较模型与思考档位的成绩、耗时和参考费用。

基于自建私有数据集为什么这样测

数据快照 · 2026/10/1

每个模型展示本项最高实测分,展开查看其他档位。33 个模型 · 81 个配置
评分说明

后端 40% · 前端 30% · 推理 30%,采用同一实测配置。 默认显示各模型在当前评测项中得分最高的档位。

耗时与费用对应当前评测项;切换分类后同步更新。这些数值不代表日常单次请求的速度或价格。

查看任务范围 →了解评测方法 →
排名 按得分
ⓘ
排序方式与筛选条件

质量优先更看重得分;得分与耗时平衡兼顾两者;评测耗时优先更看重任务完成时间。每款模型展示当前偏好下的实测档位。

这里使用的是评测任务耗时,不代表日常对话的响应速度。

全部提供商
排名模型 / 实测档位后端前端知识推理评测用时参考费用对比
01
gpt-6-astra
max
95.597949593m 26s$8.35
02
gpt-6.1-sol新
max
93.895969062m 9s$1.69
03
claude-opus-5-5新
max
90.3848910033m 57s$3.67
04
claude-fable-5-1
max
89.885919579m 7s$26.15
05
claude-sonnet-5-5新
xhighAnthropic
86.686898548m 32s$2.80
06
grok-4.7
high
84.3878085196m 18s$5.25
07
gpt-6-sol新
xhigh
82.780947539m 22s$1.10
08
claude-opus-5
max
82.670879592m 12s$7.99
09
grok-4.6
xhigh
80.7788085144m 16s$2.51
10
gpt-5.6-sol
max
78.485737587m 21s$3.25
11
claude-opus-4-8
xhigh
77.5618790102m 10s$9.18
12
k3
highMoonshot
74.5708570158m 17s$3.28
13
mimo-v2.6-pro新
defaultXiaomi MiMo
73.0708565336m 3s$0.66
14
gpt-5.6-terra
max
71.7817655133m 2s$1.94
15
hy4-preview
highTencent Hunyuan
71.0747365218m 41s$1.63
16
space-bunny新
default其他
70.961807562m 35s$0.000
17
deepseek-v4.1-flash
max
70.762886535m 40s$0.41
18
glm-5.3
max
70.4657870157m 1s$1.83
19
MiniMax-M3.1-Flash-Preview新
max
69.675577554m 7s暂无暂无费用
20
Qwen 3.8 Flash
defaultQwen
68.3688750134m 31s$0.42
21
step-5-preview新
defaultStepFun
68.261717598m 22s$1.24
22
deepseek-v4-pro
max
65.267636593m 15s$1.15
23
k2.8 preview
high
64.254727070m 58s$0.66
24
gpt-6-luna新
xhigh
63.862805063m 52s$0.061
25
Gemini 3.8 Flash High
defaultGoogle
63.464864025m 21s$0.13费用未齐
26
deepseek-v4-flash
high
62.558765598m 25s$0.42
27
deepseek-v4-flash-vision-exp
high
58.361437088m 43s$0.32
27
Qwen 3.8 Max
defaultQwen
58.3646940133m 3s$3.41费用未齐
29
mimo-v2.6-flash新
defaultXiaomi MiMo
58.0587145386m 14s$0.28
30
gpt-5.6-luna
max
56.965782586m 14s$0.35
31
glm-5.3-flash
max
56.1547540100m 0s$0.078费用未齐
32
Gemini 3.7 Flash High
defaultGoogle
54.063712524m 19s$0.13
33
MiniMax-M3
highMiniMax
52.946655056m 33s$0.62费用未齐
各模型采用本项最高分档位;同分并列。
后端 40% · 前端 30% · 推理 30%,采用同一实测配置。 评测范围与数据来源 →