ModelDial · 评测方法

评测方法与结果更新

榜单记录已完成的实测结果。下面说明各项评分、综合分计算,以及成绩如何更新。

每项成绩对应明确的任务范围

后端与测试

识别冲突与遗漏,给出可核验的处理方案;检查约束、边界条件和回归覆盖。

后端集共 5 道题,每题满分 20 分,总分 100。按对应版本的规则检查答案、约束、异常处理和回归证据,保留每题得分。

前端与交互

结合任务检查功能、状态维护与交互反馈,按该任务的评分规则汇总成绩。

前端集测试一个网页应用及其交互流程,总分 100。不同评分版本使用各自的维度与权重;例如 r11 按布局 20、交互 20、状态连续性 20、可访问性与反馈 15、状态预测 15、回归 10 计分。具体记录的维度与满分可在对比页展开查看。

知识与推理

按答案正确性计分,并保留学科维度的表现。成绩反映本次任务范围。

当前知识推理集含 20 道跨学科问题,按正确答案数 ÷ 20 × 100 计分,并保留各学科的题数与正确数。未答对的有效答案记为错误;请求失败不作为零分答案发布。

有效答案按规则计分,即使得分较低也保留。请求失败、输出不完整或评测未完成时,不生成新的有效成绩,也不覆盖该配置已有成绩。

查看评测集与任务范围

综合分采用同一实测配置

后端 40%前端 30%知识推理 30%

三项成绩按权重加总,展示到小数点后一位。缺少任一项时,不补零,也不生成完整综合分。

思考档位、耗时与费用

思考档位是请求模型时使用的推理设置,例如 High 或 Max;同名档位在不同提供商之间不一定相同。榜单默认展示该模型在所选评测项中的最高分档位。展开可看其他档位;对比中可分别调整档位,或以共同档位比较。

参考费用按记录的用量和价格估算,评测用时是完成这些任务的时间。费用不完整时会标注,不能据此推算日常对话的响应速度或订阅支出。

新结果如何更新榜单

新模型发布后第一时间评测,核验通过后更新对应模型和档位。已有模型保留已发布成绩,不承诺定期重测。未参与、失败或未完成的评测不会清除已有成绩;网页检查的是数据更新。

单次分差说明这次任务中的表现,不等于稳定领先或所有领域的能力。不同评分规则的历史记录保留其来源信息。

通过 API 获取成绩与来源