评测方法与结果更新
榜单记录已完成的实测结果。下面说明各项评分、综合分计算,以及成绩如何更新。
每项成绩对应明确的任务范围
后端与测试
识别冲突与遗漏,给出可核验的处理方案;检查约束、边界条件和回归覆盖。
后端集共 5 道题,每题满分 20 分,总分 100。按对应版本的规则检查答案、约束、异常处理和回归证据,保留每题得分。
前端与交互
结合任务检查功能、状态维护与交互反馈,按该任务的评分规则汇总成绩。
前端集测试一个网页应用及其交互流程,总分 100。不同评分版本使用各自的维度与权重;例如 r11 按布局 20、交互 20、状态连续性 20、可访问性与反馈 15、状态预测 15、回归 10 计分。具体记录的维度与满分可在对比页展开查看。
知识与推理
按答案正确性计分,并保留学科维度的表现。成绩反映本次任务范围。
当前知识推理集含 20 道跨学科问题,按正确答案数 ÷ 20 × 100 计分,并保留各学科的题数与正确数。未答对的有效答案记为错误;请求失败不作为零分答案发布。
有效答案按规则计分,即使得分较低也保留。请求失败、输出不完整或评测未完成时,不生成新的有效成绩,也不覆盖该配置已有成绩。
查看评测集与任务范围综合分采用同一实测配置
三项成绩按权重加总,展示到小数点后一位。缺少任一项时,不补零,也不生成完整综合分。
思考档位、耗时与费用
思考档位是请求模型时使用的推理设置,例如 High 或 Max;同名档位在不同提供商之间不一定相同。榜单默认展示该模型在所选评测项中的最高分档位。展开可看其他档位;对比中可分别调整档位,或以共同档位比较。
参考费用按记录的用量和价格估算,评测用时是完成这些任务的时间。费用不完整时会标注,不能据此推算日常对话的响应速度或订阅支出。
新结果如何更新榜单
新模型发布后第一时间评测,核验通过后更新对应模型和档位。已有模型保留已发布成绩,不承诺定期重测。未参与、失败或未完成的评测不会清除已有成绩;网页检查的是数据更新。
单次分差说明这次任务中的表现,不等于稳定领先或所有领域的能力。不同评分规则的历史记录保留其来源信息。
通过 API 获取成绩与来源