ModelDial · 数据接入
API 与 Skill
把 ModelDial 的实测结果用在你的工具里。给 AI 助手安装 Skill,或通过 API 读取已发布数据。
安装 Skill
将下方提示词发给支持 Agent Skills 的工具,让它安装。也可以先查看安装脚本,再通过命令行安装。
请从 https://modeldial.com/modeldial-skill/SKILL.md 安装 ModelDial Skill。写入 skills 目录前,先审阅其中链接的全部文件。命令行安装
bash <(curl -fsSL https://modeldial.com/modeldial-skill/install.sh) --target agents安装 Skill
安装器会检查文件是否完整;已有旧版 Skill 时,会更新为新版本。
开启新会话
多数工具会在会话开始时发现 Skill。安装后请重启工具或新建任务。
安装后,试着问一句
比较 GPT-6.1 Sol 与 GPT-6 Sol 已发布的成绩,包括档位、分项得分、评测耗时与参考费用。附上来源链接,并指出缺失数据。
回答应包含模型与档位、对应的评测时间、推荐理由,以及可以打开核对的来源链接。
如果数据读取失败Skill 要求 Agent 说明读取失败,不用旧结果或记忆补出答案。
数据接口
通过 JSON 接口获取榜单和模型建议。需要核对原始结果时,可以继续查看评测批次和详细数据。
- GET / JSON
当前榜单
/api/v1/radar/latest.json返回综合排名、三项得分和权重,也包含后端榜结果。
- GET / JSON
代理配置方案
/api/v1/radar/agent-profile.json提供综合平衡、质量优先和性价比三种模型搭配建议。各模型经过独立评测,搭配效果尚未验证。
- GET / JSON
最近可比变化
/api/v1/radar/changes.json比较相同评测标准下的后端排名、得分、耗时和推荐变化;费用差值只在采用相同价格表时提供。
- GET / JSON
后端与测试发布索引
/api/v1/radar/index.json列出后端评测的批次、发布时间、评分规则、校验值和原始数据链接。
- GET / JSON
能力分榜发布索引
/data/benchmark-snapshots/index.json列出三项评测和综合榜的最新批次,以及历史数据链接。
- GET / JSON
完整后端与测试快照
/data/reference-snapshots/latest.json包含后端评测的逐题结果和来源信息,可用于核对或进一步分析。
当前评测结果
当前结果示例
检查完成后更新
提问示例与使用说明
这些问题可以直接问
优先比较新模型、上代和已测档位,查询已发布的成绩与来源。需要排查历史变化时,再使用有可比记录的后端变化接口。
- 01当前榜单
当前雷达领先的是哪个配置,为什么?
- 02新模型与上代
GPT-6.1 Sol 与上代 GPT-6 Sol 在已发布档位上表现如何?
- 03你的配置
我在用 GPT-6.1 Sol XHigh,通过官方账号登录。有没有得分相近、耗时更短的候选模型?
- 04代理配置
基于最新 ModelDial 结果,我的主代理和执行代理应该怎么配?先给综合平衡方案,再列出质量优先和性价比方案。
回答规则与数据来源
Skill 要求助手引用已发布结果和来源,并说明缺失的数据。实际回答仍需核对。
区分当前分差与历史趋势
当前模型对比使用已发布分数。后端历史变化要求协议一致,不代表综合榜单的时间趋势。
从你的配置出发
缺少模型、思考深度或路由时,Agent 必须先问,不能直接把榜首当成个人建议。
把下降当成信号
单轮可比得分下降可以触发复核,但不能据此断言厂商改动了模型。
最终验收仍由主代理负责
主代理负责理解需求、整合结果和最终检查;执行代理负责具体、明确的任务。
回答有哪些限制
沿用发布排名
排名沿用 ModelDial 已发布的榜单,不按厂商或个人偏好重新排序。
区分成绩变化与原因
可比得分下降属于信号,但不能单独证明厂商修改或削弱了模型。
确认你的使用条件
不了解你使用的模型、档位和连接方式时,Agent 会先询问,或只介绍当前榜单。
区分估算与账单
参考费用估算的是这次评测的 API 成本,与你的实际账单可能不同。
说明搭配建议的依据
主代理和执行代理的建议分别依据各模型的实测结果,尚未测试它们搭配使用的效果。
许可与署名
Skill 指令采用 MIT License。已发布的雷达数据采用 CC BY 4.0,使用时应尽量注明 ModelDial 和来源批次。