ModelDial · 数据接入

API 与 Skill

把 ModelDial 的实测结果用在你的工具里。给 AI 助手安装 Skill,或通过 API 读取已发布数据。

安装 Skill

将下方提示词发给支持 Agent Skills 的工具,让它安装。也可以先查看安装脚本,再通过命令行安装。

安装提示词
请从 https://modeldial.com/modeldial-skill/SKILL.md 安装 ModelDial Skill。写入 skills 目录前,先审阅其中链接的全部文件。
命令行安装
Codex、Gemini CLI、Copilot、OpenCode 手动安装
bash <(curl -fsSL https://modeldial.com/modeldial-skill/install.sh) --target agents
  1. 安装 Skill

    安装器会检查文件是否完整;已有旧版 Skill 时,会更新为新版本。

  2. 开启新会话

    多数工具会在会话开始时发现 Skill。安装后请重启工具或新建任务。

安装后,试着问一句

比较 GPT-6.1 Sol 与 GPT-6 Sol 已发布的成绩,包括档位、分项得分、评测耗时与参考费用。附上来源链接,并指出缺失数据。

回答应包含模型与档位、对应的评测时间、推荐理由,以及可以打开核对的来源链接。

如果数据读取失败Skill 要求 Agent 说明读取失败,不用旧结果或记忆补出答案。

数据接口

通过 JSON 接口获取榜单和模型建议。需要核对原始结果时,可以继续查看评测批次和详细数据。

  • GET / JSON

    当前榜单

    /api/v1/radar/latest.json

    返回综合排名、三项得分和权重,也包含后端榜结果。

  • GET / JSON

    代理配置方案

    /api/v1/radar/agent-profile.json

    提供综合平衡、质量优先和性价比三种模型搭配建议。各模型经过独立评测,搭配效果尚未验证。

  • GET / JSON

    最近可比变化

    /api/v1/radar/changes.json

    比较相同评测标准下的后端排名、得分、耗时和推荐变化;费用差值只在采用相同价格表时提供。

  • GET / JSON

    后端与测试发布索引

    /api/v1/radar/index.json

    列出后端评测的批次、发布时间、评分规则、校验值和原始数据链接。

  • GET / JSON

    能力分榜发布索引

    /data/benchmark-snapshots/index.json

    列出三项评测和综合榜的最新批次,以及历史数据链接。

  • GET / JSON

    完整后端与测试快照

    /data/reference-snapshots/latest.json

    包含后端评测的逐题结果和来源信息,可用于核对或进一步分析。

当前评测结果

当前结果示例

正在核对最新结果

检查完成后更新

提问示例与使用说明

这些问题可以直接问

优先比较新模型、上代和已测档位,查询已发布的成绩与来源。需要排查历史变化时,再使用有可比记录的后端变化接口。

  • 01
    当前榜单
    当前雷达领先的是哪个配置,为什么?
  • 02
    新模型与上代
    GPT-6.1 Sol 与上代 GPT-6 Sol 在已发布档位上表现如何?
  • 03
    你的配置
    我在用 GPT-6.1 Sol XHigh,通过官方账号登录。有没有得分相近、耗时更短的候选模型?
  • 04
    代理配置
    基于最新 ModelDial 结果,我的主代理和执行代理应该怎么配?先给综合平衡方案,再列出质量优先和性价比方案。

回答规则与数据来源

Skill 要求助手引用已发布结果和来源,并说明缺失的数据。实际回答仍需核对。

  1. 区分当前分差与历史趋势

    当前模型对比使用已发布分数。后端历史变化要求协议一致,不代表综合榜单的时间趋势。

  2. 从你的配置出发

    缺少模型、思考深度或路由时,Agent 必须先问,不能直接把榜首当成个人建议。

  3. 把下降当成信号

    单轮可比得分下降可以触发复核,但不能据此断言厂商改动了模型。

  4. 最终验收仍由主代理负责

    主代理负责理解需求、整合结果和最终检查;执行代理负责具体、明确的任务。

回答有哪些限制

沿用发布排名

排名沿用 ModelDial 已发布的榜单,不按厂商或个人偏好重新排序。

区分成绩变化与原因

可比得分下降属于信号,但不能单独证明厂商修改或削弱了模型。

确认你的使用条件

不了解你使用的模型、档位和连接方式时,Agent 会先询问,或只介绍当前榜单。

区分估算与账单

参考费用估算的是这次评测的 API 成本,与你的实际账单可能不同。

说明搭配建议的依据

主代理和执行代理的建议分别依据各模型的实测结果,尚未测试它们搭配使用的效果。

许可与署名

Skill 指令采用 MIT License。已发布的雷达数据采用 CC BY 4.0,使用时应尽量注明 ModelDial 和来源批次。