Large 4 与 Large 3:按任务选择
用可复现任务评估,不凭型号判断胜负。
本页目录
可核实任务
使用已知修复方式的代码、有原文的问题和标签清晰的图片。两个模型使用相同提示词与设置。
记录结果
保存模型 ID、日期、提示词、输出限制和推理设置。首字延迟与总耗时分开记录。
| 任务 | 检查内容 |
|---|---|
| 代码 | 诊断、补丁、修改范围 |
| 文档 | 原文依据 |
| 图片 | 标签与不确定性 |
| JSON | schema 有效性 |
有证据再升级
总分更高不保证实际任务更好。本地未对测真实模型,不公布虚构胜者。
用可复现任务评估,不凭型号判断胜负。
使用已知修复方式的代码、有原文的问题和标签清晰的图片。两个模型使用相同提示词与设置。
保存模型 ID、日期、提示词、输出限制和推理设置。首字延迟与总耗时分开记录。
| 任务 | 检查内容 |
|---|---|
| 代码 | 诊断、补丁、修改范围 |
| 文档 | 原文依据 |
| 图片 | 标签与不确定性 |
| JSON | schema 有效性 |
总分更高不保证实际任务更好。本地未对测真实模型,不公布虚构胜者。