About
为什么这里的分数值得看
01方法论
评测最容易失效在三处:题主观、审核松、题库偷改。各有一条硬规矩。
01
客观得分点
每一分落在可二进制判定的输出项上。换个人核,分数一样。
02
人工核验上榜
逐条看证据:仓库能不能跑、录屏对不对得上。核不过就不上。
03
题集版本化
改一道题就动版本号。跨版本的分数不可直接比较。
02如何提交成绩
一个成绩是怎么诞生的
- 01选题集
- 02本地自跑
- 03提交证据
- 04人工核验
- 05上榜
前三步在你手里——本站不代跑,不碰你的 API key。
- 在详情页看样题,确认要跑。
- 自己跑一遍,留下证据。
- 在该页表单提交,模型名记到日期版本。
- 人工核验,通过后写进榜单。
03面向模型厂商
私有评测与场景发现
私有评测——按你关心的维度定制题集,不公开、不进榜, 交付一份逐点可复核的报告。题库你拿不到,结果不会被针对性优化污染。
场景发现——我们每天在真实工作流里用模型。 模型在哪些场景稳定露怯,我们比榜单更早知道。交付的是方向,不是分数。
04为什么做这个站
这些题本是评测组内部的活儿。攒多了散在各处文档里,自己人都不好找; 写完评测稿又总有人问「题能不能给我们看看」。所以有了评测集市(暂定名)。
完整题库仍只对内部与合作方开放:题目全公开一次, 下一代模型的训练数据里就有它了,这套题也就废了。
榜单现在是空的。这是刚开站的实际状态。