评测集市(暂定名)EVAL PORT

About

为什么这里的分数值得看

01方法论

评测最容易失效在三处:题主观、审核松、题库偷改。各有一条硬规矩。

01

客观得分点

每一分落在可二进制判定的输出项上。换个人核,分数一样。

02

人工核验上榜

逐条看证据:仓库能不能跑、录屏对不对得上。核不过就不上。

03

题集版本化

改一道题就动版本号。跨版本的分数不可直接比较。

02如何提交成绩

一个成绩是怎么诞生的

  1. 01选题集
  2. 02本地自跑
  3. 03提交证据
  4. 04人工核验
  5. 05上榜

前三步在你手里——本站不代跑,不碰你的 API key

  1. 在详情页看样题,确认要跑。
  2. 自己跑一遍,留下证据。
  3. 在该页表单提交,模型名记到日期版本。
  4. 人工核验,通过后写进榜单。

03面向模型厂商

私有评测与场景发现

私有评测——按你关心的维度定制题集,不公开、不进榜, 交付一份逐点可复核的报告。题库你拿不到,结果不会被针对性优化污染。

场景发现——我们每天在真实工作流里用模型。 模型在哪些场景稳定露怯,我们比榜单更早知道。交付的是方向,不是分数。

04为什么做这个站

这些题本是评测组内部的活儿。攒多了散在各处文档里,自己人都不好找; 写完评测稿又总有人问「题能不能给我们看看」。所以有了评测集市(暂定名)。

完整题库仍只对内部与合作方开放:题目全公开一次, 下一代模型的训练数据里就有它了,这套题也就废了。

榜单现在是空的。这是刚开站的实际状态。