评测集市(暂定名)EVAL PORT

EVAL PORT

评测集市(暂定名)

真实场景 · 客观得分点 · 人工核榜

样题公开,自己跑,交证据上榜。不刷分、不代跑。

怎么参与

  1. 01

    挑题

    看样题,确认测的是你要的能力。

  2. 02

    自己跑

    自带模型和 key,我们不代跑。

  3. 03

    交证据上榜

    仓库、记录或录屏,核验通过上榜。

    去提交 →
6
个评测集
3
个在测模型
3
条已收录成绩

样题公开 · 完整题库对内部与合作方开放

最新收录成绩

模型成绩题集收录
deepseek-chat (2026-07)57 / 65LLM 通用认知能力题集2026-07-29
claude-haiku-4.5 (2026-07)61 / 65LLM 通用认知能力题集2026-07-29
claude-sonnet-5 (2026-07)65 / 65LLM 通用认知能力题集2026-07-29

跨题集分数不可直接比较;完整榜单见各评测集页。

评测集

通用认知修订中v3.0

LLM 通用认知能力题集

37 题、五个维度、195 分,每一分都落在一个可二进制判定的输出项上

单模型一轮通测约 37 次单轮问答(无需工具、无需联网)⌘ 一条命令可跑进入详情 →