评测集市(暂定名)EVAL PORT
通用认知修订中v3.0

LLM 通用认知能力题集

37 题、五个维度、195 分,每一分都落在一个可二进制判定的输出项上

成本预估:单模型一轮通测约 37 次单轮问答(无需工具、无需联网)

本题集正在进行程序化校验修订,样题先行,完整版随修订发布。

01简介

横向对比用的通用认知题集,37 题,满分 195 分

维度 题量 每题 小计
逻辑推理 14 5 分 70 分
数学 10 5 分 50 分
人类直觉 5 5 分 25 分
指令遵循 6 5 分 30 分
长文本处理 2 10 分 20 分
合计 37 195 分

每一分都落在可二进制判定的输出项上:答案对不对,不是答得好不好。题型刻意避开可背的公开基准。

02评测方法

判分方式

每题拆成 5 个独立得分点(长文本题 10 分制),逐点判定,不做整体印象分。

施测规范

  1. 单轮问答,每题独立开新会话
  2. 不联网、不调用代码执行工具
  3. 不提示、不追问、不重试
  4. 模型名记到日期版本
  5. 采样参数按默认,提交时注明

版本纪律

改题必改版本号。跨版本分数不可直接比较,榜单标注对应版本。

当前状态

v3.0 正在做程序化校验修订,脚本没跑通的题先不上站。本页只展示已通过校验的样题。

03样题

真题节选,可直接复制去跑。

01T02 · 干支纪年推算【跨公元前 · 闰月 · 时辰】

题目描述

干支纪年由「天干(10) + 地支(12)」组成,60 年一甲子。已知 2024 年是甲辰年。补充规则:

  • 农历年的干支以正月初一为分界(春节当日及之后属新年干支,春节前属上一年干支)。
  • 公元前 1 年的下一年是公元 1 年(无公元 0 年);公元前纪年同样使用干支推算,60 年一甲子向后回溯。
  • 古代「时辰」以子时(23:00–01:00)为日界,子时初(23:00–00:00)属当日子时,子时正(00:00–01:00)属次日子时(部分流派归属方式不同,本题按「子时正归属次日」)。

输出要求

回答以下 5 个问题(每题 1 分,共 5 分):

  1. 公元前 551 年(孔子诞生年,传统记为庚戌年)按 60 甲子回溯推算,干支是否为庚戌?给出推导。
  2. 2026 年农历正月初一(2026-02-17)前一天(即 2026-02-16,腊月廿九或三十)的干支年是什么?
  3. 1949 年 10 月 1 日(中华人民共和国成立日)当日的干支年是什么?(注:1949 年春节为 1 月 29 日)
  4. 若某年正月初一为丙寅日,问该年正月初一前一日的干支日是什么?
  5. 给定 2024 年 2 月 10 日(2024 甲辰年正月初一)为甲辰年甲子日,问 2024 年 2 月 10 日 23:30 与 2024 年 2 月 11 日 00:30 各属于哪个时辰?各属于哪个干支日?
02T22 · 数论综合【同余 · 不定方程 · 原根】

题目描述

5 个独立小问题(每题 1 分):

  1. 求 7^2026 mod 13 的值。
  2. 求正整数解 (x, y) 满足 3x + 7y = 100 的所有解中,使 xy 最大的 (x, y)。
  3. 求 x⁴ ≡ 1 (mod 35) 在 0 ≤ x < 35 内的解的个数。
  4. 求 (n!) 中素因子 5 的指数,取 n = 2026(即 2026! 末尾有多少个 0)。
  5. 判断 3 是否为模 7 的原根,并求模 7 的所有原根。
03T23 · 线性代数与矩阵【特征值 · 矩阵方程】

题目描述

5 个独立小问题(每题 1 分):

  1. 求矩阵 A = [[2, 1], [1, 2]] 的特征值与特征向量。
  2. 矩阵 A = [[1, 2, 3], [4, 5, 6], [7, 8, 10]] 的行列式是多少?
  3. 设 A 为 3×3 矩阵,det(A) = 2,求 det(2A) 与 det(A⁻¹)。
  4. 求解矩阵方程 AX = B,其中 A = [[1, 2], [3, 4]],B = [[5, 6], [7, 8]],给出 X。
  5. 给定向量 v = (1, 2, 3),求其在平面 x + y + z = 0 上的投影向量。
04T24 · 组合博弈与 SG 函数【Nim 变体】

题目描述

3 堆石子,初始 (7, 5, 3)。甲、乙轮流操作(甲先),每步可从任一堆中取走 1~3 颗(必须取完至少 1 颗)。取走最后一颗的玩家(正常玩法,非 Misère)。

输出要求

回答 5 个问题(每题 1 分,共 5 分):

  1. 在正常 Nim 玩法(每堆可取任意正数)下,初始 (7, 5, 3) 是 N 位(先手必胜)还是 P 位(后手必胜)?给出 Nim 和。
  2. 在本题限制(每堆至多取 3)下,初始 (7, 5, 3) 是 N 位还是 P 位?
  3. 若先手甲第一步从 7 堆中取 2,剩 (5, 5, 3),乙的最优响应是什么?
  4. 若规则改为「取最后一颗的输」(Misère),且每堆至多取 3,初始 (7, 5, 3) 是 N 位还是 P 位?
  5. 给出本题(每堆至多取 3)的 SG 函数通项公式(SG(k) 用 k 表示)。
05T33 · 多步骤精确任务【嵌套集合运算】

题目描述

给定初始字符串 S = "abcdefghijklmnopqrstuvwxyz"。

按顺序执行以下 8 步:

  1. 取 S 中位置为 3 的倍数(3、6、9...)的字符放入集合 A(位置 1-based)。
  2. 取 S 中所有辅音字母放入集合 B(辅音 = 非元音 a/e/i/o/u)。
  3. 计算 C = A ∩ B,按 ASCII 升序排列。
  4. 把 S 中所有元音字母改为大写,得到新串 S'。
  5. 计算 D = {S' 中所有大写字母}(即被改大写的元音)。
  6. 计算 E = C ∪ D,按 ASCII 升序排列(注意大小写 ASCII 顺序:大写 < 小写)。
  7. 计算 F = E − {元音字母的小写形式}(即从 E 中移除 a/e/i/o/u 的小写)。
  8. 输出 |A|、|B|、|C|、|D|、|E|、|F| 以及 F 的字符串形式。

输出要求

回答 5 个子问题(每题 1 分,共 5 分):

  1. 集合 A 与集合 B 各有几个元素?
  2. 集合 C 的内容是什么?
  3. 集合 D 的内容是什么?
  4. 集合 F 的内容是什么?
  5. |E| 与 |F| 的差是多少?
06T35 · 条件分支输出【状态机式指令】

题目描述

给定一个虚拟的「状态机指令序列」,请按规则逐步执行并输出每步后的状态。初始状态:counter = 0, mode = "A", stack = []。

指令(共 10 条,按顺序执行):

1. PUSH 3
2. PUSH 5
3. ADD          ; 弹出栈顶 2 个,相加后压回;counter += 1
4. IF mode == "A" THEN mode = "B" ELSE mode = "A"
5. PUSH counter
6. DUP          ; 复制栈顶并压入
7. IF stack.size >= 3 THEN ADD ELSE NOP
8. IF mode == "B" THEN mode = "C" ELSE mode = "B"
9. SWAP         ; 交换栈顶 2 个(若栈 < 2 则 NOP)
10. POP         ; 弹出栈顶(若栈空则 NOP)

定义:

  • PUSH x:把 x 压入栈。
  • ADD:弹出栈顶 a、b(栈顶为 a,次顶为 b),压入 b + a;counter += 1。
  • DUP:复制栈顶压入。
  • SWAP:交换栈顶 2 个。
  • POP:弹出栈顶。
  • NOP:无操作。
  • IF 条件 THEN 动作1 ELSE 动作2:按条件执行其中一个动作。

输出要求

回答 5 个子问题(每题 1 分,共 5 分):

  1. 执行完第 3 条后,栈、counter、mode 各是什么?
  2. 执行完第 7 条后,栈顶元素是什么?栈大小是多少?
  3. 执行完第 8 条后,mode 是什么?
  4. 执行完第 10 条后,栈的内容是什么(从底到顶)?
  5. 整个序列执行完后,counter 的最终值是多少?

完整题库与评分标准仅对内部及合作方开放。

04本集榜单

#模型得分提交者核验日期备注
1claude-sonnet-5 (2026-07)65 / 65评测组自测已核验2026-07-29修订期已验证 13 题子集(满分 65);每题独立单轮会话、禁用工具;逐题判分档案内部可查
2claude-haiku-4.5 (2026-07)61 / 65评测组自测已核验2026-07-29同规程施测;失分集中在陷阱识别与约束坚持(T26/T07),逐题判分档案内部可查
3deepseek-chat (2026-07)57 / 65评测组自测已核验2026-07-29首条经「一条命令自动跑」CLI 全流程提交的成绩(回执

05提交成绩

推荐:一条命令自动跑

curl -sO https://eval-portal.pages.dev/run.mjs
OPENAI_API_KEY=sk-xxx node run.mjs --eval cognition-core-v3 --base-url https://api.deepseek.com/v1 --model deepseek-chat

跑的是 65 分制已验证子集(13 题,单轮问答),跑完自动落盘并提交,不必再填下面的表单。

  1. 01自己跑题,我们不代跑
  2. 02证据留链接,可复核
  3. 03人工核验通过后上榜
  • 逐题作答记录 JSON 或文档
  • 须是完整原文,不是结论
  • 注明采样参数与系统提示词
提交即表示你同意我们公开展示核验后的模型名与得分。