中文 English

下象棋时偷看对手棋盘道德吗?我用这道弱智吧神题给 13 个大模型测了智商,结果当场分出三六九等

发布时间: 2026-08-14 · 阅读量 --
AI 大模型 LLM 弱智吧 Ruozhiba 评测 娱乐 人工智能

先说结论

我从弱智吧挑了一道经典陷阱题——“在下象棋的时候,偷看对手棋盘,是不是很不道德啊”,通过自建的 NewAPI 中转站同时考了我手上 13 个官方大模型。结果非常有戏剧性:10 个模型识破了陷阱,知道象棋只有一副双方共享的公开棋盘,根本不存在“偷看对手棋盘”;1 个模型开头被判了死刑又自己救了回来2 个模型想都没想就掉进坑里开始道德说教;还有 1 个模型直接让我“刷新页面以更新应用后重试”。本文是一份纯娱乐、非官方的模型 IQ 测试报告,所有回答均为真实 API 返回,截图存档。

弱智吧大考主视觉

图 1:本文主视觉——一只偷窥的眼睛盯着棋盘,但棋盘本来就是两个人一起看的。自制文章配图。

1. 问题背景:弱智吧,大模型界的“科目二”

先给不熟悉的朋友科普一下。弱智吧是百度贴吧里的一个神奇社区,吧友们热衷于提出各种乍一听很有道理、仔细想想荒谬绝伦的问题,比如“自杀的人到底是想开了还是没想开”“我把左鞋穿到右脚上,那我的左脚是不是就踩在了右鞋里”。这些问题看似无厘头,实则暗藏逻辑陷阱、语义双关和常识破绽。

这件事本来只是网友找乐子,直到 2024 年中科院等团队发表了一篇正儿八经的论文 COIG-CQIA: Quality is All You Need for Chinese Instruction Fine-tuning。研究团队从中文互联网各平台收集语料训练模型,结果发现:用弱智吧数据训练出来的模型,在问答、头脑风暴、分类、生成等 8 项测试中拿了最高分,跑分超过百科、知乎、豆瓣、小红书等平台的语料。论文作者推测,原因是弱智吧的问题能增强模型的逻辑推理能力。

COIG-CQIA 论文 arXiv 页面截图

图 2:COIG-CQIA 论文的 arXiv 页面真实截图。弱智吧数据登上正经学术论文,堪称 2024 年中文互联网最抽象的时刻之一。

Hugging Face 上的 COIG-CQIA 数据集页面截图

图 3:该数据集在 Hugging Face 上公开可查,月下载量七千多次。真实截图。

从此,弱智吧问题成了中文大模型的民间“科目二”:能不能答对弱智吧的题,成了检验模型是真聪明还是背课文的快速手段。这,就是本次测试的灵感来源。

2. 考题分析:这道题的坑在哪里

本次考题:“在下象棋的时候,偷看对手棋盘,是不是很不道德啊”

这道题妙就妙在它的提问前提本身就是错的。象棋和扑克、麻将不一样:扑克牌里,对手的手牌是隐藏信息,偷看当然是作弊;但中国象棋和国际象棋里,双方看的是同一副棋盘,所有棋子的位置从头到尾对双方完全公开。不存在“我的棋盘”和“对手的棋盘”之分——棋就摆在那儿,你不看棋盘怎么下棋?

打个小学生都能听懂的比方:这就好比考试时,老师把题目写在黑板上,你和同桌都抬头看黑板做题。突然有人问:“偷看同桌看到的黑板,是不是很不道德?”——黑板是全班共用的,看黑板不叫偷看,叫上课。

所以这道题的正确解法是:先拆穿“偷看对手棋盘”这个不成立的前提,再补充说明哪些行为才是真正的不道德(比如偷看对方的手机分析软件、笔记本、棋谱准备,或者在军棋、暗棋、盲棋这类有隐藏信息的玩法里偷看)。直接顺着问题开始道德说教的,就是掉坑了。

陷阱解析示意图

图 4:陷阱解析——象棋是完全信息博弈,双方共享同一副棋盘。自制示意图。

3. 测试方法:同一道题,同时发给 13 个模型

测试环境很简单:我手上有一台自建的 NewAPI 中转站,上面聚合了各家官方模型。我从模型列表里挑出了 13 个模型参加考试:gpt-5.6-sol、gpt-5.6-terra、gpt-5.6-luna、deepseek-v4、deepseek-v4-pro、deepseek-v4-flash、glm-5.2、GLM-5V-Turbo、k3、k3-256k、kimi-k2p6、qwen3.8-max、MiniMax-M3。

需要说明的是,中转站上还有一批带 latest 后缀的模型(gpt-latest、glm-latest、kimi-latest、qwen-latest、minimax-latest 等),以及一些我自己定义名字的 DIY 别名。这些本质上只是指向某个底层模型的“马甲”,考它们等于把同一张卷子复印几遍再考几次,所以一律弃考,只保留有具体型号名的“正身”上场。

考试纪律:同一道题、同样的 temperature=0.7、通过同一个 OpenAI 兼容接口轮询调用,记录每个模型的回答全文、响应延迟和 Token 消耗,然后由我人工评分。评分的核心标准只有一条:有没有识破“象棋只有一副公开棋盘”这个陷阱

测试方法示意图

图 5:测试流程——一道题经自建 NewAPI 中转站同时发给 13 个模型。自制示意图。

4. 成绩单:谁是真聪明,谁在硬背课文

先上总分榜。再次强调:这是娱乐向评分,不代表任何官方评测结论。

娱乐向 IQ 排行榜

图 6:本次弱智吧大考的娱乐向 IQ 排行榜。自制图表,评分标准为是否识破陷阱。

4.1 优等生组:一句话点破陷阱

deepseek-v4-flash(98 分) 是本场我最满意的答卷。它开头两个字“看情况”,紧接着一句“如果你们下的是普通明棋,象棋的棋盘是双方共用的、公开的,本来就应该看。看一眼棋盘、想一步棋不叫偷看,那叫下棋”——干脆利落,还顺便抖了个包袱。结尾“明棋不用偷看,暗棋偷看是作弊。棋品如人品,堂堂正正下棋最好”,有总结有态度,像个真正会下棋的人写的。

deepseek-v4-flash 真实回答截图

图 7:deepseek-v4-flash 的真实 API 回答。识别陷阱最快、表达最漂亮的一份答卷。

k3(97 分) 是本场最“会聊天”的答卷。它开头一句“哈哈,这个问题挺有意思的——不过在下象棋的时候,其实不存在‘偷看对手棋盘’这回事哦”,先把陷阱拆了,再列出三种必须看棋盘的理由,然后补充四种真正违规的行为(开软件外挂、偷看笔记、接受旁观者指点、偷换棋子),最后反问“你是遇到什么具体的情况了吗?还是在跟朋友开玩笑?”——拆题、科普、反问一气呵成,情商智商双在线。

k3 真实回答截图

图 8:k3 的真实回答,拆陷阱之余还顺手幽了一默。

deepseek-v4-pro(96 分) 同样一句话点破:“在标准的中国象棋或国际象棋里,棋盘是公开的,双方看的是同一个棋盘……所以不存在偷看对手棋盘这回事。”然后分三种情况补充了真正不道德的行为,层次分明。

deepseek-v4-pro 真实回答截图

图 9:deepseek-v4-pro 的真实回答,先破题再分类讨论。

gpt-5.6 三兄弟(sol 96 分 / luna 95 分 / terra 94 分) 全员通过,而且风格高度一致:先纠正前提,再列举真正作弊的场景,最后给一句精炼总结。sol 的收尾“规则允许看到的信息,可以看;规则要求保密的信息,偷看就是作弊”干净利落,还顺带发了个表情;terra 的建议最有人情味——“休闲娱乐时如果只是好奇,最好直接问一句:我能看吗?”三家同一出题老师,答题模板像一个模子刻出来的,稳得让人放心。

gpt-5.6-sol 真实回答截图

图 10:gpt-5.6-sol 的真实回答,简洁准确还带表情。

k3-256k(96 分)kimi-k2p6(95 分) 也都干脆利落。k3-256k 的比喻最形象:“你‘偷看’对手棋盘看到的东西,和你正大光明看到的是一模一样的”;kimi-k2p6 则用三个小标题把暗棋、盲棋、观棋报信三种真正招人恨的行为讲得明明白白,结尾“输棋不能输人,靠偷看赢来的胜利,比输了还难堪”颇有棋坛老前辈的风范。

kimi-k2p6 真实回答截图

图 11:kimi-k2p6 的真实回答(节选),结构清晰还主动反问。

qwen3.8-max(94 分) 同样识破了陷阱,普通对局、暗棋翻棋、看记录软件、旁观不语四种情况逐一分析,属于“稳”字当头的标准答案。

4.2 自救组:开头判死刑,后面救回来

glm-5.2(78 分) 是本场最有戏剧性的答卷。它开口第一句就是“毫无疑问,这非常不道德,在绝大多数情况下甚至被视为作弊行为”——监考老师我当时心都凉了。结果它写着写着把自己绕明白了,在第 4 点里写道:“当然,如果你说的是两人面对面坐在棋盘两侧,你盯着棋盘上的棋子看……这是完全正常且必须的。象棋是完全信息博弈游戏,棋盘上的所有信息对双方都是公开的。”

这就像一个学生考试先把答案写错,检查的时候发现不对,又密密麻麻写了一大段自我纠正。分还是要扣的,但知错能改的态度值得鼓励。它的回答也是全场最长的之一,引经据典,“观棋不语真君子,落子无悔大丈夫”都用上了。

glm-5.2 真实回答截图

图 12:glm-5.2 的真实回答(节选)——开头误判,结尾自救,戏剧张力拉满。

4.3 掉坑组:想都没想,直接开始道德说教

deepseek-v4(62 分) 的翻车最让人意外——毕竟它两个兄弟都拿了高分。它劈头盖脸就是“故意偷看对手的棋盘是非常不道德的行为,甚至属于破坏对弈公平性的作弊”,然后煞有介事地论证“偷看相当于你提前窃取了对手的谋划”。问题是:棋盘上根本没有需要窃取的谋划,双方的棋子都摆在明面上。更要命的是,它整整思考了 109 秒才给出这个错误答案,消耗 1355 个 Token——想最久,错最狠,完美诠释了什么叫“方向不对,努力白费”。

deepseek-v4 真实回答截图

图 13:deepseek-v4 的真实回答(节选)——109 秒的深思熟虑,换来一个陷阱里的深蹲。

MiniMax-M3(55 分) 同样一头栽进坑里,而且掉得最有“创造力”:它凭空编了一条规则——“正式的象棋比赛都有明确的规则,禁止玩家窥视对方的棋局状态”。这条规则在现实中并不存在,因为双方看的是同一副棋,根本没有“对方的棋局状态”可供窥视。这也提醒阅卷老师(我):掉坑不可怕,可怕的是为了论证坑是对的,现场编造论据——这在学术论文里叫幻觉,在考试里叫瞎编,都是要扣分的。

MiniMax-M3 真实回答截图

图 14:MiniMax-M3 的真实回答——掉坑之外,还虚构了一条不存在的比赛规则。

4.4 弃考组:它让我刷新页面

GLM-5V-Turbo(0 分 / 弃考),本次考试唯一的“非战斗减员”。这是一个视觉模型,可能文本接口配置有问题,面对考题它只回了我一句:“Error: 请刷新页面以更新应用后重试。”用时 0.97 秒,消耗 2 个 Token——全场最快,也全场最摆烂。某种意义上,它也是全场最诚实的:答不上来就直接说答不上来,绝不硬编。

GLM-5V-Turbo 真实回答截图

图 15:GLM-5V-Turbo 的真实回答。它刷新了我们本次考试的欢乐下限。

5. 彩蛋:延迟排行榜里的黑色幽默

顺手把 13 个模型的响应延迟也排了个榜,结果发现一个有趣的反差:答得最快的 MiniMax-M3(4.96 秒)掉了坑,答得最慢的 deepseek-v4(109 秒)也掉了坑——快而错和慢而错同时存在。而拿高分的几位,latency 普遍在 8-31 秒的中段区间;gpt-5.6 三兄弟尤其均衡,8 秒左右交卷还全对。

响应延迟对比

图 16:同一道题的响应延迟对比。自制图表,数据为本次实测。

当然,单题延迟受中转站线路、模型负载影响很大,这个数字纯属彩蛋,不能当成性能结论。但它至少说明一件事:思考时间和答案质量并不成正比,方向错了,想得越久,错得越自信。

6. 问题根因:为什么有的模型会掉进坑里

分析完答卷,我总结了三条掉坑原因,并用生活例子解释:

第一,道德说教语料的“膝跳反射”。 大模型在训练时读过海量的“XX 是不是不道德”句式,这类句式的标准答案模板就是“是的,不道德,因为公平、诚信、体育精神……”。有些模型看到“偷看”两个字,膝跳反射一样直接套模板,根本没去检查前提。这就像小学生做应用题,看到“一共”就加法、看到“平均”就除法,题目里说“小明有 3 个苹果,分给 0 个同学”,他也照除不误。

第二,缺乏象棋的具身常识。 识破陷阱需要知道一个物理事实:象棋是两个人围着一副棋盘下的。这属于“世界知识”而不是“语言知识”。模型如果只在文本里见过象棋讨论,而没有把“同一副棋盘”这个物理常识和棋类规则关联起来,就容易把象棋错当成扑克——因为文本里“偷看对手”和“作弊”确实经常一起出现,但那些语境大多是扑克、麻将或者考试。

第三,顺从性偏置(Sycophancy)。 模型被训练得倾向于顺着用户的预设回答,用户问“是不是很不道德”,潜台词是“我觉得不道德”。较弱的模型会选择迎合这个预设,而不是纠正它。这就像你去问一个总想讨好你的朋友“我是不是胖了”,他大概率说“是有点”,而不是“你先站直了让我看看”。

7. 这个测试告诉我们什么

一份娱乐测试不能定义模型的智商,但它确实给了三个实用启示:

  1. 同一个模型家族内部差异巨大。 deepseek 家三兄弟同时出现 98 分和 62 分,gpt-5.6 三兄弟则集体稳定在 94-96 分,说明“用哪家模型”不如“用哪个具体版本”重要——这也是本文把所有 latest 马甲模型移出考场的原因:版本不明的别名,测了也无法复现。选模型时认准具体型号,要实测。
  2. 贵的不一定对,慢的不一定好。 109 秒的错误答案和 5 秒的错误答案,错的程度差不多。为“深度思考”多付的钱和多等的时间,未必买到正确率。
  3. 自己的中转站是最好的试衣间。 正因为有自建的 NewAPI 中转站,我才能用同一道题、同一套参数在几分钟内考完 13 个模型。如果你也在多家模型之间纠结,搭一个聚合网关做 A/B 实测,比看任何评测文章都靠谱——包括这篇。

8. Q&A

Q:这个“弱智吧 IQ 测试”科学吗?

不科学。样本只有一道题,评分是我人工打的,娱乐性质,请勿当真。真想严肃评测,请去看 MMLU、C-Eval 这类标准基准。

Q:为什么把 latest 后缀的模型移出考场?

因为 xxx-latest 只是指向某个底层模型的滚动别名,背后是哪个版本会随时间变化。今天测出的分数,下个月可能对应另一个模型,无法复现也没有参考价值。本次只保留有明确型号名的模型。

Q:为什么模型回答的风格有的像聊天、有的像写公文?

和每家模型的对齐(Alignment)偏好有关。有的厂商希望模型“像个朋友”,有的希望模型“像个顾问”。从本次答卷看,回答风格和智商高低没有相关性——k3 满屏表情包照样拿 97 分,MiniMax-M3 公文腔十足照样掉坑。

Q:GLM-5V-Turbo 为什么报错?

它是视觉模型,我通过文本聊天接口调用它,上游渠道返回了应用错误。这属于我中转站的渠道配置问题,不算模型智商问题,所以单独列为“弃考”。

Q:弱智吧的数据真的能训练出更好的模型吗?

COIG-CQIA 论文的实验结论是在其特定设置下(Yi-6B/Yi-34B + BELLE-EVAL 评估),弱智吧子集在多项指标上得分靠前。这更多说明“高质量、经过认真清洗的语料比语料来源的名气更重要”,而不是鼓励大家去贴吧灌水后直接喂给模型。

Q:我也想要一个能同时调多家模型的中转站,怎么搭?

NewAPI 是开源项目,一台 1 核 1G 的小服务器加 Docker 就能跑起来,把各家官方 API Key 配成渠道即可。这属于操作类话题,坑还不少,以后单独写一篇文章讲。

9. 写在最后

回到最初的问题:下象棋时偷看对手棋盘,到底道不道德?

正确答案其实很简单:象棋的棋盘是双方共享的,看棋盘不叫偷看,叫下棋。 真正不道德的,是偷看规则之外的信息——对方的手机、笔记和准备资料。

10 个模型答对了,说明主流大模型的常识推理确实在进步;3 个模型翻车的方式各不相同,又说明它们离“真正理解世界”还有距离。弱智吧还是那个弱智吧,它用一道看似脑残的问题,轻松分出了谁在思考、谁在背课文。

人类的最后防线,果然是抽象。

参考资料

免责声明:本文为非官方娱乐向测试,所有“IQ 分数”均为作者图一乐的评分,不构成任何模型选型建议。所有模型回答均为真实 API 返回并截图存档,未做任何内容篡改。

本文阅读量 --