⭐ 觉得好用?收藏备用,下次直接打开 ✨ 开通会员去广告 · 更多权益即将开放 ☕ 支持作者
呈现方式
计分方式

默认这一组(自定步调 + 3 条命)与 Human Benchmark 的 Chimp Test 口径一致,成绩可以直接对照。

等级 1
按顺序点击方块
🐵
等级 1 · 从 4 个数字开始
排行榜

猩猩测试(Chimp Test)是一个视空间工作记忆任务:数字 1…N 随机散布在网格上,你要记住它们的位置,然后在数字被盖住之后按顺序点完。它因为”黑猩猩做得比人好”的说法而出名,但那个说法有不少前提被省略了,下面一并讲清楚。

它测的是什么

不是智商,不是”记性好不好”这种笼统的东西,而是视空间工作记忆加上编码策略这两样的合成结果。

和背电话号码那种言语记忆不是一回事:位置没法在心里默念,也没法靠复述维持。心理学里与之最接近的经典任务是 Corsi 积木(记住方块被敲击的顺序),成年人的广度大致在 5 上下——比人们熟悉的”7 加减 2”低不少,因为后者说的是言语系统。

策略的权重很大。多数人卡在 7、8 个,能往上走的几乎都换了记法:不再逐个记坐标,而是把散点看成几个小图形。这也是为什么练几局之后成绩往往会跳一档。

三种口径,别混着比

口径怎么呈现适合
自定步调 + 3 条命数字一直显示到你点 1和别人比、和自己在其它站的成绩比
限时 650 / 430 / 210 ms固定时长后自动盖住测接近瞬时的视空间容量;唯一能对着黑猩猩那条线比的
精确(每长度 2 试)同上,但换了施测流程要一个稳的数字,而不是一局的运气

默认那一组和 Human Benchmark 的 Chimp Test 规则逐条一致:起始 4 个、过关加一、三条命。网格则跟着数字个数一起长大,把填充密度恒定在 1/4 左右(4 个 → 4×4,6 个 → 5×5,9 个 → 6×6)——密度就是难度,恒定密度才让各等级之间、以及手机和电脑之间可比。盖住之后空方块和有过数字的方块完全一样,所以回忆阶段点空方块算错,否则等于白送 3/4 的免费试探位。

精确模式用的是 span 类任务的标准施测流程:每个长度固定做 2 试,至少对 1 次才进下一长度,两次都错才停止。单次试验的运气成分很大(一次手滑就掉一档),多试次是心理学里处理这件事的通行办法。它还额外给一个加权广度 = 起始长度 − 1 + 0.5 × 通过试次数,用上了全部试次的信息,比只看最高通过长度更稳。

“打败黑猩猩”的真实版本

2007 年,京都大学的 Inoue 与 Matsuzawa 在 Current Biology 上报告了 limited-hold 范式的结果:数字出现后只停留 650、430 或 210 毫秒就被盖住。年轻黑猩猩 Ayumu 在最短的 210 毫秒条件下仍能稳定点对,同条件下的成年人则明显吃力。

省略掉的前提是:Ayumu 为这个任务受过长期训练,被拿来对照的人类受试者没有。后续研究把这一条补上了——Silberberg 与 Kearns(2009)发现人经过有限的练习即可追平,Cook 与 Wilson(2010)训练出的受试者超过了它,更晚的复核工作也倾向于认为成年人在同等训练下强于黑猩猩。

所以这条结论更稳妥的说法是:那是训练量的差距。这也是本站把限时档单独做出来的原因——自定步调下的成绩和那篇论文完全没有可比性,拿它去”比猩猩”是错位的。

怎么测才有可比性

  • 同一口径下才比:换了呈现方式或计分方式,历史最好成绩是分开记的
  • 手机和电脑可以互比(网格永远是正方形、密度一致,变的只是显示尺寸),但触屏点击比鼠标慢一点,追求最好成绩用鼠标
  • 先试两局找感觉,第一局明显偏低是普遍现象
  • 测的时候别切走标签页——会作废,原因见常见问题

局限

这是消遣和自查工具,不是智力测验,也不是任何形式的医学或职业评估。工作记忆受睡眠、咖啡因、情绪、练习量影响很大,同一个人一天之内差两三个数字完全正常。如果你怀疑自己的记忆力出现了持续的、影响日常生活的下降,该找的是医生,不是网页。

📍使用场景

  • 想知道自己能不能过 9 个用默认的自定步调 + 3 条命打一局,成绩口径和 Human Benchmark 一致,可以直接和你在那边的分数对照。
  • 真的想和黑猩猩比一次切到 210 ms 限时档。那是 2007 年那篇论文里 Ayumu 稳定通过的条件,自定步调和那组数据没有可比性。
  • 要一个稳定的数字而不是运气用精确模式,每个长度做满 2 试、两次都错才停,得到的广度分比单次试验的关卡数波动小得多。
  • 和朋友同一台电脑比高低起始 4 个、网格随等级增长但密度恒定,换人不换口径,最好成绩按口径分开存在本机。

常见问题

这个测试和 Human Benchmark 上的 Chimp Test 是一回事吗?

默认那一组(自定步调 + 3 条命)是一回事:起始 4 个数字、过关加一个、点错扣一条命重做本关、三条命打完出成绩,规则逐条对齐,所以成绩可以直接对照。有一处差别要说明:格子密度。各站的网格大小不同,而数字越稀疏越难(眼睛要扫的范围更大)。本站的网格跟着数字个数一起长大,把填充密度恒定在 1/4 左右——4 个数字对应 4×4,6 个对应 5×5,9 个对应 6×6。固定格数的做法看着整齐,实则越到后关越密、越容易蒙。

为什么成绩旁边一定要显示"编码时间"?

因为自定步调下,关卡数只是成绩的一半。数字会一直显示到你点下 1,也就是说你愿意花多久去记,完全由你决定:花 3 秒记住 10 个和花 25 秒记住 10 个,是两种完全不同的能力。只报关卡数,等于把"记忆容量"和"肯花时间"混成一个数。所以这里把从数字出现到你点 1 的用时一起记下来,和成绩并列显示。想要一个不受这件事影响的数,就用限时档。

650 / 430 / 210 ms 这三档是怎么来的?

不是随便定的,是 Inoue 与 Matsuzawa 2007 年发表在 Current Biology 上那篇黑猩猩实验用的原始时长。他们的范式叫 limited-hold(限时保持):数字出现后只停留固定时长就被方块盖住,受试者必须在这段时间内完成编码。"人比不过猩猩"这个说法出自 210 ms 这一档,所以想认真比一次,只有切到限时档才说得通。

黑猩猩真的比人记得准吗?

这个说法被过度简化了。2007 年那篇论文报告的是:年轻黑猩猩 Ayumu 在 210 ms 条件下仍能按顺序点对,而同条件下的成年人明显吃力。但后续研究指出了关键问题——Ayumu 受过大量训练,被拿来对照的人类没有。Silberberg 与 Kearns 2009 的实验显示,人经过很有限的练习就能追平;Cook 与 Wilson 2010 训练出的受试者甚至超过了它。所以更准确的说法是:这是练没练过的差距,不是物种的差距

为什么我记 7 个数字的电话号码没问题,这里 7 个就很吃力?

因为用的不是同一套系统。常说的"7 加减 2"(Miller 1956)讲的是言语工作记忆——你可以在心里默念、复述、按节奏分组,维持时间靠不断重复。而这个测试考的是视空间工作记忆:位置没法默念,复述也帮不上忙。心理学里对应的经典任务是 Corsi 积木,成年人的广度大致在 5 上下(常见报告落在 4 到 6 之间),本来就比言语广度低。所以在这里到 7、8 个已经不容易了。

点到没有数字的空方块,为什么直接判错?

因为盖住之后,空方块和曾经有数字的方块长得一模一样——认出哪些格子放过数字,本来就是这个任务的一半。如果点空方块不算错,就等于白送 3/4 的免费试探位:记不清了挨个点过去总能点到下一个,测出来的数字也就没有意义了。有一个例外:自定步调下数字还看得见的那个阶段点空方块不算错,会被直接忽略——那时没有任何信息被隐藏,纯属手滑。

有什么练法能明显提高?

有,而且提高幅度通常不小,因为这个任务很吃策略。三条最有效的:① 别逐个记坐标,记形状——把散点看成一条斜线、一个三角形,记图形比记点省得多,这也是多数人突破 7、8 个的分水岭;② 固定扫描路线,比如永远从左上往右下扫,让每一局的编码方式一致;③ 先扫完再动手,点 1 之前把整幅图过一遍,中途改主意最容易乱序。需要提醒的是:练出来的提高很大一部分是策略熟练度,不等于工作记忆容量本身变大了。

成绩会上传吗?切走标签页为什么本局作废?

不会上传。出题、计时、判分全部在你的浏览器里完成,页面不发送任何测试数据;历史最好成绩只存在本机 localStorage,点"清除"随时删掉。切走标签页作废有两个原因:浏览器会节流后台标签页的定时器,限时档的 210 ms 会变得不准;而且那段时间足够把位置抄下来,测出来的数字也就没有意义了。