黑猩猩为什么赢了人类:猩猩测试的三个限时档和那篇 2007 年的论文

· 约 3 分钟 🐵 猩猩测试

搜”黑猩猩记忆力”能搜到一大堆”黑猩猩完胜人类”的视频。这件事有真实出处:Inoue 和 Matsuzawa 2007 年发在 Current Biology 上的一篇短文,实验对象是京都大学灵长类研究所的黑猩猩 Ayumu。

但流传的版本几乎都掉了那个决定结论成立与否的条件:数字只闪 210 毫秒猩猩测试 把这个条件做成了可选的旋钮,所以这篇要讲清楚——把旋钮拨到不同档位,你测的根本不是同一种能力。

限时档掐掉的是言语编码

看到一串数字,多数人会在心里念出来。这套策略在能看两三秒时非常有效,但它有一个硬成本:默念要花时间

呈现方式你来得及做什么测到的是
自定步调(看到点中 1 为止)默念、分组、复述容量 + 愿意花的时间
650 ms勉强扫一遍,来不及念完容量 + 一点策略残余
430 ms只够整体扫视接近纯空间捕获
210 ms念不出第二个数字空间位置的瞬时捕获

Ayumu 在短呈现下几乎不掉,因为它从一开始就没有言语这条路可走。人类掉得厉害,恰恰是因为我们有一套更高级但在这里帮不上忙的工具。

自定步调为什么没法和黑猩猩比

自定步调档里,数字一直显示到你点中 1 才盖住。这意味着你可以盯着看 20 秒慢慢背——成绩会好很多,但它已经不是那篇论文测的东西了。

所以本站把编码时间(从数字出现到你点中 1 的耗时)和成绩一起报,并且每个档位单独一个排行榜。把限时和自定步调混进同一个榜,就等于让一部分人带着秒表答题,榜单立刻失去意义。

网格为什么跟着长大

本站的网格边长随数字个数增长,填充密度恒定在 1/4 左右。理由和 视觉记忆 那边一样:密度就是难度。固定格数的话,第 4 关稀稀拉拉、第 15 关挤成一团,两者的分数没法放在一条曲线上。

想提高成绩,实际上只有两条路

一是放弃念数字,改成看整体形状:把若干个位置当成一个图形记下来,这条路的上限明显更高,但需要克服”忍不住要念”的本能。二是分组:先记前三个的位置,点掉之后再处理剩下的——注意这在限时档里不可行,因为盖住之后没有第二次看的机会。

这个分数不能拿来做什么

它是消遣工具,不是智力测验也不是医疗评估。同一个人不同时段差两三个是常事。

尤其别拿它跨站比较:网格密度、起始个数、命数、限时档,每家都不一样,换一个站点比的就是规则而不是人。本站的完整口径都写在工具页的帮助里,可以逐条核对。

❓ 常见问题

「黑猩猩记忆力超过人类」这个说法靠得住吗?

出处是真的,但流传的版本掉了最关键的条件。Inoue 和 Matsuzawa 2007 年发在 Current Biology 上的《Working memory of numerals in chimpanzees》报告了京都大学灵长类研究所的黑猩猩 Ayumu:屏幕上闪出若干数字,固定时长后全部盖住,要按 1→N 的顺序点出来。关键在"固定时长"——实验用了 650、430、210 毫秒三个档(limited hold 范式)。呈现时间越短,人类的正确率掉得越厉害,而 Ayumu 受影响小得多。结论的正确表述是:在极短呈现时间的这类空间位置任务上,受过训练的黑猩猩表现优于人类受试者;不是"黑猩猩记忆力比人强"这种笼统的话。

那为什么人类在短时间下掉得更厉害?

主流解释是人类用了一套在这里帮不上忙的策略:言语编码。看到数字,人会不自觉地在心里念出来("3、7、2、9…"),这套办法在能看几秒的时候很有效,但默念本身要花时间——210 毫秒根本来不及念第二个数字,策略就白准备了。而黑猩猩没有言语系统,走的是整体性的空间位置捕获,几乎不受呈现时长影响。这也是为什么本站限时档的成绩和自定步调档不能放进同一个榜:它们测的不是一回事。

「自定步调」和三个限时档该选哪个?

看你想对照谁自定步调(数字一直显示到你点中 1)是 humanbenchmark.com 的 chimp test 口径,成绩可以和那边直接对照,但它测的是"肯花多少时间默念 + 容量"的混合物——所以本站会把编码时间中位数一起报出来,不然"记住 12 个"里有多少靠容量、有多少靠肯花 20 秒,完全看不出来。650 / 430 / 210 ms 三档才是能和那篇论文对照的口径,其中 210ms 是最苛刻的一档。建议:先用自定步调摸出自己的容量上限,再去 430ms 档看掉多少——掉得多说明你高度依赖言语编码。

为什么网格会越打越大,不是固定格数?

因为密度就是难度。同样 10 个数字,撒在 16 格里和撒在 81 格里完全是两回事:格子越稀疏,眼睛要扫的范围越大、位置越难编码。本站的边长跟着数字个数走(side = ceil(sqrt(4n))),把填充密度恒定在 1/4 左右。固定格数看着整齐,实则越到后关越密、越容易蒙——各关之间反而不可比了。

点到空格子为什么直接算错?

因为空格和被盖住的格子长得一模一样,这正是这个玩法的核心。如果点空格不算错,你就白得了一批免费试探位(密度 1/4 意味着四分之三的格子是空的),可以靠排除法把答案试出来,测试就没意义了。但编码阶段(数字还看得见的时候)点空格是忽略的——那时没有任何信息被隐藏,点错纯属手滑。

「挑战」和「广度」两种计分该用哪个?

要一个稳的数就用广度挑战模式是起始 4 个、过关 +1、失败扣一条命重做本关、3 条命用完结束,和 Human Benchmark 一致,节奏快但单次运气成分大。广度模式给每个长度固定做 2 试,至少对 1 次才进下一长度,两次都错即停——这是 span 类任务(数字广度、Corsi 积木)的标准施测流程,因为单次试验的方差往往比人和人的差距还大。想跟自己昨天比、或者想看清自己的真实上限,用广度

🐵 打开 猩猩测试 Chimp Test 中文版·点 1 后方块全遮凭记忆按序点·等级越高网格同步变大保持密度恒定·起始 4 个 3 条命口径同 Human Benchmark·650/430/210ms 限时档复刻黑猩猩原实验·每长度 2 试精确测广度·本地运行

🔗 相关阅读

全部教程 →