词汇量测出 8000 还是读不动原版:计数单位、每页生词密度与一词多义的三重落差

· 约 5 分钟 📚 英语词汇量测试

测完 英语词汇量测试,结果 8000 词。听起来挺体面——毕竟四六级大纲也就四五千。

然后翻开一本英文原版小说,第一页就有十几个词不认识

这不是测试不准。测试方法本身的准确性 那篇已经讲过分层抽样、诱饵词矫正和置信区间怎么保证数字不虚。这篇讲的是另一件事:为什么一个准确的词汇量数字,仍然预测不了你能不能读下去。

落差来自三个互相独立的地方。

落差一:这个 8000 和文献里的 8000 不是同一个单位

英语词汇的数法有三种,粗细差得很远:

口径run / runs / running / ranrunner / rerun算几个
词形 word form4 个各算 1 个最多
词目 lemma1 个各算 1 个中等
词族 word family1 个都归进同一个最少

关键在于:学术研究里说「读小说需要 8000–9000 词」,用的几乎都是词族口径,而在线测试给出的数字往往更接近词目甚至词形。

同一个人,两种口径能测出差别很大的两个数。所以拿测试结果去对文献或考纲里的门槛,是拿两把不同刻度的尺子在比。

这个数字的正确用法是纵向的:同一个人、同一个工具、隔几个月再测,变化的方向和幅度有参考价值。横向去比、去对门槛,都不可靠。

落差二:就算真的覆盖 98%,每页还有五六个生词

覆盖率是个百分比,百分比容易让人麻木。换算成「每页几个生词」,感受立刻就不一样了。

按一页约 250 个词计算:

覆盖率每页生词实际体验
92%20 个以上基本读不下去
95%约 12 个借助词典能读,连贯性没了
98%约 5 个能靠上下文猜过去,可自主阅读
99%约 2–3 个接近母语者的休闲阅读

看第二行和第三行:95% 和 98% 只差 3 个百分点,但每页生词数差了一倍多。 这 3 个点是「要不要一直停下来查」的分水岭,而不是「好一点」。

更劝退的是跨过这 3 个点所需的词汇量差不多要再翻一倍——因为低频词的长尾极长,越往后每多认识一千个词,能多覆盖的文本比例越小。这就是很多人能读新闻却读不动小说的数学原因:新闻用词集中,小说的长尾要长得多。

想知道某本具体的书现在能不能读,别用平均值推算——同样是小说,儿童文学和意识流作品的难度能差好几个档。直接取一段原文丢进 英文文章难度分析 算实际覆盖率,原理见 95% / 98% 覆盖率是怎么算的

落差三:认识这个词,不等于认识文中那个义项

这一层最隐蔽,因为它在词汇量的维度之外。

一词多义。 你背的是 run = 跑:

  • run a company —— 经营
  • run a fever —— 发烧
  • run in the family —— 家族遗传
  • the play ran for two years —— 上演

词你认识,义项你没学过。 测试问「run 认不认识」,你当然答认识,于是它计入你的词汇量;但在文本里它没帮上忙。

短语动词。 make out、put up with、get around to——每个单词都是最基础的那批,组合起来的意思和字面完全无关。而且词频表里根本不收这些组合,所以词汇量测得再高也覆盖不到它们。这是中文母语者读英文小说最大的一块隐形障碍。

判断方法很简单:一个句子读不懂,回头看看里面的单词是不是全都认识。如果是,那问题就不在词汇量上,而在义项、短语或搭配上。这时候继续背单词表是无效的——要查例句,把词放回上下文里记

还有一层:认识 ≠ 用得出来

「认识」其实有四个档次,难度依次上升:

  1. 见到能认出来 —— 测试测的就是这一档
  2. 读到能立刻理解,不用停下来想
  3. 听到能理解 —— 比读难,因为没有拼写提示、没有回看的机会
  4. 说和写的时候能主动用出来

第 1 档到第 4 档之间的差距,通常是两到三倍。也就是说测出 8000 的人,写作时能顺手用出来的可能只有两三千。

这解释了另一个常见困惑:读得懂却写不出、听不懂。读是第 2 档,听是第 3 档,写是第 4 档,它们本来就是三种不同的能力,而词汇量测试只测第 1 档。

想往上爬,输入量解决不了输出问题——只有在真正写和说的时候,词才会从第 1 档挪到第 4 档。

那这个数字到底能干什么

不能对门槛、不能横向比,但有两个实打实的用途:

一是纵向标尺。 同一工具隔三个月测一次,数字涨没涨、涨多少,是有意义的反馈。

二是定位该背哪一段。 看测试结果的掌握率柱状图——找到掌握率从高位明显掉下来的那个频段,那就是当前性价比最高的背诵区间。比它低的频段收益不大,比它高的频段本来就该会。这比盯着总数有用得多。

相关

总结

  • 测出的数字和文献里的词族门槛不是同一个单位,别拿来直接对照,纵向比自己才有意义
  • 覆盖率要换算成每页生词数才有体感:98% 是每页 5 个,95% 是 12 个,差的是要不要一直停下来
  • 从 95% 到 98% 需要词汇量再翻一倍,这是「能读新闻读不动小说」的数学原因
  • 句子里的词全认识却读不懂,问题在义项和短语动词上,继续背词表无效,要查例句
  • 短语动词不在任何词频表里,是中文母语者读原版最大的隐形障碍
  • 测试只测「见到能认出」这最容易的一档,离「写得出来」还隔着两到三倍的差距

❓ 常见问题

测出 8000 词,为什么翻开原版小说还是每页十几个生词?

三个原因叠在一起,每一个单独看都不致命,加起来就够劝退。(1) 计数单位不同——测试给的数字和语言学研究里说的「8000 词族」不是一回事,词族把 nation / national / nationality / internationally 算作一个,而按词形或词目算能拆成四五个,同样一个人两种口径下的数字能差出一大截;(2) 识别档高估——测试问的是「见到它你认不认得」,这是最容易的一档,和「读到它能立刻理解」「写作时能主动用出来」中间还隔着两层;(3) 98% 覆盖率也不等于顺畅——按一页 250 词算,98% 意味着每页仍有五六个生词,一页查五六次,阅读体验已经被打断了。结论不是测试不准,而是「词汇量」这个数字本身没法直接换算成「能不能读」。

词族、词目、词形,到底差在哪?

差在把多少个变体算成一个词,这个口径决定了同一个人能测出差多远的数字。(1) 词形(word form):run / runs / running / ran 算四个,最细;(2) 词目(lemma):上面四个算一个 run,但 runner、rerun 另算,这是词典的收词方式;(3) 词族(word family):run 及其屈折变化、加常见前后缀的派生词 runner / rerun / runnable 全算一个,最粗。关键:学术文献说「读小说需要 8000-9000 词」用的几乎都是词族口径,而各类在线测试的数字往往更接近词目甚至词形。所以直接拿测试结果去对文献里的门槛,是拿两把不同刻度的尺子在比。 看趋势和相对位置有意义,看绝对值对门槛没意义。

覆盖率 95% 和 98% 差 3 个点,感受上差多少?

差的是「查不查得起」,这 3 个点几乎是能不能连续读下去的分水岭。按一页约 250 个词算:(1) 95% 覆盖 → 每页约 12 个生词,平均每两行一个,查完一页的连贯性已经没了,只能算「借助词典能读」;(2) 98% 覆盖 → 每页约 5 个,可以靠上下文猜过去,不查也大致跟得上情节,这才叫「能自主阅读」;(3) 92% 覆盖 → 每页 20 个以上,基本读不下去。所以 95% 到 98% 这 3 个点在体感上不是「好一点」,而是「要不要一直停下来」的区别——而要跨过这 3 个点,需要的词汇量差不多要再翻一倍,这也是很多人卡在「能读新闻读不动小说」的原因。

认识单词却看不懂句子,是语法问题吗?

未必,更常见的是认识的不是文中那个义项。三类高频陷阱:(1) 一词多义——你背的是 run 等于跑,文中是 run a company(经营)、run a fever(发烧)、run in the family(家族遗传),词你认识,义项你没学过;(2) 短语动词——make out / put up with / get around to,每个单词都简单,组合起来的意思和字面无关,而且词频表里根本不收它们,测出的词汇量再高也覆盖不到;(3) 搭配与习语——take a decision 还是 make a decision,这类知识不在「认不认识」的维度上。判断方法:读不懂的句子里如果所有单词你都认识,那问题几乎一定在义项、短语或搭配上,而不是词汇量。对策是查例句而不是查词义,把词放回上下文里记。

那这个数字到底该怎么用?

当纵向标尺用,别当横向门槛用。(1) 纵向有效——同一个人、同一个工具、隔三个月再测,数字的变化方向和幅度是有参考价值的,抽样和口径都一致;(2) 横向无效——拿去和别人的数字比、或者去对文献和考纲里的门槛,因为口径不同,比出来的结论不可靠;(3) 最实用的一种用法:测完看 英语词汇量测试 给出的掌握率柱状图,找到掌握率开始明显下滑的那个频段——那一段就是当前性价比最高的背诵区间,比盯着总数有用得多。(4) 想知道某篇具体材料适不适合现在读,别推算,直接把原文丢进 英文文章难度分析 算实际覆盖率。

📚 打开 英语词汇量测试 基于 COCA 词频·分层抽样 100 词+诱饵词矫正·估算词汇量±区间·掌握率柱状图·考试锚点(高考/四六级/雅思)·背词清单导出 Anki·本地运行

📖 同一工具的其他教程

🔗 相关阅读

全部教程 →