测完 英语词汇量测试,结果 8000 词。听起来挺体面——毕竟四六级大纲也就四五千。
然后翻开一本英文原版小说,第一页就有十几个词不认识。
这不是测试不准。测试方法本身的准确性 那篇已经讲过分层抽样、诱饵词矫正和置信区间怎么保证数字不虚。这篇讲的是另一件事:为什么一个准确的词汇量数字,仍然预测不了你能不能读下去。
落差来自三个互相独立的地方。
落差一:这个 8000 和文献里的 8000 不是同一个单位
英语词汇的数法有三种,粗细差得很远:
| 口径 | run / runs / running / ran | runner / rerun | 算几个 |
|---|---|---|---|
| 词形 word form | 4 个 | 各算 1 个 | 最多 |
| 词目 lemma | 1 个 | 各算 1 个 | 中等 |
| 词族 word family | 1 个 | 都归进同一个 | 最少 |
关键在于:学术研究里说「读小说需要 8000–9000 词」,用的几乎都是词族口径,而在线测试给出的数字往往更接近词目甚至词形。
同一个人,两种口径能测出差别很大的两个数。所以拿测试结果去对文献或考纲里的门槛,是拿两把不同刻度的尺子在比。
这个数字的正确用法是纵向的:同一个人、同一个工具、隔几个月再测,变化的方向和幅度有参考价值。横向去比、去对门槛,都不可靠。
落差二:就算真的覆盖 98%,每页还有五六个生词
覆盖率是个百分比,百分比容易让人麻木。换算成「每页几个生词」,感受立刻就不一样了。
按一页约 250 个词计算:
| 覆盖率 | 每页生词 | 实际体验 |
|---|---|---|
| 92% | 20 个以上 | 基本读不下去 |
| 95% | 约 12 个 | 借助词典能读,连贯性没了 |
| 98% | 约 5 个 | 能靠上下文猜过去,可自主阅读 |
| 99% | 约 2–3 个 | 接近母语者的休闲阅读 |
看第二行和第三行:95% 和 98% 只差 3 个百分点,但每页生词数差了一倍多。 这 3 个点是「要不要一直停下来查」的分水岭,而不是「好一点」。
更劝退的是跨过这 3 个点所需的词汇量差不多要再翻一倍——因为低频词的长尾极长,越往后每多认识一千个词,能多覆盖的文本比例越小。这就是很多人能读新闻却读不动小说的数学原因:新闻用词集中,小说的长尾要长得多。
想知道某本具体的书现在能不能读,别用平均值推算——同样是小说,儿童文学和意识流作品的难度能差好几个档。直接取一段原文丢进 英文文章难度分析 算实际覆盖率,原理见 95% / 98% 覆盖率是怎么算的。
落差三:认识这个词,不等于认识文中那个义项
这一层最隐蔽,因为它在词汇量的维度之外。
一词多义。 你背的是 run = 跑:
- run a company —— 经营
- run a fever —— 发烧
- run in the family —— 家族遗传
- the play ran for two years —— 上演
词你认识,义项你没学过。 测试问「run 认不认识」,你当然答认识,于是它计入你的词汇量;但在文本里它没帮上忙。
短语动词。 make out、put up with、get around to——每个单词都是最基础的那批,组合起来的意思和字面完全无关。而且词频表里根本不收这些组合,所以词汇量测得再高也覆盖不到它们。这是中文母语者读英文小说最大的一块隐形障碍。
判断方法很简单:一个句子读不懂,回头看看里面的单词是不是全都认识。如果是,那问题就不在词汇量上,而在义项、短语或搭配上。这时候继续背单词表是无效的——要查例句,把词放回上下文里记。
还有一层:认识 ≠ 用得出来
「认识」其实有四个档次,难度依次上升:
- 见到能认出来 —— 测试测的就是这一档
- 读到能立刻理解,不用停下来想
- 听到能理解 —— 比读难,因为没有拼写提示、没有回看的机会
- 说和写的时候能主动用出来
第 1 档到第 4 档之间的差距,通常是两到三倍。也就是说测出 8000 的人,写作时能顺手用出来的可能只有两三千。
这解释了另一个常见困惑:读得懂却写不出、听不懂。读是第 2 档,听是第 3 档,写是第 4 档,它们本来就是三种不同的能力,而词汇量测试只测第 1 档。
想往上爬,输入量解决不了输出问题——只有在真正写和说的时候,词才会从第 1 档挪到第 4 档。
那这个数字到底能干什么
不能对门槛、不能横向比,但有两个实打实的用途:
一是纵向标尺。 同一工具隔三个月测一次,数字涨没涨、涨多少,是有意义的反馈。
二是定位该背哪一段。 看测试结果的掌握率柱状图——找到掌握率从高位明显掉下来的那个频段,那就是当前性价比最高的背诵区间。比它低的频段收益不大,比它高的频段本来就该会。这比盯着总数有用得多。
相关
- 测试本身准不准、怎么算出来的:COCA 分层抽样与置信区间
- 某篇具体材料现在能不能读:英文文章难度分析
- 查单个词的频率位置和难度等级:COCA 词频查询
- 按频段生成背诵清单:COCA 词频表生成
总结
- 测出的数字和文献里的词族门槛不是同一个单位,别拿来直接对照,纵向比自己才有意义
- 覆盖率要换算成每页生词数才有体感:98% 是每页 5 个,95% 是 12 个,差的是要不要一直停下来
- 从 95% 到 98% 需要词汇量再翻一倍,这是「能读新闻读不动小说」的数学原因
- 句子里的词全认识却读不懂,问题在义项和短语动词上,继续背词表无效,要查例句
- 短语动词不在任何词频表里,是中文母语者读原版最大的隐形障碍
- 测试只测「见到能认出」这最容易的一档,离「写得出来」还隔着两到三倍的差距