真正起作用的是覆盖率,不是词汇总量
研究关心的不是你抽象地认识多少词,而是在一段具体文本或对话中,你已经认识的词占多大比例——也就是词汇覆盖率。正是这个视角让数字变得可用,因为词频分布极不均衡:一小撮高频词几乎承担了全部工作。
Nation(2006)估计最高频的 1,000 个词族就占口语的约 80%。之后每增加一千个,回报都在递减。这既是好消息也是坏消息:最先的 2,000 个词族是你这辈子最划算的投入,而把覆盖率从 95% 提到 98%,还要再花好几千个词。
| 已掌握词族 | 覆盖率(约) | 实际体验 |
|---|---|---|
| 1,000 | 口语约 80% | 能听懂简单对话的大意;每五个词有一个不认识 |
| 2,000–3,000 | 口语约 95% | 对话撑得住;空缺可以靠上下文猜出来 |
| 6,000–7,000 | 口语约 98% | 电影、播客和语速快的对话都不必持续费力 |
| 8,000–9,000 | 书面语约 98% | 不查词典读小说和报纸 |
| 约 17,000 个基础词 | 母语者区间 | 受过教育的成年人(Goulden, Nation & Read, 1990) |
覆盖率数据来自 Nation(2006)与 Adolphs & Schmitt(2003);母语者估算来自 Goulden, Nation & Read(1990)。测量以英语为对象:曲线形状在其他语言中同样成立,但具体数字并不通用。
什么算"一个词"?
上面所有数字都是词族,不是词形。一个词族是基础词加上它的屈折形式和规则派生:英语的 help, helps, helped, helping, helper, helpful, unhelpful 算一个词族,而不是七个。这样计数是因为,掌握词根和词缀之后,其余形式大体可以推出来。
- 3,000 个词族远多于 3,000 个词。 视语言不同,可能对应两到四倍的不同词形。广告里的"掌握 5,000 词"和研究中的计数几乎从来不是同一个单位。
- 屈折发达的语言会虚高原始词数。 俄语、波兰语、芬兰语和韩语会把一个词族摊成大量词形;达到同一覆盖率所需的词族数是可比的,但你遇到的词形数量不是。
- 接受性词汇和产出性词汇不是一回事。 CEFR 和覆盖率的数字衡量的是你认得出的词。开口时你能主动用出来的,总是更少。
相关阅读:往这个总数里加一个词族的成本,见一个词要见多少次才记得住(英文)。
CEFR 各级别对应多少词汇量?
CEFR 描述的是你能做什么,而不是你认识多少词——并不存在官方的分级词数。但测量数据是有的。Milton(2010)测试了各级别的英语学习者,公布了与之伴随的词汇量。这些是离散度很大的观测均值,不是准入门槛。
| CEFR 级别 | 词族数(实测) | 通常能应付什么 |
|---|---|---|
| A1 | 约 1,500 以下 | 固定说法、自我介绍、当下需求 |
| A2 | 约 1,500–2,500 | 日常事务:购物、问路、简短寒暄 |
| B1 | 约 2,750–3,250 | 熟悉话题的交谈;无人帮忙也能旅行 |
| B2 | 约 3,250–3,750 | 讨论与论证;多数媒体内容要费点力 |
| C1 | 约 3,750–4,500 | 学术与职业场景;言外之意 |
| C2 | 约 4,500–5,000+ | 几乎完全理解;语气与语域 |
Milton(2010),英语作为外语学习者的接受性词汇。测量工具最高只到 5,000 词档,因此 C1 与 C2 被压缩:C2 使用者的真实词汇量大于表格所能呈现的范围。
为什么"能读懂"的门槛是 98% 而不是 95%
95% 听起来近乎完整,其实不是:这意味着每二十个词就有一个不认识,大约每行小说一个。Hu 和 Nation(2000)直接做了验证,方法是调节小说文本中生词的密度。在 80% 覆盖率下,几乎没有人能在无辅助的情况下达到足够的理解;95% 时也只有少数人做到;到 98% 才有多数人能独立读懂。
随后 Schmitt、Jiang 和 Grabe(2011)用学术文本测试了 661 名学习者,发现覆盖率与理解度之间基本呈线性关系——没有断崖,也没有魔法阈值。覆盖率每提高一个百分点,理解度就相应增加一份。98% 是一个实用的规划参考值,不是开关。
实际的读法是:2,000–3,000 个词族让你能开口交谈,此后每多一千个,这门语言就安静一分——空缺更少、靠猜更少、疲劳更少。
3,000 个词要学多久?
目标一旦确定,时间就是一道除法题——而决定结果的是速度,恰恰是多数学习计划算错的那一项。阅读中遇到的词大约需要 8–12 次相遇才能留住,而且这些相遇必须分散在不同的日子里才能存活。
所以"每天几个词"指的不是你看到多少个,而是有多少个走完了自己的复习周期。按四种诚实的速度算:
| 每天新词 | 每年 | 到 +1,250(A2→B1) | 从零到 3,000 |
|---|---|---|---|
| 1 | 365 | 约 3 年 5 个月 | 约 8 年 3 个月 |
| 2 | 730 | 约 1 年 8 个月 | 约 4 年 1 个月 |
| 3 | 1,095 | 约 1 年 2 个月 | 约 2 年 9 个月 |
| 5 | 1,825 | 约 8 个月 | 约 1 年 8 个月 |
这是假设不休息、不倒退的纯除法——而真正会崩掉的正是这个假设。每天三个词坚持三年,难的不是某一天,而是连续 1,095 天都记得去做。
每天几个词
究竟能从哪里来
瓶颈从来不是目标,而是持续性——而持续性从既有习惯那里买,比从意志力那里买便宜得多。Reviews.org 2026 年的调查(约 1,000 名美国成年人)发现,人们每天看手机 186 次。对大多数人来说,这是手里最大的一笔"重复时刻"存量。
把复习挂到习惯上
LearnScreen 通过 Apple 的屏幕使用时间 API 屏蔽你指定的应用——Instagram、TikTok、X、游戏。屏蔽运行在系统层面,VPN 或 DNS 的小手段绕不过去。
每次打开都变成一次回忆
出现的不是应用,而是一张单词卡。答对之后,应用会解锁一小段时间。这是主动回忆——那种隔一段时间仍然留得住的相遇——而不是一眼扫过的词表。
让日程来挑词
莱特纳式的间隔重复日程决定你看到哪个词。答错的很快回来,掌握的往后推。研究所要求的间隔安排,不需要你自己记账就完成了。
- 18 个主题、1,080 多个精选词 ——基础、日常生活、旅行、饮食、工作、数字等,大致就是覆盖率表中承担最重工作的那个词频区间。
- 11 种学习语言 ——英语、德语、西班牙语、法语、意大利语、日语、韩语、波兰语、巴西葡萄牙语、俄语和中文普通话。
- 也可以加自己的词 ——任意单词都能附上译文、音标和例句加入,进入同一轮换。
- 离线可用,无需账号。 安装后卡片与屏蔽都不需要联网。无需注册、邮箱或密码;iCloud 备份使用你自己的私有数据库。
常见问题
参考文献
- Nation, I. S. P. (2006). How large a vocabulary is needed for reading and listening? Canadian Modern Language Review, 63(1), 59–82.
- Adolphs, S., & Schmitt, N. (2003). Lexical coverage of spoken discourse. Applied Linguistics, 24(4), 425–438.
- Hu, M., & Nation, P. (2000). Unknown vocabulary density and reading comprehension. Reading in a Foreign Language, 13(1), 403–430.
- Schmitt, N., Jiang, X., & Grabe, W. (2011). The percentage of words known in a text and reading comprehension. Modern Language Journal, 95(1), 26–43.
- Goulden, R., Nation, P., & Read, J. (1990). How large can a receptive vocabulary be? Applied Linguistics, 11(4), 341–363.
- Milton, J. (2010). The development of vocabulary breadth across the CEFR levels. EuroSLA Monographs 1, 211–232.
- Reviews.org (2026). Cell Phone Usage Stats. Survey of ~1,000 US adults, fielded Q4 2025. Report
最后核对:2026 年 7 月 28 日

