跳到正文
词频研究

该先背
哪些单词

最高频的1000 个词族覆盖约 72% 的书面文本和 80% 以上的口语,而第一万个千词段增加的不到一个百分点(Nation 与 Waring, 1997;Nation, 2006)。也就是说,选哪些词比选哪种方法更要紧,而顺序并非口味问题:先把前 2000–3000 个词族吃透,再处理 4000 到 9000 的中频段。Schmitt 与 Schmitt (2014) 把这一段描述为稀疏到光靠接触无法记住、又常见到不能跳过。此后最好的下一个词,就是你刚刚需要却没有的那个。

下文每个数字都在页尾注明出处

打开被拦截的应用那一刻,iPhone 锁屏上出现的单词卡

词频的分布极不均匀

多数建议把词汇当成一堆待清理的东西,仿佛任何一千个词都和另一千个差不多值钱。语言并不这样分布。词频遵循一条非常陡的幂律 — 就是 Zipf (1949) 描述的那个形状 — 少数几个词承担了几乎全部被说出和写下的内容,其余则拉成一条很长的尾巴。

实际后果是:各词段不可互换。下面每一行是按词频排列的一千个词族,以及该词段为你在普通书面文本上的覆盖率增加了多少。

按词频排列的各千词段、每段所达到的覆盖率及其内容
词频段所达覆盖率里面是什么
前 1000 个词族约 72% 的书面文本,80% 以上的口语功能词,以及每个句子赖以搭建的日常动词和名词 — 你这辈子学到的最划算的一块
第二个千词段把你带到约 80%同样的词量再加约 8 个百分点:仍是常用词汇,仍没有理由跳过
第三个千词段把你带到约 84%再加约 4 个百分点:最后一个以整数百分点付账的词段,也是 Schmitt 与 Schmitt (2014) 所称高频词汇的终点
第四到第九个千词段把你从 84% 送向 98%中频区:每段一到两个百分点,稀疏到不常遇见,又常见到不能舍弃
第一万个千词段以外每千词不到一个百分点Zipf 的尾巴:几万个词,读上几年才碰见一次,没有一个是急事

覆盖率数字针对书面文本,来自 Nation 与 Waring (1997) 以及 Nation (2006);口语在低词段更高、在高词段更低,因为对话反复使用更小的核心。这些是英语的数字:屈折更丰富的语言分布不同,因为在那里一个词族覆盖更多不同形式。能迁移到任何语言的不是精确的百分比,而是曲线的形状 — 开头很陡,到第一万个千词段几乎平坦。

三种不同的词表都被叫作"该背的单词"

关于该背哪些词的争论,通常发生在手里拿着三种不同词表、却用同一个说法称呼这三者的人之间。它们不是对手,而是阶段,各自在不同的位置上是对的。

  • 词频表。 按在大型语料库中出现的频率排序的词。客观、无关个人,在第三个千词段以下无可匹敌,因为那些词出现在你今后读到和听到的一切之中。它的弱点是对你一无所知 — 而这一点要等到词不再"常见到谁都躲不开"之后才开始要紧。
  • 主题表或教材表。 按场景归类的词:机场、餐厅、办公室。对范围明确的眼前需求有用,也容易拿在手里,但对词频视而不见:主题表会欣然把一个稀有名词排在常用动词之前,而同一语义场的词一起呈现时,在还新鲜的阶段会彼此干扰。
  • 你自己的词。 那些你因为想弄懂或想说出某件具体的事而查过的词。它们带着真实的编码优势 — Laufer 与 Hulstijn (2001) 发现,一个你需要、你去找、并由你自己选定含义的词,比递到手上的词记得更牢 — 但它们进来时毫无顺序,放着不管就会往稀有的一侧偏。

相邻的问题,按目标和 CEFR 等级看总量有多大:说一门语言需要多少词

什么样的词值得你的下一次相遇

每一次相遇都花掉同样的几秒钟,所以唯一要紧的问题是这几秒买到了什么。下面每一行是一个会改变词的价值的属性、研究对它的说法,以及如何在不做表格的情况下应用它。

六个改变一个词此刻学习价值的属性、各自的证据与应用
看什么研究怎么说实际是什么样
它在哪个词段Nation 与 Waring (1997);Nation (2006):前三千用整数百分点买覆盖率,之后只买到小数位先把高频核心吃透:任何目标都不改变这个顺序,因为这是关于语言的事实,不是关于你的
接触会不会把它送来Schmitt 与 Schmitt (2014);Cobb (2007):中频词太稀疏,光靠阅读凑不够相遇次数4000 到 9000 之间的词,才是刻意复习真正存在的理由;前一千个你反正会遇到
它出现在你接触的内容里吗Webb 与 Rodgers (2009):约 3000 个词族覆盖电视的 95%,7000 个覆盖 98%在第三个千词段以上,你真正在看和读的东西比通用语料排序挑得更准
是不是你自己需要过Laufer 与 Hulstijn (2001):需求、查找与权衡会独立于接触提高保持率一个你为了说出某句话而查过的词,进来时已经半编码;留着它,但放在核心旁边而不是取而代之
它是不是几乎免费de Groot 与 Keijzer (2000):同源词比可比的非同源词学得更快、忘得更慢已经会用的同源词可以跳过,但要留下假朋友 — 它们同样容易被学错
它能带来多少Bauer 与 Nation (1993):知道一个成员,其屈折形式和规则派生大体可以推出词根比派生词更值:学会 help,就顺带得到 help、helpful、helper

只有第四行谈的是偏好。其余五行谈的是语言的结构,以及你所接触内容的结构,正因如此,选词是一根你不需要了解自己心理就能拉动的杠杆。也请注意这里没有什么:这个词有多有趣、听起来有多好听、以及它是否恰好出现在你去上的那一课里。

中频难题

Schmitt 与 Schmitt (2014) 提出了一个听上去像行政分类、实则不是的建议。他们把词汇分成高频 — 任何课程都会教的前 3000 个词族 — 约 9000 以外的低频,没人教也没人需要,以及夹在中间的那一段:它没有名字,也在很大程度上因此没有计划。他们的要点是,大多数人正是在那里悄悄停住的:它位于"跟得上对话"和"不查词典读小说"之间,而且比人人都盯着的那个核心大好几倍。

让这一段棘手的,是被两种机制夹住。它稀疏到接触应付不来:一个词大约需要八到十二次分散的相遇才留得住(Nation 与 Wang, 1999;Webb, 2007),而第七个千词段的词,在你消遣阅读的材料里根本不会出现那么多次。Cobb (2007) 正是对此建模,把大量文本送进附带习得的模拟,发现无论读多少,光靠阅读都会让中间词段的大部分留在未习得的状态。而它又常见到不能跳过,因为造成 84% 覆盖率与 Hu 与 Nation (2000) 所关联的、可无助理解的 98% 之间差距的,正是这些词。

这一夹击就是刻意分散复习的实际理由,而且它对"力气该花在哪里"给得出奇准确。第一个千词段几乎不需要帮助:你在任何输入里都会不断遇到。一万以外的尾巴同样不需要帮助,因为它不急。中频区是唯一一处相遇不会自行发生、而词又确实值得的地方 — 这等于说,一套复习系统的价值几乎完全取决于你往里放哪些词。

每种词源在哪里失效

任何挑词的方法都会工作一阵子,然后停下。知道停止点比拥有一个偏爱的方法更有用,因为失败很少是因为方法本身错了:多半是因为它被沿用到了还合适的那个点之外。

最后一行是多数人不知不觉站着的位置。

四种词汇来源、各自擅长提供什么,以及各自失效的位置
来源提供什么在哪里失效
通用词频表按正确顺序给出核心,比任何别的方法都快大约在第三个千词段,排序开始与你的输入对不上,词开始显得随意
课程或主题表一个划定的场景,以及足以继续下去的结构一旦你需要主题之外的东西 — 何况它本来也从未按词频排列
阅读与观看与高频核心反复的、带语境的相遇,且不花额外力气中频段,Cobb (2007) 发现那里的相遇实在太稀疏,做不完这件事
你自己收集的词高投入负荷,以及与你想说的话完美相关哪里都不失效 — 但它会向稀有和无序偏移,所以作为补充有效,作为全部计划则失败

贯穿这四行的形状是:没有任何单一来源覆盖全程,而中频段正是从它们全部之间漏下去的那一段:对入门词表太高,对你自己的查询太低,稀疏到输入送不来。这一段需要的不是更好的来源,而是比日常生活所能提供的更分散的相遇。一个词在两次相遇之间发生了什么,见 为什么背了的单词还是会忘

把这几秒花在对的词上

如果选词是杠杆,那么系统的任务就是把选中的词足够频繁地放到你面前,而不要求你安排时间。LearnScreen 用的是你已经拥有的那个瞬间 — 伸手去拿手机 — 于是力气花在决定"哪些词"上,而不是花在"为它们找时间"上。

1

词表已经排好序

18 个主题下精选 1080 多个词,按日常核心先于专门词汇的顺序排列,而不是按某一课恰好引入它们的顺序。有 11 种语言可作为学习目标。

2

你自己的词就在旁边

不限数量的自建词条,可带译文、注音和例句 — 那些任何通用词表都无法预知的中频词和个人需要的词,与核心排在同一队列里,而不是放进一个你后来不再打开的分区。

3

相遇自己会来

手机每天被查看约 186 次,清醒时每小时约 11.6 次(Reviews.org, 2026)。借助 Apple 的屏幕使用时间 API,LearnScreen 拦截你选定的应用,并在信息流本该出现的位置放上一个词,于是一个稀有词所需的那些相遇,不用安排也会发生。

  • 回来的顺序由莱特纳系统决定。 答错的词更早回来,答对的按几何级数拉开间隔 — 正是这一点把一张长长的词表变成了每天应付得来的相遇次数。
  • 剂量由你设定。 每次 3 到 20 个词,拦截多久回来一次同样可调;按默认设置约合每天 25 次提取尝试,分散开来约两分半钟。
  • 按下之前答案是隐藏的。 每张卡都是一次提取尝试而非一次阅读,迁移的正是这个方向:主动词汇与被动词汇
  • 离线可用,无需账号。 应用装好之后,卡片和拦截无网也能工作;iCloud 备份写入你自己的私有数据库而不是我们的服务器,也没有什么需要注册。

单词出现的
位置

应用中的四个界面:拦截卡、带例句的答案、词表和进度。

被拦截的应用在保护界面上显示单词卡,取代了原本的信息流 卡片上揭晓的答案,附有译文和一个使用该词的例句 精选主题的词表,旁边是用户自己的词 进度界面:有多少词在分散复习队列中向上前进

继续阅读

常见问题

学一门新语言该先背哪些单词?
先背最高频的一千个词族,而且分布并不均匀。Nation 与 Waring (1997) 把前 1000 个词族定在约 72% 的书面文本,Nation (2006) 则把它们定在 80% 以上的口语,因为这一段里装的是功能词和每个句子赖以搭建的日常动词。第二个千词段增加约 8 个百分点,第三个约 4 个,所以前 3000 个词族的价值超过之后所有词加起来。任何目标都不改变这个顺序,因为这是语言的属性而不是学习者的属性:旅行的人、备考的人、想读小说的人,需要的是同一批头一千个词。
常用词到底需要多少个?
取决于你想拿它们做什么,两个门槛相距很远。Adolphs 与 Schmitt (2003) 发现最常用的 2000 到 3000 个词族占日常英语口语的约 95%,van Zeeland 与 Schmitt (2013) 则认为 95% 的覆盖率足以支撑听力理解。阅读要求更高:Hu 与 Nation (2000) 发现无助理解需要约 98% 的覆盖率,Laufer 与 Ravenhorst-Kalovski (2010) 把它估算为约 8000 个词族。也就是说,3000 个买下对话,而爬到轻松阅读还要再花上几千个。
该用词频表,还是用我读到的词?
先用词频表,再用你读到的,切换点大约在第三个千词段。在那个点以下,词频表无可匹敌,因为那些词出现在一切之中,顺序也客观正确。在那之上,词频表就不再适合你了:一门语言里第 5000 常见的词,在你实际拥有的书、剧和对话里可能很稀有。Webb 与 Rodgers (2009) 发现约 3000 个词族覆盖电视的 95%,7000 个覆盖 98%,所以恰恰在通用词表开始只付得起小数位的地方,你自己的输入成了更好的选词原则。
什么是中频词,它们为什么重要?
Schmitt 与 Schmitt (2014) 用这个术语指大约 4000 到 9000 个词族的区间,介于人人都教的高频核心与没人教的低频尾巴之间。它们重要,是因为它们正是"跟得上对话"与"无助读完一本小说"之间的落差,也因为它们是最难被顺带捡起来的一段:稀疏到接触凑不够相遇次数,又常见到跳过并非没有代价。Cobb (2007) 直接对这个问题建模,发现光靠阅读会让这些词段的大部分留在未习得状态。刻意的、分散的复习在这一区间回报最大。
就算是稀有词,只要我喜欢就值得背吗?
值得,但是作为补充而不是替代,而且这个例外背后有真实的机制。Laufer 与 Hulstijn (2001) 描述了任务引发的投入负荷:一个你需要、你去找、并由你自己选定含义的词,比递到手上的词记得更牢,所以你为了说出某句话而查的词,进来时已经半编码。这个优势并不推翻词频分布。行得通的分工是把高频核心当作骨干,让个人词汇在旁边同行,而不是让一张心爱的稀有名词清单变成全部计划。
同源词算不算我已经会的词?
部分算,而且值得早点认出来,因为它们改变了这件事的实际规模。de Groot 与 Keijzer (2000) 发现同源词比可比的非同源词学得更快、忘得更慢,所以你的母语与目标语之间的重叠是真实的先发优势,不是错觉。但有两点保留。假朋友就藏在同一个集合里,同样容易被学错;而且一个你在纸面上认得出的同源词,未必是你能说出口或用得上的词。把它们当成便宜而不是免费,只跳过那些你已经会用的。

资料来源

  1. Nation, I. S. P., & Waring, R. (1997). Vocabulary size, text coverage and word lists. In N. Schmitt & M. McCarthy (Eds.), Vocabulary: Description, Acquisition and Pedagogy (pp. 6–19). Cambridge University Press.
  2. Nation, I. S. P. (2006). How large a vocabulary is needed for reading and listening? Canadian Modern Language Review, 63(1), 59–82.
  3. Schmitt, N., & Schmitt, D. (2014). A reassessment of frequency and vocabulary size in L2 vocabulary teaching. Language Teaching, 47(4), 484–503.
  4. Zipf, G. K. (1949). Human Behavior and the Principle of Least Effort. Addison-Wesley.
  5. Adolphs, S., & Schmitt, N. (2003). Lexical coverage of spoken discourse. Applied Linguistics, 24(4), 425–438.
  6. Hu, M., & Nation, P. (2000). Unknown vocabulary density and reading comprehension. Reading in a Foreign Language, 13(1), 403–430.
  7. Laufer, B., & Ravenhorst-Kalovski, G. C. (2010). Lexical threshold revisited: Lexical text coverage, learners’ vocabulary size and reading comprehension. Reading in a Foreign Language, 22(1), 15–30.
  8. Webb, S., & Rodgers, M. P. H. (2009). Vocabulary demands of television programs. Language Learning, 59(2), 335–366.
  9. van Zeeland, H., & Schmitt, N. (2013). Lexical coverage in L1 and L2 listening comprehension: The same or different from reading comprehension? Applied Linguistics, 34(4), 457–479.
  10. Cobb, T. (2007). Computing the vocabulary demands of L2 reading. Language Learning & Technology, 11(3), 38–63.
  11. Laufer, B., & Hulstijn, J. (2001). Incidental vocabulary acquisition in a second language: The construct of task-induced involvement. Applied Linguistics, 22(1), 1–26.
  12. de Groot, A. M. B., & Keijzer, R. (2000). What is hard to learn is easy to forget: The roles of word concreteness, cognate status, and word frequency. Language Learning, 50(1), 1–56.
  13. Brysbaert, M., Stevens, M., Mandera, P., & Keuleers, E. (2016). How many words do we know? Frontiers in Psychology, 7, 1116.
  14. Bauer, L., & Nation, P. (1993). Word families. International Journal of Lexicography, 6(4), 253–279.
  15. Schmitt, N., Jiang, X., & Grabe, W. (2011). The percentage of words known in a text and reading comprehension. Modern Language Journal, 95(1), 26–43.
  16. Nation, I. S. P., & Wang, K. (1999). Graded readers and vocabulary. Reading in a Foreign Language, 12(2), 355–380.
  17. Webb, S. (2007). The effects of repetition on vocabulary knowledge. Applied Linguistics, 28(1), 46–65.
  18. Reviews.org (2026). Cell Phone Usage Stats. Survey of ~1,000 US adults, fielded Q4 2025. Report

覆盖率数字是英语的语料统计,具体数值会随语料库、文本类型和计数单位而变动:词族、词元和词形对同一篇文本会给出不同的数字。屈折更丰富或复合更能产的语言分布不同,所以请把具体百分比当作英语的,把曲线形状当作通用的。此外 Schmitt、Jiang 与 Grabe (2011) 发现覆盖率与理解之间的关系大体是线性的而非悬崖,所以 95% 和 98% 是有用的参照线,而不是理解会被点亮的门槛。卡片数量和每日合计是按一次提取尝试约二十秒推算出的算术结果,不是实测的应用数据。

把对的词放到你一定会看见的地方

LearnScreen 把精选核心和你自己的词放在同一条分散的队列里,在你伸手拿手机的那一刻送出 — 让那些日常生活永远不会重复够次数的词,照样得到它们需要的相遇。

在 App Store 下载