詞頻的分布極不均勻
多數建議把詞彙當成一堆待清理的東西,彷彿任何一千個字都和另一千個差不多值錢。語言並不這樣分布。詞頻遵循一條非常陡的冪次律 — 就是 Zipf (1949) 描述的那個形狀 — 少數幾個字承擔了幾乎全部被說出與寫下的內容,其餘則拉成一條很長的尾巴。
實際後果是:各詞段不可互換。下面每一列是按詞頻排列的一千個詞族,以及該詞段為你在普通書面文本上的涵蓋率增加了多少。
| 詞頻段 | 所達涵蓋率 | 裡面是什麼 |
|---|---|---|
| 前 1000 個詞族 | 約 72% 的書面文本,80% 以上的口語 | 功能詞,以及每個句子賴以搭建的日常動詞與名詞 — 你這輩子學到最划算的一塊 |
| 第二個千詞段 | 把你帶到約 80% | 同樣的字量再加約 8 個百分點:仍是常用詞彙,仍沒有理由跳過 |
| 第三個千詞段 | 把你帶到約 84% | 再加約 4 個百分點:最後一個以整數百分點付帳的詞段,也是 Schmitt 與 Schmitt (2014) 所稱高頻詞彙的終點 |
| 第四到第九個千詞段 | 把你從 84% 送向 98% | 中頻區:每段一到兩個百分點,稀疏到不常遇見,又常見到不能捨棄 |
| 第一萬個千詞段以外 | 每千字不到一個百分點 | Zipf 的尾巴:幾萬個字,讀上幾年才碰見一次,沒有一個是急事 |
涵蓋率數字針對書面文本,來自 Nation 與 Waring (1997) 以及 Nation (2006);口語在低詞段更高、在高詞段更低,因為對話反覆使用更小的核心。這些是英語的數字:屈折更豐富的語言分布不同,因為在那裡一個詞族涵蓋更多不同形式。能遷移到任何語言的不是精確的百分比,而是曲線的形狀 — 開頭很陡,到第一萬個千詞段幾乎平坦。
三種不同的單字表都被叫作「該背的單字」
關於該背哪些字的爭論,通常發生在手裡拿著三種不同單字表、卻用同一個說法稱呼這三者的人之間。它們不是對手,而是階段,各自在不同的位置上是對的。
- 詞頻表。 按在大型語料庫中出現的頻率排序的字。客觀、無關個人,在第三個千詞段以下無可匹敵,因為那些字出現在你今後讀到與聽到的一切之中。它的弱點是對你一無所知 — 而這一點要等到字不再「常見到誰都躲不開」之後才開始要緊。
- 主題表或教材表。 按場景歸類的字:機場、餐廳、辦公室。對範圍明確的眼前需求有用,也容易拿在手裡,但對詞頻視而不見:主題表會欣然把一個稀有名詞排在常用動詞之前,而同一語義場的字一起呈現時,在還新鮮的階段會彼此干擾。
- 你自己的字。 那些你因為想弄懂或想說出某件具體的事而查過的字。它們帶著真實的編碼優勢 — Laufer 與 Hulstijn (2001) 發現,一個你需要、你去找、並由你自己選定含義的字,比遞到手上的字記得更牢 — 但它們進來時毫無順序,放著不管就會往稀有的一側偏。
相鄰的問題,按目標與 CEFR 等級看總量有多大:說一門語言需要多少字。
什麼樣的字值得你的下一次相遇
每一次相遇都花掉同樣的幾秒鐘,所以唯一要緊的問題是這幾秒買到了什麼。下面每一列是一個會改變字的價值的屬性、研究對它的說法,以及如何在不做表格的情況下應用它。
| 看什麼 | 研究怎麼說 | 實際是什麼樣 |
|---|---|---|
| 它在哪個詞段 | Nation 與 Waring (1997);Nation (2006):前三千用整數百分點買涵蓋率,之後只買到小數位 | 先把高頻核心吃透:任何目標都不改變這個順序,因為這是關於語言的事實,不是關於你的 |
| 接觸會不會把它送來 | Schmitt 與 Schmitt (2014);Cobb (2007):中頻字太稀疏,光靠閱讀湊不夠相遇次數 | 4000 到 9000 之間的字,才是刻意複習真正存在的理由;前一千個你反正會遇到 |
| 它出現在你接觸的內容裡嗎 | Webb 與 Rodgers (2009):約 3000 個詞族涵蓋電視的 95%,7000 個涵蓋 98% | 在第三個千詞段以上,你真正在看與讀的東西比通用語料排序挑得更準 |
| 是不是你自己需要過 | Laufer 與 Hulstijn (2001):需求、查找與權衡會獨立於接觸提高保持率 | 一個你為了說出某句話而查過的字,進來時已經半編碼;留著它,但放在核心旁邊而不是取而代之 |
| 它是不是幾乎免費 | de Groot 與 Keijzer (2000):同源詞比可比的非同源詞學得更快、忘得更慢 | 已經會用的同源詞可以跳過,但要留下假朋友 — 它們同樣容易被學錯 |
| 它能帶來多少 | Bauer 與 Nation (1993):知道一個成員,其屈折形式與規則衍生大體可以推出 | 字根比衍生字更值:學會 help,就順帶得到 help、helpful、helper |
只有第四列談的是偏好。其餘五列談的是語言的結構,以及你所接觸內容的結構,正因如此,選字是一根你不需要了解自己心理就能拉動的槓桿。也請注意這裡沒有什麼:這個字有多有趣、聽起來有多好聽、以及它是否恰好出現在你去上的那一課裡。
中頻難題
Schmitt 與 Schmitt (2014) 提出了一個聽上去像行政分類、實則不是的建議。他們把詞彙分成高頻 — 任何課程都會教的前 3000 個詞族 — 約 9000 以外的低頻,沒人教也沒人需要,以及夾在中間的那一段:它沒有名字,也在很大程度上因此沒有計畫。他們的要點是,多數人正是在那裡悄悄停住的:它位於「跟得上對話」與「不查字典讀小說」之間,而且比人人都盯著的那個核心大好幾倍。
讓這一段棘手的,是被兩種機制夾住。它稀疏到接觸應付不來:一個字大約需要八到十二次分散的相遇才留得住(Nation 與 Wang, 1999;Webb, 2007),而第七個千詞段的字,在你消遣閱讀的材料裡根本不會出現那麼多次。Cobb (2007) 正是對此建模,把大量文本送進附帶習得的模擬,發現無論讀多少,光靠閱讀都會讓中間詞段的大部分留在未習得的狀態。而它又常見到不能跳過,因為造成 84% 涵蓋率與 Hu 與 Nation (2000) 所關聯的、可無助理解的 98% 之間差距的,正是這些字。
這一夾擊就是刻意分散複習的實際理由,而且它對「力氣該花在哪裡」給得出奇準確。第一個千詞段幾乎不需要幫助:你在任何輸入裡都會不斷遇到。一萬以外的尾巴同樣不需要幫助,因為它不急。中頻區是唯一一處相遇不會自行發生、而字又確實值得的地方 — 這等於說,一套複習系統的價值幾乎完全取決於你往裡放哪些字。
每種字源在哪裡失效
任何挑字的方法都會運作一陣子,然後停下。知道停止點比擁有一個偏愛的方法更有用,因為失敗很少是因為方法本身錯了:多半是因為它被沿用到了還合適的那個點之外。
最後一列是多數人不知不覺站著的位置。
| 來源 | 提供什麼 | 在哪裡失效 |
|---|---|---|
| 通用詞頻表 | 按正確順序給出核心,比任何別的方法都快 | 大約在第三個千詞段,排序開始與你的輸入對不上,字開始顯得隨意 |
| 課程或主題表 | 一個劃定的場景,以及足以繼續下去的結構 | 一旦你需要主題之外的東西 — 何況它本來也從未按詞頻排列 |
| 閱讀與觀看 | 與高頻核心反覆的、帶語境的相遇,且不花額外力氣 | 在中頻段,Cobb (2007) 發現那裡的相遇實在太稀疏,做不完這件事 |
| 你自己蒐集的字 | 高投入負荷,以及與你想說的話完美相關 | 哪裡都不失效 — 但它會向稀有與無序偏移,所以作為補充有效,作為全部計畫則失敗 |
貫穿這四列的形狀是:沒有任何單一來源涵蓋全程,而中頻段正是從它們全部之間漏下去的那一段:對入門單字表太高,對你自己的查詢太低,稀疏到輸入送不來。這一段需要的不是更好的來源,而是比日常生活所能提供的更分散的相遇。一個字在兩次相遇之間發生了什麼,見 為什麼背過的單字還是會忘。
把這幾秒花在對的字上
如果選字是槓桿,那麼系統的任務就是把選中的字足夠頻繁地放到你面前,而不要求你安排時間。LearnScreen 用的是你已經擁有的那個瞬間 — 伸手去拿手機 — 於是力氣花在決定「哪些字」上,而不是花在「為它們找時間」上。
單字表已經排好序
18 個主題下精選 1080 多個字,按日常核心先於專門詞彙的順序排列,而不是按某一課恰好引入它們的順序。有 11 種語言可作為學習目標。
你自己的字就在旁邊
不限數量的自建字詞,可帶譯文、注音與例句 — 那些任何通用單字表都無法預知的中頻字與個人需要的字,與核心排在同一佇列裡,而不是放進一個你後來不再打開的分區。
相遇自己會來
手機每天被查看約 186 次,清醒時每小時約 11.6 次(Reviews.org, 2026)。藉助 Apple 的螢幕使用時間 API,LearnScreen 攔截你選定的應用程式,並在動態消息本該出現的位置放上一個字,於是一個稀有字所需的那些相遇,不用安排也會發生。
- 回來的順序由萊特納系統決定。 答錯的字更早回來,答對的按幾何級數拉開間隔 — 正是這一點把一張長長的單字表變成了每天應付得來的相遇次數。
- 劑量由你設定。 每次 3 到 20 個字,攔截多久回來一次同樣可調;按預設設定約合每天 25 次提取嘗試,分散開來約兩分半鐘。
- 按下之前答案是隱藏的。 每張卡都是一次提取嘗試而非一次閱讀,遷移的正是這個方向:主動詞彙與被動詞彙。
- 離線可用,無需帳號。 應用程式裝好之後,卡片與攔截無網也能運作;iCloud 備份寫入你自己的私有資料庫而不是我們的伺服器,也沒有什麼需要註冊。
繼續閱讀
- 說一門語言需要多少字 — 按目標與 CEFR 等級看整件事有多大。
- 一天背多少個字 — 走完選定單字表的速度。
- 該在語境中記單字嗎 — 字選定之後,卡片上該放什麼。
- 為什麼背過的單字還是會忘 — 一個字在兩次相遇之間發生了什麼。
- 被動學習真的有用嗎 — 光靠接觸能產生什麼,又在哪裡停下。
- 主動詞彙與被動詞彙 — 為什麼有些字看得懂卻說不出來。
常見問題
資料來源
- Nation, I. S. P., & Waring, R. (1997). Vocabulary size, text coverage and word lists. In N. Schmitt & M. McCarthy (Eds.), Vocabulary: Description, Acquisition and Pedagogy (pp. 6–19). Cambridge University Press.
- Nation, I. S. P. (2006). How large a vocabulary is needed for reading and listening? Canadian Modern Language Review, 63(1), 59–82.
- Schmitt, N., & Schmitt, D. (2014). A reassessment of frequency and vocabulary size in L2 vocabulary teaching. Language Teaching, 47(4), 484–503.
- Zipf, G. K. (1949). Human Behavior and the Principle of Least Effort. Addison-Wesley.
- Adolphs, S., & Schmitt, N. (2003). Lexical coverage of spoken discourse. Applied Linguistics, 24(4), 425–438.
- Hu, M., & Nation, P. (2000). Unknown vocabulary density and reading comprehension. Reading in a Foreign Language, 13(1), 403–430.
- Laufer, B., & Ravenhorst-Kalovski, G. C. (2010). Lexical threshold revisited: Lexical text coverage, learners’ vocabulary size and reading comprehension. Reading in a Foreign Language, 22(1), 15–30.
- Webb, S., & Rodgers, M. P. H. (2009). Vocabulary demands of television programs. Language Learning, 59(2), 335–366.
- van Zeeland, H., & Schmitt, N. (2013). Lexical coverage in L1 and L2 listening comprehension: The same or different from reading comprehension? Applied Linguistics, 34(4), 457–479.
- Cobb, T. (2007). Computing the vocabulary demands of L2 reading. Language Learning & Technology, 11(3), 38–63.
- Laufer, B., & Hulstijn, J. (2001). Incidental vocabulary acquisition in a second language: The construct of task-induced involvement. Applied Linguistics, 22(1), 1–26.
- de Groot, A. M. B., & Keijzer, R. (2000). What is hard to learn is easy to forget: The roles of word concreteness, cognate status, and word frequency. Language Learning, 50(1), 1–56.
- Brysbaert, M., Stevens, M., Mandera, P., & Keuleers, E. (2016). How many words do we know? Frontiers in Psychology, 7, 1116.
- Bauer, L., & Nation, P. (1993). Word families. International Journal of Lexicography, 6(4), 253–279.
- Schmitt, N., Jiang, X., & Grabe, W. (2011). The percentage of words known in a text and reading comprehension. Modern Language Journal, 95(1), 26–43.
- Nation, I. S. P., & Wang, K. (1999). Graded readers and vocabulary. Reading in a Foreign Language, 12(2), 355–380.
- Webb, S. (2007). The effects of repetition on vocabulary knowledge. Applied Linguistics, 28(1), 46–65.
- Reviews.org (2026). Cell Phone Usage Stats. Survey of ~1,000 US adults, fielded Q4 2025. Report
涵蓋率數字是英語的語料統計,具體數值會隨語料庫、文本類型與計數單位而變動:詞族、詞元與詞形對同一篇文本會給出不同的數字。屈折更豐富或複合更能產的語言分布不同,所以請把具體百分比當作英語的,把曲線形狀當作通用的。此外 Schmitt、Jiang 與 Grabe (2011) 發現涵蓋率與理解之間的關係大體是線性的而非懸崖,所以 95% 與 98% 是有用的參照線,而不是理解會被點亮的門檻。卡片數量與每日合計是按一次提取嘗試約二十秒推算出的算術結果,不是實測的應用程式數據。
把對的字放到你一定會看見的地方
LearnScreen 把精選核心與你自己的字放在同一條分散的佇列裡,在你伸手拿手機的那一刻送出 — 讓那些日常生活永遠不會重複夠次數的字,照樣得到它們需要的相遇。
在 App Store 下載
