跳到正文
詞頻研究

該先背
哪些單字

最高頻的1000 個詞族涵蓋約 72% 的書面文本與 80% 以上的口語,而第一萬個千詞段增加的不到一個百分點(Nation 與 Waring, 1997;Nation, 2006)。也就是說,選哪些字比選哪種方法更要緊,而順序並非口味問題:先把前 2000–3000 個詞族吃透,再處理 4000 到 9000 的中頻段。Schmitt 與 Schmitt (2014) 把這一段描述為稀疏到光靠接觸無法記住、又常見到不能跳過。此後最好的下一個字,就是你剛剛需要卻沒有的那一個。

下文每個數字都在頁尾註明出處

打開被攔截的應用程式那一刻,iPhone 鎖定畫面上出現的單字卡

詞頻的分布極不均勻

多數建議把詞彙當成一堆待清理的東西,彷彿任何一千個字都和另一千個差不多值錢。語言並不這樣分布。詞頻遵循一條非常陡的冪次律 — 就是 Zipf (1949) 描述的那個形狀 — 少數幾個字承擔了幾乎全部被說出與寫下的內容,其餘則拉成一條很長的尾巴。

實際後果是:各詞段不可互換。下面每一列是按詞頻排列的一千個詞族,以及該詞段為你在普通書面文本上的涵蓋率增加了多少。

按詞頻排列的各千詞段、每段所達到的涵蓋率及其內容
詞頻段所達涵蓋率裡面是什麼
前 1000 個詞族約 72% 的書面文本,80% 以上的口語功能詞,以及每個句子賴以搭建的日常動詞與名詞 — 你這輩子學到最划算的一塊
第二個千詞段把你帶到約 80%同樣的字量再加約 8 個百分點:仍是常用詞彙,仍沒有理由跳過
第三個千詞段把你帶到約 84%再加約 4 個百分點:最後一個以整數百分點付帳的詞段,也是 Schmitt 與 Schmitt (2014) 所稱高頻詞彙的終點
第四到第九個千詞段把你從 84% 送向 98%中頻區:每段一到兩個百分點,稀疏到不常遇見,又常見到不能捨棄
第一萬個千詞段以外每千字不到一個百分點Zipf 的尾巴:幾萬個字,讀上幾年才碰見一次,沒有一個是急事

涵蓋率數字針對書面文本,來自 Nation 與 Waring (1997) 以及 Nation (2006);口語在低詞段更高、在高詞段更低,因為對話反覆使用更小的核心。這些是英語的數字:屈折更豐富的語言分布不同,因為在那裡一個詞族涵蓋更多不同形式。能遷移到任何語言的不是精確的百分比,而是曲線的形狀 — 開頭很陡,到第一萬個千詞段幾乎平坦。

三種不同的單字表都被叫作「該背的單字」

關於該背哪些字的爭論,通常發生在手裡拿著三種不同單字表、卻用同一個說法稱呼這三者的人之間。它們不是對手,而是階段,各自在不同的位置上是對的。

  • 詞頻表。 按在大型語料庫中出現的頻率排序的字。客觀、無關個人,在第三個千詞段以下無可匹敵,因為那些字出現在你今後讀到與聽到的一切之中。它的弱點是對你一無所知 — 而這一點要等到字不再「常見到誰都躲不開」之後才開始要緊。
  • 主題表或教材表。 按場景歸類的字:機場、餐廳、辦公室。對範圍明確的眼前需求有用,也容易拿在手裡,但對詞頻視而不見:主題表會欣然把一個稀有名詞排在常用動詞之前,而同一語義場的字一起呈現時,在還新鮮的階段會彼此干擾。
  • 你自己的字。 那些你因為想弄懂或想說出某件具體的事而查過的字。它們帶著真實的編碼優勢 — Laufer 與 Hulstijn (2001) 發現,一個你需要、你去找、並由你自己選定含義的字,比遞到手上的字記得更牢 — 但它們進來時毫無順序,放著不管就會往稀有的一側偏。

相鄰的問題,按目標與 CEFR 等級看總量有多大:說一門語言需要多少字

什麼樣的字值得你的下一次相遇

每一次相遇都花掉同樣的幾秒鐘,所以唯一要緊的問題是這幾秒買到了什麼。下面每一列是一個會改變字的價值的屬性、研究對它的說法,以及如何在不做表格的情況下應用它。

六個改變一個字此刻學習價值的屬性、各自的證據與應用
看什麼研究怎麼說實際是什麼樣
它在哪個詞段Nation 與 Waring (1997);Nation (2006):前三千用整數百分點買涵蓋率,之後只買到小數位先把高頻核心吃透:任何目標都不改變這個順序,因為這是關於語言的事實,不是關於你的
接觸會不會把它送來Schmitt 與 Schmitt (2014);Cobb (2007):中頻字太稀疏,光靠閱讀湊不夠相遇次數4000 到 9000 之間的字,才是刻意複習真正存在的理由;前一千個你反正會遇到
它出現在你接觸的內容裡嗎Webb 與 Rodgers (2009):約 3000 個詞族涵蓋電視的 95%,7000 個涵蓋 98%在第三個千詞段以上,你真正在看與讀的東西比通用語料排序挑得更準
是不是你自己需要過Laufer 與 Hulstijn (2001):需求、查找與權衡會獨立於接觸提高保持率一個你為了說出某句話而查過的字,進來時已經半編碼;留著它,但放在核心旁邊而不是取而代之
它是不是幾乎免費de Groot 與 Keijzer (2000):同源詞比可比的非同源詞學得更快、忘得更慢已經會用的同源詞可以跳過,但要留下假朋友 — 它們同樣容易被學錯
它能帶來多少Bauer 與 Nation (1993):知道一個成員,其屈折形式與規則衍生大體可以推出字根比衍生字更值:學會 help,就順帶得到 help、helpful、helper

只有第四列談的是偏好。其餘五列談的是語言的結構,以及你所接觸內容的結構,正因如此,選字是一根你不需要了解自己心理就能拉動的槓桿。也請注意這裡沒有什麼:這個字有多有趣、聽起來有多好聽、以及它是否恰好出現在你去上的那一課裡。

中頻難題

Schmitt 與 Schmitt (2014) 提出了一個聽上去像行政分類、實則不是的建議。他們把詞彙分成高頻 — 任何課程都會教的前 3000 個詞族 — 約 9000 以外的低頻,沒人教也沒人需要,以及夾在中間的那一段:它沒有名字,也在很大程度上因此沒有計畫。他們的要點是,多數人正是在那裡悄悄停住的:它位於「跟得上對話」與「不查字典讀小說」之間,而且比人人都盯著的那個核心大好幾倍。

讓這一段棘手的,是被兩種機制夾住。它稀疏到接觸應付不來:一個字大約需要八到十二次分散的相遇才留得住(Nation 與 Wang, 1999;Webb, 2007),而第七個千詞段的字,在你消遣閱讀的材料裡根本不會出現那麼多次。Cobb (2007) 正是對此建模,把大量文本送進附帶習得的模擬,發現無論讀多少,光靠閱讀都會讓中間詞段的大部分留在未習得的狀態。而它又常見到不能跳過,因為造成 84% 涵蓋率與 Hu 與 Nation (2000) 所關聯的、可無助理解的 98% 之間差距的,正是這些字。

這一夾擊就是刻意分散複習的實際理由,而且它對「力氣該花在哪裡」給得出奇準確。第一個千詞段幾乎不需要幫助:你在任何輸入裡都會不斷遇到。一萬以外的尾巴同樣不需要幫助,因為它不急。中頻區是唯一一處相遇不會自行發生、而字又確實值得的地方 — 這等於說,一套複習系統的價值幾乎完全取決於你往裡放哪些字。

每種字源在哪裡失效

任何挑字的方法都會運作一陣子,然後停下。知道停止點比擁有一個偏愛的方法更有用,因為失敗很少是因為方法本身錯了:多半是因為它被沿用到了還合適的那個點之外。

最後一列是多數人不知不覺站著的位置。

四種詞彙來源、各自擅長提供什麼,以及各自失效的位置
來源提供什麼在哪裡失效
通用詞頻表按正確順序給出核心,比任何別的方法都快大約在第三個千詞段,排序開始與你的輸入對不上,字開始顯得隨意
課程或主題表一個劃定的場景,以及足以繼續下去的結構一旦你需要主題之外的東西 — 何況它本來也從未按詞頻排列
閱讀與觀看與高頻核心反覆的、帶語境的相遇,且不花額外力氣中頻段,Cobb (2007) 發現那裡的相遇實在太稀疏,做不完這件事
你自己蒐集的字高投入負荷,以及與你想說的話完美相關哪裡都不失效 — 但它會向稀有與無序偏移,所以作為補充有效,作為全部計畫則失敗

貫穿這四列的形狀是:沒有任何單一來源涵蓋全程,而中頻段正是從它們全部之間漏下去的那一段:對入門單字表太高,對你自己的查詢太低,稀疏到輸入送不來。這一段需要的不是更好的來源,而是比日常生活所能提供的更分散的相遇。一個字在兩次相遇之間發生了什麼,見 為什麼背過的單字還是會忘

把這幾秒花在對的字上

如果選字是槓桿,那麼系統的任務就是把選中的字足夠頻繁地放到你面前,而不要求你安排時間。LearnScreen 用的是你已經擁有的那個瞬間 — 伸手去拿手機 — 於是力氣花在決定「哪些字」上,而不是花在「為它們找時間」上。

1

單字表已經排好序

18 個主題下精選 1080 多個字,按日常核心先於專門詞彙的順序排列,而不是按某一課恰好引入它們的順序。有 11 種語言可作為學習目標。

2

你自己的字就在旁邊

不限數量的自建字詞,可帶譯文、注音與例句 — 那些任何通用單字表都無法預知的中頻字與個人需要的字,與核心排在同一佇列裡,而不是放進一個你後來不再打開的分區。

3

相遇自己會來

手機每天被查看約 186 次,清醒時每小時約 11.6 次(Reviews.org, 2026)。藉助 Apple 的螢幕使用時間 API,LearnScreen 攔截你選定的應用程式,並在動態消息本該出現的位置放上一個字,於是一個稀有字所需的那些相遇,不用安排也會發生。

  • 回來的順序由萊特納系統決定。 答錯的字更早回來,答對的按幾何級數拉開間隔 — 正是這一點把一張長長的單字表變成了每天應付得來的相遇次數。
  • 劑量由你設定。 每次 3 到 20 個字,攔截多久回來一次同樣可調;按預設設定約合每天 25 次提取嘗試,分散開來約兩分半鐘。
  • 按下之前答案是隱藏的。 每張卡都是一次提取嘗試而非一次閱讀,遷移的正是這個方向:主動詞彙與被動詞彙
  • 離線可用,無需帳號。 應用程式裝好之後,卡片與攔截無網也能運作;iCloud 備份寫入你自己的私有資料庫而不是我們的伺服器,也沒有什麼需要註冊。

單字出現的
位置

應用程式中的四個畫面:攔截卡、帶例句的答案、單字表與進度。

被攔截的應用程式在保護畫面上顯示單字卡,取代了原本的動態消息 卡片上揭曉的答案,附有譯文與一個使用該字的例句 精選主題的單字表,旁邊是使用者自己的字 進度畫面:有多少字在分散複習佇列中向上前進

繼續閱讀

常見問題

學一門新語言該先背哪些單字?
先背最高頻的一千個詞族,而且分布並不均勻。Nation 與 Waring (1997) 把前 1000 個詞族定在約 72% 的書面文本,Nation (2006) 則把它們定在 80% 以上的口語,因為這一段裡裝的是功能詞與每個句子賴以搭建的日常動詞。第二個千詞段增加約 8 個百分點,第三個約 4 個,所以前 3000 個詞族的價值超過之後所有字加起來。任何目標都不改變這個順序,因為這是語言的屬性而不是學習者的屬性:旅行的人、備考的人、想讀小說的人,需要的是同一批頭一千個字。
常用字到底需要多少個?
取決於你想拿它們做什麼,兩個門檻相距很遠。Adolphs 與 Schmitt (2003) 發現最常用的 2000 到 3000 個詞族占日常英語口語的約 95%,van Zeeland 與 Schmitt (2013) 則認為 95% 的涵蓋率足以支撐聽力理解。閱讀要求更高:Hu 與 Nation (2000) 發現無助理解需要約 98% 的涵蓋率,Laufer 與 Ravenhorst-Kalovski (2010) 把它估算為約 8000 個詞族。也就是說,3000 個買下對話,而爬到輕鬆閱讀還要再花上幾千個。
該用詞頻表,還是用我讀到的字?
先用詞頻表,再用你讀到的,切換點大約在第三個千詞段。在那個點以下,詞頻表無可匹敵,因為那些字出現在一切之中,順序也客觀正確。在那之上,詞頻表就不再適合你了:一門語言裡第 5000 常見的字,在你實際擁有的書、劇與對話裡可能很稀有。Webb 與 Rodgers (2009) 發現約 3000 個詞族涵蓋電視的 95%,7000 個涵蓋 98%,所以恰恰在通用單字表開始只付得起小數位的地方,你自己的輸入成了更好的選字原則。
什麼是中頻字,它們為什麼重要?
Schmitt 與 Schmitt (2014) 用這個術語指大約 4000 到 9000 個詞族的區間,介於人人都教的高頻核心與沒人教的低頻尾巴之間。它們重要,是因為它們正是「跟得上對話」與「無助讀完一本小說」之間的落差,也因為它們是最難被順帶撿起來的一段:稀疏到接觸湊不夠相遇次數,又常見到跳過並非沒有代價。Cobb (2007) 直接對這個問題建模,發現光靠閱讀會讓這些詞段的大部分留在未習得狀態。刻意的、分散的複習在這一區間回報最大。
就算是稀有字,只要我喜歡就值得背嗎?
值得,但是作為補充而不是替代,而且這個例外背後有真實的機制。Laufer 與 Hulstijn (2001) 描述了任務引發的投入負荷:一個你需要、你去找、並由你自己選定含義的字,比遞到手上的字記得更牢,所以你為了說出某句話而查的字,進來時已經半編碼。這個優勢並不推翻詞頻分布。行得通的分工是把高頻核心當作骨幹,讓個人詞彙在旁邊同行,而不是讓一張心愛的稀有名詞清單變成全部計畫。
同源詞算不算我已經會的字?
部分算,而且值得早點認出來,因為它們改變了這件事的實際規模。de Groot 與 Keijzer (2000) 發現同源詞比可比的非同源詞學得更快、忘得更慢,所以你的母語與目標語之間的重疊是真實的先發優勢,不是錯覺。但有兩點保留。假朋友就藏在同一個集合裡,同樣容易被學錯;而且一個你在紙面上認得出的同源詞,未必是你能說出口或用得上的字。把它們當成便宜而不是免費,只跳過那些你已經會用的。

資料來源

  1. Nation, I. S. P., & Waring, R. (1997). Vocabulary size, text coverage and word lists. In N. Schmitt & M. McCarthy (Eds.), Vocabulary: Description, Acquisition and Pedagogy (pp. 6–19). Cambridge University Press.
  2. Nation, I. S. P. (2006). How large a vocabulary is needed for reading and listening? Canadian Modern Language Review, 63(1), 59–82.
  3. Schmitt, N., & Schmitt, D. (2014). A reassessment of frequency and vocabulary size in L2 vocabulary teaching. Language Teaching, 47(4), 484–503.
  4. Zipf, G. K. (1949). Human Behavior and the Principle of Least Effort. Addison-Wesley.
  5. Adolphs, S., & Schmitt, N. (2003). Lexical coverage of spoken discourse. Applied Linguistics, 24(4), 425–438.
  6. Hu, M., & Nation, P. (2000). Unknown vocabulary density and reading comprehension. Reading in a Foreign Language, 13(1), 403–430.
  7. Laufer, B., & Ravenhorst-Kalovski, G. C. (2010). Lexical threshold revisited: Lexical text coverage, learners’ vocabulary size and reading comprehension. Reading in a Foreign Language, 22(1), 15–30.
  8. Webb, S., & Rodgers, M. P. H. (2009). Vocabulary demands of television programs. Language Learning, 59(2), 335–366.
  9. van Zeeland, H., & Schmitt, N. (2013). Lexical coverage in L1 and L2 listening comprehension: The same or different from reading comprehension? Applied Linguistics, 34(4), 457–479.
  10. Cobb, T. (2007). Computing the vocabulary demands of L2 reading. Language Learning & Technology, 11(3), 38–63.
  11. Laufer, B., & Hulstijn, J. (2001). Incidental vocabulary acquisition in a second language: The construct of task-induced involvement. Applied Linguistics, 22(1), 1–26.
  12. de Groot, A. M. B., & Keijzer, R. (2000). What is hard to learn is easy to forget: The roles of word concreteness, cognate status, and word frequency. Language Learning, 50(1), 1–56.
  13. Brysbaert, M., Stevens, M., Mandera, P., & Keuleers, E. (2016). How many words do we know? Frontiers in Psychology, 7, 1116.
  14. Bauer, L., & Nation, P. (1993). Word families. International Journal of Lexicography, 6(4), 253–279.
  15. Schmitt, N., Jiang, X., & Grabe, W. (2011). The percentage of words known in a text and reading comprehension. Modern Language Journal, 95(1), 26–43.
  16. Nation, I. S. P., & Wang, K. (1999). Graded readers and vocabulary. Reading in a Foreign Language, 12(2), 355–380.
  17. Webb, S. (2007). The effects of repetition on vocabulary knowledge. Applied Linguistics, 28(1), 46–65.
  18. Reviews.org (2026). Cell Phone Usage Stats. Survey of ~1,000 US adults, fielded Q4 2025. Report

涵蓋率數字是英語的語料統計,具體數值會隨語料庫、文本類型與計數單位而變動:詞族、詞元與詞形對同一篇文本會給出不同的數字。屈折更豐富或複合更能產的語言分布不同,所以請把具體百分比當作英語的,把曲線形狀當作通用的。此外 Schmitt、Jiang 與 Grabe (2011) 發現涵蓋率與理解之間的關係大體是線性的而非懸崖,所以 95% 與 98% 是有用的參照線,而不是理解會被點亮的門檻。卡片數量與每日合計是按一次提取嘗試約二十秒推算出的算術結果,不是實測的應用程式數據。

把對的字放到你一定會看見的地方

LearnScreen 把精選核心與你自己的字放在同一條分散的佇列裡,在你伸手拿手機的那一刻送出 — 讓那些日常生活永遠不會重複夠次數的字,照樣得到它們需要的相遇。

在 App Store 下載