成效研究究竟量測了什麼
語言學習 app 是全球下載量最高的類別之一,也是被嚴格檢驗得最少的類別之一。像樣的研究只有寥寥幾項,規模都不大,而它們的結果比廣告有趣,也比嘲諷有趣。放在一起看,形狀是一致的:進步是真的,集中在辨識而不是產出,個別差異極大。
經費來源這一欄和結論那一欄同樣重要。這個領域被引用最多的數字來自開發商付費的研究。這不會讓數字變假,但它是懷疑的下限,而不是承諾的上限。
| 研究 | 量測了什麼 | 發現了什麼 |
|---|---|---|
| Vesselinov & Grego (2012) | 西班牙語成人初學者,在 app 自學前後以大學分級測驗評估——由開發商委託 | 平均約 34 小時帶來相當於大學第一學期的進步,但每個人實際讀了多少差異極大 |
| Loewen et al. (2019) | 獨立的學期研究,大學生用同一款 app 從零開始學土耳其語 | 閱讀與聽力有可量測的進步,口說幾乎沒有變化,使用量在學期中急遽下滑 |
| Rachels & Rockinson-Szapkiw (2018) | 國小階段,遊戲化的西班牙語 app 與面授課對照,同時量測成績與自我效能 | 成績沒有顯著差異,app 組的自我效能較低:一樣的結果,比較少的信心 |
| Golonka et al. (2014) | 對整個語言學習科技版圖的回顧,依技術類型與證據強度整理 | 熱情很多,而嚴謹證據很薄,難以證明某項具體技術勝過一般教學;證據最扎實的用途都很窄很具體 |
| Burston (2015) | 二十年的行動語言學習專案,依所報告的學習成果究竟建立在什麼之上來分析 | 幾乎所有專案都很短、很小:正面結果描述的是幾週的新鮮感,而不是以學期計的學習 |
這些研究都沒有測試過本 app,也都沒有量測流利度。它們量的是分級測驗分數、接受性技能,以及以週或一個學期為跨度的學業表現。對這一類別的結論應該是「確實有作用,在入門階段,先出現在辨識上」——而任何承諾靠點螢幕就能會話的數字,都沒有依據。
「app 有用」底下同時跑著三種不同的主張
它們的證據完全不同,所以同一個人完全可以既認為 app 有用,又認為它的廣告是胡說。得到良好支持的只有第一種。
- 有支持的:入門階段可量測的進步,主要在接受面。 上面每一項研究都發現了些什麼。分級分數在動,閱讀與聽力在動,而詞彙是最穩定在動的部分:它是對間隔提取反應最好的成分,也是軟體唯一比課堂做得更好的事。
- 被誇大的:app 可以取代課程。 Rachels 與 Rockinson-Szapkiw(2018)發現的是與面授打平,而不是勝出;Loewen 等人發現的,正是課堂之所以存在要去補的那道口說缺口。Nation(2007)的四條線把結構說清楚了:意義導向的輸入、意義導向的輸出、有意識的語言學習、流利度培養,是四件不同的事,而點選式 app 恰好只在其中一件上強。
- 假的:每天十五分鐘就能流利。 這一文獻裡沒有任何研究量測過流利度,因此沒有任何研究支持流利度承諾。以每天十分鐘計,最著名結果裡的 34 小時要花大約七個月——而這個算法假設你一天都不漏,這正是下一節要拆掉的假設。
沒有提取的接觸是第四種主張,有它自己的證據:被動學習到底有沒有用
真正決定 app 對你有沒有用的是什麼
六件事,每一件都來自研究而不是功能清單,依對結果的影響排序。第一件壓過其餘,這對所有賣後面五件事的人來說都不方便。
| 什麼在決定 | 證據怎麼說 | 實際是什麼樣 |
|---|---|---|
| 學習到底有沒有發生 | Nielson(2011):拿到授權、有給薪學習時間與導師支援的聯邦員工,多數仍然很早停下,達到有意義使用量的人極少 | 失敗的不是一堂爛課,而是一堂從沒被打開的課:如果支援和給薪時間就夠,那項研究不會是那個結局 |
| 你在提取還是在辨識 | Roediger & Karpicke(2006):同樣時間內,被測驗比重讀帶來更好的長期保留 | 從四個方塊裡挑對的那個,比把字說出來容易得多,而容易的練習買到的更少;練習類型比 app 本身更重要 |
| 練習是否被分散 | Cepeda et al.(2006)綜合 254 項研究:分散練習回憶率約 47%,同樣的量集中做則為 37% | 六天各十分鐘勝過週日一小時,而每天都出現的 app,在比較內容之前就已經在這條軸上贏了 |
| 每個字是否得到足夠的相遇 | Nation & Wang(1999):一個字通常需要 8 到 12 次分散的相遇才會留下 | 每天都用新材料堆出來的連續紀錄永遠什麼都沒完成;留下的是那些被安排要回來的字 |
| 這些字值不值得這些相遇 | Nation(2006):前 3000 個字族涵蓋日常對話約 95%,此後涵蓋率急遽變平 | 依詞頻排序幾乎是第一年的全部收益——這也是為什麼一門講動物名稱的主題課程感覺很充實,數據卻很難看 |
| 這些分鐘從哪裡來 | Reviews.org(2026):美國成年人自述每天看手機約 186 次,大約每個清醒小時 11.6 次 | 需要在一天裡多開一格的計畫,要和這一天裡的所有事競爭;搭在既有習慣上的計畫則不必 |
只有第二到第五列關乎軟體品質,而這幾列幾乎整個類別早就解決了。第一列和第六列關乎交付方式,結果真正在那裡被決定——這也是方法比較一次次打平的原因。
評測從不量測的那個變數
app 比較寫的都是功能:語音辨識有多好、文法筆記值不值、複習佇列怎麼排。這些都是真實差別,也都是小差別。不小的差別在做了四十次的人和做了四次的人之間,而沒有任何評測能告訴你你會是哪一個,因為那不是 app 的屬性。
所以成效研究不斷給出平的結果。Golonka 等人(2014)去找有強證據顯示優勢的技術,找到的主要是熱情;Burston(2015)發現二十年的行動專案被以週計的研究主導。當時長很短、參與者之間投入時間相差一個數量級時,方法差異幾乎沒有空間顯現。與此同時,Nielson(2011)搭起了自學軟體本該最有利的場景——志願者、授權、受保護的時間、導師——然後看著多數人停下。持續不是硬因素旁邊的軟因素。它就是那個硬因素。
這就把人們真正想問的問題重寫了一遍。誠實的版本是:在什麼都不順的日子裡,這款 app 能不能產生足夠多的學習次數,讓分散與提取累積起來?本頁的任何技巧,在你三月就不再打開的 app 裡價值都是零;而哪怕平庸的技巧,在一款你從來不必決定是否打開的 app 裡也會複利。有效的一步不是去獵一個更好的練習,而是去打真正發生損失的那一步。
放棄的代價,用研究的單位來算
「要持續」是一句沒人能執行的建議。下面是同一件事換成數字:學習停止時隨之停止的四件具體的事,每一件都有人量過。
注意其中三件說的都不是「學得更少」,而是丟掉你已經付過費的材料。
| 失去什麼 | 證據 | 量出的大小 |
|---|---|---|
| 分散帶來的優勢 | Cepeda et al.(2006),254 項分散練習研究的綜合 | 約 47% 對 37%——這個差距只有在另一天回來時才拿得到 |
| 這個字還欠的相遇 | Nation & Wang(1999),關於一個字要遇到多少次才站得住 | 大約 8 到 12 次;在第四次放棄的字不是學會了三分之一,而是沒了 |
| 所有學到一半的東西 | Murre & Dros(2015),對艾賓浩斯遺忘曲線的重複驗證 | 沒有複習時早期損失很陡:你不再清空的佇列在頭幾天衰減最快,之後才放緩 |
| 一門讀完的課 | Nielson(2011),帶授權、時間與支援的職場自學 | 多數人很早停下:自主學習軟體最常見的結局是一門沒讀完的課,而不是一門爛課 |
這不是在提倡自律,而是在提倡把事情安排成你和一次複習之間少幾個決定——那是一個設計問題,而且可解。這中間那個字會怎麼樣,見為什麼你會忘記單字。
把發生損失的那一步直接拿掉
如果決定結果的變數是持續,那麼有用的設計問題就不是「怎樣把一堂課做得更好」,而是「怎樣讓一次複習在沒有人決定開始的情況下發生」。LearnScreen 就是圍繞這一個想法做的;機制如下,不加修飾:
沒有要開始的學習時段
蘋果的「螢幕使用時間」介面允許封鎖你選定的 app。當你打開其中一個時,本該是動態消息的位置出現一張單字卡。手機每天大約被查看 186 次(Reviews.org, 2026),所以複習是搭在已經存在的習慣上,而不是再要一格時間。
每張卡片都是一次提取嘗試
答案在你點擊前一直隱藏,所以卡片是一次測驗而不是一段閱讀——正是 Roediger 與 Karpicke(2006)發現長期保留更好的那個方向。環境式交付提高的是嘗試的次數,而不是每次嘗試的價值。
由排程決定什麼會回來
萊特納佇列讓答錯的字更早回來,讓已掌握的字按幾何級數往後退,於是一個字所需的 8 到 12 次相遇(Nation & Wang, 1999)會攤在多天裡,而不是擠在一次裡。
- 劑量由你定。 每次 3 到 20 個字,封鎖返回的頻率同樣可調。預設值下大約每天 25 次提取嘗試,合計約兩分半,分散著進行:小到不必為它取消任何別的安排。
- 它不是課程,也不假裝是。 這是有意識的詞彙學習,Nation(2007)四條線中的一條。說、讀、聽是它不做的工作,它誠實的位置在這些之下:主動詞彙與被動詞彙。
- 依詞頻排的字表,或者你自己的字。 現成字庫從涵蓋率最便宜的地方開始(Nation, 2006),你手動加入或整批貼上的內容進入同一個佇列:究竟需要多少字。
- 離線可用,不需帳號。 安裝之後卡片和封鎖都不需連網;iCloud 備份寫入你自己的私有資料庫而不是我們的伺服器,也沒有任何需要註冊的東西。
延伸閱讀
- 被動學習到底有沒有用 — 單靠接觸能帶來什麼,又在哪裡停下。
- 怎樣才能不半途而廢 — 本頁最後落到的持續問題,認真對待。
- 每天需要多少分鐘 — 那 34 小時攤到一年裡是什麼樣子。
- 主動詞彙與被動詞彙 — 為什麼 app 帶來的進步先落在辨識上。
- 該先學哪些字 — 怎樣讓每一次相遇都值得。
常見問題
參考來源
- Vesselinov, R., & Grego, J. (2012). Duolingo Effectiveness Study. City University of New York / University of South Carolina. Commissioned by Duolingo.
- Loewen, S., Crowther, D., Isbell, D. R., Kim, K. M., Maloney, J., Miller, Z. F., & Rawal, H. (2019). Mobile-assisted language learning: A Duolingo case study. ReCALL, 31(3), 293–311.
- Rachels, J. R., & Rockinson-Szapkiw, A. J. (2018). The effects of a mobile gamification app on elementary students’ Spanish achievement and self-efficacy. Computer Assisted Language Learning, 31(1–2), 72–89.
- Nielson, K. B. (2011). Self-study with language learning software in the workplace: What happens? Language Learning & Technology, 15(3), 110–129.
- Golonka, E. M., Bowles, A. R., Frank, V. M., Richardson, D. L., & Freynik, S. (2014). Technologies for foreign language learning: A review of technology types and their effectiveness. Computer Assisted Language Learning, 27(1), 70–105.
- Burston, J. (2015). Twenty years of MALL project implementation: A meta-analysis of learning outcomes. ReCALL, 27(1), 4–20.
- Cepeda, N. J., Pashler, H., Vul, E., Wixted, J. T., & Rohrer, D. (2006). Distributed practice in verbal recall tasks: A review and quantitative synthesis. Psychological Bulletin, 132(3), 354–380.
- Roediger, H. L., & Karpicke, J. D. (2006). Test-enhanced learning: Taking memory tests improves long-term retention. Psychological Science, 17(3), 249–255.
- Nation, I. S. P., & Wang, K. (1999). Graded readers and vocabulary. Reading in a Foreign Language, 12(2), 355–380.
- Nation, I. S. P. (2006). How large a vocabulary is needed for reading and listening? Canadian Modern Language Review, 63(1), 59–82.
- Nation, I. S. P. (2007). The four strands. Innovation in Language Learning and Teaching, 1(1), 2–13.
- Murre, J. M. J., & Dros, J. (2015). Replication and analysis of Ebbinghaus’ forgetting curve. PLOS ONE, 10(7), e0120644.
- Reviews.org (2026). Cell Phone Usage Stats. Survey of ~1,000 US adults, fielded Q4 2025. Report
這些都是小規模研究。樣本從單一班級到幾百人不等,時長從數週到一個學期,量測工具是分級測驗與技能測驗組合,而不是真實對話。其中一項由被評估的公司出資,引用處已註明。LearnScreen 沒有做過成效試驗,本頁也不作此主張;與本 app 有關的數字是基於預設值與大約二十秒一次提取嘗試的算術,而不是實測的使用資料。
修好那個決定結果的步驟
如果研究說持續勝過方法,那麼解法就不是一堂更好的課,而是一次不需要做決定就會發生的複習。LearnScreen 把它放在你本來就要解鎖的手機上,一分鐘新時間都不要。
在 App Store 下載
