效果研究究竟测了什么
语言学习软件是全球下载量最高的品类之一,也是被严格检验得最少的品类之一。像样的研究只有寥寥几项,规模都不大,而它们的结果比广告更有意思,也比嘲讽更有意思。放在一起读,形状是一致的:提升是真实的,集中在识别而不是产出,个体差异极大。
资金来源这一列和结论那一列同样重要。这个领域被引用最多的数字来自开发方付费的研究。这不会让数字变假,但它是怀疑的下限,而不是承诺的上限。
| 研究 | 测了什么 | 发现了什么 |
|---|---|---|
| Vesselinov & Grego (2012) | 西班牙语成人初学者,在软件自学前后用大学分级测试评估——由开发方委托 | 平均约 34 小时带来了相当于大学第一学期的提升,但每个人实际学了多少差异极大 |
| Loewen et al. (2019) | 独立的学期研究,大学生用同一款软件从零开始学土耳其语 | 阅读和听力有可测量的提升,口语几乎没有变化,使用量在学期中急剧下滑 |
| Rachels & Rockinson-Szapkiw (2018) | 小学阶段,游戏化的西班牙语软件与面授课对比,同时测量成绩和自我效能感 | 成绩没有显著差异,软件组的自我效能感更低:同样的结果,更少的自信 |
| Golonka et al. (2014) | 对整个语言学习技术版图的综述,按技术类型和证据强度整理 | 热情很多,而严谨证据很薄,难以证明某项具体技术优于普通教学;证据最扎实的用途都很窄很具体 |
| Burston (2015) | 二十年的移动语言学习项目,按照所报告的学习成果究竟建立在什么之上来分析 | 几乎所有项目都很短、很小:正面结果描述的是几周的新鲜感,而不是以学期计的学习 |
这些研究都没有测试过本应用,也都没有测量流利度。它们测的是分级测试分数、接受性技能,以及以周或一个学期为跨度的学业成绩。对这一品类的结论应当是「确实有作用,在入门阶段,先出现在识别上」——而任何承诺靠点屏幕就能会话的数字,都没有依据。
「软件有用」底下同时跑着三种不同的主张
它们的证据完全不同,所以同一个人完全可以既认为软件有用,又认为它的广告是胡说。得到良好支持的只有第一种。
- 有支持的:入门阶段可测量的提升,主要在接受面。 上面每一项研究都发现了些什么。分级分数在动,阅读和听力在动,而词汇是最稳定在动的部分:它是对间隔提取反应最好的成分,也是软件唯一比课堂做得更好的事。
- 被夸大的:软件可以替代课程。 Rachels 和 Rockinson-Szapkiw(2018)发现的是与面授打平,而不是胜出;Loewen 等人发现的,正是课堂之所以存在要去补的那道口语缺口。Nation(2007)的四条线把结构说清楚了:意义导向的输入、意义导向的输出、有意识的语言学习、流利度培养,是四件不同的事,而点选式软件恰好只在其中一件上强。
- 假的:每天十五分钟就能流利。 这一文献里没有任何研究测量过流利度,因此没有任何研究支持流利度承诺。按每天十分钟算,最著名结果里的 34 小时要花大约七个月——而这个算法假设你一天都不落,这恰恰是下一节要拆掉的假设。
没有提取的接触是第四种主张,有它自己的证据:被动学习到底有没有用
真正决定软件对你有没有用的是什么
六件事,每一件都来自研究而不是功能清单,按对结果的影响排序。第一件压过其余,这对所有卖后面五件事的人来说都不方便。
| 什么在决定 | 证据怎么说 | 实际是什么样 |
|---|---|---|
| 学习到底有没有发生 | Nielson(2011):拿到许可证、带薪学习时间和导师支持的联邦雇员,大多数仍然很早停下,达到有意义使用量的人极少 | 失败的不是一节差的课,而是一节从没被打开的课:如果支持和带薪时间就够,那项研究不会是那个结局 |
| 你在提取还是在识别 | Roediger & Karpicke(2006):同样时间内,被测验比重读带来更好的长期保持 | 从四个方块里挑对的那个,比把词说出来容易得多,而容易的练习买到的更少;练习类型比软件本身更重要 |
| 练习是否被分散 | Cepeda et al.(2006)综合 254 项研究:分散练习回忆率约 47%,同样的量集中做则为 37% | 六天各十分钟胜过周日一小时,而每天都出现的软件,在比较内容之前就已经在这条轴上赢了 |
| 每个词是否得到足够的相遇 | Nation & Wang(1999):一个词通常需要 8 到 12 次分散的相遇才会留下 | 每天都用新材料堆出来的连续记录永远什么都没完成;留下的是那些被安排要回来的词 |
| 这些词值不值得这些相遇 | Nation(2006):前 3000 个词族覆盖日常对话约 95%,此后覆盖率急剧变平 | 按词频排序几乎是第一年的全部收益——这也是为什么一门讲动物名称的主题课程感觉很充实,数据却很难看 |
| 这些分钟从哪里来 | Reviews.org(2026):美国成年人自述每天看手机约 186 次,大约每个清醒小时 11.6 次 | 需要在一天里新开一格的计划,要和这一天里的所有事竞争;搭在既有习惯上的计划则不必 |
只有第二到第五行关乎软件质量,而这几行几乎整个品类早就解决了。第一行和第六行关乎交付方式,结果真正在那里被决定——这也是方法对比一次次打平的原因。
评测从不测量的那个变量
软件对比写的都是功能:语音识别有多好,语法笔记值不值,复习队列怎么排。这些都是真实差别,也都是小差别。不小的差别在做了四十次的人和做了四次的人之间,而没有任何评测能告诉你你会是哪一个,因为那不是软件的属性。
所以效果研究不断给出平的结果。Golonka 等人(2014)去找有强证据显示优势的技术,找到的主要是热情;Burston(2015)发现二十年的移动项目被以周计的研究主导。当时长很短、参与者之间投入时间相差一个数量级时,方法差异几乎没有空间显现。与此同时,Nielson(2011)搭起了自学软件本该最有利的场景——志愿者、许可证、受保护的时间、导师——然后看着大多数人停下。坚持不是硬因素旁边的软因素。它就是那个硬因素。
这就把人们真正想问的问题重写了一遍。诚实的版本是:在什么都不顺的日子里,这款软件能不能产生足够多的学习次数,让分散和提取积累起来?本页的任何技巧,在你三月就不再打开的软件里价值都是零;而哪怕平庸的技巧,在一款你从来不必决定是否打开的软件里也会复利。有效的一步不是去猎一个更好的练习,而是去打真正发生损失的那一步。
放弃的代价,用研究的单位来算
「要坚持」是一句没人能执行的建议。下面是同一件事换成数字:学习停止时随之停止的四件具体的事,每一件都有人测过。
注意其中三件说的都不是「学得更少」,而是丢掉你已经付过费的材料。
| 失去什么 | 证据 | 测出的大小 |
|---|---|---|
| 分散带来的优势 | Cepeda et al.(2006),254 项分散练习研究的综合 | 约 47% 对 37%——这个差距只有在另一天回来时才能拿到 |
| 这个词还欠的相遇 | Nation & Wang(1999),关于一个词要遇到多少次才站得住 | 大约 8 到 12 次;在第四次放弃的词不是学会了三分之一,而是没了 |
| 所有学到一半的东西 | Murre & Dros(2015),对艾宾浩斯遗忘曲线的重复验证 | 没有复习时早期损失很陡:你不再清空的队列在头几天衰减最快,之后才放缓 |
| 一门读完的课 | Nielson(2011),带许可证、时间与支持的职场自学 | 大多数人很早停下:自主学习软件最常见的结局是一门没读完的课,而不是一门差课 |
这不是在提倡自律,而是在提倡把事情安排成你和一次复习之间少几个决定——那是一个设计问题,而且可解。这中间那个词会怎么样,见为什么你会忘记单词。
把发生损失的那一步直接拿掉
如果决定结果的变量是坚持,那么有用的设计问题就不是「怎样把一节课做得更好」,而是「怎样让一次复习在没有人决定开始的情况下发生」。LearnScreen 就是围绕这一个想法造的;机制如下,不加修饰:
没有要开始的学习会话
苹果的「屏幕使用时间」接口允许屏蔽你选定的应用。当你打开其中一个时,本该是信息流的位置出现一张单词卡片。手机每天大约被查看 186 次(Reviews.org, 2026),所以复习是搭在已经存在的习惯上,而不是再要一格时间。
每张卡片都是一次提取尝试
答案在你点击前一直隐藏,所以卡片是一次测验而不是一段阅读——正是 Roediger 和 Karpicke(2006)发现长期保持更好的那个方向。环境式交付提高的是尝试的次数,而不是每次尝试的价值。
由日程决定什么会回来
莱特纳队列让答错的词更早回来,让已掌握的词按几何级数往后退,于是一个词所需的 8 到 12 次相遇(Nation & Wang, 1999)会摊在多天里,而不是挤在一次里。
- 剂量由你定。 每次 3 到 20 个词,屏蔽返回的频率同样可调。默认设置下大约每天 25 次提取尝试,合计约两分半,分散着进行:小到不必为它取消任何别的安排。
- 它不是课程,也不假装是。 这是有意识的词汇学习,Nation(2007)四条线中的一条。说、读、听是它不做的工作,它诚实的位置在这些之下:主动词汇与被动词汇。
- 按词频排的词表,或者你自己的词。 现成词库从覆盖率最便宜的地方开始(Nation, 2006),你手动添加或批量粘贴的内容进入同一个队列:究竟需要多少词。
- 离线可用,无需账号。 安装之后卡片和屏蔽都不需要联网;iCloud 备份写入你自己的私有数据库而不是我们的服务器,也没有任何需要注册的东西。
延伸阅读
- 被动学习到底有没有用 — 单靠接触能带来什么,又在哪里停下。
- 怎样才能不半途而废 — 本页最后落到的坚持问题,认真对待。
- 每天需要多少分钟 — 那 34 小时摊到一年里是什么样子。
- 主动词汇与被动词汇 — 为什么软件带来的提升先落在识别上。
- 该先学哪些词 — 怎样让每一次相遇都值得。
常见问题
参考来源
- Vesselinov, R., & Grego, J. (2012). Duolingo Effectiveness Study. City University of New York / University of South Carolina. Commissioned by Duolingo.
- Loewen, S., Crowther, D., Isbell, D. R., Kim, K. M., Maloney, J., Miller, Z. F., & Rawal, H. (2019). Mobile-assisted language learning: A Duolingo case study. ReCALL, 31(3), 293–311.
- Rachels, J. R., & Rockinson-Szapkiw, A. J. (2018). The effects of a mobile gamification app on elementary students’ Spanish achievement and self-efficacy. Computer Assisted Language Learning, 31(1–2), 72–89.
- Nielson, K. B. (2011). Self-study with language learning software in the workplace: What happens? Language Learning & Technology, 15(3), 110–129.
- Golonka, E. M., Bowles, A. R., Frank, V. M., Richardson, D. L., & Freynik, S. (2014). Technologies for foreign language learning: A review of technology types and their effectiveness. Computer Assisted Language Learning, 27(1), 70–105.
- Burston, J. (2015). Twenty years of MALL project implementation: A meta-analysis of learning outcomes. ReCALL, 27(1), 4–20.
- Cepeda, N. J., Pashler, H., Vul, E., Wixted, J. T., & Rohrer, D. (2006). Distributed practice in verbal recall tasks: A review and quantitative synthesis. Psychological Bulletin, 132(3), 354–380.
- Roediger, H. L., & Karpicke, J. D. (2006). Test-enhanced learning: Taking memory tests improves long-term retention. Psychological Science, 17(3), 249–255.
- Nation, I. S. P., & Wang, K. (1999). Graded readers and vocabulary. Reading in a Foreign Language, 12(2), 355–380.
- Nation, I. S. P. (2006). How large a vocabulary is needed for reading and listening? Canadian Modern Language Review, 63(1), 59–82.
- Nation, I. S. P. (2007). The four strands. Innovation in Language Learning and Teaching, 1(1), 2–13.
- Murre, J. M. J., & Dros, J. (2015). Replication and analysis of Ebbinghaus’ forgetting curve. PLOS ONE, 10(7), e0120644.
- Reviews.org (2026). Cell Phone Usage Stats. Survey of ~1,000 US adults, fielded Q4 2025. Report
这些都是小规模研究。样本从单个班级到几百人不等,时长从数周到一个学期,测量工具是分级测试和技能测验组合,而不是真实对话。其中一项由被评估的公司出资,引用处已注明。LearnScreen 没有做过效果试验,本页也不作此主张;与本应用有关的数字是基于默认设置和大约二十秒一次提取尝试的算术,而不是实测的使用数据。
修好那个决定结果的步骤
如果研究说坚持胜过方法,那么解法就不是一节更好的课,而是一次不需要做决定就会发生的复习。LearnScreen 把它放在你本来就要解锁的手机上,一分钟新时间都不要。
在 App Store 下载
