Écouter une langue
suffit-il pour l’apprendre ?
Oui pour le système de sons, beaucoup moins pour le vocabulaire, et les données qui séparent les deux sont d’une netteté rare. Des bébés de neuf mois exposés au mandarin par une personne présente en ont appris les contrastes phonétiques en douze séances ; ceux qui ont reçu le matériel identique sous forme d’enregistrement audio n’ont rien appris de mesurable (Kuhl, Tsao et Liu, 2003). Suivre la parole spontanée à 98 % demande environ 6 000 à 7 000 familles de mots (Nation, 2006), et un mot exige de cinq à vingt rencontres avant de rester (Nation et Wang, 1999) : précisément ce qu’un flux audio ne peut pas programmer.
Tous les chiffres sont référencés en bas de page

Ce que l’écoute a réellement été mesurée en train de faire
« Écoute, c’est tout » est le conseil le plus répété et le moins précisé qui soit, et c’est dommage, car l’écoute fait partie des rares comportements d’apprentissage qu’on a isolés en laboratoire et comparés à eux-mêmes. On a opposé une personne réelle à l’enregistrement de cette même personne, compté le vocabulaire qu’exige la parole ordinaire, mesuré ce que laisse une courte séance d’écoute et vérifié si l’audio diffusé pendant le sommeil fait quoi que ce soit. Le tableau qui en sort est plus net que ce que concède l’un ou l’autre camp.
Un avertissement va en haut plutôt qu’en note de bas de page : les études les plus propres portent sur des bébés et sur la phonologie, pas sur des adultes et du vocabulaire. Un enfant de neuf mois qui apprend les tons du mandarin n’est pas un adulte qui apprend des noms anglais dans le métro, et les études d’acquisition incidente qui utilisent bien des adultes sont courtes et testent surtout la reconnaissance. Ce qui est utile dans les chiffres ci-dessous, c’est la forme de l’effet — quelles couches de la langue entrent seules par l’oreille et lesquelles n’entrent jamais —, pas une promesse sur votre mois de décembre.
| Ce qui a été mesuré | Ce que l’étude a trouvé | Ce que cela signifie pour vous |
|---|---|---|
| Si l’audio seul enseigne le son | Kuhl, Tsao et Liu (2003) : des bébés de neuf mois exposés au mandarin par une personne présente en ont appris les contrastes phonétiques ; les groupes ayant reçu le même matériel en audio ou en vidéo n’ont montré aucun apprentissage mesurable | L’onde sonore était identique et une seule condition a fonctionné. L’audio qui tourne dans la pièce est exactement celle qui n’a rien enseigné — utile à savoir avant d’en acheter une année |
| Ce que l’écoute enseigne vraiment, et très vite | Saffran, Aslin et Newport (1996) : des bébés de huit mois ont extrait les frontières entre mots de deux minutes de parole continue dénuée de sens, à partir des seules statistiques de succession des syllabes | C’est le vrai gain, et il est presque gratuit. Votre oreille commence à tirer de la structure du flux bien avant que vous n’en compreniez un seul mot |
| Le vocabulaire qu’exige la parole | Nation (2006) : environ 6 000 à 7 000 familles de mots pour couvrir 98 % de la langue parlée, et environ 3 000 pour 95 % | Il y a un seuil, et il pèse plus que tout le reste. En dessous d’environ 3 000 familles, un épisode est un son que vous ne pouvez pas découper en mots, quel que soit le nombre d’heures accumulées |
| Ce que laisse une heure d’écoute | Van Zeeland et Schmitt (2013) : les gains incidents à l’écoute de récits étaient réels mais modestes, et le sens était retenu bien plus facilement que la forme | Il vous reste une idée floue de mots que vous connaissiez déjà à moitié. La forme écrite — celle dont vous avez besoin pour recroiser ce mot ailleurs — n’arrive presque pas |
| Si le mot est récupérable ensuite | Karpicke et Roediger (2008) : le rappel actif a battu l’étude répétée sur la rétention ultérieure, avec un écart qui grandit avec le délai | Écouter, c’est de la réexposition en masse et jamais de rappel. Ce seul écart explique l’oreille confortable et la bouche vide mieux que n’importe quelle théorie sur le talent |
Lisez les deux premières lignes ensemble. L’écoute n’est pas faible : elle est spécifique. Elle livre la couche de la langue qu’il est presque impossible d’étudier délibérément, et elle est quasi indifférente à celle avec laquelle tout le monde mesure ses progrès. Le seuil de la troisième ligne est un nombre que vous pouvez estimer : combien de mots faut-il pour parler une langue ?
Trois affirmations voyagent sous « mets un podcast »
Elles reposent sur des données complètement différentes, et c’est pourquoi le conseil paraît évident et laisse pourtant un goût d’inachevé. Seules les deux premières survivent aux études, et la deuxième uniquement au-dessus d’un seuil.
- La solide : votre oreille se reconstruit. C’est le vrai bénéfice, et il n’est pas mince. Beaucoup écouter entraîne à découper le flux en mots, à survivre au débit et à l’accent, à continuer quand quelque chose vous échappe ; Saffran, Aslin et Newport (1996) ont vu cette mécanique tourner sur deux minutes d’input chez des bébés de huit mois. Aucune carte de vocabulaire n’a jamais enseigné cela. Si la compréhension orale est votre point faible, l’audio est presque l’instrument idéal.
- La conditionnelle : c’est de l’input compréhensible. Vraie au-dessus du seuil de couverture, fausse en dessous. Nation (2006) situe 95 % de couverture de l’oral à environ 3 000 familles de mots et 98 % entre 6 000 et 7 000 ; la compréhension grimpe fortement dans cette bande. En dessous, l’audio n’est pas de l’input en un sens utile : on ne reconstitue pas une phrase quand un mot sur dix manque et qu’on n’entend même pas où finissent les autres.
- La fausse : les mots viendront tout seuls. Ce qu’on retient est plafonné par la fréquence. Peters et Webb (2018) ont montré que le nombre d’occurrences prédisait l’apprentissage, et Nation et Wang (1999) situent les rencontres nécessaires entre cinq et vingt. Un épisode d’une heure vous livre l’essentiel de son vocabulaire intéressant exactement une fois, soit exactement le cas où la courbe de l’oubli l’emporte.
La version générale de cette question — ce qu’achète l’exposition, quelle qu’elle soit, et où elle s’arrête — a sa propre page : l’apprentissage passif fonctionne-t-il vraiment ?
Six choses décident si une heure d’écoute vous apprend quelque chose
Deux personnes peuvent écouter le même nombre d’heures dans l’année et finir à des endroits complètement différents. Aucune des six raisons n’est le talent et une seule est l’effort. Les autres sont des propriétés du matériel et du calendrier — et c’est la bonne nouvelle, parce que ce sont celles qu’on peut changer.
| Ce qui décide | Ce que disent les données | Quoi faire |
|---|---|---|
| S’il y a vraiment quelqu’un en face | Kuhl, Tsao et Liu (2003) : l’exposition en direct a produit un apprentissage phonétique ; l’exposition enregistrée au même matériel, aucun | Traitez les enregistrements comme de la pratique, pas comme un cours. Tout ce qui vous force à répondre — une personne, une pause, une question — fait un travail que l’audio ne fait pas |
| Votre couverture du matériel | Nation (2006) : ~3 000 familles de mots pour 95 % de couverture de l’oral, ~6 000 à 7 000 pour 98 % | Sous le seuil, consacrez une part du temps au noyau fréquent. C’est ce qui rend rentable chaque heure d’écoute suivante |
| À quelle fréquence un mot revient | Peters et Webb (2018) : la fréquence dans le matériel prédisait l’apprentissage ; Nation et Wang (1999) : de cinq à vingt rencontres pour acquérir un mot | Restez sur un animateur, une série, un sujet. L’écoute étroite transforme des rencontres uniques en rencontres répétées sans rien coûter |
| Si vous récupérez jamais quelque chose | Karpicke et Roediger (2008) : le rappel actif a battu l’étude répétée sur la rétention ultérieure | L’audio, c’est de la confirmation et jamais du rappel. Quelque chose en dehors du flux doit vous poser la question |
| L’intervalle entre les rencontres | Cepeda et al. (2006), 254 études : environ 47 % de rappel en espacé contre 37 % en massé | Ce qui revient, et quand, est décidé par un conducteur d’émission. Aucune playlist n’a jamais été ordonnée selon ce que vous avez oublié |
| Ce qui se passe entre deux épisodes | Murre et Dros (2015) : la courbe de l’oubli classique se réplique ; ce qui n’est pas rappelé décline le plus vite juste après la rencontre | Le mot cherché mardi doit revenir avant vendredi, et l’épisode de la semaine prochaine ne le ramènera pas |
Remarquez ce qui manque à cette liste : la concentration, la discipline et les dispositions. Rien de tout cela n’échoue parce que vous n’auriez pas écouté assez attentivement. Cela échoue parce qu’un enregistrement ignore quel mot vous a échappé — et cette indifférence est exactement ce qui rend l’écoute agréable pendant des années.
L’oreille est réelle. C’est la deuxième rencontre qui manque.
L’écoute réussit ce que presque toutes les méthodes délibérées ratent : elle est tenable. Personne n’a besoin d’être convaincu de lancer un épisode sur le trajet du travail, personne ne casse une série, et l’input arrive en volume, dans un format que le cerveau accepte quarante minutes d’affilée. Les quatre brins de Nation (2007) situent l’input centré sur le sens autour d’un quart d’un programme équilibré, et l’audio remplit ce quart dans les creux de la journée — la marche, la vaisselle, la salle de sport — que rien d’autre n’atteint. Gardez-le. L’argument ici n’est pas que les podcasts sont une perte de temps : c’est qu’on leur demande un travail pour lequel ils n’ont jamais été faits.
Ce qu’ils ne peuvent pas faire, c’est revenir. Un épisode décide de ce que vous entendez ensuite selon son propre conducteur ; il ignore quel mot vous a fait revenir en arrière et n’a aucun moyen de le réintroduire trois jours plus tard, au moment précis où ce serait le plus rentable. Les mots que l’animateur répète s’apprennent donc presque gratuitement, et ceux apparus une seule fois — en général les intéressants, de fréquence moyenne, ceux dont vous aviez vraiment besoin — déclinent selon la courbe habituelle (Murre et Dros, 2015). Quelques centaines d’heures plus tard, le profil est familier à quiconque l’a vécu : compréhension confortable, oreille qui encaisse le débit, et vocabulaire stationné autour de ce que l’émission dit chaque semaine.
La réparation est petite, et ce n’est pas écouter davantage. C’est une deuxième rencontre avec les mots précis qui ont filé, espacée, et formulée en question plutôt qu’en rediffusion : la combinaison que Cepeda et ses collègues (2006) ont mesurée autour de 47 % de rappel contre 37 % en massé, et que Karpicke et Roediger (2008) ont trouvée supérieure à la relecture. Le point gênant a toujours été où la placer, parce qu’une séance de révision est une chose de plus à caler et que caler est exactement l’étape où les gens échouent. D’où l’intérêt de la poser sur une surface qui se répète déjà toute seule : le téléphone est pris en main environ 186 fois par jour (Reviews.org, 2026), et aucune de ces fois n’a besoin d’être planifiée.
Podcasts, musique, radio de fond, audio pendant le sommeil
On les recommande d’un même souffle comme s’il s’agissait de la même intervention, et la recherche les traite très différemment. Deux tiennent, un tient pour une raison que presque tout le monde inverse, et un ne fonctionne que dans un sens assez étroit pour mériter d’être énoncé précisément.
Le motif en dessous est toujours le même : plus le format vous demande quelque chose, plus il vous en reste.
| Format | Ce que soutiennent les données | Ce qu’il ne fera pas |
|---|---|---|
| Podcasts et livres audio à votre niveau | Van Zeeland et Schmitt (2013) : des gains incidents réels quoique modestes à l’écoute de récits, au-dessus de la bande de couverture que Nation (2006) place à ~3 000 familles pour 95 % | Vous donner la forme écrite, ni vous rendre le mot qui vous a échappé. Le sens est retenu bien plus facilement que la forme, et ni l’un ni l’autre n’est programmé |
| Musique et chansons | Ludke, Ferreira et Schellenberg (2014) : les adultes qui ont chanté des phrases en hongrois s’en souvenaient mieux ensuite que ceux qui les avaient dites | Fonctionner avec la musique simplement allumée. L’ingrédient actif de cette étude était de produire la langue ; les paroles en fond sonore sont la condition non testée, pas la condition testée |
| Radio de fond pendant le travail | Saffran et al. (1996) : la structure phonologique s’extrait du flux à un coût étonnamment faible, donc la familiarité avec la sonorité de la langue est un gain réel | Enseigner du vocabulaire. C’est ce qui ressemble le plus à la condition audio enregistré de Kuhl et al. (2003), celle qui n’a produit aucun apprentissage mesurable |
| Audio diffusé pendant le sommeil | Schreiner et Rasch (2015) : rediffuser des mots que les participants avaient déjà étudiés avant de dormir a amélioré le rappel de ces mots précis | Vous enseigner un mot jamais rencontré. Ce résultat est la réactivation d’une trace existante : il peut finir un travail commencé éveillé, pas le commencer |
La ligne sur le sommeil est celle qu’on cite le plus souvent sans sa condition, alors répétons-la : les mots ont fonctionné parce qu’ils avaient été étudiés d’abord. Si la question du moment de l’étude vous intéresse, elle a sa page : faut-il réviser son vocabulaire avant de dormir ?
Un endroit pour les mots que l’épisode n’a dits qu’une fois
Cet écart entre entendre un mot et savoir le produire, c’est ce pour quoi LearnScreen a été fait. Gardez le podcast. Les mots pour lesquels vous êtes revenu en arrière reviennent sur un écran que vous alliez regarder de toute façon.
Le mot que vous avez réécouté devient une carte
Ajoutez-le en quelques secondes depuis la feuille de partage, ou collez une liste entière après l’épisode, chacun avec sa traduction et une phrase d’exemple. Il rejoint la même file que les listes intégrées : le mot dit une seule fois se met à se comporter comme un mot fréquent, et il arrive enfin avec la forme écrite que l’écoute lui avait refusée.
Il revient en question, pas en rediffusion
Grâce à l’API Temps d’écran d’Apple, LearnScreen bloque les applications que vous choisissez et place la carte là où aurait été le fil, réponse cachée jusqu’à ce que vous vous engagiez. Chaque rencontre devient un rappel actif — l’opération que Karpicke et Roediger (2008) ont trouvée supérieure à la réexposition, et celle qu’un flux audio ne peut structurellement pas exécuter.
Un système Leitner décide de ce qui revient
Les mots ratés reviennent plus tôt ; les mots réussis s’éloignent géométriquement. L’espacement suit votre maîtrise de chaque mot plutôt que le conducteur d’une émission — la part que la recherche sur la pratique distribuée (Cepeda et al., 2006) désigne comme décisive, et celle qu’aucune playlist n’a jamais pu fournir.
- Rien de plus à caler dans l’agenda. La révision tombe sur des déverrouillages que vous faisiez déjà, ce qui lui permet de survivre aux semaines où un épisode sur le trajet est tout ce que vous pouvez faire. Par défaut, cela représente environ 25 tentatives de rappel par jour : deux minutes trente, réparties sur des moments qui ne servaient à rien.
- Commencez par le noyau fréquent si vous êtes sous le seuil. Plus de 1 080 mots sélectionnés, 18 thèmes, 11 langues, ordonnés pour que la couverture la moins chère arrive en premier — la voie la plus rapide vers les ~3 000 familles qui rendent la parole ordinaire lisible (quels mots apprendre en premier).
- Vos propres mots, en lot. Ajoutez-en un depuis la feuille de partage en plein épisode ou collez la liste faite dans le train ; chaque entrée accepte une traduction et une phrase d’exemple, si bien que la carte garde le sens que l’épisode lui avait donné.
- Hors ligne, sans compte. Les cartes et les blocages fonctionnent sans réseau une fois l’application installée, et la sauvegarde iCloud écrit dans votre propre base privée, pas sur nos serveurs.
À lire ensuite
- L’apprentissage passif fonctionne-t-il vraiment ? — ce que livre l’exposition, quelle qu’elle soit, mesuré, et où elle s’arrête.
- Regarder des séries en VO aide-t-il vraiment ? — la même question quand il y a une image et des sous-titres.
- Peut-on apprendre en faisant autre chose ? — quelle moitié de l’apprentissage survit à une attention partagée.
- Combien de mots faut-il pour parler une langue ? — les seuils de couverture qui décident si l’audio est de l’input ou du bruit.
- Vocabulaire actif et passif — pourquoi les mots que vous reconnaissez dépassent ceux que vous savez dire.
- Pourquoi j’oublie le vocabulaire déjà appris ? — ce qui arrive à un mot entre deux épisodes.
- À quelle fréquence réviser son vocabulaire ? — les intervalles qu’un conducteur d’émission ne fournira jamais.
Questions fréquentes
Sources
- Kuhl, P. K., Tsao, F.-M., & Liu, H.-M. (2003). Foreign-language experience in infancy: Effects of short-term exposure and social interaction on phonetic learning. PNAS, 100(15), 9096–9101.
- Saffran, J. R., Aslin, R. N., & Newport, E. L. (1996). Statistical learning by 8-month-old infants. Science, 274(5294), 1926–1928.
- van Zeeland, H., & Schmitt, N. (2013). Incidental vocabulary acquisition through L2 listening: A dimensions approach. System, 41(3), 609–624.
- Nation, I. S. P. (2006). How large a vocabulary is needed for reading and listening? Canadian Modern Language Review, 63(1), 59–82.
- Peters, E., & Webb, S. (2018). Incidental vocabulary acquisition through viewing L2 television and factors that affect learning. Studies in Second Language Acquisition, 40(3), 551–577.
- Nation, I. S. P., & Wang, K. (1999). Graded readers and vocabulary. Reading in a Foreign Language, 12(2), 355–380.
- Schreiner, T., & Rasch, B. (2015). Boosting vocabulary learning by verbal cueing during sleep. Cerebral Cortex, 25(11), 4169–4179.
- Ludke, K. M., Ferreira, F., & Schellenberg, E. G. (2014). Singing can facilitate foreign language learning. Memory & Cognition, 42(1), 41–52.
- Karpicke, J. D., & Roediger, H. L. (2008). The critical importance of retrieval for learning. Science, 319(5865), 966–968.
- Cepeda, N. J., Pashler, H., Vul, E., Wixted, J. T., & Rohrer, D. (2006). Distributed practice in verbal recall tasks: A review and quantitative synthesis. Psychological Bulletin, 132(3), 354–380.
- Murre, J. M. J., & Dros, J. (2015). Replication and analysis of Ebbinghaus’ forgetting curve. PLOS ONE, 10(7), e0120644.
- Nation, I. S. P. (2007). The four strands. Innovation in Language Learning and Teaching, 1(1), 2–13.
- Reviews.org (2026). Cell Phone Usage Stats. Survey of ~1,000 US adults, fielded Q4 2025. Report
Trois limites méritent d’accompagner les chiffres. Les études sur l’apprentissage phonétique portent sur des bébés, et un bébé n’est pas un adulte en plus petit : ce qui se transporte, c’est la comparaison entre conditions, pas l’âge. Les études d’écoute incidente sont courtes et testent la reconnaissance plus que la production : elles sous-estiment donc ce que font des années d’écoute et surestiment ce qu’on peut mesurer en une heure. Et le résultat sur le sommeil ne vaut que pour des mots déjà étudiés avant de dormir. Là où cette page donne un chiffre, il vient de l’étude citée à côté ; là où elle généralise à votre propre écoute, c’est une inférence, et elle est signalée comme telle.
Continuez d’écouter. Ne laissez pas les mots partir avec l’épisode.
Le mot que vous avez réécouté, de retour en question, sur un écran que vous déverrouillez déjà.
Télécharger sur l’App Store
