Ir al contenido
La investigación sobre la escucha, aplicada a tu lista

¿Escuchar un idioma
sirve para aprenderlo?

Sí para el sistema de sonidos, mucho menos para el vocabulario, y la evidencia que separa las dos cosas es insólitamente limpia. Bebés de nueve meses que oyeron chino de una persona presente aprendieron sus contrastes fonéticos en doce sesiones; los que recibieron el material idéntico en audio grabado no aprendieron nada medible (Kuhl, Tsao y Liu, 2003). Seguir el habla espontánea al 98 % exige unas 6.000-7.000 familias de palabras (Nation, 2006), y una palabra necesita entre cinco y veinte encuentros antes de quedarse (Nation y Wang, 1999): justo lo que ningún audio puede programar.

Todas las cifras están referenciadas al final de la página

Una tarjeta de vocabulario en la pantalla de bloqueo de un iPhone, en el momento de abrir una app bloqueada

Qué se ha medido de verdad sobre escuchar un idioma

«Tú escucha mucho» es el consejo que más se repite y menos se concreta, y es una lástima, porque escuchar es de las pocas conductas de aprendizaje que se han aislado en un laboratorio y comparado consigo mismas. Se ha enfrentado una persona real a una grabación de esa misma persona, se ha contado el vocabulario que exige el habla corriente, se ha medido qué deja una sesión breve de escucha y se ha comprobado si el audio durante el sueño hace algo. El cuadro que sale es más nítido de lo que admite cualquiera de los dos bandos.

Una advertencia va arriba y no en una nota al pie: los estudios más limpios son sobre bebés y fonología, no sobre adultos y vocabulario. Un niño de nueve meses aprendiendo tonos del chino no es alguien aprendiendo sustantivos en inglés camino del trabajo, y los estudios de escucha incidental que sí usan adultos son cortos y miden sobre todo reconocimiento. Lo que sirve de las cifras de abajo es la forma del efecto —qué partes del idioma entran solas por el oído y cuáles no entran nunca—, no una promesa sobre tu diciembre.

Cinco resultados de la investigación sobre aprender un idioma escuchando y qué implica cada uno
Qué se midióQué encontró el estudioQué significa para ti
Si el audio solo enseña sonidoKuhl, Tsao y Liu (2003): bebés de nueve meses que oyeron chino de una persona presente aprendieron sus contrastes fonéticos; los grupos que recibieron el mismo material en audio o en vídeo no mostraron aprendizaje medibleLa onda sonora era idéntica y solo funcionó una condición. El audio sonando en la habitación es justo la que no enseñó nada, y conviene saberlo antes de comprarte un año de ello
Qué sí enseña escuchar, y muy rápidoSaffran, Aslin y Newport (1996): bebés de ocho meses extrajeron los límites entre palabras de dos minutos de habla continua sin significado, usando solo la estadística de qué sílaba sigue a cuálEste es el premio de verdad, y sale casi gratis. Tu oído empieza a sacar estructura del flujo mucho antes de que entiendas una sola palabra
El vocabulario que exige el hablaNation (2006): unas 6.000-7.000 familias de palabras para cubrir el 98 % del habla, y unas 3.000 para el 95 %Hay un umbral y pesa más que todo lo demás. Por debajo de unas 3.000 familias, un episodio es sonido que no puedes cortar en palabras, por muchas horas que acumules
Qué deja una hora de escuchaVan Zeeland y Schmitt (2013): las ganancias incidentales al escuchar relatos fueron reales pero modestas, y el significado se retuvo mucho mejor que la formaTe queda una idea borrosa de palabras que ya medio conocías. La forma escrita —la que necesitas para reencontrar esa palabra en cualquier otro sitio— apenas llega
Si la palabra se puede recuperar despuésKarpicke y Roediger (2008): el recuerdo activo superó al estudio repetido en la retención posterior, con una ventaja que crecía con el tiempoEscuchar es reexposición a espuertas y recuerdo nunca. Ese único hueco explica el oído cómodo y la boca vacía mejor que ninguna teoría sobre el talento

Lee juntas las dos primeras filas. Escuchar no es débil: es específico. Entrega la capa del idioma que resulta casi imposible de estudiar a propósito, y es casi indiferente a la capa con la que todo el mundo mide su progreso. El umbral de la tercera fila es un número que puedes estimar: cuántas palabras hay que saber para hablar un idioma.

Bajo «tú ponte un podcast» viajan tres afirmaciones distintas

Se apoyan en evidencias completamente diferentes, y por eso el consejo suena obvio y a la vez deja mal cuerpo. Solo las dos primeras sobreviven a los estudios, y la segunda solo por encima de un umbral.

  • La sólida: tu oído se reconstruye. Este es el beneficio real y no es pequeño. Escuchar mucho entrena a cortar el flujo en palabras, a sobrevivir a la velocidad y al acento y a seguir cuando se te escapa algo; Saffran, Aslin y Newport (1996) vieron esa maquinaria funcionando con dos minutos de input en bebés de ocho meses. Ninguna tarjeta de vocabulario ha enseñado esto jamás. Si tu punto débil es la comprensión oral, el audio es casi el instrumento ideal.
  • La condicional: esto es input comprensible. Cierta por encima del umbral de cobertura y falsa por debajo. Nation (2006) sitúa el 95 % de cobertura del habla en unas 3.000 familias de palabras y el 98 % entre 6.000 y 7.000; la comprensión sube con fuerza en esa franja. Por debajo, el audio no es input en ningún sentido útil: no se recupera una frase cuando falta una palabra de cada diez y ni siquiera oyes dónde terminan las demás.
  • La falsa: las palabras llegarán solas. Lo que se aprende está limitado por la frecuencia. Peters y Webb (2018) vieron que el número de apariciones predecía el aprendizaje, y Nation y Wang (1999) sitúan los encuentros necesarios entre cinco y veinte. Un episodio de una hora te entrega casi todo su vocabulario interesante exactamente una vez, que es justo el caso en el que gana la curva del olvido.

La versión general de esta pregunta —qué compra la exposición de cualquier tipo y dónde se detiene— tiene su propia página: ¿funciona de verdad el aprendizaje pasivo?

Seis cosas deciden si una hora de escucha te enseña algo

Dos personas pueden escuchar las mismas horas en un año y acabar en sitios completamente distintos. Ninguna de las seis razones es el talento y solo una es el esfuerzo. El resto son propiedades del material y del calendario, y esa es la buena noticia: esas sí se pueden cambiar.

Seis factores que deciden cuánto ganas escuchando, la evidencia de cada uno y qué hacer
Qué lo decideQué dice la evidenciaQué hacer
Si hay alguien de verdad al otro ladoKuhl, Tsao y Liu (2003): la exposición en vivo produjo aprendizaje fonético; la grabada, con el mismo material, ningunoTrata las grabaciones como práctica, no como clase. Cualquier cosa que te obligue a responder —una persona, una pausa, una pregunta— hace un trabajo que el audio no hace
Tu cobertura del materialNation (2006): ~3.000 familias de palabras para el 95 % del habla, ~6.000-7.000 para el 98 %Por debajo del umbral, dedica parte del tiempo al núcleo frecuente. Es lo que hace rentable cada hora posterior de escucha
Cuántas veces vuelve una palabraPeters y Webb (2018): la frecuencia en el material predijo el aprendizaje; Nation y Wang (1999): de cinco a veinte encuentros para adquirir una palabraQuédate con un locutor, una serie, un tema. La escucha estrecha convierte encuentros únicos en repetidos sin coste
Si alguna vez recuperas algo de memoriaKarpicke y Roediger (2008): el recuerdo activo superó al estudio repetido en la retención posteriorEl audio es pura confirmación y ningún recuerdo. Algo fuera del episodio tiene que hacerte la pregunta
El intervalo entre encuentrosCepeda et al. (2006), 254 estudios: en torno al 47 % de recuerdo espaciado frente al 37 % masivoLo que vuelve, y cuándo, lo decide una escaleta. Ninguna lista de reproducción se ha ordenado nunca según lo que olvidaste
Qué pasa entre episodiosMurre y Dros (2015): la curva del olvido clásica se replica; lo no recuperado decae más rápido justo después del encuentroLa palabra que buscaste el martes tiene que volver antes del viernes, y el episodio de la semana que viene no la traerá

Fíjate en lo que falta en esa lista: concentración, disciplina y aptitud. Nada de esto falla porque no escucharas con suficiente atención. Falla porque una grabación no tiene ni idea de qué palabra se te escapó, y esa indiferencia es exactamente lo que hace que escuchar resulte agradable durante años.

El oído es real. Lo que falta es el segundo encuentro.

Escuchar acierta en algo en lo que fallan casi todos los métodos deliberados: es sostenible. A nadie hay que convencerlo de poner un episodio camino del trabajo, nadie rompe una racha, y el input llega en cantidad y en un formato que el cerebro acepta durante cuarenta minutos seguidos. Las cuatro hebras de Nation (2007) sitúan el input centrado en el significado en torno a un cuarto de un programa equilibrado, y el audio llena ese cuarto en los huecos del día —el paseo, los platos, el gimnasio— a los que no llega nada más. Consérvalo. El argumento aquí no es que los podcasts sean una pérdida de tiempo, sino que se les está pidiendo un trabajo para el que nunca estuvieron hechos.

Lo que no pueden hacer es volver. Un episodio decide qué oyes a continuación según su propia escaleta; no tiene ni idea de qué palabra te hizo rebobinar, ni forma de reintroducirla tres días después, que es cuando más valdría. Así que las palabras que el locutor repite se aprenden casi gratis, y las que aparecieron una vez —normalmente las interesantes, de frecuencia media, las que de verdad necesitabas— decaen por la curva de siempre (Murre y Dros, 2015). Unos cientos de horas después el perfil es conocido para cualquiera que lo haya hecho: comprensión cómoda, un oído que aguanta la velocidad y un vocabulario estancado alrededor de lo que el programa dice cada semana.

El arreglo es pequeño y no consiste en escuchar más. Es un segundo encuentro con las palabras concretas que se te escaparon, espaciado y con forma de pregunta en vez de repetición: la combinación que Cepeda y sus colegas (2006) midieron en torno al 47 % de recuerdo frente al 37 % masivo, y que Karpicke y Roediger (2008) encontraron superior a releer. Lo incómodo siempre ha sido dónde ponerlo, porque una sesión de repaso es una cosa más que agendar y agendar es justo el paso en el que la gente falla. Por eso conviene ponerlo en una superficie que ya se repite sola: el móvil se coge unas 186 veces al día (Reviews.org, 2026), y ninguna de esas veces hay que planificarla.

Podcasts, música, radio de fondo, audio mientras duermes

Se recomiendan de corrido como si fueran la misma intervención, y la investigación los trata de forma muy distinta. Dos se sostienen, uno se sostiene por un motivo que casi todo el mundo invierte, y otro funciona solo en un sentido lo bastante estrecho como para que valga la pena decirlo con precisión.

El patrón de debajo es siempre el mismo: cuanto más te pide el formato, más te llevas.

Cuatro formatos de escucha, la evidencia que apoya cada uno y lo que ninguno hará
FormatoQué apoya la evidenciaQué no va a hacer
Podcasts y audiolibros a tu nivelVan Zeeland y Schmitt (2013): ganancias incidentales reales aunque modestas al escuchar relatos, por encima de la franja de cobertura que Nation (2006) sitúa en ~3.000 familias para el 95 %Darte la forma escrita ni devolverte la palabra que se te escapó. El significado se retiene mucho mejor que la forma, y ninguno de los dos está programado
Música y cancionesLudke, Ferreira y Schellenberg (2014): los adultos que cantaron frases en húngaro las recordaron después mejor que quienes las dijeron hablandoFuncionar con la música simplemente puesta. El ingrediente activo de ese estudio era producir el idioma; la letra de fondo es la condición no probada, no la probada
Radio de fondo mientras trabajasSaffran et al. (1996): la estructura fonológica se extrae del flujo asombrosamente barato, así que la familiaridad con el sonido del idioma sí es una ganancia realEnseñar vocabulario. Es lo más parecido a la condición de audio grabado de Kuhl et al. (2003), la que no produjo aprendizaje medible
Audio mientras duermesSchreiner y Rasch (2015): reproducir palabras que los participantes ya habían estudiado antes de dormir mejoró el recuerdo de exactamente esas palabrasEnseñarte una palabra que no has visto nunca. Ese resultado es reactivación de una memoria existente: puede rematar un trabajo empezado despierto, no empezarlo

La fila del sueño es la que más se cita sin su condición, así que conviene repetirla: las palabras funcionaron porque se habían estudiado antes. Si te interesa la pregunta del momento del estudio, tiene su propia página: ¿conviene estudiar vocabulario antes de dormir?

Un sitio para las palabras que el episodio dijo una vez

Ese hueco entre oír una palabra y poder producirla es para lo que se hizo LearnScreen. Quédate con el podcast. Las palabras por las que rebobinaste vuelven en una pantalla que ibas a mirar de todos modos.

1

La palabra que rebobinaste se convierte en tarjeta

Añádela en segundos desde la hoja de compartir, o pega una lista entera al acabar el episodio, cada una con traducción y una frase de ejemplo. Entra en la misma cola que las listas incluidas, así que la palabra que el locutor dijo una sola vez empieza a comportarse como una palabra frecuente, y por fin llega con la forma escrita que la escucha le negó.

2

Vuelve como pregunta, no como repetición

Con la API de Tiempo de Uso de Apple, LearnScreen bloquea las apps que elijas y pone la tarjeta donde habría estado el feed, con la respuesta oculta hasta que te comprometes a un intento. Eso convierte cada encuentro en un recuerdo activo: la operación que Karpicke y Roediger (2008) encontraron superior a la reexposición, y la que un audio no puede ejecutar por estructura.

3

Un esquema Leitner decide qué vuelve

Las palabras que fallas vuelven antes; las que aciertas se alejan geométricamente. El espaciado sigue lo bien que conoces cada palabra en vez de la escaleta de un programa: la parte que la investigación sobre práctica distribuida (Cepeda et al., 2006) señala como decisiva, y la que ninguna lista de reproducción ha podido dar nunca.

  • No se agenda nada extra. El repaso cae en desbloqueos que ya hacías, y por eso sobrevive a las semanas en que un episodio camino del trabajo es todo lo que puedes. Con los ajustes por defecto salen unos 25 intentos de recuerdo al día: unos dos minutos y medio, repartidos en momentos que no usabas para nada.
  • Empieza por el núcleo frecuente si estás por debajo del umbral. Más de 1.080 palabras curadas en 18 temas y 11 idiomas, ordenadas para que la cobertura más barata llegue primero: la vía rápida a las ~3.000 familias que vuelven legible el habla corriente (qué palabras van primero).
  • Tus propias palabras, en bloque. Añade una desde la hoja de compartir a mitad de episodio o pega la lista que hiciste en el trayecto; cada entrada admite traducción y frase de ejemplo, así que la tarjeta conserva el sentido que le dio el episodio.
  • Sin conexión y sin cuenta. Las tarjetas y los bloqueos funcionan sin red una vez instalada la app, y la copia en iCloud se escribe en tu propia base de datos privada, no en nuestros servidores.

Dónde aparecen las palabras

Cuatro pantallas de la app: la tarjeta de bloqueo, la respuesta con su frase de ejemplo, la lista de palabras y el progreso.

Una app bloqueada mostrando una tarjeta de vocabulario en la pantalla de bloqueo en lugar del feed La respuesta revelada en la tarjeta, con la traducción y una frase de ejemplo que usa la palabra La lista de vocabulario con los temas curados junto a las palabras añadidas por el usuario La pantalla de progreso con cuántas palabras han subido en la cola de repetición espaciada

Seguir leyendo

Preguntas frecuentes

¿Se puede aprender un idioma solo escuchándolo?
Se puede aprender así buena parte de su sistema de sonidos, y muy poco de su vocabulario. Escuchar entrena la segmentación, el ritmo y los contrastes fonéticos, algo real y difícil de conseguir de otro modo. Pero lo que se aprende de vocabulario depende de la cobertura y la repetición: por debajo de unas 3.000 familias de palabras una grabación es sonido que no puedes cortar en palabras, y una palabra necesita de cinco a veinte encuentros para quedarse (Nation y Wang, 1999). Nada en un audio está programado según lo que olvidaste.
¿Sirven de verdad los podcasts para aprender un idioma?
Sí, por encima de un umbral, y sobre todo para la comprensión oral más que para el vocabulario. Nation (2006) sitúa el 98 % de cobertura del habla entre 6.000 y 7.000 familias de palabras, y el 95 % en unas 3.000. Por encima de esa franja un podcast es input comprensible y un buen uso de un trayecto. Por debajo, la comprensión se desploma y lo que practicas es tolerar la confusión. En cualquier caso, las palabras que el locutor dijo una vez no volverán en un calendario.
¿Ayuda escuchar música en otro idioma?
La evidencia que existe es sobre cantar, no sobre escuchar. Ludke, Ferreira y Schellenberg (2014) vieron que los adultos que cantaron frases en húngaro las recordaron después mejor que quienes las dijeron hablando. El ingrediente activo era producir el idioma, no tener música sonando. La letra de fondo se parece más a la condición que repetidamente no ha mostrado aprendizaje medible.
¿Funciona escuchar un idioma mientras duermes?
Para aprender palabras nuevas no, y en un sentido estrecho sí. Schreiner y Rasch (2015) reprodujeron palabras extranjeras que los participantes ya habían estudiado antes de dormir y encontraron mejor recuerdo justo de esas palabras. Eso es reactivación de una memoria que ya existía, no adquisición. Hay que encontrarse la palabra despierto primero, lo que convierte el audio nocturno en un posible remate y nunca en un sustituto.
¿Por qué entiendo mucho más de lo que sé decir?
Porque escuchar aporta reconocimiento y nunca pide recuerdo. Karpicke y Roediger (2008) encontraron que el recuerdo activo superaba al estudio repetido en la retención posterior, y horas de input son estudio repetido por definición. Oído cómodo y boca vacía es exactamente el perfil que predecirías tras años de exposición de calidad sin ningún recuerdo asociado. Ese hueco tiene su propia página: vocabulario activo y pasivo.
¿Cuánto conviene escuchar al día?
Todo lo que disfrutes, porque es la hebra que sobrevive a una mala semana. Nation (2007) sitúa el input centrado en el significado en torno a un cuarto de un programa equilibrado, y el audio llena trayectos y tareas domésticas a los que no llega nada más. Lo que conviene añadir es poco: unos cuantos intentos breves de recuerdo para las palabras concretas que se te escaparon, espaciados. La práctica distribuida recordó en torno al 47 % frente al 37 % de la masiva (Cepeda et al., 2006).

Fuentes

  1. Kuhl, P. K., Tsao, F.-M., & Liu, H.-M. (2003). Foreign-language experience in infancy: Effects of short-term exposure and social interaction on phonetic learning. PNAS, 100(15), 9096–9101.
  2. Saffran, J. R., Aslin, R. N., & Newport, E. L. (1996). Statistical learning by 8-month-old infants. Science, 274(5294), 1926–1928.
  3. van Zeeland, H., & Schmitt, N. (2013). Incidental vocabulary acquisition through L2 listening: A dimensions approach. System, 41(3), 609–624.
  4. Nation, I. S. P. (2006). How large a vocabulary is needed for reading and listening? Canadian Modern Language Review, 63(1), 59–82.
  5. Peters, E., & Webb, S. (2018). Incidental vocabulary acquisition through viewing L2 television and factors that affect learning. Studies in Second Language Acquisition, 40(3), 551–577.
  6. Nation, I. S. P., & Wang, K. (1999). Graded readers and vocabulary. Reading in a Foreign Language, 12(2), 355–380.
  7. Schreiner, T., & Rasch, B. (2015). Boosting vocabulary learning by verbal cueing during sleep. Cerebral Cortex, 25(11), 4169–4179.
  8. Ludke, K. M., Ferreira, F., & Schellenberg, E. G. (2014). Singing can facilitate foreign language learning. Memory & Cognition, 42(1), 41–52.
  9. Karpicke, J. D., & Roediger, H. L. (2008). The critical importance of retrieval for learning. Science, 319(5865), 966–968.
  10. Cepeda, N. J., Pashler, H., Vul, E., Wixted, J. T., & Rohrer, D. (2006). Distributed practice in verbal recall tasks: A review and quantitative synthesis. Psychological Bulletin, 132(3), 354–380.
  11. Murre, J. M. J., & Dros, J. (2015). Replication and analysis of Ebbinghaus’ forgetting curve. PLOS ONE, 10(7), e0120644.
  12. Nation, I. S. P. (2007). The four strands. Innovation in Language Learning and Teaching, 1(1), 2–13.
  13. Reviews.org (2026). Cell Phone Usage Stats. Survey of ~1,000 US adults, fielded Q4 2025. Report

Con las cifras conviene llevarse tres límites. Los estudios de aprendizaje fonético son sobre bebés, y un bebé no es un adulto en formato pequeño: lo que se traslada es la comparación entre condiciones, no la edad. Los estudios de escucha incidental son cortos y miden reconocimiento más que producción, así que subestiman lo que hacen años de escucha y sobreestiman cuánto se puede medir en una hora. Y el resultado sobre el sueño solo vale para palabras ya estudiadas antes de dormir. Donde esta página da un número, viene del estudio citado al lado; donde generaliza a tu propia escucha, es una inferencia y está marcada como tal.

Sigue escuchando. Que las palabras no se vayan con el episodio.

La palabra por la que rebobinaste, de vuelta como pregunta, en una pantalla que ya desbloqueas.

Descargar en el App Store