Formatos alternativos en audio para universidades: convertir el material docente en escucha
Cómo los equipos universitarios convierten apuntes, bibliografía y dosieres en audio: formatos alternativos, DUA y qué exigir a cualquier proveedor.
Por qué las universidades se plantean el audio
Las universidades ya producen formatos alternativos. Un servicio de atención a la discapacidad convierte un capítulo en texto estructurado, una biblioteca localiza una edición accesible, un docente graba un resumen. Es un trabajo real, cualificado y casi siempre reactivo: lo dispara una solicitud y se entrega contra un plazo que el calendario académico fijó meses antes.
El audio es uno de los formatos de esa familia. Este artículo se dirige a quienes tomarían la decisión —perfiles de tecnología educativa, dirección de educación digital, bibliotecas y responsables de recursos abiertos, y servicios de discapacidad y tecnología asistiva— y no al estudiante concreto. Si buscas el flujo de trabajo personal, lo cubren Podhoc para estudiantes y Podhoc para investigadores.
¿Qué es un formato alternativo en la universidad?
Un formato alternativo es una versión del mismo material docente producida para que pueda usarla quien no puede usar la versión estándar. El audio convive con el braille, la letra grande, el texto digital estructurado y el PDF etiquetado. La clave es la equivalencia: el mismo contenido, otra vía de entrada.
No es solo buena práctica: es una obligación documentada en varias jurisdicciones. La Directiva europea sobre accesibilidad web exige a los organismos del sector público publicar una declaración de accesibilidad y mantener un mecanismo que permita a las personas «comunicar problemas de accesibilidad o solicitar información en formatos alternativos» (Comisión Europea — Accesibilidad web). La vía de solicitud se da por supuesta; la pregunta para una institución es cuánto tiempo de personal cualificado exige atenderla bien.
¿El audio cumple con el Diseño Universal para el Aprendizaje?
De forma más directa de lo que suelen citar los proveedores. Las pautas DUA de CAST nombran esta práctica de manera explícita en la consideración 2.2, «apoyar la descodificación de textos, notación matemática y símbolos», entre cuyas sugerencias figuran «permitir el uso de texto a voz» y «usar texto digital acompañado de una grabación de voz humana (por ejemplo, libros hablados DAISY)» (CAST, 2024 — Consideración 2.2). Es el marco avalando una versión en audio del texto docente, no limitándose a tolerarla.
El enfoque tampoco es nuevo. Una revisión sistemática en Innovations in Education and Teaching International aborda el pódcast en la educación superior específicamente como componente del Diseño Universal para el Aprendizaje (Gunderson y Cumming, 2023), de modo que una propuesta que une ambas cosas trabaja dentro de una línea de investigación ya establecida y no inventa una.
El principio general está en la pauta 1, Percepción, que pide asegurar que la información clave sea «igualmente perceptible para todo el alumnado» ofreciendo «la misma información a través de diferentes modalidades (por ejemplo, vista, oído o tacto)», con la consideración 1.2 explícita: «apoyar múltiples formas de percibir la información» (CAST, 2024 — Pauta 1: Percepción). Una nota de cita para quien lleve esto a una política interna: la referencia vigente es CAST (2024), CAST Universal Design for Learning Guidelines version 3.0, publicada el 30 de julio de 2024. La numeración antigua de indicadores que aún citan muchas políticas de accesibilidad está obsoleta.
El audio es una modalidad entre varias, no una solución universal, y quien afirme lo contrario está vendiendo. El audio por sí solo excluye a las personas sordas y con discapacidad auditiva, y elimina la posibilidad de ojear, releer y buscar de la que dependen muchos estudiantes. La postura defendible es que el audio acompañe al texto y nunca lo sustituya.
Conviene conocer un detalle de conformidad, porque despeja una objeción que suele frenar estas conversaciones muy pronto. El criterio de conformidad 1.2.1 de las WCAG 2.2 se aplica «salvo cuando el audio o el vídeo es una alternativa multimedia al texto y está claramente identificado como tal», entendiendo por alternativa multimedia al texto aquella «que no presenta más información de la que ya presenta el texto» (W3C — Contenido solo audio y solo vídeo). Una versión en audio de un dosier claramente identificada que no añade nada a su texto de origen no necesita por sí misma una transcripción aparte: el texto del que salió es la transcripción. Esa excepción no dice nada sobre las obligaciones de accesibilidad del documento fuente, que se mantienen igual.
¿Qué normativa exige materiales docentes accesibles?
En las conversaciones de compra aparecen sobre todo tres instrumentos. Obligan a sujetos distintos y exigen cosas distintas, así que conviene ser preciso con cada uno.
Estados Unidos: el título II de la ADA y el plazo de 2027
La norma de accesibilidad web del título II del Departamento de Justicia estadounidense fija la WCAG 2.1 nivel AA como «el estándar técnico para el contenido web y las aplicaciones móviles de los gobiernos estatales y locales». El 20 de abril de 2026 el Federal Register publicó la Interim Final Rule del Departamento, que amplió el plazo de cumplimiento para las entidades estatales y locales con una población total de 50.000 habitantes o más hasta el 26 de abril de 2027, y llevó a las entidades públicas menores y a los distritos especiales al 26 de abril de 2028 (ADA.gov — Norma web del título II). El título II alcanza a «todos los gobiernos estatales y locales y a todos los departamentos, agencias, distritos con fines especiales y demás organismos dependientes de un gobierno estatal o local» (ADA.gov — Introducción al título II), que es la categoría en la que encaja una universidad pública. La prórroga movió la fecha, no la obligación.
Unión Europea: la Directiva de accesibilidad web
La Directiva (UE) 2016/2102 se aplica a los organismos del sector público, lo que incluye a las universidades públicas. La norma técnica armonizada es la EN 301 549 v3.2.1 (Comisión Europea — Accesibilidad web), que incorpora «las WCAG 2.1 nivel AA literalmente y sin modificaciones para el contenido web» (W3C — Leyes y políticas de accesibilidad web: Unión Europea). Los Estados miembros debían transponerla antes del 23 de septiembre de 2018. Junto a la declaración de accesibilidad, la directiva exige ese mecanismo de contacto a través del cual pueden solicitarse formatos alternativos.
Reino Unido: el reglamento de 2018 y el disparador de la revisión
El Public Sector Bodies (Websites and Mobile Applications) Accessibility Regulations 2018 entró en vigor el 23 de septiembre de 2018, y la guía vigente de GOV.UK dirige a los organismos del sector público a la WCAG 2.2 nivel AA. Conviene confirmar con qué versión trabaja realmente tu institución antes de definir alcances: la norma armonizada EN 301 549 incorpora las WCAG 2.1 nivel AA, y buena parte de la orientación sectorial y de las políticas internas sigue citando la 2.1. La distinción rara vez cambia lo que se hace con el audio, pero sí cambia contra qué lista de comprobación audita alguien. Lo interesante son las exenciones: los documentos publicados antes del 23 de septiembre de 2018 quedan exentos «salvo que las personas los necesiten para usar un servicio», y el contenido de intranet o extranet publicado antes del 23 de septiembre de 2019 queda exento hasta que sufre una revisión sustancial (GOV.UK — Requisitos de accesibilidad). Reescribir una asignatura es una revisión sustancial. Actualizar un curso es, por tanto, el momento en que caduca su exención heredada, lo que convierte los ciclos de actualización docente en el lugar natural para introducir un formato nuevo.
¿Dónde encaja de verdad el audio en el circuito de contenidos?
No en todas partes. El audio se gana su sitio cuando el material es lineal, explicativo y ya está escrito para leerse de principio a fin, y flaquea cuando el material es una referencia que se consulta en lugar de consumirse.
Tres puntos del circuito encajan bien:
- Material docente escrito en prosa: apuntes de asignatura, resúmenes de clase y dosieres narrativos se convierten con limpieza porque ya tienen un hilo que va de principio a fin.
- Bibliografía, sobre todo artículos en acceso abierto, donde una orientación en audio ayuda al estudiante a decidir cómo repartir su tiempo de lectura. Es el mismo flujo descrito en Podhoc para investigadores.
- Dosieres y recursos educativos abiertos: el material explicativo autocontenido y ya autorizado para su reutilización es el punto de partida con menos fricción para un piloto, porque la cuestión de licencias queda resuelta antes de empezar.
Tres que encajan mal: los problemas y el desarrollo matemático, donde la notación carga con el significado; todo lo que el estudiante debe recorrer de forma no lineal, como un código legal o un manual de laboratorio; y el material cuya licencia no permite que lo procese un tercero. Esto último suele ser el bloqueo real, y conviene resolverlo antes que cualquier cuestión técnica.
¿En qué se diferencia el audio generado de la síntesis de voz?
La síntesis de voz lee un documento en voz alta respetando su orden y su estructura. El audio generado reestructura el material como explicación hablada: en el caso de Podhoc, una conversación entre voces en alguno de varios formatos pedagógicos como Didáctico, Técnica Feynman o Crítica (los estilos de audio).
Son herramientas distintas para tareas distintas, y una institución suele necesitar ambas. La síntesis de voz es la respuesta correcta cuando alguien necesita acceso fiel al documento exacto. El audio generado lo es cuando el objetivo es comprender las ideas: una orientación previa a la lectura de un artículo, o un repaso posterior. Por qué el segundo formato sostiene la atención de otra manera se aborda en la ciencia del aprendizaje por audio.
Ninguno elimina la obligación de producir un documento fuente accesible. El audio generado amplía la gama de formatos; no repara un original inaccesible.
¿Qué puede hacer Podhoc hoy?
Aquí importa más ser preciso que resultar impresionante, así que esta sección es deliberadamente estrecha.
Fuentes de contenido. La API de Podhoc acepta URL de acceso público. No admite archivos ni texto plano, y no puede alcanzar material situado tras la autenticación de un campus virtual. Para una institución esta es la restricción más importante que hay que asumir en el diseño: un piloto empieza con contenido ya accesible públicamente —recursos educativos abiertos, bibliografía en acceso abierto, páginas públicas de asignatura— o no empieza por la vía de la API. Los patrones de integración muestran cómo se ve eso dentro de un flujo de trabajo.
Idiomas. Podhoc declara 73 idiomas, y el idioma de salida es independiente del de origen, de modo que un material escrito en una lengua puede generarse como audio en otra. La madurez de la cobertura varía dentro de ese catálogo, así que conviene probar las lenguas concretas en las que se imparte la titulación.
Formatos. Ocho estilos pedagógicos de audio, de los cuales Didáctico y Técnica Feynman son los que más piden los pilotos institucionales.
Dónde van los episodios. Podhoc publica los episodios generados en su catálogo público Discover de forma predeterminada, y que ese comportamiento pueda desactivarse depende de la cuenta. Para una institución esto es una cuestión de gobernanza, no una preferencia: conviene establecer qué configuración de visibilidad rige la cuenta antes de que ningún material docente pase por la plataforma.
Lo que hoy no existe. No hay integración LTI, ni conector con campus virtuales o LMS, ni puente de inicio de sesión único con Moodle, Canvas, Blackboard o Brightspace. Si una propuesta depende de alguna de esas piezas, depende de algo que no está construido.
¿Qué conviene preguntar a cualquier proveedor de audio?
Esta lista vale para cualquier proveedor del sector, Podhoc incluido. No es una comparativa de funcionalidades.
- Licencias. ¿La licencia del material de origen permite procesarlo mediante un servicio de terceros? En la bibliografía suele ser una cuestión editorial, y suele ser la que decide el alcance del piloto.
- Tratamiento de datos. ¿Dónde se procesa y se almacena el contenido, durante cuánto tiempo y cuál es la vía de borrado? Conviene tenerlo por escrito antes de mover nada.
- Visibilidad por defecto. ¿Dónde acaba el resultado por defecto, quién puede verlo y puede cambiarse ese comportamiento en tu cuenta?
- Texto acompañante. ¿Cada salida en audio se entrega junto al texto del que se generó, para que el formato sume en lugar de sustituir?
- Cobertura lingüística. ¿Qué idiomas están listos para producción y no solo listados, y cómo lo verificarías para las lenguas en las que impartes?
- Revisión humana. ¿Quién comprueba la exactitud del audio generado antes de que llegue al estudiantado, y con qué recursos? El material generado necesita revisión; quien insinúe lo contrario está describiendo un riesgo, no una ventaja.
¿Cómo sería un piloto de verdad?
Estrecho, y con material cuya licencia esté ya resuelta. Una forma que funciona: una facultad o un departamento, unas pocas asignaturas, audio publicado junto al texto existente en lugar de reemplazarlo, y un paso de revisión definido antes de que nada llegue al estudiantado. Que dure un cuatrimestre para que tenga principio y final, y decidir de antemano qué contaría como resultado: trabajo manual de conversión desplazado, uso real por parte del alumnado, o simplemente si el profesorado seguiría utilizándolo.
Empezar por recursos educativos abiertos o bibliografía en acceso abierto es la vía más rápida a algo real, porque saca la cuestión de licencias de la ruta crítica. Los dos textos hermanos sobre audio para estudiantes neurodivergentes y audio para entidades de formación abordan versiones contiguas de la misma pregunta.
Si merece una conversación, preferimos hacer un piloto bien antes que describirlo.
Solicita un piloto para tu institución, empresa o empleador →
Lecturas relacionadas
- La ciencia del aprendizaje por audio: la base de evidencia sobre la escucha como canal de aprendizaje.
- Podhoc para investigadores: el flujo individual para bibliografía y artículos.
- Podhoc para estudiantes: la versión del mismo planteamiento orientada al estudiantado.
- La API de Podhoc: qué acepta y qué devuelve la API pública.
- Patrones de integración con la API: cómo encaja la generación en un flujo existente.
- Los estilos de audio: los formatos pedagógicos disponibles.
Preguntas frecuentes
- ¿Qué es un formato alternativo en la universidad?
- Es una versión del mismo material docente producida para que pueda usarla quien no puede usar la versión estándar. El audio convive con el braille, la letra grande, el texto digital estructurado y el PDF etiquetado. La Directiva europea de accesibilidad web obliga a los organismos del sector público a mantener un mecanismo de contacto para solicitar información en formatos alternativos.
- ¿El Diseño Universal para el Aprendizaje avala de verdad las versiones en audio del texto docente?
- Sí, de forma explícita. Las pautas DUA de CAST en su versión 3.0 (2024) recogen en la consideración 2.2 las sugerencias “permitir el uso de texto a voz” y “usar texto digital acompañado de una grabación de voz humana (por ejemplo, libros hablados DAISY)”. La consideración 1.2, “apoyar múltiples formas de percibir la información”, sitúa el audio como modalidad adicional y no como sustituto.
- ¿El audio sustituye al material escrito?
- No. El audio es una vía adicional para percibir el mismo contenido, no un sustituto. El audio por sí solo excluye a las personas sordas y con discapacidad auditiva, y elimina la posibilidad de ojear, releer y buscar, así que debe acompañar al texto y nunca reemplazarlo.
- ¿Una versión en audio de un dosier necesita su propia transcripción?
- No necesariamente. El criterio de conformidad 1.2.1 de las WCAG 2.2 se aplica salvo cuando el audio es una alternativa multimedia al texto y está claramente identificado como tal, entendiendo por alternativa multimedia aquella que no presenta más información de la que ya contiene el texto. Un audio claramente identificado que no añade nada a su texto de origen queda cubierto por ese texto. El documento fuente conserva sus propias obligaciones de accesibilidad.
- ¿En qué se diferencia el audio generado de la síntesis de voz?
- La síntesis de voz lee un documento en voz alta siguiendo su orden. Podhoc genera una conversación estructurada entre voces que explica el material: es otra experiencia de escucha y otra fase de producción. Ambas sirven, resuelven problemas distintos y ninguna elimina la necesidad de un documento fuente accesible.
- ¿Qué equipo de la universidad se ocupa de esto?
- En la práctica se reparte entre tecnología educativa o educación digital, la biblioteca y sus responsables de recursos abiertos, y el servicio de atención a la discapacidad o de tecnología asistiva. Compras y seguridad informática entran cuando ya hay un proveedor. El piloto funciona mejor si uno de esos equipos lo impulsa y los demás lo revisan.
- ¿Puede Podhoc acceder a material que está detrás del campus virtual?
- No a través de la API de Podhoc, que acepta URL de acceso público. Todo lo que esté tras la autenticación de un campus virtual queda fuera de esa vía, así que un piloto debe empezar por material ya publicado abiertamente: recursos educativos abiertos, bibliografía en acceso abierto o guías docentes públicas.
- ¿Dónde se publican los episodios generados por defecto?
- Podhoc publica los episodios generados en su catálogo público Discover de forma predeterminada, y que ese comportamiento pueda desactivarse depende de la cuenta. Conviene confirmar qué configuración de visibilidad se aplica a tu cuenta antes de procesar cualquier material docente: para una institución esto es lo primero que debe resolver un piloto, no lo último.
- ¿En qué idiomas se puede generar el audio?
- Podhoc declara 73 idiomas, y el idioma de salida es independiente del idioma de origen, de modo que un material escrito en una lengua puede generarse como audio en otra. La madurez de la cobertura varía según el idioma, así que conviene probar las lenguas concretas en las que se imparte la titulación en lugar de dar por hecha la paridad.