13 de septiembre de 2026

¿Transcripción errónea? El problema casi siempre es el audio

Un audio malo produce un texto malo, y ninguna IA arregla lo que no logró escuchar. Estos son los cuatro factores que deciden la precisión de una transcripción, qué se puede resolver después y cómo mejorar el audio que capturas hoy.

Rodrigo Carvalho Rodrigo Carvalho

¿Transcripción errónea? El problema casi siempre es el audio

Transcribiste una reunión de 40 minutos y el texto salió lleno de huecos. Nombres cambiados, frases cortadas, tramos que no tienen sentido. La reacción natural es culpar a la herramienta, y a veces la culpa es de ella. Pero en la mayoría de los casos, el error que ves en el texto nació antes: en el audio que llegó hasta el modelo.

El reconocimiento de voz tiene una característica incómoda. No tiene contexto de sobra para desempatar lo que escuchó. Una persona que pierde una sílaba en medio de una conversación la reconstruye por el tema, por la cara de quien habló, por lo que se dijo antes. El modelo solo tiene la onda de sonido. Si parte de ella no está ahí, no existe inferencia que devuelva la palabra correcta.

Por eso invertir en la grabación rinde más que cambiar de herramienta.

El error que ves en el texto nació en el audio

Hay un experimento mental sencillo. Toma el tramo problemático de tu transcripción y escucha los 10 segundos correspondientes. En casi todos los casos vas a escuchar exactamente el mismo problema: alguien hablando lejos del micrófono, dos personas encimándose, un ventilador de fondo, el celular golpeando la mesa.

El modelo acertó en lo que se podía escuchar. Transcribió con fidelidad un audio que ya era ambiguo.

Eso cambia la pregunta. En vez de “¿cuál es la mejor herramienta de transcripción?”, la pregunta útil es “¿cómo entrego un audio que no necesite adivinanzas?”.

Los cuatro factores que deciden la transcripción

No son decenas de variables. Son cuatro, y todas son más predecibles de lo que parecen.

FactorQué hay detrásCuánto pesa
Ruido de fondo y reverberaciónAire acondicionado, calle, sala de vidrio, ecoMucho — es el campeón de los errores
Distancia al micrófonoCelular en el centro de la mesa, laptop lejos, sala grandeMucho — cae junto con la distancia
Habla superpuestaMás de una persona hablando al mismo tiempoAlto — e irrecuperable
Tema y vocabularioNombres propios, siglas, términos técnicos y regionalesMedio — depende del contexto

El orden importa. Puedes compensar un nombre propio mal escrito leyendo la transcripción con atención. No puedes compensar una frase que nunca se capturó.

Lo que compra un audio limpio

El número que resume todo esto es la tasa de error por palabra (WER, por su sigla en inglés): la fracción de palabras que el sistema equivoca respecto a lo que realmente se dijo.

El trabajo fundacional de Deep Speech 2 (Amodei et al., 2016) entrenó el mismo modelo con volúmenes distintos de audio y midió el resultado. Incluso en los tramos sin ruido, el error por palabra cayó de aproximadamente 29% con 120 horas de entrenamiento a cerca del 8,5% con 12 mil horas. En los tramos con ruido, la misma curva quedó entre aproximadamente 51% y 14%. El total de datos mejoró ambos casos casi proporcionalmente, pero la distancia entre ellos nunca se cerró. Bajo ruido, el error se mantuvo alrededor de un 60% más alto, de forma consistente.

El detalle que le interesa a quien graba reuniones está en otra tabla del mismo trabajo. En inglés estadounidense sin ruido, el error quedó en torno al 8%. En muestras con acento indio, pasó del 20%. En los tramos con ruido real del corpus CHiME, 21,6%. En los tramos con ruido simulado, 42,5%.

Traducido: el mismo sistema, en el mismo idioma, equivocándose cinco veces más según cómo se capturó el audio. La variable no fue la inteligencia del modelo. Fue el micrófono y la sala.

Ruido: qué se puede resolver en el software y qué no

Buena parte del ruido que sobra en la transcripción se resuelve después: filtros, supresión de ruido estacionario, normalización de volumen. Eso viene incorporado en la mayoría de las herramientas serias, incluido Sintesy.

El problema es lo que no se resuelve.

Un habla superpuesta es información que se perdió. Ningún filtro separa dos voces que se volvieron una sola onda.

Amodei y otros investigadores del área son explícitos en ese punto. Awni Hannun, uno de los autores de Deep Speech 2, escribió en 2017 un texto llamado justamente “Speech Recognition Is Not Solved”: muchos de los avances en habla conversacional venían de bases donde cada participante tenía su propio micrófono, sin superposición de voces. En audio de campo lejano, con varias personas en el mismo canal, la separación sigue siendo un problema abierto.

Es la misma razón por la que las llamadas telefónicas se transcriben mejor que una sala de reuniones: un micrófono por persona. Menos distancia, superposición cero.

Lo que controlas en 30 segundos

Nada de esto exige equipo caro. Exige tres decisiones antes de apretar el botón de grabar.

Acerca la fuente. Un celular a 30 centímetros de la boca se equivoca mucho menos que una laptop en el rincón de una sala de vidrio. Si la reunión es presencial con varias personas, una grabadora en el centro de la mesa es mejor que el celular de quien está sentado en la punta. Si es solo tu voz — una clase, una idea, un recado —, graba cerca y no te preocupes por el resto.

Apaga lo que hace ruido. Aire acondicionado, ventana abierta, notificaciones, ventilador. El ruido constante es justamente lo que los filtros eliminan mejor, pero eliminar no es lo mismo que nunca haber existido. Cada capa menos mejora el resultado de todo lo que viene después.

Evita el habla superpuesta. Esto es organización, no técnica. En una reunión grande, ceder la palabra — y esperar a que la respuesta termine antes de empezar la tuya. Suena a consejo de etiqueta, pero es el factor de calidad más subestimado. Ningún software devuelve lo que dos voces borraron juntas.

Vale recordar que estas orientaciones sirven para quien graba. Si recibes un audio ya hecho — de un cliente, un alumno, un colega —, el audio es el que es. En ese caso el ajuste viene después, en la lectura.

Las palabras que siguen mal incluso con buen audio

Hay una clase de error que sobrevive a cualquier mejora de grabación: aquella en la que la única forma de acertar sería saber de qué estaba hablando la conversación.

Nombres propios, sobre todo. “Marcelo” y “Marcela” son sonidos casi idénticos. El nombre de una empresa que el modelo nunca vio, una sigla interna, el apodo de un proyecto. En la cabina acústica perfecta, con el audio más limpio posible, esas palabras siguen siendo apuestas.

También entra el vocabulario de dominio. Un estudiante de medicina dictando un término anatómico, un abogado citando el nombre de un proceso, un equipo de ingeniería hablando de un servicio con nombre interno. La investigación en voz siempre trató esto como un problema de contexto, no de acústica: quien transcribe bien en portugués acierta mejor los nombres brasileños porque conoce la lista de nombres brasileños.

Lo que esto cambia en la práctica es dónde pones la atención después de transcribir. En los tramos de contenido — argumentos, decisiones, explicaciones — el texto tiende a ser confiable. En los nombres y las siglas, conviene revisar. Y conviene usar el propio material: si ya transcribiste cinco clases del mismo profesor, esa transcripción es el mejor diccionario que existe de ese vocabulario.

Limpieza: releer la transcripción en vez de confiar en la estadística

Una trampa común es tratar la tasa de error como un sello. “La herramienta tiene 98% de precisión, entonces está todo bien.”

No lo está. El propio Hannun da el ejemplo que desarma esa confianza: con 5% de error por palabra y frases de 20 palabras, la probabilidad de que al menos una palabra salga mal en cada frase es prácticamente total. El texto parece bueno, se lee bien, y aun así puede tener un error en cada frase.

Peor: no todo error pesa igual. Cambiar “martes” por “hoy” cambia la decisión de la reunión. Quitar un “para” no cambia nada. Por eso la revisión no debe ser un repaso uniforme de todo: debe seguir lo que vas a hacer con el texto.

Si la transcripción va a sustentar una decisión, revisa números, fechas y nombres. Si va a convertirse en material de estudio, revisa los términos técnicos. Si va a convertirse en un resumen para el equipo, revisa los puntos de acción. El resto es lectura rápida.

Cómo hacerlo en Sintesy

El trabajo de calidad ocurre en dos extremos, y Sintesy intenta cubrir los dos.

En la captura, la grabación nativa se pensó justamente para tomar la voz a una distancia razonable — la idea es que quien habla no tenga que pegarse a la boca del celular, lo que ayuda en mesa de reunión y en sala de clase. El ruido de fondo estacionario se filtra antes del procesamiento.

En la organización, la ganancia real aparece cuando dejas de tratar la transcripción como un bloque único de texto. Una síntesis en Sintesy abre el mismo material en varios formatos: la transcripción completa y buscable, el resumen estructurado, el mapa mental y el checklist. En vez de auditar las miles de palabras del texto corrido, miras primero el resumen: si un nombre o un número está mal ahí, probablemente está mal en la transcripción, y encuentras el origen por la búsqueda.

Y está el efecto acumulado. Después de transcribir algunos materiales del mismo tema, de la misma persona o del mismo equipo, preguntarle al chat sobre el material nuevo se vuelve más fácil que leer la transcripción entera. Ya tienes la referencia del vocabulario y del contexto, que es exactamente donde se esconde el error.

Antes de culpar a la herramienta

Vale un último atajo, porque te ahorra una suscripción nueva y una migración entera.

Escucha 10 segundos del audio original en el tramo donde el texto falló. Si ahí ya había dos voces al mismo tiempo, eco de la sala o el habla llegando baja y distante, encontraste la causa, y está más cerca de cómo grabas que de dónde transcribes.

Si quieres el paso a paso completo de captura y transcripción, hay una guía dedicada aquí: Cómo transcribir audio con IA: guía completa. Y si el audio que quieres mejorar es de una reunión presencial grabada con el celular, el flujo específico está en cómo convertir una reunión presencial en acta con IA.

Un audio limpio no es preciosismo técnico. Es la diferencia entre tener un registro para consultar y tener un registro en el que puedes confiar sin revisar.