Transcripción de audio: convertir grabaciones de reuniones en texto
Qué es la transcripción de audio
La transcripción de audio es el proceso de convertir la voz grabada en texto escrito, ya sea pasando un archivo de audio por un modelo de reconocimiento de voz o haciendo que una persona lo escuche y lo teclee. Si estás leyendo esto, probablemente ya tienes el archivo: la llamada con el cliente de ayer, una nota de voz, una entrevista, la grabación de un webinar que duerme en tu carpeta de descargas. Ahora necesitas las palabras.
Es un problema distinto de grabar bien una reunión. La grabación ya ocurrió, buena o mala, y no puedes volver atrás para mover el micrófono. Lo que todavía controlas es el archivo que le das a la herramienta, cómo manejas a varios hablantes, cuánta precisión necesitas y cuánta limpieza vas a hacer. Esas cuatro decisiones marcan la diferencia entre algo que un compañero lee y un muro de texto que nadie abre.
Una transcripción no son notas de reunión ni un resumen: es el registro completo de lo que se dijo, turno por turno. Si quieres ver su anatomía, aquí tienes lo que contiene realmente una transcripción.
Qué archivos de audio se transcriben bien y cuáles fallan en silencio
Aquí se confunden dos cosas: el contenedor, que es la extensión de archivo que ves, y el códec, que es cómo está codificado el audio por dentro. La mayoría de las herramientas se fijan en ambos y solo te informan del primero.
| Tipo de archivo | Suele aceptarse | Qué vigilar |
|---|---|---|
.wav | Sí | Sin comprimir, la entrada más segura. Archivos grandes, así que una reunión larga puede superar un límite de subida. |
.mp3 | Sí | Bien a partir de tasas de bits moderadas. Con tasas muy bajas las consonantes se emborronan. |
.m4a / .aac | Sí | El formato por defecto de Notas de Voz del iPhone y de la mayoría de grabadoras Android. Buena calidad. |
.flac | Normalmente | Sin pérdida y compacto, pero algunas herramientas antiguas no lo decodifican. |
.ogg / .opus | Normalmente | Exportaciones de WhatsApp y Discord. Opus aguanta bien con tasas de bits bajas. |
.mp4 / .mov | Normalmente | Contenedores de vídeo. La mayoría de herramientas extraen la pista de audio; confírmalo antes de subir gigas. |
| Audio protegido con DRM | No | Los archivos con gestión de derechos no se pueden decodificar. Consigue una copia sin protección o vuelve a grabar. |
| Audio de teléfono o buzón de voz a 8 kHz | Sí, pero | Se transcribe, con una precisión notablemente peor. Ver más abajo. |
La frecuencia de muestreo importa más de lo que la gente cree. Los modelos de voz se construyen en torno a audio de 16 kHz; la documentación de Whisper de OpenAI especifica remuestrear la entrada a 16 kHz mono. Una grabación de 44,1 kHz se reduce sin problema. Una grabación de 8 kHz no se puede sobremuestrear para recuperar un detalle que nunca se captó. Ese es el verdadero problema del audio telefónico: el estándar de telefonía ITU-T G.711 limita la banda de paso a unos 300 a 3.400 Hz, lo que recorta la energía de alta frecuencia que distingue una "s" de una "f" o de una "th". El oído humano rellena el hueco con el contexto; los modelos adivinan, y lo primero que adivinan mal son los nombres y los números.
La tasa de bits es la otra palanca. Un mp3 muy comprimido descarta el detalle fino que necesita un modelo de reconocimiento. Exporta con la máxima calidad que ofrezca la fuente y no vuelvas a comprimir. El mono está bien, y a menudo es mejor que un archivo estéreo en el que un canal está casi en silencio.
El origen del archivo también cuenta. Las grabaciones en la nube suelen llegar como un mp4 más un archivo aparte solo de audio, y ese archivo de solo audio es mejor para subir. Algunas plataformas también ofrecen pistas por participante, lo mejor que puedes hacer para atribuir bien a los hablantes. Las transcripciones de las propias plataformas tienen sus manías, y sacar una transcripción de Zoom funciona distinto que subir el archivo en bruto.
Audio con varios hablantes y lo que las etiquetas de hablante pueden hacer de verdad
La diarización de hablantes es el paso que divide un flujo de audio en quién habló y cuándo, y luego etiqueta los turnos como Speaker 1, Speaker 2, etcétera. Funciona por separado del reconocimiento que produce las palabras, por eso una transcripción puede tener un texto correcto y unas etiquetas muy equivocadas al mismo tiempo.
Funciona bien cuando las voces son distintas, la gente respeta los turnos y todos están cerca de un micrófono. Funciona mejor que nunca cuando cada hablante tiene su propio canal, porque entonces la atribución deja de ser una inferencia. Donde falla:
- Solapamientos. Cuando dos personas hablan a la vez, el modelo igualmente tiene que asignar ese tramo a una sola etiqueta. Algunas herramientas eliminan por completo al hablante más bajo.
- Un solo micrófono omnidireccional en una sala grande. La reverberación en paredes duras hace que la misma voz llegue al micrófono varias veces con un ligero retraso. Eso difumina la huella acústica de la que depende la diarización, y las personas más alejadas del micrófono acaban fusionadas.
- Interjecciones cortas. "Sí", "vale" y "mm-hm" son demasiado breves para caracterizarlas, así que se las queda quien estuviera hablando alrededor.
- Voces parecidas. Dos personas con un tono cercano y el mismo acento acaban a menudo bajo una sola etiqueta.
- Deriva en el número de hablantes. La mayoría de herramientas estiman cuántas personas hay. Si se quedan cortas, dos compañeros comparten etiqueta; si se pasan, una persona que se movió acaba siendo Speaker 3 y Speaker 5.
Ajusta tus expectativas en consecuencia. En una grabación limpia de tres o cuatro personas, los cambios de turno caen más o menos donde deben y dedicarás unos minutos a asociar Speaker 1 con un nombre. En una grabación por altavoz de ocho personas, trata las etiquetas como una pista y comprueba en el audio los momentos que importan: quién se comprometió con la fecha, quién planteó la objeción.
Precisión: qué significan realmente los números
La tasa de error de palabras (WER) es la medida estándar, y entenderla cambia cómo lees cada promesa de precisión de un proveedor. El WER cuenta tres tipos de error frente a una transcripción de referencia, sustituciones, eliminaciones e inserciones, y divide el total entre el número de palabras de la referencia. Es la métrica que usó el NIST en sus evaluaciones de referencia de reconocimiento de voz, y es lo que suele significar "95 % de precisión": una tasa de error del 5 %.
El problema es que el WER trata todos los errores por igual. Un "um" que se pierde y un "not" que se pierde cuentan como una eliminación cada uno, pero solo el segundo invierte el sentido de una frase. Los errores que te cuestan tiempo se concentran en las palabras que más te importan: nombres, números, términos de producto, negaciones.
Y luego está de dónde sale la cifra. Las precisiones publicadas se miden sobre corpus de referencia, y esos corpus no se parecen en nada a tu sala de reuniones. LibriSpeech es habla leída de audiolibros: una persona, con guion, en una sala silenciosa y con el micrófono cerca. Switchboard son conversaciones telefónicas entre desconocidos. Una cifra de precisión destacada casi siempre es un resultado sobre habla leída y limpia, y la reunión rápida de ningún martes suena a audiolibro.
Lo que de verdad degrada la precisión, más o menos por orden de daño:
- El habla solapada, el caso más difícil del sector.
- La reverberación y la distancia al micrófono, que perjudican más de lo que la mayoría supone.
- El audio de baja tasa de bits o de banda estrecha, por las razones de muestreo de más arriba.
- Acentos y dialectos poco representados en los datos de entrenamiento de un modelo. Es una limitación bien documentada de los sistemas de voz, no un error de redondeo.
- La jerga del sector, los nombres de producto, las siglas y los apellidos: palabras de mucho valor que aparecen poco en los datos de entrenamiento.
- El ruido de fondo y los cambios de idioma a mitad de frase, que los modelos manejan mal salvo que estén diseñados para ello.
Antes de lanzar un archivo de dos horas, corta los tres primeros minutos y transcribe solo eso. Luego léelo. Si tres minutos necesitan muchas correcciones, los 117 restantes necesitarán proporcionalmente más, y ese es el momento de elegir entre una pasada automática más tu propio tiempo de edición o, sencillamente, pagar a una persona.
La limpieza que necesita toda transcripción en bruto
La salida en bruto de cualquier herramienta de transcripción es un volcado de datos, no un documento. Dejarla lista para que la lea un compañero exige una pasada deliberada, y va más rápido en este orden.
- Primero, asocia las etiquetas de hablante con nombres reales. Todos los pasos posteriores son más fáciles cuando ves quién habla, y un buscar y reemplazar global de "Speaker 2" no cuesta nada.
- Corrige los nombres propios. Es el fallo más predecible de la transcripción: el nombre de tu empresa, tus nombres de producto, la sigla que tu equipo dice cuarenta veces al día, el apellido de la persona al otro lado. Los motores se equivocan de forma constante, destrozando un término concreto siempre igual, así que un buscar y reemplazar por término suele limpiar todas las apariciones. Mejor aún, prevenlo: el vocabulario personalizado te permite registrar términos antes de transcribir, y para eso sirve el diccionario personal (Personal Dictionary) del asistente de reuniones de Laxis.
- Elige entre literal o versión limpia y sé coherente. La transcripción literal conserva cada muletilla, arranque en falso y repetición, que es lo que quieres para investigación o para un registro en disputa. La versión limpia los elimina, que es lo que necesita cualquier texto que se vaya a leer. Pero no limpies de más: los matices son contenido. "Creo que probablemente podamos tenerlo para el viernes" no es el mismo compromiso que "lo tendremos el viernes".
- Separa en párrafos y puntúa. Corta en los cambios de tema, no en cada cambio de hablante, o un intercambio rápido se convierte en cuarenta párrafos de una línea.
- Añade marcas de tiempo en los límites de cada sección para que cualquiera pueda volver al audio.
- Saca las decisiones y las tareas con su responsable. Es la parte que la gente usa de verdad.
Si prefieres la mecánica a la teoría, hemos escrito paso a paso todo el proceso para transcribir audio a texto.
Audio en más de un idioma
Si tu grabación no está en inglés, o no solo en inglés, dos preguntas lo deciden todo: ¿detecta la herramienta el idioma por sí sola? y ¿lo cubre de verdad? La cobertura varía mucho, y que un idioma aparezca en una lista de soporte no significa que se transcriba tan bien como el inglés, porque los datos de entrenamiento están repartidos de forma desigual.
Laxis cubre más de 100 idiomas con detección automática del idioma y, en las reuniones en directo, muestra la traducción junto al original mientras la gente habla; el plan Business cambia automáticamente entre hasta cinco idiomas dentro de una misma reunión. Para un archivo que ya tienes, sigue el orden correcto: primero consigue una transcripción correcta y después traduce. Traducir una transcripción llena de errores de reconocimiento produce una traducción cuyos errores nadie puede rastrear hasta el original.
Cuánto tarda y cuánto cuesta
La transcripción automática termina en una fracción de la duración de la grabación, normalmente unos minutos para una hora de audio, a veces más si estás en cola detrás de otros trabajos. La transcripción humana funciona al revés: un transcriptor trabaja más despacio que el tiempo real, parando, rebobinando y comprobando la ortografía, por eso los plazos se dan en horas o días y el precio va por minuto de audio. La urgencia cuesta más. Pide la tarifa del proveedor concreto en lugar de fiarte de una cifra general, porque los precios varían mucho según el plazo, la calidad del audio y el número de hablantes.
La limitación con la que choca la gente al usar software no suele ser el precio, sino el tope de duración por grabación, que es independiente del cupo mensual de minutos. Así funciona en Laxis, que acepta archivos de audio subidos además de grabar reuniones en directo:
| Plan | Precio | Qué incluye |
|---|---|---|
| Free | 0 $ | 300 minutos de transcripción al mes, 45 minutos por grabación |
| Premium | 15,99 $ por usuario al mes, o 9,99 $ con pago anual | 2.000 minutos de transcripción al mes, grabaciones de hasta 2 horas |
| Business | 29,99 $ por usuario al mes, o 19,99 $ con pago anual | Minutos de transcripción ilimitados, grabaciones de hasta 4 horas y sincronización con HubSpot y Salesforce |
El tope por grabación es el que pilla a la gente por sorpresa. Una reunión general de tres horas no cabe ni en Free ni en Premium, así que o divides el archivo o subes de plan. Y la sincronización con el CRM está en Business, no en Premium, algo importante si transcribes llamadas para meterlas en un pipeline. Laxis funciona en escritorio y móvil, se conecta con Zoom, Google Meet y Microsoft Teams, y ofrece una opción de captura sin bot cuando prefieres que no se una un participante visible.
Si estás comparando herramientas en lugar de resolver el problema de un archivo concreto, nuestra comparativa 2026 de tomadores de notas con IA pone la categoría lado a lado.
Cuándo pagar a una persona
El software es la opción por defecto correcta para la mayoría del audio. Hay casos en los que no lo es, y decirlo con claridad sale más barato que descubrirlo por las malas.
Registros legales y oficiales. Declaraciones, procedimientos judiciales, presentaciones ante reguladores y cualquier cosa que pueda aportarse como prueba suelen necesitar una transcripción certificada por un transcriptor cualificado que dé fe de su exactitud. La salida de una máquina no es un registro certificado, por precisa que sea.
Mal audio y mucho en juego. Si la grabación es un único micrófono lejano en una sala con eco y muchos solapamientos, y el contenido importa de verdad, tus horas de edición costarán más que un transcriptor. Estima la limpieza con honestidad antes de elegir.
Un acento marcado cuando el resultado importa. La calidad del reconocimiento es desigual entre acentos y dialectos. Si el modelo maneja mal el acento del hablante y la transcripción se va a citar, a usar como base o a enseñar al propio hablante, recurre a una persona.
Transcripción literal para investigación. En investigación cualitativa, lingüística y parte del trabajo clínico, las vacilaciones, los solapamientos y las autocorrecciones son los datos, no ruido. Las convenciones de la transcripción literal son concretas y las máquinas no las aplican.
Audio regulado. Comprueba el cumplimiento normativo antes de subir, no después. Laxis no cumple la HIPAA y no firma BAA, así que la información sanitaria protegida no debe pasar por él. Otras herramientas asumen compromisos distintos; la única forma fiable de saberlo es preguntar al proveedor por escrito.
Hay una opción intermedia que la gente olvida: hacer primero la pasada automática y luego pagar a una persona para que edite ese borrador en lugar de transcribir desde cero. Muchos servicios lo ofrecen, y cuesta menos que una transcripción totalmente humana.
Empieza con el archivo que ya tienes
Si la grabación está ahora mismo en tu escritorio, súbela, lee los primeros minutos y descubre a qué te enfrentas antes de decidir cuánto esfuerzo merece el resto. El plan gratuito de Laxis te da 300 minutos de transcripción al mes con un tope de 45 minutos por grabación, suficiente para probar tu peor grabación en lugar de un archivo de demostración pulido, y sin un reloj de prueba en cuenta atrás mientras lo haces. Pruébalo con el asistente de reuniones de Laxis y júzgalo con tu audio, no con el nuestro.
Preguntas frecuentes
¿Qué es la transcripción de audio?
La transcripción de audio es la conversión de voz grabada en texto escrito, hecha por un software de reconocimiento de voz o por un transcriptor humano. La entrada es un archivo de audio como un mp3, m4a o wav; la salida es texto, normalmente con etiquetas de hablante y marcas de tiempo. No es un resumen.
¿Qué formatos de archivo de audio puedo transcribir?
mp3, m4a, aac y wav funcionan de forma fiable en prácticamente cualquier herramienta de transcripción, y flac, ogg y opus normalmente también. Los contenedores de vídeo como mp4 y mov suelen funcionar porque la herramienta extrae la pista de audio, aunque conviene confirmarlo antes de subir un archivo muy grande. El audio protegido con DRM no se puede transcribir en absoluto.
¿Qué precisión tiene la transcripción automática de audio?
La precisión depende mucho más de tu grabación que de la herramienta que elijas. Cifras destacadas como "99 % de precisión" se miden sobre corpus de habla leída, limpia y de un solo hablante, no en salas de reuniones. Espera peores resultados con hablantes que se solapan, un micrófono lejano, una sala con eco, acentos poco habituales o mucha jerga. Prueba primero tres minutos de tu propio audio.
¿Puede un software de transcripción distinguir a los hablantes?
Sí, mediante la diarización de hablantes, que segmenta el audio según quién habla y etiqueta los turnos como Speaker 1, Speaker 2, etcétera. Es fiable cuando las voces son distintas y la gente respeta los turnos, y poco fiable con solapamientos, voces parecidas o un solo micrófono omnidireccional en una sala grande. Seguirás teniendo que asociar tú las etiquetas con nombres reales.
¿Puedo transcribir un archivo de audio que ya grabé?
Sí. Laxis acepta archivos de audio subidos, así que una grabación hecha con el móvil, en una plataforma de videoconferencia o con una grabadora dedicada se puede transcribir sin ninguna reunión en directo. El plan gratuito cubre 300 minutos de transcripción al mes con un tope de 45 minutos por grabación; Premium sube ese tope a dos horas y Business a cuatro.
¿Cuándo debo usar transcripción humana en lugar de software?
Recurre a una persona para registros legales y oficiales que requieran certificación, para la transcripción literal de investigación en la que las vacilaciones y los solapamientos son los datos, y cuando un mal audio y mucho en juego harían que tu tiempo de edición costara más que un transcriptor. Una vía intermedia práctica es una pasada automática seguida de una persona que edite ese borrador.