¿Qué es una transcripción? Tipos, formatos y ejemplos
Alguien te pide que le mandes la transcripción y dices que claro, porque obviamente sabes lo que es. Luego llega el archivo y hay marcas de tiempo cada pocos segundos, nombres en mayúsculas y una línea que solo dice [voces superpuestas]. De pronto ya no resulta tan obvio.
Primero, una bifurcación. En inglés, transcript también significa el registro oficial de las asignaturas que cursaste y las notas que obtuviste en el colegio o la universidad: el documento que emite la secretaría académica. Si es eso lo que necesitas, la oficina de registro de tu institución es el sitio al que ir. Esta guía trata del otro significado: el registro escrito de algo dicho en voz alta, producido a partir de una grabación.
Una transcripción es un documento, no una actividad
Una transcripción es un documento de texto que recoge lo que se dijo en una grabación, en el orden en que se dijo, atribuido a quien lo dijo. Esa es toda la definición. Todo lo demás —marcas de tiempo, notas entre corchetes, el bloque de encabezado, la extensión del archivo— son convenciones superpuestas para que el documento resulte utilizable.
La palabra se usa con soltura tanto para el trabajo como para el resultado, y de ahí arranca la confusión. Producir el documento —el coste, la velocidad, la cuestión de máquina o persona— es un tema aparte, y hemos cubierto el proceso de transcripción en sí en una guía complementaria. Esta página va del objeto.
Dos propiedades separan una transcripción de unas notas. Es lineal: sigue la grabación de principio a fin en lugar de saltar a lo interesante. Y es completa dentro del estilo que declara. Un resumen elige y descarta; una transcripción no tiene ese derecho. Sáltate los cinco minutos aburridos en los que nadie encontraba la diapositiva correcta y lo que tienes son notas: llamarlas transcripción acabará provocando una discusión.
Los cuatro estilos de transcripción, y lo que cada uno tira
Cada transcripción decide cuánto del desorden del habla real conserva. Cuatro estilos se reparten ese espectro, y elegir mal es la forma más habitual de que un encargo de transcripción se tuerza.
Verbatim completo (o transcripción literal)
Todo. Cada «eh», cada tartamudeo y cada arranque en falso, más los sonidos no verbales como risas, pausas largas y ruido de fondo, todos marcados. El verbatim completo captura no solo qué se dijo, sino cómo se dijo. Es lento de producir y desagradable de leer, que es exactamente el punto en el que se exige: procedimientos judiciales, interrogatorios policiales e investigaciones donde la vacilación es en sí misma el dato.
Verbatim limpio
Las palabras tal como se dijeron, menos el ruido. El verbatim limpio elimina muletillas, tics verbales y tartamudeos, pero no parafrasea: las frases siguen siendo del hablante. La mayoría de los proveedores conserva los arranques en falso y las autocorrecciones con significado, porque señalan incertidumbre real, y en cambio recorta el «¿sabes?» reflejo que aparece cuarenta veces por hora. Es la opción por defecto para reuniones, sesiones de congresos, grupos focales y clases grabadas.
Verbatim inteligente
Un paso más hacia la legibilidad. Además de quitar muletillas, quien transcribe repara ligeramente la gramática, condensa las repeticiones y elimina los apartes sin contenido («perdón, mi perro se ha vuelto loco»). La voz del hablante sigue intacta; la aspereza no. Los investigadores suelen preferirlo para entrevistas que van a citar. Para más lío, algunos proveedores usan «verbatim inteligente» y «verbatim limpio» como sinónimos.
Transcripción editada
La versión más procesada. Un editor reordena oraciones, aprieta las frases, corrige la gramática y da forma al texto para un lector que nunca estuvo en la sala. Aquí viven las entrevistas publicadas, los textos de discursos y las notas de episodio de un pódcast. El compromiso es real: una transcripción editada es la más agradable de leer y la menos defendible como registro.
Consejo: define el estilo antes de que nadie empiece a trabajar. Estos términos no están normalizados: el «verbatim limpio» de un proveedor es el «verbatim inteligente» de otro. No te fíes de la etiqueta. Manda en su lugar una especificación de dos líneas: «conservar arranques en falso, eliminar muletillas, marcar con tiempo los tramos inaudibles». Esa frase evita el rehacer más caro que existe, que es repetir cuarenta horas de audio porque las muletillas tenían que quedarse.
Cómo es realmente una transcripción
Las descripciones solo llegan hasta cierto punto. Aquí tienes la transcripción en verbatim limpio de una reunión de trabajo breve, formateada como se formatean la mayoría de las profesionales.
Transcripción de ejemplo — verbatim limpio
TRANSCRIPCIÓN — Revisión de precios T3 Grabado: 5 de agosto de 2026 | Duración: 00:42:11 | Hablantes: 3 Estilo: verbatim limpio
[00:00:04] MAYA CHEN: Vale, estamos grabando. Dan, ¿tenías los números de margen revisados?
[00:00:09] DAN OKAFOR: Sí. Enterprise está en un sesenta y uno por ciento de margen bruto, cuatro puntos más que en el T2. Donde se pone feo es en el mid-market.
[00:00:21] MAYA CHEN: ¿Feo en qué sentido?
[00:00:23] DAN OKAFOR: Carga de soporte. Mismo precio, más o menos el triple de tickets. Creo que es [inaudible 00:00:27] el onboarding.
[00:00:31] PRIYA RAO: Cuadra. Lanzamos el onboarding autoservicio en junio y la adopción está por debajo del treinta por ciento.
[00:00:38] MAYA CHEN: Entonces el arreglo no es — [voces superpuestas] —
[00:00:39] DAN OKAFOR: — el arreglo es el onboarding, no el precio.
[00:00:44] MAYA CHEN: Pues acción a realizar. Priya, ¿puedes sacar la adopción por cohorte antes del jueves?
[00:00:51] PRIYA RAO: Sí. El miércoles.
[00:00:53] [Grabación en pausa]
Ahí están operando cuatro convenciones casi universales:
- Un bloque de encabezado. Título, fecha, duración, número de hablantes, estilo. Esto convierte un muro de texto en un documento citable seis meses después.
- Etiquetas de hablante. Nombres completos en mayúsculas, o etiquetas de rol como ENTREVISTADOR y ENTREVISTADO cuando importa el anonimato. Sé coherente: media transcripción etiquetada «DAN» y media «D. OKAFOR» rompe cualquier búsqueda que se haga sobre ella.
- Marcas de tiempo. En cada cambio de hablante, como arriba, o a intervalos fijos de 30 segundos a dos minutos. Más granular es ruido; menos hace que los momentos sean difíciles de encontrar.
- Corchetes para todo lo que no sea habla. [inaudible], [voces superpuestas], [risas], [grabación en pausa]. Las transcripciones serias ponen marca de tiempo a la etiqueta de inaudible para que alguien pueda ir a escuchar y rellenar el hueco.
Acertar con las cuatro a mano es tedioso, y por eso hoy casi todo se genera solo. Las herramientas de reuniones producen el encabezado, las etiquetas y las marcas de tiempo automáticamente: Laxis, por ejemplo, transcribe llamadas de Zoom, Google Meet y Microsoft Teams en un documento etiquetado y marcado en el tiempo, y extrae de paso las acciones a realizar, así que la tarea que Priya acaba de asumir no depende de que alguien se acuerde de anotarla. Venga de donde venga la tuya, las convenciones de arriba son el estándar con el que se mide; nuestro paso a paso sobre cómo transcribir audio a texto cubre la mecánica.
Transcripción, subtítulos ocultos, subtítulos y acta: cuatro documentos distintos
Estos cuatro se usan como sinónimos constantemente y no son intercambiables. Todo se reduce a dos preguntas: ¿el texto está sincronizado con una línea de tiempo, y es completo o selectivo?
Una transcripción es completa y autónoma: puedes leerla con el vídeo cerrado. Unos subtítulos ocultos son completos pero sincronizados, troceados en bloques que aparecen mientras suena el audio, y llevan información no verbal porque están hechos para alguien que no oye. Unos subtítulos están sincronizados pero son selectivos, solo diálogo, porque dan por supuesto que sí oyes la banda sonora y simplemente no hablas el idioma. Un acta no es ninguna de las dos cosas: es un resumen estructurado de decisiones, responsables y plazos.
| Documento | Qué contiene | ¿Sincronizado con el vídeo? | Para quién es | Formatos típicos |
|---|---|---|---|---|
| Transcripción | Cada palabra dicha, en orden, atribuida a un hablante | No — las marcas de tiempo son puntos de referencia, no señales de entrada | Cualquiera que lea, busque, cite o archive el registro | .txt, .docx, .pdf, .json |
| Subtítulos ocultos | Diálogo más identificación de hablantes y sonido no verbal | Sí — bloques temporizados, activables | Espectadores sordos y con pérdida auditiva; ver sin sonido; cumplimiento normativo | .srt, .vtt, .scc, .cap |
| Subtítulos | Solo diálogo, normalmente traducido | Sí — bloques temporizados | Espectadores que oyen el audio pero no hablan el idioma | .srt, .vtt, .ass |
| Acta de reunión | Asistentes, decisiones, acciones, responsables, plazos | No | Quien se perdió la reunión, o necesita el registro de gobernanza | .docx, .pdf, página wiki |
Estos documentos fluyen en un solo sentido. Puedes trocear y temporizar una transcripción para convertirla en subtítulos, o resumirla en un acta. No puedes volver atrás de forma fiable: los subtítulos se cortaron en saltos de línea arbitrarios y perdieron la estructura de párrafos, y el acta tiró el 95 % de las palabras a propósito. Guarda la transcripción.
Subtítulos ocultos frente a subtítulos, porque todo el mundo se equivoca aquí
Pregunta a diez personas qué son los subtítulos y nueve describirán subtítulos ocultos. La diferencia no es cosmética, y en contextos regulados separa lo conforme de lo que no lo es.
Los subtítulos dan por supuesto que oyes. Resuelven un problema de idioma, así que llevan diálogo y nada más. Una puerta que se cierra de golpe fuera de plano no necesita subtítulo: la has oído.
Los subtítulos ocultos dan por supuesto que no oyes. Resuelven un problema de accesibilidad, así que llevan todo lo que lleva la banda sonora: quién habla, qué dijo y el audio no verbal que afecta al significado: [música inquietante en aumento], [cristales rotos], [suspiro]. Por eso los subtítulos ocultos se ven más recargados.
Dos términos más completan el conjunto. SDH —subtítulos para personas sordas y con pérdida auditiva— es el híbrido: presentación de tipo subtítulo con contenido de tipo subtítulo oculto, que es lo que suelen entregar las plataformas de streaming. Y «oculto» solo significa activable; los subtítulos abiertos van incrustados en el vídeo y no se pueden desactivar, por eso dominan en los feeds que se reproducen solos y en silencio. Los formatos difieren incluso en lo mecánico: los subtítulos ocultos de emisión están limitados tradicionalmente a unos 32 caracteres por línea, mientras que los archivos SDH permiten hasta 42, y por eso la misma frase se parte de otra manera en dos reproductores que muestran la misma película.
Consejo: comprueba cuál exige realmente tu política de accesibilidad. Los equipos publican subtítulos traducidos, marcan la casilla de accesibilidad y descubren después que nunca cumplieron el requisito. El acceso de personas sordas y con pérdida auditiva necesita subtítulos ocultos o SDH: texto que identifique a los hablantes y describa el sonido con significado. Una audiencia internacional necesita subtítulos traducidos. La mayoría de las videotecas necesitan ambos, como archivos separados y con costes separados.
Los formatos de archivo en los que llega una transcripción
La extensión te dice para qué está hecha una transcripción, y hay unos seis con los que te vas a encontrar.
.txt es el mínimo común denominador: sin formato, sin metadatos, se abre en cualquier parte, se cuela limpiamente en scripts y buscadores. .docx es para cuando una persona va a leer, comentar o tachar: conserva estilos, sangrías francesas, control de cambios. .pdf es la versión que se firma, se certifica o se archiva, con la maquetación congelada. .json es el más rico: marcas de tiempo por palabra, puntuaciones de confianza por palabra, identificadores de hablante como campos estructurados. Si vas a construir búsqueda o analítica sobre tus transcripciones, pide JSON.
Y luego los dos formatos de subtítulo que la gente confunde con formatos de transcripción. .srt (SubRip) es el formato universal de subida: bloques numerados con hora de inicio y fin, aceptados por casi todos los editores, reproductores y plataformas, con coma como separador de milisegundos: 00:00:01,500. .vtt (WebVTT) es nativo de la web, pensado para el elemento <track> de HTML5. Exige una línea WEBVTT al principio, usa punto en lugar de coma (00:00:01.500), hace opcional la numeración de bloques y lleva cosas que SRT no puede: estilos CSS, posicionamiento en pantalla, marcadores de capítulo, pistas de metadatos y mejor tratamiento de idiomas de derecha a izquierda como el árabe y el hebreo.
Ninguno es buen sitio para guardar una transcripción. Los dos descartan la estructura de párrafos por diseño, y reconstruir prosa legible a partir de bloques temporizados es un trabajo genuinamente molesto. Guarda un máster en texto o JSON; exporta SRT o VTT cuando un vídeo los necesite.
Quién vive de verdad dentro de las transcripciones
Las transcripciones parecen un objeto de nicho hasta que cuentas las profesiones construidas sobre ellas.
- Jurídico. Los usuarios más estrictos con diferencia: declaraciones y juicios exigen registros en verbatim completo, normalmente con líneas numeradas para que un abogado pueda citar «página 43, línea 12». Una transcripción certificada lleva una declaración firmada de exactitud y funciona como prueba.
- Sanidad. Los clínicos dictan notas, informes quirúrgicos y altas que entran en la historia del paciente. Los estándares de exactitud no perdonan, el vocabulario es denso y los plazos de conservación se cuentan en años.
- Investigación. El trabajo cualitativo funciona con entrevistas y grupos focales transcritos. Los investigadores codifican las transcripciones línea a línea para extraer temas, así que la elección de estilo —si sobreviven o no las vacilaciones— moldea los hallazgos.
- Medios. Los periodistas transcriben entrevistas para citar con precisión y defender después la cita. Los podcasters publican transcripciones porque es la única manera de que el contenido hablado se vuelva buscable, y así fue como la transcripción se convirtió calladamente en un activo de SEO.
- Empresa. La categoría más grande y más desordenada: llamadas de ventas, consejos de administración, reuniones generales, grabaciones de cumplimiento. Nadie las lee de principio a fin; existen para buscarse, citarse y minarse en busca de decisiones. Por eso una transcripción de Laxis, por ejemplo, sincroniza su resumen y sus próximos pasos con HubSpot o Salesforce, para que las notas de la llamada aterricen donde vive la oportunidad y no en un documento que nadie abre.
Y luego todos los demás: notas de voz, clases, entrevistas de historia familiar, vídeos de YouTube que preferirías leer a ver. Aquí es donde la transcripción roza el dictado, aunque son actos distintos: dictar es componer texto hablando a propósito, y si es eso lo que quieres, nuestro repaso de las mejores apps de dictado con IA es mejor punto de partida.
Consigue una transcripción limpia y etiquetada de cada reunión
Laxis graba, transcribe y resume Zoom, Google Meet y Microsoft Teams en más de 100 idiomas, con etiquetas de hablante, marcas de tiempo y acciones a realizar incluidas. El plan gratuito cubre 300 minutos de transcripción al mes.
En resumen
Las transcripciones envejecen en dirección contraria a todo lo demás que produces. Un resumen es útil la semana en que lo escribes y no vale nada un año después, porque conservó lo que le importaba a quien lo escribió aquel martes. Una transcripción es casi inútil la semana en que la haces —nadie lee 9.000 palabras de una reunión a la que asistió— y gana valor cada mes que pasa, porque guardó lo que nadie sabía que iba a importar. Por eso los aburridos detalles de formato merecen atención. Nada de esto es para ti. Es para quien tenga que encontrar ahí dentro una sola frase dentro de dieciocho meses.
Preguntas frecuentes
¿Qué es una transcripción?
Una transcripción es un documento de texto que registra lo que se dijo en una grabación de audio o vídeo, en el orden en que se dijo. Identifica a cada hablante y suele llevar marcas de tiempo, de modo que cualquier línea remite a un momento del archivo original.
¿Cómo es una transcripción?
Una transcripción abre con un encabezado breve que da título, fecha, duración y participantes, y luego se desarrolla como una secuencia de turnos de habla. Cada turno empieza con una marca de tiempo y una etiqueta de hablante en mayúsculas. Todo lo que no queda claro aparece entre corchetes, como [inaudible] o [voces superpuestas].
¿Cuáles son los principales tipos de transcripción?
Hay cuatro estilos habituales. El verbatim completo conserva cada sonido, incluidos tartamudeos y muletillas. El verbatim limpio conserva las palabras pero elimina muletillas y tics verbales. El verbatim inteligente además ordena la gramática y quita repeticiones. Una transcripción editada está reescrita para publicarse. Los proveedores etiquetan esto de forma incoherente, así que confirma qué significa en el tuyo.
¿Cuál es la diferencia entre una transcripción y unos subtítulos?
Una transcripción es un documento autónomo que lees por su cuenta, sin necesidad de vídeo. Los subtítulos son líneas cortas de diálogo cortadas en bloques temporizados y mostradas sobre un vídeo, normalmente traducidas para espectadores que oyen el audio pero no hablan el idioma.
¿Una transcripción es lo mismo que un acta de reunión?
No. Una transcripción registra todo lo dicho, palabra por palabra, en secuencia. Un acta es un resumen corto y estructurado de lo que se decidió: asistentes, decisiones, responsables y plazos. Una hora de reunión puede dar una transcripción de 9.000 palabras y un acta de una página, y ambas ser correctas.
¿En qué formato de archivo debería estar una transcripción?
Usa .docx o .pdf cuando una persona vaya a leer, anotar o archivar el documento. Usa .txt o .json cuando lo vaya a procesar un software. Usa .srt o .vtt solo cuando el texto tenga que sincronizarse con el vídeo como subtítulos. Guarda un máster en texto plano y exporta el resto.
¿La palabra transcript significa también un expediente académico?
Sí. En educación, un academic transcript es el registro oficial de las asignaturas que cursó un estudiante y las notas que obtuvo, emitido por la secretaría académica de un colegio o una universidad. Comparte la palabra inglesa con el sentido de audio, y nada más. Solicítalo en la secretaría académica.