Transcripción de llamadas: cómo transcribir una llamada
Pasa la grabación de un webinar por cualquier herramienta de transcripción moderna y el resultado roza la perfección. Pasa por la misma herramienta la llamada de ventas del martes pasado y la mitad de los apellidos están mal, los precios se han desviado y, en algún punto de la conversación, las dos personas parecen ser una sola. Mismo software, mismas voces, resultados radicalmente distintos, y la razón no tiene casi nada que ver con el modelo.
La transcripción de llamadas se trata como un subconjunto de la transcripción corriente. Se parece más a una disciplina aparte. Todo lo que sueles dar por sentado sobre la calidad del audio, la separación de hablantes y el lugar donde vive el archivo cambia en cuanto la conversación viaja por una línea telefónica en vez de entrar en un micrófono. Si buscas la mecánica general de convertir voz en texto, ya explicamos por separado cómo funciona realmente la transcripción. Este artículo trata de lo que las llamadas telefónicas rompen.
Por qué una llamada telefónica es un problema más difícil que una reunión
Empieza por lo que la red desecha. La telefonía tradicional es de banda estrecha: el audio se muestrea a 8 kHz, lo que significa que todo lo que está por encima de unos 3,4 kHz se descarta antes de llegar siquiera a una grabadora. Esa banda no es decorativa. Es donde vive la diferencia entre una s y una f, donde la ch se separa de la s, donde una sibilante conserva el detalle suficiente para distinguir sesenta de setenta. El audio de banda ancha muestreado a 16 kHz la conserva. Una línea telefónica, no.
Los sistemas de reconocimiento de voz modernos se entrenan abrumadoramente con audio de banda ancha, y cuando les das una entrada a 8 kHz, la mayoría la sobremuestrea primero. El sobremuestreo le da al archivo la forma correcta. No devuelve lo que se eliminó. En las frecuencias reconstruidas no hay información, porque nunca la hubo.
Las consecuencias se notan en las cifras, y por eso los benchmarks publicados engañan con tanta constancia. Los estudios controlados que no cambian nada salvo la frecuencia de muestreo encuentran que la banda estrecha, por sí sola, resta precisión. Las llamadas reales suman después la compresión del códec, las redes móviles, las voces superpuestas y el ruido de fondo, y las tasas de error en audio real de centros de contacto se sitúan, según se informa con frecuencia, en varias veces las cifras de las clasificaciones. Los benchmarks de los proveedores casi siempre se hacen con grabaciones limpias de banda ancha, así que trata cualquier cifra de precisión destacada como un techo para el audio telefónico, no como un pronóstico.
La compresión añade su propia capa. El G.711, todavía el códec de batalla de la red telefónica, es de banda estrecha por diseño. G.722, Opus y EVS transportan audio de banda ancha o superior y suenan claramente mejor, pero solo ayudan si todos los tramos de la llamada los admiten. Un solo participante que se conecta desde un móvil arrastra toda la conversación al mínimo común denominador, porque la red tiene que transcodificar a algo que entiendan ambos extremos.
Un diagnóstico que puedes hacer en treinta segundos. Abre una llamada grabada en cualquier editor de audio y cambia a la vista de frecuencias. Si la energía se corta en seco, en una línea plana, alrededor de 3,4 kHz, estás trabajando con audio de banda estrecha y ningún cambio de proveedor de transcripción lo va a arreglar. Lo que sí lo arreglará es cambiar cómo viaja la llamada: un tramo VoIP en vez de uno móvil, unos auriculares en vez del manos libres.
Uno o dos canales, y por qué lo decide todo
Lo segundo que separa el audio de una llamada del de una reunión es cuántas pistas acabas teniendo, y eso importa más de lo que la mayoría de los compradores cree.
Una llamada tiene dos tramos. Si tu grabación los capta por separado (quien llama en el canal izquierdo, el agente en el derecho), la separación de hablantes deja de ser un problema de aprendizaje automático. Es un hecho del archivo. Cada palabra del canal uno pertenece a una persona, cada palabra del canal dos pertenece a la otra, y la transcripción sale bien etiquetada incluso cuando ambos hablan a la vez.
Mezcla esos dos tramos en una sola pista mono y habrás tirado esa certeza. Ahora el software tiene que distinguir a los hablantes solo por la voz, usando el tono, el timbre y los tiempos. Con audio limpio de banda ancha eso funciona razonablemente bien. En una línea telefónica de banda estrecha, donde se han filtrado justo las frecuencias que distinguen una voz de otra, funciona bastante peor, y las conversaciones telefónicas están llenas precisamente de la situación que lo rompe, porque sin señales visuales la gente se interrumpe mucho más que cara a cara.
Las plataformas de centro de contacto llevan años grabando en doble canal por defecto precisamente por esto. Muchas centralitas empresariales y la mayoría de las apps de grabación para consumidores todavía te entregan un único archivo mezclado. Antes de concluir que una herramienta de transcripción funciona mal con tus llamadas, comprueba cuál de los dos le estás dando.
RTC, VoIP y el eslabón más débil de la cadena
Tres vías transportan las llamadas de empresa, y producen tres calidades de grabación distintas.
La RTC (la red telefónica conmutada, PSTN en inglés) y el móvil son la vía heredada: banda estrecha, sin excepción, con el móvil añadiendo encima su propia compresión. Ese es el suelo. La VoIP puede ser mucho mejor, ya que una llamada de softphone a softphone con Opus o G.722 es de banda ancha de verdad, pero eso solo se cumple cuando ambos extremos y cada salto intermedio negocian un códec de banda ancha. Las llamadas mixtas retroceden al nivel inferior. Las plataformas de videoconferencia como Zoom, Google Meet y Microsoft Teams son de banda ancha de extremo a extremo cuando todos se conectan desde una app, y esa es la verdadera razón por la que las transcripciones de reuniones se leen mucho mejor que las de llamadas.
Ese último punto tiene una consecuencia práctica. Una reunión de Teams con seis personas en sus portátiles y una conectada por el número de marcación no produce simplemente un mal hablante: a menudo produce una reunión en la que el participante telefónico se transcribe notablemente peor que todos los demás, y en la que todo lo que diga encima de otra persona probablemente se pierda. Si una parte interesada siempre se une por teléfono, conviene saberlo antes de fiarte del registro.
Cinco formas de transcribir una llamada
Aquí no hay una única respuesta, solo compromisos, y la correcta depende mucho más de dónde tiene que acabar la transcripción que de qué motor es una pizca más preciso este trimestre.
| Vía | Precisión con audio telefónico | Estructura de costes | Dónde acaba la transcripción | Ideal cuando |
|---|---|---|---|---|
| Telefonía nativa o llamadas desde el CRM | Aceptable. Normalmente mono, rara vez ajustada a tu vocabulario | Incluido en la licencia, pero restringido. HubSpot solo transcribe llamadas hechas con una licencia Professional o Enterprise de Sales Hub o Service Hub; Starter incluye 500 minutos de llamadas al mes por cuenta, y las cuentas gratuitas reciben poco o nada | Automáticamente en el registro del contacto o del negocio | Los comerciales ya llaman desde dentro del CRM |
| API de telefonía o CPaaS | El techo más alto. Eliges el motor y puedes pedir doble canal | Por consumo y acumulativo. Twilio, por ejemplo, factura la transcripción por minuto, con la grabación y la propia llamada cobradas como partidas aparte | Donde escribas código para ponerla | Tienes ingenieros y requisitos poco habituales |
| Asistente de reuniones | Sólida en llamadas por app, más débil en tramos por teléfono | Por usuario al mes, a menudo con un cupo gratuito | Su propio espacio de trabajo, más sincronización con el CRM donde se ofrece | La mayoría de las llamadas son en Zoom, Meet o Teams |
| Suite de centro de contacto | La mejor de su clase en telefonía. Doble canal por defecto, ajustada para banda estrecha | Elevado. El nivel de voz de Five9 figura en torno a $159 por usuario simultáneo al mes con un mínimo de 50 puestos; Genesys Cloud CX 4 figura a $240 | La plataforma, con asistencia en vivo al agente durante la llamada | Gestionas volumen de llamadas, no reuniones |
| Servicio humano o híbrido | La más alta con audio realmente malo | El más caro por llamada, y el más lento | Un archivo entregado que tú mismo enrutas | La llamada la leerá un tribunal o un regulador |
Los precios son precios de lista publicados en 2026; los contratos de centro de contacto, en particular, se negocian de forma habitual muy por debajo cuando hay volumen.
La mayoría de los equipos le dan demasiadas vueltas a la columna «Precisión con audio telefónico» y muy pocas a la de «Dónde acaba la transcripción». Una suite de centro de contacto es la respuesta técnicamente correcta para la telefonía y la compra equivocada para una empresa de doce personas que hace cuatro llamadas de descubrimiento a la semana en Google Meet. Para un equipo de ese perfil, la vía del asistente de reuniones suele ganar en coste y en lo que de verdad importa, que es si el resultado llega al CRM. Una herramienta como el asistente de reuniones con IA de Laxis está en ese carril: captura en Zoom, Google Meet y Microsoft Teams, acepta archivos MP3, WAV y M4A subidos desde llamadas grabadas en otro sitio y, en el plan Business, envía resúmenes y tareas pendientes a HubSpot o Salesforce. La advertencia honesta es la misma que se aplica a cualquier herramienta de esa columna: está pensada para reuniones y conversaciones, no para el volumen de llamadas de un centro de contacto, así que si transcribes cuatro mil llamadas al día, compra la plataforma diseñada para eso. Hay un repaso más completo de tomadores de notas con IA si es en esa columna donde estás comprando.
En directo, o cuando todos han colgado
La transcripción en tiempo real y la posterior a la llamada parecen la misma función y no se comportan en absoluto igual.
La transcripción en streaming devuelve el texto uno o dos segundos después de que se pronuncien las palabras, y eso es lo que hace posibles la asistencia en vivo al agente, las alertas de cumplimiento y la traducción en pantalla. El precio es la precisión. Un sistema en streaming tiene que comprometerse con una conjetura antes de haber oído el final de la frase y, aunque revisa las palabras anteriores a medida que llega más audio, nunca se da el lujo de tener el contexto completo. El procesamiento posterior a la llamada sí. Tiene la grabación entera, puede mirar hacia delante y hacia atrás, y en general es más preciso y más barato por minuto.
Lo útil es dejar de tratarlo como una sola elección. La salida en directo es para lo que tiene que pasar durante la llamada. La salida posterior es para el registro, el resumen, la entrada en el CRM y todo lo que alguien vaya a leer después. Muchas plataformas hacen ambas cosas, y no hay razón para que una misma llamada no produzca un flujo en vivo aproximado y una transcripción final limpia.
Dos mejoras baratas que rinden más que cambiar de proveedor. Carga un vocabulario personalizado con los nombres de tus productos, los de tus competidores, los formatos de tus SKU y los apellidos que tus comerciales destrozan: los nombres propios son donde las transcripciones telefónicas fallan de forma más visible, y ningún modelo los adivina sin ayuda. Después, pon a todo el mundo con auriculares. El manos libres en una sala de paredes duras añade eco, y el eco confunde la separación de hablantes más rápido que cualquier acento.
Lo que decide si todo esto valió la pena
Esta es la verdad incómoda sobre el software de transcripción de llamadas: la precisión es lo que todo el mundo evalúa, y el flujo de trabajo es lo que determina si la compra se paga sola.
Una transcripción guardada en una herramienta que nadie abre no tiene ningún valor. Una transcripción vinculada al contacto correcto, en la oportunidad correcta, consultable junto al resto del historial de esa cuenta, cambia cómo se lleva un negocio. La distancia entre esos dos resultados es una cuestión de fontanería, y conviene resolverla antes de comparar motores.
Tres cosas marcan la diferencia. La transcripción tiene que estar vinculada a un registro, no solo almacenada: contacto, empresa y negocio abierto, resueltos automáticamente a partir del número de teléfono o de la invitación del calendario. Tiene que estar reducida a algo legible, porque nadie recorre cuarenta minutos de registro literal buscando la objeción; lo que se usa es un resumen y una lista de compromisos con un nombre al lado de cada uno. Y tiene que llegar sin un paso humano, ya que cualquier flujo que dependa de que un comercial se acuerde de pegar algo dejará de funcionar sin hacer ruido en la tercera semana.
Ese último requisito es donde fallan la mayoría de las configuraciones, y es la razón por la que las llamadas nativas del CRM y los asistentes que se sincronizan con el CRM rinden por encima de lo que dicen sus puntuaciones de precisión. Laxis, por ejemplo, extrae las tareas pendientes con su responsable asignado y, en su plan Business, sincroniza el resultado con HubSpot o Salesforce sin que nadie abra la transcripción; el procesamiento se hace en la nube y no en tu dispositivo, algo que conviene contrastar con tu propia política antes de comprometerte.
Qué esperar y cómo comprobarlo sin gastar mucho
No compres basándote en una cifra de precisión publicada. Toma cinco grabaciones reales (la de la línea mala, la del acento fuerte, aquella en la que el responsable de compras del cliente habla por encima de tu ejecutivo de cuentas) y pásalas por cada herramienta de tu lista corta. Cuenta los errores que de verdad te costarían algo: números equivocados, nombres equivocados, atribución equivocada de quién aceptó qué. Las erratas en las muletillas son ruido.
Ajusta las expectativas en consecuencia. En una llamada VoIP limpia con dos personas con auriculares, los buenos sistemas quedan en el mismo terreno que el audio de reuniones. En una llamada desde el móvil con ruido de carretera y un acento que el modelo apenas ha oído, la transcripción servirá para recordar y no será fiable para citar. Las dos cosas pueden ser ciertas del mismo proveedor el mismo día, y por eso precisamente el proveedor no puede darte una única cifra y decirla en serio.
Hay algo que no es opcional: resuelve bien el consentimiento antes de que nada de esto se ponga en marcha, porque las normas varían según la jurisdicción y las sanciones no son teóricas. Nuestra guía para grabar una llamada telefónica cubre la mecánica práctica y las normas de consentimiento, incluidos los estados de EE. UU. que exigen el acuerdo de todas las partes.
En qué te deja todo esto
El cambio interesante en la transcripción de llamadas no es que los modelos hayan mejorado, aunque lo hayan hecho. Es que el cuello de botella se ha movido. Durante la mayor parte de la última década, lo difícil era acertar con las palabras. Ahora lo difícil es una banda de frecuencias que la red telefónica lleva décadas desechando y una serie de decisiones sobre cómo se captura la grabación: uno o dos canales, app o marcación telefónica, banda ancha o lo que la red haya podido negociar. Esas decisiones las toma quien configura el sistema telefónico, normalmente sin que nadie mencione la transcripción.
Eso convierte esto en una situación poco común en la que la mejora más barata disponible no es una compra. Es una conversación con quien gestione tu telefonía, con dos preguntas: si podemos grabar los dos tramos por separado y si podemos mantener más llamadas en una ruta de banda ancha. Respóndelas y casi cualquier motor competente servirá.
Preguntas frecuentes
¿Qué es la transcripción de llamadas?
La transcripción de llamadas es la conversión de una conversación telefónica o por VoIP en texto consultable, normalmente con cada hablante etiquetado y cada línea con su marca de tiempo. Se diferencia de transcribir un archivo de audio corriente en un aspecto importante: el sonido ha viajado por un canal telefónico comprimido y puede llegar como una única grabación mezclada o como dos tramos separados.
¿Qué precisión tiene la transcripción de llamadas con audio telefónico?
Espera una precisión notablemente menor que las cifras que publican los proveedores, porque estas salen de grabaciones limpias de banda ancha. La banda estrecha resta precisión por sí sola, y las llamadas reales añaden encima compresión, voces superpuestas y ruido, de modo que las tasas de error en audio telefónico pueden ser varias veces superiores a la cifra destacada. La grabación en dos canales y el vocabulario personalizado recuperan buena parte de esa diferencia.
¿Se pueden transcribir llamadas telefónicas automáticamente?
Sí. La mayoría de las centralitas empresariales, los CRM con telefonía nativa y las plataformas de centro de contacto transcriben automáticamente en cuanto se activa la grabación, y las API de telefonía devuelven el texto en directo si desarrollas sobre ellas. La limitación práctica suele ser de licencias más que de tecnología, ya que muchos planes reservan la transcripción a un nivel de licencia de pago o a un cupo mensual de minutos.
¿Cuál es la mejor forma de transcribir llamadas de ventas?
Elige la vía que deja la transcripción en el registro correcto del CRM sin que nadie copie nada. En la práctica, eso significa o bien un marcador con registro nativo en el CRM, o bien un asistente de reuniones que se sincronice con HubSpot o Salesforce para las llamadas en Zoom, Google Meet o Teams. La precisión bruta importa menos que el hecho de que un comercial llegue a abrir el documento.
¿La transcripción de llamadas funciona en tiempo real?
Sí, aunque la transcripción en directo y la posterior a la llamada son en la práctica productos distintos. Los sistemas en streaming devuelven el texto en uno o dos segundos y revisan las palabras anteriores a medida que llega más audio, lo que limita su precisión porque no pueden ver lo que viene después. El procesamiento posterior a la llamada dispone de la grabación completa y suele ser más preciso y más barato.
¿Dónde deberían guardarse las transcripciones de llamadas?
Donde ya trabaja la gente que las necesita, que para los equipos de ingresos significa el CRM, vinculadas al contacto y a la oportunidad abierta en lugar de aparcadas en una herramienta aparte. Los equipos regulados añaden encima plazos de conservación y controles de acceso. Una transcripción que nadie encuentra al escribir un seguimiento ha costado dinero en lugar de ahorrarlo.