Transcription d'appels : comment transcrire un appel
Passez l'enregistrement d'un webinaire dans n'importe quel outil de transcription moderne et le résultat frôle la perfection. Passez-y l'appel commercial de mardi dernier et la moitié des noms de famille sont faux, les prix ont dérivé, et quelque part au milieu les deux interlocuteurs semblent ne plus faire qu'une seule personne. Même logiciel, mêmes voix, résultats sans commune mesure — et la raison n'a presque rien à voir avec le modèle.
On traite la transcription d'appels comme un sous-ensemble de la transcription ordinaire. C'est plutôt une discipline à part. Tout ce que vous avez l'habitude de tenir pour acquis sur la qualité audio, la séparation des locuteurs et l'endroit où se trouve le fichier change dès que la conversation passe par une ligne téléphonique plutôt que par un micro. Si vous cherchez les mécanismes généraux qui transforment la parole en texte, nous avons expliqué comment fonctionne réellement la transcription dans un article dédié. Celui-ci porte sur ce que les appels téléphoniques cassent.
Pourquoi un appel téléphonique est plus difficile à transcrire qu'une réunion
Commencez par ce que le réseau jette. La téléphonie traditionnelle est en bande étroite : l'audio est échantillonné à 8 kHz, ce qui signifie que tout ce qui dépasse environ 3,4 kHz est supprimé avant même d'atteindre un enregistreur. Cette bande n'a rien de décoratif. C'est là que se joue la différence entre un s et un f, là que le ch se distingue du s, là qu'une sifflante porte assez de détails pour distinguer six de dix. L'audio large bande échantillonné à 16 kHz la conserve. Une ligne téléphonique, non.
Les systèmes de reconnaissance vocale modernes sont entraînés en très grande majorité sur de l'audio large bande, et lorsqu'on leur fournit une entrée à 8 kHz, la plupart commencent par la suréchantillonner. Le suréchantillonnage donne au fichier le bon format. Il ne restitue pas ce qui a été supprimé. Les fréquences reconstruites ne contiennent aucune information, parce qu'il n'y en avait aucune au départ.
Les conséquences se lisent dans les chiffres, et c'est pourquoi les benchmarks publiés induisent si régulièrement en erreur. Les études contrôlées qui ne modifient que la fréquence d'échantillonnage montrent que la bande étroite, à elle seule, fait perdre de la précision. Les vrais appels y ajoutent ensuite la compression des codecs, les réseaux mobiles, les voix qui se chevauchent et le bruit de fond, et les taux d'erreur mesurés sur l'audio réel des centres de contact sont couramment rapportés à plusieurs fois ceux des classements. Les benchmarks des éditeurs sont presque toujours réalisés sur des enregistrements large bande propres : considérez donc tout chiffre de précision mis en avant comme un plafond pour l'audio téléphonique, pas comme une prévision.
La compression ajoute sa propre couche. Le G.711, toujours le codec de référence du réseau téléphonique, est en bande étroite par conception. Le G.722, Opus et EVS transportent de l'audio large bande, voire mieux, et sonnent nettement mieux, mais ils ne servent que si chaque branche de l'appel les prend en charge. Un seul participant qui appelle depuis un mobile tire toute la conversation vers le plus petit dénominateur commun, car le réseau doit transcoder vers un format que les deux extrémités comprennent.
Un diagnostic qui prend trente secondes. Ouvrez un appel enregistré dans n'importe quel éditeur audio et passez en vue fréquentielle. Si l'énergie s'arrête net, en ligne plate, autour de 3,4 kHz, vous travaillez avec de l'audio en bande étroite, et changer de fournisseur de transcription n'y changera rien. Changer la façon dont l'appel est acheminé — une branche VoIP plutôt que mobile, un casque plutôt que le haut-parleur — y changera quelque chose.
Un canal ou deux, et pourquoi tout se joue là
La deuxième chose qui distingue l'audio d'un appel de celui d'une réunion, c'est le nombre de pistes dont vous disposez à la fin, et cela compte plus que la plupart des acheteurs ne l'imaginent.
Un appel comporte deux branches. Si votre enregistrement les capte séparément — l'appelant sur le canal gauche, l'agent sur le canal droit —, la séparation des locuteurs n'est plus du tout un problème d'apprentissage automatique. C'est une donnée du fichier. Chaque mot du canal un appartient à une personne, chaque mot du canal deux à l'autre, et la transcription sort correctement étiquetée même quand les deux parlent en même temps.
Mélangez ces deux branches en une seule piste mono et vous avez jeté cette certitude. Le logiciel doit alors distinguer les locuteurs à la seule voix, d'après la hauteur, le timbre et le rythme. Sur un audio large bande propre, cela fonctionne raisonnablement bien. Sur une ligne téléphonique en bande étroite, où les fréquences mêmes qui distinguent une voix d'une autre ont été filtrées, cela fonctionne nettement moins bien — et les conversations téléphoniques regorgent justement de la situation qui fait tout dérailler, car sans indices visuels on se coupe la parole bien plus souvent qu'en face à face.
Les plateformes de centre de contact enregistrent en double canal par défaut depuis des années, précisément pour cette raison. Beaucoup de systèmes téléphoniques d'entreprise et la plupart des applications d'enregistrement grand public vous livrent encore un seul fichier mixé. Avant de conclure qu'un outil de transcription gère mal vos appels, vérifiez lequel des deux vous lui donnez.
RTC, VoIP et le maillon le plus faible de la chaîne
Trois voies acheminent les appels professionnels, et elles produisent trois niveaux de qualité d'enregistrement.
Le RTC (réseau téléphonique commuté, PSTN en anglais) et le mobile constituent la voie historique : bande étroite, invariablement, le mobile ajoutant sa propre compression par-dessus. C'est le plancher. La VoIP peut faire bien mieux, puisqu'un appel de softphone à softphone en Opus ou en G.722 est réellement large bande, mais seulement si les deux terminaux et chaque saut intermédiaire négocient un codec large bande. Les appels mixtes se replient sur le moins bon. Les plateformes de visioconférence comme Zoom, Google Meet et Microsoft Teams sont large bande de bout en bout quand tout le monde se connecte depuis une application, et c'est la vraie raison pour laquelle les transcriptions de réunions se lisent tellement mieux que celles des appels.
Ce dernier point a une portée pratique. Une réunion Teams avec six personnes sur leur ordinateur portable et une personne connectée par le numéro d'appel ne produit pas simplement un mauvais locuteur : elle produit souvent une réunion où le participant au téléphone est transcrit nettement moins bien que tous les autres, et où tout ce qu'il dit en même temps que quelqu'un d'autre risque d'être perdu. Si une partie prenante se connecte toujours par téléphone, mieux vaut le savoir avant de se fier au compte rendu.
Cinq façons de faire transcrire un appel
Il n'y a pas de réponse unique ici, seulement des arbitrages, et le bon choix dépend bien plus de l'endroit où la transcription doit aboutir que du moteur qui sera, ce trimestre, légèrement plus précis.
| Voie | Précision sur l'audio téléphonique | Structure de coût | Où atterrit la transcription | Idéal quand |
|---|---|---|---|---|
| Téléphonie native ou appels depuis le CRM | Correcte. Généralement mono, rarement adaptée à votre vocabulaire | Inclus dans la licence, mais conditionné. HubSpot ne transcrit que les appels passés depuis une licence Professional ou Enterprise de Sales Hub ou Service Hub ; Starter inclut 500 minutes d'appel par mois et par compte, et les comptes gratuits n'ont que peu ou rien | Automatiquement sur la fiche du contact ou de la transaction | Les commerciaux appellent déjà depuis le CRM |
| API de téléphonie ou CPaaS | Plafond le plus élevé. Vous choisissez le moteur et pouvez demander le double canal | Au compteur et cumulatif. Twilio, par exemple, facture la transcription à la minute, l'enregistrement et l'appel lui-même étant facturés sur des lignes distinctes | Là où votre code la dépose | Vous avez des ingénieurs et des besoins atypiques |
| Assistant de réunion | Solide sur les appels via application, plus faible sur les branches rejointes par téléphone | Par utilisateur et par mois, souvent avec un quota gratuit | Son propre espace de travail, plus la synchro CRM quand elle existe | La plupart des appels se font sur Zoom, Meet ou Teams |
| Suite de centre de contact | La meilleure de sa catégorie en téléphonie. Double canal par défaut, optimisée pour la bande étroite | Lourd. Le niveau voix de Five9 est affiché autour de $159 par utilisateur simultané et par mois, avec un minimum de 50 postes ; Genesys Cloud CX 4 est affiché à $240 | La plateforme, avec assistance en direct à l'agent pendant l'appel | Vous gérez du volume d'appels, pas des réunions |
| Service humain ou hybride | La plus élevée sur un audio vraiment mauvais | Le plus cher par appel, et le plus lent | Un fichier livré que vous acheminez vous-même | L'appel sera lu par un tribunal ou un régulateur |
Les prix sont les prix catalogue publiés en 2026 ; les contrats de centre de contact, en particulier, se négocient couramment bien en dessous en cas de volume.
La plupart des équipes réfléchissent trop à la colonne « Précision sur l'audio téléphonique » et pas assez à la colonne « Où atterrit la transcription ». Une suite de centre de contact est la bonne réponse technique pour la téléphonie, et le mauvais achat pour une entreprise de douze personnes qui tient quatre appels de découverte par semaine sur Google Meet. Pour une équipe de ce type, la voie de l'assistant de réunion l'emporte généralement sur le coût et sur ce qui compte vraiment : savoir si le résultat arrive dans le CRM. Un outil comme l'assistant de réunion IA Laxis se situe dans ce couloir : il capture sur Zoom, Google Meet et Microsoft Teams, accepte les fichiers MP3, WAV et M4A téléversés depuis des appels enregistrés ailleurs et, sur le forfait Business, envoie résumés et actions à mener dans HubSpot ou Salesforce. La réserve honnête est la même que pour tous les outils de cette colonne : il est conçu autour des réunions et des conversations, pas du volume d'appels d'un centre de contact, donc si vous transcrivez quatre mille appels par jour, achetez la plateforme faite pour cela. Il existe un comparatif plus complet des preneurs de notes IA si c'est dans cette colonne que vous faites vos achats.
En direct, ou une fois que tout le monde a raccroché
La transcription en temps réel et la transcription après l'appel ressemblent à la même fonctionnalité et ne se comportent pas du tout de la même façon.
La transcription en streaming renvoie le texte une ou deux secondes après que les mots ont été prononcés, ce qui rend possibles l'assistance en direct aux agents, les alertes de conformité et la traduction à l'écran. Le prix à payer, c'est la précision. Un système en streaming doit s'engager sur une hypothèse avant d'avoir entendu la fin de la phrase, et même s'il révise les mots précédents à mesure que l'audio arrive, il n'a jamais le luxe du contexte complet. Le traitement après l'appel, si. Il dispose de l'enregistrement entier, peut regarder en avant comme en arrière, et se révèle en général à la fois plus précis et moins cher à la minute.
La bonne approche consiste à cesser d'en faire un choix unique. La sortie en direct sert à ce qui doit se passer pendant l'appel. La sortie après l'appel sert au compte rendu, au résumé, à l'entrée dans le CRM et à tout ce que quelqu'un lira plus tard. Beaucoup de plateformes font les deux, et rien n'empêche un même appel de produire un flux en direct approximatif et une transcription finale propre.
Deux améliorations bon marché qui valent mieux qu'un changement de fournisseur. Chargez un vocabulaire personnalisé avec les noms de vos produits, ceux de vos concurrents, vos formats de références (SKU) et les noms de famille que vos commerciaux écorchent : les noms propres sont l'endroit où les transcriptions d'appels échouent le plus visiblement, et aucun modèle ne les devine sans aide. Ensuite, équipez tout le monde d'un casque. Le haut-parleur dans une pièce aux murs durs ajoute de l'écho, et l'écho perturbe la séparation des locuteurs plus vite que n'importe quel accent.
Ce qui décide si tout cela en valait la peine
Voici la vérité inconfortable sur les logiciels de transcription d'appels : la précision est ce que tout le monde évalue, et le flux de travail est ce qui détermine si l'achat est rentabilisé.
Une transcription qui dort dans un outil que personne n'ouvre ne vaut rien. Une transcription rattachée au bon contact, sur la bonne opportunité, consultable à côté du reste de l'historique du compte, change la façon dont une affaire est menée. L'écart entre ces deux issues est une question de tuyauterie, et mieux vaut y répondre avant de comparer les moteurs.
Trois choses font la différence. La transcription doit être rattachée à une fiche, pas simplement stockée — contact, entreprise et affaire en cours, identifiés automatiquement à partir du numéro de téléphone ou de l'invitation d'agenda. Elle doit être réduite à quelque chose de lisible, car personne ne fait défiler quarante minutes de verbatim pour retrouver l'objection ; ce qui sert, c'est un résumé et une liste d'engagements avec un nom en face de chacun. Et elle doit arriver sans intervention humaine, puisque tout processus qui repose sur un commercial qui pense à coller quelque chose cessera discrètement de fonctionner dès la troisième semaine.
C'est sur cette dernière exigence que la plupart des configurations échouent, et c'est la raison pour laquelle les appels natifs depuis le CRM et les assistants synchronisés avec le CRM font mieux que leurs scores de précision ne le laissent penser. Laxis, par exemple, extrait les actions à mener avec leur responsable et, sur son forfait Business, synchronise le résultat dans HubSpot ou Salesforce sans que personne n'ouvre la transcription ; le traitement s'effectue dans le cloud et non sur votre appareil, ce qu'il vaut la peine de confronter à votre propre politique avant de vous engager.
À quoi s'attendre, et comment le vérifier à moindre coût
N'achetez pas sur la foi d'un chiffre de précision publié. Prenez cinq enregistrements réels — la mauvaise ligne, l'accent prononcé, celui où le responsable des achats du client parle par-dessus votre commercial — et passez-les dans chaque outil présélectionné. Comptez les erreurs qui vous coûteraient vraiment quelque chose : mauvais chiffres, mauvais noms, mauvaise attribution de qui a accepté quoi. Les coquilles dans les mots de remplissage, c'est du bruit.
Ajustez vos attentes en conséquence. Sur un appel VoIP propre, avec deux personnes équipées de casques, les bons systèmes atteignent le même niveau que sur l'audio de réunion. Sur un appel mobile avec du bruit de circulation et un accent que le modèle a peu entendu, la transcription sera utilisable pour se remémorer l'échange et peu fiable pour citer. Les deux peuvent être vrais du même éditeur le même jour, et c'est exactement pour cela que l'éditeur ne peut pas vous donner un chiffre unique en le pensant vraiment.
Un point n'est pas facultatif : réglez la question du consentement avant que quoi que ce soit ne tourne, car les règles varient selon les juridictions et les sanctions n'ont rien de théorique. Notre guide pour enregistrer un appel téléphonique couvre les aspects pratiques et les règles de consentement, y compris les États américains qui exigent l'accord de toutes les parties.
Ce qu'il faut en retenir
Le changement intéressant dans la transcription d'appels n'est pas que les modèles se sont améliorés, même si c'est le cas. C'est que le goulot d'étranglement s'est déplacé. Pendant la majeure partie de la dernière décennie, la difficulté consistait à obtenir les bons mots. Aujourd'hui, la difficulté tient à une bande de fréquences que le réseau téléphonique jette depuis des décennies et à une série de décisions sur la façon dont l'enregistrement est capté — un canal ou deux, application ou numéro d'appel, large bande ou ce que le réseau a bien voulu négocier. Ces choix sont faits par la personne qui configure le système téléphonique, généralement sans que personne ne parle de transcription.
C'est donc l'une des rares situations où l'amélioration la moins chère disponible n'est pas un achat. C'est une conversation avec la personne responsable de votre téléphonie, autour de deux questions : pouvons-nous enregistrer les deux branches séparément, et pouvons-nous faire passer davantage d'appels par une voie large bande. Répondez-y, et presque n'importe quel moteur compétent fera l'affaire.
Questions fréquentes
Qu'est-ce que la transcription d'appels ?
La transcription d'appels consiste à convertir une conversation téléphonique ou VoIP en texte consultable, généralement avec chaque locuteur identifié et chaque ligne horodatée. Elle diffère de la transcription d'un fichier audio ordinaire sur un point important : le son a transité par un canal téléphonique compressé, et il peut arriver sous forme d'un seul enregistrement mixé ou de deux branches séparées.
Quelle est la précision de la transcription d'appels sur l'audio téléphonique ?
Attendez-vous à une précision nettement inférieure aux chiffres publiés par les éditeurs, car ceux-ci proviennent d'enregistrements large bande propres. La bande étroite fait perdre de la précision à elle seule, et les vrais appels y ajoutent la compression, les voix qui se chevauchent et le bruit, si bien que les taux d'erreur sur l'audio téléphonique peuvent être plusieurs fois supérieurs au chiffre mis en avant. L'enregistrement sur deux canaux et un vocabulaire personnalisé permettent d'en récupérer une bonne partie.
Peut-on transcrire automatiquement les appels téléphoniques ?
Oui. La plupart des systèmes téléphoniques d'entreprise, des CRM dotés de la téléphonie native et des plateformes de centre de contact transcrivent automatiquement dès que l'enregistrement est activé, et les API de téléphonie renvoient le texte en direct si vous développez dessus. La contrainte pratique est généralement la licence plutôt que la technologie, car de nombreuses offres réservent la transcription à un niveau de licence payant ou à un quota mensuel de minutes.
Quelle est la meilleure façon de transcrire les appels commerciaux ?
Choisissez la voie qui dépose la transcription sur la bonne fiche CRM sans que personne ne copie quoi que ce soit. En pratique, cela signifie soit un composeur avec journalisation native dans le CRM, soit un assistant de réunion synchronisé avec HubSpot ou Salesforce pour les appels tenus sur Zoom, Google Meet ou Teams. La précision brute compte moins que le fait qu'un commercial ouvre un jour le document.
La transcription d'appels fonctionne-t-elle en temps réel ?
Oui, même si la transcription en direct et la transcription après l'appel sont en pratique deux produits différents. Les systèmes en streaming renvoient le texte en une ou deux secondes et révisent les mots précédents à mesure que l'audio arrive, ce qui plafonne leur précision puisqu'ils ne peuvent pas voir la suite. Le traitement après l'appel dispose de l'enregistrement complet et se révèle généralement à la fois plus précis et moins cher.
Où stocker les transcriptions d'appels ?
Là où les personnes qui en ont besoin travaillent déjà, c'est-à-dire, pour les équipes commerciales, dans le CRM, rattachées au contact et à l'opportunité en cours plutôt que parquées dans un outil à part. Les équipes soumises à une réglementation y ajoutent des durées de conservation et des contrôles d'accès. Une transcription que personne ne trouve au moment de rédiger un suivi a coûté de l'argent au lieu d'en faire économiser.