Transcription audio : transformer un enregistrement de réunion en texte
Qu'est-ce que la transcription audio
La transcription audio consiste à convertir une parole enregistrée en texte écrit, soit en passant un fichier audio dans un modèle de reconnaissance vocale, soit en demandant à une personne de l'écouter et de la taper. Si vous lisez ceci, vous avez sans doute déjà le fichier : l'appel client d'hier, un mémo vocal, une interview, l'export d'un webinaire qui dort dans votre dossier de téléchargements. Il vous faut maintenant les mots.
C'est un autre problème que celui de bien enregistrer une réunion. L'enregistrement a déjà eu lieu, bon ou mauvais, et vous ne pouvez pas revenir en arrière pour déplacer le micro. Ce que vous maîtrisez encore, c'est le fichier que vous donnez à l'outil, la façon de gérer plusieurs voix, le niveau de précision dont vous avez besoin et le temps que vous consacrerez au nettoyage. Ces quatre décisions font la différence entre un texte qu'un collègue lira et un mur de mots que personne n'ouvrira.
Une transcription n'est ni un compte rendu ni un résumé : c'est l'enregistrement complet de ce qui a été dit, prise de parole après prise de parole. Pour en voir l'anatomie, voici ce que contient réellement une transcription.
Les fichiers audio qui se transcrivent bien, et ceux qui échouent en silence
On confond souvent deux choses : le conteneur, c'est-à-dire l'extension de fichier que vous voyez, et le codec, c'est-à-dire la manière dont l'audio est encodé à l'intérieur. La plupart des outils se soucient des deux et ne vous parlent que du premier.
| Type de fichier | Généralement accepté | Points de vigilance |
|---|---|---|
.wav | Oui | Non compressé, l'entrée la plus sûre. Fichiers volumineux : une longue réunion peut dépasser une limite d'import. |
.mp3 | Oui | Correct à partir d'un débit moyen. À très bas débit, les consonnes bavent. |
.m4a / .aac | Oui | Le format par défaut des Mémos vocaux de l'iPhone et de la plupart des enregistreurs Android. Bonne qualité. |
.flac | En général | Sans perte et compact, mais certains outils anciens ne le décodent pas. |
.ogg / .opus | En général | Exports WhatsApp et Discord. Opus tient bien à bas débit. |
.mp4 / .mov | En général | Conteneurs vidéo. La plupart des outils extraient la piste audio ; vérifiez avant d'importer des gigaoctets. |
| Audio protégé par DRM | Non | Les fichiers sous gestion des droits ne peuvent pas être décodés. Procurez-vous une copie non protégée ou réenregistrez. |
| Audio téléphonique ou de messagerie vocale à 8 kHz | Oui, mais | Se transcrit, avec une précision nettement moindre. Voir plus bas. |
La fréquence d'échantillonnage compte plus qu'on ne le pense. Les modèles vocaux sont conçus autour d'un audio à 16 kHz ; la documentation de Whisper d'OpenAI prévoit de rééchantillonner l'entrée en 16 kHz mono. Un enregistrement à 44,1 kHz se sous-échantillonne sans problème. Un enregistrement à 8 kHz ne peut pas être suréchantillonné pour retrouver des détails qui n'ont jamais été captés. C'est le vrai problème de l'audio téléphonique : la norme de téléphonie ITU-T G.711 limite la bande passante à environ 300 à 3 400 Hz, ce qui supprime l'énergie des hautes fréquences qui distingue un « s » d'un « f » ou d'un « th ». L'oreille humaine comble le manque grâce au contexte ; les modèles devinent, et ils se trompent d'abord sur les noms et les chiffres.
Le débit binaire est l'autre levier. Un mp3 fortement compressé jette les détails fins dont un modèle de reconnaissance a besoin. Exportez dans la meilleure qualité proposée par la source et ne recompressez pas. Le mono suffit, et vaut souvent mieux qu'un fichier stéréo dont un canal est presque muet.
L'origine du fichier compte aussi. Les enregistrements dans le cloud arrivent généralement sous forme d'un mp4 accompagné d'un fichier audio seul, et c'est ce dernier qu'il vaut mieux importer. Certaines plateformes proposent aussi une piste par participant, ce qui est de loin la meilleure chose à faire pour l'attribution des locuteurs. Les transcriptions natives des plateformes ont leurs propres particularités, et récupérer une transcription depuis Zoom ne fonctionne pas comme l'import du fichier brut.
L'audio à plusieurs voix et ce que les étiquettes de locuteur savent vraiment faire
La diarisation est l'étape qui découpe un flux audio en « qui a parlé quand », puis étiquette les prises de parole Speaker 1, Speaker 2, et ainsi de suite. Elle tourne séparément de la reconnaissance qui produit les mots, ce qui explique qu'une transcription puisse avoir un texte exact et des étiquettes complètement fausses en même temps.
Elle fonctionne bien quand les voix sont distinctes, que les gens parlent à tour de rôle et que chacun est proche d'un micro. Elle fonctionne au mieux quand chaque locuteur a son propre canal, car l'attribution n'est alors plus du tout une déduction. Voici où elle déraille :
- Les chevauchements. Quand deux personnes parlent en même temps, le modèle doit quand même attribuer ce passage à une seule étiquette. Certains outils éliminent purement et simplement la voix la plus faible.
- Un seul micro omnidirectionnel dans une grande salle. La réverbération sur les murs durs fait arriver la même voix plusieurs fois au micro, avec un léger décalage. Cela brouille la signature acoustique sur laquelle repose la diarisation, et les personnes les plus éloignées du micro finissent fusionnées.
- Les interjections brèves. « Oui », « d'accord » et « mm-hm » sont trop courts pour être caractérisés ; ils sont absorbés par la personne qui parlait autour.
- Les voix proches. Deux personnes à la hauteur de voix similaire et au même accent sont régulièrement réunies sous une seule étiquette.
- La dérive du nombre de locuteurs. La plupart des outils estiment le nombre de personnes présentes. S'ils sous-estiment, deux collègues partagent une étiquette ; s'ils surestiment, une personne qui s'est déplacée devient Speaker 3 et Speaker 5.
Ajustez vos attentes en conséquence. Sur un enregistrement propre de trois ou quatre personnes, les changements de locuteur tombent à peu près au bon endroit et vous passerez quelques minutes à associer Speaker 1 à un nom. Sur un enregistrement de huit personnes en haut-parleur, considérez les étiquettes comme une indication et vérifiez dans l'audio les moments qui comptent : qui s'est engagé sur la date, qui a soulevé l'objection.
Précision : ce que les chiffres veulent vraiment dire
Le taux d'erreur sur les mots (WER) est la mesure de référence, et le comprendre change la façon dont vous lisez toutes les promesses de précision des éditeurs. Le WER compte trois types d'erreurs par rapport à une transcription de référence, les substitutions, les suppressions et les insertions, puis divise le total par le nombre de mots de la référence. C'est la métrique que le NIST a utilisée dans ses campagnes d'évaluation de la reconnaissance vocale, et c'est ce que « précis à 95 % » signifie normalement : un taux d'erreur de 5 %.
Le problème, c'est que le WER traite toutes les erreurs de la même manière. Un « um » oublié et un « not » oublié comptent chacun pour une suppression, mais seul le second inverse le sens d'une phrase. Les erreurs qui vous coûtent du temps se concentrent sur les mots qui comptent le plus : noms, chiffres, termes produit, négations.
Reste à savoir d'où vient le chiffre. Les taux de précision publiés sont mesurés sur des corpus de référence qui ne ressemblent en rien à votre salle de réunion. LibriSpeech, c'est de la lecture de livres audio : une seule personne, un texte écrit, une pièce calme, un micro proche. Switchboard, ce sont des conversations téléphoniques entre inconnus. Un chiffre de précision mis en avant est presque toujours obtenu sur de la parole lue et propre, et le point d'équipe du mardi de personne ne ressemble à un livre audio.
Ce qui dégrade réellement la précision, à peu près par ordre de dégâts :
- La parole qui se chevauche, le cas le plus difficile du domaine.
- La réverbération et la distance au micro, qui pèsent plus que la plupart des gens ne l'imaginent.
- L'audio à bas débit ou à bande étroite, pour les raisons d'échantillonnage vues plus haut.
- Les accents et dialectes sous-représentés dans les données d'entraînement d'un modèle. C'est une limite bien documentée des systèmes vocaux, pas une marge d'erreur.
- Le jargon métier, les noms de produits, les sigles et les noms de famille : des mots à forte valeur qui apparaissent rarement dans les données d'entraînement.
- Le bruit de fond et les changements de langue en cours de phrase, que les modèles gèrent mal s'ils n'ont pas été conçus pour.
Avant de lancer un fichier de deux heures, coupez les trois premières minutes et transcrivez seulement cet extrait. Puis lisez-le. Si trois minutes demandent de lourdes corrections, les 117 restantes en demanderont proportionnellement davantage, et c'est le moment de choisir entre un passage machine accompagné de votre propre temps de correction et le recours pur et simple à une personne.
Le nettoyage dont toute transcription brute a besoin
La sortie brute de n'importe quel outil de transcription est un amas de données, pas un document. La rendre lisible pour un collègue demande un passage délibéré, et il va plus vite dans cet ordre.
- Associez d'abord les étiquettes de locuteur à de vrais noms. Toutes les étapes suivantes deviennent plus simples dès qu'on voit qui parle, et un rechercher-remplacer global sur « Speaker 2 » ne coûte rien.
- Corrigez les noms propres. C'est l'erreur la plus prévisible de la transcription : le nom de votre entreprise, vos noms de produits, le sigle que votre équipe prononce quarante fois par jour, le nom de famille de la personne en ligne. Les moteurs se trompent de façon constante, en déformant un terme donné toujours de la même manière, si bien qu'un rechercher-remplacer par terme suffit généralement à tout corriger. Mieux encore, prévenez le problème : un vocabulaire personnalisé permet d'enregistrer des termes avant la transcription, et c'est à cela que sert le dictionnaire personnel (Personal Dictionary) de l'assistant de réunion Laxis.
- Choisissez entre verbatim et version épurée, puis tenez-vous-y. Le verbatim conserve chaque hésitation, faux départ et répétition, ce qu'il faut pour la recherche ou un compte rendu contesté. La version épurée les supprime, ce qu'exige tout texte destiné à être lu. Ne nettoyez pas trop, cependant : les précautions de langage font partie du contenu. « Je pense qu'on peut probablement le faire d'ici vendredi » n'est pas le même engagement que « on le fera d'ici vendredi ».
- Faites des paragraphes et ponctuez. Coupez aux changements de sujet, pas à chaque changement de locuteur, sinon un échange rapide se transforme en quarante paragraphes d'une ligne.
- Ajoutez des horodatages aux changements de section pour que chacun puisse revenir dans l'audio.
- Extrayez les décisions et les actions, avec leurs responsables. C'est la partie que les gens utilisent vraiment.
Si vous voulez la méthode plutôt que la théorie, nous avons détaillé tout le processus pour transcrire un audio en texte étape par étape.
L'audio en plusieurs langues
Si votre enregistrement n'est pas en anglais, ou pas seulement en anglais, deux questions décident de tout : l'outil détecte-t-il la langue tout seul, et prend-il vraiment cette langue en charge ? La couverture varie énormément, et le fait qu'une langue figure dans une liste ne signifie pas qu'elle se transcrit aussi bien que l'anglais, car les données d'entraînement sont inégalement réparties.
Laxis prend en charge plus de 100 langues avec détection automatique de la langue, et en réunion en direct il affiche la traduction à côté de l'original pendant que les gens parlent, l'offre Business basculant automatiquement entre jusqu'à cinq langues dans une même réunion. Pour un fichier que vous avez déjà, procédez dans le bon ordre : d'abord une transcription juste, ensuite la traduction. Traduire une transcription truffée d'erreurs de reconnaissance donne une traduction dont personne ne peut retracer les erreurs jusqu'à la source.
Combien de temps cela prend et combien cela coûte
La transcription automatique se termine en une fraction de la durée de l'enregistrement, généralement quelques minutes pour une heure d'audio, parfois plus s'il y a une file d'attente. La transcription humaine fonctionne à l'inverse : un transcripteur travaille plus lentement que le temps réel, s'arrête, revient en arrière, vérifie l'orthographe, ce qui explique des délais annoncés en heures ou en jours et une facturation à la minute d'audio. L'urgence coûte plus cher. Demandez la grille tarifaire du prestataire concerné plutôt que de vous fier à un chiffre général, car les prix varient fortement selon le délai, la qualité audio et le nombre de locuteurs.
Avec un logiciel, la contrainte que l'on rencontre n'est généralement pas le prix mais la durée maximale par enregistrement, distincte du quota mensuel de minutes. Voici comment cela fonctionne chez Laxis, qui accepte les fichiers audio importés en plus de l'enregistrement des réunions en direct :
| Offre | Prix | Ce qui est inclus |
|---|---|---|
| Free | 0 $ | 300 minutes de transcription par mois, 45 minutes par enregistrement |
| Premium | 15,99 $ par utilisateur et par mois, ou 9,99 $ en annuel | 2 000 minutes de transcription par mois, enregistrements jusqu'à 2 heures |
| Business | 29,99 $ par utilisateur et par mois, ou 19,99 $ en annuel | Minutes de transcription illimitées, enregistrements jusqu'à 4 heures, plus la synchronisation HubSpot et Salesforce |
C'est la limite par enregistrement qui piège les gens. Une réunion plénière de trois heures ne tient ni dans Free ni dans Premium : il faut alors découper le fichier ou passer à l'offre supérieure. Et la synchronisation CRM se trouve sur Business, pas sur Premium, ce qui compte si vous transcrivez des appels pour les faire entrer dans un pipeline. Laxis fonctionne sur ordinateur et sur mobile, se connecte à Zoom, Google Meet et Microsoft Teams, et propose une capture sans bot quand vous préférez qu'aucun participant visible ne rejoigne la réunion.
Si vous comparez des outils plutôt que de régler un problème de fichier précis, notre comparatif 2026 des outils de prise de notes IA met la catégorie côte à côte.
Quand payer plutôt un humain
Le logiciel est le bon choix par défaut pour la plupart des fichiers audio. Il y a des cas où ce n'est pas vrai, et le dire franchement coûte moins cher que de le découvrir à ses dépens.
Documents juridiques et officiels. Dépositions, procédures judiciaires, déclarations réglementaires et tout ce qui pourrait être produit comme preuve exigent en général une transcription certifiée par un transcripteur qualifié qui en atteste l'exactitude. La sortie d'une machine n'est pas un document certifié, aussi précise soit-elle.
Mauvais audio et enjeux élevés. Si l'enregistrement provient d'un seul micro éloigné dans une salle réverbérante, avec beaucoup de chevauchements, et que le contenu compte vraiment, vos heures de correction coûteront plus cher qu'un transcripteur. Estimez honnêtement le nettoyage avant de choisir.
Un accent marqué quand le résultat compte. La qualité de la reconnaissance est inégale selon les accents et les dialectes. Si le modèle gère mal l'accent du locuteur et que la transcription sera citée, servira de référence ou sera montrée au locuteur, faites appel à une personne.
La transcription verbatim pour la recherche. En recherche qualitative, en linguistique et dans certains travaux cliniques, les hésitations, les chevauchements et les autocorrections sont les données, pas du bruit. Les conventions du verbatim sont précises et les machines ne les appliquent pas.
L'audio réglementé. Vérifiez la conformité avant l'import, pas après. Laxis n'est pas conforme à la HIPAA et ne signe pas de BAA : les informations de santé protégées ne doivent donc pas passer par lui. Les autres outils prennent des engagements différents ; le seul moyen fiable de le savoir est de demander par écrit à l'éditeur.
Il existe une option intermédiaire que l'on oublie : faire d'abord un passage machine, puis payer une personne pour corriger ce brouillon plutôt que pour tout transcrire. Beaucoup de services le proposent, et cela coûte moins cher qu'une transcription entièrement humaine.
Commencez par le fichier que vous avez déjà
Si l'enregistrement est sur votre bureau en ce moment, importez-le, lisez les premières minutes et voyez à quoi vous avez affaire avant de décider de l'effort que mérite le reste. L'offre gratuite de Laxis vous donne 300 minutes de transcription par mois avec une limite de 45 minutes par enregistrement, de quoi tester votre pire enregistrement plutôt qu'un fichier de démonstration soigné, sans compte à rebours d'essai pendant que vous le faites. Essayez-le avec l'assistant de réunion Laxis et jugez-le sur votre audio, pas sur le nôtre.
Questions fréquentes
Qu'est-ce que la transcription audio ?
La transcription audio est la conversion d'une parole enregistrée en texte écrit, réalisée soit par un logiciel de reconnaissance vocale, soit par un transcripteur humain. L'entrée est un fichier audio comme un mp3, un m4a ou un wav ; la sortie est du texte, généralement avec des étiquettes de locuteur et des horodatages. Ce n'est pas un résumé.
Quels formats de fichier audio puis-je transcrire ?
Les mp3, m4a, aac et wav fonctionnent de manière fiable avec pratiquement tous les outils de transcription, et les flac, ogg et opus en général aussi. Les conteneurs vidéo comme mp4 et mov passent normalement, car l'outil en extrait la piste audio, mais vérifiez-le avant d'importer un très gros fichier. L'audio protégé par DRM ne peut pas du tout être transcrit.
Quelle est la précision de la transcription audio automatique ?
La précision dépend bien plus de votre enregistrement que de l'outil choisi. Les chiffres mis en avant, comme « précis à 99 % », sont mesurés sur des corpus de parole lue, propre et à une seule voix, pas dans des salles de réunion. Attendez-vous à de moins bons résultats avec des voix qui se chevauchent, un micro éloigné, une salle réverbérante, des accents peu courants ou beaucoup de jargon. Testez d'abord trois minutes de votre propre audio.
Un logiciel de transcription sait-il distinguer les locuteurs ?
Oui, grâce à la diarisation, qui segmente l'audio selon la personne qui parle et étiquette les prises de parole Speaker 1, Speaker 2, et ainsi de suite. Elle est fiable quand les voix sont distinctes et que les gens parlent à tour de rôle, et peu fiable avec des chevauchements, des voix proches ou un seul micro omnidirectionnel dans une grande salle. Il vous restera à associer les étiquettes à de vrais noms.
Puis-je transcrire un fichier audio déjà enregistré ?
Oui. Laxis accepte les fichiers audio importés : un enregistrement fait sur votre téléphone, sur une plateforme de visioconférence ou avec un enregistreur dédié peut être transcrit sans aucune réunion en direct. L'offre gratuite couvre 300 minutes de transcription par mois avec une limite de 45 minutes par enregistrement ; Premium porte cette limite à deux heures et Business à quatre.
Quand faut-il faire appel à une transcription humaine plutôt qu'à un logiciel ?
Faites appel à un humain pour les documents juridiques et officiels qui doivent être certifiés, pour la transcription verbatim de recherche où hésitations et chevauchements sont les données, et quand un mauvais audio et de forts enjeux feraient coûter votre temps de correction plus cher qu'un transcripteur. Une solution intermédiaire pratique consiste à faire un passage machine, puis à confier la correction de ce brouillon à une personne.