Zurück zu den Einblicken
Best Practice•2026-10-07•9 min Lesezeit

Anruftranskription: So transkribieren Sie Telefonate

Anruftranskription: So transkribieren Sie Telefonate
TL
Team Laxis
Laxis-Team @ Laxis

Schicken Sie eine Webinar-Aufzeichnung durch ein beliebiges modernes Transkriptionstool, und das Ergebnis ist nahezu fehlerfrei. Schicken Sie das Vertriebsgespräch vom vergangenen Dienstag durch dasselbe Tool, und die Hälfte der Nachnamen stimmt nicht, die Preise sind verrutscht, und irgendwo in der Mitte sind beide Gesprächspartner offenbar zu einer Person verschmolzen. Dieselbe Software, dieselben Sprecher, völlig unterschiedliche Ergebnisse – und der Grund hat fast nichts mit dem Modell zu tun.

Anruftranskription wird wie ein Teilbereich der gewöhnlichen Transkription behandelt. Sie ist eher eine eigene Disziplin. Alles, was Sie über Audioqualität, Sprechertrennung und den Ablageort der Datei stillschweigend voraussetzen, ändert sich in dem Moment, in dem das Gespräch über eine Telefonleitung läuft statt in ein Mikrofon. Wenn Sie die allgemeine Mechanik suchen, wie aus Sprache Text wird, haben wir in einem eigenen Beitrag erklärt, wie Transkription tatsächlich funktioniert. Hier geht es um den Teil, den Telefonate kaputt machen.

Warum ein Telefonat schwieriger ist als ein Meeting

Fangen Sie bei dem an, was das Netz wegwirft. Klassische Telefonie ist schmalbandig: Das Audio wird mit 8 kHz abgetastet, was bedeutet, dass alles oberhalb von etwa 3,4 kHz verworfen wird, bevor es überhaupt ein Aufnahmegerät erreicht. Dieses Band ist keine Dekoration. Dort liegt der Unterschied zwischen einem s und einem f, dort trennt sich sch von s, dort trägt ein Zischlaut genug Detail, um zwei von drei zu unterscheiden. Breitband-Audio mit 16 kHz Abtastrate bewahrt es. Eine Telefonleitung nicht.

Moderne Spracherkennungssysteme werden ganz überwiegend mit Breitband-Audio trainiert, und wenn man ihnen 8-kHz-Material liefert, tasten die meisten es zuerst hoch. Das Hochtasten bringt die Datei in die richtige Form. Es bringt nicht zurück, was entfernt wurde. In den rekonstruierten Frequenzen steckt keine Information, weil dort von Anfang an keine war.

Die Folgen zeigen sich in den Zahlen, und deshalb führen veröffentlichte Benchmarks so beständig in die Irre. Kontrollierte Studien, die nichts außer der Abtastrate verändern, zeigen, dass Schmalband-Audio für sich genommen Genauigkeit kostet. Echte Anrufe packen dann Codec-Kompression, Mobilfunknetze, gleichzeitiges Sprechen und Hintergrundgeräusche obendrauf, und für reales Contact-Center-Audio werden häufig Fehlerraten berichtet, die beim Mehrfachen der Leaderboard-Werte liegen. Benchmarks von Anbietern laufen fast immer auf sauberen Breitband-Aufnahmen – betrachten Sie also jede beworbene Genauigkeitszahl als Obergrenze für Telefon-Audio, nicht als Prognose.

Kompression legt eine eigene Schicht darüber. G.711, nach wie vor das Arbeitspferd unter den Codecs im Telefonnetz, ist konstruktionsbedingt schmalbandig. G.722, Opus und EVS übertragen Breitband-Audio oder besser und klingen hörbar besser, helfen aber nur, wenn jeder Abschnitt des Anrufs sie unterstützt. Ein einziger Teilnehmer, der sich per Handy einwählt, zieht das ganze Gespräch auf den kleinsten gemeinsamen Nenner herunter, weil das Netz in etwas transkodieren muss, das beide Enden verstehen.

Eine Diagnose in dreißig Sekunden. Öffnen Sie einen aufgezeichneten Anruf in einem beliebigen Audioeditor und wechseln Sie in die Frequenzansicht. Bricht die Energie um 3,4 kHz abrupt in einer flachen Linie ab, arbeiten Sie mit Schmalband-Audio, und kein Wechsel des Transkriptionsanbieters wird daran etwas ändern. Eine Änderung daran, wie der Anruf übertragen wird – eine VoIP-Verbindung statt einer Mobilfunkverbindung, ein Headset statt der Freisprechfunktion –, schon.

Ein Kanal oder zwei – und warum das alles entscheidet

Das Zweite, was Anruf-Audio von Meeting-Audio unterscheidet, ist die Zahl der Spuren, die am Ende vorliegen, und das ist wichtiger, als den meisten Käufern bewusst ist.

Ein Anruf hat zwei Gesprächsseiten. Wenn Ihre Aufzeichnung sie getrennt erfasst – der Anrufer auf dem linken Kanal, der Agent auf dem rechten –, ist die Sprechertrennung überhaupt kein Machine-Learning-Problem mehr. Sie ist eine Eigenschaft der Datei. Jedes Wort auf Kanal eins gehört der einen Person, jedes Wort auf Kanal zwei der anderen, und das Transkript wird korrekt beschriftet, selbst wenn beide gleichzeitig sprechen.

Mischen Sie diese beiden Seiten zu einer einzigen Monospur, und Sie haben diese Gewissheit weggeworfen. Jetzt muss die Software die Sprecher allein an der Stimme auseinanderhalten, anhand von Tonhöhe, Klangfarbe und Timing. Bei sauberem Breitband-Audio funktioniert das einigermaßen gut. Auf einer schmalbandigen Telefonleitung, auf der genau die Frequenzen herausgefiltert wurden, die eine Stimme von einer anderen unterscheiden, funktioniert es deutlich schlechter – und Telefongespräche sind ausgerechnet voll von der Situation, an der es scheitert, denn ohne visuelle Hinweise fallen sich Menschen weit häufiger ins Wort als von Angesicht zu Angesicht.

Contact-Center-Plattformen zeichnen genau aus diesem Grund seit Jahren standardmäßig zweikanalig auf. Viele Telefonanlagen in Unternehmen und die meisten Aufnahme-Apps für Privatnutzer liefern Ihnen dagegen noch immer eine einzige gemischte Datei. Bevor Sie zu dem Schluss kommen, dass ein Transkriptionstool mit Ihren Anrufen schlecht zurechtkommt, prüfen Sie, welche der beiden Varianten Sie ihm geben.

Festnetz (PSTN), VoIP und das schwächste Glied der Kette

Drei Wege transportieren Geschäftsanrufe, und sie erzeugen drei unterschiedliche Aufnahmequalitäten.

Festnetz (PSTN) und Mobilfunk sind der klassische Weg: schmalbandig, und zwar zuverlässig, wobei Mobilfunk noch seine eigene Kompression obendrauf legt. Das ist die Untergrenze. VoIP kann viel besser sein, denn ein Anruf von Softphone zu Softphone über Opus oder G.722 ist echtes Breitband, aber das gilt nur, wenn beide Endpunkte und jede Zwischenstation einen Breitband-Codec aushandeln. Gemischte Anrufe fallen zurück. Konferenzplattformen wie Zoom, Google Meet und Microsoft Teams sind durchgehend breitbandig, wenn alle per App teilnehmen – und das ist der eigentliche Grund, warum sich Meeting-Transkripte so viel besser lesen als Anruftranskripte.

Dieser letzte Punkt hat eine praktische Seite. Ein Teams-Meeting mit sechs Personen am Laptop und einer Person über die Einwahlnummer erzeugt nicht einfach einen schlechten Sprecher – es erzeugt oft ein Meeting, in dem der eingewählte Teilnehmer merklich schlechter transkribiert wird als alle anderen und in dem alles, was er sagt, während jemand anderes redet, wahrscheinlich verloren geht. Wenn eine wichtige Ansprechperson sich immer per Telefon einwählt, sollten Sie das wissen, bevor Sie sich auf das Protokoll verlassen.

Fünf Wege zum Anruftranskript

Hier gibt es keine einzige Antwort, nur Abwägungen, und die richtige hängt viel stärker davon ab, wo das Transkript landen muss, als davon, welche Engine in diesem Quartal ein paar Zehntel genauer ist.

WegGenauigkeit bei Telefon-AudioKostenstrukturWo das Transkript landetAm besten, wenn
Native Telefonanlage oder Telefonie im CRMOrdentlich. Meist mono, selten auf Ihr Vokabular abgestimmtIm Platz enthalten, aber an Bedingungen geknüpft. HubSpot transkribiert nur Anrufe, die über einen Professional- oder Enterprise-Platz in Sales Hub oder Service Hub geführt werden; Starter enthält 500 Telefonieminuten pro Monat und Account, kostenlose Accounts bekommen wenig oder nichtsAutomatisch im Kontakt- oder Deal-DatensatzIhre Vertriebler telefonieren bereits aus dem CRM heraus
Telefonie- oder CPaaS-APIHöchste Obergrenze. Sie wählen die Engine und können zweikanalige Aufzeichnung anfordernNutzungsbasiert und gestapelt. Twilio etwa rechnet Transkription pro Minute ab, Aufzeichnung und der Anruf selbst werden als separate Posten berechnetWohin auch immer Ihr Code es schreibtSie haben Entwickler und ungewöhnliche Anforderungen
Meeting-AssistentStark bei App-basierten Calls, schwächer bei EinwahlteilnehmernPro Nutzer und Monat, oft mit kostenlosem KontingentIm eigenen Workspace, plus CRM-Sync, wo angebotenDie meisten Gespräche laufen über Zoom, Meet oder Teams
Contact-Center-SuiteKlassenbeste in der Telefonie. Standardmäßig zweikanalig, auf Schmalband abgestimmtHoch. Der Voice-Tarif von Five9 liegt laut Liste bei rund $159 pro gleichzeitigem Nutzer und Monat bei mindestens 50 Plätzen; Genesys Cloud CX 4 steht mit $240 in der ListeDie Plattform, mit Live-Unterstützung für Agenten während des AnrufsSie bewältigen Anrufvolumen, keine Meetings
Menschlicher oder hybrider DienstAm höchsten bei wirklich schlechtem AudioAm teuersten pro Anruf und am langsamstenEine gelieferte Datei, die Sie selbst weiterleitenDer Anruf wird von einem Gericht oder einer Aufsichtsbehörde gelesen

Die Preise sind die 2026 veröffentlichten Listenpreise; insbesondere Contact-Center-Verträge werden bei Volumen routinemäßig deutlich darunter verhandelt.

Die meisten Teams denken zu viel über die Spalte „Genauigkeit bei Telefon-Audio“ nach und zu wenig über die Spalte „Wo das Transkript landet“. Eine Contact-Center-Suite ist die technisch richtige Antwort für Telefonie – und der falsche Kauf für ein zwölfköpfiges Unternehmen, das pro Woche vier Discovery-Calls über Google Meet führt. Für ein Team dieses Zuschnitts gewinnt der Weg über einen Meeting-Assistenten meist bei den Kosten und bei dem, was wirklich zählt: ob das Ergebnis im CRM ankommt. Ein Tool wie der KI-Meeting-Assistent von Laxis bewegt sich genau in dieser Spur: Er erfasst Gespräche in Zoom, Google Meet und Microsoft Teams, nimmt hochgeladene MP3-, WAV- und M4A-Dateien von anderswo aufgezeichneten Anrufen an und überträgt im Business-Tarif Zusammenfassungen und Aufgaben nach HubSpot oder Salesforce. Der ehrliche Vorbehalt ist derselbe, der für jedes Tool in dieser Spalte gilt: Es ist um Meetings und Gespräche herum gebaut, nicht um das Anrufvolumen eines Contact Centers – wenn Sie also viertausend Anrufe am Tag transkribieren, kaufen Sie die Plattform, die dafür gebaut ist. Es gibt eine ausführlichere Übersicht der KI-Notiztools, falls Sie in dieser Spalte einkaufen.

Live oder erst, wenn alle aufgelegt haben

Echtzeit-Transkription und Transkription nach dem Anruf sehen aus wie dieselbe Funktion und verhalten sich völlig unterschiedlich.

Streaming-Transkription liefert Text innerhalb von ein bis zwei Sekunden, nachdem die Worte gesprochen wurden – das ermöglicht Live-Unterstützung für Agenten, Compliance-Warnungen und Übersetzung auf dem Bildschirm. Der Preis ist die Genauigkeit. Ein Streaming-System muss sich auf eine Vermutung festlegen, bevor es das Ende des Satzes gehört hat, und auch wenn es frühere Wörter überarbeitet, sobald mehr Audio eintrifft, hat es nie den Luxus des vollständigen Kontexts. Die Verarbeitung nach dem Anruf hat ihn. Sie verfügt über die gesamte Aufnahme, kann nach vorn wie nach hinten schauen und ist in der Regel sowohl genauer als auch pro Minute günstiger.

Der sinnvolle Schritt ist, es nicht länger als eine einzige Entscheidung zu behandeln. Die Live-Ausgabe ist für das, was während des Anrufs passieren muss. Die Ausgabe nach dem Anruf ist für die Akte, die Zusammenfassung, den CRM-Eintrag und alles, was später jemand liest. Viele Plattformen können beides, und es gibt keinen Grund, warum derselbe Anruf nicht einen groben Live-Feed und ein sauberes finales Transkript liefern sollte.

Zwei günstige Verbesserungen, die mehr bringen als ein Anbieterwechsel. Hinterlegen Sie ein benutzerdefiniertes Vokabular mit Ihren Produktnamen, den Namen Ihrer Wettbewerber, Ihren SKU-Formaten und den Nachnamen, die Ihre Vertriebler verstümmeln – Eigennamen sind die Stelle, an der Telefontranskripte am sichtbarsten scheitern, und kein Modell errät sie ohne Hilfe. Statten Sie dann alle mit Headsets aus. Freisprechen in einem Raum mit harten Wänden erzeugt Echo, und Echo bringt die Sprechertrennung schneller durcheinander als jeder Akzent.

Der Teil, der entscheidet, ob sich das alles gelohnt hat

Hier ist die unbequeme Wahrheit über Software für Anruftranskription: Genauigkeit ist das, was alle bewerten, und der Workflow ist das, was darüber entscheidet, ob sich die Anschaffung bezahlt macht.

Ein Transkript, das in einem Tool liegt, das niemand öffnet, ist wertlos. Ein Transkript, das am richtigen Kontakt hängt, an der richtigen Verkaufschance, durchsuchbar neben der übrigen Historie dieses Accounts, verändert, wie ein Deal geführt wird. Der Abstand zwischen diesen beiden Ergebnissen ist eine Frage der Anbindung, und es lohnt sich, sie zu klären, bevor Sie Engines vergleichen.

Drei Dinge machen den Unterschied. Das Transkript muss einem Datensatz zugeordnet sein, nicht nur gespeichert – Kontakt, Unternehmen und offener Deal, automatisch ermittelt über die Telefonnummer oder die Kalendereinladung. Es muss auf etwas Lesbares verdichtet sein, denn niemand scrollt durch ein vierzigminütiges Wortprotokoll, um den Einwand zu finden; genutzt werden eine Zusammenfassung und eine Liste von Zusagen mit Namen daneben. Und es muss ohne menschlichen Zwischenschritt ankommen, denn jeder Workflow, der darauf angewiesen ist, dass ein Vertriebler daran denkt, etwas einzufügen, hört in Woche drei still und leise auf zu funktionieren.

An dieser letzten Anforderung scheitern die meisten Setups, und sie ist der Grund, warum native CRM-Telefonie und Assistenten mit CRM-Sync mehr leisten, als ihre Genauigkeitswerte vermuten lassen. Laxis zum Beispiel extrahiert Aufgaben samt zuständiger Person und synchronisiert das Ergebnis im Business-Tarif nach HubSpot oder Salesforce, ohne dass jemand das Transkript öffnen muss; die Verarbeitung erfolgt in der Cloud statt auf Ihrem Gerät, was Sie vor einer Entscheidung mit Ihren eigenen Richtlinien abgleichen sollten.

Was Sie erwarten können und wie Sie es günstig herausfinden

Kaufen Sie nicht auf Basis einer veröffentlichten Genauigkeitszahl. Nehmen Sie fünf echte Aufnahmen – die schlechte Leitung, den starken Akzent, die eine, in der der Einkaufsleiter des Kunden Ihrem Account Executive ins Wort fällt – und lassen Sie sie durch jedes Tool auf Ihrer Shortlist laufen. Zählen Sie die Fehler, die Sie tatsächlich etwas kosten würden: falsche Zahlen, falsche Namen, falsche Zuordnung, wer wozu zugestimmt hat. Tippfehler bei Füllwörtern sind Rauschen.

Passen Sie Ihre Erwartungen entsprechend an. Bei einem sauberen VoIP-Anruf mit zwei Personen am Headset landen gute Systeme im selben Bereich wie bei Meeting-Audio. Bei einem Handygespräch mit Straßenlärm und einem Akzent, den das Modell kaum gehört hat, taugt das Transkript als Gedächtnisstütze, ist aber als Zitatquelle unzuverlässig. Beides kann für denselben Anbieter am selben Tag zutreffen – und genau deshalb kann Ihnen der Anbieter keine einzelne Zahl nennen und sie ernst meinen.

Eines ist nicht optional: Klären Sie die Einwilligung, bevor irgendetwas davon läuft, denn die Regeln unterscheiden sich je nach Rechtsordnung, und die Strafen sind nicht theoretisch. Unser Leitfaden zum Aufzeichnen eines Telefonats behandelt die praktische Umsetzung und die Einwilligungsregeln, einschließlich der US-Bundesstaaten, in denen alle Beteiligten zustimmen müssen.

Was das für Sie bedeutet

Die interessante Verschiebung bei der Anruftranskription ist nicht, dass die Modelle besser geworden sind, auch wenn sie das sind. Es ist, dass sich der Engpass verlagert hat. Den größten Teil des letzten Jahrzehnts bestand die Schwierigkeit darin, die Wörter richtig zu erkennen. Heute besteht sie in einem Frequenzband, das das Telefonnetz seit Jahrzehnten verwirft, und in einer Reihe von Entscheidungen darüber, wie die Aufnahme erfasst wird – ein Kanal oder zwei, App oder Einwahl, Breitband oder was auch immer das Netz aushandeln konnte. Diese Entscheidungen trifft, wer die Telefonanlage konfiguriert, meist ohne dass irgendjemand Transkription erwähnt.

Damit ist dies eine der seltenen Situationen, in denen die günstigste verfügbare Verbesserung kein Kauf ist. Sie ist ein Gespräch mit der Person, die für Ihre Telefonie zuständig ist, mit zwei Fragen: Können wir beide Gesprächsseiten getrennt aufzeichnen, und können wir mehr Anrufe auf einem Breitbandweg halten? Klären Sie diese beiden, und nahezu jede kompetente Engine reicht aus.

Häufig gestellte Fragen

Was ist Anruftranskription?

Anruftranskription ist die Umwandlung eines Telefon- oder VoIP-Gesprächs in durchsuchbaren Text, in der Regel mit gekennzeichneten Sprechern und einem Zeitstempel für jede Zeile. Sie unterscheidet sich in einem wichtigen Punkt von der Transkription einer gewöhnlichen Audiodatei: Der Ton ist durch einen komprimierten Telefonkanal gelaufen und kann als eine gemischte Aufnahme oder als zwei getrennte Gesprächsseiten ankommen.

Wie genau ist Anruftranskription bei Telefon-Audio?

Rechnen Sie mit spürbar geringerer Genauigkeit als in den Zahlen, die Anbieter veröffentlichen, denn diese stammen von sauberen Breitband-Aufnahmen. Schmalband-Audio kostet für sich genommen Genauigkeit, und echte Anrufe bringen zusätzlich Kompression, gleichzeitiges Sprechen und Störgeräusche mit, sodass die Fehlerraten bei Telefon-Audio ein Mehrfaches des beworbenen Werts erreichen können. Zweikanalige Aufzeichnung und benutzerdefiniertes Vokabular holen einen Großteil davon zurück.

Kann man Telefonate automatisch transkribieren?

Ja. Die meisten Telefonanlagen in Unternehmen, CRMs mit nativer Telefonie und Contact-Center-Plattformen transkribieren automatisch, sobald die Aufzeichnung eingeschaltet ist, und Telefonie-APIs streamen Text live zurück, wenn Sie darauf aufbauen. Die praktische Einschränkung ist meist die Lizenzierung und nicht die Technik, da viele Tarife Transkription an eine kostenpflichtige Platzstufe oder ein monatliches Minutenkontingent knüpfen.

Wie transkribiert man Vertriebsgespräche am besten?

Wählen Sie den Weg, der das Transkript im richtigen CRM-Datensatz ablegt, ohne dass jemand etwas kopieren muss. In der Praxis heißt das entweder ein Dialer mit nativer CRM-Protokollierung oder ein Meeting-Assistent, der sich für Gespräche über Zoom, Google Meet oder Teams mit HubSpot oder Salesforce synchronisiert. Die reine Genauigkeit zählt weniger als die Frage, ob ein Vertriebler das Ding überhaupt je öffnet.

Funktioniert Anruftranskription in Echtzeit?

Ja, wobei Live-Transkription und Transkription nach dem Anruf im Grunde verschiedene Produkte sind. Streaming-Systeme liefern Text innerhalb von ein bis zwei Sekunden und überarbeiten frühere Wörter, sobald mehr Audio eintrifft, was ihre Genauigkeit begrenzt, weil sie nicht sehen können, was als Nächstes kommt. Die Verarbeitung nach dem Anruf hat die gesamte Aufnahme zur Verfügung und ist meist sowohl genauer als auch günstiger.

Wo sollten Anruftranskripte gespeichert werden?

Dort, wo die Menschen, die sie brauchen, ohnehin arbeiten – für Revenue-Teams heißt das im CRM, verknüpft mit dem Kontakt und der offenen Verkaufschance, statt in einem separaten Tool geparkt. Regulierte Teams legen Aufbewahrungsfristen und Zugriffskontrollen obendrauf. Ein Transkript, das beim Schreiben eines Follow-ups niemand findet, hat Geld gekostet, statt welches zu sparen.