Warum ist Spracherkennung so schlecht? Ursachen und Lösungen
Warum ist Spracherkennung so schlecht? (Ob Diktierfunktion, Sprache-zu-Text oder Spracheingabe: dieselben Engines, dieselbe Frage.) Vor allem, weil Spracherkennung eine Kette ist (Mikrofon, Raum, Stimme, Wortschatz, Modell) und Ihr Transkript nur so gut ist wie das schwächste Glied. Sie haben „their“ gesagt und „there“ bekommen (zwei englische Wörter, die gleich klingen). Sie haben den Nachnamen Ihrer Führungskraft gesagt und ein Gemüse bekommen. Sie haben kurz nachgedacht, und plötzlich stand da ein Satz, den Sie nie gesagt haben.
Jeder Fall hat eine eigene Ursache und eine eigene Lösung. Im Folgenden: Symptome, Ursachen, Lösungen und dann eine klare Antwort auf die Frage, ob Spracherkennung als KI zählt. Sie suchen eher ein Tool? Dann beginnen Sie mit unserem Überblick über Diktiersoftware.
Spracherkennung scheitert aus einer Handvoll vorhersehbarer Gründe
Spracherkennung liefert falsche Wörter, wenn das Audio undeutlich ist, wenn es um Wörter geht, die dem Modell im Training selten begegnet sind, oder wenn ihm der Kontext fehlt, um zwischen gleich klingenden Wörtern zu wählen. Die meisten Beschwerden lassen sich auf eine dieser drei Ursachen zurückführen, und das Symptom verrät meist, auf welche.
| Was Sie sehen | Wahrscheinliche Ursache | Zuerst versuchen |
|---|---|---|
| Zufällig falsche Wörter, in manchen Räumen schlimmer | Mikrofon zu weit weg oder ein halliger oder lauter Raum | Mikrofon auf eine Handbreit an den Mund heranbringen; prüfen, welches Mikrofon ausgewählt ist |
| Am Schreibtisch gut, draußen hoffnungslos | Wind und Verkehr treffen auf das Handymikrofon | Das Handy mit der Hand abschirmen oder Ohrhörer mit Kabelmikrofon nutzen |
| Namen, Marken und Abkürzungen immer falsch | Wörter, die das Modell selten gesehen hat | Ein eigenes Wörterbuch oder Korrektur per Sprache |
| „There“ statt „their“, „two“ statt „to“ | Gleich klingende Wörter, die per Kontext entschieden werden | In ganzen Wendungen sprechen; gezielt auf diese Wörter Korrektur lesen |
| Das erste Wort oder die ersten zwei fehlen | Sprechen, bevor das Zuhören beginnt | Auf das Signal zum Zuhören warten |
| Sätze, die Sie nie gesagt haben, nach einer langen Pause | Das Modell füllt die Stille | Das Mikrofon pausieren, während Sie nachdenken |
| Kauderwelsch oder die falsche Sprache | Falsche Diktiersprache oder Region | Sprache und die nächstgelegene regionale Variante einstellen |
| Plötzlich wurde es schlechter | Etwas in der Kette hat sich geändert | Zurückverfolgen: neue Ohrhörer, Update, neue Tastatur, Offline-Sprachpaket |
Das Mikrofon zählt mehr als das Modell
Schlechtes Audio ist das Erste, was Sie ausschließen sollten, wenn die Spracherkennung schlecht ist: Ein Mikrofon weit weg vom Mund nimmt den Raum fast so laut auf wie Ihre Stimme, und kein Modell kann Wörter zurückholen, die nie deutlich angekommen sind. Laptopmikrofone sitzen neben Lüftern und Tastaturen. Ein Handy, das auf einer belebten Straße auf Armlänge gehalten wird, nimmt vor allem die Straße auf.
Headsets sind nicht automatisch besser. Viele Bluetooth-Ohrhörer schalten in einen Anrufmodus mit geringerer Qualität, sobald ihr Mikrofon aktiv ist, sodass ein billiges kabelgebundenes Paar teure kabellose schlagen kann. Und prüfen Sie, worauf der Computer hört: Die Diktierfunktion des Mac, die Spracheingabe von Windows und Dictate (Diktieren) in Word lassen Sie jeweils das Mikrofon wählen, und das Mikrofon einer Webcam am anderen Ende des Raums kann unbemerkt zum Standard werden.
Die Hersteller sehen es genauso. Microsofts Hilfe zur Problembehandlung für Dictate in Word empfiehlt ein Headset oder ein externes Mikrofon und weniger Hintergrundgeräusche; Googles Hilfe zur Spracheingabe rät, an einen ruhigen Ort zu gehen und ein externes Mikrofon anzuschließen.
Hören Sie, was die Software hört: Nehmen Sie zwanzig Sekunden mit der Sprachmemo-App Ihres Handys auf, genau dort, wo Sie normalerweise diktieren, und spielen Sie die Aufnahme dann über Kopfhörer ab. Wenn Sie den Geschirrspüler, die Dunstabzugshaube oder Ihre eigene Tastatur hören, hört die Spracherkennung sie auch, und das Mikrofon zu versetzen hilft mehr als ein App-Wechsel.
Wie Sie sprechen, verändert, was sie hört
Die Sprechweise beeinflusst die Genauigkeit, weil Spracherkenner großenteils aus natürlicher, flüssiger Sprache lernen; wer also Sätze ausklingen lässt, Satzenden verschluckt oder langsam Wort für Wort diktiert, gibt dem Modell weniger Material. Microsofts Rat, „bewusster zu sprechen“, stimmt, wenn bewusst vollständig heißt und nicht langsam: Denken Sie den Satz zu Ende und sprechen Sie ihn dann in einem Atemzug.
Lange Pausen bergen ein seltsameres Risiko. In einer Studie von 2024 mit dem Titel „Careless Whisper“ fanden Allison Koenecke und Kollegen heraus, dass rund 1 % der Transkriptionen von OpenAIs Whisper ganze Wendungen oder Sätze enthielten, die nicht im Audio vorkamen, und dass diese Halluzinationen überproportional bei Sprechern mit längeren Stillephasen auftraten. Die meisten Diktier-Tools basieren nicht auf genau diesem Modell, aber die Lehre gilt trotzdem.
Denken Sie bei ausgeschaltetem Mikrofon: Wenn Sie mehr als ein paar Sekunden für den nächsten Satz brauchen, stoppen Sie das Diktat, denken Sie nach und starten Sie dann neu, mit dem ganzen Satz im Kopf. So entstehen weniger halbfertige Sätze, und die Engine hat nie eine lange Stille zu füllen.
Namen, Fachjargon und Homophone brauchen Kontext, den sie nicht hat
Spracherkennung tut sich mit Namen und Fachjargon schwer, weil ein Spracherkenner zu Wörtern tendiert, denen er im Training oft begegnet ist, und weil er zwischen gleich klingenden Wörtern wie „their“ und „there“ (im Englischen „ihr“ und „dort“) anhand von Kontext entscheidet, der ihm häufig fehlt. Eine Handytastatur hört einen einzelnen Satz ohne Zusammenhang. Sie weiß nicht, dass Sie Aoife wegen der Vertragsverlängerung im dritten Quartal antworten, also greift sie zu den gängigsten Wörtern, die zu den Lauten passen.
Bei seltenen Wörtern geben Sie dem Tool Ihren Wortschatz. Spezialisierte KI-Diktier-Apps haben eigene Wörterbücher; das Laxis Voice Keyboard nennt seine Version Personal Dictionary, für Namen, Abkürzungen und Fachbegriffe. Die eingebaute Diktierfunktion hat meist keines, also korrigieren Sie direkt an Ort und Stelle: Klicken Sie auf dem Mac auf ein blau unterstrichenes Wort, um Alternativen zu sehen, sagen Sie auf dem iPhone „change“ und buchstabieren Sie die Korrektur, oder tippen Sie auf dem Pixel auf das falsch verstandene Wort. Laut Google verbessert sich die erweiterte Spracheingabe des Pixel anhand der Wörter, die Sie korrigieren.
Homophone verlangen eine andere Gewohnheit. Längere Wendungen geben der Sprachseite des Modells mehr Anhaltspunkte, deshalb kommt „send it to their office“ („schick es an ihr Büro“) besser heraus als „their“ allein. Lesen Sie danach gezielt auf gleich klingende Wörter, Zahlen und Verneinungen Korrektur, die drei Stellen, an denen ein einziges falsches Wort den Sinn umkehrt.
Akzente und Dialekte werden ungleich gut bedient
Spracherkennung ist bei manchen Akzenten und Dialekten messbar ungenauer, weil die Trainingsdaten der meisten Engines bestimmte Sprechweisen überrepräsentieren. Der bekannteste Beleg ist eine Stanford-Studie von 2020 in PNAS unter Leitung von Allison Koenecke: Systeme von Amazon, Apple, Google, IBM und Microsoft, getestet 2019, erkannten im Schnitt 35 % der Wörter Schwarzer Sprecher falsch, gegenüber 19 % bei weißen Sprechern. Die Engines haben sich seitdem verbessert, aber niemand hat gezeigt, dass die Lücke geschlossen ist.
Die regionale Variante zu wählen, die Ihrer Sprechweise am nächsten kommt, hilft und kostet nichts. Mehr dazu in unserem Leitfaden zum Diktieren mit Akzent oder in zwei Sprachen.
Handytastaturen nutzen kleine Modelle, Cloud-Dienste große
Die Diktierfunktion am Handy läuft oft auf dem Gerät selbst, wo das Sprachmodell in das Speicher- und Akkubudget eines Handys passen muss, während Cloud-Dienste weitaus größere Modelle betreiben können. Apple gibt an, dass das Diktieren auf dem iPhone in vielen Sprachen auf dem Gerät verarbeitet wird, ohne Internetverbindung. Google gibt an, dass die erweiterte Spracheingabe des Pixel das Gesagte auf dem Handy behält, sofern Sie keine Funktionen wie Fix it nutzen. Die Spracheingabe von Windows dagegen nutzt Online-Erkennung auf Basis der Azure Speech-Dienste von Microsoft.
Verarbeitung auf dem Gerät ist nicht per se schlechter. Sie ist privat, funktioniert im Flugzeug, und Handyhersteller fügen lokale Sprachmodelle hinzu, um das Ergebnis zu glätten; in iOS 27 nutzt Apple eines, um auf dem iPhone 17 Pro, dem iPhone Air und neueren Modellen Rechtschreibung, Zeichensetzung und Großschreibung im Englischen zu verbessern. Aber es ist ein Kompromiss und einer der Gründe, warum derselbe Satz auf Handy und Laptop unterschiedlich herauskommen kann; unser Beitrag zu Transkription auf dem Gerät oder in der Cloud behandelt die Datenschutzseite.
Wenn Sie den Eindruck haben, dass die Spracherkennung immer schlechter wird, hat sich die Technik wahrscheinlich nicht zurückentwickelt; etwas in Ihrer Kette hat sich geändert, etwa neue Ohrhörer, eine neue Standardtastatur, ein Betriebssystem-Update oder ein Offline-Sprachpaket. Testen Sie erneut nah am Mikrofon in einem ruhigen Raum, um zu sehen, ob das Problem am Audio oder an der Software hängt.
Ist Spracherkennung KI?
Spracherkennung ist KI im Sinne des maschinellen Lernens: Moderne Spracherkenner sind neuronale Netze, die mit großen Mengen aufgezeichneter Sprache samt zugehörigen Transkripten trainiert wurden, keine Sammlungen handgeschriebener Regeln. Also ja, sie zählt dazu. OpenAIs Whisper, 2022 in einem Paper von Alec Radford und Kollegen beschrieben, wurde mit 680.000 Stunden Audio aus dem Web trainiert. Jede gängige Diktier-Engine ist heute so aufgebaut.
Das erklärt den Großteil des oben beschriebenen Verhaltens. Das Modell sagt die wahrscheinlichsten Wörter für das Gehörte voraus, auf Basis dessen, was es gelernt hat; deshalb ist es stark bei alltäglicher Sprache und schwächer bei seltenen Namen und unterrepräsentierten Stimmen. Es kann sich mit voller Überzeugung irren und gelegentlich Wörter erzeugen, die niemand gesagt hat. Unser Beitrag zu Speech-to-Text geht genauer darauf ein, wie Spracherkenner funktionieren.
Was das nicht bedeutet: dass die Diktierfunktion für Sie schreibt. Einfache Spracherkennung transkribiert; sie ist keine generative KI im Sinne eines Chatbots. Die Grenze verschwimmt allerdings, weil viele Tools einen zweiten Schritt hinzufügen, der Ihre Wörter mit einem Sprachmodell überarbeitet: Fluid dictation in Windows, Fix it auf dem Pixel, Apples Modell in iOS 27 und Verbal Cleanup von Laxis machen alle eine Variante davon. Wenn eine Richtlinie Ihrer Schule oder Ihres Arbeitgebers „KI“ einschränkt, fragen Sie nach, ob Transkription oder Umschreiben gemeint ist, und prüfen Sie dann, welche Zusatzfunktionen eingeschaltet sind.
Wann die eingebaute Diktierfunktion reicht
Die eingebaute Diktierfunktion reicht für kurze Nachrichten, Suchanfragen und schnelle Notizen in einem ruhigen Raum, und sie ist kostenlos. Bringen Sie zuerst Mikrofon, Spracheinstellung und Pausen in Ordnung. Wenn danach vor allem Namen, Füllwörter und ausufernde Sätze übrig bleiben, lohnt sich eine KI-Diktier-App.
Laxis Voice Keyboard funktioniert in Ihren Desktop- und Handy-Apps, entfernt Füllwörter und Wiederholungen, setzt Satzzeichen und nutzt Ihr Personal Dictionary für Namen. Die Grenzen: Es arbeitet nur in der Cloud, braucht also eine Verbindung, und Ihr Audio verlässt das Gerät; im kostenlosen Tarif teilen sich Diktat und Meetings ein gemeinsames Kontingent von 300 Minuten pro Monat. Die 14-tägige Premium-Testversion braucht keine Kreditkarte, Sie können sie also an Ihren eigenen schlimmsten Fehlern testen.
Häufig gestellte Fragen
Warum ist die Spracherkennung auf dem iPhone so schlecht?
Auf dem iPhone geht die Spracherkennung meist wegen des Mikrofonabstands, Hintergrundgeräuschen oder Namen und Fachbegriffen schief, die sie nie gelernt hat, und nicht wegen eines Fehlers, den nur das iPhone hat. Halten Sie das Handy näher, diktieren Sie in ganzen Wendungen und buchstabieren Sie schwierige Namen Buchstabe für Buchstabe. Ab dem iPhone 12 können Sie in US-Englisch ein falsch verstandenes Wort außerdem per Sprache mit „change“ korrigieren.
Warum wird die Spracherkennung immer schlechter?
Dass die Spracherkennung schlechter zu werden scheint, liegt meist daran, dass sich etwas an Ihrem Setup geändert hat, nicht daran, dass die Technik sich zurückentwickelt hat. Häufige Ursachen sind neue Bluetooth-Ohrhörer, ein anderes Standardmikrofon, ein Betriebssystem-Update, eine neue Tastatur-App oder ein Offline-Sprachpaket. Testen Sie erneut mit dem Mikrofon nah am Mund in einem ruhigen Raum, um zu sehen, ob das Problem am Audio oder an der Software hängt.
Ist Spracherkennung KI?
Ja. Moderne Spracherkennung nutzt maschinelles Lernen: Ein neuronales Netz, das mit großen Mengen aufgezeichneter Sprache und passenden Transkripten trainiert wurde, sagt die wahrscheinlichsten Wörter für den Klang voraus, den es hört. OpenAIs Whisper zum Beispiel wurde mit 680.000 Stunden Audio trainiert. Reines Diktieren transkribiert, statt zu schreiben, aber viele Tools fügen inzwischen einen KI-Schritt hinzu, der den Text glättet oder umschreibt.
Ist Speech-to-Text generative KI?
Einfache Speech-to-Text-Erkennung ist keine generative KI im Sinne eines Chatbots, weil sie transkribiert, was Sie gesagt haben, statt neue Inhalte zu erzeugen. Die Grenze verschwimmt: Spracherkenner erzeugen Text Wort für Wort und können gelegentlich Wendungen einfügen, die niemand gesprochen hat, und viele Diktier-Tools fügen ein Sprachmodell hinzu, das Ihre Wörter umschreibt. Wenn eine Richtlinie generative KI einschränkt, prüfen Sie, welche Funktionen eingeschaltet sind.
Wie mache ich die Spracherkennung genauer?
Bringen Sie das Mikrofon näher an den Mund, reduzieren Sie Hintergrundgeräusche, sprechen Sie in ganzen Wendungen in normalem Tempo und wählen Sie die richtige Sprache und regionale Variante. Bringen Sie dem Tool dann Ihren Wortschatz bei, mit einem eigenen Wörterbuch, sofern es eines hat. Diese Schritte beheben die meisten Fehler; wenn Namen und Füllwörter weiterhin das Problem sind, probieren Sie eine spezialisierte KI-Diktier-App.
Warum erkennt die Spracherkennung Namen falsch?
Spracherkennung erkennt Namen falsch, weil Spracherkenner Wörter bevorzugen, die sie im Training oft gesehen haben, und die meisten Nachnamen, Marken und Abkürzungen selten sind. Ohne Kontext setzt die Engine das nächstliegende gängige Wort ein. Den Namen in ein eigenes Wörterbuch aufzunehmen, behebt das bei Tools, die eines haben; die eingebaute Diktierfunktion hat meist keines, aber den Namen Buchstabe für Buchstabe zu buchstabieren funktioniert auf dem iPhone und auf neueren Pixel-Geräten.