Wir haben die führenden Spracherkennungsanbieter (STT) einem Benchmark unterzogen, mit besonderem Fokus auf Anwendungen im Gesundheitswesen. Unser Benchmark verwendete reale Beispiele, um die Transkriptionsgenauigkeit in medizinischen Kontexten zu bewerten, wo Präzision entscheidend ist.
Ergebnisse des Spracherkennungs-Benchmarks
Basierend auf den Ergebnissen sowohl der Wortfehlerrate (WER) als auch der Zeichenfehlerrate (CER) zeigt GPT-4o-transcribe die höchste Transkriptionsgenauigkeit unter allen bewerteten Spracherkennungssystemen. Deepgram Nova-v3 und Gladia schneiden ebenfalls stark ab und halten die Fehlerraten bei beiden Metriken niedrig.
Methodik
Datensatz
Wir wollten die Leistung der Modelle sowohl anhand vieler kleiner, unterschiedlicher Stichproben als auch einer langen Probe bewerten und führten daher zwei Aufgaben durch:
Aufgabe 1: Sprachdaten aus dem Gesundheitswesen
- Gesamtzahl der Stichproben: 100
- Gesamtdauer: 9 Minuten und 25 Sekunden
- Durchschnittliche Dauer pro Stichprobe: 5,65 Sekunden
- Inhalt: Sprachdaten aus dem Gesundheitswesen, einschließlich medizinischer Terminologie, Patienteninteraktionen und klinischer Diskussionen
- Vielfalt: Verschiedene Sprecher, variierende Audioqualität und diverse medizinische Kontexte auf Englisch
Audiospezifikationen:
- Format: WAV
- Kanäle: 1 (Mono)
- Abtasttiefe: 16-Bit
- Abtastrate: 16 kHz
- Konstante Bitrate: 256 kbps
- Dauerbereich: ~4,5 bis 11,5 Sekunden pro Datei
Aufgabe 2: Eine Anatomievorlesung
- Gesamtzahl der Stichproben: 1
- Gesamtdauer: 8 Minuten und 35 Sekunden
- Inhalt: Eine Anatomievorlesung, gehalten von einem Arzt, einschließlich medizinischer Terminologie
- Vielfalt: Ein Sprecher spricht in der ersten Hälfte des Videos Englisch; im Hintergrund läuft Musik.
Audiospezifikationen:
- Format: WAV
- Kanäle: 2 (Stereo)
- Abtasttiefe: 16-Bit
- Abtastrate: 48 kHz
- Konstante Bitrate: 1536 kbps
Evaluierungsmetriken
Wir verwendeten die Wortfehlerrate (WER) und die Zeichenfehlerrate (CER) als Evaluierungsmetriken für die Transkriptionsgenauigkeit. Die Wortfehlerrate wird wie folgt berechnet:
WER = (S + D + I) / N
Wobei:
- S = Anzahl der Substitutionen
- D = Anzahl der Löschungen
- I = Anzahl der Einfügungen
- N = Gesamtzahl der Wörter in der Referenz
Die Formel berechnet die minimale Anzahl von Operationen auf Wortebene, die benötigt werden, um die Hypothese in die Referenz zu transformieren, geteilt durch die Anzahl der Wörter in der Referenz. Eine niedrigere WER zeigt eine bessere Genauigkeit an, wobei 0 % eine perfekte Übereinstimmung bedeuten.
Die Zeichenfehlerrate (CER) wird berechnet, indem die Gesamtzahl der Fehler auf Zeichenebene (einschließlich Einfügungen, Löschungen und Substitutionen) durch die Gesamtzahl der Zeichen im Referenztext geteilt wird.
Wir verwendeten Spracherkennungs-APIs, um Audiodateien in Text zu transkribieren.
Die maximale Dateigröße, die von den Anbietern auf einmal eingegeben werden kann, ist in der Tabelle dargestellt:
*Da Vosk lokal läuft, gibt es keine Begrenzung der Eingabedateigröße. Lange Audiodateien können jedoch die Beam-Grenze überschreiten, wodurch einige Wahrscheinlichkeiten verloren gehen. Daher wird empfohlen, die Dateien in 1–2-minütige Segmente aufzuteilen.
Google MedASR läuft ebenfalls lokal und legt keine maximale Dateigröße fest. Für eine optimale Leistung und Ressourcenverwaltung wird die Verarbeitung langer Dateien in kleineren Segmenten empfohlen.
Hinweis: Bei Anbietern mit kleineren Dateigrößenbeschränkungen (wie Google und OpenAI) müssen größere Audiodateien vor der Verarbeitung in kleinere Teile aufgeteilt werden. Wir haben dies in Aufgabe 2 durchgeführt.
Spracherkennung
Spracherkennung ermöglicht es Computern, Audiodateien mithilfe von maschinellen Lernalgorithmen in Text zu transkribieren. Die API eines Transkriptionsdienstes kann mit verschiedenen Programmiersprachen für die Stapeltranskription verwendet werden. Diese Plattformen unterstützen sowohl Echtzeit- als auch asynchrone Transkription.
Spracherkennungstechnologie hat zahlreiche Anwendungen, darunter Transkription, Sprachassistenten und Sprachübersetzung.
Vorteile der Nutzung von Spracherkennung für die Transkription
- Schnelle Transkription von Audiodateien
- Zeit- und Arbeitsersparnis
- Echtzeit-Transkription und -Übersetzung
- Barrierefreiheit für Menschen mit Behinderungen
Wie funktionieren KI-Tools zur Spracherkennung?
Der Transkriptionsprozess umfasst:
- Audiodaten werden in das Spracherkennungstool hochgeladen oder gestreamt
- Verwendung von maschinellen Lernalgorithmen zur Analyse der Audiodaten und Identifizierung von Sprachmustern
- Das Tool wandelt die Sprache mithilfe einer Spracherkennungs-Engine in Text um
- Der transkribierte Text wird dann dem Benutzer angezeigt.
FAQs
Die Transkription von Audio- und Videoaufnahmen kann verwendet werden für:
Sprachassistenten und virtuelle Assistenten
Sprachübersetzung und Dolmetschen
Spracherkennungssysteme (ASR) für Menschen mit Behinderungen
Ihre vortrainierten Modelle ermöglichen die automatische Spracherkennung (ASR) für aufgezeichnete Audio- und Videodateien. Hochpräzise Audiotranskriptionen umfassen automatische Zeichensetzung und Themenerkennung.
Eine Open-Source-Engine oder ein Spracherkennungsanbieter von einem Dienst, mit dem Ihr Unternehmen bereits zusammenarbeitet (z. B. Google Cloud, AWS Transcribe), kann als Transkriptionslösung für die Bedürfnisse Ihres Unternehmens gewählt werden. Einige von ihnen bieten auch kostenlose Credits an, aber wir empfehlen Vorsicht in Bezug auf die Datensicherheit.
Eine Spracherkennungs-API kann helfen, Audiodateien in Text zu transkribieren. Verarbeitung und Analyse von Audiodaten:
Audiodaten werden mit Techniken wie Rauschunterdrückung und Echounterdrückung verarbeitet
Die Audiodaten werden dann mit maschinellen Lernalgorithmen analysiert, um Sprachmuster zu identifizieren
Die Algorithmen verwenden akustische Modelle und Sprachmodelle, um gesprochene Wörter und Phrasen zu erkennen
Konvertierung von Sprache in Text mit maschinellen Lernalgorithmen:
Maschinelle Lernalgorithmen werden anhand großer Datensätze von Audio- und Textdaten trainiert
Die Algorithmen lernen, Sprachmuster zu erkennen und in Text umzuwandeln
Die Algorithmen können für bestimmte Anwendungsfälle und Sprachen feinabgestimmt und angepasst werden.
Weiterführende Literatur
Zitieren Sie diesen Benchmark
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Alper, Şevval},
title = {{Spracherkennungs-Benchmark: Deepgram vs. Whisper}},
year = {2026},
month = jan,
howpublished = {\url{https://aimultiple.com/speech-to-text}},
note = {AIMultiple. Abgerufen am 22. Januar 2026}
}
Seien Sie der Erste, der kommentiert
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.