Wir haben die führenden Speech-to-Text-Anbieter (STT) einem Benchmark unterzogen, wobei wir uns speziell auf Anwendungen im Gesundheitswesen konzentrierten. Unser Benchmark verwendete reale Beispiele, um die Transkriptionsgenauigkeit in medizinischen Kontexten zu bewerten, in denen Präzision entscheidend ist.
Ergebnisse des Speech-to-Text-Benchmarks
Basierend auf den Ergebnissen sowohl der Wortfehlerrate (WER) als auch der Zeichenfehlerrate (CER) zeigt GPT-4o-transcribe die höchste Transkriptionsgenauigkeit unter allen bewerteten Speech-to-Text-Systemen. Deepgram Nova-v3 und Gladia schneiden ebenfalls stark ab und halten die Fehlerraten bei beiden Metriken niedrig.
Methodik
Dataset
Wir wollten die Leistungen der Models sowohl in kleinen und verschiedenen Samples als auch in einem langen Sample bewerten, daher haben wir zwei Aufgaben durchgeführt:
Aufgabe 1: Sprachdaten aus dem Gesundheitswesen
- Gesamtzahl der Samples: 100
- Gesamtdauer: 9 Minuten und 25 Sekunden
- Durchschnittliche Dauer pro Sample: 5,65 Sekunden
- Inhalt: Sprachdaten aus dem Gesundheitswesen, einschließlich medizinischer Terminologie, Patienteninteraktionen und klinischer Gespräche
- Vielfalt: Verschiedene Sprecher, unterschiedliche Audioqualität und vielfältige medizinische Kontexte, auf Englisch gesprochen
Audiospezifikationen:
- Format: WAV
- Kanäle: 1 (Mono)
- Sample-Breite: 16-Bit
- Abtastrate: 16 kHz
- Konstante Bitrate: 256 kbps
- Dauerbereich: ~4.5 bis 11,5 Sekunden pro Datei
Aufgabe 2: Eine Anatomievorlesung
- Gesamtzahl der Samples: 1
- Gesamtdauer: 8 Minuten und 35 Sekunden
- Inhalt: Eine Anatomievorlesung eines Arztes, einschließlich medizinischer Terminologie
- Vielfalt: Ein Sprecher spricht in der ersten Hälfte des Videos auf Englisch; im Hintergrund läuft Musik.
Audiospezifikationen:
- Format: WAV
- Kanäle: 2 (Stereo)
- Sample-Breite: 16-Bit
- Abtastrate: 48 kHz
- Konstante Bitrate: 1536 kbps
Bewertungsmetriken
Wir verwendeten die Wortfehlerrate (WER) und die Zeichenfehlerrate (CER) als Bewertungsmetriken für die Transkriptionsgenauigkeit. Die Wortfehlerrate wird wie folgt berechnet:
WER = (S + D + I) / N
Wobei:
- S = Anzahl der Substitutionen
- D = Anzahl der Löschungen
- I = Anzahl der Einfügungen
- N = Gesamtzahl der Wörter im Referenztext
Die Formel berechnet die minimale Anzahl an Wortoperationen, die erforderlich ist, um die Hypothese in die Referenz zu überführen, geteilt durch die Anzahl der Wörter in der Referenz. Ein niedrigerer WER weist auf eine bessere Genauigkeit hin, wobei 0 % eine perfekte Übereinstimmung darstellt.
Die Zeichenfehlerrate (CER) wird berechnet, indem die Gesamtzahl der Zeichenfehler (einschließlich Einfügungen, Löschungen und Substitutionen) durch die Gesamtzahl der Zeichen im Referenztext geteilt wird.
Wir verwendeten Speech-to-Text-APIs, um Audiodateien in Text zu transkribieren.
Die von den Anbietern maximal auf einmal verarbeitbare Dateigröße ist in der Tabelle dargestellt:
*Da Vosk lokal ausgeführt wird, gibt es keine Begrenzung der Eingabedateigröße. Allerdings können lange Audiodateien das Beam-Limit überschreiten, wodurch einige Wahrscheinlichkeiten verloren gehen können. Daher wird empfohlen, die Dateien in Segmente von 1–2 Minuten aufzuteilen.
Google MedASR wird ebenfalls lokal ausgeführt und legt keine maximale Dateigrößenbeschränkung fest. Für optimale Leistung und Ressourcenverwaltung wird empfohlen, lange Dateien in kleineren Segmenten zu verarbeiten.
Hinweis: Bei Anbietern mit kleineren Dateigrößenbeschränkungen (wie Google und OpenAI) müssen größere Audiodateien vor der Verarbeitung in kleinere Teile aufgeteilt werden. Wir haben dies in Aufgabe 2 durchgeführt.
Spracherkennung
Die Spracherkennung ermöglicht es Computern, Audiodateien mithilfe von Algorithmen des maschinellen Lernens in Text zu transkribieren. Die API eines Transkriptionsdienstes kann mit verschiedenen Programmiersprachen für die Stapeltranskription verwendet werden. Diese Plattformen unterstützen sowohl Echtzeit- als auch asynchrone Transkription.
Die Spracherkennungstechnologie hat zahlreiche Anwendungen, darunter Transkription, Sprachassistenten und Sprachübersetzung.
Vorteile der Nutzung von Spracherkennung für die Transkription
- Schnelle Transkription von Audiodateien
- Zeit- und Arbeitsersparnis
- Echtzeit-Transkription und -Übersetzung
- Barrierefreiheit für Menschen mit Behinderungen
Wie funktionieren Speech-to-Text-KI-Tools?
Der Transkriptionsprozess umfasst:
- Die Audiodaten werden auf das Speech-to-Text-Tool hochgeladen oder dorthin gestreamt
- Verwendung von Algorithmen des maschinellen Lernens, um die Audiodaten zu analysieren und Sprachmuster zu erkennen
- Das Tool wandelt die Sprache mithilfe einer Speech-to-Text-Engine in Text um
- Der transkribierte Text wird dann dem Benutzer angezeigt.
FAQs
Die Transkription von Audio- und Videoaufnahmen kann verwendet werden für:
Sprachassistenten und virtuelle Assistenten
Sprachübersetzung und Dolmetschen
Speech-to-Text-Systeme (ASR) für Menschen mit Behinderungen
Ihre vortrainierten Models ermöglichen die automatische Spracherkennung (ASR) für aufgenommene Audio- und Videodateien. Hochpräzise Audiotranskriptionen umfassen automatische Zeichensetzung und Themenerkennung.
Eine Open-Source-Engine oder ein Spracherkennungsanbieter von einem Dienst, mit dem Ihr Unternehmen bereits zusammenarbeitet (d. h. Google Cloud, AWS transcribe), kann als Transkriptionslösung für die Anforderungen Ihres Unternehmens gewählt werden. Einige von ihnen bieten außerdem kostenlos Credits, wir empfehlen jedoch Vorsicht in Bezug auf die Datensicherheit.
Eine Speech-to-Text-API kann dabei helfen, Audiodateien in Text zu transkribieren. Verarbeitung und Analyse von Audiodaten:
Die Audiodaten werden mithilfe von Techniken wie Rauschunterdrückung und Echounterdrückung verarbeitet
Die Audiodaten werden anschließend mithilfe von Algorithmen des maschinellen Lernens analysiert, um Sprachmuster zu erkennen
Die Algorithmen verwenden akustische Models und Language Models, um gesprochene Wörter und Phrasen zu erkennen
Umwandlung von Sprache in Text mithilfe von Algorithmen des maschinellen Lernens:
Algorithmen des maschinellen Lernens werden auf großen Datasets aus Audio- und Textdaten trainiert
Die Algorithmen lernen, Sprachmuster zu erkennen und in Text umzuwandeln
Die Algorithmen können für bestimmte Anwendungsfälle und Sprachen fine-tuned und angepasst werden.
Weiterführende Literatur
Zitieren Sie diesen Benchmark
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Alper, Şevval},
title = {{Speech-to-Text-Benchmark: Deepgram vs. Whisper}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/speech-to-text}},
note = {AIMultiple. Abgerufen am 21. August 2026}
}Ergebnisse und Zeitstempel von 12 Datenpunkten. Laden Sie die Zusammenfassungsdaten aus den Diagrammen und Tabellen dieses Artikels als ZIP-Datei herunter, die eine CSV-Datei enthält.
Möchten Sie die granularen Daten dahinter? Premium beitreten
Änderungsprotokoll
1 AktualisierungenDie Benchmark-Ergebnisse im Abschnitt „Benchmark-Ergebnisse“ wurden aktualisiert.
Cems Arbeit bei AIMultiple wurde von führenden globalen Publikationen wie Business Insider, Forbes, Morning Brew und Washington Post, von globalen Unternehmen wie Deloitte und HPE, von NGOs wie dem World Economic Forum und von supranationalen Organisationen wie der European Commission zitiert. [1], [2], [3], [4], [5]
Im Laufe seiner Karriere war Cem als Tech-Berater, Tech-Einkäufer und Tech-Unternehmer tätig. Er beriet Unternehmen bei ihren Technologieentscheidungen bei McKinsey & Company und Altman Solon über mehr als ein Jahrzehnt. Er veröffentlichte außerdem einen McKinsey-Bericht zur Digitalisierung.
Er leitete Technologiestrategie und -beschaffung eines Telekommunikationsunternehmens und berichtete dabei direkt an den CEO. Außerdem verantwortete er das kommerzielle Wachstum des Deep-Tech-Unternehmens Hypatos, das innerhalb von zwei Jahren von 0 einen siebenstelligen jährlich wiederkehrenden Umsatz und eine neunstellige Bewertung erreichte. Cems Arbeit bei Hypatos wurde von führenden Technologiepublikationen wie TechCrunch und Business Insider aufgegriffen.
Cem spricht regelmäßig auf internationalen Technologiekonferenzen. Er absolvierte die Bogazici University als Computeringenieur und hat einen MBA von der Columbia Business School.
Şevval konzentriert sich auf KI-Programmierwerkzeuge, KI-Agenten und Quantentechnologien.
Seien Sie der Erste, der kommentiert
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.