Premium
Dienstleistungen
Premium

Speech-to-Text-Benchmark: Deepgram vs. Whisper

Cem Dilmegani
Cem Dilmegani
aktualisiert am 21. Aug. 2026

Wir haben die führenden Speech-to-Text-Anbieter (STT) einem Benchmark unterzogen, wobei wir uns speziell auf Anwendungen im Gesundheitswesen konzentrierten. Unser Benchmark verwendete reale Beispiele, um die Transkriptionsgenauigkeit in medizinischen Kontexten zu bewerten, in denen Präzision entscheidend ist.

Diagramm wird geladen

Ergebnisse des Speech-to-Text-Benchmarks

Basierend auf den Ergebnissen sowohl der Wortfehlerrate (WER) als auch der Zeichenfehlerrate (CER) zeigt GPT-4o-transcribe die höchste Transkriptionsgenauigkeit unter allen bewerteten Speech-to-Text-Systemen. Deepgram Nova-v3 und Gladia schneiden ebenfalls stark ab und halten die Fehlerraten bei beiden Metriken niedrig.

Methodik

Dataset

Wir wollten die Leistungen der Models sowohl in kleinen und verschiedenen Samples als auch in einem langen Sample bewerten, daher haben wir zwei Aufgaben durchgeführt:

Aufgabe 1: Sprachdaten aus dem Gesundheitswesen

  • Gesamtzahl der Samples: 100
  • Gesamtdauer: 9 Minuten und 25 Sekunden
  • Durchschnittliche Dauer pro Sample: 5,65 Sekunden
  • Inhalt: Sprachdaten aus dem Gesundheitswesen, einschließlich medizinischer Terminologie, Patienteninteraktionen und klinischer Gespräche
  • Vielfalt: Verschiedene Sprecher, unterschiedliche Audioqualität und vielfältige medizinische Kontexte, auf Englisch gesprochen

Audiospezifikationen:

  • Format: WAV
  • Kanäle: 1 (Mono)
  • Sample-Breite: 16-Bit
  • Abtastrate: 16 kHz
  • Konstante Bitrate: 256 kbps
  • Dauerbereich: ~4.5 bis 11,5 Sekunden pro Datei

Aufgabe 2: Eine Anatomievorlesung

  • Gesamtzahl der Samples: 1
  • Gesamtdauer: 8 Minuten und 35 Sekunden
  • Inhalt: Eine Anatomievorlesung eines Arztes, einschließlich medizinischer Terminologie
  • Vielfalt: Ein Sprecher spricht in der ersten Hälfte des Videos auf Englisch; im Hintergrund läuft Musik.

Audiospezifikationen:

  • Format: WAV
  • Kanäle: 2 (Stereo)
  • Sample-Breite: 16-Bit
  • Abtastrate: 48 kHz
  • Konstante Bitrate: 1536 kbps

Bewertungsmetriken

Wir verwendeten die Wortfehlerrate (WER) und die Zeichenfehlerrate (CER) als Bewertungsmetriken für die Transkriptionsgenauigkeit. Die Wortfehlerrate wird wie folgt berechnet:

WER = (S + D + I) / N

Wobei:

  • S = Anzahl der Substitutionen
  • D = Anzahl der Löschungen
  • I = Anzahl der Einfügungen
  • N = Gesamtzahl der Wörter im Referenztext

Die Formel berechnet die minimale Anzahl an Wortoperationen, die erforderlich ist, um die Hypothese in die Referenz zu überführen, geteilt durch die Anzahl der Wörter in der Referenz. Ein niedrigerer WER weist auf eine bessere Genauigkeit hin, wobei 0 % eine perfekte Übereinstimmung darstellt.

Die Zeichenfehlerrate (CER) wird berechnet, indem die Gesamtzahl der Zeichenfehler (einschließlich Einfügungen, Löschungen und Substitutionen) durch die Gesamtzahl der Zeichen im Referenztext geteilt wird.

Wir verwendeten Speech-to-Text-APIs, um Audiodateien in Text zu transkribieren.

Die von den Anbietern maximal auf einmal verarbeitbare Dateigröße ist in der Tabelle dargestellt:

*Da Vosk lokal ausgeführt wird, gibt es keine Begrenzung der Eingabedateigröße. Allerdings können lange Audiodateien das Beam-Limit überschreiten, wodurch einige Wahrscheinlichkeiten verloren gehen können. Daher wird empfohlen, die Dateien in Segmente von 1–2 Minuten aufzuteilen.

Google MedASR wird ebenfalls lokal ausgeführt und legt keine maximale Dateigrößenbeschränkung fest. Für optimale Leistung und Ressourcenverwaltung wird empfohlen, lange Dateien in kleineren Segmenten zu verarbeiten.

Hinweis: Bei Anbietern mit kleineren Dateigrößenbeschränkungen (wie Google und OpenAI) müssen größere Audiodateien vor der Verarbeitung in kleinere Teile aufgeteilt werden. Wir haben dies in Aufgabe 2 durchgeführt.

Spracherkennung

Die Spracherkennung ermöglicht es Computern, Audiodateien mithilfe von Algorithmen des maschinellen Lernens in Text zu transkribieren. Die API eines Transkriptionsdienstes kann mit verschiedenen Programmiersprachen für die Stapeltranskription verwendet werden. Diese Plattformen unterstützen sowohl Echtzeit- als auch asynchrone Transkription.

Die Spracherkennungstechnologie hat zahlreiche Anwendungen, darunter Transkription, Sprachassistenten und Sprachübersetzung.

Vorteile der Nutzung von Spracherkennung für die Transkription

  • Schnelle Transkription von Audiodateien
  • Zeit- und Arbeitsersparnis
  • Echtzeit-Transkription und -Übersetzung
  • Barrierefreiheit für Menschen mit Behinderungen
Lassen Sie unser Team einen Ihrer Geschäftsprozesse kostenlos mit KI-Agenten automatisieren.
Einen Prozess automatisieren

Wie funktionieren Speech-to-Text-KI-Tools?

Der Transkriptionsprozess umfasst:

  • Die Audiodaten werden auf das Speech-to-Text-Tool hochgeladen oder dorthin gestreamt
  • Verwendung von Algorithmen des maschinellen Lernens, um die Audiodaten zu analysieren und Sprachmuster zu erkennen
  • Das Tool wandelt die Sprache mithilfe einer Speech-to-Text-Engine in Text um
  • Der transkribierte Text wird dann dem Benutzer angezeigt.

FAQs

Die Transkription von Audio- und Videoaufnahmen kann verwendet werden für:
Sprachassistenten und virtuelle Assistenten
Sprachübersetzung und Dolmetschen
Speech-to-Text-Systeme (ASR) für Menschen mit Behinderungen

Ihre vortrainierten Models ermöglichen die automatische Spracherkennung (ASR) für aufgenommene Audio- und Videodateien. Hochpräzise Audiotranskriptionen umfassen automatische Zeichensetzung und Themenerkennung.
Eine Open-Source-Engine oder ein Spracherkennungsanbieter von einem Dienst, mit dem Ihr Unternehmen bereits zusammenarbeitet (d. h. Google Cloud, AWS transcribe), kann als Transkriptionslösung für die Anforderungen Ihres Unternehmens gewählt werden. Einige von ihnen bieten außerdem kostenlos Credits, wir empfehlen jedoch Vorsicht in Bezug auf die Datensicherheit.

Eine Speech-to-Text-API kann dabei helfen, Audiodateien in Text zu transkribieren. Verarbeitung und Analyse von Audiodaten:
Die Audiodaten werden mithilfe von Techniken wie Rauschunterdrückung und Echounterdrückung verarbeitet
Die Audiodaten werden anschließend mithilfe von Algorithmen des maschinellen Lernens analysiert, um Sprachmuster zu erkennen
Die Algorithmen verwenden akustische Models und Language Models, um gesprochene Wörter und Phrasen zu erkennen
Umwandlung von Sprache in Text mithilfe von Algorithmen des maschinellen Lernens:
Algorithmen des maschinellen Lernens werden auf großen Datasets aus Audio- und Textdaten trainiert
Die Algorithmen lernen, Sprachmuster zu erkennen und in Text umzuwandeln
Die Algorithmen können für bestimmte Anwendungsfälle und Sprachen fine-tuned und angepasst werden.

Verpassen Sie nicht unsere Benchmarks und datengestützten Erkenntnisse. Die Schaltfläche öffnet Google; die Auswahl von AIMultiple bestätigt, dass Sie AIMultiple häufiger in den Google-Suchergebnissen sehen möchten.
GoogleAls bevorzugte Quelle hinzufügen

Weiterführende Literatur

Zitieren Sie diesen Benchmark

Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.

Cem Dilmegani and Şevval Alper (2026) - "Speech-to-Text-Benchmark: Deepgram vs. Whisper". Online veröffentlicht auf AIMultiple.com. Abgerufen am 21. August 2026, von: https://aimultiple.com/speech-to-text [Online-Ressource]

Dilmegani, C., & Alper, Ş. (2026, 21. August). Speech-to-Text-Benchmark: Deepgram vs. Whisper. AIMultiple. https://aimultiple.com/speech-to-text

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Alper, Şevval},
  title  = {{Speech-to-Text-Benchmark: Deepgram vs. Whisper}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/speech-to-text}},
  note   = {AIMultiple. Abgerufen am 21. August 2026}
}
Alle Daten herunterladen

Ergebnisse und Zeitstempel von 12 Datenpunkten. Laden Sie die Zusammenfassungsdaten aus den Diagrammen und Tabellen dieses Artikels als ZIP-Datei herunter, die eine CSV-Datei enthält.

Zuletzt aktualisiert: 28. September 2026
Herunterladen

Möchten Sie die granularen Daten dahinter? Premium beitreten

Änderungsprotokoll

1 Aktualisierungen
  1. Die Benchmark-Ergebnisse im Abschnitt „Benchmark-Ergebnisse“ wurden aktualisiert.

Cem Dilmegani
Cem Dilmegani
Leitender Analyst
Cem ist seit 2017 leitender Analyst bei AIMultiple.

Cems Arbeit bei AIMultiple wurde von führenden globalen Publikationen wie Business Insider, Forbes, Morning Brew und Washington Post, von globalen Unternehmen wie Deloitte und HPE, von NGOs wie dem World Economic Forum und von supranationalen Organisationen wie der European Commission zitiert. [1], [2], [3], [4], [5]

Im Laufe seiner Karriere war Cem als Tech-Berater, Tech-Einkäufer und Tech-Unternehmer tätig. Er beriet Unternehmen bei ihren Technologieentscheidungen bei McKinsey & Company und Altman Solon über mehr als ein Jahrzehnt. Er veröffentlichte außerdem einen McKinsey-Bericht zur Digitalisierung.

Er leitete Technologiestrategie und -beschaffung eines Telekommunikationsunternehmens und berichtete dabei direkt an den CEO. Außerdem verantwortete er das kommerzielle Wachstum des Deep-Tech-Unternehmens Hypatos, das innerhalb von zwei Jahren von 0 einen siebenstelligen jährlich wiederkehrenden Umsatz und eine neunstellige Bewertung erreichte. Cems Arbeit bei Hypatos wurde von führenden Technologiepublikationen wie TechCrunch und Business Insider aufgegriffen.

Cem spricht regelmäßig auf internationalen Technologiekonferenzen. Er absolvierte die Bogazici University als Computeringenieur und hat einen MBA von der Columbia Business School.
Vollständiges Profil anzeigen
Recherchiert von
Şevval Alper
Şevval Alper
KI-Forscherin
Şevval ist KI-Forscherin bei AIMultiple. Sie hat bereits Forschungserfahrung in der Erzeugung von Pseudozufallszahlen mithilfe chaotischer Systeme.
Şevval konzentriert sich auf KI-Programmierwerkzeuge, KI-Agenten und Quantentechnologien.
Vollständiges Profil anzeigen

Seien Sie der Erste, der kommentiert

Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.

0/450