Dienstleistungen
Kontaktieren

Spracherkennungs-Benchmark: Deepgram vs. Whisper

Cem Dilmegani
Cem Dilmegani
aktualisiert am 22. Jan. 2026

Wir haben die führenden Spracherkennungsanbieter (STT) einem Benchmark unterzogen, mit besonderem Fokus auf Anwendungen im Gesundheitswesen. Unser Benchmark verwendete reale Beispiele, um die Transkriptionsgenauigkeit in medizinischen Kontexten zu bewerten, wo Präzision entscheidend ist.

Ergebnisse des Spracherkennungs-Benchmarks

Basierend auf den Ergebnissen sowohl der Wortfehlerrate (WER) als auch der Zeichenfehlerrate (CER) zeigt GPT-4o-transcribe die höchste Transkriptionsgenauigkeit unter allen bewerteten Spracherkennungssystemen. Deepgram Nova-v3 und Gladia schneiden ebenfalls stark ab und halten die Fehlerraten bei beiden Metriken niedrig.

Loading Chart

Methodik

Datensatz

Wir wollten die Leistung der Modelle sowohl anhand vieler kleiner, unterschiedlicher Stichproben als auch einer langen Probe bewerten und führten daher zwei Aufgaben durch:

Aufgabe 1: Sprachdaten aus dem Gesundheitswesen

  • Gesamtzahl der Stichproben: 100
  • Gesamtdauer: 9 Minuten und 25 Sekunden
  • Durchschnittliche Dauer pro Stichprobe: 5,65 Sekunden
  • Inhalt: Sprachdaten aus dem Gesundheitswesen, einschließlich medizinischer Terminologie, Patienteninteraktionen und klinischer Diskussionen
  • Vielfalt: Verschiedene Sprecher, variierende Audioqualität und diverse medizinische Kontexte auf Englisch

Audiospezifikationen:

  • Format: WAV
  • Kanäle: 1 (Mono)
  • Abtasttiefe: 16-Bit
  • Abtastrate: 16 kHz
  • Konstante Bitrate: 256 kbps
  • Dauerbereich: ~4,5 bis 11,5 Sekunden pro Datei

Aufgabe 2: Eine Anatomievorlesung

  • Gesamtzahl der Stichproben: 1
  • Gesamtdauer: 8 Minuten und 35 Sekunden
  • Inhalt: Eine Anatomievorlesung, gehalten von einem Arzt, einschließlich medizinischer Terminologie
  • Vielfalt: Ein Sprecher spricht in der ersten Hälfte des Videos Englisch; im Hintergrund läuft Musik.

Audiospezifikationen:

  • Format: WAV
  • Kanäle: 2 (Stereo)
  • Abtasttiefe: 16-Bit
  • Abtastrate: 48 kHz
  • Konstante Bitrate: 1536 kbps

Evaluierungsmetriken

Wir verwendeten die Wortfehlerrate (WER) und die Zeichenfehlerrate (CER) als Evaluierungsmetriken für die Transkriptionsgenauigkeit. Die Wortfehlerrate wird wie folgt berechnet:

WER = (S + D + I) / N

Wobei:

  • S = Anzahl der Substitutionen
  • D = Anzahl der Löschungen
  • I = Anzahl der Einfügungen
  • N = Gesamtzahl der Wörter in der Referenz

Die Formel berechnet die minimale Anzahl von Operationen auf Wortebene, die benötigt werden, um die Hypothese in die Referenz zu transformieren, geteilt durch die Anzahl der Wörter in der Referenz. Eine niedrigere WER zeigt eine bessere Genauigkeit an, wobei 0 % eine perfekte Übereinstimmung bedeuten.

Die Zeichenfehlerrate (CER) wird berechnet, indem die Gesamtzahl der Fehler auf Zeichenebene (einschließlich Einfügungen, Löschungen und Substitutionen) durch die Gesamtzahl der Zeichen im Referenztext geteilt wird.

Wir verwendeten Spracherkennungs-APIs, um Audiodateien in Text zu transkribieren.

Die maximale Dateigröße, die von den Anbietern auf einmal eingegeben werden kann, ist in der Tabelle dargestellt:

*Da Vosk lokal läuft, gibt es keine Begrenzung der Eingabedateigröße. Lange Audiodateien können jedoch die Beam-Grenze überschreiten, wodurch einige Wahrscheinlichkeiten verloren gehen. Daher wird empfohlen, die Dateien in 1–2-minütige Segmente aufzuteilen.

Google MedASR läuft ebenfalls lokal und legt keine maximale Dateigröße fest. Für eine optimale Leistung und Ressourcenverwaltung wird die Verarbeitung langer Dateien in kleineren Segmenten empfohlen.

Hinweis: Bei Anbietern mit kleineren Dateigrößenbeschränkungen (wie Google und OpenAI) müssen größere Audiodateien vor der Verarbeitung in kleinere Teile aufgeteilt werden. Wir haben dies in Aufgabe 2 durchgeführt.

Spracherkennung

Spracherkennung ermöglicht es Computern, Audiodateien mithilfe von maschinellen Lernalgorithmen in Text zu transkribieren. Die API eines Transkriptionsdienstes kann mit verschiedenen Programmiersprachen für die Stapeltranskription verwendet werden. Diese Plattformen unterstützen sowohl Echtzeit- als auch asynchrone Transkription.

Spracherkennungstechnologie hat zahlreiche Anwendungen, darunter Transkription, Sprachassistenten und Sprachübersetzung.

Vorteile der Nutzung von Spracherkennung für die Transkription

  • Schnelle Transkription von Audiodateien
  • Zeit- und Arbeitsersparnis
  • Echtzeit-Transkription und -Übersetzung
  • Barrierefreiheit für Menschen mit Behinderungen
Lassen Sie unser Team einen Ihrer Geschäftsprozesse kostenlos mit KI-Agenten automatisieren.
Einen Prozess automatisieren

Wie funktionieren KI-Tools zur Spracherkennung?

Der Transkriptionsprozess umfasst:

  • Audiodaten werden in das Spracherkennungstool hochgeladen oder gestreamt
  • Verwendung von maschinellen Lernalgorithmen zur Analyse der Audiodaten und Identifizierung von Sprachmustern
  • Das Tool wandelt die Sprache mithilfe einer Spracherkennungs-Engine in Text um
  • Der transkribierte Text wird dann dem Benutzer angezeigt.

FAQs

Die Transkription von Audio- und Videoaufnahmen kann verwendet werden für:
Sprachassistenten und virtuelle Assistenten
Sprachübersetzung und Dolmetschen
Spracherkennungssysteme (ASR) für Menschen mit Behinderungen

Ihre vortrainierten Modelle ermöglichen die automatische Spracherkennung (ASR) für aufgezeichnete Audio- und Videodateien. Hochpräzise Audiotranskriptionen umfassen automatische Zeichensetzung und Themenerkennung.
Eine Open-Source-Engine oder ein Spracherkennungsanbieter von einem Dienst, mit dem Ihr Unternehmen bereits zusammenarbeitet (z. B. Google Cloud, AWS Transcribe), kann als Transkriptionslösung für die Bedürfnisse Ihres Unternehmens gewählt werden. Einige von ihnen bieten auch kostenlose Credits an, aber wir empfehlen Vorsicht in Bezug auf die Datensicherheit.

Eine Spracherkennungs-API kann helfen, Audiodateien in Text zu transkribieren. Verarbeitung und Analyse von Audiodaten:
Audiodaten werden mit Techniken wie Rauschunterdrückung und Echounterdrückung verarbeitet
Die Audiodaten werden dann mit maschinellen Lernalgorithmen analysiert, um Sprachmuster zu identifizieren
Die Algorithmen verwenden akustische Modelle und Sprachmodelle, um gesprochene Wörter und Phrasen zu erkennen
Konvertierung von Sprache in Text mit maschinellen Lernalgorithmen:
Maschinelle Lernalgorithmen werden anhand großer Datensätze von Audio- und Textdaten trainiert
Die Algorithmen lernen, Sprachmuster zu erkennen und in Text umzuwandeln
Die Algorithmen können für bestimmte Anwendungsfälle und Sprachen feinabgestimmt und angepasst werden.

Entdecken Sie weitere unserer Benchmarks und datengestützten Erkenntnisse in der Google-Suche.
GoogleAls bevorzugte Quelle hinzufügen

Weiterführende Literatur

Zitieren Sie diesen Benchmark

Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.

Cem Dilmegani and Şevval Alper (2026) - "Spracherkennungs-Benchmark: Deepgram vs. Whisper". Online veröffentlicht auf AIMultiple.com. Abgerufen am 22. Januar 2026, von: https://aimultiple.com/speech-to-text [Online-Ressource]

Dilmegani, C., & Alper, Ş. (2026, 22. Januar). Spracherkennungs-Benchmark: Deepgram vs. Whisper. AIMultiple. https://aimultiple.com/speech-to-text

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Alper, Şevval},
  title  = {{Spracherkennungs-Benchmark: Deepgram vs. Whisper}},
  year   = {2026},
  month  = jan,
  howpublished    = {\url{https://aimultiple.com/speech-to-text}},
  note   = {AIMultiple. Abgerufen am 22. Januar 2026}
}
Cem Dilmegani
Cem Dilmegani
Leitender Analyst
Cem ist seit 2017 leitender Analyst bei AIMultiple. AIMultiple informiert monatlich Hunderttausende von Unternehmen (laut similarWeb), darunter 55 % der Fortune 500. Cems Arbeit wurde von führenden globalen Publikationen wie Business Insider, Forbes und der Washington Post, von globalen Unternehmen wie Deloitte und HPE sowie von NGOs wie dem Weltwirtschaftsforum und supranationalen Organisationen wie der Europäischen Kommission zitiert. Weitere namhafte Unternehmen und Ressourcen, die AIMultiple referenziert haben, finden Sie hier. Im Laufe seiner Karriere war Cem als Technologieberater, Technologieeinkäufer und Technologieunternehmer tätig. Über ein Jahrzehnt lang beriet er Unternehmen bei McKinsey & Company und Altman Solon in ihren Technologieentscheidungen. Er veröffentlichte außerdem einen McKinsey-Bericht zur Digitalisierung. Bei einem Telekommunikationsunternehmen leitete er die Technologiestrategie und -beschaffung und berichtete direkt an den CEO. Darüber hinaus verantwortete er das kommerzielle Wachstum des Deep-Tech-Unternehmens Hypatos, das innerhalb von zwei Jahren von null auf einen siebenstelligen jährlichen wiederkehrenden Umsatz und eine neunstellige Unternehmensbewertung kam. Cems Arbeit bei Hypatos wurde von führenden Technologiepublikationen wie TechCrunch und Business Insider gewürdigt. Er ist ein gefragter Redner auf internationalen Technologiekonferenzen. Cem absolvierte sein Studium der Informatik an der Bogazici-Universität und besitzt einen MBA der Columbia Business School.
Vollständiges Profil anzeigen
Recherchiert von
Şevval Alper
Şevval Alper
KI-Forscher
Şevval ist Branchenanalystin bei AIMultiple und spezialisiert auf KI-Codierungswerkzeuge, KI-Agenten und Quantentechnologien.
Vollständiges Profil anzeigen

Seien Sie der Erste, der kommentiert

Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.

0/450