Nous avons comparé les principaux fournisseurs de reconnaissance vocale (STT), en nous concentrant spécifiquement sur les applications de santé. Notre benchmark a utilisé des exemples réels pour évaluer la précision de la transcription dans des contextes médicaux, où la précision est cruciale.
Résultats du benchmark de reconnaissance vocale
Sur la base des résultats du taux d'erreur de mots (WER) et du taux d'erreur de caractères (CER), GPT-4o-transcribe démontre la plus haute précision de transcription parmi tous les systèmes de reconnaissance vocale évalués. Deepgram Nova-v3 et Gladia obtiennent également de bons résultats, en maintenant des taux d'erreur faibles sur les deux métriques.
Méthodologie
Jeu de données
Nous souhaitions évaluer les performances des modèles à la fois sur des échantillons petits et variés, ainsi que sur un échantillon long, nous avons donc mené deux tâches :
Tâche 1 : Données vocales de santé
- Nombre total d'échantillons : 100
- Durée totale : 9 minutes et 25 secondes
- Durée moyenne par échantillon : 5,65 secondes
- Contenu : Données vocales de santé, incluant la terminologie médicale, les interactions avec les patients et les discussions cliniques
- Variété : Différents locuteurs, qualité audio variable et divers contextes médicaux parlés en anglais
Spécifications audio :
- Format : WAV
- Canaux : 1 (Mono)
- Profondeur d'échantillonnage : 16 bits
- Fréquence d'échantillonnage : 16 kHz
- Débit binaire constant : 256 kbps
- Plage de durée : ~4,5 à 11,5 secondes par fichier
Tâche 2 : Un cours d'anatomie
- Nombre total d'échantillons : 1
- Durée totale : 8 minutes et 35 secondes
- Contenu : Un cours d'anatomie donné par un médecin, incluant la terminologie médicale
- Variété : Un seul locuteur parle en anglais dans la première moitié de la vidéo ; une musique de fond est diffusée.
Spécifications audio :
- Format : WAV
- Canaux : 2 (Stéréo)
- Profondeur d'échantillonnage : 16 bits
- Fréquence d'échantillonnage : 48 kHz
- Débit binaire constant : 1536 kbps
Métriques d'évaluation
Nous avons utilisé le taux d'erreur de mots (WER) et le taux d'erreur de caractères (CER) comme métriques d'évaluation de la précision de la transcription. Le taux d'erreur de mots est calculé comme suit :
WER = (S + D + I) / N
Où :
- S = Nombre de substitutions
- D = Nombre de suppressions
- I = Nombre d'insertions
- N = Nombre total de mots dans la vérité terrain
La formule calcule le nombre minimum d'opérations au niveau des mots nécessaires pour transformer l'hypothèse en référence, divisé par le nombre de mots dans la référence. Un WER plus faible indique une meilleure précision, 0% correspondant à une correspondance parfaite.
Le taux d'erreur de caractères (CER) est calculé en divisant le nombre total d'erreurs au niveau des caractères (y compris les insertions, suppressions et substitutions) par le nombre total de caractères dans le texte de référence.
Nous avons utilisé des APIs de reconnaissance vocale pour transcrire les fichiers audio en texte.
La taille maximale de fichier acceptée en une fois par les fournisseurs est indiquée dans le tableau :
*Étant donné que Vosk s'exécute localement, il n'y a pas de limite de taille de fichier d'entrée. Cependant, les longs fichiers audio peuvent dépasser la limite de faisceau, entraînant la perte de certaines probabilités. Il est donc recommandé de diviser les fichiers en segments de 1 à 2 minutes.
Google MedASR fonctionne également localement et n'impose pas de limite de taille de fichier maximale. Pour des performances et une gestion des ressources optimales, il est recommandé de traiter les longs fichiers en segments plus petits.
Remarque : Pour les fournisseurs dont les limites de taille de fichier sont plus petites (comme Google et OpenAI), les fichiers audio plus volumineux doivent être divisés en plus petits morceaux avant le traitement. Nous avons effectué cela dans la tâche 2.
Reconnaissance vocale
La reconnaissance vocale permet aux ordinateurs de transcrire des fichiers audio en texte à l'aide d'algorithmes d'apprentissage automatique. L'API d'un service de transcription peut être utilisée avec divers langages de programmation pour la transcription par lots. Ces plateformes prennent en charge à la fois la transcription en temps réel et asynchrone.
La technologie de reconnaissance vocale a de nombreuses applications, notamment la transcription, les assistants vocaux et la traduction linguistique.
Avantages de l'utilisation de la reconnaissance vocale pour la transcription
- Transcription rapide des fichiers audio
- Économies de temps et d'efforts
- Transcription et traduction en temps réel
- Accessibilité pour les personnes handicapées
Comment fonctionnent les outils IA de reconnaissance vocale ?
Le processus de transcription comprend :
- Les données audio sont téléchargées ou diffusées vers l'outil de reconnaissance vocale
- Utilisation d'algorithmes d'apprentissage automatique pour analyser les données audio et identifier les schémas de parole
- L'outil convertit la parole en texte à l'aide d'un moteur de reconnaissance vocale
- Le texte transcrit est ensuite affiché à l'utilisateur.
FAQ
La transcription d'enregistrements audio et vidéo peut être utilisée dans :
Les assistants vocaux et les assistants virtuels
La traduction et l'interprétation linguistiques
Les systèmes de reconnaissance vocale (ASR) pour les personnes handicapées
Leurs modèles pré-entraînés permettent la reconnaissance automatique de la parole (ASR) pour les fichiers audio et vidéo enregistrés. Les transcriptions audio de haute précision incluent la ponctuation automatique et la détection de sujets.
Un moteur open source ou un fournisseur de reconnaissance vocale issu d'un service avec lequel votre entreprise travaille déjà (par exemple, Google Cloud, AWS Transcribe) peut être choisi comme solution de transcription pour les besoins de votre entreprise. Certains d'entre eux offrent également des crédits gratuits, mais nous recommandons la prudence en matière de sécurité des données.
Une API de reconnaissance vocale peut aider à transcrire les fichiers audio en texte. Traitement et analyse des données audio :
Les données audio sont traitées à l'aide de techniques telles que la réduction du bruit et l'annulation d'écho
Les données audio sont ensuite analysées à l'aide d'algorithmes d'apprentissage automatique pour identifier les schémas de parole
Les algorithmes utilisent des modèles acoustiques et des modèles de langage pour reconnaître les mots et les phrases prononcés
Conversion de la parole en texte à l'aide d'algorithmes d'apprentissage automatique :
Les algorithmes d'apprentissage automatique sont entraînés sur de grands jeux de données de données audio et textuelles
Les algorithmes apprennent à reconnaître les schémas de parole et à les convertir en texte
Les algorithmes peuvent être affinés et personnalisés pour des cas d'utilisation et des langues spécifiques
Pour approfondir
- Comparatif des 10 meilleurs logiciels de synthèse vocale
- Plus de 10 services de collecte de données vocales
Citez ce benchmark
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Alper, Şevval},
title = {{Benchmark de reconnaissance vocale: Deepgram vs. Whisper}},
year = {2026},
month = jan,
howpublished = {\url{https://aimultiple.com/speech-to-text}},
note = {AIMultiple. Consulté le 22 Janvier 2026}
}
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.