Abbiamo valutato i principali fornitori di speech-to-text (STT), concentrandoci in particolare sulle applicazioni sanitarie. Il nostro benchmark ha utilizzato esempi reali per valutare l'accuratezza della trascrizione in contesti medici, dove la precisione è cruciale.
Risultati del benchmark speech-to-text
Sulla base dei risultati sia del tasso di errore sulle parole (WER) sia del tasso di errore sui caratteri (CER), GPT-4o-transcribe dimostra la più alta accuratezza di trascrizione tra tutti i sistemi speech-to-text valutati. Deepgram Nova-v3 e Gladia offrono anch'essi prestazioni elevate, mantenendo bassi tassi di errore in entrambe le metriche.
Metodologia
Dataset
Abbiamo voluto valutare le prestazioni dei modelli sia su campioni brevi e vari sia su un campione lungo, quindi abbiamo condotto due task:
Task 1: Dati vocali sanitari
- Numero totale di campioni: 100
- Durata totale: 9 minuti e 25 secondi
- Durata media per campione: 5,65 secondi
- Contenuto: Dati vocali sanitari, inclusi terminologia medica, interazioni con i pazienti e discussioni cliniche
- Varietà: Diversi parlanti, qualità audio variabile e contesti medici eterogenei parlati in inglese
Specifiche audio:
- Formato: WAV
- Canali: 1 (Mono)
- Ampiezza del campione: 16 bit
- Frequenza di campionamento: 16 kHz
- Bitrate costante: 256 kbps
- Intervallo di durata: da ~4,5 a 11,5 secondi per file
Task 2: Una lezione di anatomia
- Numero totale di campioni: 1
- Durata totale: 8 minuti e 35 secondi
- Contenuto: Una lezione di anatomia tenuta da un medico, inclusa terminologia medica
- Varietà: Un solo parlante parla in inglese nella prima metà del video; nella seconda metà viene riprodotta della musica di sottofondo.
Specifiche audio:
- Formato: WAV
- Canali: 2 (Stereo)
- Ampiezza del campione: 16 bit
- Frequenza di campionamento: 48 kHz
- Bitrate costante: 1536 kbps
Metriche di valutazione
Abbiamo utilizzato il tasso di errore sulle parole (WER) e il tasso di errore sui caratteri (CER) come metriche di valutazione per l'accuratezza della trascrizione. Il tasso di errore sulle parole è calcolato come:
WER = (S + D + I) / N
Dove:
- S = Numero di sostituzioni
- D = Numero di eliminazioni
- I = Numero di inserimenti
- N = Numero totale di parole nel riferimento
La formula calcola il numero minimo di operazioni a livello di parola necessarie per trasformare l'ipotesi nel riferimento, diviso per il numero di parole nel riferimento. Un WER più basso indica una migliore accuratezza, dove lo 0% rappresenta una corrispondenza perfetta.
Il tasso di errore sui caratteri (CER) è calcolato dividendo il numero totale di errori a livello di carattere (inclusi inserimenti, eliminazioni e sostituzioni) per il numero totale di caratteri nel testo di riferimento.
Abbiamo utilizzato le API di speech-to-text per trascrivere i file audio in testo.
La dimensione massima del file che può essere inviato in una volta sola dai fornitori è mostrata nella tabella:
*Poiché Vosk viene eseguito localmente, non vi è alcun limite alla dimensione del file di input. Tuttavia, file audio lunghi potrebbero superare il limite del beam, causando la perdita di alcune probabilità. Pertanto, si consiglia di suddividere i file in segmenti da 1–2 minuti.
Anche Google MedASR opera localmente e non impone un limite massimo alla dimensione del file. Per prestazioni e gestione delle risorse ottimali, si consiglia di elaborare i file lunghi in segmenti più piccoli.
Nota: Per i fornitori con limiti di dimensione dei file più ridotti (come Google e OpenAI), i file audio più grandi devono essere suddivisi in porzioni più piccole prima dell'elaborazione. Abbiamo eseguito questa operazione nel Task 2.
Riconoscimento vocale
Il riconoscimento vocale consente ai computer di trascrivere i file audio in testo utilizzando algoritmi di machine learning. L'API di un servizio di trascrizione può essere utilizzata con vari linguaggi di programmazione per la trascrizione batch. Queste piattaforme supportano sia la trascrizione in tempo reale sia quella asincrona.
La tecnologia di riconoscimento vocale ha numerose applicazioni, tra cui la trascrizione, gli assistenti vocali e la traduzione linguistica.
Vantaggi dell'uso del riconoscimento vocale per la trascrizione
- Trascrizione rapida dei file audio
- Risparmio di tempo e fatica
- Trascrizione e traduzione in tempo reale
- Accessibilità per le persone con disabilità
Come funzionano gli strumenti IA di speech-to-text?
Il processo di trascrizione include:
- I dati audio vengono caricati o trasmessi in streaming allo strumento di speech-to-text
- Utilizzo di algoritmi di machine learning per analizzare i dati audio e identificare schemi nel parlato
- Lo strumento converte il parlato in testo utilizzando un motore di speech-to-text
- Il testo trascritto viene quindi visualizzato all'utente.
FAQ
La trascrizione di registrazioni audio e video può essere utilizzata in:
Assistenti vocali e assistenti virtuali
Traduzione e interpretazione linguistica
Sistemi di speech-to-text (ASR) per persone con disabilità
I loro modelli pre-addestrati consentono il riconoscimento vocale automatico (ASR) per file audio e video registrati. Le trascrizioni audio ad alta accuratezza includono punteggiatura automatica e rilevamento degli argomenti.
Un motore open-source o un fornitore di riconoscimento vocale di un servizio con cui la tua azienda già lavora (ad es. Google Cloud, AWS Transcribe) può essere scelto come soluzione di trascrizione per le esigenze della tua azienda. Alcuni di essi offrono anche crediti gratuiti, ma raccomandiamo cautela per quanto riguarda la sicurezza dei dati.
Un'API di speech-to-text può aiutare a trascrivere i file audio in testo. Elaborazione e analisi dei dati audio:
I dati audio vengono elaborati utilizzando tecniche come la riduzione del rumore e la cancellazione dell'eco
I dati audio vengono quindi analizzati utilizzando algoritmi di machine learning per identificare schemi nel parlato
Gli algoritmi utilizzano modelli acustici e modelli linguistici per riconoscere parole e frasi pronunciate
Conversione del parlato in testo utilizzando algoritmi di machine learning:
Gli algoritmi di machine learning sono addestrati su grandi dataset di dati audio e testuali
Gli algoritmi imparano a riconoscere schemi nel parlato e a convertirli in testo
Gli algoritmi possono essere sottoposti a fine-tuning e personalizzati per casi d'uso e lingue specifici
Ulteriori letture
Cita questo benchmark
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Alper, Şevval},
title = {{Benchmark Speech-to-Text: Deepgram vs. Whisper}},
year = {2026},
month = jan,
howpublished = {\url{https://aimultiple.com/speech-to-text}},
note = {AIMultiple. Consultato il 22 Gennaio 2026}
}
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.