Servizi
Contattaci

Abbiamo valutato i principali fornitori di speech-to-text (STT), concentrandoci in particolare sulle applicazioni sanitarie. Il nostro benchmark ha utilizzato esempi reali per valutare l'accuratezza della trascrizione in contesti medici, dove la precisione è cruciale.

Risultati del benchmark speech-to-text

Sulla base dei risultati sia del tasso di errore sulle parole (WER) sia del tasso di errore sui caratteri (CER), GPT-4o-transcribe dimostra la più alta accuratezza di trascrizione tra tutti i sistemi speech-to-text valutati. Deepgram Nova-v3 e Gladia offrono anch'essi prestazioni elevate, mantenendo bassi tassi di errore in entrambe le metriche.

Loading Chart

Metodologia

Dataset

Abbiamo voluto valutare le prestazioni dei modelli sia su campioni brevi e vari sia su un campione lungo, quindi abbiamo condotto due task:

Task 1: Dati vocali sanitari

  • Numero totale di campioni: 100
  • Durata totale: 9 minuti e 25 secondi
  • Durata media per campione: 5,65 secondi
  • Contenuto: Dati vocali sanitari, inclusi terminologia medica, interazioni con i pazienti e discussioni cliniche
  • Varietà: Diversi parlanti, qualità audio variabile e contesti medici eterogenei parlati in inglese

Specifiche audio:

  • Formato: WAV
  • Canali: 1 (Mono)
  • Ampiezza del campione: 16 bit
  • Frequenza di campionamento: 16 kHz
  • Bitrate costante: 256 kbps
  • Intervallo di durata: da ~4,5 a 11,5 secondi per file

Task 2: Una lezione di anatomia

  • Numero totale di campioni: 1
  • Durata totale: 8 minuti e 35 secondi
  • Contenuto: Una lezione di anatomia tenuta da un medico, inclusa terminologia medica
  • Varietà: Un solo parlante parla in inglese nella prima metà del video; nella seconda metà viene riprodotta della musica di sottofondo.

Specifiche audio:

  • Formato: WAV
  • Canali: 2 (Stereo)
  • Ampiezza del campione: 16 bit
  • Frequenza di campionamento: 48 kHz
  • Bitrate costante: 1536 kbps

Metriche di valutazione

Abbiamo utilizzato il tasso di errore sulle parole (WER) e il tasso di errore sui caratteri (CER) come metriche di valutazione per l'accuratezza della trascrizione. Il tasso di errore sulle parole è calcolato come:

WER = (S + D + I) / N

Dove:

  • S = Numero di sostituzioni
  • D = Numero di eliminazioni
  • I = Numero di inserimenti
  • N = Numero totale di parole nel riferimento

La formula calcola il numero minimo di operazioni a livello di parola necessarie per trasformare l'ipotesi nel riferimento, diviso per il numero di parole nel riferimento. Un WER più basso indica una migliore accuratezza, dove lo 0% rappresenta una corrispondenza perfetta.

Il tasso di errore sui caratteri (CER) è calcolato dividendo il numero totale di errori a livello di carattere (inclusi inserimenti, eliminazioni e sostituzioni) per il numero totale di caratteri nel testo di riferimento.

Abbiamo utilizzato le API di speech-to-text per trascrivere i file audio in testo.

La dimensione massima del file che può essere inviato in una volta sola dai fornitori è mostrata nella tabella:

*Poiché Vosk viene eseguito localmente, non vi è alcun limite alla dimensione del file di input. Tuttavia, file audio lunghi potrebbero superare il limite del beam, causando la perdita di alcune probabilità. Pertanto, si consiglia di suddividere i file in segmenti da 1–2 minuti.

Anche Google MedASR opera localmente e non impone un limite massimo alla dimensione del file. Per prestazioni e gestione delle risorse ottimali, si consiglia di elaborare i file lunghi in segmenti più piccoli.

Nota: Per i fornitori con limiti di dimensione dei file più ridotti (come Google e OpenAI), i file audio più grandi devono essere suddivisi in porzioni più piccole prima dell'elaborazione. Abbiamo eseguito questa operazione nel Task 2.

Riconoscimento vocale

Il riconoscimento vocale consente ai computer di trascrivere i file audio in testo utilizzando algoritmi di machine learning. L'API di un servizio di trascrizione può essere utilizzata con vari linguaggi di programmazione per la trascrizione batch. Queste piattaforme supportano sia la trascrizione in tempo reale sia quella asincrona.

La tecnologia di riconoscimento vocale ha numerose applicazioni, tra cui la trascrizione, gli assistenti vocali e la traduzione linguistica.

Vantaggi dell'uso del riconoscimento vocale per la trascrizione

  • Trascrizione rapida dei file audio
  • Risparmio di tempo e fatica
  • Trascrizione e traduzione in tempo reale
  • Accessibilità per le persone con disabilità
Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Come funzionano gli strumenti IA di speech-to-text?

Il processo di trascrizione include:

  • I dati audio vengono caricati o trasmessi in streaming allo strumento di speech-to-text
  • Utilizzo di algoritmi di machine learning per analizzare i dati audio e identificare schemi nel parlato
  • Lo strumento converte il parlato in testo utilizzando un motore di speech-to-text
  • Il testo trascritto viene quindi visualizzato all'utente.

FAQ

La trascrizione di registrazioni audio e video può essere utilizzata in:
Assistenti vocali e assistenti virtuali
Traduzione e interpretazione linguistica
Sistemi di speech-to-text (ASR) per persone con disabilità

I loro modelli pre-addestrati consentono il riconoscimento vocale automatico (ASR) per file audio e video registrati. Le trascrizioni audio ad alta accuratezza includono punteggiatura automatica e rilevamento degli argomenti.
Un motore open-source o un fornitore di riconoscimento vocale di un servizio con cui la tua azienda già lavora (ad es. Google Cloud, AWS Transcribe) può essere scelto come soluzione di trascrizione per le esigenze della tua azienda. Alcuni di essi offrono anche crediti gratuiti, ma raccomandiamo cautela per quanto riguarda la sicurezza dei dati.

Un'API di speech-to-text può aiutare a trascrivere i file audio in testo. Elaborazione e analisi dei dati audio:
I dati audio vengono elaborati utilizzando tecniche come la riduzione del rumore e la cancellazione dell'eco
I dati audio vengono quindi analizzati utilizzando algoritmi di machine learning per identificare schemi nel parlato
Gli algoritmi utilizzano modelli acustici e modelli linguistici per riconoscere parole e frasi pronunciate
Conversione del parlato in testo utilizzando algoritmi di machine learning:
Gli algoritmi di machine learning sono addestrati su grandi dataset di dati audio e testuali
Gli algoritmi imparano a riconoscere schemi nel parlato e a convertirli in testo
Gli algoritmi possono essere sottoposti a fine-tuning e personalizzati per casi d'uso e lingue specifici

Scopri altri nostri benchmark e approfondimenti basati sui dati nella Ricerca Google.
GoogleAggiungi come fonte preferita

Ulteriori letture

Cita questo benchmark

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Cem Dilmegani and Şevval Alper (2026) - "Benchmark Speech-to-Text: Deepgram vs. Whisper". Pubblicato online su AIMultiple.com. Consultato il 22 Gennaio 2026, da: https://aimultiple.com/speech-to-text [Risorsa online]

Dilmegani, C., & Alper, Ş. (2026, 22 Gennaio). Benchmark Speech-to-Text: Deepgram vs. Whisper. AIMultiple. https://aimultiple.com/speech-to-text

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Alper, Şevval},
  title  = {{Benchmark Speech-to-Text: Deepgram vs. Whisper}},
  year   = {2026},
  month  = jan,
  howpublished    = {\url{https://aimultiple.com/speech-to-text}},
  note   = {AIMultiple. Consultato il 22 Gennaio 2026}
}
Cem Dilmegani
Cem Dilmegani
Analista principale
Cem è analista principale presso AIMultiple dal 2017. AIMultiple fornisce informazioni a centinaia di migliaia di aziende (secondo SimilarWeb), tra cui il 55% delle aziende Fortune 500, ogni mese. Il lavoro di Cem è stato citato da importanti pubblicazioni globali come Business Insider, Forbes, Washington Post, società globali come Deloitte e HPE, ONG come il World Economic Forum e organizzazioni sovranazionali come la Commissione Europea. È possibile consultare l'elenco di altre aziende e risorse autorevoli che hanno citato AIMultiple. Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, responsabile acquisti tecnologici e imprenditore nel settore tecnologico. Ha fornito consulenza alle aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per oltre un decennio. Ha anche pubblicato un report di McKinsey sulla digitalizzazione. Ha guidato la strategia tecnologica e gli acquisti di un'azienda di telecomunicazioni, riportando direttamente al CEO. Ha inoltre guidato la crescita commerciale dell'azienda deep tech Hypatos, che ha raggiunto un fatturato annuo ricorrente a 7 cifre e una valutazione a 9 cifre partendo da zero in soli 2 anni. Il lavoro di Cem in Hypatos è stato oggetto di articoli su importanti pubblicazioni tecnologiche come TechCrunch e Business Insider. Cem partecipa regolarmente come relatore a conferenze internazionali di settore. Si è laureato in ingegneria informatica presso l'Università di Bogazici e ha conseguito un MBA presso la Columbia Business School.
Visualizza il profilo completo
Ricercato da
Şevval Alper
Şevval Alper
Ricercatore di intelligenza artificiale
Şevval è un analista di settore di AIMultiple specializzato in strumenti di programmazione per l'IA, agenti di IA e tecnologie quantistiche.
Visualizza il profilo completo

Sii il primo a commentare

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450