Realizamos un benchmark de los principales proveedores de voz a texto (STT), centrándonos específicamente en aplicaciones sanitarias. Nuestro benchmark utilizó ejemplos del mundo real para evaluar la precisión de la transcripción en contextos médicos, donde la exactitud es crucial.
Resultados del benchmark de voz a texto
Según los resultados tanto de la tasa de error de palabras (WER) como de la tasa de error de caracteres (CER), GPT-4o-transcribe demuestra la mayor precisión de transcripción entre todos los sistemas de voz a texto evaluados. Deepgram Nova-v3 y Gladia también tienen un buen rendimiento, manteniendo tasas de error bajas en ambas métricas.
Metodología
Dataset
Queríamos evaluar el rendimiento de los models tanto en muestras pequeñas y variadas como en una muestra larga, por lo que realizamos dos tareas:
Tarea 1: Datos de voz de atención médica
- Número total de muestras: 100
- Duración total: 9 minutos y 25 segundos
- Duración media por muestra: 5,65 segundos
- Contenido: Datos de voz de atención médica, incluyendo terminología médica, interacciones con pacientes y discusiones clínicas
- Variedad: Diferentes locutores, calidad de audio variable y diversos contextos médicos hablados en inglés
Especificaciones de audio:
- Formato: WAV
- Canales: 1 (Mono)
- Ancho de muestra: 16-bit
- Frecuencia de muestreo: 16 kHz
- Bitrate constante: 256 kbps
- Rango de duración: ~4.5 a 11,5 segundos por archivo
Tarea 2: Una conferencia de anatomía
- Número total de muestras: 1
- Duración total: 8 minutos y 35 segundos
- Contenido: Una conferencia de anatomía impartida por un médico, incluyendo terminología médica
- Variedad: Un solo locutor habla en inglés en la primera mitad del vídeo; suena música de fondo.
Especificaciones de audio:
- Formato: WAV
- Canales: 2 (Estéreo)
- Ancho de muestra: 16-bit
- Frecuencia de muestreo: 48 kHz
- Bitrate constante: 1536 kbps
Métricas de evaluación
Utilizamos la tasa de error de palabras (WER) y la tasa de error de caracteres (CER) como métricas de evaluación de la precisión de la transcripción. La tasa de error de palabras se calcula como:
WER = (S + D + I) / N
Donde:
- S = Número de sustituciones
- D = Número de eliminaciones
- I = Número de inserciones
- N = Número total de palabras en la verdad fundamental
La fórmula calcula el número mínimo de operaciones a nivel de palabra necesarias para transformar la hipótesis en la referencia, dividido por el número de palabras de la referencia. Un WER más bajo indica una mayor precisión, siendo 0 % una coincidencia perfecta.
La tasa de error de caracteres (CER) se calcula dividiendo el número total de errores a nivel de carácter (incluyendo inserciones, eliminaciones y sustituciones) por el número total de caracteres del texto de referencia.
Utilizamos APIs de voz a texto para transcribir archivos de audio a texto.
El tamaño máximo de archivo de entrada admitido de una vez por los proveedores se muestra en la tabla:
*Dado que Vosk se ejecuta localmente, no hay límite en el tamaño del archivo de entrada. Sin embargo, los archivos de audio largos pueden superar el límite del haz, provocando que se pierdan algunas probabilidades. Por lo tanto, se recomienda dividir los archivos en segmentos de 1 a 2 minutos.
Google MedASR también funciona localmente y no impone un límite máximo de tamaño de archivo. Para un rendimiento óptimo y una gestión de recursos adecuada, se recomienda procesar archivos largos en segmentos más pequeños.
Nota: Para proveedores con límites de tamaño de archivo más pequeños (como Google y OpenAI), los archivos de audio más grandes deben dividirse en fragmentos más pequeños antes del procesamiento. Realizamos esto en la Tarea 2.
Reconocimiento del habla
El reconocimiento del habla permite a los ordenadores transcribir archivos de audio a texto mediante algoritmos de aprendizaje automático. La API de un servicio de transcripción se puede utilizar con varios lenguajes de programación para la transcripción por lotes. Estas plataformas admiten tanto la transcripción en tiempo real como la asíncrona.
La tecnología de reconocimiento del habla tiene numerosas aplicaciones, entre ellas la transcripción, los asistentes de voz y la traducción de idiomas.
Beneficios de usar el reconocimiento del habla para la transcripción
- Transcripción rápida de archivos de audio
- Ahorro de tiempo y esfuerzo
- Transcripción y traducción en tiempo real
- Accesibilidad para personas con discapacidad
¿Cómo funcionan las herramientas de IA de voz a texto?
El proceso de transcripción incluye:
- Los datos de audio se cargan o se transmiten a la herramienta de voz a texto
- Uso de algoritmos de aprendizaje automático para analizar los datos de audio e identificar patrones en el habla
- La herramienta convierte el habla en texto mediante un motor de voz a texto
- El texto transcrito se muestra a continuación al usuario.
Preguntas frecuentes
La transcripción de audio y las grabaciones de vídeo se pueden utilizar en:
Asistentes de voz y asistentes virtuales
Traducción e interpretación de idiomas
Sistemas de voz a texto (ASR) para personas con discapacidad
Sus models preentrenados permiten el reconocimiento automático del habla (ASR) para archivos de audio y vídeo grabados. Las transcripciones de audio de alta precisión incluyen puntuación automática y detección de temas.
Se puede elegir un motor de código abierto o un proveedor de reconocimiento del habla de un servicio con el que su empresa ya trabaje (por ejemplo, Google Cloud, AWS transcribe) como solución de transcripción para las necesidades de su empresa. Algunos de ellos también ofrecen gratis créditos, pero recomendamos precaución en cuanto a la seguridad de los datos.
Una API de voz a texto puede ayudar a transcribir archivos de audio a texto. Procesamiento y análisis de datos de audio:
Los datos de audio se procesan mediante técnicas como la reducción de ruido y la cancelación de eco
A continuación, los datos de audio se analizan mediante algoritmos de aprendizaje automático para identificar patrones en el habla
Los algoritmos utilizan acoustic models y language models para reconocer palabras y frases habladas
Conversión del habla en texto mediante algoritmos de aprendizaje automático:
Los algoritmos de aprendizaje automático se entrenan con grandes datasets de datos de audio y texto
Los algoritmos aprenden a reconocer patrones en el habla y a convertirlos en texto
Los algoritmos se pueden fine-tunear y personalizar para casos de uso e idiomas específicos
Lecturas adicionales
Cita este benchmark
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Alper, Şevval},
title = {{Benchmark de voz a texto: Deepgram vs. Whisper}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/speech-to-text}},
note = {AIMultiple. Recuperado el 21 de agosto de 2026}
}Resultados y marcas de tiempo de 12 puntos de datos. Descargue los datos resumidos que se muestran en los gráficos y las tablas de este artículo como un archivo ZIP que contiene un archivo CSV.
¿Quieres los datos granulares que hay detrás? Únete a Premium
Registro de cambios
1 actualizacionesSe actualizaron los resultados de la evaluación comparativa en la sección "Resultados de la evaluación comparativa".
El trabajo de Cem en AIMultiple ha sido citado por publicaciones líderes mundiales como Business Insider, Forbes, Morning Brew y Washington Post, empresas globales como Deloitte y HPE, ONG como World Economic Forum y organizaciones supranacionales como European Commission. [1], [2], [3], [4], [5]
A lo largo de su carrera, Cem trabajó como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización.
Dirigió la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando al CEO. También lideró el crecimiento comercial de la empresa de deep tech Hypatos, que alcanzó unos ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider.
Cem participa habitualmente en conferencias internacionales de tecnología. Se graduó en Bogazici University como ingeniero informático y tiene un MBA de Columbia Business School.
Şevval se centra en herramientas de codificación con IA, agentes de IA y tecnologías cuánticas.
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.