Servicios
Contáctanos

Mejores herramientas de IA emocional probadas

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
actualizado el 27 de ago. de 2026

Probamos 12 grandes modelos de lenguaje con capacidad de visión en 70 fotografías de rostros etiquetadas, cinco veces cada una, para evaluar con qué precisión identifican la emoción en un rostro humano. La puntuación más alta es 67 %, no hay dos modelos en la prueba que sean estadísticamente distinguibles y la cohorte registra la ira en un 22 %.

Además, exploramos diez herramientas líderes de IA emocional y compartimos nuestros conocimientos prácticos.

Benchmark de reconocimiento de emociones

Loading Chart

Cada modelo vio las mismas 70 imágenes cinco veces, una imagen por solicitud, lo que suma 4.200 llamadas y 4.195 clasificaciones válidas. Consulta la metodología para ver el conjunto de etiquetas y las reglas de puntuación.

Resultados del benchmark de reconocimiento de emociones

Las puntuaciones abarcan de 51 % a 67 %, y no hay dos modelos que se separen. Al comparar cada par según la respuesta que cada modelo dio con más frecuencia en sus cinco pasadas, cuatro de las 66 pruebas exactas de McNemar tienen valores p sin corregir inferiores a 0.05, y ninguna sobrevive a la corrección de Holm. Con 70 imágenes, la diferencia de 16 puntos entre el primero y el último es una banda, y el orden dentro de ella no tiene significado.

La mejor puntuación no ha mejorado de forma medible en siete meses.

GPT o4 Mini High obtuvo un 69 % en estas mismas 70 imágenes en enero de 2026 en una sola pasada, en comparación con el 67 % de Gemini 3.7 Flash en cinco pasadas. Las dos ejecuciones usaron versiones diferentes del código de prueba, por lo que la diferencia de 1.5 puntos no es un descenso; es un resultado que no se ha movido.

Precisión por emoción

Las siete emociones no fallan juntas:

  • Felicidad: se registró correctamente el 89 % de las veces en toda la cohorte
  • Miedo: 38 %
  • Ira: 22 %, y la emoción con la puntuación más baja en 10 de los 12 modelos

La ira se sitúa ocho puntos por encima del azar. Las clases equilibradas ponen una suposición aleatoria en el 14.3 %, por lo tanto:

  • La ira supera el azar por ocho puntos; la felicidad lo supera por 75 %
  • El mejor modelo en ira alcanza un 34 %

Nada obliga a un modelo a alcanzar la línea de base: dos obtienen cero cuando se omite la imagen.

Los modelos también discrepan consigo mismos. Ante la misma imagen cinco veces:

  • MiniMax M3 repite su propia respuesta más común el 81 % de las veces
  • Claude Fable 5 la repite el 97 % de las veces

Por lo tanto, una cifra de una sola pasada en esta tarea combina el modelo y la variación entre ejecuciones.

Esa inestabilidad desaparece en las imágenes que la cohorte clasifica mal. Tres imágenes no obtuvieron ninguna respuesta correcta de ningún modelo en ninguna de las cinco pasadas (60 respuestas), cero coincidencias.

Los modelos no se dispersaron entre las seis etiquetas restantes. Convergieron en una:

  • Imagen etiquetada como ira: tristeza en 59 de 60
  • Imagen etiquetada como miedo: tristeza en 47 de 60 respuestas

Una convergencia tan estrecha en 12 modelos independientes apunta tanto a la etiqueta como a los modelos.

Coste, latencia y precisión

El coste abarca 62x en toda la cohorte, mientras que la precisión abarca 16 puntos.

  • GPT-5.6 Luna clasifica 1.000 imágenes por $0,06 y obtiene una puntuación de 53 %
  • Claude Fable 5 cobra $3,83 por las mismas 1.000 y obtiene una puntuación de 63 %.

Esos diez puntos no sobreviven a la corrección de Holm.

Las respuestas más lentas no obtienen mejor puntuación.

  • Qwen3.8 Max promedia 14.5 segundos por imagen con un percentil 95 de 46 segundos y obtiene una puntuación de 63 %
  • Claude Sonnet 5 promedia 3.1 segundos y obtiene una puntuación de 64 %

La cifra es el tiempo de ida y vuelta a través de OpenRouter, por lo que incluye tanto el enrutamiento como la propia deliberación del modelo, pero una diferencia de 4x en una respuesta de una sola palabra es demasiado grande para deberse solo al enrutamiento.

Metodología del benchmark de reconocimiento de emociones

Cada modelo recibe una imagen y la misma instrucción: elegir exactamente una palabra de una lista de siete emociones. Las etiquetas son “feliz”, “triste”, “enfadado”, “miedo”, “asco”, “sorpresa,” y “neutral”, mezcladas en cada solicitud para que ninguna etiqueta ocupe una posición fija.

Una respuesta se considera correcta solo si coincide exactamente con la etiqueta del dataset. Cualquier otra cosa, incluida una frase, un rechazo o una palabra fuera de la lista, se registra como respuesta no válida y no se puntúa como correcta. Cinco de las 4.200 llamadas fueron inválidas: MiniMax M3 devolvió una palabra truncada cuatro veces, y Kimi K3 respondió con un párrafo una vez.

Todos los modelos se llaman a través de OpenRouter, una imagen por solicitud, sin historial de conversación y sin prompt por proveedor. Esto importa más de lo que parece:

En una ejecución anterior con este dataset, algunos modelos se llamaron a través de las API de sus proveedores y otros a través de OpenRouter, y todos los modelos de OpenRouter obtuvieron entre 7 % y 21 %, mientras que todos los modelos directos por API obtuvieron entre 51 % y 63 %.

Para confirmar que las imágenes llegan a los modelos, ejecutamos el mismo prompt sin la imagen:

  • Cada modelo gana entre 37 y 64 puntos cuando la imagen está presente.
  • Sin ella, ocho de los doce se sitúan a un punto de la línea de base del 14.3 %, y siete de ellos responden con una sola etiqueta para los 70 elementos.
  • Claude Fable 5 se niega a adivinar en las 70, y Claude Sonnet 5 en 68 de ellas, por lo que ambos obtienen cero.

Dataset

Usamos una parte del dataset Facial Emotion Detection, que incluye un conjunto de imágenes etiquetadas que muestran diferentes emociones humanas.1 Cada imagen contenía expresiones faciales que representan estados emocionales comunes como felicidad, tristeza, ira, miedo y sorpresa.

Coste

El presupuesto de finalización es de 16.000 tokens para cada modelo, y los tokens de razonamiento se deducen de él.

Qwen3.8 Max es el único modelo que se acerca: en una imagen, su gasto de razonamiento osciló entre 297 y 2.115 tokens en llamadas repetidas, y dos de sus respuestas se cortaron por completo con un presupuesto anterior de 4.000 tokens.

Las dos respuestas truncadas se volvieron a ejecutar con el presupuesto más amplio porque una respuesta que choca contra un límite de presupuesto refleja el presupuesto y no el modelo. Ningún otro modelo de la cohorte superó los 300 tokens de razonamiento.

Limitaciones conocidas

Cinco de las 70 imágenes llevan una etiqueta que los 12 modelos contradicen, y en tres de ellas ningún modelo produjo la etiqueta en ninguna pasada. El acuerdo entre modelos no demuestra que una etiqueta sea incorrecta, ya que los modelos están correlacionados y no son anotadores independientes, pero sí significa que no se debe esperar que ningún modelo se acerque al 100 % en este conjunto.

Ejecutamos todo el benchmark dos veces. Dos ejecuciones independientes de cinco pasadas de los mismos 12 modelos sobre las mismas 70 imágenes, con los mismos ajustes:

  • Cada modelo varía 1.2 puntos en promedio y 4.9 puntos en el extremo
  • Nueve de los doce modelos cambian de posición entre las dos ejecuciones
  • Tres posiciones se mantienen: primera, segunda y última

Repetir el experimento llega al mismo lugar que las pruebas de significación, sin ejecutar una prueba.

Tres cosas que esta ejecución no establece:

  • Las pruebas informan de la imposibilidad de detectar una diferencia, no de equivalencia. No se demuestra que dos modelos sean iguales; se demuestra que no se separan con este tamaño de muestra.
  • Una fotografía con una única etiqueta de referencia es una tarea de laboratorio. Nombrar la emoción en un rostro estático no es el mismo problema que leer a un cliente en una llamada de soporte.
  • Los dos productos dedicados de IA emocional cubiertos anteriormente en este benchmark, Hume e Imentiv IA, no están en esta ejecución. Estamos volviendo a probar ambos y publicaremos sus puntuaciones con las mismas reglas de puntuación que los modelos.

Comparación de herramientas de computación afectiva

Hume Expression Measurement

Hume Expression Measurement es una herramienta de IA emocional que ayuda a identificar y medir las emociones humanas. Funciona a través de una sola aplicación y utiliza cuatro tipos de datos: voz, imágenes, video y expresiones faciales. Together, estas ofrecen una visión más profunda y detallada de cómo las personas expresan sus emociones.

Experiencia en la vida real

Es posible que este software de reconocimiento de emociones no siempre sea 100 % preciso, pero capta los matices emocionales de forma eficaz, especialmente a través de los patrones del habla. Sin embargo, no es perfecto. A veces, puede no detectar emociones básicas a partir de ráfagas vocales. Aun así, los resultados emocionales a menudo parecen realistas y matizados.

Hume es ideal para usuarios que desean una visión detallada y reactiva del comportamiento emocional, no etiquetas simples como “feliz” o “triste”. La aplicación web del software de reconocimiento de emociones es sumamente fácil de usar.

Características clave

  • El software proporciona un análisis en tiempo real de las emociones, el sentimiento y la toxicidad de un texto determinado.

Figura 1. Análisis de texto de Hume Expression Measurement para emociones

Figura 2. Análisis de texto de Hume Expression Measurement para sentimiento

Para más información sobre análisis de sentimiento, consulta nuestros artículos sobre análisis de sentimiento.

  • Este software de reconocimiento de emociones también detecta emociones en videos, imágenes y documentos de audio. Los usuarios pueden subir documentos o preferir usar su propia cámara y altavoces para la detección de emociones.

Hume analiza el habla, las imágenes y los videos mediante varias características:

  • Expresión facial: detecta movimientos faciales para comprender emociones faciales como alegría, ira o tristeza.
  • Ráfaga vocal: mide cómo suena alguien, ya sea tranquilo, excitado, estresado, etc.
  • Prosodia del habla: rastrea cambios en el tono, la altura y el ritmo. Esto ayuda a identificar el tono emocional de lo que alguien dice.

Figura 3. Análisis de video de Hume Expression Measurement para prosodia del habla

Mangold Observation Studio

Mangold Observation Studio es una plataforma integral diseñada para la investigación avanzada basada en sensores. Reúne muchas fuentes de datos, video, audio, expresiones faciales, señales fisiológicas y más en un solo sistema sincronizado.

Características clave

  • Grabación de video y pantalla: captura el comportamiento y la actividad en pantalla de los participantes para obtener un contexto completo.
  • Integración de sensores: admite EEG, seguimiento ocular, frecuencia cardíaca, respuesta de la piel y actividad muscular.
  • Análisis del habla: convierte las palabras habladas en texto automáticamente.
  • Encuestas y anotaciones: añade comentarios de los participantes o etiqueta momentos clave durante las sesiones.
  • Diseño multimodal: a diferencia de las herramientas que se centran en un solo tipo de dato (como la expresión facial), Mangold combina más de 120 tipos de sensores en una sola plataforma.
  • Configuración escalable: admite participantes y dispositivos ilimitados a la vez, con grabaciones sincronizadas en el tiempo.
  • Control total de la red: todos los dispositivos pueden gestionarse desde una estación central.
  • Modular y personalizable: los investigadores pueden crear su propia configuración e integrarse con herramientas externas mediante una API.

Visage SDK

Visage SDK es un software de reconocimiento de emociones faciales que ayuda a las empresas a rastrear y analizar rostros en tiempo real. Utiliza visión por computadora avanzada para comprender las emociones, la edad, el género y la identidad de las personas.

Características clave

  • Soporte en línea y sin conexión: funciona tanto en línea (en la nube) como sin conexión (en tu dispositivo), por lo que no siempre dependes de una conexión a internet.
  • Privacidad ante todo: garantiza que ningún dato personal, como nombres o fotos, se almacene o procese sin tu consentimiento.
  • Integración con Unity: se integra con Unity para crear filtros faciales o experiencias interactivas en juegos.

Aplicaciones

  • Pruebas virtuales: utiliza el reconocimiento facial para que los clientes se prueben gafas, maquillaje u otros productos de forma virtual.
  • Monitorización del conductor: detecta comportamientos de conducción inseguros, como somnolencia o distracción, para mejorar la seguridad vial.
  • Monitorización de pasajeros: rastrea el bienestar de los pasajeros en coches o transporte público para mejorar la seguridad y la comodidad.
  • Realidad aumentada (AR): crea experiencias divertidas y atractivas, como filtros de belleza o máscaras faciales realistas para redes sociales o aplicaciones.

Imentiv IA

Imentiv IA es un software de detección de emociones que ayuda a los usuarios a comprender cómo se sienten, hablan y se comportan las personas en contenido de video, audio y texto. Combina inteligencia artificial con experiencia psicológica para analizar la emoción y la personalidad humanas en tiempo real.

Experiencia en la vida real:

Imentiv IA ayuda a los usuarios a analizar emociones a partir de contenido de video. Puedes subir un video completo o centrarte en un fotograma específico. La herramienta analiza las expresiones faciales, el tono de voz y la transcripción para comprender las señales emocionales.

El análisis parece preciso y cubre una amplia gama de señales emocionales. Además de la información básica, la plataforma también ofrece evaluaciones psicológicas. Estas pueden programarse mediante un sistema de citas.

Figura 4. Análisis de rasgos de personalidad de Imentiv IA

Características clave

  • Análisis multimodal: analiza video, audio y texto en conjunto. Esto ofrece una imagen más completa de las reacciones emocionales.
  • Seguimiento de rostros y voces: detecta múltiples rostros en cada fotograma de video. Empareja las voces con los rostros o las analiza por separado. Muestra qué persona está hablando y cuándo.
  • Gráfico de emociones: muestra las emociones faciales en tiempo real en un gráfico circular dinámico. La Rueda de las Emociones ofrece una visualización clara de cómo cambian las emociones.
  • Análisis de rasgos de personalidad: utiliza el modelo OCEAN (apertura, responsabilidad, extraversión, amabilidad, neuroticismo) para resumir los rasgos de personalidad de las personas en el video. Los resultados se muestran como un sencillo gráfico de barras codificado por colores.
  • Revisión psicológica: psicólogos capacitados revisan los resultados de la IA para encontrar sesgos ocultos y desencadenantes emocionales. Esto aporta información valiosa al análisis de la IA.
Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

RightFlow

RightFlow es una herramienta de IA emocional que analiza las expresiones faciales para comprender cómo se sienten las personas durante su experiencia con una marca. Ayuda a las empresas a captar emociones como felicidad, ira, miedo o sorpresa para mejorar el marketing, el servicio al cliente y el diseño de productos.

Características clave

  • Detección de zonas calientes: identifica dónde pasan tiempo las personas y qué capta su atención.
  • Conteo de personas: rastrea cuántas personas interactúan con un espacio o producto.
  • Análisis demográfico: captura la edad y el género para comprender las diferencias del público.
  • Análisis de atención: mide el movimiento de la cabeza y los ojos para saber en qué se centran los clientes.

A diferencia de las herramientas centradas en la detección de emociones, RightFlow combina datos emocionales con el conteo de clientes, el seguimiento demográfico y funciones de seguridad física. Está diseñado para espacios públicos, tiendas o eventos donde el análisis en tiempo real y contact-free importa.

MoodMe Face IA Emotion Detection Engine

El Face IA Engine de MoodMe es una herramienta que lee las expresiones faciales para detectar emociones en tiempo real. Funciona directamente en el dispositivo del usuario, sin necesidad de conexión a internet ni procesamiento en la nube.

Características clave

  • Detección demográfica: el motor puede estimar el género, la edad, la etnia y el tipo de cabello. Esto ayuda a las aplicaciones a comprender mejor quién interactúa con ellas.
  • Coincidencia facial: MoodMe incluye una herramienta integrada para la identificación de rostros. Puede comparar un rostro con plantillas almacenadas localmente para realizar comprobaciones de identidad seguras.
  • Imparcial e inclusivo: la IA está entrenada con datos diversos para evitar favorecer a algún grupo. Esto garantiza resultados más justos entre distintos rostros y expresiones.
  • Privacidad ante todo: todo el procesamiento ocurre en el dispositivo del usuario. Los rostros nunca se almacenan ni se envían a la nube. Esto protege la privacidad y cumple con estrictas normativas de datos.
No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Affectiva AFFDEX

The Smart Eye Group proporciona software para analizar emociones y productos con un diseño portátil. Affectiva AFFDEX 2.0 es un conjunto de herramientas destinado a analizar las expresiones faciales de las personas en tiempo real. Está diseñado para analizar unidades de acción facial (AU) y la postura de la cabeza para rastrear rostros y detectar emociones.

Características clave

  • Seguimiento de múltiples rostros: la herramienta puede procesar varios rostros al mismo tiempo.
  • Expresión facial: AFFDEX 2.0 reconoce 9 emociones básicas a partir de puntos de referencia faciales (p. ej., las comisuras externas de los ojos, la punta de la nariz y el mentón). La herramienta no procesa el habla para categorizar las emociones.
  • Frecuencia de parpadeo: detecta otras métricas expresivas faciales (p. ej., parpadeo, valencia y atención).

Hume Empathic Voice Interface (EVI)

La Empathic Voice Interface (EVI) de Hume es un sistema de IA de voz a voz que hace que las conversaciones suenen más humanas. Permite a los usuarios crear, clonar y controlar voces que responden en tiempo real con emoción y personalidad.

Experiencia en la vida real

En las pruebas, las conversaciones con EVI resultaron naturales y atractivas. La detección de emociones funcionó bien. Los usuarios podían guiar el tono y el entorno, aunque esta función no siempre funcionaba perfectamente.

En resumen, la Empathic Voice Interface de Hume combina una respuesta rápida, profundidad emocional y un alto control, lo que hace que las conversaciones con IA suenen más cercanas a una interacción humana real. La interfaz web de la plataforma de conversación es sencilla e intuitiva de usar.

Figura 6. Análisis de Hume EVI de una conversación con IA

Características clave

  • Voz personalizada: admite más de 100.000 voces personalizadas, cada una con rasgos únicos. Incluso puedes crear voces como una “matriarca británica tranquilizadora” o un “músico caribeño entusiasta” escribiendo un prompt.
  • Clonar una voz: sube una muestra de audio para crear una versión digital de tu propia voz.
  • Conversaciones en tiempo real: responde en unos 300 milisegundos, aproximadamente tan rápido como un humano.

Hume Octave

Hume Octave es un modelo de lenguaje basado en voz que comprende el significado detrás de las palabras. La empresa afirma que ayuda a crear conversaciones con mejor emoción, ritmo y tono.

Experiencia en la vida real

Octave a menudo encontraba la voz adecuada para un prompt. Ayudaba a mejorar las descripciones de voz y emparejaba bien los tonos. Sin embargo, la voz final a veces sonaba plana o artificial, como una interpretación actoral débil. Aun así, la herramienta mostró un gran potencial para captar diferentes estilos de habla.

En resumen, Hume Octave aporta significado a la voz. Ayuda a los usuarios a crear un habla más realista y expresiva que se adapta tanto a las palabras como al momento, y es fácil de usar.

Características clave

  • Baja latencia: empieza a hablar en 200 milisegundos con el modo instantáneo.
  • Voces personalizadas: crea voces desde cero, usa tu propia voz o elige entre muchas opciones prediseñadas.
  • Control de expresión: añade instrucciones de estilo interpretativo para moldear cómo la voz pronuncia cada línea.
  • Voces únicas: con un prompt sencillo, crea voces como un “campesino medieval sarcástico” o un “profesor de ciencias tranquilo”.

Revoicer

Revoicer es un software de texto a voz impulsado por IA con tecnología de reconocimiento de emociones que convierte texto escrito en locuciones realistas. Afirma crear contenido de audio con tonos emocionales que suenan más humanos y menos a tecnología de IA emocional.

Características clave

  • Voces emocionales: Revoicer puede hablar en tonos como alegre, triste, enfadado, amistoso, susurrante o entusiasta.
  • Amplio soporte de idiomas: funciona en inglés y en más de 40 idiomas, incluidos francés, alemán, árabe y mandarín.
  • Opciones personalizadas: los usuarios pueden cambiar el tono, la velocidad y la entonación de la voz. También pueden añadir pausas o enfatizar palabras concretas.
  • Muchas voces: la herramienta ofrece más de 80 voces, incluidas voces masculinas, femeninas e infantiles. Los usuarios también pueden elegir entre diferentes acentos del inglés, como americano, británico, australiano o indio.

Criterios de evaluación

Para evaluar cada herramienta de IA emocional de forma justa, utilizamos el mismo conjunto de criterios en todas las plataformas. Estos incluyen:

  • Precisión de la detección de emociones: qué tan bien identifica la herramienta emociones como felicidad, ira o sorpresa a partir de expresiones faciales, voz o texto.
  • Capacidades multimodales: si la herramienta puede analizar múltiples tipos de entrada (p. ej., video, audio, texto) en conjunto o por separado.
  • Facilidad de uso: qué tan intuitiva es la interfaz para usuarios no técnicos, incluida la configuración y el uso diario.
  • Retroalimentación en tiempo real: si la plataforma puede ofrecer información instantánea durante interacciones en vivo o grabaciones.
  • Profundidad de la información: calidad y detalle de la analítica emocional, incluidos patrones de comportamiento, seguimiento de la atención y desgloses demográficos.

Lecturas adicionales

Cita este benchmark

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Ezgi Arslan, PhD. (2026) - "Mejores herramientas de IA emocional probadas". Publicado en línea en AIMultiple.com. Recuperado el 27 de Agosto de 2026, de: https://aimultiple.com/emotion-ai-tools [Recurso en línea]

PhD., E. A. (2026, 27 de Agosto). Mejores herramientas de IA emocional probadas. AIMultiple. https://aimultiple.com/emotion-ai-tools

@misc{phd2026,
  author = {PhD., Ezgi Arslan,},
  title  = {{Mejores herramientas de IA emocional probadas}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/emotion-ai-tools}},
  note   = {AIMultiple. Recuperado el 27 de Agosto de 2026}
}
Descargar todos los datos

Resultados y marcas de tiempo de 10 puntos de datos. Descargue los datos utilizados en este artículo como un archivo ZIP que contiene un archivo CSV.

Última actualización: 17 de Agosto de 2026
Descargar

Registro de cambios

2 actualizaciones
  1. 2026

    Resultados de referencia actualizados para el reconocimiento de emociones.

  2. 2025

    Se añadió un benchmark sobre reconocimiento de emociones a la sección de comparación de herramientas de computación afectiva.

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Analista de la industria
Ezgi tiene un doctorado en Administración de Empresas con especialización en finanzas y se desempeña como Analista de la Industria en AIMultiple. Impulsa la investigación y los conocimientos en la intersección de la tecnología y los negocios, con experiencia en sostenibilidad, análisis de encuestas y de sentimiento, aplicaciones de agentes de IA en finanzas, optimización para motores de respuestas, gestión de cortafuegos y tecnologías de adquisiciones.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450