Nous avons testé 12 large language models dotés de vision sur 70 photographies de visages étiquetées, cinq fois chacune, afin d’évaluer avec quelle précision ils identifient l’émotion sur un visage humain. Le score le plus élevé est 67 %, aucun model du test n’est statistiquement distinguable et la cohorte lit la colère à 22 %.
De plus, nous explorons dix outils d’IA émotionnelle de premier plan et partageons nos observations pratiques.
Benchmark sur la reconnaissance des émotions
Chaque model a vu les mêmes 70 images cinq fois, une image par requête, soit 4 200 appels et 4 195 classifications valides. Voir la méthodologie pour l’ensemble des étiquettes et les règles de notation.
Résultats du benchmark de reconnaissance des émotions
Les scores vont de 51 % à 67 %, et aucun model ne se distingue des autres. En comparant chaque paire sur la réponse que chaque model a le plus souvent donnée au cours de ses cinq passages, quatre des 66 tests de McNemar exacts présentent des valeurs p non corrigées inférieures à 0.05, et aucune ne survit à la correction de Holm. Avec 70 images, l’écart de 16 points entre le premier et le dernier constitue une seule bande, et l’ordre à l’intérieur n’a aucune signification.
Le meilleur score ne s’est pas amélioré de façon mesurable en sept mois.
GPT o4 Mini High a obtenu 69 % sur ces mêmes 70 images en janvier 2026 en un seul passage, contre 67 % pour Gemini 3.7 Flash sur cinq passages. Les deux séries ont utilisé des versions différentes du code de test, donc l’écart de 1.5 point n’est pas un déclin ; c’est un résultat qui n’a pas bougé.
Précision par émotion
Les sept émotions n’échouent pas toutes ensemble :
- Joie : lue correctement 89 % du temps dans l’ensemble de la cohorte
- Peur : 38 %
- Colère : 22 %, et l’émotion la moins bien reconnue pour 10 des 12 models
La colère se situe huit points au-dessus du hasard. Des classes équilibrées placent un choix aléatoire à 14.3 %, donc :
- La colère dépasse le hasard de huit points ; la joie le dépasse de 75 %
- Le meilleur model sur la colère atteint 34 %
Rien n’oblige un model à atteindre la ligne de base : deux obtiennent zéro lorsque l’image est retirée.
Les models se contredisent aussi eux-mêmes. Interrogés cinq fois sur la même image :
- MiniMax M3 répète sa propre réponse la plus fréquente 81 % du temps
- Claude Fable 5 la répète 97 % du temps
Un chiffre obtenu en un seul passage sur cette tâche regroupe donc le model et la variation d’une exécution à l’autre.
Cette instabilité disparaît dans les images que la cohorte se trompe. Trois images n’ont obtenu aucune réponse correcte de la part d’un quelconque model au cours des cinq passages (60 réponses), zéro correspondance.
Les models ne se sont pas dispersés sur les six étiquettes restantes. Ils ont convergé vers une seule :
- Image étiquetée « colère » : tristesse dans 59 des 60
- Image étiquetée « peur » : tristesse dans 47 des 60 réponses
Une convergence aussi forte entre 12 models indépendants pointe autant vers l’étiquette que vers les models.
Coût, latence et précision
Le coût varie d’un facteur 62x au sein de la cohorte, tandis que la précision varie de 16 points.
- GPT-5.6 Luna classifie 1 000 images pour $0,06 et obtient 53 %
- Claude Fable 5 facture $3,83 pour les mêmes 1 000 et obtient 63 %.
Ces dix points ne survivent pas à la correction de Holm.
Les réponses plus lentes n’obtiennent pas de meilleurs scores.
- Qwen3.8 Max met en moyenne 14.5 secondes par image, avec un 95 centile de 46 secondes, et obtient 63 %
- Claude Sonnet 5 met en moyenne 3.1 secondes et obtient 64 %
Ce chiffre correspond au temps d’aller-retour via OpenRouter ; il inclut donc le routage ainsi que la propre délibération du model, mais un écart de 4x sur une réponse en un seul mot est trop important pour provenir uniquement du routage.
Méthodologie du benchmark de reconnaissance des émotions
Chaque model reçoit une image et la même instruction : choisissez exactement un mot dans une liste de sept émotions. Les étiquettes sont « happy », « sad », « angry », « fear », « disgust », « surprise » et « neutral », mélangées à chaque requête afin qu’aucune étiquette n’occupe une position fixe.
Une réponse n’est considérée comme correcte que si elle correspond exactement à l’étiquette du dataset. Toute autre réponse, y compris une phrase, un refus ou un mot hors liste, est enregistrée comme réponse invalide et n’est pas comptée comme correcte. Cinq des 4 200 appels étaient invalides : MiniMax M3 a renvoyé un mot tronqué quatre fois, et Kimi K3 a répondu par un paragraphe une fois.
Chaque model est appelé via OpenRouter, une image par requête, sans historique de conversation ni API propre au fournisseur. Cela importe plus qu’il n’y paraît :
Lors d’une exécution antérieure sur ce dataset, certains models étaient appelés via les API de leurs fournisseurs et d’autres via OpenRouter ; chaque OpenRouter model a obtenu entre 7 % et 21 %, tandis que chaque model en direct via API a obtenu entre 51 % et 63 %.
Pour confirmer que les images parviennent aux models, nous exécutons le même prompt avec l’image supprimée :
- Chaque model gagne entre 37 et 64 points lorsque l’image est présente.
- Sans elle, huit des douze models se situent à un point près de la ligne de base de 14.3 %, et sept d’entre eux répondent par une seule étiquette pour l’ensemble des 70 éléments.
- Claude Fable 5 refuse de deviner sur les 70 images, et Claude Sonnet 5 sur 68 d’entre elles ; les deux obtiennent donc zéro.
Dataset
Nous utilisons une partie du dataset Facial Emotion Detection, qui comprend un ensemble d’images étiquetées montrant différentes émotions humaines.1 Chaque image contenait des expressions faciales proxy des états émotionnels courants tels que la joie, la tristesse, la colère, la peur et la surprise.
Coût
Le budget de complétion est de 16 000 tokens pour chaque model, et les tokens de raisonnement sont prélevés sur ce budget.
Qwen3.8 Max est le seul model à s’en approcher : sur une image, sa dépense de raisonnement est allée de 297 à 2 115 tokens lors d’appels répétés, et deux de ses réponses ont été entièrement tronquées avec un budget antérieur de 4 000 tokens.
Les deux réponses tronquées ont été réexécutées avec le budget plus large, car une réponse qui atteint un mur budgétaire reflète le budget plutôt que le model. Aucun autre model de la cohorte n’a dépassé 300 tokens de raisonnement.
Limites connues
Cinq des 70 images portent une étiquette que les 12 models contredisent tous, et sur trois d’entre elles aucun model n’a produit l’étiquette lors d’un quelconque passage. L’accord des models ne prouve pas qu’une étiquette est erronée, car les models sont corrélés plutôt que des annotateurs indépendants, mais cela signifie qu’aucun model ne devrait être censé approcher les 100 % sur cet ensemble.
Nous avons exécuté l’ensemble du benchmark deux fois. Deux séries indépendantes de cinq passages des mêmes 12 models sur les mêmes 70 images, avec les mêmes réglages :
- Chaque model varie de 1.2 point en moyenne et de 4.9 points dans les cas extrêmes
- Neuf des douze models changent de rang entre les deux exécutions
- Trois positions se maintiennent : premier, deuxième et dernier
Répéter l’expérience aboutit au même endroit que les tests de significativité, sans exécuter de test.
Trois choses que cette exécution n’établit pas :
- Les tests signalent l’absence de détection d’une différence, pas une équivalence. Aucun couple de models ne s’avère égal ; ils s’avèrent simplement non séparés à cette taille d’échantillon.
- Une photographie avec une seule étiquette de référence est une tâche de laboratoire. Nommer l’émotion sur un visage immobile n’est pas le même problème que lire un client lors d’un appel d’assistance.
- Les deux produits d’IA émotionnelle spécialisés précédemment couverts dans ce benchmark, Hume et Imentiv IA, ne figurent pas dans cette exécution. Nous sommes en train de retester les deux et publierons leurs scores selon les mêmes règles de notation que les models.
Comparaison des outils d’informatique affective
Hume Expression Measurement
Hume Expression Measurement est un outil d’IA émotionnelle qui aide à identifier et à mesurer les émotions humaines. Il fonctionne via une seule application et utilise quatre types de données : la voix, les images, la vidéo et les expressions faciales. Together, ces éléments offrent un aperçu plus profond et plus détaillé de la manière dont les gens expriment leurs émotions.
Expérience réelle
Ce logiciel de reconnaissance des émotions n’est peut-être pas toujours précis à 100 %, mais il capture efficacement les nuances émotionnelles, notamment à travers les schémas de parole. Cependant, il n’est pas parfait. Parfois, il peut ne pas détecter une émotion de base à partir de rafales vocales. Pourtant, les résultats émotionnels semblent souvent réalistes et nuancés.
Hume est idéal pour les utilisateurs qui souhaitent une vision détaillée et réactive du comportement émotionnel, et non de simples étiquettes comme « joyeux » ou « triste ». L’application web du logiciel de reconnaissance des émotions est extrêmement conviviale.
Fonctionnalités clés
- Le logiciel fournit une analyse en temps réel des émotions, du sentiment et de la toxicité pour un texte donné.
Figure 1. Analyse de texte de Hume Expression Measurement pour les émotions
Figure 2. Analyse de texte de Hume Expression Measurement pour le sentiment
Pour plus d’informations sur l’analyse des sentiments, consultez nos articles sur l’analyse des sentiments.
- Ce logiciel de reconnaissance des émotions détecte également les émotions à partir de vidéos, d’images et de documents audio. Les utilisateurs peuvent téléverser des documents ou préférer utiliser leur propre caméra et leurs haut-parleurs pour la détection des émotions.
Hume analyse la parole, les images et les vidéos à l’aide de plusieurs fonctionnalités :
- Expression faciale : détecte les mouvements du visage pour comprendre les émotions faciales telles que la joie, la colère ou la tristesse.
- Rafale vocale : mesure la façon dont une personne sonne, qu’elle soit calme, excitée, stressée, etc.
- Prosodie de la parole : suit les changements de ton, de hauteur et de rythme. Cela aide à identifier le ton émotionnel de ce que dit une personne.
Figure 3. Analyse vidéo de Hume Expression Measurement pour la prosodie de la parole
Mangold Observation Studio
Mangold Observation Studio est une plateforme complète conçue pour la recherche avancée pilotée par capteurs. Elle rassemble de nombreuses sources de données — vidéo, audio, expressions faciales, signaux physiologiques et plus encore — dans un système synchronisé unique.
Fonctionnalités clés
- Enregistrement vidéo et d’écran : capture le comportement des participants et l’activité à l’écran pour un contexte complet.
- Intégration de capteurs : prend en charge l’EEG, le suivi oculaire, la fréquence cardiaque, la réponse cutanée et l’activité musculaire.
- Analyse de la parole : convertit automatiquement les mots prononcés en texte.
- Enquêtes et annotations : ajoutez les retours des participants ou marquez les moments clés pendant les sessions.
- Conception multimodale : contrairement aux outils qui se concentrent sur un seul type de données (comme l’expression faciale), Mangold combine plus de 120 types de capteurs sur une seule plateforme.
- Configuration évolutive : prend en charge un nombre illimité de participants et d’appareils à la fois, avec des enregistrements synchronisés dans le temps.
- Contrôle réseau complet : tous les appareils peuvent être gérés depuis une station centrale.
- Modulaire et personnalisable : les chercheurs peuvent construire leur propre configuration et s’intégrer à des outils externes à l’aide d’une API.
Visage SDK
Visage SDK est un logiciel de reconnaissance des émotions faciales qui aide les entreprises à suivre et à analyser les visages en temps réel. Il utilise la vision par ordinateur avancée pour comprendre les émotions, l’âge, le sexe et l’identité des personnes.
Fonctionnalités clés
- Prise en charge en ligne & hors ligne : fonctionne à la fois en ligne (dans le cloud) et hors ligne (sur votre appareil), vous n’êtes donc pas toujours dépendant d’une connexion internet.
- Priorité à la confidentialité : garantit qu’aucune donnée personnelle, comme les noms ou les photos, n’est stockée ni traitée sans votre consentement.
- Intégration Unity : s’intègre à Unity pour créer des filtres faciaux ou des expériences interactives dans les jeux.
Applications
- Essayages virtuels : utilisez la reconnaissance faciale pour permettre aux clients d’essayer virtuellement des lunettes, du maquillage ou d’autres produits.
- Surveillance du conducteur : détectez les comportements de conduite dangereux, comme la somnolence ou la distraction, afin d’améliorer la sécurité routière.
- Surveillance des passagers : suivez le bien-être des passagers dans les voitures ou les transports publics pour améliorer la sécurité et le confort.
- Réalité augmentée (AR) : créez des expériences amusantes et engageantes comme des filtres embellisseurs ou des masques faciaux réalistes pour les réseaux sociaux ou les applications.
Imentiv IA
Imentiv IA est un logiciel de détection des émotions qui aide les utilisateurs à comprendre comment les gens se sentent, parlent et se comportent dans des contenus vidéo, audio et textuels. Il combine l’intelligence artificielle et l’expertise psychologique pour analyser les émotions et la personnalité humaines en temps réel.
Expérience réelle :
Imentiv IA aide les utilisateurs à analyser les émotions à partir de contenus vidéo. Vous pouvez téléverser une vidéo complète ou vous concentrer sur une image spécifique. L’outil examine les expressions faciales, le ton de la voix et la transcription pour comprendre les signaux émotionnels.
L’analyse semble précise et couvre un large éventail de signaux émotionnels. En plus des informations de base, la plateforme propose également des évaluations psychologiques. Celles-ci peuvent être programmées via un système de rendez-vous.
Figure 4. Analyse des traits de personnalité d’Imentiv IA
Fonctionnalités clés
- Analyse multimodale : analyse ensemble la vidéo, l’audio et le texte. Cela donne une image plus complète des réactions émotionnelles.
- Suivi des visages et des voix : détecte plusieurs visages dans chaque image vidéo. Associe les voix aux visages ou les analyse séparément. Indique qui parle et à quel moment.
- Graphe des émotions : affiche les émotions faciales en temps réel sur un graphe circulaire dynamique. La Roue des émotions donne une visualisation claire de l’évolution des émotions.
- Analyse des traits de personnalité : utilise le modèle OCEAN (Ouverture, Conscienciosité, Extraversion, Agréabilité, Névrosisme) pour résumer les traits de personnalité des personnes dans la vidéo. Les résultats sont présentés sous forme d’un simple graphique à barres avec code couleur.
- Examen par des psychologues : des psychologues formés examinent les résultats de l’IA pour détecter des biais cachés et des déclencheurs émotionnels. Cela apporte un éclairage précieux à l’analyse par IA.
RightFlow
RightFlow est un outil d’IA émotionnelle qui analyse les expressions faciales pour comprendre ce que ressentent les personnes lors de leur expérience avec une marque. Il aide les entreprises à capter des émotions telles que la joie, la colère, la peur ou la surprise pour améliorer le marketing, le service client et la conception de produits.
Fonctionnalités clés
- Détection de zones chaudes : identifie où les personnes passent du temps et ce qui attire l’attention.
- Comptage de personnes : suit le nombre de personnes qui interagissent avec un espace ou un produit.
- Analyse démographique : capture l’âge et le sexe pour comprendre les différences d’audience.
- Analyse de l’attention : mesure les mouvements de la tête et des yeux pour savoir sur quoi se concentrent les clients.
Contrairement aux outils axés sur la détection des émotions, RightFlow combine les données émotionnelles avec le comptage de clients, le suivi démographique et des fonctionnalités de sécurité physique. Il est conçu pour les espaces publics, les magasins ou les événements où une analyse en temps réel et contact-free est importante.
MoodMe Face IA Emotion Detection Engine
Le Face IA Engine de MoodMe est un outil qui lit les expressions faciales pour détecter les émotions en temps réel. Il fonctionne directement sur l’appareil de l’utilisateur, sans connexion internet ni traitement dans le cloud.
Fonctionnalités clés
- Détection démographique : le moteur peut estimer le sexe, l’âge, l’origine ethnique et le type de cheveux. Cela aide les applications à mieux comprendre qui interagit avec elles.
- Correspondance de visage : MoodMe inclut un outil intégré d’identification faciale. Il peut faire correspondre un visage à des gabarits stockés localement pour des contrôles d’identité sécurisés.
- Sans biais et inclusif : l’IA est entraînée sur des données diverses pour éviter de favoriser un groupe. Cela garantit des résultats plus équitables entre différents visages et expressions.
- Priorité à la confidentialité : tout le traitement a lieu sur l’appareil de l’utilisateur. Les visages ne sont jamais stockés ni envoyés dans le cloud. Cela protège la vie privée et respecte les réglementations strictes sur les données.
Affectiva AFFDEX
The Smart Eye Group fournit des logiciels d’analyse des émotions et des produits au design portable. Affectiva AFFDEX 2.0 est une boîte à outils destinée à analyser les expressions faciales des individus en temps réel. Elle est conçue pour analyser les unités d’action faciale (AU) et la posture de la tête afin de suivre les visages et de détecter les émotions.
Fonctionnalités clés
- Suivi de plusieurs visages : l’outil peut traiter plusieurs visages en même temps.
- Expression faciale : AFFDEX 2.0 reconnaît 9 émotions de base à partir de points de repère faciaux (par exemple, les coins externes des yeux, le bout du nez et le menton). L’outil ne traite pas la parole pour catégoriser les émotions.
- Fréquence de clignement : il détecte d’autres métriques expressives faciales (par exemple le clignement, la valence et l’attention).
Hume Empathic Voice Interface (EVI)
Hume Empathic Voice Interface (EVI) est un système d’IA de parole à parole qui rend les conversations plus humaines. Il permet aux utilisateurs de créer, cloner et contrôler des voix qui répondent en temps réel avec émotion et personnalité.
Expérience réelle
Lors des tests, les conversations avec EVI semblaient réalistes et engageantes. La détection des émotions fonctionnait bien. Les utilisateurs pouvaient guider le ton et le cadre, bien que cette fonctionnalité n’ait pas toujours été parfaite.
En résumé, Hume Empathic Voice Interface combine réponse rapide, profondeur émotionnelle et contrôle élevé, rendant les conversations avec l’IA plus proches d’une véritable interaction humaine. L’interface web de la plateforme de conversation est simple et intuitive à utiliser.
Figure 6. Analyse par Hume EVI d’une conversation avec l’IA
Fonctionnalités clés
- Voix personnalisée : prend en charge plus de 100 000 voix personnalisées, chacune avec des traits uniques. Vous pouvez même créer des voix comme une « matriarche britannique apaisante » ou un « musicien caribéen enthousiaste » en tapant un prompt.
- Cloner une voix : téléversez un échantillon audio pour créer une version numérique de votre propre voix.
- Conversations en temps réel : répond en environ 300 millisecondes, à peu près aussi vite qu’un humain.
Hume Octave
Hume Octave est un model de langage basé sur la voix qui comprend le sens derrière les mots. L’entreprise affirme qu’il aide à créer des conversations avec une meilleure émotion, un meilleur rythme et un meilleur ton.
Expérience réelle
Octave a souvent trouvé la bonne voix pour un prompt. Il a aidé à améliorer les descriptions vocales et à bien assortir les tons. Cependant, la voix finale semblait parfois plate ou artificielle, comme une faible performance d’acteur. L’outil a néanmoins montré un fort potentiel pour capturer différents styles de parole.
En résumé, Hume Octave apporte du sens à la voix. Il aide les utilisateurs à créer une parole plus réaliste et expressive qui correspond à la fois aux mots et au moment, et il est facile à utiliser.
Fonctionnalités clés
- Faible latence : commence à parler en 200 millisecondes avec le Mode Instantané.
- Voix personnalisées : créez des voix à partir de zéro, utilisez votre propre voix ou choisissez parmi de nombreuses options prêtes à l’emploi.
- Contrôle de l’expression : ajoutez des instructions de style jeu d’acteur pour façonner la manière dont la voix délivre chaque réplique.
- Voix uniques : avec un simple prompt, créez des voix comme un « paysan médiéval sarcastique » ou un « professeur de sciences calme ».
Revoicer
Revoicer est un logiciel de synthèse vocale propulsé par l’IA doté d’une technologie de reconnaissance des émotions qui transforme le texte écrit en voix off réalistes. Il prétend créer du contenu audio avec des tons émotionnels qui sonnent plus humains et moins comme une technologie d’IA émotionnelle.
Fonctionnalités clés
- Voix émotionnelles : Revoicer peut parler sur des tons tels que joyeux, triste, en colère, amical, chuchoté ou excité.
- Large prise en charge des langues : il fonctionne en anglais et dans plus de 40 autres langues, dont le français, l’allemand, l’arabe et le mandarin.
- Options personnalisées : les utilisateurs peuvent modifier la hauteur, la vitesse et le ton de la voix. Ils peuvent aussi ajouter des pauses ou mettre l’accent sur des mots précis.
- De nombreuses voix : l’outil propose plus de 80 voix, notamment des voix masculines, féminines et enfantines. Les utilisateurs peuvent également choisir parmi différents accents anglais comme américain, britannique, australien ou indien.
Critères d’évaluation
Pour évaluer équitablement chaque outil d’IA émotionnelle, nous avons utilisé le même ensemble de critères sur toutes les plateformes. Ceux-ci incluent :
- Précision de la détection des émotions : dans quelle mesure l’outil identifie des émotions telles que la joie, la colère ou la surprise à partir des expressions faciales, de la voix ou du texte.
- Capacités multimodales : la capacité de l’outil à analyser plusieurs types d’entrée (par exemple vidéo, audio, texte) ensemble ou séparément.
- Facilité d’utilisation : le caractère intuitif de l’interface pour les utilisateurs non techniques, y compris l’installation et l’utilisation quotidienne.
- Retour en temps réel : la capacité de la plateforme à fournir des informations instantanées pendant les interactions ou les enregistrements en direct.
- Profondeur des informations : la qualité et le détail des analyses émotionnelles, y compris les schémas comportementaux, le suivi de l’attention et les répartitions démographiques.
Lectures complémentaires
- Benchmark de l’analyse des sentiments
- Meilleures méthodes pour l’analyse des sentiments audio
- Outils d’analyse des sentiments open source
Citez ce benchmark
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{phd2026,
author = {PhD., Ezgi Arslan,},
title = {{Meilleurs outils d'IA émotionnelle testés}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/emotion-ai-tools}},
note = {AIMultiple. Consulté le 27 Août 2026}
}Résultats et horodatages de 10 points de données. Téléchargez les données utilisées dans cet article sous forme de fichier ZIP contenant un fichier CSV.
Journal des modifications
2 mises à jour- 2026
Résultats de référence mis à jour pour la reconnaissance des émotions.
- 2025
Ajout d'un benchmark sur la reconnaissance des émotions à la section de comparaison des outils de calcul affectif.






Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.