Abbiamo testato 12 large language models con capacità visive su 70 fotografie di volti etichettate, cinque volte ciascuna, per valutare con quanta precisione identificano l'emozione su un volto umano. Il punteggio più alto è 67%, non esistono due models nel test statisticamente distinguibili e il gruppo rileva la rabbia al 22%.
Inoltre, esploriamo dieci strumenti di IA emotiva leader e condividiamo i nostri approfondimenti pratici.
Benchmark sul riconoscimento delle emozioni
Ogni model ha visto le stesse 70 immagini cinque volte, un'immagine per richiesta, per 4.200 chiamate e 4.195 classificazioni valide. Vedi la metodologia per il set di etichette e le regole di punteggio.
Risultati del benchmark sul riconoscimento delle emozioni
I punteggi vanno da 51% a 67%, e nessuna coppia di models si distingue. Confrontando ogni coppia sulla risposta che ciascun model ha dato più spesso nelle sue cinque passate, quattro dei 66 test esatti di McNemar hanno p-value non corretti inferiori a 0.05, e nessuno sopravvive alla correzione di Holm. Con 70 immagini, la differenza di 16 punti tra il primo e l'ultimo è una fascia, e l'ordine al suo interno non ha significato.
Il punteggio migliore non è migliorato in modo misurabile in sette mesi.
GPT o4 Mini High ha ottenuto 69% su queste stesse 70 immagini a gennaio 2026 in un singolo passaggio, rispetto al 67% di Gemini 3.7 Flash su cinque passaggi. Le due esecuzioni hanno usato versioni diverse del codice di test, quindi il divario di 1.5 punti non è un declino; è un risultato che non si è mosso.
Accuratezza per emozione
Le sette emozioni non falliscono insieme:
- Felicità: letta correttamente 89% delle volte nel gruppo
- Paura: 38%
- Rabbia: 22%, e l'emozione con il punteggio più basso per 10 dei 12 models
La rabbia si colloca otto punti sopra il tiro a caso. Le classi bilanciate pongono un tentativo casuale al 14.3%, quindi:
- La rabbia supera il caso di otto punti; la felicità lo supera di 75 %
- Il miglior model sulla rabbia raggiunge 34%
Nulla obbliga un model a raggiungere la baseline: due ottengono zero quando l'immagine viene omessa.
Anche i models sono in disaccordo con se stessi. Interrogati sulla stessa immagine cinque volte:
- MiniMax M3 ripete la propria risposta più comune l'81% delle volte
- Claude Fable 5 la ripete il 97% delle volte
Un numero di singolo passaggio su questo compito porta quindi insieme il model e la variazione tra un'esecuzione e l'altra.
Quella instabilità scompare nelle immagini che il gruppo sbaglia. Tre immagini non hanno ottenuto risposte corrette da alcun model in nessuno dei cinque passaggi (60 risposte), zero corrispondenze.
I models non si sono dispersi sulle restanti sei etichette. Sono confluiti su una:
- Immagine etichettata come rabbia: tristezza in 59 su 60
- Immagine etichettata come paura: tristezza in 47 su 60 risposte
Una convergenza così stretta tra 12 models indipendenti punta all'etichetta tanto quanto ai models.
Costo, latenza e accuratezza
Il costo varia di 62x nel gruppo mentre l'accuratezza varia di 16 punti.
- GPT-5.6 Luna classifica 1.000 immagini per $0,06 e ottiene 53%
- Claude Fable 5 addebita $3,83 per le stesse 1.000 e ottiene 63%.
Quei dieci punti non sopravvivono alla correzione di Holm.
Le risposte più lente non ottengono punteggi migliori.
- Qwen3.8 Max ha una media di 14.5 secondi per immagine con un 95 percentile di 46 secondi e ottiene 63%
- Claude Sonnet 5 ha una media di 3.1 secondi e ottiene 64%
La cifra è il tempo di andata e ritorno attraverso OpenRouter, quindi include il routing oltre che la deliberazione del model stesso, ma una differenza di 4x su una risposta di una sola parola è troppo grande per derivare solo dal routing.
Metodologia del benchmark sul riconoscimento delle emozioni
Ogni model riceve un'immagine e la stessa istruzione: scegli esattamente una parola da un elenco di sette emozioni. Le etichette sono "felice", "triste", "arrabbiato", "paura", "disgusto", "sorpresa" e "neutro", mescolate per ogni richiesta in modo che nessuna etichetta occupi una posizione fissa.
Una risposta conta come corretta solo se corrisponde esattamente all'etichetta del dataset. Qualsiasi altra cosa, inclusa una frase, un rifiuto o una parola fuori dall'elenco, viene registrata come risposta non valida e non viene considerata corretta. Cinque delle 4.200 chiamate non erano valide: MiniMax M3 ha restituito una parola troncata quattro volte, e Kimi K3 ha risposto con un paragrafo una volta.
Ogni model viene chiamato tramite OpenRouter, un'immagine per richiesta, senza cronologia di conversazione e senza prompt per fornitore. Questo conta più di quanto sembri:
In un'esecuzione precedente su questo dataset, alcuni models sono stati chiamati tramite le APIs dei loro fornitori e altri tramite OpenRouter, e ogni model OpenRouter ha ottenuto un punteggio tra 7% e 21% mentre ogni model diretto tramite API ha ottenuto un punteggio tra 51% e 63%.
Per confermare che le immagini raggiungano i models, eseguiamo lo stesso prompt con l'immagine rimossa:
- Ogni model guadagna tra 37 e 64 punti quando l'immagine è presente.
- Senza di essa, otto dei dodici si collocano entro un punto dalla baseline del 14.3%, e sette di questi rispondono con un'unica etichetta per tutti i 70 elementi.
- Claude Fable 5 si rifiuta di indovinare su tutti i 70, e Claude Sonnet 5 su 68 di essi, quindi entrambi ottengono zero.
Dataset
Utilizziamo una parte del dataset Facial Emotion Detection, che include un insieme di immagini etichettate che mostrano diverse emozioni umane.1 Ogni immagine conteneva espressioni facciali che rappresentavano stati emotivi comuni come felicità, tristezza, rabbia, paura e sorpresa.
Costo
Il budget di completamento è di 16.000 tokens per ogni model, e i tokens di ragionamento vengono presi da esso.
Qwen3.8 Max è l'unico model che si avvicina ad esso: su un'immagine, la sua spesa di ragionamento variava da 297 a 2.115 tokens tra chiamate ripetute, e due delle sue risposte sono state troncate del tutto con un precedente budget di 4.000 tokens.
Le due risposte troncate sono state rieseguite con il budget più ampio perché una risposta che colpisce un muro di budget riflette il budget piuttosto che il model. Nessun altro model nel gruppo ha superato 300 tokens di ragionamento.
Limiti noti
Cinque delle 70 immagini hanno un'etichetta che tutti i 12 models contraddicono, e su tre di esse nessun model ha prodotto l'etichetta in alcun passaggio. L'accordo dei models non dimostra che un'etichetta sia sbagliata, poiché i models sono correlati piuttosto che annotatori indipendenti, ma significa che nessun model dovrebbe avvicinarsi al 100% su questo set.
Abbiamo eseguito l'intero benchmark due volte. Due esecuzioni indipendenti da cinque passaggi degli stessi 12 models sulle stesse 70 immagini, con le stesse impostazioni:
- Ogni model si sposta di 1.2 punti in media e di 4.9 punti all'estremo
- Nove dei dodici models cambiano posizione tra le due esecuzioni
- Tre posizioni tengono: prima, seconda e ultima
Ripetere l'esperimento arriva allo stesso punto dei test di significatività, senza eseguire un test.
Tre cose che questa esecuzione non stabilisce:
- I test segnalano il mancato rilevamento di una differenza, non l'equivalenza. Nessuna coppia di models risulta uguale; risultano non separati a questa dimensione del campione.
- Una fotografia con un'etichetta ground-truth è un compito di laboratorio. Nominare l'emozione su un volto fermo non è lo stesso problema di leggere un cliente in una chiamata di assistenza.
- I due prodotti di IA emotiva dedicati precedentemente coperti in questo benchmark, Hume e Imentiv IA, non sono in questa esecuzione. Stiamo testando nuovamente entrambi e pubblicheremo i loro punteggi con le stesse regole di valutazione dei models.
Confronto degli strumenti di affective computing
Hume Expression Measurement
Hume Expression Measurement è uno strumento di IA emotiva che aiuta a identificare e misurare le emozioni umane. Funziona tramite una singola app e utilizza quattro tipi di dati: voce, immagini, video ed espressioni facciali. Together, questi offrono uno sguardo più profondo e dettagliato su come le persone esprimono le emozioni.
Esperienza nella vita reale
Questo software di riconoscimento delle emozioni potrebbe non essere sempre accurato al 100%, ma cattura efficacemente le sfumature emotive, soprattutto attraverso i schemi vocali. Tuttavia, non è perfetto. A volte potrebbe non rilevare un'emozione di base dai vocal burst. Tuttavia, i risultati emotivi spesso sembrano realistici e sfumati.
Hume è ideale per gli utenti che desiderano uno sguardo dettagliato e reattivo al comportamento emotivo, non semplici etichette come "felice" o "triste". L'applicazione web per il software di riconoscimento delle emozioni è estremamente facile da usare.
Caratteristiche principali
- Il software fornisce un'analisi in tempo reale di emozioni, sentiment e tossicità per un dato testo.
Figura 1. Analisi testuale di Hume Expression Measurement per le emozioni
Figura 2. Analisi testuale del sentiment di Hume Expression Measurement
Per ulteriori informazioni sull'analisi del sentiment, consulta i nostri articoli sull'analisi del sentiment.
- Questo software di riconoscimento delle emozioni rileva anche le emozioni da video, immagini e documenti audio. Gli utenti possono caricare documenti oppure preferire di usare la propria fotocamera e gli altoparlanti per il rilevamento delle emozioni.
Hume analizza parlato, immagini e video utilizzando diverse funzionalità:
- Espressione facciale: rileva i movimenti facciali per comprendere emozioni facciali come gioia, rabbia o tristezza.
- Vocal burst: misura come suona qualcuno, se calmo, eccitato, stressato, ecc.
- Prosodia del parlato: traccia i cambiamenti di tono, altezza e ritmo. Questo aiuta a identificare il tono emotivo di ciò che qualcuno sta dicendo.
Figura 3. Analisi video di Hume Expression Measurement per la prosodia del parlato
Mangold Observation Studio
Mangold Observation Studio è una piattaforma completa progettata per la ricerca avanzata basata su sensori. Riunisce molte fonti di dati, video, audio, espressioni facciali, segnali fisiologici e altro in un unico sistema sincronizzato.
Caratteristiche principali
- Registrazione video e schermo: cattura il comportamento dei partecipanti e l'attività sullo schermo per un contesto completo.
- Integrazione dei sensori: supporta EEG, eye tracking, frequenza cardiaca, risposta cutanea e attività muscolare.
- Analisi del parlato: converte automaticamente le parole pronunciate in testo.
- Sondaggi e annotazioni: aggiungi feedback dei partecipanti o tagga i momenti chiave durante le sessioni.
- Design multimodale: a differenza degli strumenti che si concentrano su un solo tipo di dato (come l'espressione facciale), Mangold combina oltre 120 tipi di sensori in un'unica piattaforma.
- Configurazione scalabile: supporta partecipanti e dispositivi illimitati contemporaneamente, con registrazioni sincronizzate nel tempo.
- Controllo completo della rete: tutti i dispositivi possono essere gestiti da una stazione centrale.
- Modulare e personalizzabile: i ricercatori possono costruire la propria configurazione e integrarsi con strumenti esterni utilizzando un'API.
Visage SDK
Visage SDK è un software di riconoscimento facciale delle emozioni che aiuta le aziende a tracciare e analizzare i volti in tempo reale. Utilizza la visione artificiale avanzata per comprendere emozioni, età, genere e identità delle persone.
Caratteristiche principali
- Supporto online & offline: funziona sia online (nel cloud) sia offline (sul dispositivo), quindi non sei sempre dipendente da una connessione internet.
- Priorità alla privacy: garantisce che nessun dato personale, come nomi o foto, venga archiviato o elaborato senza il tuo consenso.
- Integrazione con Unity: si integra con Unity per creare filtri facciali o esperienze interattive nei giochi.
Applicazioni
- Prove virtuali: usa il riconoscimento facciale per consentire ai clienti di provare virtualmente occhiali, trucco o altri prodotti.
- Monitoraggio del conducente: rileva comportamenti di guida non sicuri, come sonnolenza o distrazione, per migliorare la sicurezza stradale.
- Monitoraggio dei passeggeri: traccia il benessere dei passeggeri in auto o nei trasporti pubblici per migliorare sicurezza e comfort.
- Realtà aumentata (AR): crea esperienze divertenti e coinvolgenti come filtri di bellezza o maschere facciali realistiche per social media o app.
Imentiv IA
Imentiv IA è un software di rilevamento delle emozioni che aiuta gli utenti a capire come le persone si sentono, parlano e si comportano nei contenuti video, audio e testuali. Combina l'intelligenza artificiale con competenze psicologiche per analizzare emozioni e personalità umane in tempo reale.
Esperienza reale:
Imentiv IA aiuta gli utenti ad analizzare le emozioni dai contenuti video. Puoi caricare un video completo o concentrarti su un fotogramma specifico. Lo strumento esamina le espressioni facciali, il tono della voce e la trascrizione per comprendere i segnali emotivi.
L'analisi sembra accurata e copre un'ampia gamma di segnali emotivi. Oltre agli approfondimenti di base, la piattaforma offre anche valutazioni psicologiche. Queste possono essere pianificate tramite un sistema di appuntamenti.
Figura 4. Analisi dei tratti di personalità di Imentiv IA
Caratteristiche principali
- Analisi multimodale: analizza video, audio e testo insieme. Questo fornisce un quadro più completo delle reazioni emotive.
- Tracciamento di volti e voci: rileva più volti in ogni fotogramma video. Associa le voci ai volti o le analizza separatamente. Mostra quale persona sta parlando e quando.
- Grafico delle emozioni: mostra le emozioni facciali in tempo reale su un grafico circolare dinamico. L'Emotion Wheel offre una chiara visualizzazione di come cambiano le emozioni.
- Analisi dei tratti di personalità: utilizza il model OCEAN (apertura, coscienziosità, estroversione, gradevolezza, nevroticismo) per riassumere i tratti di personalità delle persone nel video. I risultati sono mostrati come un semplice grafico a barre codificato a colori.
- Revisione psicologica: psicologi qualificati esaminano i risultati dell'IA per individuare pregiudizi nascosti e fattori scatenanti emotivi. Questo aggiunge preziose informazioni all'analisi dell'IA.
RightFlow
RightFlow è uno strumento di IA emotiva che analizza le espressioni facciali per capire come si sentono le persone durante la loro esperienza con un brand. Aiuta le aziende a cogliere emozioni come felicità, rabbia, paura o sorpresa per migliorare marketing, servizio clienti e design del prodotto.
Caratteristiche principali
- Rilevamento delle hot zone: identifica dove le persone trascorrono il tempo e cosa cattura l'attenzione.
- Conteggio delle persone: traccia quante persone interagiscono con uno spazio o un prodotto.
- Analisi demografica: rileva età e genere per comprendere le differenze del pubblico.
- Analisi dell'attenzione: misura i movimenti di testa e occhi per capire su cosa si concentrano i clienti.
A differenza degli strumenti focalizzati sul rilevamento delle emozioni, RightFlow combina i dati emotivi con il conteggio dei clienti, il tracciamento demografico e le funzioni di sicurezza fisica. È progettato per spazi pubblici, negozi o eventi in cui conta un'analisi in tempo reale e contatto-free.
MoodMe Face IA Emotion Detection Engine
MoodMe's Face IA Engine è uno strumento che legge le espressioni facciali per rilevare le emozioni in tempo reale. Funziona direttamente sul dispositivo dell'utente, senza bisogno di connessione internet o elaborazione cloud.
Caratteristiche principali
- Rilevamento demografico: il motore può stimare genere, età, etnia e tipo di capelli. Questo aiuta le app a capire meglio chi sta interagendo con esse.
- Corrispondenza facciale: MoodMe include uno strumento integrato per l'identificazione del volto. Può confrontare un volto con i template archiviati localmente per controlli di identità sicuri.
- Imparziale e inclusivo: l'IA è addestrata su dati diversificati per evitare di favorire qualsiasi gruppo. Ciò garantisce risultati più equi tra volti ed espressioni diverse.
- Priorità alla privacy: tutta l'elaborazione avviene sul dispositivo dell'utente. I volti non vengono mai archiviati né inviati al cloud. Questo protegge la privacy e soddisfa le rigide normative sui dati.
Affectiva AFFDEX
The Smart Eye Group fornisce software per l'analisi delle emozioni e prodotti con un design indossabile. Affectiva AFFDEX 2.0 è un toolkit volto ad analizzare le espressioni facciali degli individui in tempo reale. È progettato per analizzare le unità di azione facciale (AU) e la posa della testa per tracciare i volti e rilevare le emozioni.
Caratteristiche principali
- Tracciamento di più volti: lo strumento può elaborare più volti contemporaneamente.
- Espressione facciale: AFFDEX 2.0 riconosce 9 emozioni di base dai punti di riferimento facciali (ad es. angoli esterni degli occhi, punta del naso e mento). Lo strumento non elabora il parlato per categorizzare le emozioni.
- Frequenza di ammiccamento: rileva alcune altre metriche espressive facciali (ad es. ammiccamento, valenza e attenzione).
Hume Empathic Voice Interface (EVI)
Hume's Empathic Voice Interface (EVI) è un sistema di IA speech-to-speech che rende le conversazioni più umane. Consente agli utenti di creare, clonare e controllare voci che rispondono in tempo reale con emozione e personalità.
Esperienza reale
Nei test, le conversazioni con EVI sono sembrate realistiche e coinvolgenti. Il rilevamento delle emozioni ha funzionato bene. Gli utenti potevano guidare tono e ambientazione, sebbene questa funzione non sempre funzionasse perfettamente.
In breve, Hume's Empathic Voice Interface combina risposta rapida, profondità emotiva e alto controllo, rendendo le conversazioni con l'IA più vicine all'interazione umana reale. L'interfaccia web della piattaforma di conversazione è semplice e intuitiva da usare.
Figura 6. Analisi di Hume EVI di una conversazione con l'IA
Caratteristiche principali
- Voce personalizzata: supporta oltre 100.000 voci personalizzate, ognuna con tratti unici. Puoi persino creare voci come una "matriarca britannica calma" o un "musicista caraibico entusiasta" digitando un prompt.
- Clona una voce: carica un campione audio per creare una versione digitale della tua voce.
- Conversazioni in tempo reale: risponde in circa 300 millisecondi, all'incirca veloce come un essere umano.
Hume Octave
Hume Octave è un language model basato sulla voce che comprende il significato dietro le parole. L'azienda afferma che aiuta a creare conversazioni con migliore emozione, ritmo e tono.
Esperienza reale
Octave ha spesso trovato la voce giusta per un prompt. Ha aiutato a migliorare le descrizioni vocali e ad abbinare bene i toni. Tuttavia, la voce finale a volte suonava piatta o artificiale, come una performance di recitazione debole. Tuttavia, lo strumento ha mostrato un forte potenziale nel catturare diversi stili di parlato.
In breve, Hume Octave porta il significato alla voce. Aiuta gli utenti a creare un parlato più realistico ed espressivo che si adatta sia alle parole sia al momento, ed è facile da usare.
Caratteristiche principali
- Bassa latenza: inizia a parlare in 200 millisecondi con Instant Mode.
- Voci personalizzate: crea voci da zero, usa la tua voce o scegli tra molte opzioni predefinite.
- Controllo dell'espressione: aggiungi istruzioni in stile recitazione per modellare il modo in cui la voce interpreta ogni battuta.
- Voci uniche: con un semplice prompt, crea voci come un "contadino medievale sarcastico" o una "calma insegnante di scienze".
Revoicer
Revoicer è un software text-to-speech basato sull'IA con tecnologia di riconoscimento delle emozioni che trasforma il testo scritto in voiceover realistici. Afferma di creare contenuti audio con toni emotivi che suonano più umani e meno tecnologia di IA emotiva.
Caratteristiche principali
- Voci emotive: Revoicer può parlare con toni come allegro, triste, arrabbiato, amichevole, sussurrato o eccitato.
- Ampio supporto linguistico: funziona in inglese e in oltre 40 altre lingue, tra cui francese, tedesco, arabo e mandarino.
- Opzioni personalizzate: gli utenti possono modificare tono, velocità e intonazione della voce. Possono anche aggiungere pause o enfatizzare parole specifiche.
- Molte voci: lo strumento offre più di 80 voci, incluse voci maschili, femminili e di bambini. Gli utenti possono anche scegliere tra diversi accenti inglesi come americano, britannico, australiano o indiano.
Criteri di valutazione
Per valutare equamente ogni strumento di IA emotiva, abbiamo utilizzato lo stesso insieme di criteri su tutte le piattaforme. Questi includono:
- Accuratezza del rilevamento delle emozioni: quanto bene lo strumento identifica emozioni come felicità, rabbia o sorpresa da espressioni facciali, voce o testo.
- Capacità multimodali: se lo strumento può analizzare più tipi di input (ad es. video, audio, testo) insieme o separatamente.
- Facilità d'uso: quanto è intuitiva l'interfaccia per gli utenti non tecnici, inclusi configurazione e uso quotidiano.
- Feedback in tempo reale: se la piattaforma può fornire approfondimenti immediati durante interazioni dal vivo o registrazioni.
- Profondità degli approfondimenti: qualità e dettaglio dell'analisi emotiva, inclusi schemi comportamentali, tracciamento dell'attenzione e suddivisioni demografiche.
Ulteriori letture
- Benchmark sull'analisi del sentiment
- I migliori metodi per l'analisi del sentiment audio
- Strumenti open source per l'analisi del sentiment
Cita questo benchmark
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{phd2026,
author = {PhD., Ezgi Arslan,},
title = {{I migliori strumenti di IA emotiva testati}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/emotion-ai-tools}},
note = {AIMultiple. Consultato il 27 Agosto 2026}
}Risultati e timestamp di 10 punti dati. Scarica i dati utilizzati in questo articolo come file ZIP contenente un file CSV.
Registro delle modifiche
2 aggiornamenti- 2026
Risultati del benchmark aggiornati per il riconoscimento delle emozioni.
- 2025
Aggiunto un benchmark sul riconoscimento delle emozioni alla sezione di confronto degli strumenti di calcolo affettivo.






Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.