Servizi
Contattaci

Test benchmark dell'analisi del sentiment: ChatGPT, Claude & Qwen

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
aggiornato il 1 set. 2026

Ottenere un'etichettatura precisa di emozioni e sentimenti, così come rilevare ironia, odiosità e offensività, resta una sfida e richiede ulteriori test e perfezionamenti. Abbiamo testato 10 large language model su cinque task di sentiment: emozione, odiosità, ironia, offensività e sentiment. Li abbiamo classificati in base all'accuratezza media in tutti e cinque.

I risultati evidenziano chiare differenze tra gli strumenti:

  • GPT 5.5 ha ottenuto la migliore accuratezza complessiva (80%),
  • Minimax M2.7 (72%) ha registrato la prestazione complessiva più bassa.

Risultati sperimentali: benchmark di analisi del sentiment

Loading Chart

Classifica: gli strumenti sono ordinati in base ai tassi di accuratezza media aggregati in tutte le categorie testate: emozione, odiosità, ironia, offensività e sentiment.

Per ulteriori dettagli, leggi la metodologia del nostro benchmark.

Accuratezza complessiva

Combinando tutti i task, i punteggi di accuratezza complessivi dei model offrono una visione olistica delle loro capacità:

  • GPT 5.5 si è classificato primo con 80%. Non è mai sceso sotto 73% in nessun task, il che lo ha reso il model più costante del test.
  • Claude Sonnet 4.6 si è classificato secondo con 79%. Ha ottenuto il singolo risultato più alto del benchmark: 82% nell'odiosità.
  • Qwen 3.6 Plus e ChatGPT 5.4 mini hanno chiuso in parità al terzo posto con 78%. ChatGPT 5.4 mini è il model più piccolo tra i primi, ma ha guidato la rilevazione dell'offensività e ha pareggiato al primo posto nell'ironia.
  • Kimi k2.6 ha ottenuto 77%, con risultati costanti e nessun task chiaramente debole.
  • Gemini 3.1-pro e GLM 5.1 hanno pareggiato a 76%. Gemini 3.1-pro ha pareggiato al primo posto nella rilevazione delle emozioni ma si è classificato in basso nell'odiosità.
  • Claude Opus 4.8 ha ottenuto 74%. È stato frenato dalla rilevazione delle emozioni (68%), la sua categoria più debole.
  • Gemini 3.5 Flash ha ottenuto 73%. Il suo risultato sull'odiosità (65%) è stato il più basso in quel task.
  • Minimax M2.7 si è classificato ultimo con 72%. Ha ottenuto il punteggio più basso in emozione, ironia e offensività.

1. Rilevazione delle emozioni

La rilevazione delle emozioni è un task impegnativo nell'analisi del sentiment e spesso richiede che i model distinguano segnali sottili nel linguaggio. Ecco come si sono comportati i model:

  • GPT 5.5 e Gemini 3.1-pro hanno pareggiato al primo posto con 80%.
  • Qwen 3.6 Plus è seguito con 79%.
  • Kimi k2.6 ha ottenuto 78%, e GLM 5.1 ha ottenuto 77%.
  • ChatGPT 5.4 mini ha raggiunto 76%, e Claude Sonnet 4.6 ha raggiunto 75%.
  • Gemini 3.5 Flash ha ottenuto 73%.
  • Claude Opus 4.8 ha ottenuto 68%.
  • Minimax M2.7 ha ottenuto il punteggio più basso con 66%.

La rilevazione delle emozioni ha mostrato un divario ampio: 14 punti tra i model in testa e in coda. Questo la rende uno dei due task che separano più chiaramente i model.

2. Rilevazione dell'odiosità

Rilevare contenuti d'odio è cruciale per la classificazione del sentiment su Twitter e per altre attività di moderazione. I risultati hanno rivelato differenze notevoli:

  • Claude Sonnet 4.6 ha guidato con 82%, il punteggio singolo più alto del benchmark.
  • GPT 5.5 ha seguito da vicino con 80%.
  • Qwen 3.6 Plus ha ottenuto 77%.
  • Kimi k2.6 e GLM 5.1 hanno entrambi ottenuto 76%.
  • Minimax M2.7 ha ottenuto 75%.
  • ChatGPT 5.4 mini ha ottenuto 72%.
  • Gemini 3.1-pro e Claude Opus 4.8 hanno entrambi ottenuto 71%.
  • Gemini 3.5 Flash ha ottenuto il punteggio più basso con 65%.

L'odiosità ha avuto il divario più ampio di qualsiasi task: 17 punti. Se la moderazione è il tuo caso d'uso, scegli dalla parte alta di questa colonna anziché dalla classifica media.

3. Rilevazione dell'ironia

La rilevazione dell'ironia è un ambito in cui la valutazione semantica gioca un ruolo fondamentale. Entrambi i model hanno offerto prestazioni elevate nel benchmark di analisi del sentiment, ma GPT-4o è emerso come leader netto:

  • GPT 5.5, Claude Sonnet 4.6, Qwen 3.6 Plus e ChatGPT 5.4 mini hanno pareggiato al primo posto con 91%.
  • Gemini 3.1-pro, GLM 5.1 e Gemini 3.5 Flash hanno ottenuto ciascuno 87%.
  • Claude Opus 4.8 ha ottenuto 86%, e Kimi k2.6 ha ottenuto 85%.
  • Minimax M2.7 ha ottenuto il punteggio più basso con 82%.

Questo è stato il task più semplice del gruppo. Anche il punteggio più basso è stato 82%. Per lavori che dipendono dalla capacità di cogliere ironia o sarcasmo, ciascuno di questi model è un punto di partenza sicuro.

4. Rilevazione dell'offensività

Rilevare contenuti offensivi è fondamentale per mantenere sane le community online. Le prestazioni nel benchmark di analisi del sentiment dei model in questo task sono state le seguenti:

  • ChatGPT 5.4 mini ha guidato con 75%.
  • GPT 5.5 ha ottenuto 73%, e Claude Sonnet 4.6 ha ottenuto 72%. Claude Opus 4.8 ha ottenuto 70%.
  • Qwen 3.6 Plus, Kimi k2.6, Gemini 3.1-pro e GLM 5.1 hanno tutti ottenuto 69%.
  • Gemini 3.5 Flash ha ottenuto 68%.
  • Minimax M2.7 ha ottenuto il punteggio più basso con 65%.

Nessun model ha raggiunto 76% nella metrica di offensività. L'intero gruppo è andato dal 65% al 75%. Il contesto guida questo task e i casi limite del dataset mettono in difficoltà ogni model.

5. Analisi del sentiment

Il task generale di analisi del sentiment si è concentrato sulla classificazione dei dati in sentimenti positivi, negativi e neutri. I punteggi di accuratezza di questo task variavano notevolmente tra i model:

  • GPT 5.5, Qwen 3.6 Plus, ChatGPT 5.4 mini e Gemini 3.1-pro hanno pareggiato al primo posto con 75%.
  • Kimi k2.6, Claude Opus 4.8, Gemini 3.5 Flash e Minimax M2.7 hanno tutti ottenuto 74%.
  • Claude Sonnet 4.6 ha ottenuto 73%.
  • GLM 5.1 ha ottenuto il punteggio più basso con 72%.

L'intero intervallo è stato di 3 punti, dal 72% al 75%. Nessun model ha gestito bene il sentiment a tre classi. Se il progetto richiede etichette affidabili positive, negative e neutre, nessuno di questi model è pronto per essere eseguito senza un controllo umano.

Osservazioni e approfondimenti

I task non sono tutti ugualmente difficili

L'ironia è stata facile per ogni model (dall'82% al 91%). Il sentiment e l'offensività sono stati difficili per ogni model, con tutti i punteggi tra 65% e 75%. Scegli un model per il task che hai realmente, non per la sua posizione media.

Emozione e odiosità separano meglio i model

Questi due task hanno avuto i divari di punteggio più ampi: 14 e 17 punti. Se il tuo caso d'uso è il monitoraggio delle emozioni o la moderazione, la scelta del model conta più qui che altrove.

Una media alta può nascondere un task debole

GPT 5.5 si è classificato primo in assoluto ed è rimasto forte su tutta la linea. Ma Claude Opus 4.8 si è classificato ottavo in assoluto, ottenendo 86% nell'ironia. Leggi la colonna del tuo task, non la media.

Dataset e metodologia del benchmark

Dataset di analisi

Abbiamo usato il dataset TweetEval, creato per l'analisi del sentiment su messaggi Twitter reali.1 Fa parte del lavoro dell'Association for Computational Linguistics (ACL) sulla valutazione semantica. Il dataset viene fornito con set di addestramento e di test pre-etichettati in cinque tipologie di task:

  • Rilevazione delle emozioni: assegnare un nome alla sensazione espressa in un tweet, come rabbia, gioia, ottimismo o tristezza. Esempio di tweet ed etichetta: “#Deppression è reale. I partner delle persone #depressed davvero non capiscono la profondità con cui ci influenzano. Aggiungi #anxiety & peggiora la situazione” è etichettato come triste.2
  • Rilevazione dell'odiosità: segnalare i discorsi d'odio in un tweet. Esempio di tweet ed etichetta: “Trump vuole deportare gli stranieri illegali senza ‘giudici né processi’ #MeToo Sono pienamente favorevole a questa azione. Il pensiero che qualcuno che entra illegalmente in un paese & non mostra rispetto per le sue leggi debba essere protetto dalle stesse leggi è assurdo! #DeportThemAll” è etichettato come odioso.3
  • Rilevazione dell'ironia: individuare l'intento ironico. Esempio di tweet ed etichetta: “Le persone che dicono a chi soffre di ansia di ‘smettere semplicemente di preoccuparsi’ sono il mio tipo di persone preferito #not #educateyourself” è etichettato come ironia.4
  • Rilevazione dell'offensività: classificare i tweet con linguaggio offensivo. Esempio di tweet ed etichetta: “#ConstitutionDay È molto strano che i conservatori della alt right dicano che stiamo rovinando la costituzione perché vogliamo #GunControlNow, ma sono loro a rovinare la costituzione arrabbiandosi perché gli stranieri che arrivano in questo paese e non sono bianchi vogliono vivere” è etichettato come offensivo.5
  • Classificazione del sentiment: assegnare un'etichetta positiva, negativa o neutra. Esempio di tweet ed etichetta: “Non vedo l'ora di provarlo – Google Earth VR – questa roba è davvero il futuro dell'esplorazione….” è etichettato come positivo.6

Questi task sono in linea con gli approcci di machine learning del mondo reale, il che li rende ideali per valutare i risultati sperimentali dei due model.

Model testati

Abbiamo testato 10 large language model, tutti tramite l'OpenRouter API, così la configurazione era la stessa per ciascuno:

GPT 5.5, ChatGPT 5.4 mini, Claude Sonnet 4.6, Claude Opus 4.8, Gemini 3.1-pro, Gemini 3.5 Flash, Qwen 3.6 Plus, Kimi k2.6, GLM 5.1 e Minimax M2.7.

Configurazione sperimentale

Abbiamo mantenuto ogni impostazione identica per tutti e 10 i model.

Campione

Abbiamo usato i primi 200 tweet del set di test ufficiale di ogni task, con le gold label del dataset. Gli stessi 200 tweet sono stati inviati a ogni model, quindi il confronto è omogeneo.

Prompting

Abbiamo usato prompt zero-shot: un'istruzione di task semplice e il tweet grezzo, senza esempi svolti. Il model ha restituito una sola etichetta e nient'altro.

Abbiamo scritto i prompt in modo che non rivelassero nulla. Non abbiamo nominato il benchmark, chiamato il model “annotatore” né lasciato intendere che veniva valutato. Nominare il test può cambiare il modo in cui un model risponde, quindi lo abbiamo omesso. Il prompt per le emozioni, per esempio, chiedeva al model di scegliere una tra rabbia, gioia, ottimismo o tristezza e di rispondere con quella parola.

Impostazioni di generazione

Abbiamo impostato la temperatura a 0, il che rende l'output stabile quanto il model consente. Abbiamo impostato il limite di token a 4.096. Il limite alto è importante per i model di ragionamento: con un limite piccolo spendono l'intero budget nel ragionamento nascosto e restituiscono una risposta vuota. Lo spazio extra consente loro di completare il ragionamento e di stampare comunque l'etichetta. I model che non ragionano rispondono con una sola parola breve, quindi il limite non costa nulla in quel caso.

Lettura delle risposte

Abbiamo mappato ogni risposta a un'etichetta in più passaggi: prima una corrispondenza esatta, poi una breve lista di sinonimi (per esempio, “felice” corrisponde a gioia), poi una ricerca di qualsiasi etichetta all'interno di una risposta più lunga. Le risposte che non siamo riusciti a leggere sono state conteggiate come errate.

Metrica

Il punteggio per ogni task non è accuratezza grezza. Abbiamo usato la metrica definita dagli autori di TweetEval per ciascun task:

  • Emozione: macro-F1
  • Sentiment: macro-recall
  • Odiosità: macro-F1
  • Ironia: F1 della classe ironia
  • Offensività: macro-F1

Macro-F1 e macro-recall pesano entrambe ogni classe allo stesso modo, indipendentemente dalla frequenza con cui compare. Questa è la scelta giusta in questo caso perché classi come odio o ironia sono rare e l'accuratezza semplice permetterebbe a un model di sembrare buono scegliendo sempre l'etichetta comune. La colonna media è la media di questi cinque punteggi.

Affidabilità

Alcuni model hanno raggiunto i limiti di velocità durante l'esecuzione e hanno perso alcune chiamate. Abbiamo rieseguito le righe non riuscite a bassa velocità per evitare i limiti e abbiamo ripetuto l'operazione finché non ci sono stati più errori. I risultati finali non contengono chiamate non riuscite né risposte illeggibili.

Limiti della configurazione

Abbiamo usato una porzione di 200 tweet di ogni set di test, non l'intero set, quindi questi numeri non coincidono con la classifica ufficiale TweetEval pubblicata. Il confronto tra i nostri 10 model resta comunque valido, perché ogni model ha visto gli stessi tweet.

La porzione di 200 tweet è fissa, non casuale, quindi è riproducibile ma non è un campione casuale. Ogni task ha inoltre usato un singolo prompt a temperatura 0. Un prompt diverso, o esempi few-shot, sposterebbe i numeri assoluti.

Abbiamo usato dataset con gold label pubbliche. Questo comporta un rischio di contaminazione, nel caso in cui un model abbia visto le etichette durante l'addestramento. Non possiamo escluderlo, ma i punteggi erano ben lontani dalla perfezione, il che suggerisce che non sia stato un fattore determinante. Per la prossima versione, prevediamo di testare tweet le cui etichette non sono state pubblicate.

Poiché il campione è di 200 tweet per task, piccoli scarti comportano rumore di campionamento. Trattiamo una differenza di uno o due punti come parità anziché come classifica.

Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Quale model scegliere

I punteggi completi sono nella tabella sopra. Questa sezione è più breve: associa le esigenze comuni al model più adatto.

  • Scelta migliore a tutto tondo: GPT 5.5. Si è classificato primo ed è rimasto forte in ogni task, quindi è l'impostazione predefinita sicura quando il tuo lavoro combina più attività di sentiment.
  • Moderazione dei contenuti e discorsi d'odio: Claude Sonnet 4.6. Ha ottenuto il punteggio più alto di qualsiasi model nell'odiosità. GPT 5.5 è un secondo molto vicino.
  • Rilevazione del linguaggio offensivo con un budget limitato: ChatGPT 5.4 mini. Ha guidato l'offensività e ha eguagliato i migliori punteggi sull'ironia, cosa rara per un model più piccolo ed economico.
  • Monitoraggio di emozioni e sentiment: Gemini 3.1-pro o Qwen 3.6 Plus. Entrambi si trovano in cima a queste due colonne. Usali per lavori su umore e opinioni piuttosto che per la moderazione.
  • Ironia e sarcasmo: quasi qualsiasi model qui. I punteggi sono andati da 82% a 91%, quindi questo task raramente determina la scelta. Scegli il model più economico che soddisfa le altre tue esigenze.
  • Uso costante e generico: Kimi k2.6. Nessun task eccezionale, ma nemmeno uno debole.
  • Da usare con cautela per lavori ad alto rischio: Gemini 3.5 Flash e Minimax M2.7 si sono classificati in fondo. Gemini 3.5 Flash è stato il più debole sui discorsi d'odio, quindi evitalo in particolare per la moderazione.

Un promemoria che attraversa tutto questo: leggi la colonna del tuo task, non la media. Un model può classificarsi a metà classifica in assoluto e comunque guidare l'unico task che ti interessa.

Ulteriori letture

Non perderti i nostri benchmark e approfondimenti basati sui dati. Il pulsante apre Google; selezionare AIMultiple conferma che desideri vedere AIMultiple più spesso nei risultati di ricerca di Google.
GoogleAggiungi come fonte preferita

Cita questo benchmark

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Ezgi Arslan, PhD. (2026) - "Test benchmark dell'analisi del sentiment: ChatGPT, Claude & Qwen". Pubblicato online su AIMultiple.com. Consultato il 1 Settembre 2026, da: https://aimultiple.com/sentiment-analysis-benchmark [Risorsa online]

PhD., E. A. (2026, 1 Settembre). Test benchmark dell'analisi del sentiment: ChatGPT, Claude & Qwen. AIMultiple. https://aimultiple.com/sentiment-analysis-benchmark

@misc{phd2026,
  author = {PhD., Ezgi Arslan,},
  title  = {{Test benchmark dell'analisi del sentiment: ChatGPT, Claude & Qwen}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/sentiment-analysis-benchmark}},
  note   = {AIMultiple. Consultato il 1 Settembre 2026}
}

Registro delle modifiche

6 aggiornamenti
  1. 2025

    Aggiunti ChatGPT 5.o, Claude 4.5 e Grok 4 alla sezione Risultati sperimentali: benchmark di analisi del sentiment.

  2. Sostituiti i modelli nella sezione Metodologia di analisi.

  3. Aggiunti ChatGPT 4.5, Claude 3.7 e DeepSeek V3 all'elenco dei modelli testati.

  4. Sostituito ChatGPT 4.0 con GPT-4o nella sezione metodologia.

  5. 2024

    Rimossa la sezione "Accuratezza complessiva" dalla fine del documento.

  6. Rimossa la sezione "Set di dati di benchmark e metodologia".

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Analista di settore
Ezgi ha conseguito un PhD in Economia aziendale con specializzazione in finanza e ricopre il ruolo di analista di settore presso AIMultiple. Conduce ricerche e approfondimenti all'intersezione tra tecnologia e business, con competenze che spaziano dalla sostenibilità alle indagini e all'analisi del sentiment, dalle applicazioni di agenti AI nella finanza all'ottimizzazione dei motori di risposta, dalla gestione dei firewall alle tecnologie di procurement.
Visualizza il profilo completo

Sii il primo a commentare

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450