Servizi
Contattaci

Test Benchmark sull'Analisi del Sentiment: ChatGPT, Claude & Qwen

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
aggiornato il 15 giu. 2026

Ottenere un'etichettatura precisa delle emozioni e dei sentimenti, così come rilevare ironia, odio e offensività, rimane una sfida, che richiede ulteriori test e perfezionamenti. Abbiamo testato 10 modelli linguistici di grandi dimensioni su cinque compiti di sentiment: emozione, odio, ironia, offensività e sentiment. Li abbiamo classificati in base all'accuratezza media su tutti e cinque.

I risultati evidenziano chiare distinzioni tra gli strumenti:

  • GPT 5.5 ha raggiunto la migliore accuratezza complessiva (80%),
  • Minimax M2.7 (72%) ha registrato le prestazioni complessive più basse.

Risultati sperimentali: benchmark sull'analisi del sentiment

Loading Chart

Classifica: Gli strumenti sono classificati in base ai loro tassi di accuratezza media aggregati su tutte le categorie testate: emozione, odio, ironia, offensività e sentiment.

Per ulteriori dettagli, leggi la metodologia del nostro benchmark.

Accuratezza complessiva

Combinando tutti i compiti, i punteggi di accuratezza totale dei modelli forniscono una visione olistica delle loro capacità:

  • GPT 5.5 si è classificato primo con 80%. Non è mai sceso sotto il 73% in nessun compito, il che lo ha reso il modello più costante nel test.
  • Claude Sonnet 4.6 è arrivato secondo con 79%. Ha ottenuto il singolo risultato più alto del benchmark: 82% sull'odio.
  • Qwen 3.6 Plus e ChatGPT 5.4 mini sono a pari merito al terzo posto con 78%. ChatGPT 5.4 mini è il modello più piccolo tra i primi, eppure ha guidato la rilevazione dell'offensività ed è arrivato primo a pari merito nell'ironia.
  • Kimi k2.6 ha ottenuto 77%, con risultati costanti e nessun compito chiaramente debole.
  • Gemini 3.1-pro e GLM 5.1 sono a pari merito con 76%. Gemini 3.1-pro è arrivato primo a pari merito nella rilevazione delle emozioni ma si è classificato basso nell'odio.
  • Claude Opus 4.8 ha ottenuto 74%. È stato frenato dalla rilevazione delle emozioni (68%), la sua categoria più debole.
  • Gemini 3.5 Flash ha ottenuto 73%. Il suo risultato sull'odio (65%) è stato il più basso in quel compito.
  • Minimax M2.7 si è classificato ultimo con 72%. Ha ottenuto il punteggio più basso in emozione, ironia e offensività.

1. Rilevazione delle emozioni

La rilevazione delle emozioni è un compito impegnativo nell'analisi del sentiment, che spesso richiede ai modelli di discernere segnali sottili nel linguaggio. Ecco come si sono comportati i modelli:

  • GPT 5.5 e Gemini 3.1-pro sono primi a pari merito con 80%.
  • Qwen 3.6 Plus segue con 79%.
  • Kimi k2.6 ha ottenuto 78%, e GLM 5.1 ha ottenuto 77%.
  • ChatGPT 5.4 mini ha raggiunto 76%, e Claude Sonnet 4.6 ha raggiunto 75%.
  • Gemini 3.5 Flash ha ottenuto 73%.
  • Claude Opus 4.8 ha ottenuto 68%.
  • Minimax M2.7 ha ottenuto il punteggio più basso con 66%.

La rilevazione delle emozioni ha avuto un'ampia forbice: 14 punti tra il modello migliore e quello peggiore. Questo la rende uno dei due compiti che separano più chiaramente i modelli.

2. Rilevazione dell'odio

Rilevare contenuti d'odio è cruciale per la classificazione del sentiment su Twitter e altre attività di moderazione. I risultati hanno rivelato differenze notevoli:

  • Claude Sonnet 4.6 è in testa con 82%, il singolo punteggio più alto del benchmark.
  • GPT 5.5 segue da vicino con 80%.
  • Qwen 3.6 Plus ha ottenuto 77%.
  • Kimi k2.6 e GLM 5.1 hanno entrambi ottenuto 76%.
  • Minimax M2.7 ha ottenuto 75%.
  • ChatGPT 5.4 mini ha ottenuto 72%.
  • Gemini 3.1-pro e Claude Opus 4.8 hanno entrambi ottenuto 71%.
  • Gemini 3.5 Flash ha ottenuto il punteggio più basso con 65%.

L'odio ha avuto la forbice più ampia di qualsiasi compito: 17 punti. Se la moderazione è il tuo caso d'uso, scegli tra i primi di questa colonna piuttosto che dalla classifica media.

3. Rilevazione dell'ironia

La rilevazione dell'ironia è un'area in cui la valutazione semantica gioca un ruolo fondamentale. Entrambi i modelli hanno offerto elevate prestazioni nel benchmark sull'analisi del sentiment, ma GPT-4o è emerso come leader indiscusso:

  • GPT 5.5, Claude Sonnet 4.6, Qwen 3.6 Plus e ChatGPT 5.4 mini sono primi a pari merito con 91%.
  • Gemini 3.1-pro, GLM 5.1 e Gemini 3.5 Flash hanno ciascuno ottenuto 87%.
  • Claude Opus 4.8 ha ottenuto 86%, e Kimi k2.6 ha ottenuto 85%.
  • Minimax M2.7 ha ottenuto il punteggio più basso con 82%.

Questo è stato il compito più facile del set. Anche il punteggio più basso è stato 82%. Per un lavoro che dipende dal cogliere l'ironia o il sarcasmo, uno qualsiasi di questi modelli è un punto di partenza sicuro.

4. Rilevazione dell'offensività

Rilevare contenuti offensivi è fondamentale per mantenere comunità online sane. Le prestazioni dei modelli nel benchmark sull'analisi del sentiment in questo compito sono state le seguenti:

  • ChatGPT 5.4 mini è in testa con 75%.
  • GPT 5.5 ha ottenuto 73%, e Claude Sonnet 4.6 ha ottenuto 72%. Claude Opus 4.8 ha ottenuto 70%.
  • Qwen 3.6 Plus, Kimi k2.6, Gemini 3.1-pro e GLM 5.1 hanno tutti ottenuto 69%.
  • Gemini 3.5 Flash ha ottenuto 68%.
  • Minimax M2.7 ha ottenuto il punteggio più basso con 65%.

Nessun modello ha raggiunto il 76% nella metrica dell'offensività. L'intero campo è andato dal 65% al 75%. Il contesto guida questo compito, e i casi limite del dataset mettono in difficoltà ogni modello.

5. Analisi del sentiment

Il compito generale di analisi del sentiment si è concentrato sulla classificazione dei dati in sentimenti positivi, negativi e neutri. I punteggi di accuratezza per questo compito sono variati significativamente tra i modelli:

  • GPT 5.5, Qwen 3.6 Plus, ChatGPT 5.4 mini e Gemini 3.1-pro sono primi a pari merito con 75%.
  • Kimi k2.6, Claude Opus 4.8, Gemini 3.5 Flash e Minimax M2.7 hanno tutti ottenuto 74%.
  • Claude Sonnet 4.6 ha ottenuto 73%.
  • GLM 5.1 ha ottenuto il punteggio più basso con 72%.

L'intervallo completo è stato di 3 punti, dal 72% al 75%. Nessun modello ha gestito bene il sentiment a tre vie. Se il progetto richiede etichette affidabili di positivo, negativo e neutro, nessuno di questi modelli è pronto per essere eseguito senza un controllo umano.

Osservazioni e approfondimenti

I compiti non sono ugualmente difficili

L'ironia è stata facile per ogni modello (dall'82% al 91%). Sentiment e offensività sono stati difficili per ogni modello, con tutti i punteggi tra il 65% e il 75%. Scegli un modello per il compito che hai effettivamente, non per la sua posizione media.

Emozione e odio separano meglio i modelli

Questi due compiti hanno avuto i divari di punteggio più ampi: 14 e 17 punti. Se il tuo caso d'uso è il tracciamento delle emozioni o la moderazione, la scelta del modello conta più qui che altrove.

Una media alta può nascondere un compito debole

GPT 5.5 si è classificato primo in assoluto ed è rimasto forte su tutta la linea. Ma Claude Opus 4.8 si è classificato ottavo in assoluto, ottenendo l'86% sull'ironia. Leggi la colonna per il tuo compito, non la media.

Dataset del benchmark e metodologia

Dataset di analisi

Abbiamo utilizzato il dataset TweetEval, creato per l'analisi del sentiment su messaggi Twitter reali.1 Fa parte del lavoro dell'Association for Computational Linguistics (ACL) sulla valutazione semantica. Il dataset viene fornito con set di addestramento e test pre-etichettati su cinque tipi di compiti:

  • Rilevazione delle emozioni: identificare la sensazione in un tweet, come rabbia, gioia, ottimismo o tristezza. Tweet ed etichetta di esempio: "#Deppression is real. Partners w/ #depressed people truly dont understand the depth in which they affect us. Add in #anxiety &makes it worse" è etichettato come triste.2
  • Rilevazione dell'odio: segnalare l'incitamento all'odio in un tweet. Tweet ed etichetta di esempio: "Trump wants to deport illegal aliens with 'no judges or court cases' #MeToo I am solidly behind this action The thought of someone illegally entering a country & showing no respect for its laws, should be protected by same laws is ludacris! #DeportThemAll" è etichettato come odioso.3
  • Rilevazione dell'ironia: individuare l'intento ironico. Tweet ed etichetta di esempio: "People who tell people with anxiety to 'just stop worrying about it' are my favorite kind of people #not #educateyourself" è etichettato come ironia.4
  • Rilevazione dell'offensività: classificare i tweet con linguaggio offensivo. Tweet ed etichetta di esempio: "#ConstitutionDay It's very odd for the alt right conservatives to say that we are ruining the constitution because we want #GunControlNow but they are the ones ruining the constitution getting upset because foreigners are coming to this land who are not White wanting to live" è etichettato come offensivo.5
  • Classificazione del sentiment: assegnare un'etichetta positiva, negativa o neutra. Tweet ed etichetta di esempio: "Can't wait to try this – Google Earth VR – this stuff really is the future of exploration…." è etichettato come positivo.6

Questi compiti sono in linea con gli approcci reali di machine learning, rendendoli ideali per valutare i risultati sperimentali dei due modelli.

Modelli testati

Abbiamo testato 10 modelli linguistici di grandi dimensioni, tutti tramite l'OpenRouter API in modo che la configurazione fosse la stessa per ciascuno:

GPT 5.5, ChatGPT 5.4 mini, Claude Sonnet 4.6, Claude Opus 4.8, Gemini 3.1-pro, Gemini 3.5 Flash, Qwen 3.6 Plus, Kimi k2.6, GLM 5.1 e Minimax M2.7.

Configurazione sperimentale

Abbiamo mantenuto ogni impostazione uguale per tutti i 10 modelli.

Campione

Abbiamo utilizzato i primi 200 tweet del set di test ufficiale di ciascun compito, con le etichette gold del dataset stesso. Gli stessi 200 tweet sono stati inviati a ogni modello, quindi il confronto è omogeneo.

Prompting

Abbiamo utilizzato prompt zero-shot: un'istruzione semplice del compito e il tweet grezzo, senza esempi elaborati. Il modello ha restituito un'etichetta e nient'altro.

Abbiamo scritto i prompt in modo che non rivelassero nulla. Non abbiamo nominato il benchmark, né chiamato il modello "annotatore", né accennato al fatto che fosse sotto valutazione. Nominare il test può cambiare il modo in cui un modello risponde, quindi l'abbiamo omesso. Il prompt per le emozioni, ad esempio, chiedeva al modello di scegliere tra rabbia, gioia, ottimismo o tristezza e rispondere con quella parola.

Impostazioni di generazione

Abbiamo impostato la temperatura a 0, il che rende l'output il più stabile possibile per il modello. Abbiamo impostato il limite di token a 4.096. Il limite alto è importante per i modelli di ragionamento: con un limite basso spendono l'intero budget nel ragionamento nascosto e restituiscono una risposta vuota. Lo spazio extra permette loro di finire il ragionamento e stampare comunque l'etichetta. I modelli che non ragionano rispondono con una sola parola breve, quindi il limite non costa nulla in quel caso.

Lettura delle risposte

Abbiamo mappato ogni risposta a un'etichetta in più fasi: prima una corrispondenza esatta, poi una breve lista di sinonimi (ad esempio, "happy" corrisponde a gioia), quindi una ricerca di qualsiasi etichetta all'interno di una risposta più lunga. Le risposte che non siamo riusciti a leggere sono state conteggiate come errate.

Metrica

Il punteggio per ciascun compito non è l'accuratezza grezza. Abbiamo utilizzato la metrica che gli autori di TweetEval hanno stabilito per ogni compito:

  • Emozione: macro-F1
  • Sentiment: macro-recall
  • Odio: macro-F1
  • Ironia: F1 della classe ironia
  • Offensività: macro-F1

Macro-F1 e macro-recall pesano entrambi ogni classe allo stesso modo, indipendentemente dalla frequenza con cui appare. Questa è la scelta giusta qui perché classi come l'odio o l'ironia sono rare, e l'accuratezza semplice permetterebbe a un modello di sembrare buono scegliendo sempre l'etichetta comune. La colonna della media è la media di questi cinque punteggi.

Affidabilità

Alcuni modelli hanno incontrato limiti di velocità durante l'esecuzione e hanno perso alcune chiamate. Abbiamo rieseguito le righe fallite a bassa velocità per evitare i limiti e ripetuto fino a quando non c'erano più fallimenti. I risultati finali non hanno chiamate fallite né risposte illeggibili.

Limitazioni della configurazione

Abbiamo utilizzato una porzione di 200 tweet di ciascun set di test, non il set completo, quindi questi numeri non corrispondono alla classifica pubblicata di TweetEval. Il confronto tra i nostri 10 modelli rimane valido, perché ogni modello ha visto gli stessi tweet.

La porzione di 200 tweet è fissa, non casuale, quindi è riproducibile ma non è un campione casuale. Ogni compito ha inoltre utilizzato un singolo prompt a temperatura 0. Un prompt diverso, o esempi few-shot, sposterebbero i numeri assoluti.

Abbiamo utilizzato dataset con etichette gold pubbliche. Questo comporta un rischio di contaminazione, dove un modello ha visto le etichette durante l'addestramento. Non possiamo escluderlo, ma i punteggi erano ben lontani dalla perfezione, il che suggerisce che non sia stato un fattore determinante. Per la prossima versione, prevediamo di testare tweet le cui etichette non sono state pubblicate.

Poiché il campione è di 200 tweet per compito, piccoli divari comportano rumore di campionamento. Trattiamo una differenza di uno o due punti come un pareggio piuttosto che una classifica.

Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Quale modello scegliere

I punteggi completi sono nella tabella sopra. Questa sezione è più breve: associa le esigenze comuni al modello più adatto.

  • Miglior scelta a tutto tondo: GPT 5.5. Si è classificato primo ed è rimasto forte su ogni compito, quindi è l'impostazione predefinita sicura quando il tuo lavoro combina diverse attività di sentiment.
  • Moderazione dei contenuti e incitamento all'odio: Claude Sonnet 4.6. Ha ottenuto il punteggio più alto di qualsiasi modello sull'odio. GPT 5.5 è un secondo molto vicino.
  • Rilevazione del linguaggio offensivo con un budget limitato: ChatGPT 5.4 mini. Ha guidato l'offensività ed eguagliato i migliori punteggi sull'ironia, il che è raro per un modello più piccolo ed economico.
  • Tracciamento di emozioni e sentiment: Gemini 3.1-pro o Qwen 3.6 Plus. Entrambi si collocano in cima a queste due colonne. Usali per lavori su umore e opinioni piuttosto che per la moderazione.
  • Ironia e sarcasmo: quasi tutti i modelli qui. I punteggi vanno dall'82% al 91%, quindi questo compito raramente determina la scelta. Scegli il modello più economico che soddisfa le tue altre esigenze.
  • Uso stabile e general-purpose: Kimi k2.6. Nessun compito eccezionale, ma nemmeno debole.
  • Da usare con cautela per lavori ad alto rischio: Gemini 3.5 Flash e Minimax M2.7 si sono classificati in fondo. Gemini 3.5 Flash è stato il più debole sull'incitamento all'odio, quindi evitalo in particolare per la moderazione.

Un promemoria che attraversa tutto questo: leggi la colonna per il tuo compito, non la media. Un modello può classificarsi a metà classifica in assoluto e comunque guidare l'unico compito che ti interessa.

Ulteriori letture

Scopri altri nostri benchmark e approfondimenti basati sui dati nella Ricerca Google.
GoogleAggiungi come fonte preferita

Cita questo benchmark

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Ezgi Arslan, PhD. (2026) - "Test Benchmark sull'Analisi del Sentiment: ChatGPT, Claude & Qwen". Pubblicato online su AIMultiple.com. Consultato il 15 Giugno 2026, da: https://aimultiple.com/sentiment-analysis-benchmark [Risorsa online]

PhD., E. A. (2026, 15 Giugno). Test Benchmark sull'Analisi del Sentiment: ChatGPT, Claude & Qwen. AIMultiple. https://aimultiple.com/sentiment-analysis-benchmark

@misc{phd2026,
  author = {PhD., Ezgi Arslan,},
  title  = {{Test Benchmark sull'Analisi del Sentiment: ChatGPT, Claude & Qwen}},
  year   = {2026},
  month  = jun,
  howpublished    = {\url{https://aimultiple.com/sentiment-analysis-benchmark}},
  note   = {AIMultiple. Consultato il 15 Giugno 2026}
}
Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Analista di Settore
Ezgi possiede un dottorato di ricerca in Business Administration con specializzazione in finanza e lavora come Analista di Settore presso AIMultiple. Guida la ricerca e gli approfondimenti all'intersezione tra tecnologia e business, con competenze che spaziano dalla sostenibilità, ai sondaggi e all'analisi del sentiment, alle applicazioni degli AI agent nella finanza, all'answer engine optimization, alla gestione dei firewall e alle tecnologie di procurement.
Visualizza il profilo completo

Sii il primo a commentare

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450