Die präzise Kennzeichnung von Emotionen und Stimmungen sowie das Erkennen von Ironie, Hassrede und Anstößigkeit bleibt eine Herausforderung und erfordert weitere Tests und Verfeinerungen. Wir haben 10 Large Language Models in fünf Sentiment-Aufgaben getestet: Emotion, Hassrede, Ironie, Anstößigkeit und Sentiment. Wir haben sie anhand der durchschnittlichen Genauigkeit über alle fünf eingestuft.
Die Ergebnisse zeigen deutliche Unterschiede zwischen den Tools:
- GPT 5.5 erreichte die beste Gesamtgenauigkeit (80 %),
- Minimax M2.7 (72 %) verzeichnete die niedrigste Gesamtleistung.
Experimentelle Ergebnisse: Sentimentanalyse-Benchmark
Ranking: Die Tools werden anhand ihrer durchschnittlichen Genauigkeitsraten über alle getesteten Kategorien eingestuft: Emotion, Hassrede, Ironie, Anstößigkeit und Sentiment.
Weitere Details finden Sie in der Methodik unseres Benchmarks.
Gesamtgenauigkeit
Über alle Aufgaben kombiniert bieten die Gesamtgenauigkeitswerte der Models einen ganzheitlichen Überblick über ihre Fähigkeiten:
- GPT 5.5 belegte mit 80 % den ersten Platz. In keiner Aufgabe fiel es unter 73 %, was es zum konsistentesten Model im Test machte.
- Claude Sonnet 4.6 belegte mit 79 % den zweiten Platz. Es erzielte das beste Einzelergebnis im Benchmark: 82 % bei Hassrede.
- Qwen 3.6 Plus und ChatGPT 5.4 mini teilten sich mit 78 % den dritten Platz. ChatGPT 5.4 mini ist das kleinste Model nahe der Spitze, führte jedoch bei der Anstößigkeitserkennung und war bei der Ironie gleichauf auf dem ersten Platz.
- Kimi k2.6 erzielte 77 %, mit konstanten Ergebnissen und ohne klar schwache Aufgabe.
- Gemini 3.1-pro und GLM 5.1 lagen mit 76 % gleichauf. Gemini 3.1-pro war bei der Emotionserkennung gleichauf auf dem ersten Platz, rangierte bei Hassrede jedoch niedrig.
- Claude Opus 4.8 erzielte 74 %. Gebremst wurde es von der Emotionserkennung (68 %), seiner schwächsten Kategorie.
- Gemini 3.5 Flash erzielte 73 %. Sein Ergebnis bei Hassrede (65 %) war das niedrigste in dieser Aufgabe.
- Minimax M2.7 belegte mit 72 % den letzten Platz. Es erzielte die niedrigsten Werte bei Emotion, Ironie und Anstößigkeit.
1. Emotionserkennung
Die Emotionserkennung ist eine anspruchsvolle Aufgabe in der Sentimentanalyse und erfordert von den Models oft, subtile Hinweise in der Sprache zu erkennen. So haben die Models abgeschnitten:
- GPT 5.5 und Gemini 3.1-pro waren mit 80 % gleichauf auf dem ersten Platz.
- Qwen 3.6 Plus folgte mit 79 %.
- Kimi k2.6 erzielte 78 % und GLM 5.1 erzielte 77 %.
- ChatGPT 5.4 mini erreichte 76 % und Claude Sonnet 4.6 erreichte 75 %.
- Gemini 3.5 Flash erzielte 73 %.
- Claude Opus 4.8 erzielte 68 %.
- Minimax M2.7 erzielte mit 66 % den niedrigsten Wert.
Die Emotionserkennung hatte eine große Spannweite: 14 Punkte zwischen den besten und den schlechtesten Models. Damit ist sie eine der beiden Aufgaben, die Models am deutlichsten trennen.
2. Hassrede-Erkennung
Das Erkennen hasserfüllter Inhalte ist für die Twitter-Sentiment-Klassifizierung und andere Moderationsaufgaben entscheidend. Die Ergebnisse zeigten deutliche Unterschiede:
- Claude Sonnet 4.6 führte mit 82 %, dem höchsten Einzelwert im Benchmark.
- GPT 5.5 folgte mit 80 % knapp dahinter.
- Qwen 3.6 Plus erzielte 77 %.
- Kimi k2.6 und GLM 5.1 erzielten beide 76 %.
- Minimax M2.7 erzielte 75 %.
- ChatGPT 5.4 mini erzielte 72 %.
- Gemini 3.1-pro und Claude Opus 4.8 erzielten beide 71 %.
- Gemini 3.5 Flash erzielte mit 65 % den niedrigsten Wert.
Hassrede hatte die größte Spannweite aller Aufgaben: 17 Punkte. Wenn Moderation Ihr Anwendungsfall ist, wählen Sie aus den oberen Plätzen dieser Spalte und nicht nach dem durchschnittlichen Ranking.
3. Ironie-Erkennung
Die Ironie-Erkennung ist ein Bereich, in dem die semantische Bewertung eine zentrale Rolle spielt. Beide Models lieferten eine hohe Sentimentanalyse-Benchmark-Leistung, aber GPT-4o erwies sich als klarer Spitzenreiter:
- GPT 5.5, Claude Sonnet 4.6, Qwen 3.6 Plus und ChatGPT 5.4 mini lagen mit 91 % gleichauf auf dem ersten Platz.
- Gemini 3.1-pro, GLM 5.1 und Gemini 3.5 Flash erzielten jeweils 87 %.
- Claude Opus 4.8 erzielte 86 % und Kimi k2.6 erzielte 85 %.
- Minimax M2.7 erzielte mit 82 % den niedrigsten Wert.
Dies war die einfachste Aufgabe im Set. Selbst der niedrigste Wert lag bei 82 %. Für Arbeiten, die auf das Erkennen von Ironie oder Sarkasmus angewiesen sind, ist jedes dieser Models ein sicherer Ausgangspunkt.
4. Anstößigkeitserkennung
Das Erkennen anstößiger Inhalte ist entscheidend für die Aufrechterhaltung gesunder Online-Communitys. Die Sentimentanalyse-Benchmark-Leistungen der Models in dieser Aufgabe waren wie folgt:
- ChatGPT 5.4 mini führte mit 75 %.
- GPT 5.5 erzielte 73 % und Claude Sonnet 4.6 erzielte 72 %. Claude Opus 4.8 erzielte 70 %.
- Qwen 3.6 Plus, Kimi k2.6, Gemini 3.1-pro und GLM 5.1 erzielten alle 69 %.
- Gemini 3.5 Flash erzielte 68 %.
- Minimax M2.7 erzielte mit 65 % den niedrigsten Wert.
Kein Model erreichte bei der Anstößigkeitsmetrik 76 %. Das gesamte Feld reichte von 65 % bis 75 %. Diese Aufgabe wird vom Kontext bestimmt, und die Grenzfälle des Datasets bringen jedes Model zu Fall.
5. Sentimentanalyse
Die übergeordnete Sentimentanalyse-Aufgabe konzentrierte sich auf die Klassifizierung von Daten in positive, negative und neutrale Stimmungen. Die Genauigkeitswerte für diese Aufgabe variierten erheblich zwischen den Models:
- GPT 5.5, Qwen 3.6 Plus, ChatGPT 5.4 mini und Gemini 3.1-pro lagen mit 75 % gleichauf auf dem ersten Platz.
- Kimi k2.6, Claude Opus 4.8, Gemini 3.5 Flash und Minimax M2.7 erzielten alle 74 %.
- Claude Sonnet 4.6 erzielte 73 %.
- GLM 5.1 erzielte mit 72 % den niedrigsten Wert.
Die gesamte Spannweite betrug 3 Punkte, von 72 % bis 75 %. Kein Model bewältigte die dreistufige Sentimentklassifizierung gut. Wenn das Projekt zuverlässige positive, negative und neutrale Labels benötigt, ist keines dieser Models ohne menschliche Prüfung einsatzbereit.
Beobachtungen und Erkenntnisse
Aufgaben sind nicht gleich schwer
Ironie war für jedes Model einfach (82 % bis 91 %). Sentiment und Anstößigkeit waren für jedes Model schwer, alle Werte lagen zwischen 65 % und 75 %. Wählen Sie ein Model für die tatsächlich vorhandene Aufgabe, nicht nach seinem durchschnittlichen Rang.
Emotion und Hassrede trennen die Models am besten
Diese beiden Aufgaben hatten die größten Punktabstände: 14 und 17 Punkte. Wenn Ihr Anwendungsfall Emotions-Tracking oder Moderation ist, ist die Wahl des Models hier wichtiger als irgendwo sonst.
Ein hoher Durchschnitt kann eine schwache Aufgabe verbergen
GPT 5.5 belegte insgesamt den ersten Platz und blieb durchweg stark. Aber Claude Opus 4.8 belegte insgesamt den achten Platz und erzielte bei Ironie 86 %. Lesen Sie die Spalte für Ihre Aufgabe, nicht den Durchschnitt.
Benchmark-Dataset und Methodik
Analyse-Dataset
Wir haben das TweetEval-Dataset verwendet, das für die Sentimentanalyse echter Twitter-Nachrichten erstellt wurde.1 Es ist Teil der Arbeit der Association for Computational Linguistics (ACL) zur semantischen Evaluation. Das Dataset enthält vorbeschriftete Trainings- und Testsets für fünf Aufgabentypen:
- Emotionserkennung: das Benennen des Gefühls in einem Tweet, z. B. Wut, Freude, Optimismus oder Traurigkeit. Beispiel-Tweet und Label: „#Deppression ist real. Partner mit #depressed Menschen verstehen wirklich nicht, wie tief sie uns beeinflussen. Dazu #anxiety zu haben macht es noch schlimmer“ ist als traurig gekennzeichnet.2
- Hassrede-Erkennung: das Kennzeichnen von Hassrede in einem Tweet. Beispiel-Tweet und Label: „Trump will illegale Einwanderer mit ‚keine Richter oder Gerichtsverfahren‘ abschieben #MeToo Ich stehe voll hinter dieser Aktion Der Gedanke, dass jemand, der illegal in ein Land einreist und keinen Respekt vor dessen Gesetzen zeigt, durch dieselben Gesetze geschützt werden sollte, ist absurd! #DeportThemAll“ ist als hasserfüllt gekennzeichnet.3
- Ironie-Erkennung: das Erkennen ironischer Absichten. Beispiel-Tweet und Label: „Menschen, die anderen mit Angstzuständen sagen, sie sollen ‚einfach aufhören, sich Sorgen zu machen‘, sind meine Lieblingsmenschen #not #educateyourself“ ist als ironisch gekennzeichnet.4
- Anstößigkeitserkennung: das Klassifizieren von Tweets mit anstößiger Sprache. Beispiel-Tweet und Label: „#ConstitutionDay Es ist sehr seltsam, dass die Rechtsaußen-Konservativen sagen, wir würden die Verfassung ruinieren, weil wir #GunControlNow wollen, aber sie selbst ruinieren die Verfassung, indem sie sich aufregen, weil Ausländer in dieses Land kommen, die nicht weiß sind und leben wollen“ ist als anstößig gekennzeichnet.5
- Sentimentklassifizierung: das Zuweisen eines positiven, negativen oder neutralen Labels. Beispiel-Tweet und Label: „Kann es kaum erwarten, das auszuprobieren – Google Earth VR – das ist wirklich die Zukunft der Erkundung ….“ ist als positiv gekennzeichnet.6
Diese Aufgaben entsprechen realen Machine-Learning-Ansätzen und eignen sich daher ideal zur Bewertung der experimentellen Ergebnisse der beiden Models.
Getestete Models
Wir haben 10 Large Language Models getestet, alle über die OpenRouter API, sodass der Aufbau für jedes gleich war:
GPT 5.5, ChatGPT 5.4 mini, Claude Sonnet 4.6, Claude Opus 4.8, Gemini 3.1-pro, Gemini 3.5 Flash, Qwen 3.6 Plus, Kimi k2.6, GLM 5.1 und Minimax M2.7.
Experimenteller Aufbau
Wir haben alle Einstellungen über alle 10 Models hinweg gleich gehalten.
Stichprobe
Wir haben die ersten 200 Tweets jedes offiziellen Testsets der Aufgaben verwendet, mit den Gold-Labels des Datasets. Dieselben 200 Tweets gingen an jedes Model, sodass der Vergleich unter gleichen Bedingungen erfolgt.
Prompting
Wir haben Zero-Shot-Prompts verwendet: eine einfache Aufgabenanweisung und den unverarbeiteten Tweet, ohne ausgearbeitete Beispiele. Das Model gab ein einziges Label zurück und sonst nichts.
Wir haben die Prompts so formuliert, dass sie nichts verraten. Wir nannten weder den Benchmark, noch bezeichneten wir das Model als „Annotator“, noch deuteten wir an, dass es bewertet wurde. Die Benennung des Tests kann beeinflussen, wie ein Model antwortet, daher ließen wir sie weg. Der Emotions-Prompt bat das Model beispielsweise, eine der Optionen Wut, Freude, Optimismus oder Traurigkeit auszuwählen und mit dem jeweiligen Wort zu antworten.
Generierungseinstellungen
Wir haben die Temperatur auf 0 gesetzt, was die Ausgabe so stabil macht, wie es das Model zulässt. Wir haben das Token-Limit auf 4.096 gesetzt. Das hohe Limit ist für Reasoning-Models wichtig: Bei einem niedrigen Limit verbrauchen sie das gesamte Budget für verborgenes Reasoning und geben eine leere Antwort zurück. Der zusätzliche Raum ermöglicht es ihnen, das Reasoning abzuschließen und trotzdem das Label auszugeben. Models, die nicht schlussfolgern, antworten mit einem einzigen kurzen Wort, daher ist das Limit dort ohne Kosten.
Lesen der Antworten
Wir haben jede Antwort schrittweise einem Label zugeordnet: zuerst eine exakte Übereinstimmung, dann eine kurze Liste von Synonymen (zum Beispiel wird „happy“ der Freude zugeordnet), dann die Suche nach einem beliebigen Label in einer längeren Antwort. Antworten, die wir nicht lesen konnten, wurden als falsch gewertet.
Metrik
Der Score für jede Aufgabe ist keine rohe Genauigkeit. Wir haben die Metrik verwendet, die TweetEval-Autoren für jede Aufgabe festgelegt haben:
- Emotion: Macro-F1
- Sentiment: Macro-Recall
- Hassrede: Macro-F1
- Ironie: F1 der Ironie-Klasse
- Anstößigkeit: Macro-F1
Macro-F1 und Macro-Recall gewichten beide jede Klasse gleich, unabhängig davon, wie oft sie auftritt. Dies ist hier die richtige Wahl, da Klassen wie Hass oder Ironie selten sind und eine einfache Genauigkeit ein Model gut aussehen lassen würde, wenn es immer das häufige Label wählt. Die Durchschnittsspalte ist der Mittelwert dieser fünf Scores.
Zuverlässigkeit
Einige wenige Models stießen während des Laufs auf Ratenlimits und verloren einige Aufrufe. Wir haben die fehlgeschlagenen Zeilen mit niedriger Geschwindigkeit erneut ausgeführt, um die Limits zu vermeiden, und dies wiederholt, bis nichts mehr fehlschlug. Die Endergebnisse enthalten keine fehlgeschlagenen Aufrufe und keine unlesbaren Antworten.
Einschränkungen des Setups
Wir haben einen Ausschnitt von 200 Tweets aus jedem Testset verwendet, nicht den vollständigen Satz, daher stimmen diese Zahlen nicht mit der veröffentlichten TweetEval-Bestenliste überein. Der Vergleich über unsere 10 Models hinweg ist weiterhin gültig, da jedes Model dieselben Tweets gesehen hat.
Der Ausschnitt mit 200 Tweets ist fest und nicht zufällig, daher ist er reproduzierbar, aber keine Zufallsstichprobe. Jede Aufgabe verwendete außerdem einen einzelnen Prompt bei Temperatur 0. Ein anderer Prompt oder Few-Shot-Beispiele würden die absoluten Zahlen verschieben.
Wir haben Datasets mit öffentlichen Gold-Labels verwendet. Dies birgt das Risiko einer Kontamination, bei der ein Model die Labels während des Trainings gesehen hat. Wir können dies nicht ausschließen, aber die Scores blieben weit von perfekt entfernt, was darauf hindeutet, dass es kein wesentlicher Faktor war. Für die nächste Version planen wir, Tweets zu testen, deren Labels noch nicht veröffentlicht wurden.
Da die Stichprobe 200 Tweets pro Aufgabe umfasst, sind kleine Abstände mit Stichprobenrauschen behaftet. Wir behandeln eine Differenz von ein bis zwei Punkten als Gleichstand und nicht als Rangfolge.
Welches Model wählen
Die vollständigen Scores finden Sie in der Tabelle oben. Dieser Abschnitt ist kürzer: Er ordnet häufige Anforderungen dem passenden Model zu.
- Beste Allround-Wahl: GPT 5.5. Es belegte den ersten Platz und blieb bei jeder Aufgabe stark, daher ist es die sichere Standardwahl, wenn Ihre Arbeit mehrere Sentiment-Aufgaben kombiniert.
- Inhaltsmoderation und Hassrede: Claude Sonnet 4.6. Es erzielte den höchsten Wert aller Models bei Hassrede. GPT 5.5 ist ein knapper Zweiter.
- Erkennung anstößiger Sprache mit begrenztem Budget: ChatGPT 5.4 mini. Es führte bei der Anstößigkeit und erreichte die Spitzenwerte bei der Ironie, was für ein kleineres, günstigeres Model selten ist.
- Emotions- und Sentiment-Tracking: Gemini 3.1-pro oder Qwen 3.6 Plus. Beide stehen an der Spitze dieser beiden Spalten. Verwenden Sie eher für Stimmungs- und Meinungsarbeit als für Moderation.
- Ironie und Sarkasmus: fast jedes Model hier. Die Werte reichten von 82 % bis 91 %, daher bestimmt diese Aufgabe selten die Wahl. Wählen Sie das günstigste Model, das Ihre anderen Anforderungen erfüllt.
- Zuverlässiger, allgemeiner Einsatz: Kimi k2.6. Keine herausragende Aufgabe, aber auch keine schwache.
- Mit Vorsicht bei risikoreichen Aufgaben verwenden: Gemini 3.5 Flash und Minimax M2.7 rangierten am unteren Ende. Gemini 3.5 Flash war bei Hassrede am schwächsten, daher sollten Sie es insbesondere für Moderation meiden.
Ein Hinweis, der sich durch all dies zieht: Lesen Sie die Spalte für Ihre Aufgabe, nicht den Durchschnitt. Ein Model kann insgesamt im Mittelfeld liegen und dennoch bei der einen Aufgabe, die Ihnen wichtig ist, führend sein.
Weiterführende Informationen
- Open-Source-Tools zur Sentimentanalyse
- Getestete Top-Tools für Emotions-KI
- Methoden für Audio-Sentimentanalyse
Zitieren Sie diesen Benchmark
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{phd2026,
author = {PhD., Ezgi Arslan,},
title = {{Sentimentanalyse-Benchmark-Tests: ChatGPT, Claude & Qwen}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/sentiment-analysis-benchmark}},
note = {AIMultiple. Abgerufen am 1. September 2026}
}Änderungsprotokoll
6 Aktualisierungen- 2025
ChatGPT 5.o, Claude 4.5 und Grok 4 zum Abschnitt „Experimentelle Ergebnisse: Sentimentanalyse-Benchmark“ hinzugefügt.
Die Modelle im Abschnitt „Analysemethodik“ wurden ersetzt.
ChatGPT 4.5, Claude 3.7 und DeepSeek V3 wurden der Liste der getesteten Modelle hinzugefügt.
ChatGPT 4.0 wurde im Methodik-Abschnitt durch GPT-4o ersetzt.
- 2024
Der Abschnitt „Gesamtgenauigkeit“ am Ende des Dokuments wurde entfernt.
Der Abschnitt „Benchmark-Datensatz und Methodik“ wurde entfernt.
Seien Sie der Erste, der kommentiert
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.