Hizmetler
Bize Ulaşın

Duygu Analizi Benchmark Testi: ChatGPT, Claude & Qwen

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Güncellenme tarihi: 1 Eyl 2026

Duyguların ve hislerin hassas şekilde etiketlenmesi, ayrıca ironi, nefret ve saldırganlığın tespit edilmesi hala zorlu bir iştir ve daha fazla test ile iyileştirme gerektirir. 10 büyük dil modelini beş duygu görevi üzerinde test ettik: duygu, nefret, ironi, saldırganlık ve duygu durumu. Onları beş görevin tümündeki ortalama doğruluklarına göre sıraladık.

Sonuçlar araçlar arasındaki net farkları ortaya koyuyor:

  • GPT 5.5 en iyi genel doğruluğa ulaştı (%80),
  • Minimax M2.7 (%72) en düşük genel performansı kaydetti.

Deneysel sonuçlar: duygu analizi benchmark'ı

Loading Chart

Sıralama: Araçlar, test edilen tüm kategoriler genelinde toplanan ortalama doğruluk oranlarına göre sıralanmıştır: duygu, nefret, ironi, saldırganlık ve duygu durumu.

Daha fazla ayrıntı için benchmark'ımızın metodolojisini okuyun.

Genel doğruluk

Tüm görevler birleştirildiğinde modellerin toplam doğruluk puanları yeteneklerine bütünsel bir bakış sağlar:

  • GPT 5.5 %80 ile birinci oldu. Hiçbir görevde %73'ün altına düşmedi; bu da onu testteki en tutarlı model yaptı.
  • Claude Sonnet 4.6 %79 ile ikinci oldu. Benchmark içindeki en yüksek tek sonucu elde etti: nefret tespitinde %82.
  • Qwen 3.6 Plus ve ChatGPT 5.4 mini %78 ile üçüncülüğü paylaştı. ChatGPT 5.4 mini zirveye yakın en küçük modeldir; yine de saldırganlık tespitinde lider oldu ve ironide birinciliği paylaştı.
  • Kimi k2.6 %77 aldı; istikrarlı sonuçlar ve belirgin zayıf görevi yoktu.
  • Gemini 3.1-pro ve GLM 5.1 %76 ile berabere kaldı. Gemini 3.1-pro duygu tespitinde birinciliği paylaştı ancak nefret tespitinde düşük sırada yer aldı.
  • Claude Opus 4.8 %74 aldı. En zayıf kategorisi olan duygu tespitindeki (%68) sonuç onu geride bıraktı.
  • Gemini 3.5 Flash %73 aldı. Nefret sonucu (%65) bu görevdeki en düşük sonuçtu.
  • Minimax M2.7 %72 ile son sırada yer aldı. Duygu, ironi ve saldırganlıkta en düşük puanları aldı.

1. Duygu tespiti

Duygu tespiti, duygu analizi içinde zorlu bir görevdir ve modellerin genellikle dildeki ince ipuçlarını ayırt etmesini gerektirir. Modellerin performansı şöyle:

  • GPT 5.5 ve Gemini 3.1-pro %80 ile birinciliği paylaştı.
  • Qwen 3.6 Plus %79 ile takip etti.
  • Kimi k2.6 %78 puan aldı ve GLM 5.1 %77 puan aldı.
  • ChatGPT 5.4 mini %76 oranına ulaştı ve Claude Sonnet 4.6 %75 oranına ulaştı.
  • Gemini 3.5 Flash %73 puan aldı.
  • Claude Opus 4.8 %68 puan aldı.
  • Minimax M2.7 en düşük puanı aldı: %66.

Duygu tespitinde geniş bir fark vardı: zirve ve dip modeller arasında 14 puan. Bu, onu modelleri en net şekilde ayıran iki görevden biri yapıyor.

2. Nefret tespiti

Nefret içeren içeriği tespit etmek Twitter duygu sınıflandırması ve diğer moderasyon görevleri için kritik öneme sahiptir. Sonuçlar dikkate değer farklılıklar ortaya koydu:

  • Claude Sonnet 4.6 %82 ile liderdi; bu benchmark'taki en yüksek tek puandı.
  • GPT 5.5 %80 ile yakından takip etti.
  • Qwen 3.6 Plus %77 puan aldı.
  • Kimi k2.6 ve GLM 5.1 her ikisi de %76 puan aldı.
  • Minimax M2.7 %75 puan aldı.
  • ChatGPT 5.4 mini %72 puan aldı.
  • Gemini 3.1-pro ve Claude Opus 4.8 her ikisi de %71 puan aldı.
  • Gemini 3.5 Flash en düşük puanı aldı: %65.

Nefret tespiti, tüm görevler arasında en geniş farka sahipti: 17 puan. Moderasyon sizin kullanım senaryonuzsa, ortalama sıralama yerine bu sütunun en üstünden seçin.

3. İroni tespiti

İroni tespiti, semantik değerlendirmenin önemli bir rol oynadığı bir alandır. Her iki model de yüksek duygu analizi benchmark performansı gösterdi, ancak GPT-4o açık bir lider olarak öne çıktı:

  • GPT 5.5, Claude Sonnet 4.6, Qwen 3.6 Plus ve ChatGPT 5.4 mini %91 ile birinciliği paylaştı.
  • Gemini 3.1-pro, GLM 5.1 ve Gemini 3.5 Flash her biri %87 puan aldı.
  • Claude Opus 4.8 %86 puan aldı ve Kimi k2.6 %85 puan aldı.
  • Minimax M2.7 en düşük puanı aldı: %82.

Bu, setteki en kolay görevdi. En düşük puan bile %82 idi. İroni veya alaycılığı yakalamaya dayalı işler için bu modellerden herhangi biri güvenli bir başlangıç noktasıdır.

4. Saldırganlık tespiti

Saldırgan içeriği tespit etmek sağlıklı çevrimiçi toplulukların sürdürülmesi için kritik öneme sahiptir. Modellerin bu görevdeki duygu analizi benchmark performansları şöyleydi:

  • ChatGPT 5.4 mini %75 ile liderdi.
  • GPT 5.5 %73 puan aldı ve Claude Sonnet 4.6 %72 puan aldı. Claude Opus 4.8 %70 puan aldı.
  • Qwen 3.6 Plus, Kimi k2.6, Gemini 3.1-pro ve GLM 5.1 hepsi %69 puan aldı.
  • Gemini 3.5 Flash %68 puan aldı.
  • Minimax M2.7 en düşük puanı aldı: %65.

Saldırganlık metriğinde hiçbir model %76 değerine ulaşamadı. Tüm alan %65 ile %75 arasında değişti. Bu görevi bağlam yönlendiriyor ve dataset'in sınırda kalan örnekleri her modeli zorluyor.

5. Duygu durumu analizi

Kapsayıcı duygu durumu analizi görevi, verileri pozitif, negatif ve nötr duygulara sınıflandırmaya odaklandı. Bu görev için doğruluk puanları modeller arasında önemli ölçüde farklılık gösterdi:

  • GPT 5.5, Qwen 3.6 Plus, ChatGPT 5.4 mini ve Gemini 3.1-pro %75 ile birinciliği paylaştı.
  • Kimi k2.6, Claude Opus 4.8, Gemini 3.5 Flash ve Minimax M2.7 hepsi %74 puan aldı.
  • Claude Sonnet 4.6 %73 puan aldı.
  • GLM 5.1 en düşük puanı aldı: %72.

Tam aralık %72 ile %75 arasında 3 puandı. Hiçbir model üç yönlü duygu durumunu iyi idare edemedi. Proje güvenilir pozitif, negatif ve nötr etiketler gerektiriyorsa, bu modellerin hiçbiri insan kontrolü olmadan çalışmaya hazır değildir.

Gözlemler ve içgörüler

Görevler eşit derecede zor değil

İroni her model için kolaydı (%82 ile %91). Duygu durumu ve saldırganlık her model için zordu; tüm puanlar %65 ile %75 arasındaydı. Modeli ortalama sıralamasına göre değil, gerçekte sahip olduğunuz göreve göre seçin.

Duygu ve nefret modelleri en iyi şekilde ayırıyor

Bu iki görev en geniş puan farklarına sahipti: 14 ve 17 puan. Kullanım senaryonuz duygu takibi veya moderasyonsa, model seçimi burada başka her yerden daha önemlidir.

Yüksek bir ortalama zayıf bir görevi gizleyebilir

GPT 5.5 genel sıralamada birinci oldu ve her alanda güçlü kaldı. Ancak Claude Opus 4.8 genel sıralamada sekizinci oldu; ironide %86 puan aldı. Göreviniz için sütunu okuyun, ortalamayı değil.

Benchmark dataset'i ve metodoloji

Analiz dataset'i

TweetEval dataset'ini kullandık; bu dataset, gerçek Twitter mesajları üzerinde duygu analizi için oluşturulmuştur.1 Bu, Association for Computational Linguistics (ACL) semantic değerlendirme çalışmasının bir parçasıdır. Dataset, beş görev türünde önceden etiketlenmiş eğitim ve test setleriyle birlikte gelir:

  • Duygu tespiti: bir tweet'teki öfke, neşe, iyimserlik veya üzüntü gibi duyguyu adlandırmak. Örnek tweet ve etiket: “#Deppression gerçektir. #depressed kişilerin partnerleri, bizi ne kadar derinden etkilediklerini gerçekten anlamıyorlar. Buna #anxiety ekleyince daha da kötüleşiyor” üzgün olarak etiketlenmiştir.2
  • Nefret tespiti: bir tweet'teki nefret söylemini işaretlemek. Örnek tweet ve etiket: “Trump ‘yargıçlar veya mahkeme davaları olmadan’ yasadışı yabancıları sınır dışı etmek istiyor #MeToo Bu eylemin tamamen arkasındayım Bir ülkeye yasadışı giren ve yasalarına saygı göstermeyen birinin aynı yasalarla korunması gerektiği düşüncesi saçmalıktır! #DeportThemAll” nefret içerikli olarak etiketlenmiştir.3
  • İroni tespiti: ironik niyeti fark etmek. Örnek tweet ve etiket: “Anksiyetesi olan insanlara ‘bunun hakkında endişelenmeyi bırak’ diyen insanlar benim en sevdiğim insan türü #not #educateyourself” ironi olarak etiketlenmiştir.4
  • Saldırganlık tespiti: saldırgan dil içeren tweetleri sınıflandırmak. Örnek tweet ve etiket: “#ConstitutionDay Alt right muhafazakarların, #GunControlNow istediğimiz için anayasayı mahvettiğimizi söylemeleri çok tuhaf; oysa anayasayı mahvedenler, bu topraklara yaşamak isteyen Beyaz olmayan yabancıların gelmesinden rahatsız olan onlardır” saldırgan olarak etiketlenmiştir.5
  • Duygu durumu sınıflandırması: pozitif, negatif veya nötr bir etiket atamak. Örnek tweet ve etiket: “Bunu denemek için sabırsızlanıyorum – Google Earth VR – bu şeyler gerçekten keşfin geleceği….” pozitif olarak etiketlenmiştir.6

Bu görevler gerçek dünyadaki makine öğrenmesi yaklaşımlarıyla örtüşür ve bu da onları iki modelin deneysel sonuçlarını değerlendirmek için ideal kılar.

Test edilen modeller

10 büyük dil modelini test ettik; hepsi OpenRouter API üzerinden test edildi, böylece kurulum her biri için aynıydı:

GPT 5.5, ChatGPT 5.4 mini, Claude Sonnet 4.6, Claude Opus 4.8, Gemini 3.1-pro, Gemini 3.5 Flash, Qwen 3.6 Plus, Kimi k2.6, GLM 5.1 ve Minimax M2.7.

Deneysel kurulum

Tüm 10 modelde her ayarı aynı tuttuk.

Örneklem

Her görevin resmi test setinin ilk 200 tweetini, dataset'in kendi altın etiketleriyle birlikte kullandık. Aynı 200 tweet her modele gitti, bu nedenle karşılaştırma birebir oldu.

Prompting

Sıfır örnekli prompt'lar kullandık: düz bir görev talimatı ve ham tweet, hiç çözülmüş örnek olmadan. Model yalnızca bir etiket döndürdü, başka hiçbir şey değil.

Prompt'ları hiçbir şey ele vermeyecek şekilde yazdık. Benchmark'ın adını vermedik, modele “etiketleyici” demedik veya notlandırıldığını ima etmedik. Testin adını vermek bir modelin nasıl cevap verdiğini değiştirebilir, bu yüzden bunu atladık. Örneğin duygu prompt'u, modelden öfke, neşe, iyimserlik veya üzüntüden birini seçip o kelimeyle yanıt vermesini istedi.

Üretim ayarları

Sıcaklığı 0'a ayarladık; bu, çıktıyı modelin izin verdiği ölçüde istikrarlı hale getirir. Token limitini 4.096 olarak belirledik. Yüksek limit, muhakeme yapan modeller için önemlidir: küçük bir limitle tüm bütçeyi gizli muhakemeye harcayıp boş bir cevap döndürürler. Ekstra alan, muhakemelerini bitirip yine de etiketi yazdırmalarını sağlar. Muhakeme yapmayan modeller tek kısa kelimeyle cevap verir, bu yüzden limitin orada bir maliyeti yoktur.

Cevapları okuma

Her yanıtı adım adım bir etikete eşleştirdik: önce tam eşleşme, sonra kısa bir eş anlamlılar listesi (örneğin, “mutlu” neşeye eşlenir), ardından daha uzun bir yanıt içinde herhangi bir etiketi arama. Okuyamadığımız yanıtlar yanlış sayıldı.

Metrik

Her görevin puanı ham doğruluk değildir. TweetEval yazarlarının her görev için belirlediği metriği kullandık:

  • Duygu: macro-F1
  • Duygu durumu: macro-recall
  • Nefret: macro-F1
  • İroni: ironi sınıfının F1 değeri
  • Saldırganlık: macro-F1

Macro-F1 ve macro-recall, her sınıfı ne sıklıkta görünürse görünsün aynı şekilde ağırlıklandırır. Burada doğru seçim budur; çünkü nefret veya ironi gibi sınıflar nadirdir ve düz doğruluk, bir modelin her zaman yaygın etiketi seçerek iyi görünmesine izin verir. Ortalama sütunu bu beş puanın ortalamasıdır.

Güvenilirlik

Birkaç model, çalışma sırasında hız limitlerine takıldı ve bazı çağrıları düşürdü. Limitlerden kaçınmak için başarısız satırları düşük hızda yeniden çalıştırdık ve hiçbir şey başarısız olana kadar bunu tekrarladık. Nihai sonuçlarda başarısız çağrı veya okunamayan yanıt yok.

Kurulum sınırlamaları

Her test setinin tamamını değil, 200 tweetlik bir dilimini kullandık; bu nedenle bu sayılar yayınlanan TweetEval liderlik tablosuyla örtüşmez. 10 modelimiz arasındaki karşılaştırma yine de geçerlidir; çünkü her model aynı tweetleri gördü.

200 tweetlik dilim rastgele değil sabittir; bu nedenle tekrarlanabilir ancak rastgele bir örneklem değildir. Her görev ayrıca sıcaklık 0'da tek bir prompt kullandı. Farklı bir prompt veya birkaç örnekli örnekler mutlak sayıları değiştirirdi.

Genel altın etiketlere sahip dataset'ler kullandık. Bu, bir modelin eğitim sırasında etiketleri görmüş olduğu kontaminasyon riski taşır. Bunu göz ardı edemeyiz; ancak puanlar mükemmelden oldukça uzaktı ve bu, bunun önemli bir faktör olmadığını gösteriyor. Bir sonraki sürüm için etiketleri yayınlanmamış tweetleri test etmeyi planlıyoruz.

Örneklem görev başına 200 tweet olduğundan, küçük farklar örnekleme gürültüsü taşır. Bir ila iki puanlık farkı sıralama yerine beraberlik olarak değerlendiriyoruz.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Hangi modeli seçmeli

Tam puanlar yukarıdaki tablodadır. Bu bölüm daha kısadır: yaygın ihtiyaçları uygun modele eşler.

  • En iyi çok yönlü seçim: GPT 5.5. Birinci oldu ve her görevde güçlü kaldı; bu nedenle işiniz birkaç duygu görevini birleştirdiğinde güvenli varsayılandır.
  • İçerik moderasyonu ve nefret söylemi: Claude Sonnet 4.6. Nefret tespitinde tüm modeller arasında en yüksek puanı aldı. GPT 5.5 yakın ikincidir.
  • Düşük bütçeyle saldırgan dil tespiti: ChatGPT 5.4 mini. Saldırganlıkta lider oldu ve en yüksek ironi puanlarıyla eşleşti; bu, daha küçük ve daha ucuz bir model için nadirdir.
  • Duygu ve duygu durumu takibi: Gemini 3.1-pro veya Qwen 3.6 Plus. Her ikisi de bu iki sütunun en üstünde yer alıyor. Bunları moderasyondan ziyade ruh hali ve görüş çalışmaları için kullanın.
  • İroni ve alaycılık: buradaki hemen her model. Puanlar %82 ile %91 arasında değişti; bu nedenle bu görev seçimi nadiren belirler. Diğer ihtiyaçlarınızı karşılayan en ucuz modeli seçin.
  • İstikrarlı, genel amaçlı kullanım: Kimi k2.6. Öne çıkan bir görevi yok ama zayıf bir görevi de yok.
  • Yüksek riskli işler için dikkatli kullanın: Gemini 3.5 Flash ve Minimax M2.7 en altta yer aldı. Gemini 3.5 Flash nefret söyleminde en zayıftı; bu nedenle özellikle moderasyon için bundan kaçının.

Tüm bunların içinden geçen bir hatırlatma: göreviniz için sütunu okuyun, ortalamayı değil. Bir model genel sıralamada orta sıralarda yer alabilir ve yine de önemsediğiniz tek görevde lider olabilir.

Daha fazla bilgi

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Ezgi Arslan, PhD. (2026) - "Duygu Analizi Benchmark Testi: ChatGPT, Claude & Qwen". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 1 Eylül 2026, kaynak: https://aimultiple.com/sentiment-analysis-benchmark [Çevrimiçi Kaynak]

PhD., E. A. (2026, 1 Eylül). Duygu Analizi Benchmark Testi: ChatGPT, Claude & Qwen. AIMultiple. https://aimultiple.com/sentiment-analysis-benchmark

@misc{phd2026,
  author = {PhD., Ezgi Arslan,},
  title  = {{Duygu Analizi Benchmark Testi: ChatGPT, Claude & Qwen}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/sentiment-analysis-benchmark}},
  note   = {AIMultiple. Erişim tarihi: 1 Eylül 2026}
}

Değişiklik günlüğü

7 güncelleme
  1. 2026

    Kıyaslanan sekiz model, GPT 5.5, Claude Sonnet 4.6 ve Qwen 3.6 Plus dahil on modelle ve tüm görev puanlarıyla değiştirildi.

  2. 2025

    Deneysel sonuçlar: duygu analizi karşılaştırması bölümüne ChatGPT 5.o, Claude 4.5 ve Grok 4 eklendi.

  3. Analiz metodolojisi bölümündeki modeller değiştirildi.

  4. Test edilen modeller listesine ChatGPT 4.5, Claude 3.7 ve DeepSeek V3 eklendi.

  5. Metodoloji bölümünde ChatGPT 4.0, GPT-4o ile değiştirildi.

  6. 2024

    Belgenin sonundaki "Genel doğruluk" bölümü kaldırıldı.

  7. “Benchmark veri kümesi ve metodolojisi” bölümü kaldırıldı.

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Sektör Analisti
Ezgi, işletme alanında finans uzmanlığı içeren bir doktora derecesine sahiptir ve AIMultiple'da Sektör Analisti olarak görev yapmaktadır. Teknoloji ve iş dünyasının kesişiminde araştırma ve içgörü çalışmalarını yürütür; uzmanlık alanları arasında sürdürülebilirlik, anket ve duygu analizi, finanstaki AI ajan uygulamaları, yanıt motoru optimizasyonu, güvenlik duvarı yönetimi ve satın alma teknolojileri yer alır.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450