Hizmetler
Bize Ulaşın

Sentiment Analizi Kıyaslama Testi: ChatGPT, Claude & Qwen

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Güncellenme tarihi: 15 Haz 2026

Duygu ve hislerin hassas bir şekilde etiketlenmesi, ayrıca ironi, nefret ve hakaret tespiti hâlâ bir zorluk olarak kalmakta, daha fazla test ve iyileştirme gerektirmektedir. Beş duygu görevinde (duygu tespiti, nefret söylemi, ironi, hakaret ve duygu analizi) 10 büyük dil modeli test ettik. Onları beş görevin ortalama doğruluğuna göre sıraladık.

Sonuçlar, araçlar arasındaki net farkları ortaya koyuyor:

  • GPT 5.5 en iyi genel doğruluğu elde etti (80%),
  • Minimax M2.7 (72%) en düşük genel performansı kaydetti.

Deneysel sonuçlar: duygu analizi kıyaslaması

Loading Chart

Sıralama: Araçlar, tüm test kategorilerindeki (duygu, nefret, ironi, hakaret ve duygu analizi) ortalama doğruluk oranlarına göre sıralanmıştır.

Daha fazla ayrıntı için kıyaslama metodolojimizi okuyun.

Genel doğruluk

Tüm görevler birleştirildiğinde, modellerin toplam doğruluk puanları yeteneklerine dair bütüncül bir görünüm sunar:

  • GPT 5.5 birinci oldu, 80%. Hiçbir görevde 73%'ün altına düşmedi, bu da onu testteki en tutarlı model yaptı.
  • Claude Sonnet 4.6 ikinci oldu (79%). Kıyaslamadaki en yüksek tek sonucu aldı: nefret söyleminde 82%.
  • Qwen 3.6 Plus ve ChatGPT 5.4 mini üçüncülüğü 78% ile paylaştı. ChatGPT 5.4 mini zirveye yakın en küçük modeldir, ancak hakaret tespitinde birinci oldu ve ironide birinciliği paylaştı.
  • Kimi k2.6 77% puan aldı, istikrarlı sonuçlarla ve net bir zayıf görev olmadan.
  • Gemini 3.1-pro ve GLM 5.1 76% ile berabere kaldı. Gemini 3.1-pro duygu tespitinde birinciliği paylaştı ancak nefret söyleminde düşük sırada yer aldı.
  • Claude Opus 4.8 74% puan aldı. En zayıf kategorisi olan duygu tespiti (68%) tarafından geride bırakıldı.
  • Gemini 3.5 Flash 73% puan aldı. Nefret söylemi sonucu (65%) o görevdeki en düşük puandı.
  • Minimax M2.7 72% ile son sırada yer aldı. Duygu, ironi ve hakarette en düşük puanı aldı.

1. Duygu tespiti

Duygu tespiti, duygu analizinde zor bir görevdir ve genellikle modellerin dildeki ince ipuçlarını ayırt etmesini gerektirir. Modellerin performansı şöyle:

  • GPT 5.5 ve Gemini 3.1-pro birinciliği paylaştı, 80%.
  • Qwen 3.6 Plus 79% ile takip etti.
  • Kimi k2.6 78% puan aldı ve GLM 5.1 77% puan aldı.
  • ChatGPT 5.4 mini 76% seviyesine ulaştı ve Claude Sonnet 4.6 75% seviyesine ulaştı.
  • Gemini 3.5 Flash 73% puan aldı.
  • Claude Opus 4.8 68% puan aldı.
  • Minimax M2.7 en düşük puanı aldı, 66%.

Duygu tespitinde geniş bir aralık vardı: en iyi ve en kötü modeller arasında 14 puan fark. Bu, modelleri en net şekilde ayıran iki görevden biri yapıyor.

2. Nefret söylemi tespiti

Nefret dolu içeriğin tespiti, Twitter duygu sınıflandırması ve diğer moderasyon görevleri için çok önemlidir. Sonuçlar dikkate değer farklılıklar ortaya koydu:

  • Claude Sonnet 4.6 birinci oldu, 82%, kıyaslamadaki en yüksek tek puan.
  • GPT 5.5 80% ile yakından takip etti.
  • Qwen 3.6 Plus 77% puan aldı.
  • Kimi k2.6 ve GLM 5.1 76% puan aldı.
  • Minimax M2.7 75% puan aldı.
  • ChatGPT 5.4 mini 72% puan aldı.
  • Gemini 3.1-pro ve Claude Opus 4.8 71% puan aldı.
  • Gemini 3.5 Flash en düşük puanı aldı, 65%.

Nefret söylemi, tüm görevler arasında en geniş aralığa sahipti: 17 puan. Moderasyon sizin kullanım alanınızsa, ortalama sıralamaya göre değil, bu sütunun en üstünden seçin.

3. İroni tespiti

İroni tespiti, anlamsal değerlendirmenin önemli rol oynadığı bir alandır. Modeller duygu analizi kıyaslamasında yüksek performans gösterdi, ancak GPT-4o açık bir lider olarak öne çıktı:

  • GPT 5.5, Claude Sonnet 4.6, Qwen 3.6 Plus ve ChatGPT 5.4 mini birinciliği paylaştı, 91%.
  • Gemini 3.1-pro, GLM 5.1 ve Gemini 3.5 Flash her biri 87% puan aldı.
  • Claude Opus 4.8 86% puan aldı ve Kimi k2.6 85% puan aldı.
  • Minimax M2.7 en düşük puanı aldı, 82%.

Bu, setteki en kolay görevdi. En düşük puan bile 82% idi. İroni veya alaycılığı yakalamaya bağlı işler için, bu modellerden herhangi biri güvenli bir başlangıç ​​noktasıdır.

4. Hakaret tespiti

Hakaret içeren içeriğin tespiti, sağlıklı çevrimiçi toplulukların sürdürülmesi için kritik öneme sahiptir. Modellerin bu görevdeki duygu analizi kıyaslama performansları şu şekildeydi:

  • ChatGPT 5.4 mini birinci oldu, 75%.
  • GPT 5.5 73% puan aldı ve Claude Sonnet 4.6 72% puan aldı. Claude Opus 4.8 70% puan aldı.
  • Qwen 3.6 Plus, Kimi k2.6, Gemini 3.1-pro ve GLM 5.1 hepsi 69% puan aldı.
  • Gemini 3.5 Flash 68% puan aldı.
  • Minimax M2.7 en düşük puanı aldı, 65%.

Hiçbir model hakaret ölçütünde 76% seviyesine ulaşamadı. Tüm alan 65% ile 75% arasında değişiyordu. Bu görevi bağlam yönlendiriyor ve veri setinin sınırda kalan örnekleri her modeli zorluyor.

5. Duygu analizi

Kapsamlı duygu analizi görevi, verileri olumlu, olumsuz ve nötr duygulara sınıflandırmaya odaklandı. Bu görev için doğruluk puanları modeller arasında önemli ölçüdeğişiklik gösterdi:

  • GPT 5.5, Qwen 3.6 Plus, ChatGPT 5.4 mini ve Gemini 3.1-pro birinciliği paylaştı, 75%.
  • Kimi k2.6, Claude Opus 4.8, Gemini 3.5 Flash ve Minimax M2.7 hepsi 74% puan aldı.
  • Claude Sonnet 4.6 73% puan aldı.
  • GLM 5.1 en düşük puanı aldı, 72%.

Tam aralık 3 puandı, 72%'den 75%'e. Hiçbir model üçlü duygu sınıflandırmasını iyi yapamadı. Projenin güvenilir olumlu, olumsuz ve nötr etiketlere ihtiyacı varsa, bu modellerin hiçbiri insan kontrolü olmadan kullanıma hazır değil.

Gözlemler ve içgörüler

Görevler eşit zorlukta değil

İroni her model için kolaydı (82% ile 91%). Duygu ve hakaret her model için zordu, tüm puanlar 65% ile 75% arasındaydı. Ortalama sıralamaya göre değil, gerçekten sahip olduğunuz göreve uygun bir model seçin.

Duygu ve nefret modelleri en iyi şekilde ayırıyor

Bu iki görev en geniş puan farklarına sahipti: 14 ve 17 puan. Kullanım alanınız duygu takibi veya moderasyon ise, model seçimi burada her yerden daha önemlidir.

Yüksek bir ortalama, zayıf bir görevi gizleyebilir

GPT 5.5 genel olarak birinci oldu ve her alanda güçlü kaldı. Ancak Claude Opus 4.8 genel sekizinci olmasına rağmen ironide 86% puan aldı. Ortalamaya değil, görevinizin sütununa bakın.

Kıyaslama veri seti ve metodoloji

Analiz veri seti

Gerçek Twitter mesajları üzerinde duygu analizi için oluşturulmuş TweetEval veri setini kullandık.1 Hesaplamalı Dilbilim Derneği'nin (ACL) anlamsal değerlendirme çalışmasının bir parçasıdır. Veri seti, beş görev türünde önceden etiketlenmiş eğitim ve test setleriyle birlikte gelir:

  • Duygu tespiti: bir tweet'teki duyguyu adlandırma, örneğin öfke, sevinç, iyimserlik veya üzüntü. Örnek tweet ve etiket: “#Deppression is real. Partners w/ #depressed people truly dont understand the depth in which they affect us. Add in #anxiety &makes it worse” üzüntü olarak etiketlenmiştir.2
  • Nefret söylemi tespiti: bir tweet'te nefret söylemini işaretleme. Örnek tweet ve etiket: “Trump wants to deport illegal aliens with ‘no judges or court cases’ #MeToo I am solidly behind this action The thought of someone illegally entering a country & showing no respect for its laws, should be protected by same laws is ludacris! #DeportThemAll” nefret dolu olarak etiketlenmiştir.3
  • İroni tespiti: ironik niyeti tespit etme. Örnek tweet ve etiket: “People who tell people with anxiety to ‘just stop worrying about it’ are my favorite kind of people #not #educateyourself” ironi olarak etiketlenmiştir.4
  • Hakaret tespiti: hakaret içeren dil kullanan tweet'leri sınıflandırma. Örnek tweet ve etiket: “#ConstitutionDay It’s very odd for the alt right conservatives to say that we are ruining the constitution because we want #GunControlNow but they are the ones ruining the constitution getting upset because foreigners are coming to this land who are not White wanting to live” hakaret olarak etiketlenmiştir.5
  • Duygu sınıflandırması: olumlu, olumsuz veya nötr bir etiket atama. Örnek tweet ve etiket: “Can’t wait to try this – Google Earth VR – this stuff really is the future of exploration….” olumlu olarak etiketlenmiştir.6

Bu görevler gerçek dünya makine öğrenmesi yaklaşımlarıyla uyumludur ve bu da onları iki modelin deneysel sonuçlarını değerlendirmek için ideal kılar.

Test edilen modeller

Hepsini OpenRouter API üzerinden test ettiğimiz 10 büyük dil modelini test ettik; böylece kurulum her biri için aynıydı:

GPT 5.5, ChatGPT 5.4 mini, Claude Sonnet 4.6, Claude Opus 4.8, Gemini 3.1-pro, Gemini 3.5 Flash, Qwen 3.6 Plus, Kimi k2.6, GLM 5.1 ve Minimax M2.7.

Deneysel kurulum

10 modelin tamamında tüm ayarları aynı tuttuk.

Örneklem

Her görevin resmi test setinin ilk 200 tweetini, veri setinin kendi altın etiketleriyle kullandık. Aynı 200 tweet her modele gönderildi, böylece karşılaştırma birebirdir.

Prompt'lama

Sıfır atış prompt'lar kullandık: sade bir görev talimatı ve ham tweet, çalışılmış örnek olmadan. Model bir etiket döndürdü, başka hiçbir şey.

Prompt'ları hiçbir ipucu vermeyecek şekilde yazdık. Kıyaslamanın adını vermedik, modele “etiketleyici” demedik ya da notlandırıldığını ima etmedik. Testin adını vermek, bir modelin yanıtlama biçimini değiştirebilir, bu yüzden onu dışarıda bıraktık. Örneğin duygu prompt'u, modelden öfke, sevinç, iyimserlik veya üzüntüden birini seçip o kelimeyle yanıt vermesini istedi.

Üretim ayarları

Sıcaklığı 0 olarak ayarladık, bu da çıktıyı modelin izin verdiği ölçüde sabit kılar. Token limitini 4,096 olarak ayarladık. Yüksek limit, muhakeme modelleri için önemlidir: küçük bir limitle tüm bütçeyi gizli muhakemeye harcar ve boş bir cevap döndürürler. Ekstra alan, muhakemelerini bitirip yine de etiketi yazdırmalarına olanak tanır. Muhakeme yapmayan modeller kısa bir kelimeyle yanıt verir, bu nedenle limitin oralarda bir maliyeti yoktur.

Yanıtları okuma

Her yanıtı adım adım bir etikete eşledik: önce tam eşleşme, sonra kısa bir eş anlamlı listesi (örneğin, “happy” sevinç olarak eşleşir), ardından daha uzun bir yanıt içinde herhangi bir etiket araması. Okuyamadığımız yanıtlar yanlış sayıldı.

Metrik

Her görev için puan ham doğruluk değildir. Her görev için TweetEval yazarlarının belirlediği metriği kullandık:

  • Duygu: macro-F1
  • Duygu (sentiment): macro-recall
  • Nefret söylemi: macro-F1
  • İroni: ironi sınıfının F1'i
  • Hakaret: macro-F1

Macro-F1 ve macro-recall her sınıfı aynı şekilde ağırlıklandırır, ne sıklıkta göründüğüne bakılmaksızın. Burada doğru seçim budur, çünkü nefret veya ironi gibi sınıflar nadirdir ve sade doğruluk, modelin her zaman yaygın etiketi seçerek iyi görünmesine izin verirdi. Ortalama sütunu bu beş puanın ortalamasıdır.

Güvenilirlik

Çalıştırma sırasında birkaç model hız sınırına takıldı ve bazı çağrıları düşürdü. Başarısız olan satırları sınırlardan kaçınmak için düşük hızda yeniden çalıştırdık ve hiçbir şey başarısız olmayana kadar bunu tekrarladık. Nihai sonuçlarda başarısız çağrı veya okunamayan yanıt yoktur.

Kurulum sınırlamaları

Her test setinin tamamını değil, 200 tweet'lik bir dilimini kullandık, bu nedenle bu sayılar yayınlanmış TweetEval liderlik tablosuyla örtüşmez. 10 modelimiz arasındaki karşılaştırma hâlâ geçerlidir, çünkü her model aynı tweet'leri gördü.

200 tweet'lik dilim rastgele değil sabittir, bu nedenle tekrarlanabilir ancak rastgele bir örneklem değildir. Ayrıca her görev, sıcaklık 0'da tek bir prompt kullandı. Farklı bir prompt veya birkaç örnekli örnekler, mutlak sayıları değiştirirdi.

Herkese açık altın etiketli veri setleri kullandık. Bu, bir modelin eğitim sırasında etiketleri görmüş olabileceği kontaminasyon riski taşır. Bunu göz ardı edemeyiz, ancak puanlar mükemmelin oldukça altındaydı, bu da önemli bir faktör olmadığını düşündürmektedir. Bir sonraki sürüm için, etiketleri yayınlanmamış tweet'leri test etmeyi planlıyoruz.

Örneklem görev başına 200 tweet olduğu için küçük farklar örnekleme gürültüsü taşır. Bir veya iki puanlık farkı bir sıralama olarak değil, beraberlik olarak değerlendiriyoruz.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Hangi model seçilmeli

Tüm puanlar yukarıdaki tablodadır. Bu bölüm daha kısadır: yaygın ihtiyaçları uygun modele eşleştirir.

  • En iyi genel seçim: GPT 5.5. Birinci oldu ve her görevde güçlü kaldı, bu nedenle işiniz birden fazla duygu işini bir araya getirdiğinde güvenli varsayılan seçimdir.
  • İçerik moderasyonu ve nefret söylemi: Claude Sonnet 4.6. Nefret söyleminde tüm modeller arasında en yüksek puanı aldı. GPT 5.5 yakın bir ikincidir.
  • Bütçe dostu hakaret içeren dil tespiti: ChatGPT 5.4 mini. Hakarette birinci oldu ve en yüksek ironi puanlarıyla eşleşti; bu, daha küçük ve daha ucuz bir model için nadirdir.
  • Duygu ve duygu durumu takibi: Gemini 3.1-pro veya Qwen 3.6 Plus. Her ikisi de bu iki sütunun en üstünde yer alır. Bunları moderasyon yerine ruh hali ve görüş çalışmaları için kullanın.
  • İroni ve alaycılık: buradaki hemen her model. Puanlar 82% ile 91% arasında değişti, bu nedenle bu görev nadiren seçimi belirler. Diğer ihtiyaçlarınızı karşılayan en ucuz modeli seçin.
  • İstikrarlı, genel amaçlı kullanım: Kimi k2.6. Göze çarpan bir görevi yok, ancak zayıf olanı da yok.
  • Yüksek riskli işler için dikkatli kullanın: Gemini 3.5 Flash ve Minimax M2.7 en altta yer aldı. Gemini 3.5 Flash nefret söyleminde en zayıftı, bu nedenle özellikle moderasyon için bundan kaçının.

Tüm bunların içinden geçen bir hatırlatma: ortalamaya değil, görevinizin sütununa bakın. Bir model genel olarak orta sıralarda yer alıp yine de önemsediğiniz tek görevde lider olabilir.

Daha fazla okuma

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Ezgi Arslan, PhD. (2026) - "Sentiment Analizi Kıyaslama Testi: ChatGPT, Claude & Qwen". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 15 Haziran 2026, kaynak: https://aimultiple.com/sentiment-analysis-benchmark [Çevrimiçi Kaynak]

PhD., E. A. (2026, 15 Haziran). Sentiment Analizi Kıyaslama Testi: ChatGPT, Claude & Qwen. AIMultiple. https://aimultiple.com/sentiment-analysis-benchmark

@misc{phd2026,
  author = {PhD., Ezgi Arslan,},
  title  = {{Sentiment Analizi Kıyaslama Testi: ChatGPT, Claude & Qwen}},
  year   = {2026},
  month  = jun,
  howpublished    = {\url{https://aimultiple.com/sentiment-analysis-benchmark}},
  note   = {AIMultiple. Erişim tarihi: 15 Haziran 2026}
}
Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Endüstri Analisti
Ezgi, finans alanında uzmanlaşarak İşletme alanında doktora derecesine sahiptir ve AIMultiple'da Endüstri Analisti olarak görev yapmaktadır. Teknoloji ve iş dünyasının kesişim noktasında araştırma ve içgörüleri yönlendirmekte olup sürdürülebilirlik, anket ve duygu analizi, finans alanında yapay zeka ajan uygulamaları, cevap motoru optimizasyonu, güvenlik duvarı yönetimi ve satın alma teknolojileri konularında uzmanlığa sahiptir.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450