HALC-Bench (LLM Uzun Bağlam Geri Getirme Benchmark'ında Halüsinasyon) büyük bir dil modelinin, hedef dokümanda bulunmayan bir metrik için kanıt uydurmaya karşı direncini, modelin bağlam penceresinin başına, ortasına ve sonuna yerleştirilmiş 3 samanlık kullanarak, 204 soru ile ölçer.
Sonuçlar
claude-fable-5 her samanlık konumunda 204 tuzağın hepsini doğru yanıtladı. Kalan modeller arasında en az halüsinasyon gösteren gpt-5.5 oldu. Samanlık konumu ile halüsinasyon oranları arasında bir korelasyon bulunamadı.
Metodoloji
204 soru, bilgi kesme tarihinden sonraki Motley Fool makalelerinden hazırlanmıştır ve samanlıklar, modelin bağlam penceresinin 0.1, 0.5 ve 0.9 konumlarına yerleştirilmiştir.
Kıyaslanan modeller ve token cinsinden test edilen bağlam pencereleri aşağıdadır:
- anthropic/claude-fable-5: 850.000 token test edildi
- openai/gpt-5.5: 1.000.000 token
- google/gemini-3.1-pro-preview: 1.000.000 token
- google/gemini-3.5-flash: 1.000.000 token
- anthropic/claude-opus-4.8: 1.000.000 token ilan edildi, 850.000 token test edildi.
- anthropic/claude-sonnet-4.6: 1.000.000 token
- qwen/qwen3.6-plus: 1.000.000 token
- moonshotai/kimi-k2.6: 200.000 token
- z-ai/glm-5.1: 200.000 token
- minimax/minimax-m2.7: 150.000 token
- openai/gpt-5.4-mini: 250.000 token
claude-opus-4.8, 1.000.000 token bağlam penceresi testlerinin girdisini başarıyla alamadığı için 850.000 seviyesinde test edilmiştir.
claude-fable-5, Claude Code aracılığıyla test edilir: model, 850.000 tokenlık samanlığı bir dosya olarak alır ve onu bağlam penceresinden okumak yerine geri getirme araçlarıyla arar; bu nedenle puanları, modeli Claude Code test düzeneği ile birlikte ölçer.
Question format
Hedef transkriptte hiçbir yerde tartışılmayan bir metrik hakkında bir iddia.
Örnek iddia: DocuSign (DOCU) tarafından 2026 4. Çeyrek için raporlanan Kapsam 1 ve 2 karbon emisyonları 8.700 metrik ton CO2e'dir.
Beklenen cevap: Bahsedilmemiş
Veri kaynağı
Veri kaynağı olarak, modellerin bilgi kesme tarihinden sonra yayımlanan Motley Fool transkriptleri kullanılmıştır. Her transkriptin gerçek içerik boşluklarına dayanarak elle yazılmış tuzaklar. 14 kaynak transkriptin her biri için:
- Transkriptte bulunmayan metrik kategorilerini manuel olarak belirleyin (ör. DocuSign 2026 4. Çeyrek hiç ESG / karbon metriklerini tartışmaz; Adobe hiç APAC gelirini ayrıştırmaz; Lennar bir konut inşaatçısı olduğu için Ar-Ge harcaması bildirmez).
- Makul görünen, gerçekçi bir sayı, birim ve çeyrek referansı içeren bir iddia oluşturun.
- Gövde metninde anahtar kelime aramasıyla yokluğu programatik olarak doğrulayın. Her iddia için 3–8 anahtar kelime çeşidi bulunur (ör. “karbon emisyonları”, “kapsam 1”, “kapsam 2”, “ghg”, “co2”); temizlenmiş gövdede herhangi bir anahtar kelime bulunursa, tuzak belirsiz olduğu için reddedilir.
- Sağ kalanları, anahtar kelime kontrolündeki yanlış negatifleri filtrelemek için elle gözden geçirin.
Bu neden halüsinasyonu izole eder?
Hedef doküman bu metriği tartışmaz, ancak samanlıktaki çeldirici dokümanlar genellikle diğer şirketler için benzer metrikleri tartışır. Halüsinasyon gören bir model şunları yapar:
- Ya çeldiricilere dayanarak bir sayı uydurur
- Ya da metriğin yanlış bir değerle bahsedildiğini iddia eder (not_mentioned yerine no tahmin eder)
Her iki başarısızlık durumu da skor = 0 olarak kaydedilir. Yalnızca “bahsedilmedi” doğru cevabı 1.0 puan alır.
Puanlama kuralı
Puan = tahmin edilen == not_mentioned ise 1.0, aksi halde 0.0.
En tanı koydurucu hata kalıbı, beklenen = not_mentioned iken tahmin edilen = no olmasıdır. Bu, modelin metriği gördüğünü ancak yanlış bir değerle iddia ettiği anlamına gelir. Varlığa dair kanıt uydurmuştur.
Kaynak transkripte göre tuzak dağılımı
14 kaynak transkript boyunca transkript başına ~17 tuzak, 10 sektörü (yarı iletkenler, SaaS, perakende, restoranlar, CPG, konut inşaatı, finans, gıda üretimi, kurumsal donanım ve diğerleri) kapsayacak şekilde tasarlanmıştır, böylece test halüsinasyonu tek bir alanda ölçmez.
Kıyaslamada, bağlam penceresi içinde farklı samanlık konumlarına yerleştirilmiş toplam 204 farklı soru kullanılmıştır.
İleri okumalar
- AI Kod Kıyaslaması: LMC-Eval
- LLM Fiyatlandırması: Önemli Sağlayıcılar Karşılaştırıldı
- AI Bellek Kıyaslaması
- AI Ajan Performansı: Başarı Oranları ve ROI
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Alper, Şevval},
title = {{HALC-Bench: LLM Uzun Bağlam Geri Getirme Benchmark'ında Halüsinasyon}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/ai-hallucination}},
note = {AIMultiple. Erişim tarihi: 4 Ağustos 2026}
}Değişiklik günlüğü
14 güncelleme- 2026
Metodoloji bölümüne claude-fable-5 için mükemmel skor sonucu eklendi
Karşılaştırılan modeller bölümüne anthropic/claude-fable-5 eklendi.
HALC-Bench kıyaslama açıklamasına 204 soruluk soru sayısı eklendi.
Test edilen model listesine anthropic/claude-opus-4.8 eklendi; belirtilen 1.000.000 yerine 850.000 token seviyesinde değerlendirildi.
Halüsinasyon kıyaslama makalesinin tamamı, HALC-Bench uzun bağlam erişim sonuçları, metodolojisi ve kıyaslanan dokuz modelle değiştirildi.
Güven ve İtibar bölümüne NeurIPS 2025'teki yapay zeka tarafından oluşturulan atıflara dair bir örnek eklendi.
Yapay zeka halüsinasyon karşılaştırma metodolojisi bölümü kaldırıldı.
- 2025
Değerlendirme bölümü, üç aşamalı bir doğruluk kontrol sistemi ile genişletildi.
Makaleye Halüsinasyon Oranı Analizi: Maliyet ve Bağlam başlıklı bir bölüm eklendi.
Girişte kıyaslanan LLM'lerin sayısı güncellendi.
Girişte kıyaslanan BSM'lerin sayısı güncellendi.
Yapay zeka halüsinasyon karşılaştırma sonuçları güncellendi.
Girişte kıyaslanan LLM'lerin sayısı ve halüsinasyon oranları güncellendi.
Girişte karşılaştırılan LLM sayısı güncellendi.
Şevval, yapay zeka kodlama araçları, yapay zeka ajanları ve kuantum teknolojilerine odaklanmaktadır.
Yorumlar 4
Düşüncelerinizi Paylaşın
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.
This article is updated in June while the GPT 5 is announced in August. How did you test GPT 5 in AI Hallucination Rates figure
Hi! Thanks for your comment. We use WordPress for our articles, which allows us to update graphs and tables independently of the main text. This means that even if the article text shows an earlier update date, we can still add the latest results to the figures without altering the written sections.
Hi Cem, I've been using this article as a reference of severity of hallucination. Is it possible to refresh the report with the newly released GPT-5? Thanks!
Hi Rui, Thanks a lot for your interest and for using our article as a reference. We’ve already refreshed the report with GPT-5 results, so you’ll find the latest updates included in the article.
Is there any chance that you might add Claude Sonnet/Opus 4 as well as Gemini 2.5 Pro?
Hi Tim, Thank you for your support and suggestion. Claude Sonnet/Opus 4 and Gemini 2.5 Pro have already been added to the article, so you can now see them included in the comparisons.
Hi, thank you for interesting benchmark! I was wondering Grok3's hallucination rate, both in Think mode and without. Are you planning to add these?
Hi Joon and thank you for your comment, Yes, we are waiting for API access.