HALC-Bench (LLM Uzun Bağlam Geri Getirme Benchmark'ında Halüsinasyon) büyük bir dil modelinin, hedef dokümanda bulunmayan bir metrik için kanıt uydurmaya karşı direncini, modelin bağlam penceresinin başına, ortasına ve sonuna yerleştirilmiş 3 samanlık kullanarak, 204 soru ile ölçer.
Sonuçlar
claude-fable-5 her samanlık konumunda 204 tuzağın hepsini doğru yanıtladı. Kalan modeller arasında en az halüsinasyon gösteren gpt-5.5 oldu. Samanlık konumu ile halüsinasyon oranları arasında bir korelasyon bulunamadı.
Metodoloji
204 soru, bilgi kesme tarihinden sonraki Motley Fool makalelerinden hazırlanmıştır ve samanlıklar, modelin bağlam penceresinin 0.1, 0.5 ve 0.9 konumlarına yerleştirilmiştir.
Kıyaslanan modeller ve token cinsinden test edilen bağlam pencereleri aşağıdadır:
- anthropic/claude-fable-5: 850,000 token test edildi
- openai/gpt-5.5: 1,000,000 token
- google/gemini-3.1-pro-preview: 1,000,000 token
- google/gemini-3.5-flash: 1,000,000 token
- anthropic/claude-opus-4.8: 1,000,000 token ilan edildi, 850,000 token test edildi.
- anthropic/claude-sonnet-4.6: 1,000,000 token
- qwen/qwen3.6-plus: 1,000,000 token
- moonshotai/kimi-k2.6: 200,000 token
- z-ai/glm-5.1: 200,000 token
- minimax/minimax-m2.7: 150,000 token
- openai/gpt-5.4-mini: 250,000 token
claude-opus-4.8, 1,000,000 token bağlam penceresi testlerinin girdisini başarıyla alamadığı için 850,000 seviyesinde test edilmiştir.
claude-fable-5, Claude Code aracılığıyla test edilir: model, 850,000 tokenlık samanlığı bir dosya olarak alır ve onu bağlam penceresinden okumak yerine geri getirme araçlarıyla arar; bu nedenle puanları, modeli Claude Code test düzeneği ile birlikte ölçer.
Question format
Hedef transkriptte hiçbir yerde tartışılmayan bir metrik hakkında bir iddia.
Örnek iddia: DocuSign (DOCU) tarafından 2026 4. Çeyrek için raporlanan Kapsam 1 ve 2 karbon emisyonları 8,700 metrik ton CO2e'dir.
Beklenen cevap: Bahsedilmemiş
Veri kaynağı
Veri kaynağı olarak, modellerin bilgi kesme tarihinden sonra yayımlanan Motley Fool transkriptleri kullanılmıştır. Her transkriptin gerçek içerik boşluklarına dayanarak elle yazılmış tuzaklar. 14 kaynak transkriptin her biri için:
- Transkriptte bulunmayan metrik kategorilerini manuel olarak belirleyin (ör. DocuSign 2026 4. Çeyrek hiç ESG / karbon metriklerini tartışmaz; Adobe hiç APAC gelirini ayrıştırmaz; Lennar bir konut inşaatçısı olduğu için Ar-Ge harcaması bildirmez).
- Makul görünen, gerçekçi bir sayı, birim ve çeyrek referansı içeren bir iddia oluşturun.
- Gövde metninde anahtar kelime aramasıyla yokluğu programatik olarak doğrulayın. Her iddia için 3–8 anahtar kelime çeşidi bulunur (ör. “karbon emisyonları”, “kapsam 1”, “kapsam 2”, “ghg”, “co2”); temizlenmiş gövdede herhangi bir anahtar kelime bulunursa, tuzak belirsiz olduğu için reddedilir.
- Sağ kalanları, anahtar kelime kontrolündeki yanlış negatifleri filtrelemek için elle gözden geçirin.
Bu neden halüsinasyonu izole eder?
Hedef doküman bu metriği tartışmaz, ancak samanlıktaki çeldirici dokümanlar genellikle diğer şirketler için benzer metrikleri tartışır. Halüsinasyon gören bir model şunları yapar:
- Ya çeldiricilere dayanarak bir sayı uydurur
- Ya da metriğin yanlış bir değerle bahsedildiğini iddia eder (not_mentioned yerine no tahmin eder)
Her iki başarısızlık durumu da skor = 0 olarak kaydedilir. Yalnızca “bahsedilmedi” doğru cevabı 1.0 puan alır.
Puanlama kuralı
Puan = tahmin edilen == not_mentioned ise 1.0, aksi halde 0.0.
En tanı koydurucu hata kalıbı, beklenen = not_mentioned iken tahmin edilen = no olmasıdır. Bu, modelin metriği gördüğünü ancak yanlış bir değerle iddia ettiği anlamına gelir. Varlığa dair kanıt uydurmuştur.
Kaynak transkripte göre tuzak dağılımı
14 kaynak transkript boyunca transkript başına ~17 tuzak, 10 sektörü (yarı iletkenler, SaaS, perakende, restoranlar, CPG, konut inşaatı, finans, gıda üretimi, kurumsal donanım ve diğerleri) kapsayacak şekilde tasarlanmıştır, böylece test halüsinasyonu tek bir alanda ölçmez.
Kıyaslamada, bağlam penceresi içinde farklı samanlık konumlarına yerleştirilmiş toplam 204 farklı soru kullanılmıştır.
İleri okumalar
- AI Kod Kıyaslaması: LMC-Eval
- LLM Fiyatlandırması: Önemli Sağlayıcılar Karşılaştırıldı
- AI Bellek Kıyaslaması
- AI Ajan Performansı: Başarı Oranları ve ROI
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{HALC-Bench: LLM Uzun Bağlam Geri Getirme Benchmark'ında Halüsinasyon}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/ai-hallucination}},
note = {AIMultiple. Erişim tarihi: 7 Temmuz 2026}
}
Yorumlar 4
Düşüncelerinizi Paylaşın
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.
This article is updated in June while the GPT 5 is announced in August. How did you test GPT 5 in AI Hallucination Rates figure
Hi! Thanks for your comment. We use WordPress for our articles, which allows us to update graphs and tables independently of the main text. This means that even if the article text shows an earlier update date, we can still add the latest results to the figures without altering the written sections.
Hi Cem, I've been using this article as a reference of severity of hallucination. Is it possible to refresh the report with the newly released GPT-5? Thanks!
Hi Rui, Thanks a lot for your interest and for using our article as a reference. We’ve already refreshed the report with GPT-5 results, so you’ll find the latest updates included in the article.
Is there any chance that you might add Claude Sonnet/Opus 4 as well as Gemini 2.5 Pro?
Hi Tim, Thank you for your support and suggestion. Claude Sonnet/Opus 4 and Gemini 2.5 Pro have already been added to the article, so you can now see them included in the comparisons.
Hi, thank you for interesting benchmark! I was wondering Grok3's hallucination rate, both in Think mode and without. Are you planning to add these?
Hi Joon and thank you for your comment, Yes, we are waiting for API access.