HALC-Bench (LLM Hallucination on Long-Context Retrieval Benchmark), hedef belgede bulunmayan bir metrik için kanıt uydurmaya karşı büyük bir dil modelinin direncini, modelin bağlam penceresinin başına, ortasına ve sonuna yerleştirilen 3 saman yığını kullanarak 204 soruyla ölçer.
Sonuçlar
claude-fable-5, her saman yığını konumundaki 204 tuzağın tamamını doğru yanıtladı. Kalan modeller arasında en az halüsinasyonu gpt-5.5 üretti. Saman yığını konumu ile halüsinasyon oranları arasında bir ilişki bulunamadı.
Metodoloji
204 soru, bilgi kesme tarihinden sonraki Motley Fool makalelerinden hazırlanmıştır ve saman yığınları modelin bağlam penceresinin 0.1, 0.5 ve 0.9 konumlarına yerleştirilmiştir.
Kıyaslanan modeller ve token cinsinden test edilen bağlam pencereleri aşağıdadır:
- anthropic/claude-fable-5: 850.000 token test edildi
- openai/gpt-5.5: 1.000.000 token
- google/gemini-3.1-pro-preview: 1.000.000 token
- google/gemini-3.5-flash: 1.000.000 token
- anthropic/claude-opus-4.8: 1.000.000 token duyuruldu, 850.000 test edildi.
- anthropic/claude-sonnet-4.6: 1.000.000 token
- qwen/qwen3.6-plus: 1.000.000 token
- moonshotai/kimi-k2.6: 200.000 token
- z-ai/glm-5.1: 200.000 token
- minimax/minimax-m2.7: 150.000 token
- openai/gpt-5.4-mini: 250.000 token
claude-opus-4.8, 850.000 kademesinde test edilmiştir çünkü 1.000.000 tokenlik bağlam penceresi testlerinin girdisini başarıyla alamamaktadır.
claude-fable-5, Claude Code aracılığıyla test edilir: model, 850.000 tokenlik saman yığınını bir dosya olarak alır ve onu bağlam penceresinden okumak yerine getirme araçlarıyla arar; bu nedenle puanları, modeli Claude Code test düzeneğiyle birlikte ölçer.
Question format
Hedef transkriptte hiçbir yerde tartışılmayan bir metrik hakkında bir iddia.
Örnek iddia: DocuSign (DOCU) tarafından 2026'nın 4. çeyreği için raporlanan Kapsam 1 ve 2 karbon emisyonları 8.700 metrik ton CO2e'dir.
Beklenen yanıt: Bahsedilmedi
Veri kaynağı
Veri kaynağı olarak, modellerin bilgi kesme tarihinden sonra yayımlanan Motley Fool transkriptleri kullanılır. Tuzaklar, her transkriptin gerçek içerik boşluklarına dayanarak elle oluşturulmuştur. 14 kaynak transkriptin her biri için:
- Transkriptte bulunmayan metrik kategorilerini manuel olarak belirleyin (ör. DocuSign 2026 4. çeyreği hiç ESG / karbon metriklerini tartışmaz; Adobe APAC gelirini hiç ayrıştırmaz; Lennar bir ev inşaatçısı olduğu için Ar-Ge giderini hiç raporlamaz).
- Gerçekçi bir sayı, birim ve çeyrek referansı içeren makul görünen bir iddia oluşturun.
- Gövde metnine karşı anahtar kelime araması yoluyla yokluğu programatik olarak doğrulayın. Her iddianın 3-8 anahtar kelime varyantı vardır (ör. “carbon emissions”, “scope 1”, “scope 2”, “ghg”, “co2”); herhangi bir anahtar kelime temizlenmiş gövdeyle eşleşirse tuzak belirsiz olduğu için reddedilir.
- Anahtar kelime kontrolünden kaynaklanan yanlış negatifleri ayıklamak için kalanları elle inceleyin.
Bu, halüsinasyonu neden izole eder?
Hedef belge metriği tartışmaz, ancak saman yığınındaki çeldirici belgeler genellikle diğer şirketler için benzer metrikleri tartışır. Halüsinasyon üreten bir model:
- Ya çeldiricilere dayanarak bir sayı uydurur
- Ya da metriğin yanlış bir değerle bahsedildiğini iddia eder (not_mentioned yerine no tahmini yapar)
Her iki başarısızlık modu da puan = 0 olarak kaydedilir. Yalnızca “bahsedilmedi” şeklinde doğru yanıt vermek 1.0 puan kazandırır.
Puanlama kuralı
Puan = tahmin not_mentioned ise 1.0, aksi takdirde 0.0.
En belirleyici hata deseni, beklenen = not_mentioned iken predicted = no olmasıdır. Bu, modelin metriği gördüğünü ancak yanlış bir değerle gördüğünü iddia ettiği anlamına gelir. Model, varlığa ilişkin kanıt uydurmuştur.
Kaynak transkrite göre tuzak dağılımı
~17 tuzak, transkript başına, 14 kaynak transkripte yayılan ve 10 sektörü kapsayan (yarı iletkenler, SaaS, perakende, restoranlar, CPG, ev inşaatı, finans, gıda üretimi, kurumsal donanım ve diğerleri) bu testin halüsinasyonu tek bir alanda ölçmemesi için tasarlanmıştır.
Kıyaslamada toplam 204 farklı soru kullanılır ve bunlar bağlam penceresi içindeki farklı saman yığını konumlarına yerleştirilmiştir.
Yapay zeka halüsinasyonu nedir?
Bir yapay zeka halüsinasyonu, bir yapay zeka sistemi tarafından üretilen ve gerçekmiş gibi sunulan yanlış, uydurma veya yanıltıcı bilgiler içeren bir yanıttır. IBM, bu olguyu, büyük bir dil modelinin insan gözlemciler için var olmayan veya algılanamayan kalıplar veya nesneler algılaması ve eğitim verilerine dayanmayan, saçma veya olgusal olarak yanlış çıktılar üretmesi olarak tanımlar.1 Wikipedia maddesi, bunu benzer şekilde gerçekmiş gibi sunulan yanlış veya yanıltıcı bilgiler içeren bir yanıt olarak tanımlar ve literatürde kullanılan alternatif terimler olarak “bullshitting”, “confabulation” ve “delusion” ifadelerini sıralar.2
Ulusal Standartlar ve Teknoloji Enstitüsü Yapay Zeka Risk Yönetimi Çerçevesi Üretken Yapay Zeka Profili (NIST AI 600-1), Temmuz 2024'te yayımlanmıştır ve birincil terim olarak “halüsinasyon” yerine resmen “confabulation” terimini benimser. NIST, confabulation'ı kullanıcıların yanıltılabileceği veya kandırılabileceği, günlük dilde halüsinasyonlar veya uydurmalar olarak bilinen, kendinden emin bir şekilde ifade edilen ancak hatalı veya yanlış içerik üretimi olarak tanımlar.3 Bu tanım, yalnızca dış gerçeklikle çelişen iddiaları değil, prompt'tan sapan veya aynı bağlam içinde daha önce üretilen ifadelerle çelişen çıktıları da açıkça kapsar.
Halüsinasyon, sıradan bir hata veya yazım hatasından iki kritik boyutta ayrılır. İlk olarak akıcılık ve güven: NIST’in tanımı, içeriğin “kendinden emin bir şekilde ifade edilmiş” olmasını, doğru bir yanıtla aynı dilbilgisel ve stilistik kesinlik işaretlerini taşımasını ve hiçbir kaçamak ifade ya da şüphe sinyali içermemesini gerektirir.3 İkincisi, uydurma ile bozulma: IBM, bu başarısızlığı modelin eğitim verilerinde veya girdisinde hiçbir temeli olmayan içerik üretmesi olarak çerçeveler.
Yapay zeka halüsinasyonunun sektörler genelinde gerçek dünyadaki etkisi
Hukuk, sağlık ve finans sektörlerindeki belgelenmiş olaylar, halüsinasyonun teorik bir endişe değil, ölçülebilir finansal ve operasyonel hasarın bir kaynağı olduğunu göstermektedir.
Hukuk sistemi: uydurma atıflar ve mahkeme yaptırımları
En kapsamlı kamu sayımı olan Damien Charlotin AI Hallucination Cases veri tabanı, 9 Haziran 2026 itibarıyla dünya genelinde 1.598 vaka belgelemiştir ve günde yaklaşık 8 yeni vaka eklenmektedir.4
Coomer v. Lindell (ABD Bölge Mahkemesi, Colorado Bölgesi) davasında Yargıç Nina Wang, Temmuz 2025'te avukatlar Christopher I. Kachouroff ve Jennifer T. DeMaster'a her birine 3.000 dolar para cezası verdi; bu, Mike Lindell ve MyPillow için yapılan dosyalamalarda yanlış alıntılar ve var olmayan davalar da dahil olmak üzere yaklaşık 30 hatalı atıf tespit etmesinin ardından geldi.5 Aynı yargıç, Mayıs 2026'da daha maddi olarak hatalı bir atıf nedeniyle Kachouroff'a bu kez 5.000 dolar para cezası verdi.6
Couvrette v. Wisnovsky davasında, Oregon'daki bir federal mahkeme, Aralık 2025 ve Mart 2026 tarihli kararlarla davacıların taleplerini esastan reddetti ve Kaliforniyalı avukat Stephen Brigandi ile Portland'lı avukat Tim Murphy'ye toplam 110.204.38 dolar yaptırım uyguladı. İkili, beş ay boyunca sunulan üç dilekçede 15 var olmayan dava ve 8 uydurma alıntı kullandı.7
Whiting v. City of Athens, Tennessee davasında, Altıncı Daire paneli Mart 2026'da avukatlar Van Irion ve Russ Egli'nin iki düzineden fazla uydurma atıf kullandığını ve bir bölge mahkemesinin yaptırım kararını yanlış aktardığını tespit etti. Mahkeme, her iki avukata da mahkeme veznesine 15.000 dolar ödemelerini, karşı tarafın tüm istinaf ücretlerini geri ödemelerini, iki kat masraf ödemelerini ve disiplin soruşturmasıyla karşı karşıya kalmalarını emretti.89
20 Temmuz 2025'te, ABD Bölge Yargıcı Henry T. Wingate (Mississippi Güney Bölgesi), yanlış adlandırılmış taraflar ve var olmayan bir davaya yapılan atıf gibi olgusal hatalar içeren geçici bir yasaklama kararı çıkardı. Senatör Chuck Grassley bir soruşturma gönderdikten sonra Wingate, hukuk katibinin karar taslağını hazırlamak için Perplexity kullandığını kabul etti. Wingate, taslak kararların ikinci bir bağımsız incelemesini ve atıf yapılan tüm davaların fiziksel çıktılarını gerektiren bir iç politika benimsedi.1011
Takip firması ComplexDiscovery, tek bir 2023 davasında yaklaşık 5.000 dolardan tek bir 2025 davasında 55.597 dolara yükselen yaptırımları belgeledi; bu, yaklaşık 11x artış anlamına gelir ve yaklaşık 18 ayda gerçekleşmiştir. Couvrette rakamıyla birlikte, 2026'nın başından ortasına kadar dava başına yaptırımlar yaklaşık 110.000 dolara ulaştı.12 Birleşik Krallık, Singapur, Kanada, Avustralya, Arjantin, AB, Kore, İtalya, Norveç ve Fransa'daki mahkemelerin tümü, yapay zeka kaynaklı halüsinasyonlu dosyalamalar hakkında kararlar vermiştir.1314
Sağlık hizmetleri ve klinik dokümantasyon
4 Aralık 2024'te yayımlanan ECRI'nin 18th yıllık En Büyük 10 Sağlık Teknolojisi Tehlikesi raporu, “yapay zeka destekli sağlık teknolojilerindeki riskleri” 2025 için bir numaralı tehlike olarak sıraladı; özellikle yanlış veya yanıltıcı halüsinasyonlu sonuçlar üreten yapay zeka sistemlerine ve yapay zekanın yeterince temsil edilmeyen hasta gruplarına karşı önyargıyı sürdürme riskine dikkat çekti.1516
Communications Medicine dergisinde yayımlanan 2025 tarihli bir çalışma, her biri uydurma bir ayrıntı içeren 300 hekim onaylı simüle klinik vinyet kullanarak klinik vaka özetlemede birden fazla LLM test etti. Çalışma, hafifletme prompt'u olmadan genel halüsinasyon oranının %65,9 olduğunu ve yapılandırılmış hafifletme prompt'u ile %44,2'ye düştüğünü buldu; GPT-4o en iyi performans gösteren modeldi ve hafifletme etkinken %53 taban çizgisinden %23'e geriledi.1718
Finans ve müşteri hizmetleri
ABD Menkul Kıymetler ve Borsa Komisyonu (SEC), yapay zeka yanlış beyanları için yaptırım eylemleri başlattı. 18 Mart 2024'te SEC, iki yatırım danışmanı olan Delphia (USA) Inc. ve Global Predictions, Inc. aleyhine toplam 400.000 dolar para cezası içeren ilk yapay zeka aklama suçlamalarını çözüme kavuşturdu.19 Ocak 2025'te SEC, halka açık bir şirket olan Presto Automation Inc. aleyhine, yapay zeka konuşma tanıma ürününün aslında önemli insan müdahalesi gerektiren üçüncü taraf bir araç olduğunu açıklamadığı için ilk yapay zeka aklama davasını açtı.20
Moffatt v. Air Canada davasında, 2024 BCCRT 149, 14 Şubat 2024'te Britanya Kolumbiyası Sivil Çözüm Mahkemesi tarafından karara bağlandı; mahkeme, Air Canada'nın chatbot'unun ifadelerinden sorumlu olmadığı yönündeki savunmasını reddetti. Jake Moffatt'a, havayolunun web sitesi chatbot'u tarafından tam ücretli biletleri aldıktan sonra yas tazminatı indirimine geriye dönük olarak başvurabileceği söylenmişti; bu yanlıştı. Mahkeme, Air Canada'nın Moffatt'a ihmalkâr yanlış beyan nedeniyle 650.88 dolar tazminat ödemesine karar verdi.2122
Yapay zeka halüsinasyonları ne kadar yaygındır?
Halüsinasyon oranları görev türüne ve değerlendirme metodolojisine göre büyük ölçüdeğişir; bu da tek rakamlı özetleri yanıltıcı kılar. Stanford HAI 2026 Yapay Zeka Endeksi Raporu, modellerin yanlış ifadeler sunulduğunda üçüncü taraf inancı ile kullanıcı inancı arasında ayrım yapıp yapamayacağını test eden yeni bir doğruluk kıyaslaması belgelemektedir. Bu kıyaslamada, 26 üst modelde halüsinasyon oranları %22 ile %94 arasında değişmektedir.23
Bu geniş dağılımı metodoloji yönlendirir. Modeller, yanlış iddialar üçüncü bir tarafın inandığı bir şey olarak çerçevelendiğinde iyi başa çıkarken, aynı yanlış iddia kullanıcının inandığı bir şey olarak çerçevelendiğinde performans çöker. Bu “kullanıcı inancı” çerçevelemesinde, GPT-4o'nun doğruluğu %98,2'den %64,4'e düştü ve DeepSeek R1 %90 üzerinden %14,4'e geriledi.23
Temellendirilmiş özetleme görevlerinde oranlar daha düşüktür, ancak kıyaslama değişiklikleri eğilim analizini karmaşıklaştırır. Vectara'nın Halüsinasyon Lider Tablosu (HHEM modeli), özetlerin kaynak belgeler tarafından desteklenmeyen iddiaları ne sıklıkta içerdiğini ölçer. 2025'in büyük bölümünde geçerli olan orijinal lider tablosu sürümünde, Google'ın Gemini-2.0-Flash-001 modeli %0,7 halüsinasyon oranı elde etti. Kasım 2025'te Vectara, hukuk, tıp, finans, teknoloji ve eğitimi kapsayan daha uzun belgeler (en fazla 32K token) kullanan daha zor bir veri kümesiyle kıyaslamayı değiştirdi. Bu yeni kıyaslamada mevcut lider, Ant Group'un finix_s1_32b modeli olup %1,8, onu Google'ın Gemini-2.5-flash-lite'ı %3,3 ve OpenAI'ın gpt-5.4-nano modeli %3,1 ile izlemektedir.24 Vectara, yeni veri kümesi kasıtlı olarak daha zor olduğu için eski ve yeni sürümlerin puanlarının doğrudan karşılaştırılmaması gerektiğini açıkça belirtir.25
Yapay zeka halüsinasyonlarını tespit etme ve azaltma
Teknik hafifletme yaklaşımları, getirme mimarisinden değerlendirme tasarımına kadar üretim pipeline'ının farklı aşamalarını hedefler.
Getirme artırımlı üretim ve temellendirme
Standart getirme artırımlı üretim, önceden eğitilmiş parametrik bir dil modelini parametrik olmayan bir getirme endeksiyle birleştirir ve çıktıyı, yalnızca eğitim sırasında ezberlenen olgulara dayanmak yerine inference sırasında getirilen belgelere koşullandırır.26 Mekanistik yorumlanabilirlik araştırması, RAG sistemlerindeki halüsinasyonları iki dahili bileşene bağlar: “Knowledge FFNs” (parametrik bilgiyi kodlayan ileri beslemeli ağ katmanları) ve “Copying Heads” (getirilen bağlamı çıktıya aktarmaktan sorumlu dikkat kafaları). Halüsinasyon, Knowledge FFNs parametrik bilgiyi aşırı vurgularken Copying Heads dışarıdan getirilen içeriği koruyamadığında ortaya çıkar.27
SQL RAG, getirme işlemini belge düzeyi yerine şema düzeyinde uygular; CREATE TABLE ifadelerini ve örnek sorguları semantik embedding'ler kullanarak getirir. Bu, yalnızca gerçek, getirilen şema tanımları bağlamda olduğu için modellerin şema öğeleri uydurmasını yapısal olarak engeller. Ancak, getirilen şema içeriğinin büyütülmesi getirme ayrımını iyileştirir, fakat prompt'lar optimum bir boyutu aştığında halüsinasyon oranlarını artırır; bu da aşağı yönlü üretim kapasitesinin SQL RAG'ın uydurmayı ne kadar azaltabileceğini sınırladığını gösterir.28
Microsoft Research'in GraphRAG'ı, getirme işleminden önce kaynak külliyatları bilgi graflarına dönüştürür ve ilgili varlık kümeleri için topluluk özetlerini önceden üretir. Bu, standart RAG'ın tüm külliyatlarla ilgili küresel sorulardaki zorluğunu, izole parçalar yerine yapılandırılmış varlık ilişkilerini getirerek ele alır.29
Kalibrasyon, prompt'lama ve değerlendirme yöntemleri
OpenAI'ın Eylül 2025 tarihli makalesi, değerlendirme tasarımındaki değişikliklerin model geliştirme sırasında neyin optimize edildiğini değiştirerek halüsinasyon oranlarını değiştirebileceğini öne sürer. Yazarlar, kıyaslamalara açık güven eşikleri eklemeyi önerir; örneğin “yalnızca %t'den daha emin olduğunda yanıt ver, çünkü hatalar t/(1−t) puan cezalandırılır.” Bu puanlama kuralına göre, modelin gerçek güveni eşiği aştığında yanıt vermek, çekimser kalmaktan daha iyidir ve tahmin etme teşvikini ortadan kaldırır.3031
Yapılandırılmış prompt'lama, belirli alanlarda halüsinasyon oranlarını azaltır. Communications Medicine çalışması, modellere “yalnızca klinik olarak doğrulanmış bilgileri kullanın ve daha fazla spekülasyon yapmak yerine belirsizliği kabul edin” talimatını veren bir hafifletme prompt'unun, uzun vaka klinik vinyetleri için halüsinasyon oranlarını %64,1'den %43,1'e ve tüm modeller ile vaka uzunlukları ortalamasında yaklaşık %66'dan %44'e düşürdüğünü buldu. 3218 Sıcaklık-0 (deterministik) kod çözme önemli bir iyileşme üretmedi; bu da etkili değişkenin kod çözme rastgeleliği değil, prompt yapısı olduğunu izole etti.32
Yapay zeka halüsinasyonu çözülebilir bir sorun mu?
Halüsinasyonun ortadan kaldırılıp kaldırılamayacağı sorusu, teorik imkansızlık sonuçları ile azalan kıyaslama oranlarına ilişkin ampirik eğilimler arasında gerçekten tartışmalıdır.
“Hallucination is Inevitable” başlıklı makale, LLM'lerin tüm hesaplanabilir işlevleri öğrenemeyeceğini ve bu nedenle genel problem çözücü olarak kullanıldıklarında kaçınılmaz olarak halüsinasyon üreteceğini öne süren biçimsel bir argüman sunar ve bunu mimari veya eğitim iyileştirmelerinden bağımsız doğuştan bir sınırlılık olarak çerçeveler.33 İlgili bir teorik sonuç, modellerin aynı anda yüksek tutarlılık (yalnızca eğitim verileriyle desteklenen ifadeler üretme) ve yüksek kapsam (hedef dilin tam çeşitliliğini kapsama) elde edemeyeceğini kanıtlar; birine doğru itmek zorunlu olarak diğer başarısızlık moduna, yani halüsinasyona veya mod çöküşüne doğru iter.3435
Bu teorik sınırların karşısında, standartlaştırılmış kıyaslamalarda düşen halüsinasyon oranlarına ilişkin ampirik eğilim yer alır; üst modeller temellendirilmiş özetleme görevlerinde %2'nin altına ulaşmaktadır. Ancak bu eğilim, değerlendirme uyumsuzluğu nedeniyle karmaşıklaşır. OpenAI'ın araştırması, ana akım kıyaslamalardaki ikili puanlamanın, kalibre edilmiş belirsizlik yerine kendinden emin tahminleri matematiksel olarak ödüllendiren yapısal bir engel olduğunu belirler; bu da raporlanan oranların, gerçek dünya güvenilirlik gereksinimlerini yansıtmayabilecek teşvik yapılarına karşı performansı ölçtüğü anlamına gelir.30
Şubat 2024'ten bir anket, halüsinasyon ile yaratıcı üretimin altında yatan mekanizmaları paylaşabileceğini ve ikisini ayrılabilir başarısızlık modları ve başarılar yerine bir takas olarak çerçevelediğini öne sürer. Keşifsel çıktılar üreten üretim mekanizmasını bastırmak, özellikle beyin fırtınası veya kurgu gibi alanlarda yalnızca riski değil, yeteneği de bastırma riski taşır.36 Bu, gözlemlenen kod çözme parametresi davranışıyla uyumludur: olgusal çıkarım için düşük sıcaklık ayarları (0 ila 0.3) önerilirken, daha yüksek ayarlar (0.7 ila 1.0) yaratıcı görevler için varyansı ve bununla birlikte halüsinasyon riskini kasıtlı olarak artırır.37
Yapay zeka halüsinasyonu politikası ve araştırması nereye yöneliyor?
Stanford HAI'nin 2026 Yapay Zeka Endeksi Raporu'na göre, Yapay Zeka Olay Veri Tabanı 2025'te 362 belgelenmiş olay kaydetti; bu sayı 2024'te 233 idi.23 Yapay zeka olaylarını bildiren işletmeler arasında 3-5 olay bildirenlerin payı artarken, yalnızca 1-2 olay bildirenlerin payı düştü; bu da tek seferlik olaylar yerine tekrarlanan maruz kalmanın daha yaygın hale geldiğini gösterir.23
Vakıf Modeli Şeffaflık Endeksi, olaylar artsa bile şeffaflığın azaldığını göstermektedir. Değerlendirilen geliştiriciler arasında ortalama puan 2023'te 37'den 2024'te 58'e yükseldi, ardından 2025'te 40'a düştü.3839 Bireysel 2025 puanları, IBM için 95'ten xAI ve Midjourney için her biri 14'e kadar değişti.40
Yapay zekaya özgü yönetişim rolleri 2025'te %17 arttı ve sorumlu yapay zeka politikaları olmayan işletmelerin payı %24'ten %11'e düştü.23
Mahkemeler, vaka bazlı yaptırımlardan kalıcı kurallara geçiş yaptı. 28 Mayıs 2026'da Florida Yüksek Mahkemesi, Genel Uygulama ve Yargı İdaresi Kuralı 2.515(d)(2)'yi değiştirerek, bir mahkeme dosyalamasını imzalayan her kişinin “belirtilen yasal dayanakların var olduğunu ve doğru şekilde atıf yapıldığını” onaylamasını zorunlu kıldı; bu değişiklik 15 Haziran 2026'dan itibaren geçerli oldu.41 New York Güney Bölgesi'nde, Yargıç Vernon Broderick'in İçtihadı Kuralları (29 Ekim 2025'te güncellenmiştir), dosyalamaların hazırlanmasında kullanılan üretken yapay zekanın açıklanmasını ve yapay zeka tarafından üretilen bölümlerin bağımsız olarak incelendiğine dair onay verilmesini gerektirir.42
SSS'ler
Hayır. Biçimsel hesaplanabilirlik argümanları, büyük dil modellerinin tüm hesaplanabilir işlevleri öğrenemeyeceğini ve mimari veya eğitim verisi kalitesinden bağımsız olarak bazı girdilerde kaçınılmaz şekilde halüsinasyon üreteceğini kanıtlar.33 Araştırmalar, model performansını korurken halüsinasyon olasılığının istatistiksel olarak ihmal edilebilir düzeylere indirilebileceğini ancak sıfıra indirilemeyeceğini göstermektedir.4344
Hayır. IBM'in teknik tanımı, yapay zeka halüsinasyonlarının “kasıtlı aldatma eylemleri olmadığını”, eğitim verisi önyargısı ve model karmaşıklığı gibi faktörlerden kaynaklandığını ve yanlış çıktıları istemeden ürettiğini belirtir.1 Yalan söylemek, doğru yanıtı bilmeyi ve yanlış bir şey söylemeyi seçmeyi gerektirir; modeller aldatma niyetinden yoksundur ve bunun yerine doğruluk değerine kayıtsız çıktılar üretir.30
Kırmızı bayraklar arasında güvenle sunulan olgusal olarak yanlış ifadeler, konudan sapan veya mantıksal akışı bozan yanıtlar, temel aritmetik hataları gibi hatalı adım adım mantık ve çok modlu araçlarda istekle eşleşmeyen üretilen görüntüler yer alır.45 Eğitim teşvikleri tahmin etmeyi ödüllendirdiği için, kullanıcılar kaynaksız ve güvenle ifade edilen ayrıntıları birincil kaynaklarla kontrol edilene kadar doğrulanmamış olarak görmelidir.30
Ek okumalar
- LLM Fiyatlandırması: Başlıca Sağlayıcılar Karşılaştırıldı
- Yapay Zeka Belleği Kıyaslaması
- Yapay Zeka Ajanı Performansı: Başarı Oranları & ROI
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Alper, Şevval},
title = {{HALC-Bench: LLM Uzun Bağlamlı Getirme Kıyaslamasında Halüsinasyon}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/ai-hallucination}},
note = {AIMultiple. Erişim tarihi: 4 Ağustos 2026}
}0 veri noktasının sonuçları ve zaman damgaları. Bu makaledeki grafik ve tablolarda gösterilen özet verileri, 0 CSV dosyası içeren ZIP dosyası olarak indirin.
Arkasındaki ayrıntılı veriyi ister misiniz? Premium'a katılın
Değişiklik günlüğü
14 güncellemeMetodoloji bölümüne claude-fable-5 için mükemmel skor sonucu eklendi
Karşılaştırılan modeller bölümüne anthropic/claude-fable-5 eklendi.
HALC-Bench kıyaslama açıklamasına 204 soruluk soru sayısı eklendi.
Test edilen model listesine anthropic/claude-opus-4.8 eklendi; belirtilen 1.000.000 yerine 850.000 token seviyesinde değerlendirildi.
Halüsinasyon kıyaslama makalesinin tamamı, HALC-Bench uzun bağlam erişim sonuçları, metodolojisi ve kıyaslanan dokuz modelle değiştirildi.
Güven ve İtibar bölümüne NeurIPS 2025'teki yapay zeka tarafından oluşturulan atıflara dair bir örnek eklendi.
Yapay zeka halüsinasyon karşılaştırma metodolojisi bölümü kaldırıldı.
Referans Linkleri
Şevval, yapay zeka kodlama araçları, yapay zeka ajanları ve kuantum teknolojilerine odaklanmaktadır.
Yorumlar 5
Düşüncelerinizi Paylaşın
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.
Can you test the Gemini 3 model? Thank you!
Hi Lishim, We included Gemini-3 models, Thank you for your comment!
This article is updated in June while the GPT 5 is announced in August. How did you test GPT 5 in AI Hallucination Rates figure
Hi! Thanks for your comment. We use WordPress for our articles, which allows us to update graphs and tables independently of the main text. This means that even if the article text shows an earlier update date, we can still add the latest results to the figures without altering the written sections.
Hi Cem, I've been using this article as a reference of severity of hallucination. Is it possible to refresh the report with the newly released GPT-5? Thanks!
Hi Rui, Thanks a lot for your interest and for using our article as a reference. We’ve already refreshed the report with GPT-5 results, so you’ll find the latest updates included in the article.
Is there any chance that you might add Claude Sonnet/Opus 4 as well as Gemini 2.5 Pro?
Hi Tim, Thank you for your support and suggestion. Claude Sonnet/Opus 4 and Gemini 2.5 Pro have already been added to the article, so you can now see them included in the comparisons.
Hi, thank you for interesting benchmark! I was wondering Grok3's hallucination rate, both in Think mode and without. Are you planning to add these?
Hi Joon and thank you for your comment, Yes, we are waiting for API access.