Premium
Hizmetler
Premium

HALC-Bench: LLM Uzun Bağlamlı Getirme Kıyaslamasında Halüsinasyon

Cem Dilmegani
Cem Dilmegani
Güncellenme tarihi: 4 Ağu 2026

HALC-Bench (LLM Hallucination on Long-Context Retrieval Benchmark), hedef belgede bulunmayan bir metrik için kanıt uydurmaya karşı büyük bir dil modelinin direncini, modelin bağlam penceresinin başına, ortasına ve sonuna yerleştirilen 3 saman yığını kullanarak 204 soruyla ölçer.

Sonuçlar

Grafik Yükleniyor

claude-fable-5, her saman yığını konumundaki 204 tuzağın tamamını doğru yanıtladı. Kalan modeller arasında en az halüsinasyonu gpt-5.5 üretti. Saman yığını konumu ile halüsinasyon oranları arasında bir ilişki bulunamadı.

Metodoloji

204 soru, bilgi kesme tarihinden sonraki Motley Fool makalelerinden hazırlanmıştır ve saman yığınları modelin bağlam penceresinin 0.1, 0.5 ve 0.9 konumlarına yerleştirilmiştir.

Kıyaslanan modeller ve token cinsinden test edilen bağlam pencereleri aşağıdadır:

  • anthropic/claude-fable-5: 850.000 token test edildi
  • openai/gpt-5.5: 1.000.000 token
  • google/gemini-3.1-pro-preview: 1.000.000 token
  • google/gemini-3.5-flash: 1.000.000 token
  • anthropic/claude-opus-4.8: 1.000.000 token duyuruldu, 850.000 test edildi.
  • anthropic/claude-sonnet-4.6: 1.000.000 token
  • qwen/qwen3.6-plus: 1.000.000 token
  • moonshotai/kimi-k2.6: 200.000 token
  • z-ai/glm-5.1: 200.000 token
  • minimax/minimax-m2.7: 150.000 token
  • openai/gpt-5.4-mini: 250.000 token

claude-opus-4.8, 850.000 kademesinde test edilmiştir çünkü 1.000.000 tokenlik bağlam penceresi testlerinin girdisini başarıyla alamamaktadır.

claude-fable-5, Claude Code aracılığıyla test edilir: model, 850.000 tokenlik saman yığınını bir dosya olarak alır ve onu bağlam penceresinden okumak yerine getirme araçlarıyla arar; bu nedenle puanları, modeli Claude Code test düzeneğiyle birlikte ölçer.

Question format

Hedef transkriptte hiçbir yerde tartışılmayan bir metrik hakkında bir iddia.

Örnek iddia: DocuSign (DOCU) tarafından 2026'nın 4. çeyreği için raporlanan Kapsam 1 ve 2 karbon emisyonları 8.700 metrik ton CO2e'dir.

Beklenen yanıt: Bahsedilmedi

Veri kaynağı

Veri kaynağı olarak, modellerin bilgi kesme tarihinden sonra yayımlanan Motley Fool transkriptleri kullanılır. Tuzaklar, her transkriptin gerçek içerik boşluklarına dayanarak elle oluşturulmuştur. 14 kaynak transkriptin her biri için:

  • Transkriptte bulunmayan metrik kategorilerini manuel olarak belirleyin (ör. DocuSign 2026 4. çeyreği hiç ESG / karbon metriklerini tartışmaz; Adobe APAC gelirini hiç ayrıştırmaz; Lennar bir ev inşaatçısı olduğu için Ar-Ge giderini hiç raporlamaz).
  • Gerçekçi bir sayı, birim ve çeyrek referansı içeren makul görünen bir iddia oluşturun.
  • Gövde metnine karşı anahtar kelime araması yoluyla yokluğu programatik olarak doğrulayın. Her iddianın 3-8 anahtar kelime varyantı vardır (ör. “carbon emissions”, “scope 1”, “scope 2”, “ghg”, “co2”); herhangi bir anahtar kelime temizlenmiş gövdeyle eşleşirse tuzak belirsiz olduğu için reddedilir.
  • Anahtar kelime kontrolünden kaynaklanan yanlış negatifleri ayıklamak için kalanları elle inceleyin.

Bu, halüsinasyonu neden izole eder?

Hedef belge metriği tartışmaz, ancak saman yığınındaki çeldirici belgeler genellikle diğer şirketler için benzer metrikleri tartışır. Halüsinasyon üreten bir model:

  • Ya çeldiricilere dayanarak bir sayı uydurur
  • Ya da metriğin yanlış bir değerle bahsedildiğini iddia eder (not_mentioned yerine no tahmini yapar)

Her iki başarısızlık modu da puan = 0 olarak kaydedilir. Yalnızca “bahsedilmedi” şeklinde doğru yanıt vermek 1.0 puan kazandırır.

Puanlama kuralı

Puan = tahmin not_mentioned ise 1.0, aksi takdirde 0.0.

En belirleyici hata deseni, beklenen = not_mentioned iken predicted = no olmasıdır. Bu, modelin metriği gördüğünü ancak yanlış bir değerle gördüğünü iddia ettiği anlamına gelir. Model, varlığa ilişkin kanıt uydurmuştur.

Kaynak transkrite göre tuzak dağılımı

~17 tuzak, transkript başına, 14 kaynak transkripte yayılan ve 10 sektörü kapsayan (yarı iletkenler, SaaS, perakende, restoranlar, CPG, ev inşaatı, finans, gıda üretimi, kurumsal donanım ve diğerleri) bu testin halüsinasyonu tek bir alanda ölçmemesi için tasarlanmıştır.
Kıyaslamada toplam 204 farklı soru kullanılır ve bunlar bağlam penceresi içindeki farklı saman yığını konumlarına yerleştirilmiştir.

Yapay zeka halüsinasyonu nedir?

Bir yapay zeka halüsinasyonu, bir yapay zeka sistemi tarafından üretilen ve gerçekmiş gibi sunulan yanlış, uydurma veya yanıltıcı bilgiler içeren bir yanıttır. IBM, bu olguyu, büyük bir dil modelinin insan gözlemciler için var olmayan veya algılanamayan kalıplar veya nesneler algılaması ve eğitim verilerine dayanmayan, saçma veya olgusal olarak yanlış çıktılar üretmesi olarak tanımlar.1 Wikipedia maddesi, bunu benzer şekilde gerçekmiş gibi sunulan yanlış veya yanıltıcı bilgiler içeren bir yanıt olarak tanımlar ve literatürde kullanılan alternatif terimler olarak “bullshitting”, “confabulation” ve “delusion” ifadelerini sıralar.2

Ulusal Standartlar ve Teknoloji Enstitüsü Yapay Zeka Risk Yönetimi Çerçevesi Üretken Yapay Zeka Profili (NIST AI 600-1), Temmuz 2024'te yayımlanmıştır ve birincil terim olarak “halüsinasyon” yerine resmen “confabulation” terimini benimser. NIST, confabulation'ı kullanıcıların yanıltılabileceği veya kandırılabileceği, günlük dilde halüsinasyonlar veya uydurmalar olarak bilinen, kendinden emin bir şekilde ifade edilen ancak hatalı veya yanlış içerik üretimi olarak tanımlar.3 Bu tanım, yalnızca dış gerçeklikle çelişen iddiaları değil, prompt'tan sapan veya aynı bağlam içinde daha önce üretilen ifadelerle çelişen çıktıları da açıkça kapsar.

Halüsinasyon, sıradan bir hata veya yazım hatasından iki kritik boyutta ayrılır. İlk olarak akıcılık ve güven: NIST’in tanımı, içeriğin “kendinden emin bir şekilde ifade edilmiş” olmasını, doğru bir yanıtla aynı dilbilgisel ve stilistik kesinlik işaretlerini taşımasını ve hiçbir kaçamak ifade ya da şüphe sinyali içermemesini gerektirir.3 İkincisi, uydurma ile bozulma: IBM, bu başarısızlığı modelin eğitim verilerinde veya girdisinde hiçbir temeli olmayan içerik üretmesi olarak çerçeveler.

Yapay zeka halüsinasyonunun sektörler genelinde gerçek dünyadaki etkisi

Hukuk, sağlık ve finans sektörlerindeki belgelenmiş olaylar, halüsinasyonun teorik bir endişe değil, ölçülebilir finansal ve operasyonel hasarın bir kaynağı olduğunu göstermektedir.

En kapsamlı kamu sayımı olan Damien Charlotin AI Hallucination Cases veri tabanı, 9 Haziran 2026 itibarıyla dünya genelinde 1.598 vaka belgelemiştir ve günde yaklaşık 8 yeni vaka eklenmektedir.4

Coomer v. Lindell (ABD Bölge Mahkemesi, Colorado Bölgesi) davasında Yargıç Nina Wang, Temmuz 2025'te avukatlar Christopher I. Kachouroff ve Jennifer T. DeMaster'a her birine 3.000 dolar para cezası verdi; bu, Mike Lindell ve MyPillow için yapılan dosyalamalarda yanlış alıntılar ve var olmayan davalar da dahil olmak üzere yaklaşık 30 hatalı atıf tespit etmesinin ardından geldi.5 Aynı yargıç, Mayıs 2026'da daha maddi olarak hatalı bir atıf nedeniyle Kachouroff'a bu kez 5.000 dolar para cezası verdi.6

Couvrette v. Wisnovsky davasında, Oregon'daki bir federal mahkeme, Aralık 2025 ve Mart 2026 tarihli kararlarla davacıların taleplerini esastan reddetti ve Kaliforniyalı avukat Stephen Brigandi ile Portland'lı avukat Tim Murphy'ye toplam 110.204.38 dolar yaptırım uyguladı. İkili, beş ay boyunca sunulan üç dilekçede 15 var olmayan dava ve 8 uydurma alıntı kullandı.7

Whiting v. City of Athens, Tennessee davasında, Altıncı Daire paneli Mart 2026'da avukatlar Van Irion ve Russ Egli'nin iki düzineden fazla uydurma atıf kullandığını ve bir bölge mahkemesinin yaptırım kararını yanlış aktardığını tespit etti. Mahkeme, her iki avukata da mahkeme veznesine 15.000 dolar ödemelerini, karşı tarafın tüm istinaf ücretlerini geri ödemelerini, iki kat masraf ödemelerini ve disiplin soruşturmasıyla karşı karşıya kalmalarını emretti.89

20 Temmuz 2025'te, ABD Bölge Yargıcı Henry T. Wingate (Mississippi Güney Bölgesi), yanlış adlandırılmış taraflar ve var olmayan bir davaya yapılan atıf gibi olgusal hatalar içeren geçici bir yasaklama kararı çıkardı. Senatör Chuck Grassley bir soruşturma gönderdikten sonra Wingate, hukuk katibinin karar taslağını hazırlamak için Perplexity kullandığını kabul etti. Wingate, taslak kararların ikinci bir bağımsız incelemesini ve atıf yapılan tüm davaların fiziksel çıktılarını gerektiren bir iç politika benimsedi.1011

Takip firması ComplexDiscovery, tek bir 2023 davasında yaklaşık 5.000 dolardan tek bir 2025 davasında 55.597 dolara yükselen yaptırımları belgeledi; bu, yaklaşık 11x artış anlamına gelir ve yaklaşık 18 ayda gerçekleşmiştir. Couvrette rakamıyla birlikte, 2026'nın başından ortasına kadar dava başına yaptırımlar yaklaşık 110.000 dolara ulaştı.12 Birleşik Krallık, Singapur, Kanada, Avustralya, Arjantin, AB, Kore, İtalya, Norveç ve Fransa'daki mahkemelerin tümü, yapay zeka kaynaklı halüsinasyonlu dosyalamalar hakkında kararlar vermiştir.1314

Sağlık hizmetleri ve klinik dokümantasyon

4 Aralık 2024'te yayımlanan ECRI'nin 18th yıllık En Büyük 10 Sağlık Teknolojisi Tehlikesi raporu, “yapay zeka destekli sağlık teknolojilerindeki riskleri” 2025 için bir numaralı tehlike olarak sıraladı; özellikle yanlış veya yanıltıcı halüsinasyonlu sonuçlar üreten yapay zeka sistemlerine ve yapay zekanın yeterince temsil edilmeyen hasta gruplarına karşı önyargıyı sürdürme riskine dikkat çekti.1516

Communications Medicine dergisinde yayımlanan 2025 tarihli bir çalışma, her biri uydurma bir ayrıntı içeren 300 hekim onaylı simüle klinik vinyet kullanarak klinik vaka özetlemede birden fazla LLM test etti. Çalışma, hafifletme prompt'u olmadan genel halüsinasyon oranının %65,9 olduğunu ve yapılandırılmış hafifletme prompt'u ile %44,2'ye düştüğünü buldu; GPT-4o en iyi performans gösteren modeldi ve hafifletme etkinken %53 taban çizgisinden %23'e geriledi.1718

Finans ve müşteri hizmetleri

ABD Menkul Kıymetler ve Borsa Komisyonu (SEC), yapay zeka yanlış beyanları için yaptırım eylemleri başlattı. 18 Mart 2024'te SEC, iki yatırım danışmanı olan Delphia (USA) Inc. ve Global Predictions, Inc. aleyhine toplam 400.000 dolar para cezası içeren ilk yapay zeka aklama suçlamalarını çözüme kavuşturdu.19 Ocak 2025'te SEC, halka açık bir şirket olan Presto Automation Inc. aleyhine, yapay zeka konuşma tanıma ürününün aslında önemli insan müdahalesi gerektiren üçüncü taraf bir araç olduğunu açıklamadığı için ilk yapay zeka aklama davasını açtı.20

Moffatt v. Air Canada davasında, 2024 BCCRT 149, 14 Şubat 2024'te Britanya Kolumbiyası Sivil Çözüm Mahkemesi tarafından karara bağlandı; mahkeme, Air Canada'nın chatbot'unun ifadelerinden sorumlu olmadığı yönündeki savunmasını reddetti. Jake Moffatt'a, havayolunun web sitesi chatbot'u tarafından tam ücretli biletleri aldıktan sonra yas tazminatı indirimine geriye dönük olarak başvurabileceği söylenmişti; bu yanlıştı. Mahkeme, Air Canada'nın Moffatt'a ihmalkâr yanlış beyan nedeniyle 650.88 dolar tazminat ödemesine karar verdi.2122

Yapay zeka halüsinasyonları ne kadar yaygındır?

Halüsinasyon oranları görev türüne ve değerlendirme metodolojisine göre büyük ölçüdeğişir; bu da tek rakamlı özetleri yanıltıcı kılar. Stanford HAI 2026 Yapay Zeka Endeksi Raporu, modellerin yanlış ifadeler sunulduğunda üçüncü taraf inancı ile kullanıcı inancı arasında ayrım yapıp yapamayacağını test eden yeni bir doğruluk kıyaslaması belgelemektedir. Bu kıyaslamada, 26 üst modelde halüsinasyon oranları %22 ile %94 arasında değişmektedir.23

Bu geniş dağılımı metodoloji yönlendirir. Modeller, yanlış iddialar üçüncü bir tarafın inandığı bir şey olarak çerçevelendiğinde iyi başa çıkarken, aynı yanlış iddia kullanıcının inandığı bir şey olarak çerçevelendiğinde performans çöker. Bu “kullanıcı inancı” çerçevelemesinde, GPT-4o'nun doğruluğu %98,2'den %64,4'e düştü ve DeepSeek R1 %90 üzerinden %14,4'e geriledi.23

Temellendirilmiş özetleme görevlerinde oranlar daha düşüktür, ancak kıyaslama değişiklikleri eğilim analizini karmaşıklaştırır. Vectara'nın Halüsinasyon Lider Tablosu (HHEM modeli), özetlerin kaynak belgeler tarafından desteklenmeyen iddiaları ne sıklıkta içerdiğini ölçer. 2025'in büyük bölümünde geçerli olan orijinal lider tablosu sürümünde, Google'ın Gemini-2.0-Flash-001 modeli %0,7 halüsinasyon oranı elde etti. Kasım 2025'te Vectara, hukuk, tıp, finans, teknoloji ve eğitimi kapsayan daha uzun belgeler (en fazla 32K token) kullanan daha zor bir veri kümesiyle kıyaslamayı değiştirdi. Bu yeni kıyaslamada mevcut lider, Ant Group'un finix_s1_32b modeli olup %1,8, onu Google'ın Gemini-2.5-flash-lite'ı %3,3 ve OpenAI'ın gpt-5.4-nano modeli %3,1 ile izlemektedir.24 Vectara, yeni veri kümesi kasıtlı olarak daha zor olduğu için eski ve yeni sürümlerin puanlarının doğrudan karşılaştırılmaması gerektiğini açıkça belirtir.25

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Yapay zeka halüsinasyonlarını tespit etme ve azaltma

Teknik hafifletme yaklaşımları, getirme mimarisinden değerlendirme tasarımına kadar üretim pipeline'ının farklı aşamalarını hedefler.

Getirme artırımlı üretim ve temellendirme

Standart getirme artırımlı üretim, önceden eğitilmiş parametrik bir dil modelini parametrik olmayan bir getirme endeksiyle birleştirir ve çıktıyı, yalnızca eğitim sırasında ezberlenen olgulara dayanmak yerine inference sırasında getirilen belgelere koşullandırır.26 Mekanistik yorumlanabilirlik araştırması, RAG sistemlerindeki halüsinasyonları iki dahili bileşene bağlar: “Knowledge FFNs” (parametrik bilgiyi kodlayan ileri beslemeli ağ katmanları) ve “Copying Heads” (getirilen bağlamı çıktıya aktarmaktan sorumlu dikkat kafaları). Halüsinasyon, Knowledge FFNs parametrik bilgiyi aşırı vurgularken Copying Heads dışarıdan getirilen içeriği koruyamadığında ortaya çıkar.27

SQL RAG, getirme işlemini belge düzeyi yerine şema düzeyinde uygular; CREATE TABLE ifadelerini ve örnek sorguları semantik embedding'ler kullanarak getirir. Bu, yalnızca gerçek, getirilen şema tanımları bağlamda olduğu için modellerin şema öğeleri uydurmasını yapısal olarak engeller. Ancak, getirilen şema içeriğinin büyütülmesi getirme ayrımını iyileştirir, fakat prompt'lar optimum bir boyutu aştığında halüsinasyon oranlarını artırır; bu da aşağı yönlü üretim kapasitesinin SQL RAG'ın uydurmayı ne kadar azaltabileceğini sınırladığını gösterir.28

Microsoft Research'in GraphRAG'ı, getirme işleminden önce kaynak külliyatları bilgi graflarına dönüştürür ve ilgili varlık kümeleri için topluluk özetlerini önceden üretir. Bu, standart RAG'ın tüm külliyatlarla ilgili küresel sorulardaki zorluğunu, izole parçalar yerine yapılandırılmış varlık ilişkilerini getirerek ele alır.29

Kalibrasyon, prompt'lama ve değerlendirme yöntemleri

OpenAI'ın Eylül 2025 tarihli makalesi, değerlendirme tasarımındaki değişikliklerin model geliştirme sırasında neyin optimize edildiğini değiştirerek halüsinasyon oranlarını değiştirebileceğini öne sürer. Yazarlar, kıyaslamalara açık güven eşikleri eklemeyi önerir; örneğin “yalnızca %t'den daha emin olduğunda yanıt ver, çünkü hatalar t/(1−t) puan cezalandırılır.” Bu puanlama kuralına göre, modelin gerçek güveni eşiği aştığında yanıt vermek, çekimser kalmaktan daha iyidir ve tahmin etme teşvikini ortadan kaldırır.3031

Yapılandırılmış prompt'lama, belirli alanlarda halüsinasyon oranlarını azaltır. Communications Medicine çalışması, modellere “yalnızca klinik olarak doğrulanmış bilgileri kullanın ve daha fazla spekülasyon yapmak yerine belirsizliği kabul edin” talimatını veren bir hafifletme prompt'unun, uzun vaka klinik vinyetleri için halüsinasyon oranlarını %64,1'den %43,1'e ve tüm modeller ile vaka uzunlukları ortalamasında yaklaşık %66'dan %44'e düşürdüğünü buldu. 3218 Sıcaklık-0 (deterministik) kod çözme önemli bir iyileşme üretmedi; bu da etkili değişkenin kod çözme rastgeleliği değil, prompt yapısı olduğunu izole etti.32

Yapay zeka halüsinasyonu çözülebilir bir sorun mu?

Halüsinasyonun ortadan kaldırılıp kaldırılamayacağı sorusu, teorik imkansızlık sonuçları ile azalan kıyaslama oranlarına ilişkin ampirik eğilimler arasında gerçekten tartışmalıdır.

“Hallucination is Inevitable” başlıklı makale, LLM'lerin tüm hesaplanabilir işlevleri öğrenemeyeceğini ve bu nedenle genel problem çözücü olarak kullanıldıklarında kaçınılmaz olarak halüsinasyon üreteceğini öne süren biçimsel bir argüman sunar ve bunu mimari veya eğitim iyileştirmelerinden bağımsız doğuştan bir sınırlılık olarak çerçeveler.33 İlgili bir teorik sonuç, modellerin aynı anda yüksek tutarlılık (yalnızca eğitim verileriyle desteklenen ifadeler üretme) ve yüksek kapsam (hedef dilin tam çeşitliliğini kapsama) elde edemeyeceğini kanıtlar; birine doğru itmek zorunlu olarak diğer başarısızlık moduna, yani halüsinasyona veya mod çöküşüne doğru iter.3435

Bu teorik sınırların karşısında, standartlaştırılmış kıyaslamalarda düşen halüsinasyon oranlarına ilişkin ampirik eğilim yer alır; üst modeller temellendirilmiş özetleme görevlerinde %2'nin altına ulaşmaktadır. Ancak bu eğilim, değerlendirme uyumsuzluğu nedeniyle karmaşıklaşır. OpenAI'ın araştırması, ana akım kıyaslamalardaki ikili puanlamanın, kalibre edilmiş belirsizlik yerine kendinden emin tahminleri matematiksel olarak ödüllendiren yapısal bir engel olduğunu belirler; bu da raporlanan oranların, gerçek dünya güvenilirlik gereksinimlerini yansıtmayabilecek teşvik yapılarına karşı performansı ölçtüğü anlamına gelir.30

Şubat 2024'ten bir anket, halüsinasyon ile yaratıcı üretimin altında yatan mekanizmaları paylaşabileceğini ve ikisini ayrılabilir başarısızlık modları ve başarılar yerine bir takas olarak çerçevelediğini öne sürer. Keşifsel çıktılar üreten üretim mekanizmasını bastırmak, özellikle beyin fırtınası veya kurgu gibi alanlarda yalnızca riski değil, yeteneği de bastırma riski taşır.36 Bu, gözlemlenen kod çözme parametresi davranışıyla uyumludur: olgusal çıkarım için düşük sıcaklık ayarları (0 ila 0.3) önerilirken, daha yüksek ayarlar (0.7 ila 1.0) yaratıcı görevler için varyansı ve bununla birlikte halüsinasyon riskini kasıtlı olarak artırır.37

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Yapay zeka halüsinasyonu politikası ve araştırması nereye yöneliyor?

Stanford HAI'nin 2026 Yapay Zeka Endeksi Raporu'na göre, Yapay Zeka Olay Veri Tabanı 2025'te 362 belgelenmiş olay kaydetti; bu sayı 2024'te 233 idi.23 Yapay zeka olaylarını bildiren işletmeler arasında 3-5 olay bildirenlerin payı artarken, yalnızca 1-2 olay bildirenlerin payı düştü; bu da tek seferlik olaylar yerine tekrarlanan maruz kalmanın daha yaygın hale geldiğini gösterir.23

Vakıf Modeli Şeffaflık Endeksi, olaylar artsa bile şeffaflığın azaldığını göstermektedir. Değerlendirilen geliştiriciler arasında ortalama puan 2023'te 37'den 2024'te 58'e yükseldi, ardından 2025'te 40'a düştü.3839 Bireysel 2025 puanları, IBM için 95'ten xAI ve Midjourney için her biri 14'e kadar değişti.40

Yapay zekaya özgü yönetişim rolleri 2025'te %17 arttı ve sorumlu yapay zeka politikaları olmayan işletmelerin payı %24'ten %11'e düştü.23

Mahkemeler, vaka bazlı yaptırımlardan kalıcı kurallara geçiş yaptı. 28 Mayıs 2026'da Florida Yüksek Mahkemesi, Genel Uygulama ve Yargı İdaresi Kuralı 2.515(d)(2)'yi değiştirerek, bir mahkeme dosyalamasını imzalayan her kişinin “belirtilen yasal dayanakların var olduğunu ve doğru şekilde atıf yapıldığını” onaylamasını zorunlu kıldı; bu değişiklik 15 Haziran 2026'dan itibaren geçerli oldu.41 New York Güney Bölgesi'nde, Yargıç Vernon Broderick'in İçtihadı Kuralları (29 Ekim 2025'te güncellenmiştir), dosyalamaların hazırlanmasında kullanılan üretken yapay zekanın açıklanmasını ve yapay zeka tarafından üretilen bölümlerin bağımsız olarak incelendiğine dair onay verilmesini gerektirir.42

SSS'ler

Hayır. Biçimsel hesaplanabilirlik argümanları, büyük dil modellerinin tüm hesaplanabilir işlevleri öğrenemeyeceğini ve mimari veya eğitim verisi kalitesinden bağımsız olarak bazı girdilerde kaçınılmaz şekilde halüsinasyon üreteceğini kanıtlar.33 Araştırmalar, model performansını korurken halüsinasyon olasılığının istatistiksel olarak ihmal edilebilir düzeylere indirilebileceğini ancak sıfıra indirilemeyeceğini göstermektedir.4344

Hayır. IBM'in teknik tanımı, yapay zeka halüsinasyonlarının “kasıtlı aldatma eylemleri olmadığını”, eğitim verisi önyargısı ve model karmaşıklığı gibi faktörlerden kaynaklandığını ve yanlış çıktıları istemeden ürettiğini belirtir.1 Yalan söylemek, doğru yanıtı bilmeyi ve yanlış bir şey söylemeyi seçmeyi gerektirir; modeller aldatma niyetinden yoksundur ve bunun yerine doğruluk değerine kayıtsız çıktılar üretir.30

Kırmızı bayraklar arasında güvenle sunulan olgusal olarak yanlış ifadeler, konudan sapan veya mantıksal akışı bozan yanıtlar, temel aritmetik hataları gibi hatalı adım adım mantık ve çok modlu araçlarda istekle eşleşmeyen üretilen görüntüler yer alır.45 Eğitim teşvikleri tahmin etmeyi ödüllendirdiği için, kullanıcılar kaynaksız ve güvenle ifade edilen ayrıntıları birincil kaynaklarla kontrol edilene kadar doğrulanmamış olarak görmelidir.30

Ek okumalar

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Cem Dilmegani and Şevval Alper (2026) - "HALC-Bench: LLM Uzun Bağlamlı Getirme Kıyaslamasında Halüsinasyon". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 4 Ağustos 2026, kaynak: https://aimultiple.com/ai-hallucination [Çevrimiçi Kaynak]

Dilmegani, C., & Alper, Ş. (2026, 4 Ağustos). HALC-Bench: LLM Uzun Bağlamlı Getirme Kıyaslamasında Halüsinasyon. AIMultiple. https://aimultiple.com/ai-hallucination

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Alper, Şevval},
  title  = {{HALC-Bench: LLM Uzun Bağlamlı Getirme Kıyaslamasında Halüsinasyon}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/ai-hallucination}},
  note   = {AIMultiple. Erişim tarihi: 4 Ağustos 2026}
}
Tüm verileri indir

0 veri noktasının sonuçları ve zaman damgaları. Bu makaledeki grafik ve tablolarda gösterilen özet verileri, 0 CSV dosyası içeren ZIP dosyası olarak indirin.

Son güncelleme: 26 Eylül 2026
İndir

Arkasındaki ayrıntılı veriyi ister misiniz? Premium'a katılın

Değişiklik günlüğü

14 güncelleme
  1. Metodoloji bölümüne claude-fable-5 için mükemmel skor sonucu eklendi

  2. Karşılaştırılan modeller bölümüne anthropic/claude-fable-5 eklendi.

  3. HALC-Bench kıyaslama açıklamasına 204 soruluk soru sayısı eklendi.

  4. Test edilen model listesine anthropic/claude-opus-4.8 eklendi; belirtilen 1.000.000 yerine 850.000 token seviyesinde değerlendirildi.

  5. Halüsinasyon kıyaslama makalesinin tamamı, HALC-Bench uzun bağlam erişim sonuçları, metodolojisi ve kıyaslanan dokuz modelle değiştirildi.

  6. Güven ve İtibar bölümüne NeurIPS 2025'teki yapay zeka tarafından oluşturulan atıflara dair bir örnek eklendi.

  7. Yapay zeka halüsinasyon karşılaştırma metodolojisi bölümü kaldırıldı.

Referans Linkleri

1.
What Are AI Hallucinations? | IBM
2.
Hallucination (artificial intelligence) - Wikipedia
Contributors to Wikimedia projects
3.
Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
4.
AI Hallucination Cases Database – Damien Charlotin
5.
AI hallucination in Mike Lindell case serves as a stark warning : NPR
NPR
6.
$5K Sanctions for Repeated Mis-Citation in Coomer v. Lindell / My Pillow Election-Related Libel Suit
Reason Magazine
7.
Gardiner Roberts - Blog
8.
Lawyers Citing Nonexistent Cases Ordered to Pay Opponents' Attorney Fees, Double Costs, $15K Fine Each
Reason Magazine
9.
UNITED STATES COURT OF APPEALS
10.
Attorneys baffled by federal court order with factual errors - Mississippi Today
Mississippi Today
11.
Federal judge in Mississippi admits staff used AI to draft inaccurate order - Mississippi Today
12.
The AI Sanction Wave: $145K in Q1 Penalties Signals Courts Have Lost Patience with GenAI Filing Failures
ComplexDiscovery
13.
AI Hallucinations in Law: 1,313 Court Cases and Counting | HAQQ
HAQQ
14.
AI Hallucination Cases Tracker
15.
Artificial intelligence tops 2025 health technology hazards list
ECRI and ISMP
16.
Artificial intelligence tops 2025 health technology hazards list
Cision PR Newswire
17.
Multi-model assurance analysis showing large language models are highly vulnerable to adversarial hallucination attacks during clinical decision support - PMC
18.
Multi-model assurance analysis showing large language models are highly vulnerable to adversarial hallucination attacks during clinical decision support | Communications Medicine
Nature Publishing Group UK
19.
SEC Fines Two Investment Advisers for AI Washing
20.
2025 Fiscal Year in Review: SEC Enforcement Against Investment Advisers to Private Funds, Registered Funds, and Retail Clients | Insights | Sidley Austin LLP
Sidley Austin LLP
21.
Vercel Security Checkpoint
22.
Moffet v. Air Canada
23.
Responsible AI | The 2026 AI Index Report | Stanford HAI
24.
GitHub - vectara/hallucination-leaderboard: Leaderboard Comparing LLM Performance at Producing Hallucinations when Summarizing Short Documents · GitHub
25.
Introducing the next generation of Vectara's Hallucination Leaderboard
26.
[2005.11401] Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
27.
[2410.11414] ReDeEP: Detecting Hallucination in Retrieval-Augmented Generation via Mechanistic Interpretability
28.
Balancing Content Size in RAG-Text2SQL System
29.
[2404.16130] From Local to Global: A Graph RAG Approach to Query-Focused Summarization
30.
[2509.04664] Why Language Models Hallucinate
31.
Why language models hallucinate | OpenAI
32.
Large Language Models Are Highly Vulnerable to Adversarial Hallucination Attacks in Clinical Decision Support: A Multi-Model Assurance Analysis | medRxiv
33.
[2401.11817] Hallucination is Inevitable: An Innate Limitation of Large Language Models
34.
On the Limits of Language Generation:Trade-Offs Between Hallucination and Mode Collapse
35.
On the Limits of Language Generation: Trade-Offs between Hallucination and Mode-Collapse | Proceedings of the 57th Annual ACM Symposium on Theory of Computing
36.
A Survey on Large Language Model Hallucination via a Creativity Perspective
37.
LLM temperature: tuning creativity vs reliability | KERN-IT
KERN-IT
38.
Transparency in AI is on the Decline | Stanford HAI
39.
The 2025 Foundation Model Transparency Index
40.
Transparency in AI is on the decline | Stanford Report
41.
Supreme Court amends rules to address AI use in court filings – The Florida Bar
42.
INDIVIDUAL RULES & PRACTICES IN CIVIL CASES
43.
\u0022Hallucinations
44.
AI hallucination: towards a comprehensive classification of distorted information in artificial intelligence-generated content | Humanities and Social Sciences Communications
Palgrave Macmillan UK
45.
How to tell if an AI is hallucinating in its answers. 4 red flags to watch out for | PCWorld
PCWorld
Cem Dilmegani
Cem Dilmegani
Baş Analist
Cem, 2017'den beri AIMultiple bünyesinde baş analisttir. Cem'in AIMultiple'daki çalışmaları; Business Insider, Forbes, Morning Brew ve Washington Post gibi önde gelen küresel yayınlar, Deloitte ve HPE gibi küresel firmalar, Dünya Ekonomik Forumu gibi STK'lar ve Avrupa Komisyonu gibi uluslarüstü kuruluşlar tarafından alıntılanmıştır. [1], [2], [3], [4], [5] Kariyeri boyunca Cem; teknoloji danışmanı, teknoloji alıcısı ve teknoloji girişimcisi olarak görev yaptı. On yılı aşkın süre boyunca McKinsey & Company ve Altman Solon'da işletmelere teknoloji kararlarında danışmanlık yaptı. Ayrıca dijitalleşme üzerine bir McKinsey raporu yayımladı. CEO'ya rapor verirken bir telekom şirketinin teknoloji stratejisini ve satın alma süreçlerini yönetti. Ayrıca 2 yıl içinde 0'dan 7 haneli yıllık yinelenen gelire ve 9 haneli değerlemeye ulaşan derin teknoloji şirketi Hypatos'un ticari büyümesini yönetti. Cem'in Hypatos'taki çalışmaları TechCrunch ve Business Insider gibi önde gelen teknoloji yayınları tarafından ele alındı. Cem, uluslararası teknoloji konferanslarında düzenli olarak konuşma yapmaktadır. Boğaziçi Üniversitesi'nden bilgisayar mühendisi olarak mezun oldu ve Columbia Business School'dan MBA derecesine sahiptir.
Tam Profili Görüntüle
Teknik olarak inceleyen
Şevval Alper
Şevval Alper
Yapay Zeka Araştırmacısı
Şevval, AIMultiple'da bir yapay zeka araştırmacısıdır. Kaotik sistemler kullanarak sözde rastgele sayı üretimi konusunda daha önce araştırma deneyimine sahiptir.
Şevval, yapay zeka kodlama araçları, yapay zeka ajanları ve kuantum teknolojilerine odaklanmaktadır.
Tam Profili Görüntüle

Yorumlar 5

Düşüncelerinizi Paylaşın

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450
Lishim
Lishim
Nov 20, 2025 at 11:43

Can you test the Gemini 3 model? Thank you!

Sıla Ermut
Sıla Ermut
Sep 15, 2026 at 09:24

Hi Lishim, We included Gemini-3 models, Thank you for your comment!

Abraham
Abraham
Aug 25, 2025 at 11:57

This article is updated in June while the GPT 5 is announced in August. How did you test GPT 5 in AI Hallucination Rates figure

Aleyna Daldal
Aleyna Daldal
Sep 05, 2025 at 08:46

Hi! Thanks for your comment. We use WordPress for our articles, which allows us to update graphs and tables independently of the main text. This means that even if the article text shows an earlier update date, we can still add the latest results to the figures without altering the written sections.

Rui
Rui
Aug 08, 2025 at 20:31

Hi Cem, I've been using this article as a reference of severity of hallucination. Is it possible to refresh the report with the newly released GPT-5? Thanks!

Aleyna Daldal
Aleyna Daldal
Sep 05, 2025 at 08:48

Hi Rui, Thanks a lot for your interest and for using our article as a reference. We’ve already refreshed the report with GPT-5 results, so you’ll find the latest updates included in the article.

Tim
Tim
Jul 19, 2025 at 10:13

Is there any chance that you might add Claude Sonnet/Opus 4 as well as Gemini 2.5 Pro?

Aleyna Daldal
Aleyna Daldal
Sep 05, 2025 at 08:48

Hi Tim, Thank you for your support and suggestion. Claude Sonnet/Opus 4 and Gemini 2.5 Pro have already been added to the article, so you can now see them included in the comparisons.

Joon
Joon
Feb 28, 2025 at 16:29

Hi, thank you for interesting benchmark! I was wondering Grok3's hallucination rate, both in Think mode and without. Are you planning to add these?

Cem Dilmegani
Cem Dilmegani
Mar 17, 2025 at 02:52

Hi Joon and thank you for your comment, Yes, we are waiting for API access.