100 test senaryosu üzerinde üç halüsinasyon tespit aracını kıyasladık: Weights & Biases (W&B) Weave HallucinationFree Puanlayıcı, Arize Phoenix HallucinationEvaluator ve Comet Opik Halüsinasyon Metriği.
Her araç doğruluk, kesinlik, duyarlılık ve gecikme açısından değerlendirildi.
YZ halüsinasyon tespit araçları kıyaslaması
Gerçeklere dayalı Soru-Cevap senaryolarından alınan 100 yanıtı (50 doğru, 50 halüsinasyonlu) kaynak bağlamlarına göre test ettik.
Doğruluk ve gecikme karşılaştırması
Test süreci hakkında daha fazla ayrıntı için kıyaslama metodolojisi bölümüne bakın.
W&B Weave ve Arize Phoenix sırasıyla %91 ve %90 ile neredeyse aynı doğruluğu sağladı. Her iki araç da veri kümesi genelinde güvenilir performans gösterdi. Comet Opik, %72 doğrulukla geride kaldı ve 100 testin yalnızca 72'sini doğru sınıflandırdı; bu, muhafazakâr yaklaşımından kaynaklanan önemli bir farktı.
Hız açısından, Arize Phoenix test başına 2 saniye ile kazanan oldu ve bu onu gerçek zamanlı uygulamalar için uygun hale getirdi. W&B Weave testleri 4 saniyede işledi, bu çoğu üretim kullanım durumu için makul. Comet Opik, test başına 8,5 saniye ile belirgin şekilde daha yavaştı ve bu, gecikmeye duyarlı uygulamalarda kullanıcı deneyimini etkileyebilir.
F1 skoru, kesinlik ve duyarlılık
F1 skorları (kesinlik ve duyarlılığın harmonik ortalaması) bu örüntüleri doğruladı: W&B Weave %90,5 ve Phoenix %89,4 ile her ikisi de güçlü ve dengeli bir performans elde etti. Karşılaştırıldığında, Opik'in %61,1'lik F1 skoru, mükemmel kesinlik ile zayıf duyarlılık arasındaki takası yansıttı. Opik'in sıfır yanlış pozitif elde etmesi, 28 yanlış negatif pahasına oldu; bu da onu yalnızca yanlış alarmların, gözden kaçan tespitlerden daha maliyetli olduğu senaryolar için uygun hale getiriyor.
Duyarlılık (gerçek halüsinasyonları yakalama yeteneği) farklı stratejileri ortaya çıkardı. W&B Weave, 50 halüsinasyondan 43'ünü yakalayarak ve yalnızca 7'sini kaçırarak %86 duyarlılıkla öne çıktı. Phoenix, 42 halüsinasyon tespit ederek ve 8'ini kaçırarak %84 ile yakından takip etti. Comet Opik'in duyarlılığı, yalnızca 22 halüsinasyon yakalarken 28'ini kaçırarak %44 ile önemli ölçüde daha düşüktü; tüm gerçek halüsinasyonların yarısından fazlası tespit edilemedi.
Kesinlik (uyarı güvenilirliği) önemli farklılıklar gösterdi. Comet Opik, sıfır yanlış pozitif ile mükemmel %100 kesinlik elde etti; bir şeyi halüsinasyon olarak işaretlediğinde, her zaman doğruydu. Hem Phoenix (%95,5) hem de Weave (%95,6) neredeyse aynı kesinliği gösterdi; her biri, 50 meşru yanıt içinde yalnızca 2 yanlış pozitif üreterek, aşırı muhafazakâr olmadan güçlü güvenilirlik sergiledi.
Performans farklılıklarını etkileyebilecek faktörler
Gözlemlenen performans farklılıkları muhtemelen tasarım felsefesinden, eşik seçiminden ve dayanaklandırmanın yorumlanmasından kaynaklanmaktadır.
Tespit stratejisi ve optimizasyon hedeflerindeki farklılıklar
- Araçlar aynı hedef yerine farklı hata takasları için optimize edilmiş gibi görünüyor.
- W&B Weave ve Arize Phoenix, yüksek kesinliği korurken çoğu halüsinasyonu yakalayarak dengeli bir performansı hedefliyor.
- Comet Opik, birçok halüsinasyon gözden kaçsa bile sıfır yanlış pozitife öncelik vererek oldukça muhafazakâr bir strateji benimsiyor.
- Bu stratejik tercih, Opik'in mükemmel kesinliğini ve önemli ölçüde daha düşük duyarlılığını doğrudan açıklıyor.
Araç tasarımına gömülü kesinlik-duyarlılık takasları
- Comet Opik'in sıfır yanlış pozitifi, yalnızca güven çok yüksek olduğunda halüsinasyonları işaretleyen katı bir karar eşiğini gösteriyor.
- W&B Weave ve Phoenix daha az kısıtlayıcı eşikler kullanarak, çok daha yüksek duyarlılık karşılığında bazı yanlış pozitiflere izin veriyor.
- Bu eşik farklılıkları şunlara yol açabilir:
- Weave ve Phoenix arasında benzer kesinlik
- Opik ile diğer iki araç arasında büyük duyarlılık farkları
- F1 skoru ve genel doğrulukta karşılık gelen farklılıklar
LLM-in yargıç olarak kullanımı uygulamasındaki farklılıklar
- Her üç araç da bir LLM-in yargıç olarak kullanımı yaklaşımını kullansa da, uygulamaları farklılık gösteriyor.
- W&B Weave, ince ve desteklenmeyen iddialara karşı hassasiyeti artırabilecek düşünce zinciri yürütmesine vurgu yapıyor.
- Arize Phoenix, daha incelikli yargıları destekleyen güven skorlarıyla birlikte etiket tabanlı çıktıları bünyesinde barındırıyor.
- Comet Opik, yüksek güvenli ikili kararlara odaklanıyor; bu da yanlış alarmları azaltırken sınırda halüsinasyonlara karşı hassasiyeti sınırlıyor.
Değerlendirme derinliğinden kaynaklanan gecikme farklılıkları
- Arize Phoenix'in daha düşük gecikmesi, gerçek zamanlı kullanıma uygun daha hafif veya daha akıcı bir değerlendirme pipeline'ına işaret ediyor.
- W&B Weave'in makul gecikmesi, daha zengin yürütme ve izleme loglaması ile tutarlıdır.
- Comet Opik'in daha yüksek gecikmesi muhtemelen daha kapsamlı dahili yürütme veya doğrulama adımlarını yansıtarak muhafazakâr tasarımını pekiştiriyor.
YZ halüsinasyon tespit araçları
W&B Weave'in HallucinationFree Puanlayıcısı
Şekil 1: W&B Weave'in izleme (traces) panosu.
Weights & Biases (W&B), kaynak bağlamda bulunmayan iddialar getiren LLM çıktılarını işaretleyen bir HallucinationFree Puanlayıcı ile birlikte gelir. Her yanıt üzerinde bir LLM yargıcı çalıştırır ve arkasındaki yürütme ile birlikte dayanaklandırılmış/dayanaksız bir karar döndürür.
Puanlayıcı iki girdi alır: bağlam (kaynak materyal) ve çıktı (LLM tarafından oluşturulan yanıt). Ardından, çıktının bağlamda bulunmayan bilgileri getirip getirmediğini analiz etmek için bir dil modeli kullanır. Sonuç, bir boolean has_hallucination bayrağı ve kararı açıklayan yürütmeyi içerir.
Temel özellikler:
- Düşünce zinciri yürütmesi: Her değerlendirme, çıktının neden halüsinasyon olarak işaretlendiğine veya işaretlenmediğine dair bir açıklama içerir.
- İkili sınıflandırma: Destekleyici kanıtlarla net doğru/yanlış kararları döndürür.
- Weave izlemesi ile entegrasyon: Sonuçlar, görselleştirme için otomatik olarak Weave panosuna loglanır.
- Özelleştirilebilir model: OpenAI, Anthropic ve diğer sağlayıcılar dahil olmak üzere farklı LLM yargıçlarını destekler.
Arize Phoenix'in HallucinationEvaluator'ı
Arize Phoenix, referans materyallerinden sapan yanıtları işaretleyen bir HallucinationEvaluator'ı beraberinde sunar. Her çıktı için, bir LLM yargıcı yanıtın sağlanan bağlama dayanıp dayanmadığına karar verir ve kararına bir güven skoru ekler.
Değerlendirici üç girdi alır: kullanıcı sorgusu (girdi), referans metni (bağlam) ve modelin yanıtı (çıktı). Yanıtın bağlamdan türetilemeyecek bilgileri içerip içermediğini analiz eder ve bir açıklama ve güven skoru ile birlikte etiketli bir sonuç ("olgusal" veya "halüsinasyonlu") döndürür.
Temel özellikler:
- Dengeli performans: Hem kesinlik hem de duyarlılık metriklerinde sonuç verir
- Etiket tabanlı çıktı: Yalnızca sayısal puanlar yerine kategorik etiketler ("olgusal" veya "halüsinasyonlu") döndürür
- Detaylı açıklamalar: Her değerlendirme kararı için yürütme sağlar
Comet Opik'in Halüsinasyon Metriği
Comet Opik'in Halüsinasyon Metriği, her LLM yanıtını kaynak bağlamına göre puanlar ve çıktının o bağlama sadık olup olmadığına dair ikili bir yargı döndürür. Kontrol, yalnızca yüksek güvenli desteklenmeyen iddia durumlarını işaretlemek üzere ayarlanmış bir LLM yargıcı aracılığıyla çalışır.
Metrik üç girdi kabul eder: kullanıcı sorgusu (girdi), kaynak materyal (bağlam) ve modelin yanıtı (çıktı). Çıktının bağlam tarafından desteklenmeyen iddialar getirip getirmediğini değerlendirir.
Sonuç, ikili bir puan (halüsinasyon yok için 0, halüsinasyon tespit edildi için 1) ve değerlendirmeyi açıklayan ayrıntılı bir yürütme içerir.
Temel özellikler:
- Detaylı açıklamalar: Her değerlendirme, içeriğin neden işaretlendiği veya onaylandığı hakkında kapsamlı yürütme sağlar
- Üç girdili analiz: Değerlendirme için sorguyu, bağlamı ve yanıtı birlikte dikkate alır
- Deney takibi: Sonuçlar otomatik olarak Opik'in deney takip sistemine loglanır
- Muhafazakâr yaklaşım: Yalnızca yüksek güvenli halüsinasyonları işaretleyerek yanlış pozitifleri en aza indirecek şekilde tasarlanmıştır
Galileo Luna-2
Galileo Luna-2, Galileo'nun daha geniş YZ gözlemlenebilirlik platformuna yerleşik bir halüsinasyon tespiti ve çalışma zamanı koruma katmanıdır. 1
Sistem, dayanaksız içeriği kullanıcıya ulaşmadan önce engelleyerek, üretim çıkarım yollarında satır içi olarak çalışacak şekilde tasarlanmıştır; Galileo'nun otomatik hata analizi katmanı Signals ise, manuel log incelemesi olmadan üretim hatalarının kök nedenlerini ortaya çıkarır.
Temel özellikler:
Çok yöntemli tespit: Tek bir yargılama stratejisine bağlı kalmak yerine embedding benzerliği, Düşünce Zinciri analizi ve G-Eval olgusallık puanlamasını birleştirir.
Çalışma zamanı korkulukları: Luna-2, yalnızca olaydan sonra işaretlemekle kalmaz, çıkarım yolunda satır içi olarak dayanaksız çıktıları engelleyebilir veya yeniden yazabilir.
Uçtan uca gözlemlenebilirlik: Çok adımlı ajan iş akışlarında girdileri, çıktıları ve dahili yürütme izlerini yakalar; Signals kök neden analizini otomatikleştirir.
DeepEval
DeepEval, Confident YZ'in açık kaynaklı bir LLM değerlendirme framework'üdür ve Pytest gibi hissettirecek ancak LLM uygulamaları için tasarlanmıştır. HallucinationMetric'i, modelin çıktısının sağlanan bağlamla olgusal olarak tutarlı olup olmadığına karar vermek için bir LLM-in yargıç olarak kullanılmasını kullanır ve framework herhangi bir CI/CD pipeline'ı içinde çalışacak şekilde inşa edilmiştir.2 3
Metrik üç zorunlu girdi alır: kullanıcı sorgusu (input), model yanıtı (actual_output) ve referans materyali (context). Her çıktıyı Halüsinasyon = (Çelişen Bağlamların Sayısı) / (Toplam Bağlam Sayısı) formülünü kullanarak puanlar; daha düşük puanlar daha iyi dayanaklandırmayı gösterir. Bir çıktı, puanı yapılandırılan eşiğin altında veya eşit olduğunda geçer.
Temel özellikler:
- Tanıdık test iş akışı: Halüsinasyon kontrolleri, normal birim testleri gibi yazılır ve çalıştırılır, böylece Pytest kullanan ekiplerin yeni bir araç öğrenmesine gerek kalmaz.
- Ayarlanabilir katılık: Ekipler, geçme eşiğini gevşetebilir veya sıkılaştırabilir ya da yüksek riskli içerik için katı bir geçti/kaldı moduna geçebilir.
- Her sonuç için açıklamalar: Her karar bir neden ile birlikte gelir, böylece bir çıktının neden işaretlendiği açıktır.
YZ halüsinasyonu nedir?
YZ halüsinasyonları, tutarlı görünen ancak olgusal olmayan çıktılardır. Model, kaynak bağlamı veya eğitim verisi bunları desteklemese bile bu iddiaları güvenle üretir. Konuyla ilgili bir anket, bunu modellerin sağlanan bağlamdan doğrulanabilir kanıtlar yerine dilsel önceliklere dayanmasına bağlıyor.4 Sorun, sağlık hizmetleri, hukuk hizmetleri, kurumsal arama ve müşteri desteği gibi yüksek riskli alanlarda ortaya çıkıyor; bu nedenle dayanaklandırılmış çıktı tespiti, LLM dağıtımının standart bir parçası haline geldi.
Halüsinasyonların kaynakları ve sınıflandırması
Halüsinasyonlar iki geniş kaynaktan kaynaklanır. Model içi faktörler arasında istatistiksel örüntülere aşırı güven, eğitim verisindeki boşluklar ve dizi oluşturmanın olasılıksal doğası bulunur; halüsinasyon tespiti ve azaltılmasına yönelik bir analiz, LLM'lerin genellikle doğrulanabilir kanıtlar getirmek yerine olası devamları çıkarım yaptığını ve bunun da kendinden emin ancak yanlış çıktı ürettiğini belirtiyor.5
Bağlamsal faktörler, RAG sistemlerindeki geri getirme hatalarını, belirsiz istemleri, eksik dayanaklandırmayı ve multimodal modellerde nesne karışıklıklarını veya uydurulmuş sahne ayrıntılarını kapsar.
Ajan iş akışlarında halüsinasyon tespiti
Çok adımlı ajanlar, tek etkileşimli LLM'lerin sahip olmadığı halüsinasyon risklerini beraberinde getirir: erken bir adımdaki uydurulmuş bir iddia, daha sonraki araç çağrılarına, geri getirmelere ve nihai çıktılara yayılır.
Ajan halüsinasyon tespitindeki temel zorluklar:
- Hata yayılımı: Planlama aşamasındaki uydurulmuş bir olgu, araç seçimini, veri alımını ve nihai yanıtları etkileyebilir
- Araç çağrısı halüsinasyonları: Ajanlar, araçları yanlış parametrelerle çağırabilir veya araç çıktılarını yanlış yorumlayabilir
- Durum bozulması: Ajan belleğinde depolanan halüsinasyonlu bilgiler, gelecekteki yürütme adımlarını etkiler
- Atıf karmaşıklığı: Halüsinasyonun hangi adımda ortaya çıktığını belirlemek, uçtan uca izleme gerektirir
Ajan sistemleri için tespit yaklaşımları:
- Adım düzeyinde doğrulama: Ajan bir sonraki eyleme geçmeden önce her ara çıktının doğrulanması
- Araç çıktısı doğrulaması: Araç yanıtlarının beklenen formatlar ve bilinen kısıtlamalarla çapraz kontrol edilmesi
- Yörünge analizi: Yürütmenin dayanaklandırılmış bilgiden nerede saptığını belirlemek için ajan kararlarının tam dizisinin incelenmesi
- Adımlar arası tutarlılık kontrolleri: Çelişkileri tespit etmek için farklı aşamalarda yapılan iddiaların karşılaştırılması
W&B Weave'in HallucinationFree Puanlayıcısı ve Arize Phoenix'in HallucinationEvaluator'ı her ajan adımına uygulanabilirken, entegre panoları kök neden analizi için tam yürütme izini görüntüler.
Gerçek zamanlı halüsinasyon önleme
Üretim sonrası tespit, sorunları ortaya çıkarır ancak kötü çıktıların kullanıcılara ulaşmasını engellemez. Gerçek zamanlı önleme, kontrolü yanıt teslim edilmeden önce satır içi olarak çalıştırır.
Önleme mekanizmaları:
- Çıktı korkulukları: Oluşturulan içeriği kullanıcıya döndürmeden önce olgusallık kriterlerine göre analiz eden filtreler.
- Güven eşikleri: Modelin dahili güveni kabul edilebilir seviyelerin altına düştüğünde yanıtları engelleme veya işaretleme.
- Geri getirme doğrulama kapıları: Yanıtı sonlandırmadan önce, oluşturulan iddiaların alınan belgeler tarafından desteklendiğinin doğrulanması.
- Geri dönüş stratejileri: Halüsinasyon riski yüksek olduğunda güvenli bir varsayılan yanıt döndürme veya inceleme kuyruklarına yönlendirme.
Gerçek zamanlı önleme için araç yetenekleri:
- W&B Weave, halüsinasyon puanlamasını üretim pipeline'larına entegre ederek, yanıtlar sunulmadan önce otomatik kontroller sağlar.
- Arize Phoenix, yüksek riskli çıktıları anında inceleme için işaretleyen uyarı yetenekleriyle gerçek zamanlı izleme sağlar.
- Comet Opik, otomatik değerlendirme ile deney takibi sunarak ekiplerin halüsinasyon eşiklerini aşan yanıtları engelleyen kalite kapıları kurmasına olanak tanır.
Halüsinasyon tespitine yönelik yaklaşımlar
Weave, Phoenix ve Opik'in nasıl çalıştığıyla doğrudan ilgili üç yaklaşım vardır:
1. Tutarlılığa dayalı yöntemler
Tutarlılığa dayalı yöntemler, bir yanıtı anlamsal benzerlik, n-gram örtüşmesi veya soru-cevap doğrulaması kullanarak birkaç alternatif üretimle karşılaştırarak değerlendirir. Yanıtlar birbiriyle çeliştiğinde veya mantıksal tutarsızlıklar içerdiğinde, halüsinasyon olasılığı artar. İlgili bir teknik olan semantik entropi, yanıtları ifade yerine anlama göre kümelendirir ve kavramsal istikrarsızlığı halüsinasyon sinyali olarak kullanır.
2. Olasılığa ve güvene dayalı tespit
Token düzeyindeki olasılıklar, entropi değerleri, kalibrasyon eğrileri ve marja dayalı güven tahminleri, modelin kendi çıktısı hakkındaki dahili inancını ortaya çıkarır. Düşük güvenli segmentler genellikle daha yüksek halüsinasyon oranlarıyla ilişkilidir. Ham entropi, değişken ifade nedeniyle yanıltıcı olabilir, ancak güven sinyalleri tutarlılık tabanlı göstergelerle birleştirildiğinde faydalı kalır. Arize Phoenix, etiketinin yanında bir güven skoru sunar ve bu da bu kategoriye uyar.
3. Referans veya bağlam temelli tespit
Referans tabanlı değerlendirme, modelin çıktısını sağlanan bağlam veya harici kaynaklarla karşılaştırır ve RAG kalite kontrollerinin arkasındaki temel mekanizmadır. Tipik teknikler, alınan belgelerin yanıtı destekleyip desteklemediğini kontrol eden gerektirim modellerini, kanıt desteğini doğrulayan hizalama ve dayanaklandırma yöntemlerini ve iddiaların destekleyici metinle eşleşip eşleşmediğini ölçen olgusallık metriklerini içerir. Kıyaslanan üç araç da öncelikle bu modda çalışır: bir bağlam girdisi alırlar ve çıktının bunun içinde kalıp kalmadığına karar verirler.
YZ halüsinasyon tespit teknikleri ve algoritmaları
Tespit yöntemleri üç ayrıntı düzeyinde çalışır:
- Token düzeyinde: Bir çıktı içindeki şüpheli kısımları işaretler. İnsan açıklamalı halüsinasyon veri kümelerini, bağlam verildiğinde önceki ve sonraki token olasılıkları arasındaki sapmayı veya dizi etiketleme sınıflandırıcılarını kullanır.
- Cümle düzeyinde: Tüm ifadeleri yargılar. Örnekleme tabanlı öz-tutarlılık kontrolleri, istikrarsızlık için birden fazla üretimi karşılaştırır, semantik entropi etiketler olmadan kavramsal belirsizliği işaretler ve gerektirim sınıflandırıcıları desteklenmeyen veya çelişkili iddiaları yakalar.
- İş akışı düzeyinde: Köken grafikleri, adım düzeyinde gerektirim kontrolleri, ara yürütme doğrulaması ve çok adımlı görevler için bağımlılık izleme kullanarak çok adımlı pipeline'ları takip eder.
Kıyasladığımız üç araç, öncelikle cümle düzeyinde çalışır; Weave ve Phoenix, izleme panoları aracılığıyla iş akışı düzeyinde kullanıma da uzanır.
Endüstriyel örüntüler ve en iyi uygulamalar
Üretim ekipleri nadiren tek bir yönteme güvenir. Yaygın örüntüler şunları içerir:
- Katmanlı tespit: Aynı pipeline içinde tutarlılık kontrolleri, olasılık puanlaması ve gerektirim doğrulaması çalışır.
- Gerçek zamanlı izleme: Panolar, zaman içindeki sapmayı ve güven değişimlerini takip eder.
- İstem ayarı: İstemler, dayanaksız çıktılara yol açan belirsizliği azaltmak için rafine edilir.
- Uzman incelemesi: Hataların gerçek maliyet taşıdığı hukuki, tıbbi veya finansal içerik için ayrılmıştır.
- CI/CD entegrasyonu: Otomatik kalite kontrolleri dağıtımdan önce çalışır, böylece gerilemeler erken ortaya çıkar.
- Ajan izleme: Eklentiler, anormallikleri ortaya çıktıkça yakalamak için araç çağrılarını ve ara yürütme adımlarını gözlemler.
YZ halüsinasyon tespit araçları kıyaslama metodolojisi
Kıyaslama, olgusal Soru-Cevap senaryolarından alınan 50 bilgi öğesinden oluşan kontrollü bir veri kümesi kullandı. Her öğe bir kaynak bağlamı, bir soru, bu bağlama dayalı doğru bir yanıt ve uydurulmuş bilgi içeren halüsinasyonlu bir yanıt içeriyordu. Örneğin, bir testte The Oberoi Group'un merkez ofisinin konumu soruldu; burada doğru yanıt "Delhi", halüsinasyonlu yanıt olan "Mumbai"ye karşı test edildi.
Her bilgi öğesi iki test senaryosu oluşturdu: biri doğru yanıtı kullanan (beklenen: halüsinasyon yok) ve biri halüsinasyonlu yanıtı kullanan (beklenen: halüsinasyon tespit edildi). Bu, toplam 100 test senaryosu ile dengeli bir 50/50 bölünme oluşturdu. Her üç araç da aynı test senaryolarını sırayla işledi ve her biri aynı girdileri (bağlam, soru ve çıktı) aldı.
Adil bir karşılaştırma sağlamak için her test senaryosu için gecikmeyi ayrı ayrı ölçtük; sonuçları çarpıtabilecek paralel işleme veya toplu değerlendirme tuzaklarından kaçındık. Gerçek referans etiketleri, doğru pozitiflerin, yanlış pozitiflerin, doğru negatiflerin ve yanlış negatiflerin hesaplanmasında doğruluğu sağlamak için manuel olarak doğrulandı.
Bu araştırmayı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{ermut2026,
author = {Ermut, Sıla and Şipi, Nazlı},
title = {{YZ Halüsinasyon Tespit Araçları: W&B Weave & Comet}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/ai-hallucination-detection}},
note = {AIMultiple. Erişim tarihi: 18 Haziran 2026}
}
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.