Dienstleistungen
Kontaktieren

HALC-Bench: LLM Halluzination bei Langkontext-Retrieval-Benchmark

Cem Dilmegani
Cem Dilmegani
aktualisiert am 7. Juli 2026

HALC-Bench (LLM Halluzination bei Langkontext-Retrieval-Benchmark) misst die Beständigkeit eines großen Sprachmodells gegenüber der Erfindung von Belegen für eine Metrik, die im Zieldokument nicht existiert, indem 3 Heuhaufen am Anfang, in der Mitte und am Ende des Kontextfensters des Modells platziert werden, mit 204 Fragen.

Ergebnisse

Loading Chart

claude-fable-5 beantwortete alle 204 Fallen an jeder Heuhaufenposition korrekt. Unter den verbleibenden Modellen halluzinierte gpt-5.5 am wenigsten. Es wurde kein Zusammenhang zwischen Heuhaufenposition und Halluzinationsraten gefunden.

Methodik

204 Fragen werden aus Motley Fool-Artikeln mit Datumsangaben nach dem Wissensstichtag erstellt, und die Heuhaufen werden bei 0.1, 0.5 und 0.9 des Kontextfensters des Modells positioniert.

Die getesteten Modelle und ihre getesteten Kontextfenstergrößen in Tokens sind unten aufgeführt:

  • anthropic/claude-fable-5: 850,000 Tokens getestet
  • openai/gpt-5.5: 1,000,000 Tokens
  • google/gemini-3.1-pro-preview: 1,000,000 Tokens
  • google/gemini-3.5-flash: 1,000,000 Tokens
  • anthropic/claude-opus-4.8: 1,000,000 Tokens angekündigt, 850,000 getestet.
  • anthropic/claude-sonnet-4.6: 1,000,000 Tokens
  • qwen/qwen3.6-plus: 1,000,000 Tokens
  • moonshotai/kimi-k2.6: 200,000 Tokens
  • z-ai/glm-5.1: 200,000 Tokens
  • minimax/minimax-m2.7: 150,000 Tokens
  • openai/gpt-5.4-mini: 250,000 Tokens

claude-opus-4.8 wird auf der 850,000-Stufe getestet, da es einen Test mit einem 1,000,000-Token-Kontextfenster nicht erfolgreich durchführen kann.

claude-fable-5 wird über Claude Code getestet: Das Modell erhält den 850,000-Token-Heuhaufen als Datei und durchsucht ihn mit Retrieval-Tools, anstatt ihn aus seinem Kontextfenster zu lesen, sodass die Bewertungen das Modell zusammen mit dem Claude Code-Harness messen.

Question format

Eine Behauptung über eine Metrik, die nirgendwo im Zieltranskript diskutiert wird.

Beispielbehauptung: Die Scope-1- und Scope-2-Kohlenstoffemissionen, die von DocuSign (DOCU) für Q4 2026 gemeldet wurden, betragen 8,700 Tonnen CO2e.

Erwartete Antwort: Nicht erwähnt

Datenquelle

Als Datenquelle dienen Motley Fool-Transkripte, die nach dem Wissensstichtag der Modelle veröffentlicht wurden. Handgefertigte Fallen basierend auf den tatsächlichen Inhaltslücken jedes Transkripts. Für jedes der 14 Quelltranskripte:

  • Manuelles Identifizieren von Metrikkategorien, die im Transkript fehlen (z. B. DocuSign Q4 2026 diskutiert niemals ESG-/Kohlenstoffmetriken; Adobe schlüsselt nie den APAC-Umsatz auf; Lennar weist nie F&E-Aufwendungen aus, da es sich um einen Hausbauer handelt).
  • Konstruktion einer plausibel klingenden Behauptung mit einer realistischen Zahl, Einheiten und Quartalsangabe.
  • Programmatische Überprüfung der Abwesenheit durch Schlüsselwortsuche im Haupttext. Jede Behauptung hat 3–8 Schlüsselwortvarianten (z. B. „Kohlenstoffemissionen“, „Scope 1“, „Scope 2“, „GHG“, „CO2“); wenn ein Schlüsselwort im bereinigten Text gefunden wird, wird die Falle als mehrdeutig abgelehnt.
  • Manuelle Überprüfung der verbleibenden Fallen, um falsche Negativbefunde aus der Schlüsselwortprüfung herauszufiltern.

Warum isoliert dies Halluzination?

Das Zieldokument behandelt die Metrik nicht, aber Ablenkungsdokumente im Heuhaufen diskutieren häufig ähnliche Metriken für andere Unternehmen. Ein Modell, das halluziniert, wird:

  • Entweder eine Zahl basierend auf den Ablenkern erfinden
  • Oder behaupten, die Metrik werde mit einem falschen Wert erwähnt (Vorhersage „no“ anstelle von „not_mentioned“)

Beide Fehlermodi werden als Wertung 0 registriert. Nur die korrekte Antwort „nicht erwähnt“ ergibt eine Wertung von 1.0.

Bewertungsregel

Punktzahl = 1.0, wenn vorhergesagt == nicht_erwähnt, sonst 0.0.

Das aussagekräftigste Fehlermuster ist vorhergesagt = no, wenn erwartet = nicht_erwähnt. Das bedeutet, das Modell behauptet, die Metrik gesehen zu haben, aber mit einem falschen Wert. Es hat Belege für das Vorhandensein erfunden.

Fallenverteilung nach Quelltranskript

~17 Fallen pro Transkript über 14 Quelltranskripte verteilt, die 10 Branchen abdecken (Halbleiter, SaaS, Einzelhandel, Restaurants, Konsumgüter, Hausbau, Finanzen, Lebensmittelproduktion, Unternehmenshardware und andere), so konzipiert, dass der Test keine Halluzination in einem einzigen Bereich misst.
Insgesamt werden 204 verschiedene Fragen im Benchmark verwendet, die über verschiedene Heuhaufenpositionen innerhalb des Kontextfensters verteilt sind.

Weiterführende Literatur

Lassen Sie unser Team einen Ihrer Geschäftsprozesse kostenlos mit KI-Agenten automatisieren.
Einen Prozess automatisieren

Zitieren Sie diesen Benchmark

Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.

Cem Dilmegani (2026) - "HALC-Bench: LLM Halluzination bei Langkontext-Retrieval-Benchmark". Online veröffentlicht auf AIMultiple.com. Abgerufen am 7. Juli 2026, von: https://aimultiple.com/ai-hallucination [Online-Ressource]

Dilmegani, C. (2026, 7. Juli). HALC-Bench: LLM Halluzination bei Langkontext-Retrieval-Benchmark. AIMultiple. https://aimultiple.com/ai-hallucination

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{HALC-Bench: LLM Halluzination bei Langkontext-Retrieval-Benchmark}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/ai-hallucination}},
  note   = {AIMultiple. Abgerufen am 7. Juli 2026}
}
Cem Dilmegani
Cem Dilmegani
Leitender Analyst
Cem ist seit 2017 leitender Analyst bei AIMultiple. AIMultiple informiert monatlich Hunderttausende von Unternehmen (laut similarWeb), darunter 55 % der Fortune 500. Cems Arbeit wurde von führenden globalen Publikationen wie Business Insider, Forbes und der Washington Post, von globalen Unternehmen wie Deloitte und HPE sowie von NGOs wie dem Weltwirtschaftsforum und supranationalen Organisationen wie der Europäischen Kommission zitiert. Weitere namhafte Unternehmen und Ressourcen, die AIMultiple referenziert haben, finden Sie hier. Im Laufe seiner Karriere war Cem als Technologieberater, Technologieeinkäufer und Technologieunternehmer tätig. Über ein Jahrzehnt lang beriet er Unternehmen bei McKinsey & Company und Altman Solon in ihren Technologieentscheidungen. Er veröffentlichte außerdem einen McKinsey-Bericht zur Digitalisierung. Bei einem Telekommunikationsunternehmen leitete er die Technologiestrategie und -beschaffung und berichtete direkt an den CEO. Darüber hinaus verantwortete er das kommerzielle Wachstum des Deep-Tech-Unternehmens Hypatos, das innerhalb von zwei Jahren von null auf einen siebenstelligen jährlichen wiederkehrenden Umsatz und eine neunstellige Unternehmensbewertung kam. Cems Arbeit bei Hypatos wurde von führenden Technologiepublikationen wie TechCrunch und Business Insider gewürdigt. Er ist ein gefragter Redner auf internationalen Technologiekonferenzen. Cem absolvierte sein Studium der Informatik an der Bogazici-Universität und besitzt einen MBA der Columbia Business School.
Vollständiges Profil anzeigen

Kommentare 4

Teilen Sie Ihre Gedanken

Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.

0/450
Abraham
Abraham
Aug 25, 2025 at 11:57

This article is updated in June while the GPT 5 is announced in August. How did you test GPT 5 in AI Hallucination Rates figure

Aleyna Daldal
Aleyna Daldal
Sep 05, 2025 at 08:46

Hi! Thanks for your comment. We use WordPress for our articles, which allows us to update graphs and tables independently of the main text. This means that even if the article text shows an earlier update date, we can still add the latest results to the figures without altering the written sections.

Rui
Rui
Aug 08, 2025 at 20:31

Hi Cem, I've been using this article as a reference of severity of hallucination. Is it possible to refresh the report with the newly released GPT-5? Thanks!

Aleyna Daldal
Aleyna Daldal
Sep 05, 2025 at 08:48

Hi Rui, Thanks a lot for your interest and for using our article as a reference. We’ve already refreshed the report with GPT-5 results, so you’ll find the latest updates included in the article.

Tim
Tim
Jul 19, 2025 at 10:13

Is there any chance that you might add Claude Sonnet/Opus 4 as well as Gemini 2.5 Pro?

Aleyna Daldal
Aleyna Daldal
Sep 05, 2025 at 08:48

Hi Tim, Thank you for your support and suggestion. Claude Sonnet/Opus 4 and Gemini 2.5 Pro have already been added to the article, so you can now see them included in the comparisons.

Joon
Joon
Feb 28, 2025 at 16:29

Hi, thank you for interesting benchmark! I was wondering Grok3's hallucination rate, both in Think mode and without. Are you planning to add these?

Cem Dilmegani
Cem Dilmegani
Mar 17, 2025 at 02:52

Hi Joon and thank you for your comment, Yes, we are waiting for API access.