HALC-Bench: Allucinazione LLM su Benchmark di Recupero a Lungo Contesto
HALC-Bench (Allucinazione LLM su Benchmark di Recupero a Lungo Contesto) misura la resistenza di un grande modello linguistico a fabbricare prove per una metrica che non esiste nel documento di destinazione utilizzando 3 pagliai posizionati all'inizio, al centro e alla fine della finestra di contesto del modello, con 204 domande.
Risultati
claude-fable-5 ha risposto correttamente a tutte le 204 trappole in ogni posizione del pagliaio. Tra i modelli restanti, gpt-5.5 ha allucinato di meno. Non è stata trovata alcuna correlazione tra la posizione del pagliaio e i tassi di allucinazione.
Metodologia
204 domande sono preparate da articoli di Motley Fool con date successive al cutoff di conoscenza, e i pagliai sono posizionati a 0.1, 0.5 e 0.9 della finestra di contesto del modello.
Modelli sottoposti a benchmark e le loro finestre di contesto testate in token sono di seguito:
- anthropic/claude-fable-5: 850,000 token testati
- openai/gpt-5.5: 1,000,000 token
- google/gemini-3.1-pro-preview: 1,000,000 token
- google/gemini-3.5-flash: 1,000,000 token
- anthropic/claude-opus-4.8: 1,000,000 token pubblicizzati, 850,000 testati.
- anthropic/claude-sonnet-4.6: 1,000,000 token
- qwen/qwen3.6-plus: 1,000,000 token
- moonshotai/kimi-k2.6: 200,000 token
- z-ai/glm-5.1: 200,000 token
- minimax/minimax-m2.7: 150,000 token
- openai/gpt-5.4-mini: 250,000 token
claude-opus-4.8 è testato al livello 850,000 perché non riesce a elaborare con successo l'input di una finestra di contesto da 1,000,000 token.
claude-fable-5 viene testato tramite Claude Code: il modello riceve il pagliaio da 850,000 token come file e lo cerca con strumenti di recupero invece di leggerlo dalla sua finestra di contesto, quindi i suoi punteggi misurano il modello insieme all'harness di Claude Code.
Question format
Un'affermazione su una metrica che non viene discussa da nessuna parte nella trascrizione di destinazione.
Esempio di affermazione: Le emissioni di carbonio Scope 1 e 2 riportate da DocuSign (DOCU) per il Q4 2026 sono 8,700 tonnellate metriche di CO2e.
Risposta attesa: Non menzionato
Fonte dei dati
Le trascrizioni di Motley Fool pubblicate dopo la data di cutoff della conoscenza dei modelli vengono utilizzate come fonte dei dati. Trappole create manualmente basate sulle effettive lacune di contenuto di ciascuna trascrizione. Per ciascuna delle 14 trascrizioni sorgente:
- Identificare manualmente le categorie di metriche assenti dalla trascrizione (ad esempio, DocuSign Q4 2026 non discute mai metriche ESG / carbonio; Adobe non suddivide mai i ricavi APAC; Lennar non riporta mai le spese di R&D perché è un costruttore di case).
- Costruire un'affermazione plausibile con un numero realistico, unità di misura e riferimento al trimestre.
- Verificare programmaticamente l'assenza tramite ricerca di parole chiave nel corpo del testo. Ogni affermazione ha 3–8 varianti di parole chiave (ad esempio, “carbon emissions,” “scope 1,” “scope 2,” “ghg,” “co2”); se una qualsiasi parola chiave corrisponde al corpo pulito, la trappola viene rifiutata come ambigua.
- Revisionare manualmente i sopravvissuti per filtrare i falsi negativi dal controllo delle parole chiave.
Perché questo isola l'allucinazione?
Il documento di destinazione non discute la metrica, ma i documenti distrattori nel pagliaio spesso discutono metriche simili per altre aziende. Un modello che allucina:
- O fabbrica un numero basato sui distrattori
- O sostiene che la metrica sia menzionata con un valore errato (prevedendo no invece di not_mentioned)
Entrambe le modalità di fallimento registrano un punteggio = 0. Solo rispondendo correttamente “not mentioned” si ottiene 1.0.
Regola di punteggio
Punteggio = 1.0 se predicted == not_mentioned, altrimenti 0.0.
Il pattern di errore più diagnostico è predicted = no quando expected = not_mentioned. Ciò significa che il modello sostiene di aver visto la metrica ma con un valore errato. Ha fabbricato prove di presenza.
Distribuzione delle trappole per trascrizione sorgente
~17 trappole per trascrizione su 14 trascrizioni sorgente che coprono 10 settori (semiconduttori, SaaS, vendita al dettaglio, ristoranti, beni di largo consumo, edilizia residenziale, finanza, produzione alimentare, hardware aziendale e altri) progettati in modo che il test non misuri l'allucinazione su un singolo dominio.
Un totale di 204 domande distinte vengono utilizzate nel benchmark, posizionate in diverse posizioni del pagliaio all'interno della finestra di contesto.
Ulteriori letture
- Benchmark di Codice IA: LMC-Eval
- LLM Prezzi: Confronto tra i Principali Fornitori
- Benchmark di Memoria IA
- Prestazioni degli Agenti IA: Tassi di Successo e ROI
Cita questo benchmark
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{HALC-Bench: Allucinazione LLM su Benchmark di Recupero a Lungo Contesto}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/ai-hallucination}},
note = {AIMultiple. Consultato il 7 Luglio 2026}
}
Commenti 4
Condividi i tuoi pensieri
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.
This article is updated in June while the GPT 5 is announced in August. How did you test GPT 5 in AI Hallucination Rates figure
Hi! Thanks for your comment. We use WordPress for our articles, which allows us to update graphs and tables independently of the main text. This means that even if the article text shows an earlier update date, we can still add the latest results to the figures without altering the written sections.
Hi Cem, I've been using this article as a reference of severity of hallucination. Is it possible to refresh the report with the newly released GPT-5? Thanks!
Hi Rui, Thanks a lot for your interest and for using our article as a reference. We’ve already refreshed the report with GPT-5 results, so you’ll find the latest updates included in the article.
Is there any chance that you might add Claude Sonnet/Opus 4 as well as Gemini 2.5 Pro?
Hi Tim, Thank you for your support and suggestion. Claude Sonnet/Opus 4 and Gemini 2.5 Pro have already been added to the article, so you can now see them included in the comparisons.
Hi, thank you for interesting benchmark! I was wondering Grok3's hallucination rate, both in Think mode and without. Are you planning to add these?
Hi Joon and thank you for your comment, Yes, we are waiting for API access.