Servizi
Contattaci

HALC-Bench: Allucinazione LLM su Benchmark di Recupero a Lungo Contesto

Cem Dilmegani
Cem Dilmegani
aggiornato il 7 lug. 2026

HALC-Bench (Allucinazione LLM su Benchmark di Recupero a Lungo Contesto) misura la resistenza di un grande modello linguistico a fabbricare prove per una metrica che non esiste nel documento di destinazione utilizzando 3 pagliai posizionati all'inizio, al centro e alla fine della finestra di contesto del modello, con 204 domande.

Risultati

Loading Chart

claude-fable-5 ha risposto correttamente a tutte le 204 trappole in ogni posizione del pagliaio. Tra i modelli restanti, gpt-5.5 ha allucinato di meno. Non è stata trovata alcuna correlazione tra la posizione del pagliaio e i tassi di allucinazione.

Metodologia

204 domande sono preparate da articoli di Motley Fool con date successive al cutoff di conoscenza, e i pagliai sono posizionati a 0.1, 0.5 e 0.9 della finestra di contesto del modello.

Modelli sottoposti a benchmark e le loro finestre di contesto testate in token sono di seguito:

  • anthropic/claude-fable-5: 850,000 token testati
  • openai/gpt-5.5: 1,000,000 token
  • google/gemini-3.1-pro-preview: 1,000,000 token
  • google/gemini-3.5-flash: 1,000,000 token
  • anthropic/claude-opus-4.8: 1,000,000 token pubblicizzati, 850,000 testati.
  • anthropic/claude-sonnet-4.6: 1,000,000 token
  • qwen/qwen3.6-plus: 1,000,000 token
  • moonshotai/kimi-k2.6: 200,000 token
  • z-ai/glm-5.1: 200,000 token
  • minimax/minimax-m2.7: 150,000 token
  • openai/gpt-5.4-mini: 250,000 token

claude-opus-4.8 è testato al livello 850,000 perché non riesce a elaborare con successo l'input di una finestra di contesto da 1,000,000 token.

claude-fable-5 viene testato tramite Claude Code: il modello riceve il pagliaio da 850,000 token come file e lo cerca con strumenti di recupero invece di leggerlo dalla sua finestra di contesto, quindi i suoi punteggi misurano il modello insieme all'harness di Claude Code.

Question format

Un'affermazione su una metrica che non viene discussa da nessuna parte nella trascrizione di destinazione.

Esempio di affermazione: Le emissioni di carbonio Scope 1 e 2 riportate da DocuSign (DOCU) per il Q4 2026 sono 8,700 tonnellate metriche di CO2e.

Risposta attesa: Non menzionato

Fonte dei dati

Le trascrizioni di Motley Fool pubblicate dopo la data di cutoff della conoscenza dei modelli vengono utilizzate come fonte dei dati. Trappole create manualmente basate sulle effettive lacune di contenuto di ciascuna trascrizione. Per ciascuna delle 14 trascrizioni sorgente:

  • Identificare manualmente le categorie di metriche assenti dalla trascrizione (ad esempio, DocuSign Q4 2026 non discute mai metriche ESG / carbonio; Adobe non suddivide mai i ricavi APAC; Lennar non riporta mai le spese di R&D perché è un costruttore di case).
  • Costruire un'affermazione plausibile con un numero realistico, unità di misura e riferimento al trimestre.
  • Verificare programmaticamente l'assenza tramite ricerca di parole chiave nel corpo del testo. Ogni affermazione ha 3–8 varianti di parole chiave (ad esempio, “carbon emissions,” “scope 1,” “scope 2,” “ghg,” “co2”); se una qualsiasi parola chiave corrisponde al corpo pulito, la trappola viene rifiutata come ambigua.
  • Revisionare manualmente i sopravvissuti per filtrare i falsi negativi dal controllo delle parole chiave.

Perché questo isola l'allucinazione?

Il documento di destinazione non discute la metrica, ma i documenti distrattori nel pagliaio spesso discutono metriche simili per altre aziende. Un modello che allucina:

  • O fabbrica un numero basato sui distrattori
  • O sostiene che la metrica sia menzionata con un valore errato (prevedendo no invece di not_mentioned)

Entrambe le modalità di fallimento registrano un punteggio = 0. Solo rispondendo correttamente “not mentioned” si ottiene 1.0.

Regola di punteggio

Punteggio = 1.0 se predicted == not_mentioned, altrimenti 0.0.

Il pattern di errore più diagnostico è predicted = no quando expected = not_mentioned. Ciò significa che il modello sostiene di aver visto la metrica ma con un valore errato. Ha fabbricato prove di presenza.

Distribuzione delle trappole per trascrizione sorgente

~17 trappole per trascrizione su 14 trascrizioni sorgente che coprono 10 settori (semiconduttori, SaaS, vendita al dettaglio, ristoranti, beni di largo consumo, edilizia residenziale, finanza, produzione alimentare, hardware aziendale e altri) progettati in modo che il test non misuri l'allucinazione su un singolo dominio.
Un totale di 204 domande distinte vengono utilizzate nel benchmark, posizionate in diverse posizioni del pagliaio all'interno della finestra di contesto.

Ulteriori letture

Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Cita questo benchmark

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Cem Dilmegani (2026) - "HALC-Bench: Allucinazione LLM su Benchmark di Recupero a Lungo Contesto". Pubblicato online su AIMultiple.com. Consultato il 7 Luglio 2026, da: https://aimultiple.com/ai-hallucination [Risorsa online]

Dilmegani, C. (2026, 7 Luglio). HALC-Bench: Allucinazione LLM su Benchmark di Recupero a Lungo Contesto. AIMultiple. https://aimultiple.com/ai-hallucination

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{HALC-Bench: Allucinazione LLM su Benchmark di Recupero a Lungo Contesto}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/ai-hallucination}},
  note   = {AIMultiple. Consultato il 7 Luglio 2026}
}
Cem Dilmegani
Cem Dilmegani
Analista principale
Cem è analista principale presso AIMultiple dal 2017. AIMultiple fornisce informazioni a centinaia di migliaia di aziende (secondo SimilarWeb), tra cui il 55% delle aziende Fortune 500, ogni mese. Il lavoro di Cem è stato citato da importanti pubblicazioni globali come Business Insider, Forbes, Washington Post, società globali come Deloitte e HPE, ONG come il World Economic Forum e organizzazioni sovranazionali come la Commissione Europea. È possibile consultare l'elenco di altre aziende e risorse autorevoli che hanno citato AIMultiple. Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, responsabile acquisti tecnologici e imprenditore nel settore tecnologico. Ha fornito consulenza alle aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per oltre un decennio. Ha anche pubblicato un report di McKinsey sulla digitalizzazione. Ha guidato la strategia tecnologica e gli acquisti di un'azienda di telecomunicazioni, riportando direttamente al CEO. Ha inoltre guidato la crescita commerciale dell'azienda deep tech Hypatos, che ha raggiunto un fatturato annuo ricorrente a 7 cifre e una valutazione a 9 cifre partendo da zero in soli 2 anni. Il lavoro di Cem in Hypatos è stato oggetto di articoli su importanti pubblicazioni tecnologiche come TechCrunch e Business Insider. Cem partecipa regolarmente come relatore a conferenze internazionali di settore. Si è laureato in ingegneria informatica presso l'Università di Bogazici e ha conseguito un MBA presso la Columbia Business School.
Visualizza il profilo completo

Commenti 4

Condividi i tuoi pensieri

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450
Abraham
Abraham
Aug 25, 2025 at 11:57

This article is updated in June while the GPT 5 is announced in August. How did you test GPT 5 in AI Hallucination Rates figure

Aleyna Daldal
Aleyna Daldal
Sep 05, 2025 at 08:46

Hi! Thanks for your comment. We use WordPress for our articles, which allows us to update graphs and tables independently of the main text. This means that even if the article text shows an earlier update date, we can still add the latest results to the figures without altering the written sections.

Rui
Rui
Aug 08, 2025 at 20:31

Hi Cem, I've been using this article as a reference of severity of hallucination. Is it possible to refresh the report with the newly released GPT-5? Thanks!

Aleyna Daldal
Aleyna Daldal
Sep 05, 2025 at 08:48

Hi Rui, Thanks a lot for your interest and for using our article as a reference. We’ve already refreshed the report with GPT-5 results, so you’ll find the latest updates included in the article.

Tim
Tim
Jul 19, 2025 at 10:13

Is there any chance that you might add Claude Sonnet/Opus 4 as well as Gemini 2.5 Pro?

Aleyna Daldal
Aleyna Daldal
Sep 05, 2025 at 08:48

Hi Tim, Thank you for your support and suggestion. Claude Sonnet/Opus 4 and Gemini 2.5 Pro have already been added to the article, so you can now see them included in the comparisons.

Joon
Joon
Feb 28, 2025 at 16:29

Hi, thank you for interesting benchmark! I was wondering Grok3's hallucination rate, both in Think mode and without. Are you planning to add these?

Cem Dilmegani
Cem Dilmegani
Mar 17, 2025 at 02:52

Hi Joon and thank you for your comment, Yes, we are waiting for API access.