HALC-Bench: LLM Alucinação em Benchmark de Recuperação de Longo Contexto
HALC-Bench (LLM Alucinação em Benchmark de Recuperação de Longo Contexto) mede a resistência de um modelo de linguagem grande a fabricar evidências para uma métrica que não existe no documento alvo usando 3 palheiros colocados no início, no meio e no final da janela de contexto do modelo, com 204 perguntas.
Resultados
claude-fable-5 respondeu corretamente a todas as 204 armadilhas em cada posição do palheiro. Entre os modelos restantes, gpt-5.5 alucinou menos. Não foi encontrada correlação entre a posição do palheiro e as taxas de alucinação.
Metodologia
204 perguntas são preparadas a partir de artigos do Motley Fool com datas posteriores ao corte de conhecimento, e os palheiros são posicionados em 0.1, 0.5 e 0.9 da janela de contexto do modelo.
Modelos avaliados, e suas janelas de contexto testadas em tokens estão abaixo:
- anthropic/claude-fable-5: 850,000 tokens testados
- openai/gpt-5.5: 1,000,000 tokens
- google/gemini-3.1-pro-preview: 1,000,000 tokens
- google/gemini-3.5-flash: 1,000,000 tokens
- anthropic/claude-opus-4.8: 1,000,000 tokens anunciados, 850,000 testados.
- anthropic/claude-sonnet-4.6: 1,000,000 tokens
- qwen/qwen3.6-plus: 1,000,000 tokens
- moonshotai/kimi-k2.6: 200,000 tokens
- z-ai/glm-5.1: 200,000 tokens
- minimax/minimax-m2.7: 150,000 tokens
- openai/gpt-5.4-mini: 250,000 tokens
claude-opus-4.8 é testado na faixa de 850,000 tokens porque não consegue receber a entrada de testes com janela de contexto de 1,000,000 tokens com sucesso.
claude-fable-5 é testado através do Claude Code: o modelo recebe o palheiro de 850,000 tokens como um arquivo e o pesquisa com ferramentas de recuperação em vez de lê-lo da sua janela de contexto, portanto suas pontuações medem o modelo juntamente com o harness do Claude Code.
Question format
Uma alegação sobre uma métrica que não é discutida em nenhum lugar na transcrição alvo.
Exemplo de alegação: As emissões de carbono de Escopo 1 e 2 reportadas pela DocuSign (DOCU) para o Q4 2026 são 8,700 toneladas métricas de CO2e.
Resposta esperada: Não mencionado
Fonte de dados
Transcrições do Motley Fool publicadas após a data de corte de conhecimento dos modelos são usadas como fonte de dados. Armadilhas elaboradas manualmente com base nas lacunas reais de conteúdo de cada transcrição. Para cada uma das 14 transcrições fonte:
- Identificar manualmente as categorias de métricas ausentes da transcrição (ex.: DocuSign Q4 2026 nunca discute métricas de ESG / carbono; Adobe nunca detalha receita da APAC; Lennar nunca reporta despesas de P&D porque é uma construtora de casas).
- Construir uma alegação que pareça plausível com um número realista, unidades e referência de trimestre.
- Verificar programaticamente a ausência por meio de pesquisa por palavras-chave no corpo do texto. Cada alegação possui de 3 a 8 variantes de palavras-chave (ex.: “carbon emissions,” “scope 1,” “scope 2,” “ghg,” “co2”); se qualquer palavra-chave for encontrada no corpo limpo, a armadilha é rejeitada como ambígua.
- Revisar manualmente os sobreviventes para filtrar falsos negativos da verificação de palavras-chave.
Por que isso isola a alucinação?
O documento alvo não discute a métrica, mas documentos distratores no palheiro frequentemente discutem métricas similares para outras empresas. Um modelo que alucina irá:
- Ou fabricar um número com base nos distratores
- Ou alegar que a métrica é mencionada com um valor errado (prevendo não em vez de não_mencionado)
Ambos os modos de falha resultam em pontuação = 0. Apenas responder corretamente “não mencionado” pontua 1.0.
Regra de pontuação
Pontuação = 1.0 se previsto == não_mencionado, senão 0.0.
O padrão de erro mais diagnóstico é previsto = não quando esperado = não_mencionado. Isso significa que o modelo alega ter visto a métrica, mas com um valor errado. Ele fabricou evidência de presença.
Distribuição das armadilhas por transcrição fonte
~17 armadilhas por transcrição em 14 transcrições fonte abrangendo 10 indústrias (semicondutores, SaaS, varejo, restaurantes, CPG, construção civil, finanças, produção de alimentos, hardware empresarial e outras) projetadas para que o teste não meça a alucinação em um único domínio.
Um total de 204 questões distintas são usadas no benchmark, posicionadas em diferentes posições do palheiro dentro da janela de contexto.
Leituras adicionais
- Benchmark de Código de IA: LMC-Eval
- Precificação de LLM: Principais Provedores Comparados
- Benchmark de Memória de IA
- Desempenho de Agentes de IA: Taxas de Sucesso & ROI
Cite este benchmark
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{HALC-Bench: LLM Alucinação em Benchmark de Recuperação de Longo Contexto}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/ai-hallucination}},
note = {AIMultiple. Acessado em 7 Julho 2026}
}
Comentários 4
Compartilhe suas ideias
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.
This article is updated in June while the GPT 5 is announced in August. How did you test GPT 5 in AI Hallucination Rates figure
Hi! Thanks for your comment. We use WordPress for our articles, which allows us to update graphs and tables independently of the main text. This means that even if the article text shows an earlier update date, we can still add the latest results to the figures without altering the written sections.
Hi Cem, I've been using this article as a reference of severity of hallucination. Is it possible to refresh the report with the newly released GPT-5? Thanks!
Hi Rui, Thanks a lot for your interest and for using our article as a reference. We’ve already refreshed the report with GPT-5 results, so you’ll find the latest updates included in the article.
Is there any chance that you might add Claude Sonnet/Opus 4 as well as Gemini 2.5 Pro?
Hi Tim, Thank you for your support and suggestion. Claude Sonnet/Opus 4 and Gemini 2.5 Pro have already been added to the article, so you can now see them included in the comparisons.
Hi, thank you for interesting benchmark! I was wondering Grok3's hallucination rate, both in Think mode and without. Are you planning to add these?
Hi Joon and thank you for your comment, Yes, we are waiting for API access.