Serviços
Contate-nos

HALC-Bench: LLM Alucinação em Benchmark de Recuperação de Longo Contexto

Cem Dilmegani
Cem Dilmegani
atualizado em 7 jul. 2026

HALC-Bench (LLM Alucinação em Benchmark de Recuperação de Longo Contexto) mede a resistência de um modelo de linguagem grande a fabricar evidências para uma métrica que não existe no documento alvo usando 3 palheiros colocados no início, no meio e no final da janela de contexto do modelo, com 204 perguntas.

Resultados

Loading Chart

claude-fable-5 respondeu corretamente a todas as 204 armadilhas em cada posição do palheiro. Entre os modelos restantes, gpt-5.5 alucinou menos. Não foi encontrada correlação entre a posição do palheiro e as taxas de alucinação.

Metodologia

204 perguntas são preparadas a partir de artigos do Motley Fool com datas posteriores ao corte de conhecimento, e os palheiros são posicionados em 0.1, 0.5 e 0.9 da janela de contexto do modelo.

Modelos avaliados, e suas janelas de contexto testadas em tokens estão abaixo:

  • anthropic/claude-fable-5: 850,000 tokens testados
  • openai/gpt-5.5: 1,000,000 tokens
  • google/gemini-3.1-pro-preview: 1,000,000 tokens
  • google/gemini-3.5-flash: 1,000,000 tokens
  • anthropic/claude-opus-4.8: 1,000,000 tokens anunciados, 850,000 testados.
  • anthropic/claude-sonnet-4.6: 1,000,000 tokens
  • qwen/qwen3.6-plus: 1,000,000 tokens
  • moonshotai/kimi-k2.6: 200,000 tokens
  • z-ai/glm-5.1: 200,000 tokens
  • minimax/minimax-m2.7: 150,000 tokens
  • openai/gpt-5.4-mini: 250,000 tokens

claude-opus-4.8 é testado na faixa de 850,000 tokens porque não consegue receber a entrada de testes com janela de contexto de 1,000,000 tokens com sucesso.

claude-fable-5 é testado através do Claude Code: o modelo recebe o palheiro de 850,000 tokens como um arquivo e o pesquisa com ferramentas de recuperação em vez de lê-lo da sua janela de contexto, portanto suas pontuações medem o modelo juntamente com o harness do Claude Code.

Question format

Uma alegação sobre uma métrica que não é discutida em nenhum lugar na transcrição alvo.

Exemplo de alegação: As emissões de carbono de Escopo 1 e 2 reportadas pela DocuSign (DOCU) para o Q4 2026 são 8,700 toneladas métricas de CO2e.

Resposta esperada: Não mencionado

Fonte de dados

Transcrições do Motley Fool publicadas após a data de corte de conhecimento dos modelos são usadas como fonte de dados. Armadilhas elaboradas manualmente com base nas lacunas reais de conteúdo de cada transcrição. Para cada uma das 14 transcrições fonte:

  • Identificar manualmente as categorias de métricas ausentes da transcrição (ex.: DocuSign Q4 2026 nunca discute métricas de ESG / carbono; Adobe nunca detalha receita da APAC; Lennar nunca reporta despesas de P&D porque é uma construtora de casas).
  • Construir uma alegação que pareça plausível com um número realista, unidades e referência de trimestre.
  • Verificar programaticamente a ausência por meio de pesquisa por palavras-chave no corpo do texto. Cada alegação possui de 3 a 8 variantes de palavras-chave (ex.: “carbon emissions,” “scope 1,” “scope 2,” “ghg,” “co2”); se qualquer palavra-chave for encontrada no corpo limpo, a armadilha é rejeitada como ambígua.
  • Revisar manualmente os sobreviventes para filtrar falsos negativos da verificação de palavras-chave.

Por que isso isola a alucinação?

O documento alvo não discute a métrica, mas documentos distratores no palheiro frequentemente discutem métricas similares para outras empresas. Um modelo que alucina irá:

  • Ou fabricar um número com base nos distratores
  • Ou alegar que a métrica é mencionada com um valor errado (prevendo não em vez de não_mencionado)

Ambos os modos de falha resultam em pontuação = 0. Apenas responder corretamente “não mencionado” pontua 1.0.

Regra de pontuação

Pontuação = 1.0 se previsto == não_mencionado, senão 0.0.

O padrão de erro mais diagnóstico é previsto = não quando esperado = não_mencionado. Isso significa que o modelo alega ter visto a métrica, mas com um valor errado. Ele fabricou evidência de presença.

Distribuição das armadilhas por transcrição fonte

~17 armadilhas por transcrição em 14 transcrições fonte abrangendo 10 indústrias (semicondutores, SaaS, varejo, restaurantes, CPG, construção civil, finanças, produção de alimentos, hardware empresarial e outras) projetadas para que o teste não meça a alucinação em um único domínio.
Um total de 204 questões distintas são usadas no benchmark, posicionadas em diferentes posições do palheiro dentro da janela de contexto.

Leituras adicionais

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Cite este benchmark

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Cem Dilmegani (2026) - "HALC-Bench: LLM Alucinação em Benchmark de Recuperação de Longo Contexto". Publicado on-line em AIMultiple.com. Acessado em 7 Julho 2026, em: https://aimultiple.com/ai-hallucination [Recurso on-line]

Dilmegani, C. (2026, 7 Julho). HALC-Bench: LLM Alucinação em Benchmark de Recuperação de Longo Contexto. AIMultiple. https://aimultiple.com/ai-hallucination

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{HALC-Bench: LLM Alucinação em Benchmark de Recuperação de Longo Contexto}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/ai-hallucination}},
  note   = {AIMultiple. Acessado em 7 Julho 2026}
}
Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem é o analista principal da AIMultiple desde 2017. A AIMultiple fornece informações para centenas de milhares de empresas (segundo o SimilarWeb), incluindo 55% das empresas da Fortune 500, todos os meses. O trabalho de Cem foi citado por importantes publicações globais, como Business Insider, Forbes e Washington Post, além de empresas globais como Deloitte e HPE, ONGs como o Fórum Econômico Mundial e organizações supranacionais como a Comissão Europeia. Você pode ver mais empresas e recursos renomados que mencionaram a AIMultiple. Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor na área. Ele assessorou empresas em suas decisões tecnológicas na McKinsey & Company e na Altman Solon por mais de uma década. Também publicou um relatório da McKinsey sobre digitalização. Liderou a estratégia de tecnologia e a área de compras de uma empresa de telecomunicações, reportando-se diretamente ao CEO. Além disso, liderou o crescimento comercial da empresa de tecnologia avançada Hypatos, que atingiu uma receita recorrente anual de sete dígitos e uma avaliação de nove dígitos, partindo de zero, em apenas dois anos. O trabalho de Cem no Hypatos foi noticiado por importantes publicações de tecnologia, como TechCrunch e Business Insider. Cem participa regularmente como palestrante em conferências internacionais de tecnologia. Ele se formou em engenharia da computação pela Universidade Bogazici e possui um MBA pela Columbia Business School.
Ver perfil completo

Comentários 4

Compartilhe suas ideias

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450
Abraham
Abraham
Aug 25, 2025 at 11:57

This article is updated in June while the GPT 5 is announced in August. How did you test GPT 5 in AI Hallucination Rates figure

Aleyna Daldal
Aleyna Daldal
Sep 05, 2025 at 08:46

Hi! Thanks for your comment. We use WordPress for our articles, which allows us to update graphs and tables independently of the main text. This means that even if the article text shows an earlier update date, we can still add the latest results to the figures without altering the written sections.

Rui
Rui
Aug 08, 2025 at 20:31

Hi Cem, I've been using this article as a reference of severity of hallucination. Is it possible to refresh the report with the newly released GPT-5? Thanks!

Aleyna Daldal
Aleyna Daldal
Sep 05, 2025 at 08:48

Hi Rui, Thanks a lot for your interest and for using our article as a reference. We’ve already refreshed the report with GPT-5 results, so you’ll find the latest updates included in the article.

Tim
Tim
Jul 19, 2025 at 10:13

Is there any chance that you might add Claude Sonnet/Opus 4 as well as Gemini 2.5 Pro?

Aleyna Daldal
Aleyna Daldal
Sep 05, 2025 at 08:48

Hi Tim, Thank you for your support and suggestion. Claude Sonnet/Opus 4 and Gemini 2.5 Pro have already been added to the article, so you can now see them included in the comparisons.

Joon
Joon
Feb 28, 2025 at 16:29

Hi, thank you for interesting benchmark! I was wondering Grok3's hallucination rate, both in Think mode and without. Are you planning to add these?

Cem Dilmegani
Cem Dilmegani
Mar 17, 2025 at 02:52

Hi Joon and thank you for your comment, Yes, we are waiting for API access.