Serviços
Contate-nos

HALC-Bench: LLM Alucinação em Benchmark de Recuperação de Contexto Longo

Cem Dilmegani
Cem Dilmegani
atualizado em 4 ago. 2026

HALC-Bench (LLM Alucinação em Benchmark de Recuperação de Contexto Longo) mede a resistência de um modelo de linguagem grande a fabricar evidência para uma métrica que não existe no documento alvo, usando 3 palheiros colocados no início, meio e fim da janela de contexto do modelo, com 204 questões.

Resultados

Loading Chart

claude-fable-5 respondeu corretamente a todas as 204 armadilhas em cada posição de palheiro. Entre os modelos restantes, gpt-5.5 alucinou menos. Não foi encontrada correlação entre a posição do palheiro e as taxas de alucinação.

Metodologia

204 questões são preparadas a partir de artigos do Motley Fool com datas posteriores ao corte de conhecimento, e os palheiros são posicionados em 0.1, 0.5 e 0.9 da janela de contexto do modelo.

Modelos avaliados e suas janelas de contexto testadas em tokens estão abaixo:

  • anthropic/claude-fable-5: 850.000 tokens testados
  • openai/gpt-5.5: 1.000.000 tokens
  • google/gemini-3.1-pro-preview: 1.000.000 tokens
  • google/gemini-3.5-flash: 1.000.000 tokens
  • anthropic/claude-opus-4.8: 1.000.000 tokens anunciados, 850.000 testados.
  • anthropic/claude-sonnet-4.6: 1.000.000 tokens
  • qwen/qwen3.6-plus: 1.000.000 tokens
  • moonshotai/kimi-k2.6: 200.000 tokens
  • z-ai/glm-5.1: 200.000 tokens
  • minimax/minimax-m2.7: 150.000 tokens
  • openai/gpt-5.4-mini: 250.000 tokens

claude-opus-4.8 é testado no nível de 850.000 porque não consegue receber com sucesso a entrada de um teste de janela de contexto de 1.000.000 tokens.

claude-fable-5 é testado através do Claude Code: o modelo recebe o palheiro de 850.000 tokens como um arquivo e o pesquisa com ferramentas de recuperação em vez de lê-lo da sua janela de contexto, portanto, suas pontuações medem o modelo juntamente com a ferramenta Claude Code.

Question format

Uma afirmação sobre uma métrica que não é discutida em nenhum lugar no transcrito alvo.

Exemplo de afirmação: As emissões de carbono de Escopo 1 e 2 reportadas pela DocuSign (DOCU) para o T4 de 2026 são 8.700 toneladas métricas de CO2e.

Resposta esperada: Não mencionada

Fonte dos dados

Transcritos do Motley Fool publicados após a data de corte de conhecimento dos modelos são usados como fonte de dados. Armadilhas elaboradas manualmente com base nas lacunas reais de conteúdo de cada transcrito. Para cada um dos 14 transcritos fonte:

  • Identificar manualmente categorias de métricas ausentes no transcrito (ex.: DocuSign Q4 2026 nunca discute métricas ESG / de carbono; Adobe nunca detalha a receita da APAC; Lennar nunca relata despesas de P&D porque é uma construtora de residências).
  • Construir uma afirmação plausível com um número realista, unidades e referência de trimestre.
  • Verificar programaticamente a ausência por meio de pesquisa por palavras-chave no texto do corpo. Cada afirmação tem de 3 a 8 variantes de palavras-chave (ex.: “carbon emissions”, “scope 1”, “scope 2”, “ghg”, “co2”); se qualquer palavra-chave atingir o corpo limpo, a armadilha é rejeitada como ambígua.
  • Revisar manualmente os sobreviventes para filtrar falsos negativos da verificação por palavras-chave.

Por que isso isola a alucinação?

O documento alvo não discute a métrica, mas os documentos distratores no palheiro frequentemente discutem métricas semelhantes para outras empresas. Um modelo que alucina irá:

  • Ou fabricar um número com base nos distratores
  • Ou afirmar que a métrica é mencionada com um valor errado (prevendo 'no' em vez de 'not_mentioned')

Ambos os modos de falha registram nota = 0. Apenas responder corretamente “não mencionada” pontua 1.0.

Regra de pontuação

Nota = 1.0 se previsto == not_mentioned, caso contrário 0.0.

O padrão de erro mais diagnóstico é previsto = 'no' quando esperado = 'not_mentioned'. Isso significa que o modelo afirma ter visto a métrica, mas com um valor errado. Ele fabricou evidência de presença.

Distribuição das armadilhas por transcrito fonte

~17 armadilhas por transcrito em 14 transcritos fonte, abrangendo 10 indústrias (semicondutores, SaaS, varejo, restaurantes, CPG, construção residencial, finanças, produção de alimentos, hardware empresarial e outras) projetadas para que o teste não meça a alucinação em um único domínio.
Um total de 204 questões distintas são usadas no benchmark, posicionadas em diferentes posições do palheiro dentro da janela de contexto.

O que é alucinação de IA?

Uma alucinação de IA é uma resposta gerada por um sistema de inteligência artificial que contém informações falsas, fabricadas ou enganosas apresentadas como fato. A IBM define o fenômeno como ocorrendo quando um modelo de linguagem grande percebe padrões ou objetos que são inexistentes ou imperceptíveis para observadores humanos, produzindo saídas que são sem sentido ou factualmente imprecisas e não fundamentadas nos dados de treinamento.1 A definição da Wikipédia o define de forma semelhante como uma resposta contendo informações falsas ou enganosas apresentadas como fato, listando “bullshitting”, “confabulação” e “ilusão” como termos alternativos usados na literatura.2

O Perfil de IA Generativa da Estrutura de Gerenciamento de Riscos de IA do National Institute of Standards and Technology (NIST IA 600-1), publicado em julho de 2024, adota formalmente “confabulação” em vez de “alucinação” como seu termo primário. O NIST define confabulação como a produção de conteúdo declarado com confiança, mas errôneo ou falso, conhecido coloquialmente como alucinações ou fabricações, pelo qual os usuários podem ser enganados ou iludidos.3 Esta definição cobre explicitamente saídas que divergem do prompt ou contradizem declarações geradas anteriormente dentro do mesmo contexto, não apenas afirmações que conflitam com a realidade externa.

A alucinação difere de um erro comum ou de digitação em duas dimensões críticas. Primeiro, fluência e confiança: a definição do NIST exige que o conteúdo seja “declarado com confiança”, carregando os mesmos marcadores gramaticais e estilísticos de certeza que uma resposta correta, sem hesitação ou sinal de dúvida.3 Segundo, fabricação versus corrupção: a IBM enquadra a falha como o modelo gerando conteúdo que não tem base em seus dados de treinamento ou entrada.

Impacto real da alucinação de IA em todos os setores

Incidentes documentados nos setores jurídico, de saúde e financeiro demonstram que a alucinação não é uma preocupação teórica, mas uma fonte de danos financeiros e operacionais mensuráveis.

A base de dados de Casos de Alucinação de IA de Damien Charlotin, o registro público mais abrangente, documentou 1.598 casos em todo o mundo até 9 de junho de 2026, com novos casos adicionados a uma taxa de aproximadamente 8 por dia.4

No caso Coomer v. Lindell (Tribunal Distrital dos EUA, Distrito do Colorado), a Juíza Nina Wang sancionou os advogados Christopher I. Kachouroff e Jennifer T. DeMaster em $3.000 cada em julho de 2025 após encontrar aproximadamente 30 citações defeituosas, incluindo citações incorretas e casos inexistentes, em petições para Mike Lindell e MyPillow.5 A mesma juíza sancionou Kachouroff novamente em maio de 2026, desta vez $5.000, por outra citação materialmente incorreta.6

Em Couvrette v. Wisnovsky, um tribunal federal no Oregon rejeitou as reivindicações dos requerentes com prejuízo e impôs um total de $110.204.38 em sanções em ordens datadas de dezembro de 2025 e março de 2026 contra o advogado da Califórnia Stephen Brigandi e o advogado de Portland Tim Murphy. A dupla citou 15 casos inexistentes e 8 citações fabricadas em três petições apresentadas ao longo de cinco meses.7

Em Whiting v. City of Athens, Tennessee, um painel do Sexto Circuito concluiu em março de 2026 que os advogados Van Irion e Russ Egli incluíram mais de duas dúzias de citações fabricadas e deturparam uma ordem de sanções do tribunal distrital. O tribunal ordenou que cada advogado pagasse $15.000 ao registro do tribunal, reembolsasse todos os honorários de apelação da parte adversa, pagasse o dobro das custas e enfrentasse um encaminhamento disciplinar.8 9

Em 20 de julho de 2025, o Juiz Distrital dos EUA Henry T. Wingate (Distrito Sul do Mississipi) emitiu uma ordem de restrição temporária contendo erros factuais, incluindo partes nomeadas incorretamente e uma citação de um caso inexistente. Após o Senador Chuck Grassley enviar uma consulta, Wingate reconheceu que seu assistente jurídico havia usado o Perplexity para redigir a ordem. Wingate adotou uma política interna exigindo uma segunda revisão independente das ordens preliminares e impressões físicas de todos os casos citados.10 11

A empresa de monitoramento ComplexDiscovery documentou sanções aumentando de aproximadamente $5.000 em um único caso de 2023 para $55.597 em um único caso de 2025, um aumento de 11x em cerca de 18 meses; combinado com o valor de Couvrette, as sanções por caso atingiram aproximadamente $110.000 no início a meados de 2026.12 Tribunais no Reino Unido, Singapura, Canadá, Austrália, Argentina, UE, Coreia, Itália, Noruega e França emitiram decisões sobre petições alucinadas por IA.13 14

Documentação clínica e de saúde

O 18º relatório anual Top 10 Health Technology Hazards da ECRI, divulgado em 4 de dezembro de 2024, classificou “riscos com tecnologias de saúde habilitadas por IA” como o risco número um para 2025, citando especificamente sistemas de IA produzindo resultados falsos ou enganosos alucinados e o risco de a IA perpetuar viés contra grupos de pacientes sub-representados.15 16

Um estudo de 2025 publicado na Communications Medicine testou vários LLMs na sumarização de casos clínicos usando 300 vinhetas clínicas simuladas validadas por médicos, cada uma contendo um detalhe fabricado. O estudo encontrou uma taxa geral de alucinação de 65.9% sem prompt de mitigação, caindo para 44.2% com prompt estruturado de mitigação; GPT-4o foi o modelo com melhor desempenho, caindo de 53% da linha de base para 23% com mitigação ativa.17 18

Finanças e atendimento ao cliente

A Securities and Exchange Commission moveu ações de fiscalização por declarações falsas sobre IA. Em 18 de março de 2024, a SEC resolveu suas primeiras acusações de "IA-washing" contra dois consultores de investimento, Delphia (USA) Inc. e Global Predictions, Inc., por um total de $400.000 em penalidades civis.19 Em fevereiro de 2024, a SEC resolveu acusações de fraude contra a Rockwell Capital Management e seu diretor Brian Sewell por um fundo que falsamente afirmava usar tecnologia de IA que nunca existiu, resultando em $1.602.089 em devolução de ganhos e juros mais uma penalidade pessoal de $223.229.20 Em janeiro de 2025, a SEC moveu seu primeiro caso de IA-washing contra uma empresa de capital aberto, Presto Automation Inc., por não divulgar que seu produto de reconhecimento de voz por IA era na verdade uma ferramenta de terceiros que exigia intervenção humana significativa.21

Em Moffatt v. Air Canada, 2024 BCCRT 149, decidido em 14 de fevereiro de 2024 pelo Tribunal de Resolução Civil da Colúmbia Britânica, o tribunal rejeitou o argumento da Air Canada de que não era responsável pelas declarações de seu chatbot. Jake Moffatt havia sido informado pelo chatbot do site da companhia aérea que poderia solicitar um desconto por luto retroativamente após reservar passagens com tarifa integral; isso era falso. O tribunal ordenou que a Air Canada pagasse a Moffatt $650.88 em danos por declaração falsa negligente.22 23

Quão comuns são as alucinações de IA?

As taxas de alucinação variam enormemente por tipo de tarefa e metodologia de avaliação, tornando enganosos resumos de um único número. O Relatório do Índice de IA 2026 da Stanford HAI documenta um novo benchmark de precisão testando se os modelos conseguem distinguir entre crença de terceiros e crença do usuário quando apresentados a declarações falsas. As taxas de alucinação em 26 modelos de ponta variam de 22% a 94% neste benchmark.24

A metodologia impulsiona essa ampla dispersão. Os modelos lidam bem com alegações falsas quando enquadradas como algo em que um terceiro acredita, mas o desempenho desaba quando a mesma alegação falsa é enquadrada como algo em que o usuário acredita. Sob esse enquadramento de “crença do usuário”, a precisão do GPT-4o caiu de 98.2% para 64.4%, e o DeepSeek R1 caiu de mais de 90% para 14.4%.24

Em tarefas de sumarização ancorada, as taxas são mais baixas, mas as mudanças de benchmark complicam a análise de tendências. O Hallucination Leaderboard da Vectara (modelo HHEM) mede com que frequência os resumos contêm alegações não suportadas pelos documentos fonte. Na versão original do leaderboard em execução durante a maior parte de 2025, o Gemini-2.0-Flash-001 da Google alcançou uma taxa de alucinação de 0.7%. Em novembro de 2025, a Vectara substituiu o benchmark por um conjunto de dados mais difícil, usando documentos mais longos (até 32K tokens) abrangendo direito, medicina, finanças, tecnologia e educação. Neste novo benchmark, o líder atual é o finix_s1_32b do Ant Group com 1.8%, com o Gemini-2.5-flash-lite da Google com 3.3% e o gpt-5.4-nano da OpenAI com 3.1%.25 A Vectara afirma explicitamente que as pontuações das versões antiga e nova não devem ser comparadas diretamente, pois o novo conjunto de dados é intencionalmente mais difícil.26

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Detectando e reduzindo alucinações de IA

Abordagens técnicas de mitigação visam diferentes estágios do pipeline de geração, desde a arquitetura de recuperação até o design de avaliação.

Geração aumentada por recuperação e fundamentação

A geração aumentada por recuperação padrão combina um modelo de linguagem paramétrico pré-treinado com um índice de recuperação não paramétrico, condicionando a saída aos documentos obtidos no momento da inferência, em vez de depender apenas de fatos memorizados durante o treinamento.27 A pesquisa de interpretabilidade mecanicista rastreia as alucinações em sistemas RAG a dois componentes internos: “Knowledge FFNs” (camadas de rede feed-forward que codificam conhecimento paramétrico) e “Copying Heads” (cabeças de atenção responsáveis por transferir o contexto recuperado para a saída). A alucinação ocorre quando os Knowledge FFNs superenfatizam o conhecimento paramétrico enquanto os Copying Heads falham em reter o conteúdo recuperado externo.28

SQL RAG aplica a recuperação no nível do esquema em vez do nível do documento, recuperando instruções CREATE TABLE e consultas de exemplo usando embeddings semânticos. Isso impede estruturalmente que os modelos inventem elementos de esquema, porque apenas as definições reais e recuperadas do esquema estão no contexto. No entanto, aumentar o conteúdo esquema recuperado melhora a discriminação da recuperação, mas aumenta as taxas de alucinação quando os prompts ultrapassam um tamanho ideal, indicando que a capacidade de geração downstream limita o quanto o SQL RAG pode reduzir a fabricação.29

O GraphRAG da Microsoft Research converte corpora fonte em grafos de conhecimento antes da recuperação, pré-gerando resumos comunitários para grupos de entidades relacionadas. Isso aborda a dificuldade do RAG padrão com perguntas globais sobre corpora inteiros, recuperando relacionamentos estruturados entre entidades em vez de fragmentos isolados.30 31

Calibração, prompting e métodos de avaliação

O artigo de setembro de 2025 da OpenAI argumenta que mudanças no design da avaliação podem alterar as taxas de alucinação, modificando o que é otimizado durante o desenvolvimento do modelo. Os autores propõem adicionar limiares explícitos de confiança aos benchmarks, como “responda apenas se você estiver mais de t% confiante, já que erros são penalizados em t/(1−t) pontos.” Sob essa regra de pontuação, responder só supera abster-se quando a confiança real do modelo excede o limiar, removendo o incentivo para adivinhar.32 33

O prompting estruturado reduz as taxas de alucinação em domínios específicos. O estudo da Communications Medicine descobriu que um prompt de mitigação instruindo os modelos a “usar apenas informações clinicamente validadas e reconhecer a incerteza em vez de especular mais” reduziu as taxas de alucinação de 64.1% para 43.1% para vinhetas clínicas de casos longos, e de aproximadamente 66% para 44% em média em todos os modelos e tamanhos de caso. 34 18 A decodificação com temperatura 0 (determinística) não produziu melhoria significativa, isolando a estrutura do prompt em vez da aleatoriedade da decodificação como a variável efetiva.34

A alucinação de IA é um problema solucionável?

A questão de saber se a alucinação pode ser eliminada permanece genuinamente contestada entre resultados teóricos de impossibilidade e tendências empíricas de taxas decrescentes em benchmarks.

O artigo “Hallucination is Inevitable” fornece um argumento formal de que LLMs não podem aprender todas as funções computáveis e, portanto, inevitavelmente alucinarão se usados como resolvedores gerais de problemas, enquadrando isso como uma limitação inata, independentemente de melhorias na arquitetura ou no treinamento.35 Um resultado teórico relacionado prova que os modelos não podem simultaneamente alcançar alta consistência (gerando apenas declarações suportadas pelos dados de treinamento) e alta abrangência (cobrindo toda a diversidade do idioma alvo); empurrar em direção a um necessariamente empurra para o outro modo de falha, seja alucinação ou colapso de modo.36 37

Contrapondo esses limites teóricos está a tendência empírica de queda nas taxas de alucinação em benchmarks padronizados, com modelos de ponta alcançando menos de 2% em tarefas de sumarização ancorada. No entanto, essa tendência é complicada pelo desalinhamento da avaliação. A pesquisa da OpenAI identifica a classificação binária em benchmarks convencionais como um obstáculo estrutural que recompensa matematicamente a adivinhação confiante em vez da incerteza calibrada, significando que as taxas relatadas medem o desempenho em relação a estruturas de incentivo que podem não refletir os requisitos de confiabilidade do mundo real.32

Uma pesquisa de fevereiro de 2024 argumenta que a alucinação e a geração criativa podem compartilhar mecanismos subjacentes, enquadrando as duas como um trade-off em vez de modos de falha e sucesso separáveis. Suprimir o mecanismo generativo que produz saídas exploratórias corre o risco de suprimir a capacidade, não apenas o risco, particularmente em domínios como brainstorming ou ficção.38 Isso se alinha com o comportamento observado dos parâmetros de decodificação: configurações de baixa temperatura (0 a 0.3) são recomendadas para extração factual, enquanto configurações mais altas (0.7 a 1.0) aumentam deliberadamente a variância e, com ela, o risco de alucinação para tarefas criativas.39

Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Para onde estão indo as políticas e a pesquisa sobre alucinação de IA?

O IA Incident Database registrou 362 incidentes documentados em 2025, acima dos 233 em 2024, de acordo com o Relatório do Índice de IA 2026 da Stanford HAI.24 Entre as empresas que relatam incidentes de IA, a proporção que relata 3-5 incidentes aumentou enquanto a proporção que relata apenas 1-2 incidentes caiu, indicando que a exposição repetida, em vez de eventos isolados, está se tornando mais comum.24

O Índice de Transparência de Modelos de Fundação mostra uma transparência em declínio mesmo com o aumento dos incidentes. A pontuação média entre os desenvolvedores avaliados subiu de 37 em 2023 para 58 em 2024, depois caiu para 40 em 2025.40 41 As pontuações individuais de 2025 variaram de IBM com 95 a xAI e Midjourney com 14 cada.42

Os cargos de governança específica de IA cresceram 17% em 2025, e a proporção de empresas sem políticas de IA responsável caiu de 24% para 11%.24

Os tribunais passaram de sanções caso a caso para regras permanentes. Em 28 de maio de 2026, a Suprema Corte da Flórida alterou a Regra de Prática Geral e Administração Judiciária 2.515(d)(2) para exigir que cada signatário de um documento judicial certifique que “as autoridades legais identificadas existem e são citadas com precisão”, com efeito a partir de 15 de junho de 2026.43 No Distrito Sul de Nova York, as Regras Civis do Juiz Vernon Broderick (atualizadas em 29 de outubro de 2025) exigem a divulgação de qualquer IA generativa usada para preparar documentos e a certificação de que as partes geradas por IA foram revisadas independentemente.44

Perguntas frequentes

Não. Argumentos formais de computabilidade provam que modelos de linguagem grandes não podem aprender todas as funções computáveis e inevitavelmente alucinarão em algumas entradas, independentemente da arquitetura ou qualidade dos dados de treinamento.35 Pesquisas indicam que a probabilidade de alucinação pode ser reduzida a níveis estatisticamente insignificantes, mas não a zero, preservando o desempenho do modelo.45 46

Não. A definição técnica da IBM afirma que as alucinações de IA “não são atos intencionais de engano”, mas resultam de fatores como viés nos dados de treinamento e complexidade do modelo, produzindo saídas falsas não intencionalmente.1 Mentir requer saber a resposta correta e escolher declarar algo falso; os modelos carecem da intenção de enganar e, em vez disso, geram saídas indiferentes ao valor de verdade.32

Os sinais de alerta incluem declarações factualmente incorretas apresentadas com confiança, respostas que saem do tópico ou quebram o fluxo lógico, lógica passo a passo defeituosa, como erros aritméticos básicos, e em ferramentas multimodais, imagens geradas que não correspondem à solicitação.47 Como os incentivos de treinamento recompensam a adivinhação, os usuários devem tratar detalhes sem fonte e declarados com confiança como não verificados até que sejam checados em fontes primárias.32

Leituras adicionais

Cite este benchmark

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Cem Dilmegani (2026) - "HALC-Bench: LLM Alucinação em Benchmark de Recuperação de Contexto Longo". Publicado on-line em AIMultiple.com. Acessado em 4 Agosto 2026, em: https://aimultiple.com/ai-hallucination [Recurso on-line]

Dilmegani, C. (2026, 4 Agosto). HALC-Bench: LLM Alucinação em Benchmark de Recuperação de Contexto Longo. AIMultiple. https://aimultiple.com/ai-hallucination

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{HALC-Bench: LLM Alucinação em Benchmark de Recuperação de Contexto Longo}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/ai-hallucination}},
  note   = {AIMultiple. Acessado em 4 Agosto 2026}
}

Links de referência

1.
What Are AI Hallucinations? | IBM
2.
Hallucination (artificial intelligence) - Wikipedia
Contributors to Wikimedia projects
3.
https://nvlpubs.nist.gov/nistpubs/ai/NIST.AI.600-1.pdf
4.
AI Hallucination Cases Database – Damien Charlotin
5.
AI hallucination in Mike Lindell case serves as a stark warning : NPR
NPR
6.
$5K Sanctions for Repeated Mis-Citation in Coomer v. Lindell / My Pillow Election-Related Libel Suit
Reason Magazine
7.
Gardiner Roberts - Blog
8.
Lawyers Citing Nonexistent Cases Ordered to Pay Opponents' Attorney Fees, Double Costs, $15K Fine Each
Reason Magazine
9.
https://www.opn.ca6.uscourts.gov/opinions.pdf/26a0080p-06.pdf
10.
Attorneys baffled by federal court order with factual errors - Mississippi Today
Mississippi Today
11.
Federal judge in Mississippi admits staff used AI to draft inaccurate order - Mississippi Today
12.
The AI Sanction Wave: $145K in Q1 Penalties Signals Courts Have Lost Patience with GenAI Filing Failures
ComplexDiscovery
13.
AI Hallucinations in Law: 1,313 Court Cases and Counting | HAQQ
HAQQ Legal AI
14.
AI Hallucination Cases Tracker
15.
Artificial intelligence tops 2025 health technology hazards list
ECRI and ISMP
16.
Artificial intelligence tops 2025 health technology hazards list
Cision PR Newswire
17.
Multi-model assurance analysis showing large language models are highly vulnerable to adversarial hallucination attacks during clinical decision support - PMC
18.
Multi-model assurance analysis showing large language models are highly vulnerable to adversarial hallucination attacks during clinical decision support | Communications Medicine
Nature Publishing Group UK
19.
SEC Fines Two Investment Advisers for AI Washing
20.
SEC Charges Investment Company, CEO and Board Member for Alleged Misleading Statements Regarding Use of Artificial Intelligence - The 40 Act Blog
The 40 Act Blog
21.
2025 Fiscal Year in Review: SEC Enforcement Against Investment Advisers to Private Funds, Registered Funds, and Retail Clients | Insights | Sidley Austin LLP
Sidley Austin LLP
22.
Vercel Security Checkpoint
23.
https://s3.amazonaws.com/IGG/AI+Part+1+-+Materials/Moffatt+v.+Air+Canada.pdf
24.
Responsible AI | The 2026 AI Index Report | Stanford HAI
25.
GitHub - vectara/hallucination-leaderboard: Leaderboard Comparing LLM Performance at Producing Hallucinations when Summarizing Short Documents · GitHub
26.
Introducing the Next Generation of Vectara's Hallucination Leaderboard
27.
[2005.11401] Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
28.
[2410.11414] ReDeEP: Detecting Hallucination in Retrieval-Augmented Generation via Mechanistic Interpretability
29.
Balancing Content Size in RAG-Text2SQL System
30.
[2404.16130] From Local to Global: A Graph RAG Approach to Query-Focused Summarization
31.
Project GraphRAG - Microsoft Research
32.
[2509.04664] Why Language Models Hallucinate
33.
Why language models hallucinate | OpenAI
34.
Large Language Models Are Highly Vulnerable to Adversarial Hallucination Attacks in Clinical Decision Support: A Multi-Model Assurance Analysis | medRxiv
35.
[2401.11817] Hallucination is Inevitable: An Innate Limitation of Large Language Models
36.
https://arxiv.org/pdf/2411.09642
37.
On the Limits of Language Generation: Trade-Offs between Hallucination and Mode-Collapse | Proceedings of the 57th Annual ACM Symposium on Theory of Computing
38.
A Survey on Large Language Model Hallucination via a Creativity Perspective
39.
LLM temperature: tuning creativity vs reliability | KERN-IT
KERN-IT
40.
Transparency in AI is on the Decline | Stanford HAI
41.
https://crfm.stanford.edu/fmti/paper.pdf
42.
Transparency in AI is on the decline | Stanford Report
43.
Supreme Court amends rules to address AI use in court filings – The Florida Bar
44.
https://www.nysd.uscourts.gov/sites/default/files/practice_documents/VSB%20Broderick%20Civil%20Rules%20-%20rev%202025.10.29.pdf
45.
https://arxiv.org/pdf/2502.12187
46.
AI hallucination: towards a comprehensive classification of distorted information in artificial intelligence-generated content | Humanities and Social Sciences Communications
Palgrave Macmillan UK
47.
How to tell if an AI is hallucinating in its answers. 4 red flags to watch out for | PCWorld
PCWorld
Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem tem sido o analista principal do AIMultiple desde 2017. O AIMultiple informa centenas de milhares de empresas (de acordo com o similarWeb), incluindo 60% das empresas da Fortune 500 todos os meses.

O trabalho de Cem foi citado por publicações globais de destaque, incluindo Business Insider, Forbes, Washington Post, empresas globais como Deloitte, HPE e ONGs como o Fórum Econômico Mundial e organizações supranacionais como a Comissão Europeia.

Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor de tecnologia. Ele aconselhou empresas em suas decisões de tecnologia na McKinsey & Company e na Altman Solon por mais de uma década. Ele também publicou um relatório da McKinsey sobre digitalização.

Ele liderou a estratégia de tecnologia e aquisições de uma empresa de telecomunicações, reportando-se ao CEO. Ele também liderou o crescimento comercial da empresa de tecnologia profunda Hypatos, que alcançou uma receita recorrente anual de 7 dígitos e uma avaliação de 9 dígitos partindo do zero em 2 anos. O trabalho de Cem na Hypatos foi coberto por publicações de tecnologia de destaque como TechCrunch e Business Insider.

Cem fala regularmente em conferências internacionais de tecnologia. Ele se formou na Universidade Bogazici como engenheiro de computação e possui um MBA pela Columbia Business School.
Ver perfil completo

Comentários 4

Compartilhe suas ideias

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450
Abraham
Abraham
Aug 25, 2025 at 11:57

This article is updated in June while the GPT 5 is announced in August. How did you test GPT 5 in AI Hallucination Rates figure

Aleyna Daldal
Aleyna Daldal
Sep 05, 2025 at 08:46

Hi! Thanks for your comment. We use WordPress for our articles, which allows us to update graphs and tables independently of the main text. This means that even if the article text shows an earlier update date, we can still add the latest results to the figures without altering the written sections.

Rui
Rui
Aug 08, 2025 at 20:31

Hi Cem, I've been using this article as a reference of severity of hallucination. Is it possible to refresh the report with the newly released GPT-5? Thanks!

Aleyna Daldal
Aleyna Daldal
Sep 05, 2025 at 08:48

Hi Rui, Thanks a lot for your interest and for using our article as a reference. We’ve already refreshed the report with GPT-5 results, so you’ll find the latest updates included in the article.

Tim
Tim
Jul 19, 2025 at 10:13

Is there any chance that you might add Claude Sonnet/Opus 4 as well as Gemini 2.5 Pro?

Aleyna Daldal
Aleyna Daldal
Sep 05, 2025 at 08:48

Hi Tim, Thank you for your support and suggestion. Claude Sonnet/Opus 4 and Gemini 2.5 Pro have already been added to the article, so you can now see them included in the comparisons.

Joon
Joon
Feb 28, 2025 at 16:29

Hi, thank you for interesting benchmark! I was wondering Grok3's hallucination rate, both in Think mode and without. Are you planning to add these?

Cem Dilmegani
Cem Dilmegani
Mar 17, 2025 at 02:52

Hi Joon and thank you for your comment, Yes, we are waiting for API access.