Services
Contactez-nous

HALC-Bench: LLM Hallucination sur le banc d'essai de récupération en contexte long

Cem Dilmegani
Cem Dilmegani
mis à jour le 7 juil. 2026

HALC-Bench (LLM Hallucination sur le banc d'essai de récupération en contexte long) mesure la résistance d'un LLM à fabriquer des preuves pour une métrique qui n'existe pas dans le document cible en utilisant 3 meules de foin placées au début, au milieu et à la fin de la fenêtre de contexte du modèle, avec 204 questions.

Résultats

Loading Chart

claude-fable-5 a répondu correctement à tous les 204 pièges à chaque position de botte de foin. Parmi les modèles restants, gpt-5.5 a le moins halluciné. Aucune corrélation n'a été trouvée entre l'emplacement de la botte de foin et les taux d'hallucination.

Méthodologie

204 questions sont préparées à partir d'articles du Motley Fool avec des dates postérieures à la date de coupure des connaissances, et les meules de foin sont positionnées à 0.1, 0.5 et 0.9 de la fenêtre de contexte du modèle.

Modèles évalués, et leurs fenêtres de contexte testées en tokens sont ci-dessous :

  • anthropic/claude-fable-5: 850,000 tokens testés
  • openai/gpt-5.5: 1,000,000 tokens
  • google/gemini-3.1-pro-preview: 1,000,000 tokens
  • google/gemini-3.5-flash: 1,000,000 tokens
  • anthropic/claude-opus-4.8: 1,000,000 tokens annoncés, 850,000 testés.
  • anthropic/claude-sonnet-4.6: 1,000,000 tokens
  • qwen/qwen3.6-plus: 1,000,000 tokens
  • moonshotai/kimi-k2.6: 200,000 tokens
  • z-ai/glm-5.1: 200,000 tokens
  • minimax/minimax-m2.7: 150,000 tokens
  • openai/gpt-5.4-mini: 250,000 tokens

claude-opus-4.8 est testé au niveau 850,000 car il ne peut pas obtenir l'entrée d'un test de fenêtre de contexte de 1,000,000 tokens avec succès.

claude-fable-5 est testé via Claude Code : le modèle reçoit la meule de foin de 850,000 tokens sous forme de fichier et la recherche avec des outils de récupération au lieu de la lire depuis sa fenêtre de contexte, donc ses scores mesurent le modèle conjointement avec le harnais Claude Code.

Question format

Une affirmation concernant une métrique qui n'est discutée nulle part dans la transcription cible.

Exemple d'affirmation : Les émissions de carbone des scopes 1 et 2 déclarées par DocuSign (DOCU) pour le T4 2026 sont de 8,700 tonnes métriques CO2e.

Réponse attendue : Non mentionné

Source des données

Les transcriptions du Motley Fool publiées après la date de coupure des connaissances des modèles sont utilisées comme source de données. Des pièges rédigés à la main basés sur les lacunes réelles du contenu de chaque transcription. Pour chacune des 14 transcriptions sources :

  • Identifier manuellement les catégories de métriques absentes de la transcription (par exemple, DocuSign T4 2026 ne discute jamais des métriques ESG / carbone ; Adobe ne ventile jamais les revenus APAC ; Lennar ne déclare jamais de dépenses R&D car c'est un constructeur de maisons).
  • Construire une affirmation plausible avec un nombre, des unités et une référence de trimestre réalistes.
  • Vérifier par programme l'absence via une recherche de mots-clés par rapport au texte principal. Chaque affirmation a 3 à 8 variantes de mots-clés (par exemple, « émissions de carbone », « scope 1 », « scope 2 », « ges », « co2 ») ; si l'un des mots-clés correspond au corps nettoyé, le piège est rejeté comme ambigu.
  • Examiner manuellement les survivants pour filtrer les faux négatifs de la vérification par mots-clés.

Pourquoi cela isole-t-il l'hallucination ?

Le document cible ne discute pas de la métrique, mais les documents distracteurs dans la botte de foin discutent souvent de métriques similaires pour d'autres entreprises. Un modèle qui hallucine va :

  • Soit fabriquer un nombre basé sur les distracteurs
  • Soit prétendre que la métrique est mentionnée avec une valeur erronée (prédire non au lieu de not_mentioned)

Les deux modes d'échec sont comptabilisés comme score = 0. Seule une réponse correcte « non mentionné » obtient un score de 1.0.

Règle de notation

Score = 1.0 si prédit == not_mentioned, sinon 0.0.

Le modèle d'erreur le plus diagnostique est prédit = non quand attendu = not_mentioned. Cela signifie que le modèle prétend avoir vu la métrique mais avec une valeur erronée. Il a fabriqué des preuves de présence.

Répartition des pièges par transcription source

~17 pièges par transcription à travers 14 transcriptions sources couvrant 10 secteurs d'activité (semi-conducteurs, SaaS, vente au détail, restaurants, produits de grande consommation, construction de maisons, finance, production alimentaire, matériel d'entreprise, et autres) conçus pour que le test ne mesure pas l'hallucination sur un seul domaine.
Un total de 204 questions distinctes sont utilisées dans le benchmark, positionnées à différentes positions de botte de foin dans la fenêtre de contexte.

Lectures complémentaires

Laissez notre équipe automatiser l'un de vos processus métier avec des agents IA, gratuitement.
Automatiser un processus

Citez ce benchmark

Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.

Cem Dilmegani (2026) - "HALC-Bench: LLM Hallucination sur le banc d'essai de récupération en contexte long". Publié en ligne sur AIMultiple.com. Consulté le 7 Juillet 2026, à : https://aimultiple.com/ai-hallucination [Ressource en ligne]

Dilmegani, C. (2026, 7 Juillet). HALC-Bench: LLM Hallucination sur le banc d'essai de récupération en contexte long. AIMultiple. https://aimultiple.com/ai-hallucination

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{HALC-Bench: LLM Hallucination sur le banc d'essai de récupération en contexte long}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/ai-hallucination}},
  note   = {AIMultiple. Consulté le 7 Juillet 2026}
}
Cem Dilmegani
Cem Dilmegani
Analyste principal
Cem est analyste principal chez AIMultiple depuis 2017. AIMultiple informe chaque mois des centaines de milliers d'entreprises (selon similarWeb), dont 55 % des entreprises du classement Fortune 500. Les travaux de Cem ont été cités par des publications internationales de premier plan telles que Business Insider, Forbes et le Washington Post, ainsi que par des entreprises mondiales comme Deloitte et HPE, des ONG comme le Forum économique mondial et des organisations supranationales comme la Commission européenne. Vous trouverez d'autres entreprises et ressources réputées ayant fait référence à AIMultiple. Tout au long de sa carrière, Cem a exercé les fonctions de consultant, d'acheteur et d'entrepreneur dans le secteur des technologies. Il a conseillé des entreprises sur leurs décisions technologiques chez McKinsey & Company et Altman Solon pendant plus de dix ans. Il a également publié un rapport McKinsey sur la numérisation. Il a dirigé la stratégie technologique et les achats d'un opérateur télécom, sous la responsabilité directe du PDG. Il a également piloté la croissance commerciale de la société de deep tech Hypatos, qui a atteint un chiffre d'affaires annuel récurrent à sept chiffres et une valorisation à neuf chiffres en seulement deux ans. Les travaux de Cem chez Hypatos ont été présentés dans des publications technologiques de référence telles que TechCrunch et Business Insider. Cem intervient régulièrement lors de conférences internationales sur les technologies. Diplômé en génie informatique de l'université de Bogazici, il est également titulaire d'un MBA de la Columbia Business School.
Voir le profil complet

Commentaires 4

Partagez vos idées

Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.

0/450
Abraham
Abraham
Aug 25, 2025 at 11:57

This article is updated in June while the GPT 5 is announced in August. How did you test GPT 5 in AI Hallucination Rates figure

Aleyna Daldal
Aleyna Daldal
Sep 05, 2025 at 08:46

Hi! Thanks for your comment. We use WordPress for our articles, which allows us to update graphs and tables independently of the main text. This means that even if the article text shows an earlier update date, we can still add the latest results to the figures without altering the written sections.

Rui
Rui
Aug 08, 2025 at 20:31

Hi Cem, I've been using this article as a reference of severity of hallucination. Is it possible to refresh the report with the newly released GPT-5? Thanks!

Aleyna Daldal
Aleyna Daldal
Sep 05, 2025 at 08:48

Hi Rui, Thanks a lot for your interest and for using our article as a reference. We’ve already refreshed the report with GPT-5 results, so you’ll find the latest updates included in the article.

Tim
Tim
Jul 19, 2025 at 10:13

Is there any chance that you might add Claude Sonnet/Opus 4 as well as Gemini 2.5 Pro?

Aleyna Daldal
Aleyna Daldal
Sep 05, 2025 at 08:48

Hi Tim, Thank you for your support and suggestion. Claude Sonnet/Opus 4 and Gemini 2.5 Pro have already been added to the article, so you can now see them included in the comparisons.

Joon
Joon
Feb 28, 2025 at 16:29

Hi, thank you for interesting benchmark! I was wondering Grok3's hallucination rate, both in Think mode and without. Are you planning to add these?

Cem Dilmegani
Cem Dilmegani
Mar 17, 2025 at 02:52

Hi Joon and thank you for your comment, Yes, we are waiting for API access.