Servicios
Contáctanos

HALC-Bench: LLM Alucinación en el Benchmark de Recuperación de Contexto Largo

Cem Dilmegani
Cem Dilmegani
actualizado el 7 de jul. de 2026

HALC-Bench (LLM Alucinación en el Benchmark de Recuperación de Contexto Largo) mide la resistencia de un LLM a fabricar evidencia para una métrica que no existe en el documento objetivo mediante el uso de 3 pajares colocados al principio, en el medio y al final de la ventana de contexto del modelo, con 204 preguntas.

Resultados

Loading Chart

claude-fable-5 respondió correctamente a todas las 204 trampas en cada posición del pajar. Entre los modelos restantes, gpt-5.5 alucinó menos. No se encontró correlación entre la posición del pajar y las tasas de alucinación.

Metodología

204 preguntas se preparan a partir de artículos de Motley Fool con fechas posteriores al corte de conocimiento, y los pajares se posicionan en el 0.1, 0.5 y 0.9 de la ventana de contexto del modelo.

Los modelos evaluados y sus ventanas de contexto probadas en tokens son los siguientes:

  • anthropic/claude-fable-5: 850,000 tokens probados
  • openai/gpt-5.5: 1,000,000 tokens
  • google/gemini-3.1-pro-preview: 1,000,000 tokens
  • google/gemini-3.5-flash: 1,000,000 tokens
  • anthropic/claude-opus-4.8: 1,000,000 tokens anunciados, 850,000 probados
  • anthropic/claude-sonnet-4.6: 1,000,000 tokens
  • qwen/qwen3.6-plus: 1,000,000 tokens
  • moonshotai/kimi-k2.6: 200,000 tokens
  • z-ai/glm-5.1: 200,000 tokens
  • minimax/minimax-m2.7: 150,000 tokens
  • openai/gpt-5.4-mini: 250,000 tokens

claude-opus-4.8 se prueba en el nivel de 850,000 porque no puede procesar con éxito las pruebas de entrada de una ventana de contexto de 1,000,000 tokens.

claude-fable-5 se prueba a través de Claude Code: el modelo recibe el pajar de 850,000 tokens como un archivo y lo busca con herramientas de recuperación en lugar de leerlo desde su ventana de contexto, por lo que sus puntuaciones miden el modelo junto con el arnés de Claude Code.

Question format

Una afirmación sobre una métrica que no se discute en ninguna parte de la transcripción objetivo.

Ejemplo de afirmación: Las emisiones de carbono de Alcance 1 y 2 reportadas por DocuSign (DOCU) para el cuarto trimestre de 2026 son 8,700 toneladas métricas de CO2e.

Respuesta esperada: No mencionado

Fuente de datos

Se utilizan transcripciones de Motley Fool publicadas después de la fecha de corte de conocimiento de los modelos como fuente de datos. Trampas creadas manualmente basadas en las brechas de contenido reales de cada transcripción. Para cada una de las 14 transcripciones fuente:

  • Identificar manualmente las categorías de métricas ausentes en la transcripción (por ejemplo, DocuSign en el cuarto trimestre de 2026 nunca discute métricas ESG / de carbono; Adobe nunca desglosa los ingresos de APAC; Lennar nunca reporta gastos de I+D porque es una constructora de viviendas).
  • Construir una afirmación que suene plausible con un número realista, unidades y referencia de trimestre.
  • Verificar programáticamente la ausencia mediante búsqueda de palabras clave en el texto del cuerpo. Cada afirmación tiene de 3 a 8 variantes de palabras clave (por ejemplo, “emisiones de carbono”, “alcance 1”, “alcance 2”, “gei”, “co2”); si alguna palabra clave aparece en el cuerpo limpio, la trampa se rechaza como ambigua.
  • Revisar manualmente los supervivientes para filtrar falsos negativos de la verificación de palabras clave.

¿Por qué esto aísla la alucinación?

El documento objetivo no discute la métrica, pero los documentos distractores en el pajar a menudo sí discuten métricas similares para otras empresas. Un modelo que alucina hará:

  • Fabricar un número basado en los distractores
  • O afirmar que la métrica se menciona con un valor incorrecto (prediciendo "no" en lugar de "no_mencionado")

Ambos modos de fallo se registran como puntuación = 0. Solo responder correctamente “no mencionado” obtiene una puntuación de 1.0.

Regla de puntuación

Puntuación = 1.0 si predicho == no_mencionado, de lo contrario 0.0.

El patrón de error más diagnóstico es predicho = no cuando se esperaba = no_mencionado. Esto significa que el modelo afirma haber visto la métrica pero con un valor incorrecto. Fabricó evidencia de presencia.

Distribución de trampas por transcripción fuente

~17 trampas por transcripción en 14 transcripciones fuente que abarcan 10 industrias (semiconductores, SaaS, venta al por menor, restaurantes, CPG, construcción de viviendas, finanzas, producción de alimentos, hardware empresarial, y otras) diseñadas para que la prueba no mida la alucinación en un solo dominio.
Se utilizan un total de 204 preguntas distintas en el benchmark, posicionadas en diferentes posiciones del pajar dentro de la ventana de contexto.

Lecturas adicionales

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Cita este benchmark

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Cem Dilmegani (2026) - "HALC-Bench: LLM Alucinación en el Benchmark de Recuperación de Contexto Largo". Publicado en línea en AIMultiple.com. Recuperado el 7 de Julio de 2026, de: https://aimultiple.com/ai-hallucination [Recurso en línea]

Dilmegani, C. (2026, 7 de Julio). HALC-Bench: LLM Alucinación en el Benchmark de Recuperación de Contexto Largo. AIMultiple. https://aimultiple.com/ai-hallucination

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{HALC-Bench: LLM Alucinación en el Benchmark de Recuperación de Contexto Largo}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/ai-hallucination}},
  note   = {AIMultiple. Recuperado el 7 de Julio de 2026}
}
Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem ha sido el analista principal en AIMultiple desde 2017. AIMultiple informa a cientos de miles de empresas (según similarWeb), incluido el 60% de Fortune 500 cada mes.

El trabajo de Cem ha sido citado por publicaciones globales líderes como Business Insider, Forbes, Washington Post, firmas globales como Deloitte, HPE y ONG como el Foro Económico Mundial y organizaciones supranacionales como la Comisión Europea.

A lo largo de su carrera, Cem se ha desempeñado como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización.

Lideró la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando directamente al CEO. También lideró el crecimiento comercial de la empresa de tecnología profunda Hypatos, que alcanzó ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider.

Cem habla regularmente en conferencias internacionales de tecnología. Se graduó de la Universidad de Bogazici como ingeniero informático y tiene un MBA de Columbia Business School.
Ver perfil completo

Comentarios 4

Comparte tus ideas

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450
Abraham
Abraham
Aug 25, 2025 at 11:57

This article is updated in June while the GPT 5 is announced in August. How did you test GPT 5 in AI Hallucination Rates figure

Aleyna Daldal
Aleyna Daldal
Sep 05, 2025 at 08:46

Hi! Thanks for your comment. We use WordPress for our articles, which allows us to update graphs and tables independently of the main text. This means that even if the article text shows an earlier update date, we can still add the latest results to the figures without altering the written sections.

Rui
Rui
Aug 08, 2025 at 20:31

Hi Cem, I've been using this article as a reference of severity of hallucination. Is it possible to refresh the report with the newly released GPT-5? Thanks!

Aleyna Daldal
Aleyna Daldal
Sep 05, 2025 at 08:48

Hi Rui, Thanks a lot for your interest and for using our article as a reference. We’ve already refreshed the report with GPT-5 results, so you’ll find the latest updates included in the article.

Tim
Tim
Jul 19, 2025 at 10:13

Is there any chance that you might add Claude Sonnet/Opus 4 as well as Gemini 2.5 Pro?

Aleyna Daldal
Aleyna Daldal
Sep 05, 2025 at 08:48

Hi Tim, Thank you for your support and suggestion. Claude Sonnet/Opus 4 and Gemini 2.5 Pro have already been added to the article, so you can now see them included in the comparisons.

Joon
Joon
Feb 28, 2025 at 16:29

Hi, thank you for interesting benchmark! I was wondering Grok3's hallucination rate, both in Think mode and without. Are you planning to add these?

Cem Dilmegani
Cem Dilmegani
Mar 17, 2025 at 02:52

Hi Joon and thank you for your comment, Yes, we are waiting for API access.