Servicios
Contáctanos

VELC-Bench: Verificación en Benchmark de Contexto Largo

Cem Dilmegani
Cem Dilmegani
actualizado el 22 de jul. de 2026

La capacidad del modelo para localizar una métrica específica en el contexto, comparar su valor con una afirmación, y confirmarla o rechazarla. Esto prueba la coincidencia de valores con gran detalle en condiciones de contexto largo. El modelo debe recuperar el valor y realizar una comparación precisa.

Resultados

Loading Chart

Los modelos se prueban en las siguientes ventanas de contexto:

  • anthropic/claude-fable-5: 850,000 tokens probados
  • openai/gpt-5.5: 1,000,000 tokens
  • google/gemini-3.1-pro-preview: 1,000,000 tokens
  • google/gemini-3.5-flash: 1,000,000 tokens
  • anthropic/claude-sonnet-4.6: 1,000,000 tokens
  • qwen/qwen3.6-plus: 1,000,000 tokens
  • moonshotai/kimi-k2.6: 200,000 tokens
  • z-ai/glm-5.1: 200,000 tokens
  • minimax/minimax-m2.7: 150,000 tokens
  • openai/gpt-5.4-mini: 250,000 tokens

claude-fable-5 obtiene 90.0% en verificar YES y 94.0% en verificar NO. La brecha coincide con la asimetría descrita a continuación: confirmar un valor requiere encontrarlo, mientras que rechazar uno solo requiere detectar una discrepancia.

Question formats

Verificar YES (el valor de la afirmación es correcto):

Afirmación: Los ingresos del primer trimestre de 2026 de Adobe (ADBE) son $6.40 mil millones.
Esperado: YES

Verificar NO (el valor de la afirmación es incorrecto):

Afirmación: Los ingresos del primer trimestre de 2026 de Adobe (ADBE) son $7.92 mil millones.
Esperado: NO

Fuente de datos

Mismas métricas extraídas de TAKEAWAYS que para el recuerdo directo. Para cada métrica elegida:

  • Verificar YES los elementos usan el valor real de la transcripción
  • Verificar NO los elementos usan un valor perturbado programáticamente (8–25% de diferencia, en cualquier dirección, con precisión y unidades coincidentes)

Regla de puntuación

Detección de tres estados en la respuesta del modelo:

  1. Si la respuesta contiene una frase de NO MENCIONADO (por ejemplo, “not mentioned”, “not discussed”) → predicted = not_mentioned
  2. De lo contrario, si contiene “yes” → predicted = yes
  3. De lo contrario, si contiene “no” → predicted = no

Puntuación = 1.0 si predicted == expected, de lo contrario 0.0.

La prioridad de detección es NO MENCIONADO > NO > YES para evitar que “not mentioned” coincida accidentalmente con “no” debido a la subcadena “not”.

claude-fable-5 se prueba a través de Claude Code: recibe el pajar de 850,000 tokens como un archivo y lo busca con herramientas de recuperación en lugar de leerlo desde su ventana de contexto, por lo que sus puntuaciones miden el modelo junto con el arnés de Claude Code.

Claude Sonnet 5 se lanzó el 30 de junio de 2026 con una ventana nativa de 1M tokens a precio estándar, y Claude Opus 4.8 lleva la misma ventana de 1M tokens, ambos son ahora parte de este conjunto de pruebas.1

Dos modelos de peso abierto entrenados completamente en hardware no-Nvidia también entraron en el campo de contexto largo la misma semana: LongCat-2.0 de Meituan, un modelo MoE de 1.6T parámetros con una ventana nativa de 1M tokens construido sobre aceleradores de IA chinos, y openPangu-2.0-Flash de Huawei, un modelo MoE de 92B parámetros con una ventana de 512K entrenado en chips Ascend.2

Interpretación fase por fase

La asimetría entre YES y NO es informativa: YES requiere identificación positiva de un valor (más difícil cuando el objetivo está más profundo), mientras que NO solo requiere detectar una discrepancia (más fácil cuando se ha leído recientemente).

Las fases son 0.1, 0.5 y 0.9 de la ventana de contexto, para ver la diferencia en precisión en diferentes posiciones del pajar.

¿Qué es un buen rendimiento?

Fase 2 YES ≥ 80% y NO ≥ 80% indica que el modelo puede tanto confirmar como rechazar a lo largo del pajar.

Un modelo que obtiene una puntuación muy alta en NO pero baja en YES está sesgado hacia el rechazo. Un modelo que obtiene una puntuación muy alta en YES pero baja en NO está confiando demasiado en las afirmaciones.

Recuento de elementos

50 verify_yes + 50 verify_no = 100 ítems de verificación.

Cita esta investigación

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Cem Dilmegani (2026) - "VELC-Bench: Verificación en Benchmark de Contexto Largo". Publicado en línea en AIMultiple.com. Recuperado el 22 de Julio de 2026, de: https://aimultiple.com/ai-context-window [Recurso en línea]

Dilmegani, C. (2026, 22 de Julio). VELC-Bench: Verificación en Benchmark de Contexto Largo. AIMultiple. https://aimultiple.com/ai-context-window

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{VELC-Bench: Verificación en Benchmark de Contexto Largo}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/ai-context-window}},
  note   = {AIMultiple. Recuperado el 22 de Julio de 2026}
}
Cem Dilmegani
Cem Dilmegani
Analista principal
Cem ha sido el analista principal de AIMultiple desde 2017. AIMultiple informa a cientos de miles de empresas (según similarWeb), incluyendo el 55% de las empresas Fortune 500 cada mes. El trabajo de Cem ha sido citado por importantes publicaciones globales como Business Insider, Forbes, Washington Post, firmas globales como Deloitte, HPE y ONG como el Foro Económico Mundial y organizaciones supranacionales como la Comisión Europea. Puede consultar más empresas y recursos de renombre que citan a AIMultiple. A lo largo de su carrera, Cem se desempeñó como consultor, comprador y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización. Lideró la estrategia y adquisición de tecnología de una empresa de telecomunicaciones, reportando directamente al CEO. Asimismo, lideró el crecimiento comercial de la empresa de tecnología avanzada Hypatos, que alcanzó ingresos recurrentes anuales de siete cifras y una valoración de nueve cifras partiendo de cero en tan solo dos años. El trabajo de Cem en Hypatos fue reseñado por importantes publicaciones tecnológicas como TechCrunch y Business Insider. Cem participa regularmente como ponente en conferencias internacionales de tecnología. Se graduó en ingeniería informática por la Universidad de Bogazici y posee un MBA de la Columbia Business School.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450