La capacidad del modelo para localizar una métrica específica en el contexto, comparar su valor con una afirmación, y confirmarla o rechazarla. Esto prueba la coincidencia de valores con gran detalle en condiciones de contexto largo. El modelo debe recuperar el valor y realizar una comparación precisa.
Resultados
Los modelos se prueban en las siguientes ventanas de contexto:
- anthropic/claude-fable-5: 850,000 tokens probados
- openai/gpt-5.5: 1,000,000 tokens
- google/gemini-3.1-pro-preview: 1,000,000 tokens
- google/gemini-3.5-flash: 1,000,000 tokens
- anthropic/claude-sonnet-4.6: 1,000,000 tokens
- qwen/qwen3.6-plus: 1,000,000 tokens
- moonshotai/kimi-k2.6: 200,000 tokens
- z-ai/glm-5.1: 200,000 tokens
- minimax/minimax-m2.7: 150,000 tokens
- openai/gpt-5.4-mini: 250,000 tokens
claude-fable-5 obtiene 90.0% en verificar YES y 94.0% en verificar NO. La brecha coincide con la asimetría descrita a continuación: confirmar un valor requiere encontrarlo, mientras que rechazar uno solo requiere detectar una discrepancia.
Question formats
Verificar YES (el valor de la afirmación es correcto):
Afirmación: Los ingresos del primer trimestre de 2026 de Adobe (ADBE) son $6.40 mil millones.
Esperado: YES
Verificar NO (el valor de la afirmación es incorrecto):
Afirmación: Los ingresos del primer trimestre de 2026 de Adobe (ADBE) son $7.92 mil millones.
Esperado: NO
Fuente de datos
Mismas métricas extraídas de TAKEAWAYS que para el recuerdo directo. Para cada métrica elegida:
- Verificar YES los elementos usan el valor real de la transcripción
- Verificar NO los elementos usan un valor perturbado programáticamente (8–25% de diferencia, en cualquier dirección, con precisión y unidades coincidentes)
Regla de puntuación
Detección de tres estados en la respuesta del modelo:
- Si la respuesta contiene una frase de NO MENCIONADO (por ejemplo, “not mentioned”, “not discussed”) → predicted =
not_mentioned - De lo contrario, si contiene “yes” → predicted =
yes - De lo contrario, si contiene “no” → predicted =
no
Puntuación = 1.0 si predicted == expected, de lo contrario 0.0.
La prioridad de detección es NO MENCIONADO > NO > YES para evitar que “not mentioned” coincida accidentalmente con “no” debido a la subcadena “not”.
claude-fable-5 se prueba a través de Claude Code: recibe el pajar de 850,000 tokens como un archivo y lo busca con herramientas de recuperación en lugar de leerlo desde su ventana de contexto, por lo que sus puntuaciones miden el modelo junto con el arnés de Claude Code.
Claude Sonnet 5 se lanzó el 30 de junio de 2026 con una ventana nativa de 1M tokens a precio estándar, y Claude Opus 4.8 lleva la misma ventana de 1M tokens, ambos son ahora parte de este conjunto de pruebas.1
Dos modelos de peso abierto entrenados completamente en hardware no-Nvidia también entraron en el campo de contexto largo la misma semana: LongCat-2.0 de Meituan, un modelo MoE de 1.6T parámetros con una ventana nativa de 1M tokens construido sobre aceleradores de IA chinos, y openPangu-2.0-Flash de Huawei, un modelo MoE de 92B parámetros con una ventana de 512K entrenado en chips Ascend.2
Interpretación fase por fase
La asimetría entre YES y NO es informativa: YES requiere identificación positiva de un valor (más difícil cuando el objetivo está más profundo), mientras que NO solo requiere detectar una discrepancia (más fácil cuando se ha leído recientemente).
Las fases son 0.1, 0.5 y 0.9 de la ventana de contexto, para ver la diferencia en precisión en diferentes posiciones del pajar.
¿Qué es un buen rendimiento?
Fase 2 YES ≥ 80% y NO ≥ 80% indica que el modelo puede tanto confirmar como rechazar a lo largo del pajar.
Un modelo que obtiene una puntuación muy alta en NO pero baja en YES está sesgado hacia el rechazo. Un modelo que obtiene una puntuación muy alta en YES pero baja en NO está confiando demasiado en las afirmaciones.
Recuento de elementos
50 verify_yes + 50 verify_no = 100 ítems de verificación.
Cita esta investigación
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{VELC-Bench: Verificación en Benchmark de Contexto Largo}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/ai-context-window}},
note = {AIMultiple. Recuperado el 22 de Julio de 2026}
}
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.