Servicios
Contáctanos

VELC-Bench: Verificación en el Benchmark de Contexto Largo

Cem Dilmegani
Cem Dilmegani
actualizado el 4 de ago. de 2026

La capacidad del modelo para localizar una métrica específica en el contexto, comparar su valor con una afirmación y confirmarla o rechazarla. Esto evalúa la coincidencia precisa de valores en condiciones de contexto largo. El modelo debe recuperar el valor y realizar una comparación precisa.

Resultados

Loading Chart

Los modelos se evalúan en las siguientes ventanas de contexto:

  • anthropic/claude-fable-5: 850.000 tokens probados
  • openai/gpt-5.5: 1.000.000 tokens
  • google/gemini-3.1-pro-preview: 1.000.000 tokens
  • google/gemini-3.5-flash: 1.000.000 tokens
  • anthropic/claude-sonnet-4.6: 1.000.000 tokens
  • qwen/qwen3.6-plus: 1.000.000 tokens
  • moonshotai/kimi-k2.6: 200.000 tokens
  • z-ai/glm-5.1: 200.000 tokens
  • minimax/minimax-m2.7: 150.000 tokens
  • openai/gpt-5.4-mini: 250.000 tokens

claude-fable-5 obtiene 90.0 % en verificar SÍ y 94.0 % en verificar NO. La brecha coincide con la asimetría descrita a continuación: confirmar un valor requiere encontrarlo, mientras que rechazarlo solo requiere detectar una discrepancia.

Question formats

Verificar SÍ (el valor de la afirmación es correcto):

Afirmación: Los ingresos del primer trimestre de 2026 de Adobe (ADBE) son de $6.40 mil millones.
Esperado: SÍ

Verificar NO (el valor de la afirmación es incorrecto):

Afirmación: Los ingresos del primer trimestre de 2026 de Adobe (ADBE) son de $7.92 mil millones.
Esperado: NO

Fuente de datos

Las mismas métricas extraídas de TAKEAWAYS que en el recuerdo directo. Para cada métrica elegida:

  • Los elementos Verificar SÍ utilizan el valor real de la transcripción
  • Los elementos Verificar NO utilizan un valor perturbado programáticamente (entre un 8 y un 25 % de desviación, en cualquier dirección, con precisión y unidades coincidentes)

Regla de puntuación

Detección de tres estados en la respuesta del modelo:

  1. Si la respuesta contiene una frase de NO MENCIONADO (p. ej., “no mencionado”, “no discutido”) → predicho = not_mentioned
  2. De lo contrario, si contiene “sí” → predicho = yes
  3. De lo contrario, si contiene “no” → predicho = no

Puntuación = 1.0 si predicho == esperado, de lo contrario 0.0.

La prioridad de detección es NO MENCIONADO > NO > SÍ para evitar que “no mencionado” coincida accidentalmente con “no” a través de la subcadena “no”.

claude-fable-5 se prueba a través de Claude Code: recibe el pajar de 850.000 tokens como un archivo y lo busca con herramientas de recuperación en lugar de leerlo desde su ventana de contexto, por lo que sus puntuaciones miden el modelo junto con el arnés de Claude Code.

Claude Sonnet 5 se lanzó el 30 de junio de 2026 con una ventana nativa de 1M tokens a precio estándar, y Claude Opus 4.8 tiene la misma ventana de 1M; ambos ahora forman parte de este conjunto de pruebas.1

Dos modelos de peso abierto entrenados completamente en hardware no Nvidia también entraron en el campo del contexto largo la misma semana: LongCat-2.0 de Meituan, un modelo MoE de 1.6T parámetros con una ventana nativa de 1M tokens construido sobre aceleradores de IA chinos, y openPangu-2.0-Flash de Huawei, un modelo MoE de 92B parámetros con una ventana de 512K entrenado en chips Ascend.2

Interpretación fase por fase

La asimetría entre SÍ y NO es informativa: SÍ requiere la identificación positiva de un valor (más difícil cuando el objetivo está más profundo), mientras que NO solo requiere detectar una discrepancia (más fácil cuando se ha leído recientemente).

Las fases son 0.1, 0.5 y 0.9 de la ventana de contexto, para ver la diferencia en precisión en diferentes posiciones del pajar.

¿Qué es un buen rendimiento?

Fase 2 SÍ ≥ 80 % y NO ≥ 80 % indica que el modelo puede tanto confirmar como rechazar a lo largo de un pajar.

Un modelo que obtiene una puntuación muy alta en NO pero baja en SÍ está sesgado hacia el rechazo. Un modelo que obtiene una puntuación muy alta en SÍ pero baja en NO confía excesivamente en las afirmaciones.

Conteo de elementos

50 verificar_sí + 50 verificar_no = 100 elementos de verificación.

¿Qué es una ventana de contexto?

La documentación técnica de Anthropic ofrece la definición canónica: la ventana de contexto es “todo el texto al que un modelo de lenguaje puede hacer referencia al generar una respuesta, incluida la respuesta misma”, distinguiéndola del corpus de entrenamiento más amplio y representando en cambio una “memoria de trabajo” para el modelo.3 IBM la define en términos casi idénticos como la cantidad de texto, en tokens, que el modelo puede considerar o “recordar” en un momento dado.4 McKinsey enmarca el concepto como comparable a la memoria a corto plazo humana, señalando que el modelo solo puede “observar” una cantidad fija de información a la vez antes de combinarla con parámetros preentrenados para producir una respuesta.5

La unidad de medida es el token. La documentación para desarrolladores de OpenAI indica que un token corresponde aproximadamente a 4 caracteres o 0.75 palabras para texto en inglés, aunque la proporción varía según el idioma y el contenido.6 IBM describe un token como la unidad más pequeña que utilizan los modelos de IA de lenguaje, una representación legible por máquina de una palabra, parte de una palabra o puntuación.4

La ventana cubre el mensaje del sistema, cada mensaje incluyendo resultados de herramientas y documentos, y la salida generada combinados. La documentación de Anthropic afirma explícitamente que “la salida que Claude genera para el turno, incluyendo su pensamiento extendido, también cuenta”.3 OpenAI confirma que para los modelos de generación de texto, el prompt y la salida generada combinados no deben exceder la longitud máxima de contexto.6

El tamaño de la ventana de contexto es una propiedad arquitectónica fija establecida en el momento del entrenamiento, no un ajuste configurable por el usuario. La documentación del curso de LLM de Hugging Face señala que las arquitecturas Transformer base sin modificaciones de contexto extendido están limitadas a una longitud de secuencia máxima fija y fallarán o truncarán la entrada cuando se supere esa longitud, aunque técnicas especializadas ahora permiten que algunos modelos implementados manejen secuencias mucho más largas.7 Un modelo no puede recibir una ventana de contexto más grande después del despliegue sin reentrenamiento o técnicas de extensión especializadas.

Ventana de contexto vs términos relacionados

“Longitud de contexto” funciona como un sinónimo directo de “ventana de contexto”, no como un concepto distinto. IBM presenta ambos términos juntos, indicando que la “ventana de contexto (o ‘longitud de contexto’)” es la cantidad de texto que el modelo puede considerar en un momento dado.4 OpenAI utiliza “longitud máxima de contexto” para describir el mismo límite combinado de prompt más salida.6

El límite de tokens de salida es un término separado y más restringido. OpenAI lo expone como un parámetro distinto (como `max_tokens`) que limita solo la porción generada de la respuesta, mientras que la ventana de contexto restringe el total de entrada más salida.6

La ventana de contexto es distinta de la memoria persistente o agéntica entre sesiones. La documentación de Anthropic para su herramienta de memoria aclara que la ventana de contexto es efímera y vinculada a la sesión: “Tu ventana de contexto podría restablecerse en cualquier momento, por lo que corres el riesgo de perder cualquier progreso que no esté registrado en tu directorio de memoria”.8 La memoria persistente, por el contrario, almacena información en archivos externos que sobreviven entre sesiones.8

Finalmente, la ventana de contexto no es el corpus de datos con el que se entrenó el modelo. La documentación de Anthropic traza esta línea explícitamente: la ventana de contexto “es diferente del gran corpus de datos con el que se entrenó el modelo de lenguaje, y en cambio representa una ‘memoria de trabajo’ para el modelo”.3

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

¿Cómo funciona una ventana de contexto?

Antes del procesamiento, el texto sin procesar se convierte en tokens mediante tokenización. El método dominante es la codificación por pares de bytes (BPE), originalmente un algoritmo de compresión de datos de 1994 adaptado para la traducción automática neuronal en 2016, que construye un vocabulario fusionando iterativamente las secuencias de caracteres que coocurren con más frecuencia.9 BPE impulsa los tokenizadores en GPT-2, GPT-3, GPT-4 y LLaMA, entre otros.9 OpenAI señala que la tokenización es sensible al contexto; la misma palabra puede asignarse a diferentes tokens dependiendo de la capitalización o los espacios en blanco circundantes.10

Una vez tokenizado, cada token se convierte en un vector y se procesa a través de la arquitectura transformer introducida en el artículo de 2017 “Attention Is All You Need”.11 El mecanismo central, la auto-atención, calcula vectores de Consulta, Clave y Valor para cada token, luego utiliza la atención de producto escalar escalado para que cada token preste atención a todos los demás tokens en la secuencia, incluido él mismo.11 Esta comparación paralela de todos los pares de tokens es lo que permite a los transformers reemplazar el procesamiento secuencial de arquitecturas recurrentes anteriores.

Durante la generación autorregresiva, el modelo produce un token a la vez. El paso de auto-atención de cada nuevo token requiere los vectores de Clave y Valor de cada token anterior. En lugar de recalcularlos desde cero en cada paso, los LLM de producción los almacenan después del primer cálculo y los reutilizan; este conjunto almacenado se llama caché KV.12 Al reutilizar las matrices de Clave y Valor almacenadas en caché, la complejidad de la inferencia por paso disminuye, aunque la huella de memoria de la caché crece linealmente con la longitud del contexto y debe residir en la memoria de la GPU durante la solicitud.12

Los tokens fuera de la ventana son arquitectónicamente invisibles. Debido a que la auto-atención solo calcula relaciones entre los tokens presentes en el tensor de entrada actual, y la caché KV solo almacena vectores para los tokens que se introdujeron en el modelo, un token nunca incluido en la solicitud no tiene representación a la que el modelo pueda hacer referencia.11 Esta es la razón por la que el desbordamiento de la ventana de contexto desencadena un fallo grave de la API; la API de Anthropic devuelve un error 400 `invalid_request_error` si la entrada por sí sola excede el límite, y la generación se detiene con un motivo de parada `model_context_window_exceeded` si la salida empujara el total más allá del límite.3

Tamaños de ventana de contexto en los principales modelos de IA

A mediados de 2026, el valor predeterminado de la API de frontera se ha establecido en aproximadamente 1 millón de tokens, aunque el límite efectivo varía según la superficie de acceso.

La familia GPT-5.6 de OpenAI (Sol, Terra y Luna) ofrece una ventana de contexto de 1.05 millones de tokens y una salida máxima de 128.000 tokens a través de la API.13 Sin embargo, la interfaz de consumidor ChatGPT ofrece menos: cuando un usuario selecciona manualmente el modo “Thinking”, la ventana combinada es de 256.000 tokens (128.000 de entrada más 128.000 de salida máxima).14

Anthropic Claude Opus 5 y Sonnet 5 ofrecen una ventana de 1 millón de tokens a través de la Claude API y en Amazon Bedrock, Google Cloud y Microsoft Foundry.3

Gemini 3.5 Flash de Google admite una ventana de contexto de entrada de 1 millón de tokens con hasta 65.536 tokens de salida.15 Las afirmaciones de que el nuevo Gemini 3.5 Pro alcanza los 2 millones de tokens no pudieron verificarse con la documentación principal de Google en el momento de escribir este artículo.

Grok 4.3 de xAI, lanzado el 30 de abril de 2026, tiene una ventana de contexto de 1 millón de tokens.16 Llama 4 Scout de Meta anuncia una ventana de contexto de 10 millones de tokens lograda mediante una arquitectura iRoPE, aunque el modelo solo fue preentrenado hasta 256.000 tokens, lo que significa que la cifra de 10 millones representa una capacidad extrapolada.17

Mistral Large 3 permanece limitado a 256.000 tokens, un valor atípico entre los modelos de frontera.18 DeepSeek-V4 se presenta en dos variantes que admiten 1 millón de tokens, logrado mediante un mecanismo de atención eficiente.19

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Ventanas de contexto largas vs generación aumentada por recuperación

La elección entre introducir tokens en una ventana de contexto larga versus usar generación aumentada por recuperación (RAG) depende del tamaño del corpus y la frecuencia de actualización. La guía de ingeniería de Anthropic aconseja que si una base de conocimiento es menor de 200.000 tokens (aproximadamente 500 páginas), todo el corpus puede incluirse en el prompt, lo que con el almacenamiento en caché del prompt se vuelve “significativamente más rápido y rentable”. Una vez que el corpus excede ese umbral, se necesita una solución más escalable.20

IA agéntica y tareas de larga duración

Los agentes de codificación e investigación dependen del tamaño de la ventana de contexto para contener las salidas acumuladas de herramientas y el historial de la conversación. El equipo de ingeniería de Anthropic documenta la gestión del contexto como la restricción central para tareas de horizonte largo, recomendando un contexto “justo a tiempo” donde los agentes mantienen referencias ligeras y cargan datos dinámicamente en tiempo de ejecución en lugar de cargar todo por adelantado.21

Claude Code implementa esto a través de subagentes. En un ejemplo documentado, un subagente encargado de investigar un código base leyó 6.100 tokens de contenido de archivos y devolvió un resumen de 420 tokens a la sesión principal, manteniendo aproximadamente 5.700 tokens de contenido de archivos fuera de la ventana de contexto del agente principal por completo.22 La ventana de contexto predeterminada de Claude Code para Sonnet 5 es de 1 millón de tokens en la API de Anthropic, con sesiones que se compactan automáticamente de forma predeterminada a aproximadamente 967.000 tokens, o alrededor del 96.7 % de ese límite, a menos que una configuración limite la ventana a 200.000 tokens en su lugar.23

Análisis de documentos y bases de código

La documentación de la API de Gemini de Google indica que su ventana de contexto de 1 millón de tokens equivale aproximadamente a 50.000 líneas de código, lo que ilustra la escala de una sola ventana de contexto en lugar de describir un caso de uso específico de revisión de base de código.24

Cita esta investigación

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Cem Dilmegani and Şevval Alper (2026) - "VELC-Bench: Verificación en el Benchmark de Contexto Largo". Publicado en línea en AIMultiple.com. Recuperado el 4 de Agosto de 2026, de: https://aimultiple.com/ai-context-window [Recurso en línea]

Dilmegani, C., & Alper, Ş. (2026, 4 de Agosto). VELC-Bench: Verificación en el Benchmark de Contexto Largo. AIMultiple. https://aimultiple.com/ai-context-window

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Alper, Şevval},
  title  = {{VELC-Bench: Verificación en el Benchmark de Contexto Largo}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/ai-context-window}},
  note   = {AIMultiple. Recuperado el 4 de Agosto de 2026}
}
Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem ha sido el analista principal en AIMultiple desde 2017. AIMultiple informa a cientos de miles de empresas (según similarWeb), incluido el 60% de Fortune 500 cada mes.

El trabajo de Cem ha sido citado por publicaciones globales líderes como Business Insider, Forbes, Washington Post, firmas globales como Deloitte, HPE y ONG como el Foro Económico Mundial y organizaciones supranacionales como la Comisión Europea.

A lo largo de su carrera, Cem se ha desempeñado como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización.

Lideró la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando directamente al CEO. También lideró el crecimiento comercial de la empresa de tecnología profunda Hypatos, que alcanzó ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider.

Cem habla regularmente en conferencias internacionales de tecnología. Se graduó de la Universidad de Bogazici como ingeniero informático y tiene un MBA de Columbia Business School.
Ver perfil completo
Revisado técnicamente por
Şevval Alper
Şevval Alper
Investigador de IA
Şevval es analista del sector en AIMultiple, especializado en herramientas de codificación de IA, agentes de IA y tecnologías cuánticas.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450