A capacidade do modelo de localizar uma métrica específica no contexto, comparar seu valor a uma afirmação e confirmá-la ou rejeitá-la. Isso testa a correspondência precisa de valores sob condições de contexto longo. O modelo precisa tanto recuperar o valor quanto realizar uma comparação precisa.
Resultados
Os modelos são testados nas seguintes janelas de contexto:
- anthropic/claude-fable-5: 850,000 tokens testados
- openai/gpt-5.5: 1,000,000 tokens
- google/gemini-3.1-pro-preview: 1,000,000 tokens
- google/gemini-3.5-flash: 1,000,000 tokens
- anthropic/claude-sonnet-4.6: 1,000,000 tokens
- qwen/qwen3.6-plus: 1,000,000 tokens
- moonshotai/kimi-k2.6: 200,000 tokens
- z-ai/glm-5.1: 200,000 tokens
- minimax/minimax-m2.7: 150,000 tokens
- openai/gpt-5.4-mini: 250,000 tokens
claude-fable-5 obtém 90,0% em verify YES e 94,0% em verify NO. A diferença corresponde à assimetria descrita abaixo: confirmar um valor exige encontrá-lo, enquanto rejeitá-lo exige apenas identificar uma incompatibilidade.
Question formats
Verify YES (o valor da afirmação está correto):
Afirmação: A Receita do 1º trimestre de 2026 da Adobe (ADBE) é de US$ 6,40 bilhões.
Esperado: YES
Verify NO (o valor da afirmação está errado):
Afirmação: A Receita do 1º trimestre de 2026 da Adobe (ADBE) é de US$ 7,92 bilhões.
Esperado: NO
Fonte dos dados
Métricas extraídas do TAKEAWAYS, iguais às da recordação direta. Para cada métrica escolhida:
- Os itens Verify YES usam o valor real da transcrição
- Os itens Verify NO usam um valor alterado programaticamente (8–25% de diferença, em qualquer direção, com precisão e unidades correspondentes)
Regra de pontuação
Detecção de três estados na resposta do modelo:
- Se a resposta contiver uma frase de NÃO MENCIONADO (por exemplo, "não mencionado", "não discutido") → previsto =
not_mentioned - Caso contrário, se contiver "yes" → previsto =
yes - Caso contrário, se contiver "no" → previsto =
no
Pontuação = 1,0 se previsto == esperado, caso contrário 0,0.
A prioridade de detecção é NÃO MENCIONADO > NO > YES para evitar que "não mencionado" corresponda acidentalmente a "no" por meio da substring "não".
claude-fable-5 é testado por meio do Claude Code: ele recebe o palheiro de 850.000 tokens como um arquivo e o pesquisa com ferramentas de recuperação, em vez de lê-lo a partir de sua janela de contexto, de modo que suas pontuações medem o modelo juntamente com o ambiente do Claude Code.
Claude Sonnet 5 foi lançado em 30 de junho de 2026 com uma janela nativa de 1M de tokens a preço padrão, e o Claude Opus 4.8 possui a mesma janela de 1M; ambos agora fazem parte deste conjunto de testes.1
Dois modelos de código aberto treinados inteiramente em hardware não Nvidia também entraram no campo de contexto longo na mesma semana: o LongCat-2.0 da Meituan, um modelo MoE de 1,6T parâmetros com uma janela nativa de 1M de tokens construído em aceleradores de IA chineses, e o openPangu-2.0-Flash da Huawei, um modelo MoE de 92B parâmetros com uma janela de 512K treinado em chips Ascend.2
Interpretação fase a fase
A assimetria entre YES e NO é informativa: YES exige a identificação positiva de um valor (mais difícil quando o alvo está mais profundo), enquanto NO exige apenas identificar uma incompatibilidade (mais fácil quando lido recentemente).
As fases são 0,1, 0,5 e 0,9 da janela de contexto, para ver a diferença de precisão em diferentes posições do palheiro.
O que é um bom desempenho?
Fase 2 YES ≥ 80% e NO ≥ 80% indica que o modelo consegue tanto confirmar quanto rejeitar ao longo de um palheiro.
Um modelo que pontua muito alto em NO, mas baixo em YES, está enviesado para a rejeição. Um modelo que pontua muito alto em YES, mas baixo em NO, está confiando demais nas afirmações.
Contagem de itens
50 verify_yes + 50 verify_no = 100 itens de verificação.
Cite esta pesquisa
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{VELC-Bench: Verificação em Benchmark de Contexto Longo}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/ai-context-window}},
note = {AIMultiple. Acessado em 22 Julho 2026}
}
Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.