Serviços
Contate-nos

VELC-Bench: Verificação em Benchmark de Contexto Longo

Cem Dilmegani
Cem Dilmegani
atualizado em 22 jul. 2026

A capacidade do modelo de localizar uma métrica específica no contexto, comparar seu valor a uma afirmação e confirmá-la ou rejeitá-la. Isso testa a correspondência precisa de valores sob condições de contexto longo. O modelo precisa tanto recuperar o valor quanto realizar uma comparação precisa.

Resultados

Loading Chart

Os modelos são testados nas seguintes janelas de contexto:

  • anthropic/claude-fable-5: 850,000 tokens testados
  • openai/gpt-5.5: 1,000,000 tokens
  • google/gemini-3.1-pro-preview: 1,000,000 tokens
  • google/gemini-3.5-flash: 1,000,000 tokens
  • anthropic/claude-sonnet-4.6: 1,000,000 tokens
  • qwen/qwen3.6-plus: 1,000,000 tokens
  • moonshotai/kimi-k2.6: 200,000 tokens
  • z-ai/glm-5.1: 200,000 tokens
  • minimax/minimax-m2.7: 150,000 tokens
  • openai/gpt-5.4-mini: 250,000 tokens

claude-fable-5 obtém 90,0% em verify YES e 94,0% em verify NO. A diferença corresponde à assimetria descrita abaixo: confirmar um valor exige encontrá-lo, enquanto rejeitá-lo exige apenas identificar uma incompatibilidade.

Question formats

Verify YES (o valor da afirmação está correto):

Afirmação: A Receita do 1º trimestre de 2026 da Adobe (ADBE) é de US$ 6,40 bilhões.
Esperado: YES

Verify NO (o valor da afirmação está errado):

Afirmação: A Receita do 1º trimestre de 2026 da Adobe (ADBE) é de US$ 7,92 bilhões.
Esperado: NO

Fonte dos dados

Métricas extraídas do TAKEAWAYS, iguais às da recordação direta. Para cada métrica escolhida:

  • Os itens Verify YES usam o valor real da transcrição
  • Os itens Verify NO usam um valor alterado programaticamente (8–25% de diferença, em qualquer direção, com precisão e unidades correspondentes)

Regra de pontuação

Detecção de três estados na resposta do modelo:

  1. Se a resposta contiver uma frase de NÃO MENCIONADO (por exemplo, "não mencionado", "não discutido") → previsto = not_mentioned
  2. Caso contrário, se contiver "yes" → previsto = yes
  3. Caso contrário, se contiver "no" → previsto = no

Pontuação = 1,0 se previsto == esperado, caso contrário 0,0.

A prioridade de detecção é NÃO MENCIONADO > NO > YES para evitar que "não mencionado" corresponda acidentalmente a "no" por meio da substring "não".

claude-fable-5 é testado por meio do Claude Code: ele recebe o palheiro de 850.000 tokens como um arquivo e o pesquisa com ferramentas de recuperação, em vez de lê-lo a partir de sua janela de contexto, de modo que suas pontuações medem o modelo juntamente com o ambiente do Claude Code.

Claude Sonnet 5 foi lançado em 30 de junho de 2026 com uma janela nativa de 1M de tokens a preço padrão, e o Claude Opus 4.8 possui a mesma janela de 1M; ambos agora fazem parte deste conjunto de testes.1

Dois modelos de código aberto treinados inteiramente em hardware não Nvidia também entraram no campo de contexto longo na mesma semana: o LongCat-2.0 da Meituan, um modelo MoE de 1,6T parâmetros com uma janela nativa de 1M de tokens construído em aceleradores de IA chineses, e o openPangu-2.0-Flash da Huawei, um modelo MoE de 92B parâmetros com uma janela de 512K treinado em chips Ascend.2

Interpretação fase a fase

A assimetria entre YES e NO é informativa: YES exige a identificação positiva de um valor (mais difícil quando o alvo está mais profundo), enquanto NO exige apenas identificar uma incompatibilidade (mais fácil quando lido recentemente).

As fases são 0,1, 0,5 e 0,9 da janela de contexto, para ver a diferença de precisão em diferentes posições do palheiro.

O que é um bom desempenho?

Fase 2 YES ≥ 80% e NO ≥ 80% indica que o modelo consegue tanto confirmar quanto rejeitar ao longo de um palheiro.

Um modelo que pontua muito alto em NO, mas baixo em YES, está enviesado para a rejeição. Um modelo que pontua muito alto em YES, mas baixo em NO, está confiando demais nas afirmações.

Contagem de itens

50 verify_yes + 50 verify_no = 100 itens de verificação.

Cite esta pesquisa

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Cem Dilmegani (2026) - "VELC-Bench: Verificação em Benchmark de Contexto Longo". Publicado on-line em AIMultiple.com. Acessado em 22 Julho 2026, em: https://aimultiple.com/ai-context-window [Recurso on-line]

Dilmegani, C. (2026, 22 Julho). VELC-Bench: Verificação em Benchmark de Contexto Longo. AIMultiple. https://aimultiple.com/ai-context-window

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{VELC-Bench: Verificação em Benchmark de Contexto Longo}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/ai-context-window}},
  note   = {AIMultiple. Acessado em 22 Julho 2026}
}
Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem tem sido o analista principal do AIMultiple desde 2017. O AIMultiple informa centenas de milhares de empresas (de acordo com o similarWeb), incluindo 60% das empresas da Fortune 500 todos os meses. O trabalho de Cem foi citado por publicações globais de destaque, incluindo Business Insider, Forbes, Washington Post, empresas globais como Deloitte, HPE e ONGs como o Fórum Econômico Mundial e organizações supranacionais como a Comissão Europeia. Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor de tecnologia. Ele aconselhou empresas em suas decisões de tecnologia na McKinsey & Company e na Altman Solon por mais de uma década. Ele também publicou um relatório da McKinsey sobre digitalização. Ele liderou a estratégia de tecnologia e aquisições de uma empresa de telecomunicações, reportando-se ao CEO. Ele também liderou o crescimento comercial da empresa de tecnologia profunda Hypatos, que alcançou uma receita recorrente anual de 7 dígitos e uma avaliação de 9 dígitos partindo do zero em 2 anos. O trabalho de Cem na Hypatos foi coberto por publicações de tecnologia de destaque como TechCrunch e Business Insider. Cem fala regularmente em conferências internacionais de tecnologia. Ele se formou na Universidade Bogazici como engenheiro de computação e possui um MBA pela Columbia Business School.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450