Serviços
Contate-nos

VELC-Bench: Verificação em Benchmark de Contexto Longo

Cem Dilmegani
Cem Dilmegani
atualizado em 4 ago. 2026

A capacidade do modelo de localizar uma métrica específica no contexto, comparar seu valor com uma afirmação e confirmá-la ou rejeitá-la. Isso testa a correspondência precisa de valores em condições de contexto longo. O modelo deve tanto recuperar o valor quanto realizar uma comparação precisa.

Resultados

Loading Chart

Os modelos são testados nas seguintes janelas de contexto:

  • anthropic/claude-fable-5: 850.000 tokens testados
  • openai/gpt-5.5: 1.000.000 tokens
  • google/gemini-3.1-pro-preview: 1.000.000 tokens
  • google/gemini-3.5-flash: 1.000.000 tokens
  • anthropic/claude-sonnet-4.6: 1.000.000 tokens
  • qwen/qwen3.6-plus: 1.000.000 tokens
  • moonshotai/kimi-k2.6: 200.000 tokens
  • z-ai/glm-5.1: 200.000 tokens
  • minimax/minimax-m2.7: 150.000 tokens
  • openai/gpt-5.4-mini: 250.000 tokens

claude-fable-5 pontua 90.0% em verificar SIM e 94.0% em verificar NÃO. A diferença corresponde à assimetria descrita abaixo: confirmar um valor requer encontrá-lo, enquanto rejeitá-lo requer apenas identificar uma incompatibilidade.

Question formats

Verificar SIM (o valor da afirmação está correto):

Afirmação: A Receita do Q1 2026 da Adobe (ADBE) é de $6.40 bilhões.
Esperado: SIM

Verificar NÃO (o valor da afirmação está errado):

Afirmação: A Receita do Q1 2026 da Adobe (ADBE) é de $7.92 bilhões.
Esperado: NÃO

Fonte de dados

Mesmas métricas extraídas de TAKEAWAYS que na recordação direta. Para cada métrica escolhida:

  • Itens Verificar SIM usam o valor real da transcrição
  • Itens Verificar NÃO usam um valor programaticamente perturbado (8–25% de diferença, em qualquer direção, com precisão e unidades correspondentes)

Regra de pontuação

Detecção de três estados na resposta do modelo:

  1. Se a resposta contém uma frase NÃO MENCIONADO (ex.: "não mencionado", "não discutido") → previsto = not_mentioned
  2. Senão, se contém "sim" → previsto = yes
  3. Senão, se contém "não" → previsto = no

Pontuação = 1.0 se previsto == esperado, senão 0.0.

A prioridade de detecção é NÃO MENCIONADO > NÃO > SIM para evitar que "não mencionado" corresponda acidentalmente a "não" via a substring "não."

claude-fable-5 é testado através do Claude Code: ele recebe o palheiro de 850.000 tokens como um arquivo e o pesquisa com ferramentas de recuperação em vez de lê-lo de sua janela de contexto, então suas pontuações medem o modelo juntamente com o arcabouço Claude Code.

O Claude Sonnet 5 foi lançado em 30 de junho de 2026 com uma janela nativa de 1M de tokens com preço padrão, e o Claude Opus 4.8 carrega a mesma janela de 1M; ambos agora fazem parte deste conjunto de teste.1

Dois modelos de peso aberto treinados inteiramente em hardware não-Nvidia também entraram no campo de contexto longo na mesma semana: o LongCat-2.0 da Meituan, um modelo MoE de 1.6T de parâmetros com uma janela nativa de 1M de tokens construído em aceleradores de IA chineses, e o openPangu-2.0-Flash da Huawei, um modelo MoE de 92B de parâmetros com uma janela de 512K treinado em chips Ascend.2

Interpretação fase a fase

assimetria entre SIM e NÃO é informativa: SIM requer identificação positiva de um valor (mais difícil quando o alvo está mais profundo), enquanto NÃO requer apenas identificar uma incompatibilidade (mais fácil quando lido recentemente).

As fases são 0.1, 0.5 e 0.9 da janela de contexto, para ver a diferença de precisão em diferentes posições do palheiro.

O que é um bom desempenho?

Fase 2 SIM ≥ 80% e NÃO ≥ 80% indica que o modelo pode tanto confirmar quanto rejeitar em todo o palheiro.

Um modelo que pontua muito alto em NÃO mas baixo em SIM está enviesado para rejeição. Um modelo que pontua muito alto em SIM mas baixo em NÃO está confiando demais nas afirmações.

Contagem de itens

50 verify_yes + 50 verify_no = 100 itens de verificação.

O que é uma janela de contexto?

A documentação técnica da Anthropic oferece a definição canônica: a janela de contexto é "todo o texto que um modelo de linguagem pode referenciar ao gerar uma resposta, incluindo a própria resposta," distinguindo-a do corpus de treinamento maior e, em vez disso, representando uma "memória de trabalho" para o modelo.3 A IBM a define em termos quase idênticos como a quantidade de texto, em tokens, que o modelo pode considerar ou "lembrar" de uma só vez.4 A McKinsey enquadra o conceito como comparável à memória humana de curto prazo, observando que o modelo só pode "observar" uma quantidade fixa de informações de cada vez antes de combiná-las com parâmetros pré-treinados para produzir uma resposta.5

A unidade de medida é o token. A documentação de desenvolvedor da OpenAI afirma que um token corresponde a aproximadamente 4 caracteres ou 0.75 palavras para texto em inglês, embora a proporção varie conforme o idioma e conteúdo.6 A IBM descreve um token como a menor unidade que os modelos de IA de linguagem usam, uma representação legível por máquina de uma palavra, parte de uma palavra ou pontuação.4

A janela cobre o prompt do sistema, cada mensagem incluindo resultados de ferramentas e documentos, e a saída gerada combinados. A documentação da Anthropic afirma explicitamente que "a saída que o Claude gera para a rodada, incluindo seu raciocínio estendido, também conta."3 A OpenAI confirma que, para modelos de geração de texto, o prompt e a saída gerada combinados não devem exceder o comprimento máximo de contexto.6

O tamanho da janela de contexto é uma propriedade arquitetural fixa definida no momento do treinamento, não uma configuração ajustável pelo usuário. A documentação do curso de LLM do Hugging Face observa que arquiteturas Transformer base sem modificações de contexto estendido são limitadas a um comprimento máximo fixo de sequência e irão travar ou truncar a entrada quando esse comprimento for excedido, embora técnicas especializadas agora permitam que alguns modelos implantados lidem com sequências muito mais longas.7 Um modelo não pode receber uma janela de contexto maior após a implantação sem retreinamento ou técnicas de extensão especializadas.

Janela de contexto vs termos relacionados

"Comprimento do contexto" funciona como um sinônimo direto para "janela de contexto", não um conceito distinto. A IBM apresenta ambos os termos juntos, afirmando que a "janela de contexto (ou 'comprimento do contexto')" é a quantidade de texto que o modelo pode considerar de uma só vez.4 A OpenAI usa "comprimento máximo de contexto" para descrever o mesmo teto combinado de prompt mais saída.6

O limite de tokens de saída é um termo separado e mais restrito. A OpenAI expõe isso como um parâmetro distinto (como `max_tokens`) que limita apenas a porção gerada da resposta, enquanto a janela de contexto restringe o total de entrada mais saída.6

A janela de contexto é distinta da memória persistente ou agêntica entre sessões. A documentação da Anthropic para sua ferramenta de memória esclarece que a janela de contexto é efêmera e vinculada à sessão: "Sua janela de contexto pode ser reiniciada a qualquer momento, então você corre o risco de perder qualquer progresso que não esteja registrado em seu diretório de memória."8 A memória persistente, por outro lado, armazena informações em arquivos externos que sobrevivem entre sessões.8

Finalmente, a janela de contexto não é o corpus de dados no qual o modelo foi treinado. A documentação da Anthropic traça essa linha explicitamente: a janela de contexto "é diferente do grande corpus de dados no qual o modelo de linguagem foi treinado e, em vez disso, representa uma 'memória de trabalho' para o modelo."3

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Como funciona uma janela de contexto?

Antes do processamento, o texto bruto é convertido em tokens através da tokenização. O método dominante é a codificação byte pair (BPE), originalmente um algoritmo de compressão de dados de 1994 adaptado para tradução automática neural em 2016, que constrói um vocabulário mesclando iterativamente as sequências de caracteres que co-ocorrem com mais frequência.9 O BPE alimenta tokenizadores no GPT-2, GPT-3, GPT-4 e LLaMA, entre outros.9 A OpenAI observa que a tokenização é sensível ao contexto; a mesma palavra pode mapear para tokens diferentes dependendo da capitalização ou espaços em branco ao redor.10

Uma vez tokenizado, cada token é convertido em um vetor e processado através da arquitetura transformer introduzida no artigo de 2017 "Attention Is All You Need."11 O mecanismo central, auto-atenção, computa vetores Query, Key e Value para cada token, depois usa atenção de produto escalar escalonado para que cada token atenda a todos os outros tokens na sequência, incluindo a si mesmo.11 Essa comparação paralela de todos os pares de tokens é o que permite que os transformers substituam o processamento sequencial de arquiteturas recorrentes anteriores.

Durante a geração autorregressiva, o modelo produz um token por vez. O passo de auto-atenção de cada novo token requer os vetores Key e Value de cada token anterior. Em vez de recomputá-los do zero a cada passo, os LLMs de produção os armazenam após a primeira computação e os reutilizam; esse conjunto armazenado é chamado de cache KV.12 Ao reutilizar as matrizes Key e Value em cache, a complexidade de inferência por passo diminui, embora a pegada de memória do cache cresça linearmente com o comprimento do contexto e deva residir na memória da GPU durante toda a requisição.12

Tokens fora da janela são arquiteturalmente invisíveis. Como a auto-atenção só computa relações entre tokens presentes no tensor de entrada atual, e o cache KV só armazena vetores para tokens que foram alimentados no modelo, um token nunca incluído na requisição não tem representação para o modelo referenciar.11 É por isso que o estouro da janela de contexto aciona uma falha brusca na API; a API da Anthropic retorna um `invalid_request_error` 400 se apenas a entrada exceder o limite, e a geração para com um motivo de parada `model_context_window_exceeded` se a saída empurrar o total além do teto.3

Tamanhos de janela de contexto entre os principais modelos de IA

Em meados de 2026, o padrão de API de fronteira se estabeleceu em aproximadamente 1 milhão de tokens, embora o limite efetivo varie conforme a superfície de acesso.

A família GPT-5.6 da OpenAI (Sol, Terra e Luna) oferece uma janela de contexto de 1.05 milhão de tokens e 128.000 tokens de saída máxima via API.13 No entanto, a interface do consumidor ChatGPT oferece menos: quando um usuário seleciona manualmente o modo "Thinking", a janela combinada é de 256.000 tokens (128.000 de entrada mais 128.000 de saída máxima).14

O Claude Opus 5 e o Sonnet 5 da Anthropic oferecem uma janela de 1 milhão de tokens via Claude API e no Amazon Bedrock, Google Cloud e Microsoft Foundry.3

O Gemini 3.5 Flash do Google suporta uma janela de contexto de entrada de 1 milhão de tokens com até 65.536 tokens de saída.15 Alegações de que o Gemini 3.5 Pro mais recente atinge 2 milhões de tokens não puderam ser verificadas contra a documentação primária do Google no momento da redação.

O Grok 4.3 da xAI, lançado em 30 de abril de 2026, carrega uma janela de contexto de 1 milhão de tokens.16 O Llama 4 Scout da Meta anuncia uma janela de contexto de 10 milhões de tokens alcançada via uma arquitetura iRoPE, embora o modelo tenha sido pré-treinado apenas até 256.000 tokens, o que significa que o valor de 10 milhões representa capacidade extrapolada.17

O Mistral Large 3 permanece limitado a 256.000 tokens, um ponto fora da curva entre os modelos de fronteira.18 O DeepSeek-V4 é lançado em duas variantes suportando 1 milhão de tokens, alcançado através de um mecanismo de atenção eficiente.19

Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Janelas de contexto longas vs geração aumentada por recuperação

A escolha entre enfiar tokens em uma janela de contexto longa versus usar geração aumentada por recuperação (RAG) depende do tamanho do corpus e da frequência de atualização. A orientação de engenharia da Anthropic aconselha que, se uma base de conhecimento for menor que 200.000 tokens (cerca de 500 páginas), todo o corpus pode ser incluído no prompt, o que com cache de prompt se torna "significativamente mais rápido e mais custo-efetivo." Uma vez que o corpus excede esse limite, há necessidade de uma solução mais escalável.20

IA agêntica e tarefas de longa duração

Agentes de codificação e pesquisa dependem do tamanho da janela de contexto para armazenar saídas acumuladas de ferramentas e histórico de conversa. A equipe de engenharia da Anthropic documenta o gerenciamento de contexto como a restrição central para tarefas de horizonte longo, recomendando contexto "just-in-time" onde os agentes mantêm referências leves e carregam dados dinamicamente em tempo de execução em vez de carregar tudo antecipadamente.21

O Claude Code implementa isso via subagentes. Em um exemplo documentado, um subagente encarregado de pesquisar uma base de código leu 6.100 tokens de conteúdo de arquivo e retornou um resumo de 420 tokens para a sessão pai, mantendo aproximadamente 5.700 tokens de conteúdo de arquivo completamente fora da janela de contexto do agente primário.22 A janela de contexto padrão do Claude Code para o Sonnet 5 é de 1 milhão de tokens na API da Anthropic, com sessões auto-compactando por padrão em aproximadamente 967.000 tokens, ou cerca de 96.7% desse limite, a menos que uma configuração limite a janela em 200.000 tokens.23

Análise de documentos e bases de código

A documentação da API do Gemini do Google afirma que sua janela de contexto de 1 milhão de tokens é equivalente a aproximadamente 50.000 linhas de código, ilustrando a escala de uma única janela de contexto em vez de descrever um caso de uso dedicado de revisão de base de código.24

Cite esta pesquisa

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Cem Dilmegani and Şevval Alper (2026) - "VELC-Bench: Verificação em Benchmark de Contexto Longo". Publicado on-line em AIMultiple.com. Acessado em 4 Agosto 2026, em: https://aimultiple.com/ai-context-window [Recurso on-line]

Dilmegani, C., & Alper, Ş. (2026, 4 Agosto). VELC-Bench: Verificação em Benchmark de Contexto Longo. AIMultiple. https://aimultiple.com/ai-context-window

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Alper, Şevval},
  title  = {{VELC-Bench: Verificação em Benchmark de Contexto Longo}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/ai-context-window}},
  note   = {AIMultiple. Acessado em 4 Agosto 2026}
}
Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem tem sido o analista principal do AIMultiple desde 2017. O AIMultiple informa centenas de milhares de empresas (de acordo com o similarWeb), incluindo 60% das empresas da Fortune 500 todos os meses.

O trabalho de Cem foi citado por publicações globais de destaque, incluindo Business Insider, Forbes, Washington Post, empresas globais como Deloitte, HPE e ONGs como o Fórum Econômico Mundial e organizações supranacionais como a Comissão Europeia.

Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor de tecnologia. Ele aconselhou empresas em suas decisões de tecnologia na McKinsey & Company e na Altman Solon por mais de uma década. Ele também publicou um relatório da McKinsey sobre digitalização.

Ele liderou a estratégia de tecnologia e aquisições de uma empresa de telecomunicações, reportando-se ao CEO. Ele também liderou o crescimento comercial da empresa de tecnologia profunda Hypatos, que alcançou uma receita recorrente anual de 7 dígitos e uma avaliação de 9 dígitos partindo do zero em 2 anos. O trabalho de Cem na Hypatos foi coberto por publicações de tecnologia de destaque como TechCrunch e Business Insider.

Cem fala regularmente em conferências internacionais de tecnologia. Ele se formou na Universidade Bogazici como engenheiro de computação e possui um MBA pela Columbia Business School.
Ver perfil completo
Revisado tecnicamente por
Şevval Alper
Şevval Alper
Pesquisador de IA
Şevval é analista da AIMultiple, especializada em ferramentas de codificação de IA, agentes de IA e tecnologias quânticas.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450