Servizi
Contattaci

VELC-Bench: Verifica su Benchmark a Lungo Contesto

Cem Dilmegani
Cem Dilmegani
aggiornato il 22 lug. 2026

La capacità del modello di individuare una metrica specifica nel contesto, confrontare il suo valore con un'affermazione e confermarla o respingerla. Questo testa il matching preciso dei valori in condizioni di contesto lungo. Il modello deve sia recuperare il valore che eseguire un confronto preciso.

Risultati

Loading Chart

I modelli vengono testati nelle seguenti finestre di contesto:

  • anthropic/claude-fable-5: 850,000 token testati
  • openai/gpt-5.5: 1,000,000 token
  • google/gemini-3.1-pro-preview: 1,000,000 token
  • google/gemini-3.5-flash: 1,000,000 token
  • anthropic/claude-sonnet-4.6: 1,000,000 token
  • qwen/qwen3.6-plus: 1,000,000 token
  • moonshotai/kimi-k2.6: 200,000 token
  • z-ai/glm-5.1: 200,000 token
  • minimax/minimax-m2.7: 150,000 token
  • openai/gpt-5.4-mini: 250,000 token

claude-fable-5 ottiene 90.0% su verify YES e 94.0% su verify NO. Il divario corrisponde all'asimmetria descritta di seguito: confermare un valore richiede di trovarlo, mentre respingerlo richiede solo di individuare una discrepanza.

Question formats

Verify YES (il valore dell'affermazione è corretto):

Claim: Il fatturato del Q1 2026 di Adobe (ADBE) è di $6.40 miliardi.
Expected: YES

Verify NO (il valore dell'affermazione è sbagliato):

Claim: Il fatturato del Q1 2026 di Adobe (ADBE) è di $7.92 miliardi.
Expected: NO

Fonte dei dati

Stesse metriche estratte da TAKEAWAYS come nel richiamo diretto. Per ciascuna metrica scelta:

  • Verify YES gli elementi utilizzano il valore effettivo dalla trascrizione
  • Verify NO gli elementi utilizzano un valore perturbato programmaticamente (scostamento dell'8–25%, in entrambe le direzioni, con precisione e unità corrispondenti)

Regola di punteggio

Rilevamento a tre stati sulla risposta del modello:

  1. Se la risposta contiene una frase NOT MENTIONED (ad es., “not mentioned,” “not discussed”) → previsto = not_mentioned
  2. Altrimenti, se contiene “yes” → previsto = yes
  3. Altrimenti, se contiene “no” → previsto = no

Punteggio = 1.0 se previsto == atteso, altrimenti 0.0.

La priorità di rilevamento è NOT MENTIONED > NO > YES per evitare che “not mentioned” corrisponda accidentalmente a “no” tramite la sottostringa “not”.

claude-fable-5 viene testato tramite Claude Code: riceve il pagliaio di 850,000 token come file e lo cerca con strumenti di recupero anziché leggerlo dalla sua finestra di contesto, quindi i suoi punteggi misurano il modello insieme al harness di Claude Code.

Claude Sonnet 5 è stato lanciato il 30 giugno 2026 con una finestra nativa di 1M token a prezzo standard, e Claude Opus 4.8 ha la stessa finestra di 1M; entrambi ora fanno parte di questo set di test.1

Due modelli open-weight addestrati interamente su hardware non-Nvidia sono entrati nel campo del contesto lungo nella stessa settimana: LongCat-2.0 di Meituan, un modello MoE da 1.6T parametri con una finestra nativa di 1M token costruito su acceleratori IA cinesi, e openPangu-2.0-Flash di Huawei, un modello MoE da 92B parametri con una finestra di 512K addestrato su chip Ascend.2

Interpretazione fase per fase

L'asimmetria tra YES e NO è informativa: YES richiede l'identificazione positiva di un valore (più difficile quando il target è più profondo), mentre NO richiede solo di individuare una discrepanza (più facile quando letto di recente).

Le fasi sono 0.1, 0.5 e 0.9 della finestra di contesto, per vedere la differenza di accuratezza in diverse posizioni del pagliaio.

Cosa è una buona performance?

Fase 2 YES ≥ 80% e NO ≥ 80% indica che il modello può sia confermare che respingere attraverso un pagliaio.

Un modello che ottiene un punteggio molto alto su NO ma basso su YES è sbilanciato verso il rifiuto. Un modello che ottiene un punteggio molto alto su YES ma basso su NO si fida eccessivamente delle affermazioni.

Conteggio elementi

50 verify_yes + 50 verify_no = 100 elementi verify.

Cita questa ricerca

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Cem Dilmegani (2026) - "VELC-Bench: Verifica su Benchmark a Lungo Contesto". Pubblicato online su AIMultiple.com. Consultato il 22 Luglio 2026, da: https://aimultiple.com/ai-context-window [Risorsa online]

Dilmegani, C. (2026, 22 Luglio). VELC-Bench: Verifica su Benchmark a Lungo Contesto. AIMultiple. https://aimultiple.com/ai-context-window

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{VELC-Bench: Verifica su Benchmark a Lungo Contesto}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/ai-context-window}},
  note   = {AIMultiple. Consultato il 22 Luglio 2026}
}
Cem Dilmegani
Cem Dilmegani
Analista principale
Cem è l'analista principale di AIMultiple dal 2017. AIMultiple informa centinaia di migliaia di aziende (secondo SimilarWeb) compreso il 60% delle Fortune 500 ogni mese.

Il lavoro di Cem è stato citato da importanti pubblicazioni globali tra cui Business Insider, Forbes, Washington Post, aziende globali come Deloitte, HPE e ONG come il World Economic Forum e organizzazioni sovranazionali come la Commissione europea.

Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, acquirente di tecnologia e imprenditore tecnologico. Ha consigliato aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per oltre un decennio. Ha anche pubblicato un rapporto McKinsey sulla digitalizzazione.

Ha guidato la strategia tecnologica e gli approvvigionamenti di una società di telecomunicazioni rispondendo direttamente al CEO. Ha anche guidato la crescita commerciale dell'azienda deep tech Hypatos che ha raggiunto un fatturato annuo ricorrente a 7 cifre e una valutazione a 9 cifre partendo da 0 in 2 anni. Il lavoro di Cem in Hypatos è stato trattato da importanti pubblicazioni tecnologiche come TechCrunch e Business Insider.

Cem interviene regolarmente a conferenze tecnologiche internazionali. Si è laureato in ingegneria informatica all'Università Bogazici e ha conseguito un MBA presso la Columbia Business School.
Visualizza il profilo completo

Sii il primo a commentare

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450