La capacità del modello di individuare una metrica specifica nel contesto, confrontare il suo valore con un'affermazione e confermarla o respingerla. Questo testa il matching preciso dei valori in condizioni di contesto lungo. Il modello deve sia recuperare il valore che eseguire un confronto preciso.
Risultati
I modelli vengono testati nelle seguenti finestre di contesto:
- anthropic/claude-fable-5: 850,000 token testati
- openai/gpt-5.5: 1,000,000 token
- google/gemini-3.1-pro-preview: 1,000,000 token
- google/gemini-3.5-flash: 1,000,000 token
- anthropic/claude-sonnet-4.6: 1,000,000 token
- qwen/qwen3.6-plus: 1,000,000 token
- moonshotai/kimi-k2.6: 200,000 token
- z-ai/glm-5.1: 200,000 token
- minimax/minimax-m2.7: 150,000 token
- openai/gpt-5.4-mini: 250,000 token
claude-fable-5 ottiene 90.0% su verify YES e 94.0% su verify NO. Il divario corrisponde all'asimmetria descritta di seguito: confermare un valore richiede di trovarlo, mentre respingerlo richiede solo di individuare una discrepanza.
Question formats
Verify YES (il valore dell'affermazione è corretto):
Claim: Il fatturato del Q1 2026 di Adobe (ADBE) è di $6.40 miliardi.
Expected: YES
Verify NO (il valore dell'affermazione è sbagliato):
Claim: Il fatturato del Q1 2026 di Adobe (ADBE) è di $7.92 miliardi.
Expected: NO
Fonte dei dati
Stesse metriche estratte da TAKEAWAYS come nel richiamo diretto. Per ciascuna metrica scelta:
- Verify YES gli elementi utilizzano il valore effettivo dalla trascrizione
- Verify NO gli elementi utilizzano un valore perturbato programmaticamente (scostamento dell'8–25%, in entrambe le direzioni, con precisione e unità corrispondenti)
Regola di punteggio
Rilevamento a tre stati sulla risposta del modello:
- Se la risposta contiene una frase NOT MENTIONED (ad es., “not mentioned,” “not discussed”) → previsto =
not_mentioned - Altrimenti, se contiene “yes” → previsto =
yes - Altrimenti, se contiene “no” → previsto =
no
Punteggio = 1.0 se previsto == atteso, altrimenti 0.0.
La priorità di rilevamento è NOT MENTIONED > NO > YES per evitare che “not mentioned” corrisponda accidentalmente a “no” tramite la sottostringa “not”.
claude-fable-5 viene testato tramite Claude Code: riceve il pagliaio di 850,000 token come file e lo cerca con strumenti di recupero anziché leggerlo dalla sua finestra di contesto, quindi i suoi punteggi misurano il modello insieme al harness di Claude Code.
Claude Sonnet 5 è stato lanciato il 30 giugno 2026 con una finestra nativa di 1M token a prezzo standard, e Claude Opus 4.8 ha la stessa finestra di 1M; entrambi ora fanno parte di questo set di test.1
Due modelli open-weight addestrati interamente su hardware non-Nvidia sono entrati nel campo del contesto lungo nella stessa settimana: LongCat-2.0 di Meituan, un modello MoE da 1.6T parametri con una finestra nativa di 1M token costruito su acceleratori IA cinesi, e openPangu-2.0-Flash di Huawei, un modello MoE da 92B parametri con una finestra di 512K addestrato su chip Ascend.2
Interpretazione fase per fase
L'asimmetria tra YES e NO è informativa: YES richiede l'identificazione positiva di un valore (più difficile quando il target è più profondo), mentre NO richiede solo di individuare una discrepanza (più facile quando letto di recente).
Le fasi sono 0.1, 0.5 e 0.9 della finestra di contesto, per vedere la differenza di accuratezza in diverse posizioni del pagliaio.
Cosa è una buona performance?
Fase 2 YES ≥ 80% e NO ≥ 80% indica che il modello può sia confermare che respingere attraverso un pagliaio.
Un modello che ottiene un punteggio molto alto su NO ma basso su YES è sbilanciato verso il rifiuto. Un modello che ottiene un punteggio molto alto su YES ma basso su NO si fida eccessivamente delle affermazioni.
Conteggio elementi
50 verify_yes + 50 verify_no = 100 elementi verify.
Cita questa ricerca
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{VELC-Bench: Verifica su Benchmark a Lungo Contesto}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/ai-context-window}},
note = {AIMultiple. Consultato il 22 Luglio 2026}
}Collegamenti di riferimento
Il lavoro di Cem è stato citato da importanti pubblicazioni globali tra cui Business Insider, Forbes, Washington Post, aziende globali come Deloitte, HPE e ONG come il World Economic Forum e organizzazioni sovranazionali come la Commissione europea.
Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, acquirente di tecnologia e imprenditore tecnologico. Ha consigliato aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per oltre un decennio. Ha anche pubblicato un rapporto McKinsey sulla digitalizzazione.
Ha guidato la strategia tecnologica e gli approvvigionamenti di una società di telecomunicazioni rispondendo direttamente al CEO. Ha anche guidato la crescita commerciale dell'azienda deep tech Hypatos che ha raggiunto un fatturato annuo ricorrente a 7 cifre e una valutazione a 9 cifre partendo da 0 in 2 anni. Il lavoro di Cem in Hypatos è stato trattato da importanti pubblicazioni tecnologiche come TechCrunch e Business Insider.
Cem interviene regolarmente a conferenze tecnologiche internazionali. Si è laureato in ingegneria informatica all'Università Bogazici e ha conseguito un MBA presso la Columbia Business School.
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.