Services
Contactez-nous

VELC-Bench: Vérification sur un benchmark à contexte long

Cem Dilmegani
Cem Dilmegani
mis à jour le 22 juil. 2026

La capacité du modèle à localiser une métrique spécifique dans le contexte, à comparer sa valeur à une affirmation, et à la confirmer ou la rejeter. Cela teste la correspondance fine de valeurs dans des conditions de contexte long. Le modèle doit à la fois récupérer la valeur et effectuer une comparaison précise.

Résultats

Loading Chart

Les modèles sont testés dans les fenêtres de contexte suivantes :

  • anthropic/claude-fable-5 : 850,000 tokens testés
  • openai/gpt-5.5 : 1,000,000 tokens
  • google/gemini-3.1-pro-preview : 1,000,000 tokens
  • google/gemini-3.5-flash : 1,000,000 tokens
  • anthropic/claude-sonnet-4.6 : 1,000,000 tokens
  • qwen/qwen3.6-plus : 1,000,000 tokens
  • moonshotai/kimi-k2.6 : 200,000 tokens
  • z-ai/glm-5.1 : 200,000 tokens
  • minimax/minimax-m2.7 : 150,000 tokens
  • openai/gpt-5.4-mini : 250,000 tokens

claude-fable-5 obtient 90,0% sur vérifier OUI et 94,0% sur vérifier NON. L'écart correspond à l'asymétrie décrite ci-dessous : confirmer une valeur nécessite de la trouver, tandis que la rejeter nécessite seulement de repérer une discordance.

Question formats

Vérifier OUI (la valeur de l'affirmation est correcte) :

Affirmation : Le chiffre d'affaires du T1 2026 d'Adobe (ADBE) est de 6,40 milliards $.
Attendu : OUI

Vérifier NON (la valeur de l'affirmation est incorrecte) :

Affirmation : Le chiffre d'affaires du T1 2026 d'Adobe (ADBE) est de 7,92 milliards $.
Attendu : NON

Source des données

Mêmes métriques extraites de TAKEAWAYS que pour le rappel direct. Pour chaque métrique choisie :

  • Les éléments Vérifier OUI utilisent la valeur réelle de la transcription
  • Les éléments Vérifier NON utilisent une valeur perturbée programmatiquement (écart de 8 à 25%, dans les deux sens, avec une précision et des unités correspondantes)

Règle de notation

Détection à trois états sur la réponse du modèle :

  1. Si la réponse contient une expression NON MENTIONNÉ (par ex., « non mentionné », « non abordé ») → prédit = not_mentioned
  2. Sinon, si elle contient « oui » → prédit = yes
  3. Sinon, si elle contient « non » → prédit = no

Score = 1,0 si prédit == attendu, sinon 0,0.

La priorité de détection est NON MENTIONNÉ > NON > OUI pour éviter que « non mentionné » ne corresponde accidentellement à « non » via la sous-chaîne « non ».

claude-fable-5 est testé via Claude Code : il reçoit la botte de foin de 850 000 tokens sous forme de fichier et la parcourt avec des outils de recherche au lieu de la lire depuis sa fenêtre de contexte, de sorte que ses scores mesurent le modèle avec le harnais Claude Code.

Claude Sonnet 5 a été lancé le 30 juin 2026 avec une fenêtre native de 1M tokens à prix standard, et Claude Opus 4.8 dispose de la même fenêtre de 1M, les deux font désormais partie de cet ensemble de tests.1

Deux modèles open-weight entraînés entièrement sur du matériel non-Nvidia sont également entrés dans le domaine du contexte long la même semaine : LongCat-2.0 de Meituan, un modèle MoE de 1,6T paramètres avec une fenêtre native de 1M tokens construit sur des accélérateurs IA chinois, et openPangu-2.0-Flash de Huawei, un modèle MoE de 92B paramètres avec une fenêtre de 512K entraîné sur des puces Ascend.2

Interprétation phase par phase

L'asymétrie entre OUI et NON est instructive : OUI nécessite une identification positive d'une valeur (plus difficile lorsque la cible est plus profonde), tandis que NON nécessite seulement de repérer une discordance (plus facile lorsque lu récemment).

Les phases sont à 0,1, 0,5 et 0,9 de la fenêtre de contexte, pour voir la différence de précision selon les positions dans la botte de foin.

Qu'est-ce qu'une bonne performance ?

Phase 2 OUI ≥ 80% et NON ≥ 80% indique que le modèle peut à la fois confirmer et rejeter à travers une botte de foin.

Un modèle qui obtient un score très élevé en NON mais faible en OUI est biaisé vers le rejet. Un modèle qui obtient un score très élevé en OUI mais faible en NON fait trop confiance aux affirmations.

Nombre d'éléments

50 verify_yes + 50 verify_no = 100 éléments de vérification.

Citer cette recherche

Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.

Cem Dilmegani (2026) - "VELC-Bench: Vérification sur un benchmark à contexte long". Publié en ligne sur AIMultiple.com. Consulté le 22 Juillet 2026, à : https://aimultiple.com/ai-context-window [Ressource en ligne]

Dilmegani, C. (2026, 22 Juillet). VELC-Bench: Vérification sur un benchmark à contexte long. AIMultiple. https://aimultiple.com/ai-context-window

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{VELC-Bench: Vérification sur un benchmark à contexte long}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/ai-context-window}},
  note   = {AIMultiple. Consulté le 22 Juillet 2026}
}
Cem Dilmegani
Cem Dilmegani
Analyste principal
Cem est analyste principal chez AIMultiple depuis 2017. AIMultiple informe des centaines de milliers d'entreprises (selon SimilarWeb) dont 60 % du Fortune 500 chaque mois. Les travaux de Cem ont été cités par des publications internationales de premier plan telles que Business Insider, Forbes, Washington Post, des entreprises mondiales comme Deloitte, HPE et des ONG comme le Forum économique mondial et des organisations supranationales comme la Commission européenne. Tout au long de sa carrière, Cem a exercé en tant que consultant tech, acheteur tech et entrepreneur tech. Il a conseillé des entreprises sur leurs décisions technologiques chez McKinsey & Company et Altman Solon pendant plus d'une décennie. Il a également publié un rapport McKinsey sur la numérisation. Il a dirigé la stratégie technologique et les achats d'un opérateur télécom tout en rendant compte au PDG. Il a également mené la croissance commerciale de l'entreprise deep tech Hypatos qui a atteint un chiffre d'affaires récurrent annuel à 7 chiffres et une valorisation à 9 chiffres à partir de 0 en 2 ans. Le travail de Cem chez Hypatos a été couvert par des publications technologiques de premier plan comme TechCrunch et Business Insider. Cem intervient régulièrement lors de conférences technologiques internationales. Il est diplômé de la Bogazici University en tant qu'ingénieur informatique et détient un MBA de la Columbia Business School.
Voir le profil complet

Soyez le premier à commenter

Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.

0/450