Die Fähigkeit des Modells, eine bestimmte Metrik im Kontext zu lokalisieren, ihren Wert mit einer Behauptung zu vergleichen und diese zu bestätigen oder abzulehnen. Dies testet den feingranularen Werteabgleich unter Langkontext-Bedingungen. Das Modell muss sowohl den Wert abrufen als auch einen präzisen Vergleich durchführen.
Ergebnisse
Die Modelle werden in den folgenden Kontextfenstern getestet:
- anthropic/claude-fable-5: 850,000 Tokens getestet
- openai/gpt-5.5: 1,000,000 Tokens
- google/gemini-3.1-pro-preview: 1,000,000 Tokens
- google/gemini-3.5-flash: 1,000,000 Tokens
- anthropic/claude-sonnet-4.6: 1,000,000 Tokens
- qwen/qwen3.6-plus: 1,000,000 Tokens
- moonshotai/kimi-k2.6: 200,000 Tokens
- z-ai/glm-5.1: 200,000 Tokens
- minimax/minimax-m2.7: 150,000 Tokens
- openai/gpt-5.4-mini: 250,000 Tokens
claude-fable-5 erreicht 90.0% bei verify Ja und 94.0% bei verify NO. Die Lücke entspricht der unten beschriebenen Asymmetrie: Das Bestätigen eines Werts erfordert das Auffinden, während das Ablehnen nur das Erkennen einer Nichtübereinstimmung erfordert.
Question formats
Verify Ja (der Wert der Behauptung ist korrekt):
Behauptung: Der Umsatz für Q1 2026 Adobe (ADBE) beträgt $6.40 Milliarden.
Erwartet: Ja
Verify NO (der Wert der Behauptung ist falsch):
Behauptung: Der Umsatz für Q1 2026 Adobe (ADBE) beträgt $7.92 Milliarden.
Erwartet: NO
Datenquelle
Dieselben TAKEAWAYS-extrahierten Metriken wie beim direkten Abruf. Für jede ausgewählte Metrik:
- Verify Ja-Elemente verwenden den tatsächlichen Wert aus dem Transkript
- Verify NO-Elemente verwenden einen programmatisch veränderten Wert (8–25% abweichend, in beide Richtungen, mit übereinstimmender Präzision und Einheiten)
Bewertungsregel
Dreistufige Erkennung der Modellantwort:
- Wenn die Antwort eine NOT MENTIONED-Formulierung enthält (z. B. „not mentioned“, „not discussed“) → predicted =
not_mentioned - Sonst, wenn sie „ja“ enthält → predicted =
yes - Sonst, wenn sie „no“ enthält → predicted =
no
Score = 1.0 wenn predicted == expected, sonst 0.0.
Die Erkennungspriorität ist NOT MENTIONED > NO > Ja, um zu verhindern, dass „not mentioned“ versehentlich über den Teilstring „not“ mit „no“ übereinstimmt.
claude-fable-5 wird über Claude Code getestet: Es erhält den 850,000-Token-Haystack als Datei und durchsucht ihn mit Retrieval-Tools, anstatt ihn aus seinem Kontextfenster zu lesen, sodass seine Scores das Modell zusammen mit dem Claude Code-Harness messen.
Claude Sonnet 5 wurde am 30. Juni 2026 mit einem nativen 1M-Token-Fenster zu Standardpreisen eingeführt, und Claude Opus 4.8 verfügt über dasselbe 1M-Fenster – beide sind nun Teil dieses Testsets.1
Zwei Open-Weight-Modelle, die vollständig auf Nicht-Nvidia-Hardware trainiert wurden, betraten ebenfalls in derselben Woche das Langkontext-Feld: Meituans LongCat-2.0, ein 1.6T-Parameter-MoE-Modell mit einem nativen 1M-Token-Fenster, das auf chinesischen KI-Beschleunigern aufbaut, und Huaweis openPangu-2.0-Flash, ein 92B-Parameter-MoE-Modell mit einem 512K-Fenster, das auf Ascend-Chips trainiert wurde.2
Phasenweise Interpretation
Die Asymmetrie zwischen Ja und NO ist aufschlussreich: Ja erfordert die positive Identifikation eines Werts (schwieriger, wenn das Ziel tiefer liegt), während NO nur das Erkennen einer Nichtübereinstimmung erfordert (einfacher, wenn kürzlich gelesen).
Die Phasen sind 0.1, 0.5 und 0.9 des Kontextfensters, um den Unterschied in der Genauigkeit an verschiedenen Haystack-Positionen zu sehen.
Was ist eine gute Leistung?
Phase 2 Ja ≥ 80% und NO ≥ 80% zeigt an, dass das Modell über einen gesamten Haystack hinweg sowohl bestätigen als auch ablehnen kann.
Ein Modell, das bei NO sehr hoch, aber bei Ja niedrig abschneidet, ist voreingenommen zugunsten der Ablehnung. Ein Modell, das bei Ja sehr hoch, aber bei NO niedrig abschneidet, vertraut Behauptungen zu sehr.
Anzahl der Elemente
50 verify_yes + 50 verify_no = 100 Verify-Elemente.
Diese Forschung zitieren
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{VELC-Bench: Verifizierung auf Langkontext-Benchmark}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/ai-context-window}},
note = {AIMultiple. Abgerufen am 22. Juli 2026}
}
Seien Sie der Erste, der kommentiert
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.