Dienstleistungen
Kontaktieren

VELC-Bench: Verifizierung auf Langkontext-Benchmark

Cem Dilmegani
Cem Dilmegani
aktualisiert am 22. Juli 2026

Die Fähigkeit des Modells, eine bestimmte Metrik im Kontext zu lokalisieren, ihren Wert mit einer Behauptung zu vergleichen und diese zu bestätigen oder abzulehnen. Dies testet den feingranularen Werteabgleich unter Langkontext-Bedingungen. Das Modell muss sowohl den Wert abrufen als auch einen präzisen Vergleich durchführen.

Ergebnisse

Loading Chart

Die Modelle werden in den folgenden Kontextfenstern getestet:

  • anthropic/claude-fable-5: 850,000 Tokens getestet
  • openai/gpt-5.5: 1,000,000 Tokens
  • google/gemini-3.1-pro-preview: 1,000,000 Tokens
  • google/gemini-3.5-flash: 1,000,000 Tokens
  • anthropic/claude-sonnet-4.6: 1,000,000 Tokens
  • qwen/qwen3.6-plus: 1,000,000 Tokens
  • moonshotai/kimi-k2.6: 200,000 Tokens
  • z-ai/glm-5.1: 200,000 Tokens
  • minimax/minimax-m2.7: 150,000 Tokens
  • openai/gpt-5.4-mini: 250,000 Tokens

claude-fable-5 erreicht 90.0% bei verify Ja und 94.0% bei verify NO. Die Lücke entspricht der unten beschriebenen Asymmetrie: Das Bestätigen eines Werts erfordert das Auffinden, während das Ablehnen nur das Erkennen einer Nichtübereinstimmung erfordert.

Question formats

Verify Ja (der Wert der Behauptung ist korrekt):

Behauptung: Der Umsatz für Q1 2026 Adobe (ADBE) beträgt $6.40 Milliarden.
Erwartet: Ja

Verify NO (der Wert der Behauptung ist falsch):

Behauptung: Der Umsatz für Q1 2026 Adobe (ADBE) beträgt $7.92 Milliarden.
Erwartet: NO

Datenquelle

Dieselben TAKEAWAYS-extrahierten Metriken wie beim direkten Abruf. Für jede ausgewählte Metrik:

  • Verify Ja-Elemente verwenden den tatsächlichen Wert aus dem Transkript
  • Verify NO-Elemente verwenden einen programmatisch veränderten Wert (8–25% abweichend, in beide Richtungen, mit übereinstimmender Präzision und Einheiten)

Bewertungsregel

Dreistufige Erkennung der Modellantwort:

  1. Wenn die Antwort eine NOT MENTIONED-Formulierung enthält (z. B. „not mentioned“, „not discussed“) → predicted = not_mentioned
  2. Sonst, wenn sie „ja“ enthält → predicted = yes
  3. Sonst, wenn sie „no“ enthält → predicted = no

Score = 1.0 wenn predicted == expected, sonst 0.0.

Die Erkennungspriorität ist NOT MENTIONED > NO > Ja, um zu verhindern, dass „not mentioned“ versehentlich über den Teilstring „not“ mit „no“ übereinstimmt.

claude-fable-5 wird über Claude Code getestet: Es erhält den 850,000-Token-Haystack als Datei und durchsucht ihn mit Retrieval-Tools, anstatt ihn aus seinem Kontextfenster zu lesen, sodass seine Scores das Modell zusammen mit dem Claude Code-Harness messen.

Claude Sonnet 5 wurde am 30. Juni 2026 mit einem nativen 1M-Token-Fenster zu Standardpreisen eingeführt, und Claude Opus 4.8 verfügt über dasselbe 1M-Fenster – beide sind nun Teil dieses Testsets.1

Zwei Open-Weight-Modelle, die vollständig auf Nicht-Nvidia-Hardware trainiert wurden, betraten ebenfalls in derselben Woche das Langkontext-Feld: Meituans LongCat-2.0, ein 1.6T-Parameter-MoE-Modell mit einem nativen 1M-Token-Fenster, das auf chinesischen KI-Beschleunigern aufbaut, und Huaweis openPangu-2.0-Flash, ein 92B-Parameter-MoE-Modell mit einem 512K-Fenster, das auf Ascend-Chips trainiert wurde.2

Phasenweise Interpretation

Die Asymmetrie zwischen Ja und NO ist aufschlussreich: Ja erfordert die positive Identifikation eines Werts (schwieriger, wenn das Ziel tiefer liegt), während NO nur das Erkennen einer Nichtübereinstimmung erfordert (einfacher, wenn kürzlich gelesen).

Die Phasen sind 0.1, 0.5 und 0.9 des Kontextfensters, um den Unterschied in der Genauigkeit an verschiedenen Haystack-Positionen zu sehen.

Was ist eine gute Leistung?

Phase 2 Ja ≥ 80% und NO ≥ 80% zeigt an, dass das Modell über einen gesamten Haystack hinweg sowohl bestätigen als auch ablehnen kann.

Ein Modell, das bei NO sehr hoch, aber bei Ja niedrig abschneidet, ist voreingenommen zugunsten der Ablehnung. Ein Modell, das bei Ja sehr hoch, aber bei NO niedrig abschneidet, vertraut Behauptungen zu sehr.

Anzahl der Elemente

50 verify_yes + 50 verify_no = 100 Verify-Elemente.

Diese Forschung zitieren

Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.

Cem Dilmegani (2026) - "VELC-Bench: Verifizierung auf Langkontext-Benchmark". Online veröffentlicht auf AIMultiple.com. Abgerufen am 22. Juli 2026, von: https://aimultiple.com/ai-context-window [Online-Ressource]

Dilmegani, C. (2026, 22. Juli). VELC-Bench: Verifizierung auf Langkontext-Benchmark. AIMultiple. https://aimultiple.com/ai-context-window

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{VELC-Bench: Verifizierung auf Langkontext-Benchmark}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/ai-context-window}},
  note   = {AIMultiple. Abgerufen am 22. Juli 2026}
}
Cem Dilmegani
Cem Dilmegani
Leitender Analyst
Cem ist seit 2017 leitender Analyst bei AIMultiple. AIMultiple informiert monatlich Hunderttausende von Unternehmen (laut similarWeb), darunter 55 % der Fortune 500. Cems Arbeit wurde von führenden globalen Publikationen wie Business Insider, Forbes und der Washington Post, von globalen Unternehmen wie Deloitte und HPE sowie von NGOs wie dem Weltwirtschaftsforum und supranationalen Organisationen wie der Europäischen Kommission zitiert. Weitere namhafte Unternehmen und Ressourcen, die AIMultiple referenziert haben, finden Sie hier. Im Laufe seiner Karriere war Cem als Technologieberater, Technologieeinkäufer und Technologieunternehmer tätig. Über ein Jahrzehnt lang beriet er Unternehmen bei McKinsey & Company und Altman Solon in ihren Technologieentscheidungen. Er veröffentlichte außerdem einen McKinsey-Bericht zur Digitalisierung. Bei einem Telekommunikationsunternehmen leitete er die Technologiestrategie und -beschaffung und berichtete direkt an den CEO. Darüber hinaus verantwortete er das kommerzielle Wachstum des Deep-Tech-Unternehmens Hypatos, das innerhalb von zwei Jahren von null auf einen siebenstelligen jährlichen wiederkehrenden Umsatz und eine neunstellige Unternehmensbewertung kam. Cems Arbeit bei Hypatos wurde von führenden Technologiepublikationen wie TechCrunch und Business Insider gewürdigt. Er ist ein gefragter Redner auf internationalen Technologiekonferenzen. Cem absolvierte sein Studium der Informatik an der Bogazici-Universität und besitzt einen MBA der Columbia Business School.
Vollständiges Profil anzeigen

Seien Sie der Erste, der kommentiert

Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.

0/450