Hizmetler
Bize Ulaşın

VELC-Bench: Uzun Bağlam Benchmark'ında Doğrulama

Cem Dilmegani
Cem Dilmegani
Güncellenme tarihi: 4 Ağu 2026

Modelin bağlam içinde belirli bir metriği bulma, değerini bir iddiayla karşılaştırma ve onaylama veya reddetme yeteneği. Bu, uzun bağlam koşullarında ince taneli değer eşleştirmeyi test eder. Model hem değeri almalı hem de hassas bir karşılaştırma yapmalıdır.

Sonuçlar

Loading Chart

Modeller aşağıdaki bağlam pencerelerinde test edilmiştir:

  • anthropic/claude-fable-5: 850.000 token test edildi
  • openai/gpt-5.5: 1.000.000 token
  • google/gemini-3.1-pro-preview: 1.000.000 token
  • google/gemini-3.5-flash: 1.000.000 token
  • anthropic/claude-sonnet-4.6: 1.000.000 token
  • qwen/qwen3.6-plus: 1.000.000 token
  • moonshotai/kimi-k2.6: 200.000 token
  • z-ai/glm-5.1: 200.000 token
  • minimax/minimax-m2.7: 150.000 token
  • openai/gpt-5.4-mini: 250.000 token

claude-fable-5 EVET'i doğrulamada %90,0 ve HAYIR'ı doğrulamada %94,0 puan alır. Bu fark, aşağıda açıklanan asimetriyle örtüşür: bir değeri onaylamak onu bulmayı gerektirirken, reddetmek yalnızca bir uyuşmazlığı tespit etmeyi gerektirir.

Question formats

EVET'i Doğrula (iddianın değeri doğrudur):

İddia: Q1 2026 Adobe (ADBE) için Gelir $6.40 milyar.
Beklenen: EVET

HAYIR'ı Doğrula (iddianın değeri yanlıştır):

İddia: Q1 2026 Adobe (ADBE) için Gelir $7.92 milyar.
Beklenen: HAYIR

Veri kaynağı

Doğrudan hatırlama ile aynı TAKEAWAYS'ten çıkarılan metrikler. Seçilen her metrik için:

  • EVET'i Doğrula öğeleri transkriptteki gerçek değeri kullanır
  • HAYIR'ı Doğrula öğeleri programatik olarak değiştirilmiş bir değer kullanır (eşleşen hassasiyet ve birimlerle, her iki yönde 8–%25 sapma ile)

Puanlama kuralı

Modelin yanıtında üç durumlu tespit:

  1. Yanıt bir NOT MENTIONED ifadesi içeriyorsa (ör. "not mentioned," "not discussed") → predicted = not_mentioned
  2. Aksi takdirde "yes" içeriyorsa → predicted = yes
  3. Aksi takdirde "no" içeriyorsa → predicted = no

Puan = 1.0 eğer predicted == expected ise, aksi takdirde 0.0.

Tespit önceliği NOT MENTIONED > NO > YES şeklindedir, böylece "not mentioned" ifadesinin "not" alt dizesi aracılığıyla yanlışlıkla "no" ile eşleşmesi önlenir.

claude-fable-5, Claude Code aracılığıyla test edilir: 850.000 token'lık samanlığı bir dosya olarak alır ve bağlam penceresinden okumak yerine erişim araçlarıyla arar, bu nedenle puanları modeli Claude Code çerçevesiyle birlikte ölçer.

Claude Sonnet 5, 30 Haziran 2026'da standart fiyatlandırmayla yerel 1M token penceresiyle piyasaya sürüldü ve Claude Opus 4.8 aynı 1M pencereyi taşıyor; her ikisi de artık bu test setinin bir parçası.1

Tamamen Nvidia dışı donanım üzerinde eğitilen iki açık ağırlıklı model de aynı hafta uzun bağlam alanına girdi: Meituan'ın LongCat-2.0 modeli, Çin yapay zeka hızlandırıcıları üzerinde inşa edilmiş yerel 1M token pencereli 1.6T parametreli bir MoE modeli ve Huawei'in openPangu-2.0-Flash modeli, Ascend çipleri üzerinde eğitilmiş 512K pencereli 92B parametreli bir MoE modeli.2

Aşama aşama yorumlama

EVET ve HAYIR arasındaki asimetri bilgilendiricidir: EVET bir değerin pozitif olarak tanımlanmasını gerektirir (hedef daha derinde olduğunda daha zor), HAYIR ise yalnızca bir uyuşmazlığı tespit etmeyi gerektirir (yakın zamanda okunduğunda daha kolay).

Aşamalar, farklı samanlık konumlarındaki doğruluk farkını görmek için bağlam penceresinin 0.1, 0.5 ve 0.9'udur.

İyi bir performans nedir?

Aşama 2 EVET ≥ %80 ve HAYIR ≥ %80, modelin bir samanlık boyunca hem onaylayabildiğini hem de reddedebildiğini gösterir.

HAYIR'da çok yüksek ancak EVET'te düşük puan alan bir model reddetmeye eğilimlidir. EVET'te çok yüksek ancak HAYIR'da düşük puan alan bir model iddialara aşırı güvenmektedir.

Öğe sayısı

50 verify_yes + 50 verify_no = 100 doğrulama öğesi.

Bağlam penceresi nedir?

Anthropic'in teknik dokümantasyonu kanonik tanımı sunar: bağlam penceresi, "bir dil modelinin bir yanıt oluştururken referans alabileceği, yanıtın kendisi de dahil olmak üzere tüm metin"dir, onu daha büyük eğitim külliyatından ayırır ve bunun yerine model için bir "çalışma belleği" temsil eder.3 IBM bunu neredeyse aynı terimlerle, modelin herhangi bir anda dikkate alabileceği veya "hatırlayabileceği" token cinsinden metin miktarı olarak tanımlar.4 McKinsey kavramı insan kısa süreli belleğiyle karşılaştırılabilir olarak çerçeveler ve modelin bir yanıt üretmek için önceden eğitilmiş parametrelerle birleştirmeden önce bir seferde yalnızca sabit miktarda bilgiye "bakabileceğini" belirtir.5

Ölçüm birimi token'dır. OpenAI'in geliştirici dokümantasyonu, bir token'ın İngilizce metin için yaklaşık 4 karaktere veya 0.75 kelimeye karşılık geldiğini, ancak oranın dile ve içeriğe göre değiştiğini belirtir.6 IBM token'ı, dil yapay zeka modellerinin kullandığı en küçük birim, bir kelimenin, kelimenin bir kısmının veya noktalama işaretinin makine tarafından okunabilir bir temsili olarak tanımlar.4

Pencere, sistem istemini, araç sonuçları ve belgeler dahil her mesajı ve oluşturulan çıktıyı birleştirir. Anthropic'in dokümantasyonu açıkça "Claude'un tur için oluşturduğu çıktı, genişletilmiş düşünme dahil, aynı zamanda sayılır" ifadesini belirtir.3 OpenAI, metin üretim modelleri için prompt'lar ve oluşturulan çıktının birleşiminin maksimum bağlam uzunluğunu aşmaması gerektiğini onaylar.6

Bağlam penceresi boyutu, eğitim zamanında belirlenen sabit bir mimari özelliktir, kullanıcı tarafından ayarlanabilir bir ayar değildir. Hugging Face'in LLM kurs dokümantasyonu, genişletilmiş bağlam modifikasyonları olmayan temel Transformer mimarilerinin sabit bir maksimum dizi uzunluğuyla sınırlı olduğunu ve bu uzunluk aşıldığında çökeceğini veya girdiyi keseceğini, ancak özel tekniklerin artık bazı dağıtılmış modellerin çok daha uzun dizileri işlemesine izin verdiğini belirtir.7 Bir modele dağıtımdan sonra yeniden eğitim veya özel genişletme teknikleri olmadan daha büyük bir bağlam penceresi verilemez.

Bağlam penceresi ve ilgili terimler

"Bağlam uzunluğu", "bağlam penceresi" için doğrudan bir eşanlamlı olarak işlev görür, ayrı bir kavram değildir. IBM her iki terimi birlikte sunar ve "bağlam penceresinin (veya 'bağlam uzunluğunun')" modelin herhangi bir anda dikkate alabileceği metin miktarı olduğunu belirtir.4 OpenAI, aynı birleşik prompt'lar artı çıktı tavanını tanımlamak için "maksimum bağlam uzunluğunu" kullanır.6

Çıktı token limiti ayrı, daha dar bir terimdir. OpenAI bunu, yalnızca yanıtın oluşturulan kısmını sınırlayan ayrı bir parametre (örn. `max_tokens`) olarak sunar, oysa bağlam penceresi girdi artı çıktının toplamını kısıtlar.6

Bağlam penceresi, oturumlar arası kalıcı veya ajansal bellekten farklıdır. Anthropic'in bellek aracı dokümantasyonu, bağlam penceresinin geçici ve oturuma bağlı olduğunu açıklar: "Bağlam pencereniz her an sıfırlanabilir, bu nedenle bellek dizininize kaydedilmemiş herhangi bir ilerlemeyi kaybetme riskiyle karşı karşıyasınız."8 Kalıcı bellek ise, bilgileri oturumlar arasında varlığını sürdüren harici dosyalarda saklar.8

Son olarak, bağlam penceresi modelin eğitildiği veri külliyatı değildir. Anthropic'in dokümantasyonu bu çizgiyi açıkça çizer: bağlam penceresi "dil modelinin eğitildiği büyük veri külliyatından farklıdır ve bunun yerine model için bir 'çalışma belleği' temsil eder."3

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Bağlam penceresi nasıl çalışır?

İşlemeden önce, ham metin tokenizasyon yoluyla token'lara dönüştürülür. Baskın yöntem, başlangıçta 1994 yapımı bir veri sıkıştırma algoritması olan ve 2016'da nöral makine çevirisi için uyarlanan, en sık birlikte ortaya çıkan karakter dizilerini yinelemeli olarak birleştirerek bir kelime dağarcığı oluşturan byte pair encoding (BPE)'dir.9 BPE, diğerleri arasında GPT-2, GPT-3, GPT-4 ve LLaMA'daki tokenizer'lara güç verir.9 OpenAI, tokenizasyonun bağlama duyarlı olduğunu; aynı kelimenin büyük harf kullanımına veya çevresindeki boşluklara bağlı olarak farklı token'lara eşlenebileceğini belirtir.10

Tokenize edildikten sonra, her token bir vektöre dönüştürülür ve 2017 tarihli "Attention Is All You Need" makalesinde tanıtılan transformer mimarisi aracılığıyla işlenir.11 Temel mekanizma olan öz-dikkat (self-attention), her token için Query, Key ve Value vektörlerini hesaplar, ardından her token'ın kendisi de dahil olmak üzere dizideki diğer her token'a dikkat etmesi için ölçeklendirilmiş nokta çarpımı dikkatini kullanır.11 Tüm token çiftlerinin bu paralel karşılaştırması, transformer'ların daha önceki tekrarlayan mimarilerin sıralı işlemesinin yerini almasını sağlayan şeydir.

Otoregresif üretim sırasında, model her seferinde bir token üretir. Her yeni token'ın öz-dikkat adımı, önceki her token'ın Key ve Value vektörlerini gerektirir. Bunları her adımda sıfırdan yeniden hesaplamak yerine, üretim LLM'leri ilk hesaplamadan sonra bunları saklar ve yeniden kullanır; bu saklanan kümeye KV cache denir.12 Önbelleğe alınmış Key ve Value matrislerini yeniden kullanarak, adım başına çıkarım karmaşıklığı düşer, ancak önbelleğin bellek ayak izi bağlam uzunluğuyla doğrusal olarak büyür ve istek süresi boyunca GPU belleğinde bulunmalıdır.12

Pencerenin dışındaki token'lar mimari olarak görünmezdir. Öz-dikkat yalnızca mevcut girdi tensöründe bulunan token'lar arasındaki ilişkileri hesapladığı ve KV cache yalnızca modele beslenen token'lar için vektörler sakladığı için, isteğe hiç dahil edilmemiş bir token'ın modelin referans alabileceği bir temsili yoktur.11 Bu nedenle bağlam penceresi taşması sert bir API hatasını tetikler; Anthropic'in API'si, yalnızca girdi sınırı aşarsa 400 `invalid_request_error` döndürür ve çıktı toplamı tavanın ötesine itecekse `model_context_window_exceeded` durdurma nedeniyle üretim durur.3

Önde gelen yapay zeka modellerinde bağlam penceresi boyutları

2026 ortası itibarıyla, öncü API varsayılanı yaklaşık 1 milyon token'da karar kılmıştır, ancak etkin sınır erişim yüzeyine göre değişir.

OpenAI'in GPT-5.6 ailesi (Sol, Terra ve Luna), API aracılığıyla 1.05 milyon token bağlam penceresi ve 128.000 token maksimum çıktı sunar.13 Ancak, ChatGPT tüketici arayüzü daha azını sunar: bir kullanıcı manuel olarak "Thinking" modunu seçtiğinde, birleşik pencere 256.000 token'dır (128.000 girdi artı 128.000 maksimum çıktı).14

Anthropic'in Claude Opus 5 ve Sonnet 5, Claude API'si ve Amazon Bedrock, Google Cloud ve Microsoft Foundry üzerinde 1 milyon token penceresi sunar.3

Google'ın Gemini 3.5 Flash modeli, 65.536'ya kadar çıktı token'ı ile 1 milyon token girdi bağlam penceresini destekler.15 Daha yeni Gemini 3.5 Pro'nun 2 milyon token'a ulaştığı iddiaları, yazım sırasında birincil Google dokümantasyonuna karşı doğrulanamadı.

xAI'in Grok 4.3 modeli, 30 Nisan 2026'da piyasaya sürüldü ve 1 milyon token bağlam penceresi taşır.16 Meta'nın Llama 4 Scout modeli, iRoPE mimarisi aracılığıyla ulaşılan 10 milyon token bağlam penceresi reklam eder, ancak model yalnızca 256.000 token'a kadar önceden eğitilmiştir, yani 10 milyon rakamı ekstrapole edilmiş yeteneği temsil eder.17

Mistral Large 3, öncü modeller arasında bir aykırı değer olarak 256.000 token'da sınırlı kalmaya devam ediyor.18 DeepSeek-V4, verimli bir dikkat mekanizmasıyla elde edilen 1 milyon token'ı destekleyen iki varyantta sunulur.19

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Uzun bağlam pencereleri ve retrieval-augmented generation

Token'ları uzun bir bağlam penceresine tıkmak ile retrieval-augmented generation (RAG) kullanmak arasındaki seçim, külliyat boyutuna ve güncelleme sıklığına bağlıdır. Anthropic'in mühendislik kılavuzu, bir bilgi tabanı 200.000 token'dan (yaklaşık 500 sayfa) daha küçükse, tüm külliyatın isteme dahil edilebileceğini ve prompt'lar önbelleğe alma ile bunun "önemli ölçüde daha hızlı ve daha maliyet etkin" hale geldiğini tavsiye eder. Külliyat bu eşiği aştığında, daha ölçeklenebilir bir çözüme ihtiyaç vardır.20

Ajansal yapay zeka ve uzun süreli görevler

Kodlama ve araştırma ajanları, birikmiş araç çıktılarını ve konuşma geçmişini tutmak için bağlam penceresi boyutuna güvenir. Anthropic'in mühendislik ekibi, bağlam yönetimini uzun ufuklu görevler için merkezi kısıt olarak belgeler ve ajanların hafif referanslar tuttuğu ve her şeyi peşin yüklemek yerine çalışma zamanında dinamik olarak veri yüklediği "tam zamanında" bağlamı önerir.21

Claude Code bunu alt ajanlar aracılığıyla uygular. Belgelenmiş bir örnekte, bir kod tabanını araştırmakla görevlendirilen bir alt ajan 6.100 token dosya içeriği okudu ve üst oturuma 420 token'lık bir özet döndürdü, böylece yaklaşık 5.700 token dosya içeriğini birincil ajanın bağlam penceresinden tamamen uzak tuttu.22 Claude Code'un Sonnet 5 için varsayılan bağlam penceresi Anthropic API'sinde 1 milyon token'dır, oturumlar varsayılan olarak yaklaşık 967.000 token'da veya bu sınırın yaklaşık %96,7'sinde otomatik-sıkıştırma yapar, bir yapılandırma pencereyi bunun yerine 200.000 token ile sınırlamadığı sürece.23

Doküman ve kod tabanı analizi

Google'ın Gemini API dokümantasyonu, 1 milyon token bağlam penceresinin yaklaşık 50.000 satır koda eşdeğer olduğunu belirtir ve özel bir kod tabanı inceleme kullanım durumunu tanımlamaktan ziyade tek bir bağlam penceresinin ölçeğini gösterir.24

Bu araştırmayı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Cem Dilmegani and Şevval Alper (2026) - "VELC-Bench: Uzun Bağlam Benchmark'ında Doğrulama". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 4 Ağustos 2026, kaynak: https://aimultiple.com/ai-context-window [Çevrimiçi Kaynak]

Dilmegani, C., & Alper, Ş. (2026, 4 Ağustos). VELC-Bench: Uzun Bağlam Benchmark'ında Doğrulama. AIMultiple. https://aimultiple.com/ai-context-window

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Alper, Şevval},
  title  = {{VELC-Bench: Uzun Bağlam Benchmark'ında Doğrulama}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/ai-context-window}},
  note   = {AIMultiple. Erişim tarihi: 4 Ağustos 2026}
}
Cem Dilmegani
Cem Dilmegani
Baş Analist
Cem, 2017'den beri AIMultiple'da baş analisttir. AIMultiple, her ay Fortune 500'ün %60'ı dahil olmak üzere (similarWeb'e göre) yüz binlerce işletmeyi bilgilendirmektedir.

Cem'in çalışmaları Business Insider, Forbes, Washington Post gibi önde gelen küresel yayınlar, Deloitte, HPE gibi küresel firmalar, Dünya Ekonomik Forumu gibi STK'lar ve Avrupa Komisyonu gibi uluslarüstü kuruluşlar tarafından alıntılanmıştır.

Cem, kariyeri boyunca teknoloji danışmanı, teknoloji alıcısı ve teknoloji girişimcisi olarak görev yapmıştır. On yıldan fazla bir süre McKinsey & Company ve Altman Solon'da işletmelere teknoloji kararlarında danışmanlık yapmıştır. Ayrıca dijitalleşme üzerine bir McKinsey raporu yayımlamıştır.

CEO'ya rapor verirken bir telekomünikasyon şirketinin teknoloji stratejisini ve satın alımını yönetmiştir. Ayrıca, 2 yıl içinde 0'dan 7 haneli yıllık yinelenen gelire ve 9 haneli değerlemeye ulaşan derin teknoloji şirketi Hypatos'un ticari büyümesini yönetmiştir. Cem'in Hypatos'taki çalışmaları TechCrunch ve Business Insider gibi önde gelen teknoloji yayınları tarafından ele alınmıştır.

Cem, uluslararası teknoloji konferanslarında düzenli olarak konuşma yapmaktadır. Boğaziçi Üniversitesi'nden bilgisayar mühendisi olarak mezun olmuş ve Columbia Business School'dan MBA derecesine sahiptir.
Tam Profili Görüntüle
Teknik olarak inceleyen
Şevval Alper
Şevval Alper
Yapay Zeka Araştırmacısı
Şevval, AIMultiple'da yapay zeka kodlama araçları, yapay zeka ajanları ve kuantum teknolojileri konusunda uzmanlaşmış bir sektör analistidir.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450