Hizmetler
Bize Ulaşın

A-CODE-LLM Bench: Ajan Kodlama Kıyaslaması

Berk Kalelioğlu
Berk Kalelioğlu
Güncellenme tarihi: 23 Tem 2026

En iyi Büyük Dil Modellerini (LLM'leri) 10 yazılım geliştirme görevi üzerinde bir ajansal CLI aracı kullanarak kıyasladık. Her model için hem API hem de UI katmanlarında ~3.500 otomatik doğrulama adımı çalıştırdık.

A-CODE-LLM Bench sonuçları

Loading Chart

Her alias 10 görevde 3 kez çalıştırıldı (alias başına 30 örnek, 40 alias boyunca yineleme başına 400 hücre). Daha fazla ayrıntı için metodolojiye bakın.

  • Orta seviye Sonnet, amiral gemisi Opus'u geçti. Her iki Sonnet sürümü, Opus 4.8 (0.702) dahil olmak üzere tüm Opus'lardan daha yüksek puan alıyor. Anthropic'in en pahalı katmanı, en iyi kodlayıcısı değil.
  • Zirve artık yalnızca Anthropic'e ait değil: Grok 4.5 (0.732) tüm Opus varyantlarını geride bırakıyor. OpenAI'nin yeni amiral gemisi GPT 5.6 Sol, şirketin en iyi puanını (0.615) alıyor, ancak hala Sonnet 5'in 0.157 altında ve daha yüksek hesaplama gücüne sahip pro varyantları çoğunlukla kendi taban modellerinin altında kalıyor (Sol Pro 0.543, Terra Pro 0.568; yalnızca Luna Pro iyileşme gösteriyor, 0.603 vs 0.579).
  • Kod uzmanları kodlama kıyaslamasını kazanamadı. OpenAI'nin kod için ince ayarlanmış varyantı GPT 5.3 Codex, 0.572 puan alarak orta sıralarda ve OpenAI'nin kendi genel GPT 5.4 Mini'sinin (0.594) altında kalıyor. Moonshot'ın Kimi K2.7 Code modeli, 0.611 ile daha güçlü bir uzman.
  • Genel bir model olan Kimi K3, açık ağırlıklı liderliği Moonshot'ın kendi kod uzmanından alıyor: 0.725, genel sıralamada altıncı, K2.7 Code'dan 0.114 yukarıda. 0.632 arka uç puanıyla beşinci sırada, tüm Opus ve GPT alias'larının üzerinde.
  • Thinking Machines'in ilk modeli Inkling, 0.575 ile giriş yaparak açık ağırlıklı katılımcılar arasında üçüncü sırada. 0.747 ön uç puanı tüm GPT 5.6 alias'larını geçiyor; 0.501 arka uç ise sıralamasını sınırlıyor.
  • Hiçbir model arka uçta güvenilir değil: tavan 0.701 (Sonnet 5), bu yüzden kazanan bile iş mantığı ve sözleşme kontrollerinin yaklaşık üçte birinde başarısız oluyor. Temmuz eklemeleri arasında Grok 4.5, 0.663 ile en yakın. Ön uç liderler arasında neredeyse çözülmüş durumda (0.79 ile 0.96 arası), bu nedenle arka uç açık problem ve sıralamayı belirliyor. Claude Haiku 4.5 iyi görüntü veriyor (0.731), ancak 0.277 arka uç puanı onu 0.413'te tutuyor.
  • GPT'nin zayıf noktası ön uç. GPT 5.4 ve 5.5, arka uçta Opus 4.8 ile eşleşiyor (yaklaşık 0.6) ancak ön uçta 0.53 ile 0.55 arasında puan alıyor; GPT 5.6 ailesi bunu 0.63 ile 0.71'e çıkarıyor, ancak hâlâ Sonnet serisinin 0.91 ve üzerinin çok altında.

Maliyet ve başarı karşılaştırması

  • Amiral gemisi fiyatlı modeller en kötü değer. Opus 4.7 en pahalısı (hücre başına $3,08) ve 0.610 puan alıyor, $1,33 olan Sonnet 4.6'nın altında.
  • Zirve, küçük bir kazanç için dik bir prim alıyor: Sonnet 5, Sonnet 4.6'nın 0.024 üzerinde puan alırken hücre başına maliyette %70 daha fazla.
  • Grok 4.5 yeni en iyi değer: 0.732, kazanandan 0.040 farkla, hücre başına $0,46, Sonnet 5'in $2,23'ine kıyasla. GPT 5.6 ailesi içinde fiyat hiçbir şey kazandırmıyor: hücre başına $0,18 (Luna) ile $2,76 (Sol Pro) arasında değişen fiyatlarla 0.543 ile 0.615 arasında puanlar, en ucuz alias en pahalıyı geçiyor.
  • Kimi K3, altıncı sıradaki puanını orta seviye bir fiyata alıyor: hücre başına $1,47, Sonnet 4.6'nın $1,33'üne yakın ancak puanda 0.007 daha yüksek ve Sonnet 5'in $2,23'inin oldukça altında. Inkling, liste fiyatıyla hücre başına $1,64 ile 0.575 puan alıyor; daha düşük bir puan için Sonnet 4.6'nın üzerinde.

Görev tamamlama süresi ve başarı karşılaştırması

  • En yüksek puan en yavaşlar arasında. Sonnet 5, görev başına yaklaşık 30 dakika sürüyor, Sonnet 4.6'nın 3 katı sürede 0.024 daha fazla; Sonnet 4.6 üçte bir sürede neredeyse aynı puanı veriyor.
  • Uzun süre genellikle takılmış bir modelin işaretidir, kapsamlı bir modelin değil: en düşük puanlılar, her iki Qwen varyantı, GLM 5.1 tabanı ve Deepseek V4 Pro, aşırı yinelemeden dolayı 1.700 saniyenin üzerinde çalıştı ve 0.45'in altında puan aldı.
  • Grok 4.3 erkenden bıraktığı için hızlıydı: 0.431 için 142 saniye ve 18 araç çağrısı. Grok 4.5 hızı koruyor ve bırakmayı kesiyor: görev başına yaklaşık 9 dakika, Sonnet 5'in süresinin üçte birinden az, 0.732 için.
  • Kimi K3 tam ters köşede: üst düzey puan, en kötü hız. Görev başına ortalama yaklaşık 55 dakika, alandaki en yavaş ve Sonnet 5'in kabaca iki katı, altıncı sıradaki 0.725 için. Doğruluğu gerçek, ancak üst seviyeye giden en az pratik yol.

Görev başına araç çağrıları

  • Araç çağrı sayısı ne yeteneği ne de karşılaştırılabilir çabayı ölçmez. Sonnet 5 en fazla çağrı yaptı (125) ve en yüksek puanı aldı; MiniMax M3 orta sıralarda 0.583 için 108 çağrı yaptı; Grok 4.5 40 çağrıyla 0.732'ye ulaştı; OpenAI'nin düşük 16 ila 36 çağrısı, apply_patch'in tüm dosyayı tek bir çağrıda toplamasından geliyor. Sol Pro ve Terra Pro, taban modellerine kıyasla dörtte bir ila üçte bir daha az araç çağırıyor ve daha düşük puan alıyor: daha fazla akıl yürütme, daha az uygulama. Ajanları araç hacmine göre sıralamayın.
  • Aynı puana iki yol ulaşır: Sonnet 5 yoğun şekilde yineler (125 çağrı), Sonnet 4.6 zar zor (yaklaşık 50), 0.024 farkla.

LLM performansı tek bir başarılı görevde

Hiçbir model yukarıdaki tam kıyaslamanın her adımını geçemedi. Maliyet ve hızı eşit şartlarda karşılaştırmak için, her modelin tamamlayabileceği basit bir temel görev çalıştırdık: dört CRUD uç noktası, temel doğrulama, kimlik doğrulama yok ve veritabanı yok.

Maliyet ve kod satırı karşılaştırması

  • Basit görevler modelleri sıralayamaz, bu nedenle oyuncak değerlendirmeler yanıltıcıdır. Temel görevde her model geçer, kod 40 ile 64 satıra yakınsar ve maliyet sentlere düşer; farklılıklar yalnızca uzun, çok dosyalı çalışmalarda ortaya çıkar.
  • “Hızlı ve hafif” katman burada en pahalısıydı: Gemini 3.5 Flash tabanı, bu önemsiz görev için diğerlerinin iki ila üç katı olan 131 satır yazdı ve kendi konumlandırmasına aykırı olarak en pahalı temel haline geldi.
  • Sonnet 5'in yoğun yinelemesi görev odaklıdır, bir alışkanlık değil: Burada 9 çağrı ve $0,09 iken kıyaslamada 125 çağrı.

Daha fazla ayrıntı için LLM Fiyatlandırma makalesine bakın.

Tamamlama süresi ve token kullanımı

  • Maliyet öngörülebilirliği modelleri ikiye ayırır. Uyarlanabilir modeller yalnızca gerektiğinde harcar (Opus 4.8: temel 34sn, kıyaslama 1.072sn); sabit tempolu modeller önemsiz işlerde bile yavaş ve maliyetli çalışır (MiniMax M3: 475 vs 1.684sn).
  • Çıktı uzunluğu sabit bir model özelliğidir, aynı görev için yaklaşık 10 kat aralığındadır (787 ile 7.508 token), doğrudan maliyete yansır.
Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Ajansal LLM sistemleri nedir?

Yazılım geliştirme yinelemelidir: kod yaz, çalıştır, hataları oku, düzelt, tekrarla. Ajansal YZ sistemleri, LLM'lerin aynı döngüyü izlemesini sağlar. Model, dosya yazabileceği, komut çalıştırabileceği, çıktıları okuyabileceği ve gördüklerine göre değişiklik yapabileceği bir geliştirme ortamında çalışır, görev tamamlanana kadar devam eder.

Bu önemlidir çünkü gerçek uygulamalar tek dosyadan ibaret değildir. Rotaları ve veritabanı modelleri olan arka uçları, bileşenleri ve API çağrıları olan ön uçları, yapılandırma dosyaları, bağımlılıkları ve testleri vardır. Bunları birlikte çalıştırmak, tam olarak ajansal mimarinin sağladığı yinelemeli test ve iyileştirme gerektirir.

Nasıl çalışır

Model, bir kabuk, dosya sistemi ve yürütme çıktısına erişimi olan bir koşum takımı içinde bulunur. Bir uygulama oluşturması istendiğinde, dosyaları aşamalı olarak yazar. Her adımdan sonra, koşum takımı modele ne olduğunu gösterir: sunucu başladı mı, testler geçti mi, linter hatalar işaretledi mi? Bu geri bildirime dayanarak, model bir sonraki ne yazacağına veya düzelteceğine karar verir.

Bu, tek seferlik üretimden temelde farklıdır. Tek seferlik kurulumlarda, model tüm kod tabanını körlemesine üretir ve çalışıp çalışmadığını doğrulamanın bir yolu yoktur. Ajansal LLM sistemlerinde, model her eylemin sonuçlarını görür ve rotasını düzeltir. Ancak, bu yetenek tek başına yeterli değildir. Modelin, iş mantığını doğru bir şekilde uygulamak için hala güçlü akıl yürütmeye ihtiyacı vardır ki performans farklılıkları burada ortaya çıkar.

Google Arama'da daha fazla kıyaslamamızı ve veri odaklı içgörülerimizi görün.
GoogleTercih edilen kaynak olarak ekle

Ajansal LLM kıyaslama metodolojisi

Tüm modeller için ajan koşum takımı olarak Opencode'i kullandık ve iki istisna dışında OpenRouter üzerinden bağladık: Claude Fable 5, Claude aboneliğinde Claude Code CLI'da çalıştırıldı ve Inkling, model OpenRouter'da mevcut olmadığı için Thinking Machines'in kendi OpenAI-uyumlu API'si üzerinden çalıştırıldı. Her hücre, hücre başı varyansı ölçmek ve lider tablosunu dengelemek için 3 kez çalıştırıldı. Rezervasyon sistemlerinden etkileşimli panolara kadar uzanan 10 yazılım geliştirme görevinde (T-1'den T-10'a) otonom çalışma yeteneklerini değerlendirdik. Bu görevler, ajanların çok dosyalı projeleri yönetmesini ve işlevsel ürünler sunmasını gerektirir. Temmuz 2026'da eklenen yedi alias (Grok 4.5 ve GPT 5.6 ailesi: Sol, Terra, Luna, her biri taban ve pro modunda) buradaki tüm modellerle aynı olan API-varsayılan ayarlarında Opencode 1.15.13 üzerinde çalıştırıldı; OpenAI'nin Sol için lansman sayıları daha yüksek hesaplama modlarını kullanır.1 Dört Sol Pro hücresi ve bir Terra Pro hücresi, model hataları yerine tekrarlanan sessiz API akış hatalarıyla sona erdi ve başarısız olarak puanlandı.

Kimi K3 ve Inkling, 18 Temmuz'da API-varsayılan ayarlarıyla eklendi; Inkling, varsayılan düşünme çabası olan 0.9 ile çalıştırıldı. Inkling'in maliyet sütunu, Thinking Machines'in liste fiyatları olan milyon giriş token'ı başına $3,74 ve milyon çıkış token'ı başına $9,36 kullanır; sağlayıcı, sınırlı süreli lansman indirimi kapsamında bunun yaklaşık yarısını faturalandırdı.2 Her iki model de daha önceki 45 dakika yerine hücre başına 150 dakikalık bir duvar ile çalıştırıldı, çünkü Kimi K3'nin token akışı, daha kısa duvarı yapının ortasında aşacak kadar yavaş; tamamlama süresi zaman grafiğinde ayrıca raporlanmıştır. Kimi K3'nin paylaşılan üst akış kapasitesi, çalıştırma penceresi sırasında sık sık hız sınırı ve zaman aşımı hataları döndürdü; etkilenen hücreler aynı duvara karşı bir kez yeniden çalıştırıldı, aynı politika yukarıdaki Sol Pro ve Terra Pro akış hatalarına da uygulandı.

Yürütme ve orkestrasyon

Her ajan ve görev temiz bir ortamda başlar. Talimatlar bir TASK.md dosyası olarak sağlanır ve başlatma betikleri için 20 dakikalık bir kalp atışı gözlemcisi kullanırız. Bu aşamada, çıkış kodlarını, yürütme süresini ve arka uç ile ön uç dosyalarının oluşturulup oluşturulmadığını kaydederiz. Ayrıca giriş, çıkış ve önbelleğe alınmış kategorilerde gerçek zamanlı token kullanımını izleriz.

Arka uç doğrulaması: Oluşturulan projeleri, standart bir YAML sözleşmesine karşı test etmek için yalıtılmış ortamlarda dağıtırız. Doğrulama, başarılı yol senaryolarını, hata işlemeyi (400/403/409) ve veri tutarlılığını kapsar.

Sonuçları iki modda test ederiz:

Uyarlanabilir mod, farklı rota adlarıyla bile işlevselliği doğrular, Katı mod ise sözleşmeye tam bağlılık gerektirir.

Arka uç genel puanı hücre başına şu şekilde hesaplanır:

backend_overall = has_backend × (0.7 × adaptive_pass_rate + 0.3 × strict_pass_rate)

burada has_backend, hücre bir arka uç projesi ürettiyse 1, aksi takdirde 0'dır. Uyarlanabilir, davranışsal doğruluğu ölçtüğü için daha yüksek ağırlıklandırılır; katı, sözleşme sapması (yeniden adlandırılmış rotalar, değiştirilmiş durum kodları, yeniden yapılandırılmış yanıt alanları) için bir ceza ekler.

Kullanıcı arayüzü ve kullanıcı senaryosu testi

Ön kontroller, görüntüleme ve kimlik doğrulama dahil olmak üzere gerçek kullanıcı akışlarını simüle etmek için tarayıcı otomasyonu kullanırız. Uygulamanın çökmeden çalıştığından emin olmak için oturum açma gönderimi ve oturum açma sonrası davranış gibi işlevsel adımları doğrularız.

Kullanıcı arayüzü puanlaması sekiz adımı iki gruba ayırır. Altyapı adımları (arka uç ön kontrolü, ön uç görüntüleme, oturum açma formunun görünür olması, oturum açma gönderimi, oturum açma 2xx, çalışma zamanı çökmesi olmaması) uygulamanın hiç çalışıp çalışmadığını ölçer. Davranış adımları (oturum açma sonrası yetkilendirme sinyali, oturum açma sonrası davranış sinyali) uygulamanın çalıştıktan sonra amaçlanan işlevini yerine getirip getirmediğini değerlendirir.

ui_score = (behavior_passed / (behavior_passed + behavior_failed)) × (infra_passed / infra_total)

Engellenen davranış adımları davranış paydasından çıkarılır, böylece uygulama yüklenemediğinde bir hücre çift cezalandırılmaz.

Token hesaplaması

Token sayıları, LLM API yanıtından çıkarılır. Yalnızca yeni işlenen token'ları yansıtan etkin girişi elde etmek için önbelleğe alınmış giriş token'larını toplam giriş token'larından çıkarırız. Çıkış token'ları asla önbelleğe alınmaz, bu nedenle değişmeden kalır.

Son toplama

Nihai kıyaslama puanı, önceki aşamaların sonuçları birleştirilerek hesaplanır: Final Score = (0.7 × backend_overall) + (0.3 × ui_score) API düzeyindeki mantık hataları genellikle ön uçtaki herhangi bir başarıyı geçersiz kıldığından arka uca daha yüksek ağırlık veririz.

Görev örneği

Görev 6: Yardım masası bileti sistemi

Görev 6, karmaşık bir müşteri destek ekosistemi geliştirmeye odaklanır. Birincil amaç, iş kurallarını ve güvenlik sınırlarını sıkı bir şekilde uygularken müşteriler ve destek ajanları arasındaki iletişimi sağlayan bir platform oluşturmaktır. Bu görev, bir ajanın tam yığın ortamında çok kullanıcılı durum makinelerini, veri yalıtımını ve zincirleme iletişimi yönetme yeteneğini değerlendirir.

Görev, aşağıdakileri içeren bir yardım masası sistemi oluşturmayı gerektiriyordu:

  • Müşteriler (bilet oluşturma/yanıtlama) ve Ajanlar (yönetim/çözüm) için ayrı izinler.
  • Yasadışı geçişleri önleyen ve role özgü eylemleri zorunlu kılan katı bir durum iş akışı.
  • Yetkisiz kaynak taleplerinin, sistem bütünlüğünü korumak için 403 yerine 404 döndürdüğü gelişmiş veri yalıtımı.
  • Sorunsuz ajan-müşteri etkileşimi için kronolojik bir yanıt sistemi.
  • Duyarlı bir Vite destekli ön uç (React/Vue/Svelte) ile birleştirilmiş bir FastAPI arka ucu.
  • Anında sistem etkinleştirme için belirli kabuk komutları aracılığıyla yeniden üretilebilir kurulum.

Görev 6 belgelerini GitHub'da görüntüleyebilirsiniz.

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Berk Kalelioğlu and Cem Dilmegani (2026) - "A-CODE-LLM Bench: Ajan Kodlama Kıyaslaması". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 23 Temmuz 2026, kaynak: https://aimultiple.com/agentic-llm [Çevrimiçi Kaynak]

Kalelioğlu, B., & Dilmegani, C. (2026, 23 Temmuz). A-CODE-LLM Bench: Ajan Kodlama Kıyaslaması. AIMultiple. https://aimultiple.com/agentic-llm

@misc{kalelioglu2026,
  author = {Kalelioğlu, Berk and Dilmegani, Cem},
  title  = {{A-CODE-LLM Bench: Ajan Kodlama Kıyaslaması}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/agentic-llm}},
  note   = {AIMultiple. Erişim tarihi: 23 Temmuz 2026}
}
Tüm verileri indir

429 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, 2 CSV dosyası ve bir README içeren ZIP dosyası olarak indirin.

Son güncelleme: 3 Temmuz 2026
İndir
Berk Kalelioğlu
Berk Kalelioğlu
AI Araştırmacısı
Berk, AIMultiple'da bir AI araştırmacısıdır ve etmen tabanlı AI sistemleri ile dil modellerine odaklanmaktadır.
Tam Profili Görüntüle
Teknik olarak inceleyen
Cem Dilmegani
Cem Dilmegani
Baş Analist
Cem, 2017'den beri AIMultiple'da baş analist olarak görev yapmaktadır. AIMultiple, Fortune 500'ün %55'i dahil olmak üzere her ay yüz binlerce işletmeyi (similarWeb verilerine göre) bilgilendirmektedir. Cem'in çalışmaları, Business Insider, Forbes, Washington Post gibi önde gelen küresel yayınlar, Deloitte, HPE gibi küresel firmalar, Dünya Ekonomik Forumu gibi STK'lar ve Avrupa Komisyonu gibi uluslarüstü kuruluşlar tarafından alıntılanmıştır. AIMultiple'a atıfta bulunan daha fazla saygın şirketi ve kaynağı görebilirsiniz. Kariyeri boyunca Cem, teknoloji danışmanı, teknoloji alıcısı ve teknoloji girişimcisi olarak görev yaptı. On yıldan fazla bir süre boyunca McKinsey & Company ve Altman Solon'da işletmelere teknoloji kararları konusunda danışmanlık yaptı. Ayrıca dijitalleşme üzerine bir McKinsey raporu yayınladı. CEO'ya rapor verirken bir telekom şirketinin teknoloji stratejisini ve satın alımını yönetti. Ayrıca, 2 yıl içinde sıfırdan 7 haneli yıllık yinelenen gelire ve 9 haneli değerlemeye ulaşan derin teknoloji şirketi Hypatos'un ticari büyümesini yönetti. Cem'in Hypatos'taki çalışmaları, TechCrunch ve Business Insider gibi önde gelen teknoloji yayınları tarafından ele alındı. Cem düzenli olarak uluslararası teknoloji konferanslarında konuşma yapmaktadır. Boğaziçi Üniversitesi'nden bilgisayar mühendisi olarak mezun olmuş ve Columbia Business School'dan MBA derecesine sahiptir.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450