Hizmetler
Bize Ulaşın

AIM Enterprise: Ajanik Kurumsal Benchmark

Berk Kalelioğlu
Berk Kalelioğlu
Güncellenme tarihi: 14 Ağu 2026

Kurumlar düzenli görevleri için her gün LLM'ler kullanıyor. En maliyet etkin LLM'leri bulmak için, farklı kategorilerde 69 kurumsal görevi kullandığımız ajansal bir kurumsal benchmark olan AIM Enterprise'ı tasarladık.

Benchmark sonuçları

Loading Chart

Her model her görev için bir dosya teslim etti. Puanlar görelidir: jüriler her yanıtı aynı görevdeki diğer yanıtlara göre sıralar, bu nedenle ortalama puan tasarım gereği 50'dir. Bir 55, bir modelin yanıtlarının çoğu diğerinden üst sırada yer aldığını gösterir; işinin %55'inin doğru olduğunu değil.

İki model açık ara önde bitirdi. Claude Opus 5 66.4 puan aldı ve GPT 5.6 Sol 62.4 puan aldı; üçüncü sıradaki kurulumdan 7 puandan fazla önde. Liderlikleri hangi görevleri seçtiğimize bağlı değildir: 69 görevin rastgele yeniden seçimleri üzerinde liderlik tablosunu 4.000 kez yeniden puanladık ve bu ikisi her seferinde birinci ve ikinci sırayı korudu.

Sonraki dokuz model 51.4 ile 55.3 arasında puan aldı. Altmış dokuz görev bu kadar yakın puanları ayırt edemez; bu nedenle sıralamaları hangi görevlerin sayıldığına bağlı olarak değişir. Kimi K3, yeniden puanlamaların %94'ünde Claude Sonnet 5'in üzerinde bitirerek bu grupta istisnadır.

Opus 5 en zor görevleri de kazandı. Tüm 16 kurulum genelinde en düşük ortalama puana sahip 17 görevi aldık; bu kural, bu görevlerdeki herhangi birinin sıralaması hesaplanmadan önce sabitlendi ve Opus 5 bu alt kümede diğer 15 kurulumun tümünü yendi.

Opus 5'in zayıf görevi yoktur. En iyi puanı olan 80.6, herkesin aldığı en yüksek puandır ve en kötü puanı olan 52.9 yine de ortalama bir yanıtı geçer. 69 görevin 62'sinde 60'ın üzerinde puan aldı ve bunların 43'ünde birinci oldu. GPT 5.6 Sol 13 görev kazandı ve başka hiçbir model dörtten fazla kazanamadı.

İki puanlama modeli, liderlerden hangisinin birinci olması gerektiği konusunda anlaşamadı. Her biri kendi şirketinin modelini en üste koydu; bu nedenle yayınlanan sıralama her iki sıralamayı birleştirir.

Maliyet ve puan

Maliyet, çalıştırma başına faturalandırılan 11 kurulumu kapsar. Her iki lider de dahil olmak üzere beş kurulum, çalıştırma başına ücret kaydetmeyen abonelikler üzerinde çalıştı.

En iyi puan alan ücretli kurulum aynı zamanda en ucuzudur. GPT 5.6 Luna, görev başına $0.032 ile 55.3 puan aldı; bu, görev başına $0.033 olan DeepSeek V4 Flash'ın hemen altındadır. Claude Sonnet 5 $1.46 ile 53.2 puan aldı; bu, maliyetin 46 katı ve 2.1 puan daha düşüktür.

Burada daha fazla ödemek çok az şey kazandırır. Ücretli 11 kurulum genelinde görev başına maliyet ile puan arasındaki korelasyon 0.48'dir. $0.92 ile Kimi K3 ve $0.74 ile Qwen 3.8 Max, $0.03 ile Luna ile aynı aralıkta puan aldı.

Hızlı bir çalıştırma bir uyarı işaretidir, ancak yavaş olan hiçbir şey kanıtlamaz. Tüm 16 kurulum genelinde görev başına süre ile puan arasındaki korelasyon 0.55'tir ve en hızlı dört kurulum, en düşük puan alan beş kurulumun dördüydü. Inkling Small bir görevi 49 saniyede bitirdi ve sondan ikinci oldu. Ortada kümelenen ve 127 ile 569 saniye arasında süren dokuz model arasında bu korelasyon −0.06'ya düşer.

Maliyetler, sistemin paketli fiyat listesinden faturalandırdığı tutarlardır; bir fiyat teklifi değildir. Sağlayıcı liste fiyatları LLM fiyatlandırma karşılaştırmamızda yer alır. Başarısız denemeler bir modelin toplamında sayılır, ancak görev başına rakamında sayılmaz ve bu ikisi en çok Grok 4.5 için farklılık gösterir: teslim edilen çalıştırmaların $22.84'üne karşılık $26.14 harcandı.

Jüri anlaşmazlığı

Her dosyayı iki model puanladı ve sıklıkla anlaşmazlığa düştüler. Bireysel puanların yaklaşık üçte birinde iki model, ölçeğin dörtte birinden daha fazla ayrı düştü ve hiç kimse bu satırları incelemedi.

Uçlarda anlaştılar, ortada değil. Her ikisi de Opus 5 ve GPT 5.6 Sol'u diğer herkesin üzerine koydu; ancak 16 kurulumdan 11'i hangi puanlama modelini izlediğinize bağlı olarak farklı bir konuma düşer.

Her görev bir kez çalıştırıldı ve bir kez puanlandı. Dosya üretmeyen bir model yeniden çalıştırıldı, ancak hiçbir dosya iki kez puanlanmadı; bu nedenle iki denemenin iyisini seçmekten hiçbir sonuç elde edilmedi.

Yetmişinci görev, bir sorgu yönetimi rehberi, buradaki her rakamın dışında bırakılmıştır. Girdi dosyası çalıştırma sırasında eksikti ve onun için yalnızca bir kurulum dosya üretti.

AIM Marketing benchmark'ı

Aynı yöntem pazarlama işlerinde de çalışır: bir rakibin yayınladığı ve AIMultiple'ın yayınlamadığı teklifleri bulma, en uygun hesap listesini oluşturma ve kişiselleştirilmiş bir satış destesi hazırlama. Her görev 0 ile 100 arasında puanlanır ve genel puan bu üçünün ortalamasıdır. Bir web sitesi itibar denetimi bunların yanında çalışır ve sabit bir maksimum puanı olmadığı için kendi eksenlerinde raporlanır.

Tam sonuçlar: ajanik pazarlama benchmark'ı.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

AIM IT benchmark'ı

On iki modelden bir benchmark icat etmeleri, onu oluşturmaları ve dört modeli bu benchmark'tan ikişer kez geçirmeleri istendi. 24 denemenin hiçbiri her kriteri geçemedi ve değerlendirme tablosundaki kontrollerin altısından hiçbiri geçemedi. Claude Opus 5 78.2 ile metinden SQL'e dönüştürmede öndeydi ve Kimi K3 araç çağırma konusunda 74.3 ile öndeydi.

Tam sonuçlar: LLM'ler bir benchmark tasarlayabilir mi.

AIM VC benchmark'ı

On üç modelden, üç hedef şirket genelinde bir şirketin müşterilerini tarihli kanıtlarla adlandırmaları istendi. Claude Opus 5 100 üzerinden 89.1 puan aldı ve Claude Fable 5 85.0 puan aldı; bu ikisi, üç hedefin tamamında 76'nın üzerinde kalan tek modellerdi. Diğerlerinin çoğu, müşterileri dizine eklenmiş sayfalar yerine podcast sponsor okumalarında adı geçen hedefte çöktü.

Tam sonuçlar: müşteri listesi benchmark'ı.

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Metodoloji

69 görev, AIMultiple'ın kurucusu tarafından gerçek şirket kararlarına dayanarak yazıldı ve APQC Process Classification Framework kimlikleriyle eşleştirildi.1

Strateji (16 görev), pazarlama (15), İK (7), satış (6), operasyonlar (5), BT ve finans (her biri 4) ve yedi daha küçük alanı kapsar. Her görev teslim edilecek çıktıyı adlandırır: sabit bir sütun listesi olan, genellikle 10 satır ve 8 sütunlu, her tam sayı alanı için açık bir kural içeren bir results.csv.

Modeller nasıl çalıştı

On üç model 16 kurulumda çalıştı; bir kurulum, bir ajan programı altındaki bir modeldir. On biri OpenRouter üzerinden opencode 1.15.13 ile çalıştı. Geri kalanlar, kendi satıcılarının sunduğu Claude Code ve Codex ajan programlarında, aboneliklere faturalandırılarak çalıştı.

Her kurulum aynı dondurulmuş prompt, bir scraping API aracılığıyla canlı web erişimi ve iki saatlik bir sınır aldı. Prompt'lar hiçbir modele göre ayarlanmadı ve puanlama rubrikleri görevleri çalıştıran makineye asla ulaşmadı.

Bu, model başına görev başına bir dosya olmak üzere 1.104 dosya üretti. Altı opencode kurulumu ilk geçişte 25 hücreyi kaçırdı; çünkü ajanın dosya araması, kendi sandbox'unun daha sonra açmayı reddettiği yollarda gezinerek çalıştırmayı durdurdu. Bu 25 hücreyi yalıtılmış bir dizinde yeniden çalıştırmak hepsini kurtardı; bu nedenle teslimat hem ilk geçiş hem de nihai oran olarak raporlanır. Her yeniden başlatma sayıldığında, kullanım kaydı olan 759 hücreden 83'ü birden fazla deneme gerektirdi.

Kontroller ve jüriler nasıl çalışır

Deterministik kontroller önce çalışır ve bu kontrolleri geçemeyen bir dosyayı hiçbir jüri görmez: sütun kümesi ve satır sayısı, RFC 4180 ayrıştırma,2

tam sayı biçimlendirmesi, boş hücre olmaması, yinelenen satır olmaması ve görevin gerektirdiği yerde sıralama düzeni.

Başarısız olan bir dosya düşürülmek yerine sıfır puan alır; çünkü kimsenin ayrıştıramadığı bir dosya bir sonuçtur. DeepSeek V4 Flash 69 dosyasının 6'sında başarısız oldu; Inkling Small 2'sinde, MiniMax M3 ve GPT 5.6 Terra ise birer tanesinde başarısız oldu. Herhangi bir kurulumun başarısız olduğu her görev çıkarıldığında, iki lider ve genel yapı bozulmadan kalır.

Geçen 1.094 dosya iki jüriye gitti: Codex CLI aracılığıyla GPT 5.6 Sol ve Claude Code CLI aracılığıyla Claude Opus 5; her ikisi de canlı web erişimi ile yüksek akıl yürütme çabasında.

Teslim edilecek çıktının her sütunu kendi alt ajanına gider; bu alt ajan, her jüri için ayrı ayrı karıştırılmış anonim satır kimlikleri altında yalnızca o sütundaki her modelin yanıtlarını görür ve başka hiçbir şey görmez. Jüri bu yanıtları birbirine göre sıralar ve herhangi iki yanıtın eşit olduğunu söyleyemez. Daha sonra iki sıralama, her yanıtın her jüri altındaki konumu toplanarak birleştirilir. Bu, 90.530 puan üretti.

Anonimleştirme kozmetik değildir. Model adları görünürken ölçüldüğünde Sol, GPT yanıtlarını Opus'un sıraladığı yerin 8.4 persentil üzerinde sıraladı; Opus da Anthropic yanıtlarını Sol'un sıraladığı yerin 4.9 persentil üzerinde sıraladı. Bu, etkiyi ortadan kaldırmaz: bu liderlik tablosunun arkasındaki çalıştırmalar anonimleştirildi ve her jüri yine de kendi şirketinin kurulumunu birinci sıraya koydu.

Puanlama nasıl çalışır

Bir modelin puanı, sütun ortalamalarının toplamıdır ve mümkün olan en yüksek toplam 100 olacak şekilde yeniden ölçeklendirilir. Bu tavan, kontrolleri geçen model sayısına bağlıdır; bu nedenle bu puanlar yalnızca bu benchmark içinde karşılaştırılır, başka hiçbir yerde değil.

Sıralamanın görev seçimine ne kadar bağlı olduğunu test etmek için liderlik tablosunu 4.000 kez, her seferinde 69 görevin rastgele bir yeniden seçiminde yeniden puanladık. Bu yalnızca görev duyarlılığını ölçer. Aynı görevin yeniden çalıştırılmasının bir puanı ne kadar değiştireceğini ölçmez; çünkü hiçbir görev iki kez puanlanmadı.

En zor çeyrek, tüm 16 kurulum genelinde en düşük ortalama puana sahip 17 görevdir. Bu kural, bu görevlerdeki herhangi bir modelin sıralaması hesaplanmadan önce sabitlendi.

Buradaki 13 modelin on ikisi yukarıdaki diğer benchmark'larda da çalışır; bu nedenle sıralamaları seri boyunca taşınır. Rakamlar taşınmaz; çünkü her benchmark kendi ölçeğini belirler.

Bu benchmark, diğerlerinin yapabildiği şekilde kısaltılamaz. Her puan, karşılaştırılan modellere göre bir konumdur; bu nedenle bir kurulumu çıkarmak, bir çubuğu kaldırmak yerine geri kalan tüm puanları yeniden hesaplar. Qwen 3.8 Max yalnızca bu benchmark'ta çalışır ve bu nedenle grafikte kalır.

SSS'ler

Bu kanıtlara göre hayır. Ölçek görelidir; bu nedenle 66.4'lük en yüksek puan bile yalnızca bir modelin yanıtlarının diğerlerinin üzerinde sıralandığını söyler ve iki puanlama modelinin önemli ölçüde anlaşmazlığa düştüğü satırlar incelenmemiştir. Bu tür ajanlar geliştiren satıcılar kurumsal yapay zeka şirketleri dökümümüzde listelenmiştir ve AIMultiple bunlar gibi süreçleri otomatikleştirir.

Çünkü dokuzu gerçekten yakındır ve 69 görev, yaklaşık 1.5 puanın altındaki farkları ayırt edemez. Benchmark güçlü modelleri zayıf olanlardan ayırır; orta sıradaki bir modeli bir sonrakinden değil.

Test edebildiğimiz üç durumda, çıktı kalitesi için değil. Üç modelin her biri iki ajan programı altında çalıştı ve hiçbir çift 0.83 puandan fazla farklılık göstermedi. Fark bunun yerine operasyonlarda ortaya çıktı: yalnızca opencode kurulumları bir sandbox çakışması nedeniyle hücre kaybetti ve yalnızca abonelikle faturalandırılan programlar kullanım kaydı bırakmadı.

Bu araştırmayı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Berk Kalelioğlu (2026) - "AIM Enterprise: Ajanik Kurumsal Benchmark". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 14 Ağustos 2026, kaynak: https://aimultiple.com/agentic-enterprise [Çevrimiçi Kaynak]

Kalelioğlu, B. (2026, 14 Ağustos). AIM Enterprise: Ajanik Kurumsal Benchmark. AIMultiple. https://aimultiple.com/agentic-enterprise

@misc{kalelioglu2026,
  author = {Kalelioğlu, Berk},
  title  = {{AIM Enterprise: Ajanik Kurumsal Benchmark}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/agentic-enterprise}},
  note   = {AIMultiple. Erişim tarihi: 14 Ağustos 2026}
}
Berk Kalelioğlu
Berk Kalelioğlu
Yapay Zeka Araştırmacısı
Berk, AIMultiple'da yapay zeka araştırmacısıdır; etmen tabanlı yapay zeka sistemleri ve dil modellerine odaklanmaktadır.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450