İşletmeler düzenli görevleri için her gün LLM'ler kullanır. En uygun maliyetli LLM'leri bulmak için, strateji, pazarlama, İK, satış ve operasyonlar genelinde 69 gerçek kurumsal görev kullandığımız ajansal bir kurumsal kıyaslama olan AIM Enterprise'ı tasarladık.
Kıyaslama sonuçları
- Claude Opus 5 (66.4) ve GPT 5.6 Sol (62.4) üçüncü sıranın 7 puandan fazla önünde bitirdi ve görevlerin rastgele yeniden seçimlerindeki tüm 4.000 yeniden puanlamada ilk iki sırayı korudu.
- Opus 5 43 görevi 69 görevden kazandı ve Sol 13 görevi kazandı. Başka hiçbir model dörtten fazlasını kazanmadı.
- Opus 5 ayrıca en zor 17 görevde en yüksek ortalamaya sahipti: 66.2, Sol için 62.3'e karşı.
- Sonraki altı model 51.4 ile 55.2 arasında puan aldı. Bu fark, 69 görevin ayırt edebileceğinden daha yakındır; bu nedenle sıraları görev seçimine göre değişir.
Maliyet ve puan
- GPT 5.6 Luna, 55.2 puan aldı ve görev başına $0,040 maliyete sahipti. Bu, grafikteki en iyi modelin 7 puan altında ve maliyetinin on yedide birindedir.
- Fiyatlandırılan 11 modelde, görev başına maliyet ile puan 0.71 korelasyon gösterir.
- Tüm 16 kurulumda görev başına süre ile puan arasındaki korelasyon 0.55'tir. En hızlı dört model, en düşük puan alan beş modelin dördüydü ve Inkling Small, sondan ikinci olmak üzere bir görevi 49 saniyede bitirdi.
- Kimi K3 $0,652 ve Qwen 3.8 Max $0,628 ile, GPT 5.6 Sol'un $0,670 ile yaptığına yakın maliyete sahiptir ve 8 ile 11 puan daha düşük alır.
Hakem uyuşmazlığı
İki hakem model her dosyayı puanladı ve sıklıkla uyuşmazlığa düştü. Bireysel puanların yaklaşık üçte birinde ikisi, ölçeğin dörtte birinden fazla ayrıştı ve bu satırları kimse incelemedi.
Uçlarda anlaştılar, ortada değil. Her ikisi de Opus 5 ve GPT 5.6 Sol'u herkesten yukarı koydu, ancak hangi puanlama modelini izlediğinize bağlı olarak 16 kurulumdan 11'i farklı bir konuma yerleşir.
İkili ayrıca hangi liderin birinci geleceği konusunda da uyuşmazlığa düştü; her biri kendi şirketinin modelini en üste koydu. Yayınlanan sıra her iki sıralamayı birleştirir.
AIM Pazarlama kıyaslaması
Aynı yöntem pazarlama işinde de çalışır: bir rakibin yayınladığı ancak AIMultiple'ın yayınlamadığı teklifleri bulmak, en uygun hesap listesini oluşturmak ve kişiselleştirilmiş bir satış destesi üretmek. Her görev 0 ile 100 arasında puanlanır ve genel puan üçünün ortalamasıdır. Bir web sitesi itibar denetimi bunların yanında çalışır ve sabit bir maksimum puanı olmadığı için kendi eksenlerinde raporlanır.
Tam sonuçlar: ajansal pazarlama kıyaslaması.
AIM BT kıyaslaması
On iki modelin her biri bir kıyaslama tasarımı görevini iki kez çalıştırdı; bir kıyaslama icat etti, onu inşa etti ve dört modeli bu kıyaslamadan geçirdi. 24 denemenin hiçbiri her ölçüyü geçemedi ve değerlendirme listesindeki kontrollerin altısı hiçbiri tarafından geçilmedi. Claude Opus 5 metinden SQL'e dönüştürmede 78.2 ile, Kimi K3 ise araç çağırmada 74.3 ile öne geçti.
Tam sonuçlar: LLM'ler bir kıyaslama tasarlayabilir mi.
AIM VC kıyaslaması
On üç grafiğe alınmış modelden, üç hedef şirkette tarihli kanıtlarla bir şirketin müşterilerini adlandırması istendi. Claude Opus 5 89.1 puan aldı (100 üzerinden) ve Claude Fable 5 85.0 puan aldı; bu ikisi, puanlandığı şekliyle her üç hedefte de 76'nın üzerinde kalan tek modellerdi. Diğerlerinin çoğu, müşterileri dizine eklenmiş sayfalar yerine podcast reklamlarında görünen hedefte en düşük puanı aldı.
Tam sonuçlar: müşteri listesi kıyaslaması.
Yöntem
69 görev, AIMultiple'ın kurucusu tarafından gerçek şirket kararlarına göre yazılmış ve APQC Süreç Sınıflandırma Çerçevesi kimlikleriyle eşleştirilmiştir.1
Bunlar strateji (16 görev), pazarlama (15), İK (7), satış (6), operasyonlar (5), BT ve finans (her biri 4) ve yedi küçük alanı kapsar. Her görev istediği dosyayı adlandırır: sabit bir sütun listesine sahip, tipik olarak 10 satır ve 8 sütun içeren ve her tam sayı alanı için açık bir kural bulunan bir results.csv.
Modeller nasıl çalıştı
On üç model, bir kurulumun tek bir ajan programı altındaki bir model olduğu 16 kurulumda çalıştı. On biri opencode 1.15.13 ile OpenRouter üzerinden çalıştı. Geri kalanlar, kendi satıcılarının sunduğu ajan programlarında, aboneliklere faturalandırılarak Claude Code ve Codex üzerinde çalıştı.
Her kurulum aynı dondurulmuş prompt'u, bir scraping API aracılığıyla canlı web erişimini ve iki saatlik bir sınırı aldı. Prompt'lar model başına asla ayarlanmadı ve puanlama rubrikleri görevleri çalıştıran makineye asla ulaşmadı.
Hiç kimse bir akıl yürütme düzeyi seçmedi. Her kurulum kendi ajan programının varsayılanında çalıştı ve varsayılanlar tek bir düzey değil:
Claude Code 2.1.220, çalıştırdığı her iki model için yüksek düzeyi varsayılan olarak sunar ve Codex her çalıştırmada yüksek düzey kaydetti. opencode hiçbir şey seçmez ve düzeyi sağlayıcıya bırakır; bu nedenle bu sekiz model, her modelin kendi varsayılanında kalır.
Daha yüksek bir akıl yürütme varsayılanı, daha yüksek bir puanı beraberinde getirmedi. Yüksek düzeyin üzerinde varsayılana sahip iki model, maksimum düzeyde Kimi K3 ve çok yüksek düzeyde Qwen 3.8 Max, 4th ve 8th sırada bitirdi, 13 model arasında. Hem satıcı CLI hem opencode altında çalışan üç model, kendi sonuçları arasında 0.83 puan içinde kaldı.
Buradaki her maliyet rakamı, bir çalıştırmanın gerçekte taşıdığı token'lardan, OpenRouter'ın 19 Ağustos 2026'da okunan liste fiyatlarıyla yeniden hesaplanır; önbelleğe alınmış girdiler önbellek ücretiyle faturalandırılır.
Ajan programlarının kendi faturalandırmaları karşılaştırılabilir olmaz. opencode kendi paket fiyat listesine göre faturalandırır; Claude Code ve Codex çalıştırmaları, çalıştırma başına ücret kaydetmeyen aboneliklere faturalandırılır. İki Claude Code kurulumu kullanım kaydı tutmadı ve hiçbir şekilde fiyatlandırılamaz.
Bu, görev başına kurulum başına bir dosya olmak üzere 1.104 dosya üretti. Altı opencode kurulumu, ajanın dosya araması kendi sanal alanının daha sonra açmayı reddettiği yollara girdiği için ilk geçişte 25 çalıştırmayı kaçırdı; bu da çalıştırmayı durdurdu. Bu 25 çalıştırmayı yalıtılmış bir dizinde yeniden çalıştırmak hepsini kurtardı; bu nedenle teslimat hem ilk geçiş hem de nihai oran olarak raporlanır. Her görev bir kez çalıştırıldı ve bir kez puanlandı. Dosya üretmeyen bir model yeniden çalıştırıldı, ancak hiçbir dosya iki kez puanlanmadı; dolayısıyla iki denemeden daha iyisini seçmekten hiçbir sonuç gelmedi.
Yetmişinci bir görev, sorgu işleme kılavuzu, buradaki her rakamın dışında bırakılmıştır. Girdi dosyası çalışma zamanında eksikti ve yalnızca bir kurulum onun için dosya üretti. Her yeniden başlatma sayıldığında, 83'ü (kullanım kaydı bulunan 759 çalıştırmanın) birden fazla deneme gerektirdi.
Kontroller ve hakemler nasıl çalışır
Deterministik kontroller önce çalışır ve bunları geçemeyen hiçbir dosyayı hiçbir hakem görmez: sütun kümesi ve satır sayısı, RFC 4180 ayrıştırması,2
tam sayı biçimlendirmesi, boş hücre yok, yinelenen satır yok ve görevin gerektirdiği yerde sıralama düzeni.
Başarısız olan bir dosya, atılmak yerine sıfır puan alır. DeepSeek V4 Flash, 69 dosyasının 6'sında başarısız oldu; Inkling Small 2'sinde, MiniMax M3 ve GPT 5.6 Terra ise birer tanesinde başarısız oldu. Herhangi bir kurulumun başarısız olduğu her görev çıkarıldığında iki lider yerinde kalıyor.
Geçen 1.094 dosya iki hakeme gitti: Codex CLI üzerinden GPT 5.6 Sol ve Claude Code CLI üzerinden Claude Opus 5; her ikisi de canlı web erişimiyle yüksek akıl yürütme çabasıyla.
Dosyanın her sütunu, her hakem için ayrı ayrı karıştırılmış anonim satır kimlikleri altında, o sütunun her modelden gelen yanıtlarını ve başka hiçbir şeyi gören kendi alt ajanına gider. Hakem bu yanıtları birbirine karşı sıralar ve herhangi iki tanesini eşit olarak adlandıramaz. Ardından iki sıralama, her yanıtın her hakem altındaki konumu toplanarak birleştirilir. Bu, 90.530 puan üretti.
Model adları görünürken ölçüldüğünde, Sol GPT yanıtlarını Opus'un sıraladığından 8.4 yüzdelik dilim daha yukarıda sıraladı ve Opus da Anthropic yanıtlarını Sol'un sıraladığından 4.9 yüzdelik dilim daha yukarıda sıraladı. Anonimleştirme bu etkiyi ortadan kaldırmıyor. Bu liderlik tablosunun arkasındaki çalıştırmalar anonimleştirildi ve her hakem yine de kendi şirketinin kurulumunu birinci sıraya koydu.
Puanlama nasıl çalışır
Bir modelin puanı, olası en yüksek toplam 100 olacak şekilde yeniden ölçeklendirilmiş sütun ortalamalarının toplamıdır. Bu tavan, kontrolleri kaç modelin geçtiğine bağlıdır; bu nedenle bu puanlar yalnızca bu kıyaslama içinde karşılaştırılır, başka hiçbir yerde değil.
Sıralamanın görev seçimine ne kadar bağlı olduğunu test etmek için liderlik tablosunu 4.000 kez, her seferinde 69 görevin rastgele yeniden seçimiyle yeniden puanladık. Bu yalnızca görev duyarlılığını ölçer. Aynı görevin yeniden çalıştırılmasının bir puanı ne kadar değiştireceğini ölçmez, çünkü hiçbir görev iki kez puanlanmadı.
En zor çeyrek, 17 görevdir; bu görevler tüm 16 kurulumdaki en düşük ortalama puana sahiptir. Bu kural, herhangi bir modelin bu görevlerdeki durumu hesaplanmadan önce sabitlenmiştir.
13 modelin on ikisi yukarıdaki kıyaslamalarda da yer alıyor. Puanları diğerine taşınmaz, çünkü her kıyaslama kendi ölçeğini belirler.
Buradaki her puan, karşılaştırıldığı modellere göre bir konumdur; bu nedenle bir kurulumu çıkarmak, bir çubuğu kaldırmak yerine geri kalan tümünü yeniden puanlayacaktır. Qwen 3.8 Max yalnızca bu kıyaslamayı çalıştırır ve bu nedenle grafikte kalır.
SSS'ler
Bu kanıtlara göre hayır. Ölçek görelidir; bu nedenle 66.4 olan en yüksek puan bile yalnızca bir modelin yanıtlarının diğerlerinin üzerinde sıralandığını söyler ve iki puanlama modelinin önemli ölçüde ayrıştığı satırlar incelenmemiştir. Bu tür bir ajan geliştiren satıcılar, kurumsal yapay zeka şirketleri dökümümüzde listelenmiştir ve AIMultiple bunlar gibi süreçleri otomatikleştirir.
Çünkü altı tanesi gerçekten birbirine yakın ve 69 görev yaklaşık 1.5 puanın altındaki farkları ayırt edemez. Kıyaslama güçlü modelleri zayıf olanlardan ayırır. Görev yeniden örnekleme ortadaki altıyı yeniden sıralar.
Test edebildiğimiz üç durumda, çıktı kalitesi için önemli değil. Üç modelin her biri iki ajan programı altında çalıştı ve satıcı CLI'ları yüksek düzeyde akıl yürütse ve opencode çalıştırmaları sağlayıcı varsayılanını alsa bile hiçbir çift 0.83 puandan fazla farklılık göstermedi. Grafikler bu üçü için satıcının kendi programını çizer. Fark bunun yerine operasyonlarda ortaya çıktı: yalnızca opencode kurulumları sanal alan çakışması nedeniyle çalıştırma kaybetti ve yalnızca Claude Code kullanım kaydı bırakmadı.
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{kalelioglu2026,
author = {Kalelioğlu, Berk},
title = {{AIM Enterprise: Ajansal Kurumsal Kıyaslama}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/agentic-enterprise}},
note = {AIMultiple. Erişim tarihi: 24 Ağustos 2026}
}
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.