Premium
Hizmetler
Premium

AIM Enterprise: Otonom Kurumsal Benchmark

Berk Kalelioğlu
Berk Kalelioğlu
Güncellenme tarihi: 17 Eyl 2026

Kuruluşlar düzenli görevleri için her gün LLM'ler kullanır. En maliyet etkin LLM'leri bulmak için, strateji, pazarlama, İK, satış ve operasyonları kapsayan 69 gerçek kurumsal görev kullandığımız etmen tabanlı bir kurumsal benchmark olan AIM Enterprise'ı tasarladık,

Benchmark sonuçları

Grafik Yükleniyor
  • Opus 5 39 görevde daha yüksek puan aldı, Astra ise 30 görevde. İlk dört, Claude Fable 5.1 ve Grok 4.6 ile birlikte, 2.9 puan aralığına yayılıyor.
  • Astra 23 görevde, Opus 5 22 görevde ve Fable 5.1 16 görevde öndeydi.
  • Claude Fable 5.1, Claude Fable 5'i 69 görevin 63'ünde yendi ve ortalama 7.2 puan daha yüksek aldı. GPT 6 Astra, GPT 5.6 Sol'dan ortalama 8.8 puan daha yüksek aldı ve onu 61 görevde yendi.
  • Claude Sonnet 5 görev başına $1,23 tutuyor. Gemini 3.8 Flash, $0,61 maliyetle 1.5 puan daha yüksek puan aldı ve Grok 4.6, $1,09 maliyetle 13 puan daha yüksek puan aldı.

Maliyet ve puan

  • GPT 6 Astra ve Claude Opus 5 yaklaşık aynı maliyete sahip; görev başına $1,76 ve $1,73 tutuyor ve puanları 1.6 puan farklı.
  • GPT 5.6 Luna, görev başına $0,016 maliyetle 45.2 puan aldı; bu, Claude Opus 5'in maliyetinin yüzde birinin altında bir maliyetle 18.7 puan altında.
  • GPT 5.6 Sol, görev başına $0,167 maliyetle 53.5 puan alıyor. Grok 4.6 7.5 puan daha yüksek puan alıyor ve 6.5 kat daha maliyetli.
  • Claude Fable 5.1, görev başına $3,19 maliyetle listedeki en pahalı modeldir ve maliyeti $1,73 olan Claude Opus 5'in 1.8 puan altında puan alır.
  • Listedeki 16 model genelinde, görev başına maliyet ile puan arasındaki korelasyon 0.68'dir. Görev başına medyan süre ile puan arasındaki korelasyon 0.04'tür. Görev başına 66 saniye ile en hızlı model olan Inkling Small son sırada yer alıyor.

Hakem uyuşmazlığı

İki hakem model, kontrolleri geçen her dosyayı puanladı. Bireysel puanların %32,7'sinde iki hakem ölçeğin dörtte birinden fazla farklılaştı ve bu satırları kimse incelemedi.

Her iki hakem de aynı dört kurulumu ilk dörde ve aynı iki kurulumu sona koydu; 17 kurulumdan 12'si her hakeme göre farklı sıralanıyor.

Her hakem kendi şirketinin modelini birinci sıraya koydu. GPT 5.6 Sol, GPT 6 Astra'yı birinci ve Claude Opus 5'i ikinci olarak sıraladı; Opus 5 kendisini birinci, Astra'yı dördüncü olarak sıraladı. Yayımlanan sıra her iki sıralamayı birleştirir.

AIM Pazarlama benchmark

Aynı yöntem pazarlama işlerinde de kullanılır: bir rakibin yayımladığı ancak AIMultiple'ın yayımlamadığı teklifleri bulmak, en uygun hesap listesini oluşturmak ve kişiselleştirilmiş bir satış destesi hazırlamak. Her görev 0 ile 100 arasında puanlanır ve genel puan üç görevin ortalamasıdır. Bir web sitesi itibar denetimi bunlarla birlikte çalışır ve sabit bir maksimum puanı olmadığı için kendi eksenlerinde raporlanır.

Tüm sonuçlar: etmen tabanlı pazarlama benchmark.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

AIM BT benchmark

On iki modelin her biri bir benchmark tasarımı görevini iki kez çalıştırdı; bir benchmark icat etti, onu oluşturdu ve dört modeli bu benchmark üzerinde çalıştırdı. 24 denemeden hiçbiri her kriteri geçemedi ve rubrikteki kontrollerin altısını hiçbir model geçemedi. Claude Opus 5, metin-SQL'de 78.2 puanla ve Kimi K3 araç çağırmada 74.3 puanla öndeydi.

Tüm sonuçlar: LLM'ler bir benchmark tasarlayabilir mi.

AIM VC benchmark

On üç grafikte yer alan modelden, üç hedef şirkette tarihli kanıtlarla bir şirketin müşterilerini adlandırması istendi. Claude Opus 5 89.1/100 puan aldı ve Claude Fable 5 85.0 puan aldı; puanlanan üç hedefin tamamında 76 puanın üzerinde kalan yalnızca bu ikisi oldu. Diğerlerinin çoğu, müşterileri dizine eklenmiş sayfalarda değil podcast reklamlarında görünen hedefte en düşük puanı aldı.

Tüm sonuçlar: müşteri listesi benchmark'ı.

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Etmen tabanlı kurumsal platformlar

Şirketler LLM'leri iş yazılımları aracılığıyla da kullanabilir. Aşağıdaki platformlar, OpenAI, Anthropic ve Google gibi sağlayıcılardan gelen modelleri CRM kayıtlarına, iş akışlarına ve önceden oluşturulmuş etmenlere bağlar.

Creatio

Creatio, önceden oluşturulmuş yapay zeka etmenlerine sahip bir CRM ve iş akışı platformudur.

Departmana göre etmenler: Kullanılabilir etmenler, bir şirketin yüklü olan uygulamalarına bağlıdır. Örnekler:

  • Satış Etmeni: hesap verilerini zenginleştirir, Zoom toplantılarından sonra fırsat alanlarını doldurur ve yeni toplantılara hazırlanır.
  • Bilgi Etmeni: çözülen vakalardan bilgi tabanı makaleleri taslağı oluşturur.
  • Segmentasyon Etmeni: sade dille yazılmış hedef kitle açıklamalarını pazarlama segmentlerine dönüştürür.

Etmen başına, şirket içinde barındırılanlar da dahil olmak üzere ayrı model: Her etmen veya alt etmen kendi modelini kullanabilir. Desteklenen seçenekler OpenAI, Azure OpenAI ve LiteLLM destekli sağlayıcılar olup şirketin kendi altyapısındaki modeller de dahildir. Etmen senaryoları en az 40.000 token'lık bağlam penceresi ve işlev çağırma gerektirir.

Salesforce Agentforce

Agentforce, Salesforce'un CRM'ine ait etmen katmanıdır.

Modeller: Etmenler, Salesforce destekli iş ortağı modellerini kullanır; bunlar Anthropic, Google ve OpenAI'yi içerir. Şirketler ayrıca kendi LLM hesaplarını bağlayabilir ve bir etmenin varsayılan modeli değiştirilebilir.

Einstein Güven Katmanı: Model çağrıları, Salesforce'un toksisite tespiti, sıfır veri saklama anlaşmaları ve prompt enjeksiyon savunması içerdiğini söylediği bir katmandan geçer.

Bir kişiye devretme: “İnsan etmene aktar” bir etmenin seçebileceği eylemlerden biridir. Bu, bir süreç hataları tolere edemediğinde konuşmanın bir kişiye geçmesini sağlar.

Microsoft Copilot Studio

Copilot Studio, Microsoft'un Microsoft 365 ve Power Platform için etmenler oluşturma aracıdır.

Modeller: Varsayılan olarak OpenAI modelleri kullanılır. Oluşturucular ayrıca Anthropic, xAI veya Mistral'dan harici modeller ekleyebilir.

Üretim etiketleri: Microsoft bazı modelleri deneysel veya önizleme olarak işaretler ve bunların üretimde kullanılmasını önermez. Bu modelleri kullanan yayımlanmış etmenler yine standart ücretler üzerinden faturalandırılır.

Yedek: Bir yönetici Anthropic modellerini kapatırsa, bunların üzerine kurulu etmenler otomatik olarak varsayılan OpenAI modeline geçer.

Metodoloji

69 görev, AIMultiple'ın kurucusu tarafından gerçek şirket kararlarına dayanarak yazıldı ve APQC Process Classification Framework kimlikleriyle eşleştirildi.1

Bunlar strateji (16 görev), pazarlama (15), İK (7), satış (6), operasyon (5), BT ve finans (her biri 4) ve yedi daha küçük alanı kapsar. Her görev istediği dosyayı adlandırır: sabit bir sütun listesine sahip, genellikle 10 satır ve 8 sütun içeren ve her tamsayı alanı için açık bir kural bulunan bir results.csv.

Modeller nasıl çalıştı

On altı model, 17 kurulumda çalıştı; kurulum, bir etmen programı altındaki bir modeldir. Sekizi OpenRouter üzerinden opencode 1.15.13 ile çalıştı. Diğer dokuzu, satıcılarının kendi etmen programları olan Claude Code, Codex veya Grok Build kullandı. Hepsi abonelikler üzerinden faturalandırıldı.

Fable 5.1, Claude Code 2.1.258 üzerinde çalışırken diğer üç Claude kurulumu 2.1.220 üzerinde çalıştı; Astra, Codex 0.153.4 üzerinde çalışırken üç GPT 5.6 kurulumu 0.146.0 üzerinde çalıştı. Gemini 3.8 Flash diğerleriyle aynı opencode sürümünde çalıştı.

Her kurulum aynı dondurulmuş promptu, scraping API üzerinden canlı web erişimini ve bir saatlik sınırı aldı. Promptlar hiçbir zaman model başına ayarlanmadı ve puanlama rubrikleri görevleri çalıştıran makineye hiç ulaşmadı.

Kimse bir akıl yürütme düzeyi seçmedi. Her kurulum etmen programının varsayılanında çalıştı ve varsayılanlar tek bir düzey değil:

Claude Code, çalıştırdığı her modelde varsayılan olarak yüksek düzeye ayarlıdır. Codex her modelin katalog varsayılanını gönderir. Bu, GPT 5.6 Sol için düşük, Luna, Terra ve GPT 6 Astra için ortadır. Grok Build, Grok 4.6'yı yüksek düzeyde çalıştırdı. opencode düzeyi sağlayıcıya bırakır; bu nedenle sekiz kurulumu her modelin OpenRouter varsayılanında çalıştı.

Daha yüksek bir akıl yürütme varsayılanı daha yüksek puan getirmedi. 16 modellik listede varsayılanı yüksek düzeyin üzerinde olan üç model 9th, 11th ve 14th sırada yer alıyor: maksimumda GLM 5.3, xhigh düzeyinde Qwen 3.8 Max ve maksimumda Kimi K3. Claude Sonnet 5 hem bir satıcı CLI'sı hem de opencode altında çalıştı ve 47.9 ve 47.5 puan aldı.

Buradaki her maliyet rakamı, 27 Ağustos 2026'da dondurulmuş OpenRouter liste fiyatları üzerinden kaydedilen token kullanımından yeniden hesaplanmıştır. Akıl yürütme token'ları çıktı token'ları olarak fiyatlandırılır; OpenRouter bunları böyle faturalandırır. GPT 6 Astra ve Gemini 3.8 Flash daha sonra katıldı ve 5 Eylül 2026'da okunan OpenRouter ücretlerini kullanıyor; Claude Fable 5.1, OpenRouter onu listelemediği için aynı tarihteki Anthropic yayınlanmış ücretlerini kullanıyor.

Claude Code maliyetleri ayrıca sabit bir fiyat listesinde bulunmayan üç yayımlanmış Anthropic kuralını uygular. Bir saatlik prompt önbelleği giriş ücretinin iki katı tutarındadır; beş dakikalık önbellek ise giriş ücretinin 1.25 katıdır. Web araması her bin istek için $10 tutar. Claude Code'un ana modelin yanında çalıştırdığı Haiku 4.5 alt etmeni dahildir.

Etmen programlarının kendi maliyet rakamları karşılaştırılabilir değildir. Her çalıştırma abonelik üzerinden yapıldığından hiçbir kurulumun çalıştırma başına faturası yoktur. Bir program maliyet bildirdiğinde, kendi token'larını kendi listesine göre fiyatlandırır. opencode paketlenmiş bir fiyat listesi kullanır. Grok Build, genel ücretin yaklaşık üçte biri oranında bir xAI listesi kullanır. Codex hiçbir şey bildirmez. Claude Code, Sonnet 5'i milyon token başına $3 ve $15 olarak fiyatlandırdı; bu, Claude Sonnet 4.6'nın ücretidir; oysa Sonnet 5 $2 ve $10'dur.

Çalıştırmalar, 1.173 kurulum-görev çiftinden 1.140 dosya üretti. Eksik bir dosya sıfır puan alır ve yeniden çalıştırılmaz; ancak çalıştırma bir saatlik sınıra ulaştıysa veya modelin sağlayıcısından kaynaklanan bir hatayla sona erdiyse yeniden çalıştırılır; her istisna bir yeniden denemeye izin verir.

Beş çalıştırma takıldı ve dördü yeniden denemede dosya teslim etti. On sekiz çalıştırma, sağlayıcı hatasıyla, API'den gelen bir 502 veya 504 ya da bozuk bir yanıtla sona erdi. Biri dosyasını zaten yazmıştı; diğer 17'si yeniden çalıştırıldı ve 16'sı teslim etti. Bir çalıştırma hem zaman sınırına hem de sağlayıcı hatasına takıldı.

Sekiz Qwen 3.8 Max çalıştırması, opencode'un döngü koruması modelin aynı araç çağrısını üçüncü kez tekrarlamasını durdurduğunda sona erdi. Başka hiçbir kurulum korumayı tetiklemedi. Bu çalıştırmalar yeniden çalıştırılmadı ve dördü hiç dosya üretmedi. Her dosya bir kez puanlandı; bu nedenle hiçbir sonuç iki denemeden daha iyisini seçmekten gelmedi.

Kontroller ve hakemler nasıl çalışır

Önce deterministik kontroller çalışır ve bunları geçemeyen bir dosyayı hiçbir hakem görmez: sütun kümesi ve satır sayısı, RFC 4180 ayrıştırma,2

tamsayı biçimlendirmesi, boş hücre olmaması, yinelenen satır olmaması ve görevin gerektirdiği yerlerde sıralama düzeni.

Kontrolleri geçemeyen bir dosya atılmak yerine sıfır puan alır. MiniMax M3, teslim ettiği 64 dosyanın 8'inde başarısız oldu; bunların altısı CSV ayrıştırılamadığı için, GPT 5.6 Luna ve GPT 5.6 Terra ise birer dosyada başarısız oldu. Herhangi bir kurulumun sıfır puan aldığı her görev çıkarıldığında 38 görev ve aynı lider kalır.

Geçen 1.130 dosya iki hakeme gitti: Codex CLI üzerinden GPT 5.6 Sol ve Claude Code CLI üzerinden Claude Opus 5; her ikisi de canlı web erişimiyle yüksek akıl yürütme çabasında çalıştı.

Dosyanın her sütunu kendi alt etmenine gider; bu alt etmen, her hakem için ayrı ayrı karıştırılmış anonim satır kimlikleri altında yalnızca o sütundaki tüm modellerin yanıtlarını görür, başka hiçbir şey görmez. Hakem bu yanıtları birbirine göre sıralar ve herhangi iki yanıtı eşit ilan edemez. İki sıralama daha sonra her yanıtın her hakem altındaki konumu toplanarak birleştirilir. Bu, 93.490 puan üretti.

Model adları görünürken ölçüldüğünde Sol, GPT yanıtlarını Opus'un sıraladığı yerin 8.4 yüzdelik puan üzerinde sıraladı; Opus da Anthropic yanıtlarını Sol'un sıraladığı yerin 4.9 yüzdelik puan üzerinde sıraladı. Bu lider tablosunun arkasındaki anonimleştirilmiş çalıştırmada Sol, GPT 6 Astra'yı birinci, Opus ise Claude Opus 5'i birinci sıraladı.

Puanlama nasıl çalışır

Bir modelin puanı, sütun ortalamalarının toplamıdır ve mümkün olan en yüksek toplam 100 olacak şekilde yeniden ölçeklendirilir. Bu tavan, kontrolleri geçen model sayısına bağlıdır; bu nedenle bu puanlar yalnızca bu benchmark içinde karşılaştırılabilir, başka hiçbir yerde karşılaştırılamaz.

Sıralamanın görev seçimine ne kadar bağlı olduğunu test etmek için lider tablosunu, her seferinde 69 görevin rastgele yeniden seçimiyle 4.000 kez yeniden puanladık. Bu yalnızca görev duyarlılığını ölçer. Aynı görevin yeniden çalıştırılmasının puanı ne kadar değiştireceğini ölçmez, çünkü hiçbir görev iki kez puanlanmadı.

En zorlu çeyrek, tüm 17 kurulum genelinde en düşük ortalama puana sahip olan 17 görevdir. Beş görev son dört sıra için eşit puana sahiptir ve Opus 5, beş olası seçimin tamamında en yüksek ortalamaya sahiptir. Bu kural, herhangi bir modelin bu görevlerdeki sıralaması hesaplanmadan önce belirlenmiştir.

16 modelden onu yukarıdaki benchmark'larda da yer alıyor. Puanları benchmark'lar arasında karşılaştırılamaz, çünkü her biri kendi ölçeğini belirler.

Buradaki her kurulum, karşılaştığı modellere göre konumu üzerinden puanlanır; bu nedenle bir kurulumu çıkarmak diğer tüm puanları değiştirir. Aynı nedenle bu puanlar, farklı bir alanı puanlayan bu benchmark'ın önceki çalıştırmasıyla karşılaştırılamaz. Çalıştırmalar arasında yalnızca kurulumların sırası karşılaştırılabilir.

Gemini 3.7 Flash bu alanda çalıştı ve Gemini 3.8 Flash tamamlandığında, halefi çalıştıktan sonra bir modelin ayrılması kuralı gereği çıkarıldı. Aynı kural Grok 4.5 ve GLM 5.2'yi emekliye ayırdı.

SSS'ler

Bu kanıtlara göre hayır. Ölçek görecelidir; bu nedenle 63.9 olan en yüksek puan bile yalnızca bir modelin yanıtlarının diğerlerinin üzerinde sıralandığı anlamına gelir ve iki puanlama modelinin önemli ölçüde ayrıştığı satırlar incelenmemiştir. Bu tür etmenler geliştiren satıcılar, kurumsal yapay zeka şirketleri listemizde yer alır ve AIMultiple bu gibi süreçleri otomatikleştirir.

Bunlardan yedisi 45.2 ile 49.4 arasında puan alıyor; bu, 69 görevin ayırt edebileceğinden daha dar bir aralıktır. İlk dört de birbirinden 2.9 puan içindedir. Benchmark güçlü modelleri zayıf olanlardan ayırır; görevleri yeniden örneklemek bu iki grubun her ikisini de yeniden sıralar.

Bu çalıştırmada bir model her iki program altında da çalıştı ve Claude Code altında 47.9, opencode altında 47.5 puan aldı. Tek bir karşılaştırma genel bir yanıt vermez. Grafikler Claude Code sonucunu gösterir. opencode kurulumu, Claude Code'dan 4.5 kat daha fazla önbelleğe alınmış bağlam okudu ve akıl yürütme dahil 1.2 kat daha fazla çıktı token'ı üretti. Görev başına $1,59 tuttu; 1.23 dolarlık Claude Code rakamı zaten opencode'un çalıştırmadığı bir alt etmeni de içerir.

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Berk Kalelioğlu (2026) - "AIM Enterprise: Otonom Kurumsal Benchmark". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 17 Eylül 2026, kaynak: https://aimultiple.com/agentic-enterprise [Çevrimiçi Kaynak]

Kalelioğlu, B. (2026, 17 Eylül). AIM Enterprise: Otonom Kurumsal Benchmark. AIMultiple. https://aimultiple.com/agentic-enterprise

@misc{kalelioglu2026,
  author = {Kalelioğlu, Berk},
  title  = {{AIM Enterprise: Otonom Kurumsal Benchmark}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/agentic-enterprise}},
  note   = {AIMultiple. Erişim tarihi: 17 Eylül 2026}
}
Tüm verileri indir

33 veri noktasının sonuçları ve zaman damgaları. Bu makaledeki grafik ve tablolarda gösterilen özet verileri, 2 CSV dosyası ve bir README içeren ZIP dosyası olarak indirin.

Son güncelleme: 23 Eylül 2026
İndir

Arkasındaki ayrıntılı veriyi ister misiniz? Premium'a katılın

Değişiklik günlüğü

1 güncelleme
  1. Metodoloji bölümüne model ve ajan programına göre akıl yürütme çabası tablosu eklendi.

Berk Kalelioğlu
Berk Kalelioğlu
Yapay Zeka Araştırmacısı
Berk, AIMultiple'ın benchmark ekibinde Yapay Zeka Araştırmacısıdır; etmen tabanlı yapay zeka, makine öğrenimi ve büyük ve küçük dil modelleri (LLM'ler ve SLM'ler) üzerine odaklanmaktadır.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450