Hizmetler
Bize Ulaşın

Yapay Zeka Ajan Platformları Kıyaslaması: Claude Yönetilen Ajanlar ve Google Vertex Agent Engine

Şevval Alper
Şevval Alper
Güncellenme tarihi: 21 Ağu 2026

4 yapay zeka ajan platformunu 3 boyutta değerlendirdik: görev tamamlama (10 kodlama görevi × 3 çalıştırma), harness'e özgü yetenekler (yönlendirme, yeniden bağlanma, uzun konuşma hatırlama, büyük dosya işleme) ve maliyet.

Yapay zeka ajan platformları kıyaslamasının sonuçları

Platform
Model
Geçme oranı
Geçen süre
Maliyet
Token
Claude Yönetilen Ajanlar
Claude Sonnet 4.6
30/30 (%100)
1.172s
$2,50
93k
Vertex AI Agent Engine
Gemini 2.5 Pro
30/30 (%100)
1.447s
$1,45
159k
OpenAI Responses + CI
GPT-5.4
27/30 (%90)
522s
$1,54
113k
Kontrol (kendi barındırılan)
Claude Sonnet 4.6
30/30 (%100)
794s
$1,96
464k

Claude Yönetilen Ajanlar ve Vertex AI Agent Engine, görev paketinde %100 geçme oranına ulaşıyor; maliyette Vertex kazanıyor ($1,45 karşısında $2,50). Yalnızca yönetilen platformlarda bulunan, akış ortasında yönlendirme, bağlantı kesme/yeniden bağlanma, uzun konuşma sıkıştırma gibi harness'e özgü özelliklerde Claude Yönetilen Ajanlar en yetenekli olanıdır; ancak Vertex Agent Engine taşınabilir testlerde (sıkıştırma, büyük dosya işleme) onunla eşleşmektedir.

Görev kıyaslamasından temel bulgular

  1. Claude MA ve Vertex AE geçme oranında 30/30 (%100) ile berabere kaldı. Her ikisi de OpenAI'yi zorlayan ağ görevleri (06, 10) dahil tüm görev türlerini tamamladı.
  2. OpenAI'nin başarısızlıkları korumalı alan politikasından kaynaklanıyor. 06 (REST API) ve 10 (eşzamanlı indirici) görevleri giden HTTP gerektirir. Code Interpreter'ın korumalı alanı bunu kısıtlıyor ve her ikisi de sırasıyla 2/3 ve 1/3 oranında başarısız oldu. GPT-5.4'ün kodu yazabildiğini gördük, ancak korumalı alan bunu güvenilir şekilde çalıştırmıyor.
  3. Vertex AE toplamda $1,45 ile en ucuzudur. Claude MA ise $2,50 ile en pahalısıdır. Aynı görev paketinde ve aynı geçme oranıyla Vertex'ten %72 daha pahalıdır.
  4. Vertex AE en yavaş olanıdır. Yönetilen ADK orkestrasyonu ek yük getirir.

Harness'e özgü yetenekler

İki platform, yalnızca yönetilen bir harness olduğu için var olan özelliklerde bire bir karşılaştırılmıştır.

Aşağıdaki metodoloji bölümüne bakın.

Yapay zeka ajan platformları

Claude Yönetilen Ajanlar

Anthropic'in Claude Yönetilen Ajanları, durum bilgisi olan oturumları, yerleşik araç yürütmeyi, olay tabanlı akışı ve uzun süreli otonom iş yükleri için otomatik sıkıştırmayı birleştiren barındırılan bir ajan çalışma zamanı sunar. Platform, uçuş sırasında yönlendirme için akış ortasında kullanıcı olayı enjeksiyonu, bağlantı kesme/yeniden bağlama için sürdürülebilir SSE akışları ve yerel MCP sunucu entegrasyonu gibi benzer tekliflerde bulunmayan benzersiz ilkellerle farklılaşır. Tümü, geliştiricilerin sağlaması gereken hiçbir altyapı olmadan tam yönetilen bir hizmet olarak sunulur.1

Fiyatlandırma, standart Claude API token maliyetlerine ek olarak oturum saati başına $0,08'dir.

Artılar:

  • Durum bilgisi olan oturumlar ve akış ortasında olay enjeksiyonu, yürütme sırasında yeni kullanıcı mesajlarının ajanları yönlendirmesine olanak tanır.
  • Kalıcı SSE akışları aracılığıyla bağlantı kesme ve yeniden bağlama desteği; oturumlar ağ kesintileri boyunca sunucu tarafında çalışmaya devam eder ve istemciler yeniden bağlanmada olay tüketimini sürdürebilir.
  • Yerleşik ajan araç seti; bash, dosya işlemleri (okuma, yazma, düzenleme, glob, grep) ve web araçlarını (web_fetch, web_search) tek bir yapılandırma parametresiyle erişilebilir şekilde bir araya getirir; böylece özel araç bağlantılarını ortadan kaldırır.
  • Ajanın yerleşik araç setini değiştirmeden özel araç uzantıları için yerel MCP (Model Context Protocol) sunucu entegrasyonu.

Eksiler:

  • Şu anda beta aşamasındadır; tüm istekler managed-agents-2026-04-01 beta başlığını gerektirir ve davranış sürümler arasında iyileşebilir.
  • Yalnızca Claude içindir; birden çok model sağlayıcısını destekleyen AWS Bedrock AgentCore veya Northflank gibi platformlarla karşılaştırıldığında model esnekliği yoktur.

Salesforce Agentforce

Salesforce Agentforce, Atlas Reasoning Engine aracılığıyla yerel CRM veri erişimi ve satış, hizmet, pazarlama ve ticaret iş akışları için önceden oluşturulmuş ajanlarla farklılaşır.2

Platform, sistemler arası orkestrasyon için MuleSoft Agent Fabric ile entegre olur ve AWS ortaklıkları için Agentforce 360 sunar.

Agentforce, doğrudan mevcut Salesforce Cloud altyapılarına gömülü otonom müşteriye dönük iş akışları gerektiren kuruluşlara hizmet eder.

Artılar:

– Atlas Reasoning Engine aracılığıyla yerel CRM veri erişimi, bağlama duyarlı ajan eylemleri sağlar.

– Satış, hizmet, pazarlama ve ticaret için hazır ajanlar dağıtım süresini kısaltır.

– Düzenlemeye tabi sektörler için Salesforce Government Cloud üzerinde FedRAMP yetkilidir.

– Foundations ücretsiz katmanı, ilk testler için 200.000 Flex Kredisi içerir.

Eksiler:

– Yalnızca bulut SaaS; şirket içi dağıtım seçeneği yoktur.

– Sınırlı model agnostisizmi; varsayılan olarak Salesforce tarafından yönetilen modellerle sınırlı harici sağlayıcı desteği sunar.

– Tam değeri elde etmek için mevcut Salesforce ekosistem yatırımını gerektirir.

Microsoft Copilot Studio

Artılar:

– Dahili ajan kullanımı için ek ücret olmaksızın Microsoft 365 Copilot lisanslarına dahildir.3

– Müşteri hizmetleri senaryoları için gerçek zamanlı sesli ajanlar ve IVR telefon desteği.

– Kamu sektörü dağıtımları için Azure Government aracılığıyla FedRAMP yetkilidir.

– Tek bir derleme ortamında OpenAI, Anthropic modellerini ve açık kaynaklı framework'leri destekler.

Eksiler:

– Microsoft ekosistemi dışında sınırlı işlevsellik; tam yetenekler için Azure veya M365 taahhüdü gerektirir.

– Bağımsız kalıcı ücretsiz katman yoktur; dahil edilen kullanım için mevcut M365 Copilot aboneliği gerektirir.

– Gerçek zamanlı sesli yapay zeka modeli Nisan 2026 itibarıyla yalnızca Kuzey Amerika'da barındırılmaktadır.

Copilot Studio; hâlihazırda Microsoft 365, Teams ve Azure kullanan kuruluşlar için en uygun maliyetli seçenektir ve mevcut kimlik, güvenlik ve uyumluluk yapılandırmalarını devralan çalışan odaklı otomasyon sunar.

Google Agentspace ve Vertex AI Agent Builder

Google'ın ikili teklifi, kurumsal bilgi yönetimi için Agentspace'i ve düşük kod geliştirme için Vertex AI Agent Builder'ı birleştirir; Gemini model entegrasyonu, Google Workspace ürünler arası bağlamı ve metin, ses ve görseller için çok modlu girdi desteği ile farklılaşır.4

Platform, yeni kullanıcılar için ücretsiz kredi olarak $300 ve Vertex AI Agent Engine için kullandıkça öde fiyatlandırması sunar.

Artılar:

– Yeni kullanıcılar için $300 ücretsiz kredi, ön yatırım olmadan kapsamlı prototipleme sağlar.

– Düzenlemeye tabi ortamlar için Google Distributed Cloud aracılığıyla şirket içi dağıtım desteklenir.

– Google Cloud aracılığıyla FedRAMP yetkilidir.

– Google ADK (Agent Development Kit), Python, TypeScript, Go ve Java'da kod öncelikli geliştirmeyi destekler.

Eksiler:

– Gemini öncelikli tasarım, tamamen agnostik platformlara kıyasla model esnekliğini sınırlar.

AWS Bedrock Agents ve AgentCore

AWS Bedrock Agents ve daha yeni AgentCore platformu, kurumsal ölçekli ajanlar için sunucusuz altyapı yönetimi sağlar ve re:Invent 2025'te tanıtılmıştır.5

Farklılaştırıcılar arasında AgentCore çalışma zamanı için vCPU-saat başına $0,0895 kullandıkça öde fiyatlandırması, sağlanan verim seçenekleri ve özel bellek sağlayıcısı olarak Mem0 yer alır.

Artılar:

– Hassas iş yükleri için AWS GovCloud üzerinde FedRAMP High yetkilidir.

– Çift yönlü akış, kullanıcı ve ajanın aynı anda konuşabildiği sesli ajanları destekler.

– İlk denemeler için yeni AWS müşterilerine ücretsiz katman sunulur.

– Bedrock kataloğu aracılığıyla Anthropic, Amazon, Meta, Mistral ve AI21 modellerine erişim.

Eksiler:

– Önceden oluşturulmuş alana özgü ajan şablonları yoktur; SDK kullanarak sıfırdan oluşturmayı gerektirir.

– Şirket içi dağıtım seçeneği yoktur; yalnızca AWS altyapısında çalışır.

– Ajan oluşturmak, görsel oluşturucularla karşılaştırıldığında önemli miktarda API/SDK kodlaması gerektirir.

AWS Bedrock; AWS ekosistemiyle derin entegrasyon ve ayrıntılı kullanım tabanlı faturalama yoluyla maliyet verimliliği sunarak ölçeklenebilir, sunucusuz ajan altyapısına ihtiyaç duyan kuruluşlara hizmet eder.

IBM watsonx Orchestrate

IBM watsonx Orchestrate; İK, satın alma, satış ve finans için 150'den fazla önceden oluşturulmuş alana özgü ajan ve özel beceriler oluşturmak için Skills Studio ile düzenlemeye tabi kuruluşları hedefler.6

Platform, IBM Cloud Pak for Data ve Software Hub aracılığıyla hibrit bulut ve şirket içi dağıtım esnekliği sunar.

Artılar:

– Veri ikameti gereksinimleri için IBM Cloud Pak for Data aracılığıyla şirket içi kurulum desteklenir.

– IBM ve iş ortaklarından 150'den fazla hazır ajan ve araç; SAP, Salesforce ve Workday dahil 80'den fazla kurumsal uygulama entegrasyonu.

– Federal dağıtımlar için FedRAMP yetkisi Nisan 2026'da genişletildi.

– Satıcı bağımlılığı olmadan birden çok LLM sağlayıcısını destekleyen gerçek model agnostisizmi.

Eksiler:

– Kalıcı ücretsiz katman yoktur; sürekli kullanım için ücretli Essentials veya Standard aboneliği gerektirir.

– Ses ve telefon yetenekleri, ADK'daki yerel ses yapılandırması ve Deepgram ile ElevenLabs gibi sağlayıcılarla entegrasyonlar aracılığıyla watsonx Orchestrate içinde kullanılabilir; ancak gelişmiş telefon özellikleri ek yapılandırma gerektirebilir.

– Kurumsal özellikler için özel fiyat teklifi gerektiren karmaşık fiyatlandırma yapısı.

ServiceNow AI Agents

ServiceNow AI Agents, bağımsız bir platform olarak çalışmak yerine BT, İK ve müşteri hizmetleri iş akışlarıyla yerel entegrasyon yoluyla farklılaşarak doğrudan Now Platformuna gömülür.

Platform; yönetişim için AI Control Tower, ITSM ve HRSD için önceden oluşturulmuş ajan tabanlı iş akışları ve ilke geçmişini ajan eylemlerine bağlayan bir Context Engine içerir.7

Artılar:

– Mevcut Now Platform yönetişimini, SLA kurallarını ve onay iş akışlarını devralır.

– AI Voice Agents, CCaaS sağlayıcıları olarak Genesys Cloud, Twilio ve 3CLogic'i destekler.

– AI Web Agents, tarayıcı tabanlı görevleri otomatikleştirmek için insan gösterimlerinden öğrenir.

Eksiler:

– Kalıcı ücretsiz katman yoktur; yeni müşteriler yalnızca 100 ücretsiz Build Agent çağrısı alır.

– AI Agents, AI Agent Orchestrator ve AI Agent Studio için FedRAMP High yetkisi Mart 2026 itibarıyla Government Community Cloud (GCC) müşterileri için doğrulandı.

– ServiceNow'u BT veya İK hizmet yönetimi için henüz kullanmayan kuruluşlar için sınırlı değer.

Kore.ai

Kore.ai, 300'den fazla hazır ajan, 250'den fazla kurumsal entegrasyon ve bulut ile şirket içi dağıtımları destekleyen model-agnostik bir mimariyle kurumsal konuşmaya dayalı yapay zekaya odaklanır.

Platform; bankacılık, sağlık ve perakende dahil altı sektöre hizmet eder.8

Artılar:

– Düşük gecikmeli küresel ses etkileşimleri sağlayan yerel ses altyapısı.

– Şirket içi ve özel bulut seçenekleri dahil esnek dağıtım.

– Birden çok LLM sağlayıcısını destekler.

Eksiler:

– Kalıcı ücretsiz katman yoktur; ilk testler için yalnızca tek seferlik $500 kredi sunar.

LangGraph

Artılar:

– MIT açık kaynak lisansı, sınırsız ticari kullanım ve değişikliğe izin verir.

– Graf mimarisi aracılığıyla belirlenimci iş akışı kontrolü, tekrarlanabilir yürütme yolları sağlar.

– LangSmith gözlemlenebilirlik entegrasyonu, üretim izleme ve izleme sağlar.

Eksiler:

– Görsel no-code oluşturucu yoktur; ajan graflarını tanımlamak için Python veya JavaScript kodu gerektirir.

– Yerel ses veya telefon entegrasyonu yoktur; ses kanalları için özel kodlama gerektirir.

– Graf tabanlı programlama paradigmalarına aşina olmayan ekipler için dik öğrenme eğrisi.

LangGraph; karmaşık koşullu mantık, hata kurtarma ve tek yürütme adımlarının denetlenebilirliğini gerektiren üretim düzeyinde ajanlar geliştiren mühendislik ekipleri için uygundur.

CrewAI

Artılar:

– Rol tabanlı soyutlama, sezgisel ajan koordinasyonu için insan ekip yapılarını yansıtır.

– Kendi barındırılan dağıtımlar için lisans ücreti olmayan ücretsiz açık kaynaklı çekirdek.

– Teknik olmayan ekip üyeleri için ücretsiz katmanda görsel düzenleyici ve yapay zeka yardımcı pilot bulunur.

Eksiler:

– Satıcı tarafından bakımı yapılan resmi şablon pazar yeri yoktur; topluluk katkılarına dayanır.

– Kod öncelikli yaklaşım, ajan oluşturma için Python bilgisi gerektirir.

– Kurumsal plan fiyatlandırması yalnızca talep üzerine sunulur; bu da diğer açık kaynak seçeneklerle karşılaştırıldığında küçük ekipler için bütçe belirsizliği yaratabilir.

CrewAI; belge işleme, araştırma iş akışları ve çok adımlı içerik üretimi görevleri için özellikle uygun olan rol tabanlı ajan pipeline'larının hızlı prototiplenmesini sağlar.

n8n

n8n, fair-code lisansı (Sustainable Use License) altında çalışır ve görsel yapay zeka düğümleri ile kendi barındırılabilir altyapıyla 400'den fazla yerel uygulama bağlayıcısı sunar.

Artılar:

– Kendi barındırılan Community Edition, ücretsiz olarak SSO SAML, LDAP, RBAC ve şifreli gizli anahtar depoları içerir.

– Görsel iş akışları içinde LangChain ve LlamaIndex için yerel destek.

– Görsel iş akışı düzenleyicisi, kodlama olmadan karmaşık otomasyon sağlar.

Eksiler:

– Fair-code lisansı, ticari barındırma veya SaaS ürünleri için ücretli lisans gerektirir.

– Yerel ses veya telefon düğümü yoktur; ses için harici API entegrasyonu gerektirir.

– Doğrulanmış FedRAMP yetkisi yoktur.

n8n; veri ikameti için kendi barındırılan dağıtım gerektiren ve görsel oluşturma yeteneklerini koruyan teknik iş analistleri ile DevOps ekiplerine hizmet ederek geleneksel iş akışı otomasyonu ile yapay zeka ajanları arasında köprü kurar.

Dify

Dify açık kaynaklı bir LLMOps platformudur.

Platform, RAG pipeline'larını, prompt mühendisliği araçlarını ve model-agnostik mimariyi destekler.

Artılar:

– Kendi barındırılan Community Edition, Docker dağıtımı yoluyla tam veri kontrolüyle kalıcı olarak ücretsiz'dir.

– Görsel iş akışı oluşturucusu, kodlama olmadan karmaşık ajan oluşturmayı sağlar.

– Düzinelerce inference sağlayıcısından yüzlerce özel ve açık kaynaklı LLM's destekler.

Eksiler:

– Ses desteği, Agora veya Tencent RTC gibi pazar yeri eklentilerini gerektirir; yerel PSTN telefonu yoktur.

– FedRAMP yetkisi yoktur.

– Aylık $159 olan Cloud Team planı küçük ekipler için maliyetli olabilir.

Dify; özellikle kendi barındırma yoluyla veri kontrolüne öncelik veren, güçlü RAG yeteneklerine sahip belge duyarlı ajanlar gerektiren ürün ve operasyon ekipleri için uygundur.

Voiceflow

Voiceflow, ses öncelikli ajan tasarımını eklenti yerine birinci sınıf bir vatandaş olarak ele alan tek büyük platform olarak farklılaşır; sesli ve sohbet ajanları için altı-500ms gecikmeyle özel olarak tasarlanmış bir tasarım tuvali sunar.

Platform, müşteri hizmetleri talep otomasyonu ve IVR sistemlerinde uzmanlaşmıştır.

Artılar:

– IVR desteği ve altı-500ms gecikmeyle yerel ses ve telefon kanalları.

– Bilgi tabanı sorguları için varlık çıkarma yetenekleri.

– Free plan, süresi dolmayan 2 ajan ve aylık 100 yapay zeka token'ı içerir.

– Özellikle konuşmaya dayalı yapay zeka iş akışları için tasarlanmış görsel tuval.

Eksiler:

– Şirket içi dağıtım yalnızca özel kurumsal anlaşmalarla kullanılabilir.

Voiceflow; tek bir tasarım arayüzünden ses, sohbet ve mesajlaşma kanallarında dağıtım gerektiren müşteriye dönük konuşmaya dayalı ajanlar geliştiren CX ve destek ekiplerine hizmet eder.

Relevance AI

Relevance AI, eylem tabanlı bir faturalama modeliyle kendi LLM'ini getir (BYOLLM) esnekliği sunar ve teknik olmayan ekiplerin doğal dil açıklamalarıyla çok ajanlı ekipler oluşturmasına olanak tanır.

Artılar:

– Free katman, süresi dolmayan günlük 100 kredi içerir.

– HubSpot, Salesforce, Slack ve Gmail dahil 2.000'den fazla entegrasyon.

– Birden çok LLM sağlayıcısını destekleyen gerçek model agnostisizmi.

Eksiler:

– Kendi barındırma veya şirket içi dağıtım seçeneği yoktur; yalnızca bulut SaaS.

– Düzenlemeye tabi sektörler için FedRAMP yetkisi yoktur.

– Ses yetenekleri, yerel telefon yerine Vapi veya Twilio ile entegrasyon gerektirir.

Lindy AI

Lindy AI; Pipedream aracılığıyla çeşitli entegrasyonlar, e-posta önceliklendirme ve zamanlama için hazır ajan şablonları ve Gaia ses özelliği aracılığıyla telefon görüşmesi ajan yetenekleri sunar.9

Platform, ücretsiz katmanı bulunan kredi tabanlı bir yürütme modeli kullanır.

Artılar:

– Free katman, ayda 400 kredi ve 1 milyon karakterlik bilgi tabanı içerir.

– Gerçek model agnostisizmi ve kapsamlı entegrasyon kütüphanesi.

Eksiler:

– Şirket içi dağıtım, düzenlemeye tabi sektörler için yalnızca özel kurumsal anlaşmalarla kullanılabilir.

Mühendislik kaynakları olmadan e-posta, takvim ve CRM iş akışlarının hızlı otomasyonunu gerektiren bireysel iş kullanıcıları, kurucular ve operasyon ekipleri için en uygunudur.

Metodoloji

Yönetilen bir yapay zeka ajan platformu rakiplerine ve kendi ajan harness'inizi oluşturma alternatifine kıyasla gerçekte ne sunar? Yapay zeka araç alanının burada kalıcı bir kör noktası var. “Yönetilen ajan” ürünleri, ham dil modelleri için kullanılan aynı görev tamamlama puan kartlarıyla rutin olarak karşılaştırılır; bu, birbirinden çok farklı iki şeyi birbirine karıştırır: modelin doğru kod üretme yeteneği ile harness'in bu kodu durum, araçlar ve yalıtım içeren yönetilen bir çalışma zamanında güvenilir şekilde çalıştırma yeteneği. Bu kıyaslamayı bu sinyalleri ayırmak için tasarladık.

Yönetilen ajan platformu nedir?

Belirli bir kategoriyi kıyaslıyoruz: LLM inference'ı, ajan orkestrasyonunu ve korumalı alanda kod yürütmeyi tek bir yönetilen hizmette bir araya getiren barındırılan çalışma zamanları. Bu; (1) ham LLM inference API'larından, (2) kendi barındırdığınız ajan orkestrasyon framework'lerinden ve (3) kendi modelinizle eşleştirdiğiniz işlem korumalı alanlarından farklıdır. Test edilen dört platform, bu paketin biraz farklı bir biçimini alır:

  • Claude Yönetilen Ajanlar (Anthropic): Tam yönetilen harness. Ajan tanımları, oturumlar, olay tabanlı akış, sıkıştırma ve araç yürütmenin tümü sunucu tarafındadır. Bu kategorideki iki gerçek rakipten biridir.
  • Vertex AI Agent Engine (Google): Tam yönetilen harness. ADK ile tanımlanmış bir ajanı yönetilen bir çalışma zamanına dağıtın; dağıtım, ajan durumunu ve araç yürütmeyi barındırır. vertexai.agent_engines SDK'sı aracılığıyla erişilir.
  • OpenAI Responses API ve Code Interpreter: Bitişik kategori. Yerleşik bir Python korumalı alan aracına sahip inference API; ancak kalıcı çok turlu oturum durumu veya akış ortasında yönlendirme yoktur.
  • Kontrol: Claude Messages API ve yerel araç döngüsü: Temel olarak dahil edilmiştir. Claude MA ile aynı model (claude-sonnet-4-6), ancak ajan döngüsünü yerel olarak yaklaşık 150 satır Python ile uyguluyoruz. Araçlar (bash, yazma, okuma, düzenleme) kıyaslama makinesinde görev başına geçici dizinde yürütülür. Bu, yönetilen harness'in “model artı araç döngüsü”nün ötesinde ne kattığını yalıtır. Messages API'sini yerel bir ajan döngüsüyle çalıştırmak, modelin aynı olduğu ancak harness'in bulunmadığı bir karşılaştırma üretir. Claude MA ile kontrol arasındaki herhangi bir fark, tamamen harness'e atfedilebilir; model yeteneğine değil.
Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Görev paketi

Üç zorluk düzeyine yayılan on kodlama görevi. Her görevin çıktıyı belirten sabit bir prompt'u ve belirlenimci geçme/kalma ölçütlerini kodlayan bir doğrulama betiği vardır. Her görev, varyansı ölçmek için her platformda üç kez çalıştırılır.

Harness'e özgü stres testleri

Görev paketi uçtan uca doğruluğu ölçer. Yalnızca yönetilen bir harness sayesinde var olan yetenekleri ölçemez: durum bilgisi olan oturum kalıcılığı, akış ortasında yönlendirme, bağlantı sürdürme, otomatik bağlam sıkıştırma ve yönetilen dosya sistemi yapıt işleme. Bunlar için iki ek test paketi tasarladık.

Süit A: Yönlendirme ve Kesinti

Harness'e özgü ilkelleri çalıştıran üç test.

A1; bir kodlama görevinde ajanı başlatır, ardından 10 saniye sonra POST /events aracılığıyla gereksinimleri değiştiren yeni bir kullanıcı olayı enjekte eder ve konteyner dosya sistemini inceleyerek nihai yapıtın yeni gereksinimi özgün gereksinim yerine yansıttığını doğrular.

A2; bir SSE akışı açar, dört olaydan sonra bağlantıyı keser, yeniden bağlanır ve oturumun hâlâ status_idle'a ulaştığını doğrular.

A3; kasıtlı olarak çelişkili bir prompt gönderir ve ajanın açıklama isteyip istemediğini veya sessizce bir yorum seçip seçmediğini ölçer.

Yalnızca A3 platformlar arasında taşınabilir. A1'in akış ortasında olay enjeksiyonunun OpenAI Responses (tek istek/yanıt) veya Vertex Agent Engine (oturum modeli uçuş sırasında mesaj enjeksiyonundan yoksundur) üzerinde doğrudan bir karşılığı yoktur. A2'nin bağlantı kesme/yeniden bağlama özelliğinin de başka yerde karşılığı yoktur. Bunlar, Claude MA'nın olay güdümlü oturum modelinin gerçek yapısal avantajlarıdır; alternatiflerde kıyaslanamaz. A1 ve A2'yi yalnızca Claude MA üzerinde, A3'ü ise hem Claude MA hem de Vertex Agent Engine üzerinde çalıştırdık.

Süit B: Sıkıştırma ve Bağlam

Yönetilen bağlam özelliklerini çalıştıran iki test.

B1; bir oturumun ilk turuna benzersiz bir kanarya dizesi (UUID'den türetilen bir token) yerleştirir, her biri araç çağrıları ve araç sonuçları üreten 23 dolgu turu ilgisiz küçük kodlama görevi çalıştırır ve ardından ajandan 25th turda dosya araması yapmadan kanaryayı bellekten hatırlamasını ister. 23 dolgu turundan sonra başarılı hatırlama, harness'in hangi sıkıştırma politikasını kullanırsa kullansın erken bağlamı koruduğunun kanıtıdır.

B2; ajandan gömülü bir işaretleyici içeren 50.000 satırlık bir metin dosyası oluşturmasını ve ardından işaretleyiciyi bulmayı gerektiren bir soruyu yanıtlamasını ister. Bu, ajanın bağlam penceresinden daha büyük yapıtlar hakkında tüm dosyayı okumaya çalışmadan akıl yürütüp yürütemediğini test eder.

Hem B1 hem B2, aynı prompt'ları ve protokolleri kullanarak hem Claude MA hem de Vertex Agent Engine üzerinde çalıştırıldı.

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

LLM-as-judge davranışsal puanlama için

Süit A3 (çelişkiler) için geçme/kalma belirlenimci bir kontrol değildir; “ajan açıklama istedi mi” sorusunu konuşma davranışına ilişkin nitel bir yargı olarak ele aldık. Üç metodolojik korumalı bir LLM-as-judge tasarımı kullanıyoruz:

  1. Yargıç model, test edilen modelden farklıdır: Öz değerlendirme yanlılığını önlemek için yargıç Claude Opus 4.6'dır.
  2. 4 boolean boyutlu yapılandırılmış puanlama anahtarı: Yargıç, JSON puanlaması döndürür: recognized_contradiction, asked_for_clarification, proceeded_with_assumption, documented_assumption ve bir paragraflık gerekçe.
  3. 3 çalıştırmalı tutarlılık kontrolü: Her yargı 3 kez çalıştırılır. Boyut bazında çoğunluk mutabakatını ve boyut bazında uyum oranını raporlarız. Herhangi bir boyutun uyumu %67'nin altına düşerse yargıç o boyutta tutarsız olarak işaretlenir ve sonuç düşük güvenilirlik olarak kabul edilir.

Bir anahtar kelime sezgiseli, akıl sağlığı kontrolü olarak paralelde çalışır. Sezgisel ile yargıç arasındaki farklılık, manuel inceleme için günlüğe kaydedilir.

Puanlama

Her platformda çalıştırılan her görev için:

  • Geçme/kalma
  • Geçen süre: Prompt'un gönderilmesinden terminal olayın alınmasına kadar geçen saniyeler (Claude MA için status_idle, Vertex AE için görev tamamlama, OpenAI için yanıt tamamlama, kontrol için araç döngüsünden çıkış).
  • Araç çağrısı sayısı: Farklı araç çağrıları. Davranışsal parmak izi olarak faydalıdır; araç ayrıntı düzeyi platformlar arasında önemli ölçüde farklılık gösterdiğinden verimlilik metriği olarak daha az faydalıdır.
  • Token kullanımı: Claude MA'da model_request_end olaylarından, Vertex AE'de usage_metadata'dan, OpenAI'da response.usage'dan ve kontrolün mesaj döngüsünde tur başına birikimden ayrıştırılır. Girdi, çıktı, önbellek okuma ve önbellek oluşturma olarak ayrıştırılır.
  • USD cinsinden maliyet: Token kullanımından yayınlanan fiyatlandırmaya göre hesaplanır: milyon başına claude-sonnet-4-6 $3/$15/$0,30/$3,75; gpt-5.4 $2,50/$15/$0,25; gemini-2.5-pro $1,25/$10/$0.13. Platforma özgü altyapı ücretleri eklenir: Claude MA'nın geçen süreye oranlanan $0,08/oturum-saati, herhangi bir araç çağrısı gerçekleştiğinde OpenAI'nin $0,03/konteyner ücreti, Vertex AE'nin dağıtım çalışma süresine oranlanan yaklaşık $0,35/saat barındırma ücreti.

Süit A ve B sonuçları ayrıca oturum düzeyinde metrikleri (tur sayısı, kanarya hatırlama, yargıç mutabakatı ve uyumu) yakalar.

Adillik değerlendirmeleri ve bilinen sınırlamalar

Kurulumdaki birkaç asimetri sayıların nasıl okunması gerektiğini etkiler; bunları açıkça belirtiyoruz:

Kontrol, araç yürütmeyi bulut gidiş-dönüşü olmadan kıyaslama makinesinde çalıştırır. Bu, ajan hızından çok ağ atlamasını yansıtan haksız bir geçen süre avantajı sağlar. Kontrolün görevleri aynı modelde Claude MA'dan ~%25 daha hızlı tamamladığını gözlemlediğimizde, bu farkın kabaca yarısı gidiş-dönüş asimetrisidir.

OpenAI Code Interpreter, ağ kısıtlı bir korumalı alanda çalışır. 06 (REST API) ve 10 (eşzamanlı indirici) görevleri, CI'ın yalnızca aralıklı olarak izin verdiği giden HTTP gerektirir. OpenAI'nin bu görevlerdeki başarısızlıkları, model yeteneği değil korumalı alan politikası başarısızlıklarıdır. GPT-5.4 doğru eşzamanlı HTTP kodu yazabilir; platform bunu her zaman çalıştıramaz. Okuyucular “OpenAI ağ görevlerinde başarısız oluyor” ifadesini model hakkında bir ifade olarak yorumlamamalıdır.

Gemini 3.1-pro-preview, proje düzeyinde önizleme izin listesinin arkasında sınırlandırılmıştır. Bu modeli hem doğrudan Vertex API hem de Vertex Agent Engine üzerinde kıyaslamaya çalıştık. Doğrudan API çağrıları 404 döndürdü; modelle yapılan Agent Engine dağıtımları dağıtım sırasında başarılı oldu, ancak inference çağrıları hata olmadan sıfır olay döndürdü. gemini-2.5-pro'ya geri döndük.

Çok saatli yeniden düzenleme görevleri, alışılmadık kod tabanlarında hata ayıklama veya uzun süreli otonom iş akışlarından oluşan bir paket, harness'leri farklı şekilde zorlayacak ve muhtemelen üst düzey seçenekleri daha net ayıracaktır.

Sağlama gecikmesini, soğuk başlatma davranışını, eşzamanlı oturum performansını veya hız sınırı tavanlarını ölçmedik. Bunlar yüksek verimli üretim iş yükleri için önemlidir ancak bu turun kapsamı dışındaydı.

Tüm yapay zeka ajan platformlarında ortak özellikler

Bu karşılaştırmadaki her platform, yapay zeka ajan kategorisini tanımlayan temel yetenekleri sağlar. Bu ortak özellikler, ajan tabanlı otomasyon için minimum uygulanabilir ürünü oluşturur; farklılaştırıcı özellikler ise platform seçimini belirler.

Çok ajanlı orkestrasyon: Uygulama farklılık gösterse de tüm platformlar çok ajanlı orkestrasyonu destekler (yukarıdaki platform bölümlerine bakın).

Araç kullanımı ve harici entegrasyonlar: Her platformdaki ajanlar harici API'ları, veritabanlarını ve iş uygulamalarını çağırabilir. Hazır bağlayıcı sayıları yaklaşık 50'den (Dify) 2.000+'ya (Relevance AI) kadar değişir ve tüm platformlar özel API tanımlarını destekler.

Kalıcı bellek ve bağlam yönetimi: Bilgilerin oturumlar içinde (kısa süreli bellek) ve oturumlar arasında (uzun süreli bellek) tutulması; platforma bağlı olarak vektör veritabanları, oturum nesneleri veya yapılandırılabilir bağlam pencereleri aracılığıyla sağlanan standart bir yetenektir.

İzleme ve gözlemlenebilirlik: Her platform; ajan yürütmeyi incelemek, token kullanımını ve gecikmeyi izlemek ve hataları belirlemek için günlükleri, izleri veya analitikleri sunar.

İnsan gözetimi ve onay kontrolleri: Ajan eylemlerinin insan tarafından incelenmesi, onaylanması veya geçersiz kılınmasına yönelik mekanizmalar her platformda mevcuttur. Örnekler arasında n8n'in araç başına onay kapıları, LangGraph kesme ve sürdürme ilkelleri, Bedrock AgentCore ilke kontrolleri, ServiceNow AI Control Tower ve Lindy'nin otomatik eskalasyonu bulunur.

Bilgi tabanı ve getirme destekli üretim (RAG): Belge dizinleme ve getirme yoluyla ajanları özel bilgiye dayandırmak, kategoride temel bir yetenektir. Uygulamalar arasında Dify RAG pipeline'ı, Voiceflow Knowledge Base, Bedrock Knowledge Bases, Vertex AI RAG Engine ve Kore.ai Search AI bulunur.

No-code veya low-code ajan oluşturucu arayüzü: Ajan oluşturmak için grafiksel veya doğal dil arayüzleri her platformda mevcuttur. Kurumsal platformlar no-code stüdyolar sunar (Agentforce Builder, Copilot Studio, watsonx Orchestrate); geliştirici framework'leri ise eşlik eden görsel araçlar sağlar (LangGraph Studio, AutoGen Studio, CrewAI Studio).

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Şevval Alper (2026) - "Yapay Zeka Ajan Platformları Kıyaslaması: Claude Yönetilen Ajanlar ve Google Vertex Agent Engine". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 21 Ağustos 2026, kaynak: https://aimultiple.com/ai-agent-platforms [Çevrimiçi Kaynak]

Alper, Ş. (2026, 21 Ağustos). Yapay Zeka Ajan Platformları Kıyaslaması: Claude Yönetilen Ajanlar ve Google Vertex Agent Engine. AIMultiple. https://aimultiple.com/ai-agent-platforms

@misc{alper2026,
  author = {Alper, Şevval},
  title  = {{Yapay Zeka Ajan Platformları Kıyaslaması: Claude Yönetilen Ajanlar ve Google Vertex Agent Engine}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/ai-agent-platforms}},
  note   = {AIMultiple. Erişim tarihi: 21 Ağustos 2026}
}
Tüm verileri indir

4 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, bir CSV dosyası içeren ZIP dosyası olarak indirin.

Son güncelleme: 17 Ağustos 2026
İndir
Şevval Alper
Şevval Alper
Yapay Zeka Araştırmacısı
Şevval, AIMultiple'da bir yapay zeka araştırmacısıdır. Kaotik sistemler kullanarak sözde rastgele sayı üretimi konusunda daha önce araştırma deneyimine sahiptir.
Şevval, yapay zeka kodlama araçları, yapay zeka ajanları ve kuantum teknolojilerine odaklanmaktadır.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450