Hizmetler
Bize Ulaşın

4 popüler açık kaynak agentic framework'ü 2.000 çalıştırma boyunca (5 görev, her framework için 100 çalıştırma) kıyasladık; uçtan uca gecikme süresini, token tüketimini ve mimari farklılıkları ölçtük.

Agentic AI framework benchmark'ı

Framework'lerin kendilerinin ajan davranışını nasıl etkilediğini ve bunun gecikme süresi ile token tüketimi üzerindeki sonuç etkisini inceledik.

Loading Chart

LangGraph, tüm görevlerde en düşük gecikme değerleriyle en hızlı framework iken LangChain en yüksek gecikme süresine ve token kullanımına sahiptir.

5 görev ve 2.000 çalıştırma boyunca, LangChain token açısından en verimli framework olarak öne çıkarken, gecikme süresinde AutoGen liderdir; LangGraph ve LangChain onu yakından takip eder. CrewAI ise genel olarak en ağır profili çizer.

Görevler hakkında daha fazla ayrıntı için agentic YZ framework benchmark metodolojisini inceleyebilirsiniz.

Görev 1: Temel toplama

İlk olarak, karmaşık bir akıl yürütme gerçekleştirmeden tek bir araç çağrısı yaparken her framework'ün ek yükünü ölçtük.

LangChain & LangGraph: Basit görevlerde neredeyse agentic olmayan kod kadar hızlı performans gösterirler; ikisi de 5 saniyenin altında ve 900 prompt token'dan az kullanarak tamamlar. LangGraph'ın durum makinesi mimarisi bu basitlik seviyesinde LangChain'e kıyasla fark edilir bir gecikme yaratmaz; durum yönetiminin ek yükü görev karmaşıklığı arttıkça ortaya çıkar.

AutoGen: Hem gecikme hem token kullanımında LangChain ve LangGraph'ın biraz üzerindedir; bu, iki ajanın tek adımlık bir görevde bile mesaj alışverişi yaptığı çok ajanlı konuşma döngüsünün temel maliyetini yansıtır.

CrewAI: Tek bir araç çağrısı yapması istendiğinde bile “yönetsel ek yük” olarak adlandırılabilecek bir davranış sergiler; LangChain'in token miktarının neredeyse 3 katını tüketir ve neredeyse 3 kat daha uzun sürer. Planner ve Analyst kişilikleri arasındaki çok adımlı doğrulama süreci, hız yerine eksiksizliği önceliklendiren kapsamlı ancak kaynak yoğun bir yaklaşım sunar. Bu maliyet yapısaldır: görev karmaşıklığından bağımsız olarak ortaya çıkar.

Görev 2: Karşılaştırmalı gelir analizi (durum yönetimi)

Görev 2'de, framework'lerin iki farklı filtre grubunu bellekte tutma (Durum Kalıcılığı) ve bunları birleştirme becerisini görmek istedik.

CrewAI

Günlük analizimizde, CrewAI'nin framework'ler arasında en yüksek düzeyde altyapı şeffaflığı sağladığını, ancak bunu en yüksek kaynak tüketimi pahasına yaptığını tespit ettik.

CrewAI, getirilen veriyi hemen döndürmek yerine, kendi süreçlerini bir öz-denetim mekanizması aracılığıyla tekrar doğrular. Bu keşifçi davranış, yapılandırılmış max_iter=10 sınırına ulaşmasına neden oldu ve bazı çalıştırmalar JSON çıktısı üretmeden sürekli bir düşünme döngüsünde takılı kaldı.

Bu davranışın temel nedeni, CrewAI'nin sistem prompt'una çok katmanlı talimatlar enjekte ederek her ajana bir rol, hedef ve geçmiş ataması ve aynı zamanda her adımda ReAct tarzı Düşünce → Eylem → Gözlem döngüsünü zorunlu kılmasıdır. Basit görevlerde bile LLM bu seremoni atlayamaz ve uzun iç monologlar üretir; bu da çok ajanlı senaryolarda daha da katlanır.

CrewAI, diğer framework'lerin neredeyse iki katı token tüketti ve LangChain'den üç kat daha uzun sürdü; bu da onu doğrudan veri getirme görevlerinden ziyade karmaşık durum geçişleri ve çok faktörlü karar alma için daha uygun hale getirir.

LangChain

En hızlı ve en uygun maliyetli framework. Günlüklerimizde, LangChain'in görevi hiçbir sapma olmadan 5-6 adımda tamamladığını gözlemledik: Yükle → Filtrele → Hesapla → Filtrele → Hesapla → Çıktı. Durum yönetimi çok basit olduğu için ek yük neredeyse sıfırdır ve gecikme süresi tüm framework'ler arasında en düşüktür.

AutoGen

Çok dengeli bir performans sergiledi. Görev 2'de, hem token kullanımı hem gecikme süresi bakımından LangGraph ile neredeyse birebir aynı sonucu elde etti; bu da görev zinciri doğrusal kaldığında konuşma döngüsünün ek yükünün anlamlı ölçüde katlanmadığını gösterir.

Bununla birlikte, araç çağırma sürecinde parametreleri doğrulamak için zaman ekstra bir doğrulama adımı ekler ve bu da onu LangChain'den biraz daha yavaş yapar. Bir araç çağrısında hatayla karşılaştığında veya veri beklendiği gibi gelmediğinde, bir sonraki adımda muhakemesini hemen günceller ve doğru JSON'a ulaşır. Araç çıktılarını bir konuşma akışı olarak yönettiği için mantık hatalarına karşı en dirençli framework'lerden biridir.

LangGraph

Bu görevde LangGraph, grafik tabanlı mimarisi sayesinde en istikrarlı framework'tür. Günlüklerinde, durumun çalıştırma boyunca çok temiz bir şekilde taşındığını gözlemledik. Veri kirliliği veya segmentlerin birbirine müdahale etme riski bu framework'te en düşük seviyededir. 100 çalıştırmanın tamamında neredeyse aynı sayıda adımda ve aynı gecikme aralığında sonuç üretti.

Görev 3: Eşik ayrıştırma (sayısal disiplin)

Bu görevde, "1 yıldan az kıdem" ve "aylık ücretlerde $70'ten fazla" gibi doğal dildeki sayısal koşulların tenure_max=12 ve charges_min=70.0 gibi hassas araç parametrelerine framework'ler tarafından ne kadar doğru çevrildiğini görmek istedik.

LLM bu dönüşümü nasıl yapacağını bilir; asıl test etmek istediğimiz, framework'ün kendi yeniden deneme mekanizmaları, yeniden prompt bağlamı ve durum yönetimi döngüleri boyunca bu parametreleri koruyup koruyamadığıydı.

LangChain & LangGraph

Her iki framework de parametreleri (tenure_max=12, charges_min=70) hiçbir değişiklik veya yeniden prompt döngüsü olmaksızın tam olarak LLM'in ürettiği gibi doğrudan araca geçti. Bu verimlilik rakamlarda görülüyor: her iki framework de Görev 3'ü 1.800 prompt token'ın altında ve 9 saniyenin altında tamamladı; bu, bu görevdeki en düşük değerlerdir.

Sayısal eşiklerin framework müdahalesi olmaksızın korunup korunmadığını ölçmek istediğimizde, bu ikisi beklentimizi karşıladı: hangi parametre üretildiyse, koşturulan o oldu.

AutoGen

Autogen sayısal doğrulukta tamamen başarılıdır. Bazı çalıştırmalarda, LLM tarafından üretilen parametreyi araca geçirmeden önce framework'ün bir doğrulama adımı eklediği gözlemlendi; yani framework parametreyi korurken fazladan bir adım harcadı. 2.480 token ve 8 saniyede, ek adıma rağmen LangChain'in gecikme süresine eşit sonuç elde etti; bu da doğrulama ek yükünün gerçek ama küçük olduğunu doğrular. Parametre bütünlüğü açısından beklentilerimizi karşıladı; onay adımı anlamlı bir gecikme cezası yerine marjinal bir token maliyeti getirdi.

CrewAI

En dikkat çekici davranış CrewAI'de gözlemlendi; CrewAI Görev 3'ü 30 saniyede ve 4.360 token ile tamamladı; bu, bu görevdeki en yüksek değerdir. Günlük analizinden iki farklı hata örüntüsü ortaya çıktı.

Bazı çalıştırmalarda %68,81 olması gereken bir değer 0.6878 (ondalık oran) olarak döndürüldü. Bu, framework'ün çıktı serileştirmesinin LLM'in çıktısını orijinal bağlamından koparabileceğini gösterir.

Günlükler, LLM'in başlangıçta doğru parametreleri ürettiğini gösteriyor: tenure_max=12 ve charges_min=70. Ancak CrewAI bir "Failed to parse" döngüsüne girdiğinde, framework LLM'i yeniden değerlendirmeye zorladı. Yeniden prompt bağlamında LLM, eşiği tenure_max=14'e kaydırdı ve charges_min filtresini tamamen devre dışı bırakarak %46,84 churn oranı üretti; bu aslında kıdemi 14'ten az olan tüm müşterilerin churn oranıdır. Bu tam olarak gözlemlemek istediğimiz senaryoydu: framework'ün yeniden deneme mekanizması, LLM'in doğru bildiği bir parametreyi bozabilir.

Görev 4: Hata dayanıklılığı ve pivot kapasitesi

Bu görevde, her framework'ün yıkıcı senaryoları nasıl ele aldığını görmek ve gecikme süresi ile token tüketimi üzerindeki etkisini gözlemlemek istedik. Araç art arda 3 farklı hata türü fırlatır (Network, Timeout, Rate Limit) ve ajanı köşeye sıkıştırır. İlk iki hata ajana yeniden denemesini söyler; her ikisini de denedikten sonra gelen Rate Limit hatası ajana 10 saniye beklemesini söyler. Ajan bekleyip yeniden denediğinde araç normal şekilde çalışmaya başlar.

LangGraph & Autogen

Bu iki framework, bu görevde araç hatalarıyla karşılaştığında otonom olarak alternatif çözümler buldu.

Araç bir hız limiti uyarısı döndürdüğünde, bu ajanlar duraklamak ve beklemek yerine başarısız aracı tamamen terk edip alternatif bir yol bulmaya karar verdi. Yaklaşımları şuydu: "Bu araç çalışmadığına göre, her ödeme yöntemini tek filtreleyip her biri için churn oranını ayrı ayrı hesaplayacağım ve sonra sonuçları kendim birleştireceğim."

Yöntem: Görevi tek bir araç çağrısıyla yapmak yerine, her PaymentMethod'u (Electronic check, Mailed check, vb.) ayrı ayrı işlemek üzere biri filtreleme biri hesaplama için iki ayrı araç kullanarak parçalara böldüler.

Bu ajanlar yol bağımlılığından ziyade hedef odaklı muhakeme ile çalışır. En kısa yol kullanılamıyorsa, saniyeler içinde alternatif bir yürütme planı kurabilirler.

LangGraph, Görev 4'te tüm benchmark genelindeki en yüksek tek görev token sayısı olan 15.010 prompt token'a ulaştı; çünkü durum makinesi her adımda her manuel araç çağrısının büyüyen geçmişini tekrar bağlama ekledi. AutoGen ise ara sonuçları konuşma akışıyla ele alması nedeniyle biraz daha kontrollü kalarak 10.750 token ile izledi. Buna rağmen her ikisi de 24-27 saniye civarında tamamladı; bu da ek token maliyetinin anlamlı bir gecikmeye dönüşmediğini doğruladı çünkü pivotun kendisi hızlıydı.

CrewAI

Önceki görevlerde en yüksek token tüketimini göstermesine rağmen CrewAI, bu görevde en düşük token kullanımını ancak en yüksek gecikme değerlerini sergiledi.

En düşük token neden?

CewAI, rakipleri gibi 10-15 adımlık manuel bir geçici çözüme girmedi. Hatalarla karşılaştığında, tüm geçmişi ve karmaşık ara verileri her adımda LLM'e tekrar pompalamak yerine daha odaklı, modüler bir muhakeme döngüsü kurdu. Gereksiz laf kalabalığından kaçınarak bu görevdeki en uygun maliyetli framework haline geldi.

Yüksek gecikme neden?

CrewAI'nin yönetsel yapısı, bir hatayla karşılaştığında duraklar ve planı yeniden değerlendirir. 10 saniyelik bekleme uyarısını aldığında "strateji planlama" aşamasında daha fazla zaman harcadı. Ayrıca filtreleme için başka bir araca geçmek yerine ısrarla ana aracın kendine gelmesini beklemeyi ya da kararlı araçla denemeyi seçti; bu da toplam süreyi uzattı.

LangChain

LangChain, bu görevde en önemli dönüşümünü geçirdi ve dayanıklılığın neden doğru yapılandırmaya bağlı olduğunu kanıtladı.

İlk çalıştırmamızda LangChain, ConnectionError ile her denemede çöktü.

LangChain'in varsayılan AgentExecutor'ı, bir araç içinden fırlatılan ham Python istisnalarını ölümcül hata olarak ele alır ve süreci sonlandırır. Rakiplerinden farklı olarak varsayılan olarak "hatalar gözlemdir" felsefesini uygulamaz. Ajan hatayı hiç görmediği için onun hakkında akıl yürütme şansı olmaz.

Araç çağrısını langchain_agent.py içinde try-except bloğuyla sardık. Bu, hatayı ajanın işleyebileceği okunabilir bir mesaja dönüştürdü.

Düzeltme sonrası davranış: Düzeltmeyi uyguladıktan sonra LangChain günlüklerinde LangGraph ile birebir aynı muhakemeyi sergilediğini gözlemledik. Araçtan 3 hata aldı, hemen strateji değiştirdi ve biri filtreleme biri hesaplama için iki ayrı araç kullanmaya geçti, her ödeme yöntemini ayrı ayrı işledi ve sonuçları birleştirdi.

LangChain aslında LangGraph kadar yetenekli ve uyarlanabilir; ancak framework'ün hata yönetimi varsayılan olarak kapalı olduğu için bu yeteneği gösterme fırsatı bulamadı. Doğru yapılandırıldığında, aynı alternatif yol yaklaşımını kullanarak doğru sonuca ulaştı.

Bu farklılıklar neden oluştu? (framework mimari analizi)

Ajan davranışı yalnızca LLM'e (GPT-5.2) bağlı olsaydı, tüm framework'ler benzer şekilde davranmalıydı. Ancak bu oranlardaki net farklılıklar, framework'lerin kendi iç döngü mekanizmalarından kaynaklanır:

1. LangGraph & AutoGen (%90 Pivot):

LangGraph bir Durum Makinesi mimarisi üzerinde çalışırken AutoGen konuşmaya dayalı bir modelle çalışır. Her iki sistemde de hatalar bir geri bildirim döngüsü olarak işlenir. LangGraph'da hatayı alan durum bir sonraki düğüme geçer; AutoGen'de ise Proxy ajan hatayı asistana bir sohbet mesajı olarak iletir. Bu sürekli yönlendirme mekanizması ajanı çözüm aramaya devam etmeye zorlar. Ajan tekrar "Bir hata aldım, ne yapmalıyım?" sorusuyla yüzleştiği için alternatif manuel yol izleme olasılığı %90'e yükselir.

2. LangChain (%65 Pivot / %35 Bekleme):

LangChain, sıralı bir AgentExecutor mimarisi üzerinde çalışır. Hata yönetimi yerinde olsa bile yürütme döngüsü daha doğrusal bir yapıya sahiptir ve öncelikli olarak Nihai Yanıt üretmeye odaklanmıştır. Araç 3-4 adım boyunca hata fırlatırsa LangChain bazen alternatif bir stratejiye geçmek yerine bir sonraki denemede aracın başarılı olmasını beklemeyi veya mevcut bağlamdan bir sonuç üretmeyi tercih eder. LangChain'in durum kilitlemesi LangGraph'ınkinden daha esnek olduğu için bekleme/doğrudan çözüm oranı yaklaşık %35 civarındadır.

3. CrewAI (%0 Pivot):

CrewAI, Yönetsel Süreç mimarisi üzerinde çalışır. Ajanları Rol ve Görev tanımlarıyla sarılmıştır. Hatalar oluştuğunda iç mimarisi genellikle Kendini Düzeltme veya Yeniden Deneme mantığını tetikler. Ancak "tüm planı iptal edip 5 adımda manuel filtreleme yapalım" gibi radikal bir strateji değişikliği, CrewAI'nin yönetsel plan yapısıyla çelişir. Planını tamamen terk etmek yerine "Bana verilen aracı düzeltmeliyim veya en yakın alternatifi kullanmalıyım" disipliniyle çalışır. Bu temelde hedef merkezli değil, plan merkezli bir yaklaşımdır.

Görev 5: Yapılandırılmamış veri orkestrasyonu (yapılandırılmamış veri yönlendirme)

Görev 5'te, framework'lerin bir CSV içindeki JSON ve uzun metin (LongText) sütunlarıyla karşılaştıklarında nasıl davrandıklarını gözlemledik. Ajanların önce bu sütunların veri türünü keşfetmesi, ardından sıralı veya paralel olarak doğru işleme araçlarını seçmesi gerekiyordu.

Gerçek dünyada yapılandırılmamış veri yönetimi, ajanın standart tablo verisinin ötesine geçip JSON blob'ları, ücretsiz-text paragraflar veya iç içe nesnelerle çalışmasını gerektirir.

Bir framework'ün bu veri türünü doğru şekilde işleyebilmesi için iki şeyi iyi yapması gerekir:

1- hangi aracın hangi veri türüne uyduğunu anlayan bir keşif zekası

2- birden çok bağımsız araç çağrısını koordine eden bir orkestrasyon mekanizması.

Görev 5'i özellikle bu iki yeteneği ayrı ayrı ölçmek için tasarladık.

AutoGen

AutoGen bu görevde güçlü bir performans sergiledi ve 8.170 prompt token ile 47 saniyelik medyan gecikmeyle Görev 5'teki en hızlı ve token açısından en verimli sonucu elde etti.

Mimarisinin merkezindeki konuşma döngüsü, AssistantAgent ile UserProxyAgent arasındaki mesajlaşma, genellikle laf kalabalığına yol açan bir yapı olarak görülür. Ancak Görev 5'te bu yapı bir avantaja dönüştü.

Konuşma geçmişine bakarak LLM, Metadata ve SupportNotes sütunlarının birbirinden bağımsız olduğunu fark etti. Ardından aynı anda 4 aracı listeleyen tek bir TOOL CALLS yanıtı gönderdi: inspect_column(Metadata), inspect_column(SupportNotes), parse_json_column(…) ve summarize_text_column(…) paralel olarak çalıştı. Bu, görevi en az token ve en az adımla 3 LLM turunda tamamlamasını sağladı.

Bu davranışın teknik nedeni açıktır: AutoGen'in araç yürütme motoru, LLM tarafından döndürülen tool_calls listesini atomik olarak çalıştırır ve sonuçları tek bir konuşma adımında toplar. Framework'ün "konuşmayı yönet" felsefesi, birden çok paralel kanalın aynı anda açılmasına doğal olarak izin verir ve token ile gecikme rakamları bunu doğrudan doğrular.

LangGraph

LangGraph, 9.150 prompt token ve 70 saniye medyan ile tamamladı; token bakımından AutoGen'e yakın ancak süre olarak daha yavaş. Durum Makinesi mimarisi, Görev 5'te hem en büyük gücünü hem de en dikkat çekici zayıflığını aynı anda sergiledi.

Her çalıştırmada LLM düğümü → araçlar düğümü → LLM düğümü döngüsü, tüm önceki araç çıktılarını durumda biriktirir ve bunları LLM'e geçirir. Bu yapı ajanın hiçbir şeyi unutmamasını garanti eder; bu normalde önemli bir avantajdır.

Ancak Görev 5'te bu güç aleyhine çalıştı. LangGraph doğru araçları buluyor ve doğru segmenti kuruyordu. Ancak analiz tamamlandıktan sonra bile biriken durumdaki belirsizlikleri tespit edip tamamlanmış adımları hâlâ bekliyormuş gibi yorumladı ve tekrar ek araç çağrıları tetikledi. Gerekli veriyi almış ve doğru cevabı üretmek üzere olmasına rağmen durum makinesinin "eksik adım" sinyali devreye girdi ve ajan gereksiz döngülere girdi. Sonuç olarak çalıştırma başına araç çağrısı sayısı 6 ile 16 arasında değişti. Durumun "hiçbir şeyi unutmama" gücü bazen tamamlanmış adımları eksik gibi göstererek ajanı gereksiz döngülere çekti ve benzer token sayısına rağmen gecikmeyi AutoGen'in 23 saniye üzerine çıkardı.

CrewAI

CrewAI'nin Görev 5 performansı, tüm benchmark genelindeki en yüksek varyansı üretti. Bazı çalıştırmalarda 5 araç çağrısıyla kusursuz bir sıra izledi, hiçbir sapma yapmadı ve bir betik gibi çalıştı. Bu çalıştırmalarda CrewAI'nin rol ve görev tanımlı yönetsel yapısı tam olarak amaçlandığı gibi işledi: ajan rolünü net şekilde anladığında öngörülebilir ve disiplinli davrandı.

Ancak diğer çalıştırmalarda (örn. çalıştırma 16: 35 araç çağrısı) tam bir kaos yaşandı. Temel neden, CrewAI'nin her adımda ürettiği iç monologdur (Thought). Doğru filtreyle segmenti doğru kurduktan sonra ajanın iç monoloğu ek filtrelerin de uygulanması gerekip gerekmediğini sorgulamaya başladı. Sonucu gördükten sonra mevcut segmentin geçerli mi yoksa öncekinin öncelikli mi olması gerektiğinden şüphe etti. Bu şüphe onu veriyi en baştan yeniden yüklemeye itti. Sonra tekrar filtreledi, başka bir doğrulama döngüsüne girdi, tekrar şüphe etti ve bu sarmalı 8 kez tekrarladı.

CrewAI'de her Düşünce bağımsız bir değerlendirme üretir ve bu değerlendirmeler zaman daha önce doğrulanmış adımları geçersiz kılar. Yönetsel Süreç'in "sürekli doğrulama" refleksi bazı çalıştırmalarda ajanı kendi doğru kararlarını yeniden sorgulamaya itti.

LangChain

LangChain'in AgentExecutor yapısı doğası gereği sıralıdır ve Görev 5, bu kısıtın en görünür olduğu yerdir. 10.070 prompt token ve 86 saniye medyan ile en yüksek token sayısına sahip olmamasına rağmen bu görevdeki en yavaş framework oldu.

Her adımda tek bir araç çağrısı yapar, sonucu alır ve devam eder; bu da 4 bağımsız aracın 4 ayrı bekleme süresiyle 4 ayrı LLM turu gerektirdiği anlamına gelir. AutoGen'in 47 saniyelik medyanı ile LangChain'in 86 saniyesi, sıralı ve paralel yürütme arasındaki maliyetin doğrudan bir ölçümüdür.

Görev 5'te LangChain'in araç sayısı 9 veya 15 olarak sabitlendi. Bu iki küme iki tipik stratejiye işaret eder: bazı çalıştırmalarda inceleme adımını atlayıp doğrudan ayrıştırma ve özetlemeye geçti (9 araç), diğerlerinde ise işlemeden önce her sütunu inceledi (15 araç). LangChain'in doğrusal yürütücü kimliği burada netleşti: ne AutoGen'in paralel verimliliğini ne de CrewAI'nin monolog kaosunu sergiledi.

Yapılandırılmamış veri yönetimi ve framework mimarisi

Bu görevin sonuçları, bir framework'ün yapılandırılmamış veriyi (JSON, LongText) ne kadar verimli yönetebildiğinin doğrudan iç döngü mekanizmasına bağlı olduğunu ortaya koyuyor:

Paralel araç çağrısı yapabilen framework'ler (AutoGen), bağımsız veri sütunlarını tek adımda işleyebilir. Büyük JSON nesneleri ve çok sayıda metin sütunu içeren gerçek dünya senaryolarında bu fark, büyük bir maliyet ve hız avantajına dönüşür.

Durum odaklı döngülere sahip framework'ler (LangGraph), veri tutarlılığında üstündür ancak geçmişte biriken tamamlanmış adımları yeniden değerlendirme riski taşır.

Monolog tabanlı framework'ler (CrewAI), verinin türünü ve anlamını derinlemesine anlama konusunda yeteneklidir; ancak bu derinlik bazen aşırı sorgulamaya ve döngülere dönüşür.

Doğrusal yürütme framework'leri (LangChain), yapılandırılmamış verinin farklı dallarını ayrı ayrı işleyerek her iki dünyadan orta düzey bir sonuç üretir.

GitHub yıldız artışı: agentic framework'ler

Agentic AI framework'leri karşılaştırın

Agentic AI framework'ler birkaç temel boyutta farklılık gösterir ve bu farklılıkları anlamak anlamlı karşılaştırmalar yapmak için gereklidir.

Çok ajanlı orkestrasyon

Çok ajanlı orkestrasyon, tek ajanın yeteneklerini aşan karmaşık iş akışlarını yönetmek için birden çok uzman yapay zeka ajanını koordine eder. Tek bir monolitik ajan inşa etmek yerine orkestrasyon, işi farklı rollere, araçlara ve uzmanlıklara sahip ajanlar arasında bölüştürür. Her framework, ajan koordinasyonu için farklı yaklaşımlar sunar.

LangGraph

LangGraph framework

LangGraph nispeten iyi bilinen bir framework'tür ve ajan sistemleri geliştiren geliştiriciler için önemli bir seçenek olarak öne çıkar.

Açık çok ajanlı koordinasyon: Birden çok ajanı, her biri kendi mantığına, belleğine ve sistemdeki rolüne sahip bireysel düğümler veya gruplar olarak modelleyebilirsiniz.

API'ler ve araçlar arasında yapay zeka iş akışları oluşturur. Bu nedenle RAG ve özel pipeline'lar için iyi bir uyumdur.

AutoGen

AutoGen Framework1

AutoGen, birden çok ajanın bir döngü içinde mesaj ileterek iletişim kurmasına olanak tanır. Her ajan, kendi iç mantığına göre yanıt verebilir, değerlendirme yapabilir veya araç çağırabilir.

Asenkron ajan işbirliğine sahiptir; bu da onu özellikle ajan davranışının deneme veya yinelemeli iyileştirme gerektirdiği araştırma ve prototip senaryoları için kullanışlı kılar.

CrewAI

Crew YZ1

CrewAI, alt seviye mantığın çoğunu sizin için halleder ve çok ajanlı orkestrasyon sağlar:

  • İzleme ve hata ayıklama için izleme araçlarıyla entegre olur
  • Koşullu mantık, döngüler ve durum yönetimiyle Flows aracılığıyla yerleşik yürütme kontrolü
  • Hiyerarşik (yönetici-çalışan) ve yapılandırılmış çok ajanlı koordinasyonu destekler

OpenAI Swarm

Swarm framework

Swarm, prototipleme için hafif, deneysel bir çok ajanlı framework'tür. Ajanlar, paylaşılan bağlamı koruyarak görevleri aktaran devirlerle sıralı olarak çalışır. Esnek iş akışları için doğal dil rutinleri ve Python araçları kullanır.

LangChain

LangChain, LLM uygulamaları RAG araçlarıyla birlikte tek ajanlı uygulamalar geliştirmek için bir framework'tür. Zincirler, araçlar, bellek ve belge işleme iş akışları için erişim dahil modüler bileşenler sağlar.

LangChain, öncelikle iş akışını tek bir ajanın yönettiği tek ajanlı yürütme kalıplarıyla çalışır.

Ajan ve fonksiyon tanımı

LangGraph

LangGraph, ajan tasarımında grafik tabanlı bir yaklaşım benimser; her ajan kendi durumunu koruyan bir düğüm olarak temsil edilir. Bu düğümler yönlendirilmiş bir grafik aracılığıyla bağlanır; koşullu mantık, çok ekipli koordinasyon ve hiyerarşik kontrol sağlar. Bu, ölçeklenebilir orkestrasyon için süpervizör düğümleriyle çok ajanlı grafikler oluşturmanızı ve görselleştirmenizi sağlar.

LangGraph, araçları ajanlara bağlayan anotasyonlu, yapılandırılmış fonksiyonlar kullanır. Düğümler oluşturabilir, bunları çeşitli süpervizörlere bağlayabilir ve farklı ekiplerin nasıl etkileşim kurduğunu görselleştirebilirsiniz. Bunu, her ekip üyesine ayrıntılı bir iş tanımı vermek gibi düşünün. Bu, birlikte çalışan ajanları geliştirmeyi ve test etmeyi kolaylaştırır.

AutoGen

AutoGen, ajanları esnek yönlendirme ve asenkron iletişim yeteneğine sahip uyarlanabilir birimler olarak tanımlar. Ajanlar mesaj alışverişi yaparak (ve isteğe bağlı olarak insanlarla) etkileşime girer ve işbirlikçi problem çözmeyi mümkün kılar. LangGraph gibi anotasyonlu, yapılandırılmış fonksiyonlar kullanır.

CrewAI

CrewAI rol tabanlı tasarım yaklaşımını benimser. Her ajana bir rol (örn. Araştırmacı, Geliştirici) ve erişebileceği beceriler, fonksiyonlar veya araçlar atanır. Fonksiyon tanımı yapılandırılmış anotasyonlar aracılığıyla yapılır.

OpenAI Swarm

OpenAI Swarm, ajanların prompt'lar ve fonksiyon docstring'leri aracılığıyla tanımlandığı rutin tabanlı bir model kullanır. Resmi orkestrasyon veya durum modelleri yoktur; bunun yerine manuel olarak yapılandırılmış iş akışlarına dayanır. Fonksiyon davranışı LLM tarafından docstring'ler aracılığıyla çıkarılır (Swarm, bir fonksiyonun ne yaptığını açıklamasını okuyarak tanımlar); bu kurulumu esnek kılar ancak daha az hassastır.

LangChain

LangChain, tek bir orkestratör ajanın dil modellerine ve çeşitli araçlara yapılan çağrıları yönettiği zincir tabanlı bir mimari kullanır. Fonksiyonları, toolkit'ler ve prompt şablonları gibi açık arayüzler aracılığıyla tanımlar.

Öncelikle merkezi iş akışlarına odaklanmış olsa da LangChain, çok ajanlı kurulumlar için uzantıları destekler ancak ajanlar arası yerleşik iletişimden yoksundur.

Bellek

Bellek yetenekleri:

  • Durumlu: Framework'ün yürütmeler arasında kalıcı belleği destekleyip desteklemediği.
  • Bağlamsal: Mesaj geçmişi veya bağlam aktarımı yoluyla kısa vadeli belleği destekleyip desteklemediği.

Bellek özellikleri, ajan sistemlerinin bağlamı hatırlaması ve zamanla uyum sağlaması için temel bir parçadır:

  • Kısa vadeli bellek: Yakın etkileşimleri izler; ajanların çok turlu konuşmaları veya adım adım iş akışlarını yönetmesini sağlar.
  • Uzun vadeli bellek: Kullanıcı tercihleri veya görev geçmişi gibi oturumlar arası kalıcı bilgileri saklar.
  • Varlık belleği: Etkileşimler sırasında bahsedilen belirli nesneler, kişiler veya kavramlar hakkındaki bilgiyi izler ve günceller (örn. daha önce bahsedilen şirket adı veya proje kimliğini hatırlama).

LangGraph

LangGraph iki tür bellek kullanır: tek bir görev veya konuşma sırasında bilgi saklayan iş parçacığı içi bellek ve oturumlar arasında veri saklayan iş parçacıkları arası bellek. Geliştiriciler, bir görevin akışını kaydetmek ve onu belirli bir thread_id ile ilişkilendirmek için MemorySaver kullanabilir. Uzun vadeli depolama için LangGraph, InMemoryStore veya diğer veritabanlarını destekler. Bu, belleğin kapsamının ve yürütmeler boyunca nasıl tutulacağının esnek şekilde kontrol edilmesini sağlar.

AutoGen

AutoGen bağlamsal bir bellek modeli kullanır. Her ajan, etkileşim geçmişini saklayan bir context_variables nesnesi aracılığıyla kısa vadeli bağlamı korur. Yerleşik kalıcı belleği yoktur.

CrewAI

CrewAI , kutudan çıkar çıkmaz katmanlı bellek sağlar. Kısa vadeli belleği bir ChromaDB vektör deposunda, son görev sonuçlarını SQLite'da ve uzun vadeli belleği ayrı bir SQLite tablosunda (görev açıklamalarına dayalı) saklar. Ayrıca vektör embedding'leri kullanarak varlık belleğini destekler. Bu bellek kurulumu, memory=True etkinleştirildiğinde otomatik olarak yapılandırılır.

OpenAI Swarm

Swarm durumsuzdur ve belleği yerleşik olarak yönetmez. Geliştiriciler kısa vadeli belleği context_variables üzerinden manuel olarak geçirebilir ve daha uzun vadeli bağlamı saklamak için isteğe bağlı olarak harici araçları veya üçüncü taraf bellek katmanlarını (örn. mem0) entegre edebilir.

LangChain

LangChain, esnek bileşenler aracılığıyla hem kısa vadeli hem uzun vadeli belleği destekler. Kısa vadeli bellek genellikle bir oturum içindeki konuşma geçmişini izleyen bellek içi tamponlarla yönetilir. Uzun vadeli bellek için LangChain, embedding'leri ve erişim verilerini kalıcı hale getirmek üzere harici vektör depoları veya veritabanlarıyla entegre olur.

Geliştiriciler, yerleşik bellek sınıflarını kullanarak bellek kapsamlarını ve stratejilerini özelleştirebilir; bu da etkileşimler boyunca bağlamsal ve varlığa özgü belleğin verimli yönetimini sağlar.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Döngüde insan

LangGraph

LangGraph, grafiği duraklatmak ve yürütme ortasında kullanıcı girdisini beklemek için özel kesme noktalarını (interrupt_before) destekler.

AutoGen

AutoGen, UserProxyAgent aracılığıyla insan ajanları yerleşik olarak destekler; bu, insanların ajan işbirliği sırasında adımları incelemesine, onaylamasına veya değiştirmesine olanak tanır.

CrewAI:

CrewAI , human_input=True ayarlayarak her görevden sonra geri bildirimi etkinleştirir; ajan kullanıcıdan doğal dil girdisi toplamak için duraklar.

OpenAI Swarm

OpenAI Swarm yerleşik HITL sunmaz.

LangChain

LangChain, yürütmeyi duraklatmak ve insan girdisi istemek için zincirler veya ajanlar içine özel kesme noktaları eklemeye olanak tanır. Bu, iş akışındaki belirli noktalarda inceleme, geri bildirim veya manuel müdahaleyi destekler.

Agentic AI framework'lerinde Model Context Protocol (MCP) entegrasyonu

Yapay zeka ajanlarının veritabanları, API'ler, dosya sistemleri ve iş uygulamaları gibi harici araçlarla etkileşime girmesi gerekir. Bir standart olmadan her framework, her araç için özel entegrasyonlar oluşturmak zorundaydı ve bu da parçalı bir ekosistem yaratıyordu. MCP, herhangi bir ajanın tek bir arayüz üzerinden herhangi bir araca bağlanmasını sağlayan evrensel bir protokol sunarak bu sorunu çözer.

Her framework MCP ile nasıl entegre olur?

LangGraph
LangGraph, mevcut araçları otomatik olarak keşfeden ve bunları LangChain uyumlu biçime dönüştüren bir adaptör aracılığıyla MCP sunucularına bağlanır. Ajanlar daha sonra bu araçları yerleşik yetenekleriyle birlikte sorunsuzca kullanabilir.

AutoGen
AutoGen, uzantı modülü aracılığıyla yerleşik MCP entegrasyonu sağlar. Geliştiriciler birkaç satır kodla MCP sunucularına bağlanabilir ve tüm araçlarını AutoGen ajanlarına sunabilir.

CrewAI
CrewAI ajanları, yapılandırmalarında basit URL'ler veya yapılandırılmış ayarlar kullanarak MCP sunucularına doğrudan referans verebilir. Framework, bağlantı yaşam döngüsünü ve hata yönetimini otomatik olarak yönetir.

OpenAI Swarm
Swarm, OpenAI ekosistemi genelindeki yerleşik MCP desteğinden yararlanır. OpenAI, MCP'yi ChatGPT ve Agents SDK'ya entegre ettiği için Swarm bu altyapıyı doğrudan kullanabilir.

LangChain
LangChain, Python fonksiyonlarının MCP sunucularına köprü görevi gördüğü MCP araç çağırma yetenekleri sunar. Bu, çeşitli kaynaklardan araçların çekilmesini ve bunların özel sarmalayıcılar olmadan zincirlere, ajanlara ve diğer LangChain bileşenlerine entegre edilmesini sağlar.

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Agentic AI framework'ler aslında ne yapar?

Agentic AI framework'ler, prompt mühendisliğine ve verilerin LLM'lere gidiş-gelişinin yönetilmesine yardımcı olur. Temel düzeyde, LLM'in öngörülebilir bir biçimde yanıt vermesi için prompt'ları yapılandırmaya ve yanıtları doğru araca, API'ye veya belgeye yönlendirmeye yardımcı olurlar.

Sıfırdan geliştiriyor olsaydınız prompt'u manuel tanımlamanız, LLM'in kullanmak istediği aracı çıkarmanız ve ilgili API çağrısını tetiklemeniz gerekirdi. Framework'ler şunları yaparak bunu kolaylaştırır:

  • Prompt orkestrasyonu: Karmaşık prompt'ları LLM'lere oluşturma, yönetme ve yönlendirme
  • Araç entegrasyonu: Ajanların harici API'leri, veritabanlarını, kod fonksiyonlarını vb. çağırmasını sağlama
  • Bellek: Turlar veya oturumlar boyunca durumu koruma (kısa ve uzun vadeli)
  • RAG entegrasyonu: Harici kaynaklardan bilgi erişimini sağlama
  • Çok ajanlı koordinasyon: Ajanların işbirliği yapma veya görev devretme şeklini yapılandırma
Agentic framework2

Agentic AI framework'ler: Gerçek hayat kullanım örnekleri

LangGraph – Çok ajanlı seyahat planlayıcı

LangGraph ile geliştirilen bir üretim projesi, uçuş ve otel verilerini çeken (Google Flights & Hotels API'leri kullanarak) ve seyahat önerileri üreten durumlu, çok ajanlı bir seyahat asistanını gösteriyor.3

CrewAI – Agentic içerik üretici

CrewAI'nin resmi örnek deposunda seyahat planlama, pazarlama stratejisi, hisse senedi analizi ve işe alım asistanları gibi akışlar bulunur; bu akışlarda rol bazlı ajanlar (örn. "Araştırmacı", "Yazar") görevler üzerinde işbirliği yapar.4

CrewAI, yüksek düzey bir içerik özetini Groq kullanarak eksiksiz bir makaleye dönüştürür.

Agentic AI framework'lerin temel özellikleri

Model desteği:

  • Çoğu model-agnostiktir; birden çok LLM sağlayıcısını destekler (örn. OpenAI, Anthropic, açık kaynak modeller).
  • Ancak sistem prompt yapıları framework'e göre değişir ve bazı modellerde diğerlerinden daha iyi performans gösterebilir.
  • Sistem prompt'larına erişim ve onları özelleştirme genellikle en iyi sonuçlar için gereklidir.

Araçlar:

  • Tüm framework'ler, ajan eylemlerini mümkün kılan temel bir parça olan araç kullanımını destekler.
  • Özel araçları tanımlamak için basit soyutlamalar sunar.
  • Çoğu, Model-Context-Protocol (MCP) destekler; bunu yerleşik olarak veya topluluk uzantıları aracılığıyla yapar.

Bellek / Durum:

  • Adımlar veya LLM çağrıları boyunca kısa vadeli belleği korumak için durum takibi kullanır.
  • Bazıları, ajanların bir oturum içinde önceki etkileşimleri veya bağlamı hatırlamasına yardımcı olur.

RAG (Erişimle Arttırılmış Üretim):

  • Çoğu, RAG için kolay kurulum seçenekleri sunar; vektör veritabanları veya belge depolarıyla entegre olur.
  • Bu, ajanların yürütme sırasında harici bilgiye referans vermesini sağlar.

Diğer yaygın özellikler

  • Eşzamanlı ajan veya araç çağrılarına olanak tanıyan asenkron yürütme desteği.
  • Yapılandırılmış çıktılar için yerleşik işleme (örn. JSON).
  • Modelin sonuçları artımlı olarak ürettiği akış çıktıları desteği.
  • Ajan çalıştırmalarını izleme ve hata ayıklama için temel gözlemlenebilirlik özellikleri.

Benchmark metodolojisi

1. Görev Yapısı

Görev 1: Tek bir araç çağrısının doğru parametreyle yapılıp yapılamadığını ölçer. Framework'ün temel altyapı ek yükü en net şekilde bu basit senaryoda ortaya çıkar.

Görev 2: İki ayrı filtre grubunun sonuçlarını bellekte tutmayı ve tek bir çıktıda birleştirmeyi gerektirir. Durum yönetimi ve çok segmentli koordinasyon test edilir.

Görev 3: Doğal dildeki sayısal koşulların bozulma olmadan araç parametrelerine çevrilip çevrilmediğini ölçer. Asıl test, framework'ün yeniden deneme ve yeniden prompt mekanizmalarının bu parametreleri koruyup koruyamadığıdır.

Görev 4: Bir araç art arda Network, Timeout ve RateLimit hataları fırlatır. Bu hatalar karşısında framework'ün strateji değiştirip değiştirmediği ölçülür.

Görev 5: Ajan önce JSON ve LongText sütunlarını keşfetmeli, ardından doğru araçları doğru kapsam parametreleriyle çağırmalıdır. Framework'ün bağımsız araçları paralel mi yoksa sıralı mı çalıştırdığı gözlemlenir.

Bir görev gerçekte nasıl görünür?

Kurulumu somutlaştırmak için işte Görev 5, agentic YZ framework benchmark'ındaki en karmaşık görev. Her framework aynı prompt'u ve aynı araç setini aldı; yalnızca LLM'i saran framework değişti.

Ajana verilen prompt:

Churn='Evet' olan ve MonthlyCharges'ta 100'den fazla ödeme yapan kayıplı müşterileri analiz et.

  1. Veri kümesini Churn='Evet' olacak şekilde filtrele.
  2. 'Metadata' ve 'SupportNotes' sütunlarını inceleyip veri türlerini keşfet.
  3. JSON 'Metadata' sütunundan 'device_type' dağılımını çıkar.
  4. ücretsiz-text 'SupportNotes' sütunundan şikayet anahtar kelimelerini say.
    Sonucu yalnızca JSON olarak döndür.

Gerekli JSON çıktısı:

Bu görev neden framework'leri ayırt ediyor: ajan dört araç çağrısından oluşan bir zincir planlamalı, filtrelenmiş segmenti her çağrıda durumda tutmalı ve bir sütunun JSON, diğerinin ücretsiz metin olduğunu fark etmelidir. Bağımsız sütunları paralel çalıştıran bir framework (AutoGen), onları sıralı çalıştırandan (LangChain) çok daha hızlı bitirir; tamamlanan adımları yeniden değerlendiren framework ise (LangGraph, CrewAI) gereksiz yere döngüye girer. Katı JSON şeması, doğruluğu otomatik olarak puanlamamızı sağlar.

2. Yapılandırma

Tüm framework'ler aynı LLM modelini (openai/gpt-5.2) ve aynı sıcaklık değerini (0.1) kullandı. Tüm görevlerde her ajana aynı araçlar ve aynı prompt'lar verildi. Her framework kendi yerleşik yapısıyla kuruldu: LangChain AgentExecutor ile, LangGraph StateGraph ile, AutoGen AssistantAgent + UserProxyAgent ile ve CrewAI Agent + Task + Crew ile.

IBM Telco Customer Churn veri kümesi (7.032 müşteri) kullanıldı. Araç durumu her çalıştırmadan önce sıfırlandı. Her framework ve görev kombinasyonu için 100 bağımsız çalıştırma gerçekleştirildi.

Maksimum iterasyon limitleri görev karmaşıklığına göre belirlendi: Görev 1, 2 ve 3 için 10; değişken araç döngüsü nedeniyle Görev 4 için 20; 4 adımlı keşif zinciri nedeniyle Görev 5 için 20.

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Cem Dilmegani and Nazlı Şipi (2026) - "En İyi 5 Açık Kaynak Agentic AI Framework". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 10 Ağustos 2026, kaynak: https://aimultiple.com/agentic-frameworks [Çevrimiçi Kaynak]

Dilmegani, C., & Şipi, N. (2026, 10 Ağustos). En İyi 5 Açık Kaynak Agentic AI Framework. AIMultiple. https://aimultiple.com/agentic-frameworks

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Şipi, Nazlı},
  title  = {{En İyi 5 Açık Kaynak Agentic AI Framework}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/agentic-frameworks}},
  note   = {AIMultiple. Erişim tarihi: 10 Ağustos 2026}
}
Tüm verileri indir

0 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, 0 CSV dosyası ve bir README içeren ZIP dosyası olarak indirin.

Son güncelleme: 17 Ağustos 2026
İndir
Cem Dilmegani
Cem Dilmegani
Baş Analist
Cem, 2017'den beri AIMultiple'da baş analisttir. AIMultiple, her ay Fortune 500'ün %60'ı dahil olmak üzere (similarWeb'e göre) yüz binlerce işletmeyi bilgilendirmektedir.

Cem'in çalışmaları Business Insider, Forbes, Washington Post gibi önde gelen küresel yayınlar, Deloitte, HPE gibi küresel firmalar, Dünya Ekonomik Forumu gibi STK'lar ve Avrupa Komisyonu gibi uluslarüstü kuruluşlar tarafından alıntılanmıştır.

Cem, kariyeri boyunca teknoloji danışmanı, teknoloji alıcısı ve teknoloji girişimcisi olarak görev yapmıştır. On yıldan fazla bir süre McKinsey & Company ve Altman Solon'da işletmelere teknoloji kararlarında danışmanlık yapmıştır. Ayrıca dijitalleşme üzerine bir McKinsey raporu yayımlamıştır.

CEO'ya rapor verirken bir telekomünikasyon şirketinin teknoloji stratejisini ve satın alımını yönetmiştir. Ayrıca, 2 yıl içinde 0'dan 7 haneli yıllık yinelenen gelire ve 9 haneli değerlemeye ulaşan derin teknoloji şirketi Hypatos'un ticari büyümesini yönetmiştir. Cem'in Hypatos'taki çalışmaları TechCrunch ve Business Insider gibi önde gelen teknoloji yayınları tarafından ele alınmıştır.

Cem, uluslararası teknoloji konferanslarında düzenli olarak konuşma yapmaktadır. Boğaziçi Üniversitesi'nden bilgisayar mühendisi olarak mezun olmuş ve Columbia Business School'dan MBA derecesine sahiptir.
Tam Profili Görüntüle
Araştıran
Nazlı Şipi
Nazlı Şipi
Yapay Zeka Araştırmacısı
Nazlı, AIMultiple bünyesinde veri analistidir. Çeşitli sektörlerde veri analizi konusunda daha önce deneyime sahiptir; burada karmaşık dataset'leri eyleme dönüştürülebilir içgörülere dönüştürme üzerine çalışmıştır.
Tam Profili Görüntüle

Yorumlar 1

Düşüncelerinizi Paylaşın

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450
Chaitanya
Chaitanya
Dec 19, 2025 at 01:47

Thank you for this informative and detailed article! It helped me get a reading on these frameworks.