Ajan CLI araçları, dosya oluşturup silebilen, komut çalıştırabilen, plan yapabilen ve tüm projenin kodlamasını yürütebilen yapay zeka kodlama araçlarıdır. Önde gelen araçları 10 gerçek dünya web geliştirme senaryosunda kıyasladık; ajan başına ~600 atomik doğrulama kontrolü ve backend mantığı, frontend işlevselliği ve çoklu çalıştırma tutarlılık doğrulaması dahil toplamda ~5.000'den fazla otomatik test yürütmesi gerçekleştirdik.
Agentic CLI benchmark sonuçları
Agentic CLI araçlarının performans içgörüleri
Backend doğruluğu sıralamayı belirler; birleşik puan onu 0,7, frontend'i ise 0,3 ağırlıklandırır.
- Dokuz temiz çalışan ajanın tümü aynı Sonnet 4.6'yı kullanır, ancak backend Opencode'ın %77,3'ünden Goose'un %55,4'üne kadar değişir. Bu 22 puanlık fark tamamen orkestrasyondan kaynaklanır.
- Güçlü bir backend, güçlü bir bitişi garanti etmez: Cline (backend'de 4., %69,5) ve Forge (5., %67,2) backend'de tepeye yakın sıralanır ancak frontend'de ciddi şekilde geride kalır, Cline'ın %52,5'i alandaki en zayıfıdır, bu yüzden ikisi de birleşik tabloda aşağı kayar.
- Codex mükemmel %100 frontend'e rağmen backend'de 10. sıradadır (%52,1). Ortak modele ulaşmak için burada bir proxy üzerinden çalışır; bu da yeteneklerini olumsuz etkileyebilir, dolayısıyla bu muhtemelen ajanın gerçek backend'inin tabanıdır.1 Gemini de bir proxy üzerinden çalıştırıldığı için aynı şekilde sınırlıdır.
- Derleme sırası davranışı öngörmez: Burada lider olan ajan, sıkıştırma sonrasında hiçbir şeyi korumazken, orta sıradaki bir ajan her şeyi korur.
Hız, token kullanımı ve maliyet ile puan karşılaştırması
Ortalama yürütme süresi (saniye), etkili token kullanımı (girdi + çıktı) ve görev başına maliyeti (USD) kullanarak çalışma zamanı verimliliğini değerlendirdik; her biri birleşik doğruluk puanına karşı çizildi:
Bir ajanın ne kadar hızlı, ucuz veya token açısından hafif olduğu, ne kadar iyi puan aldığını öngörmez.
- Opencode üçünü de aynı anda kazanır: en yüksek birleşik puan (%81,6), yetenekli herhangi bir ajanın en düşük maliyeti (görev başına $1,03), en az token'lardan biri ve en hızlı çalıştırmalar. Olağan doğruluk-maliyet takasını tersine çevirir.
- Maliyet, Forge $0,18'den Junie $7,58'e kadar yaklaşık 40x aralığındadır ve sıralamayla bağlantısı yoktur. Forge en ucuzdur çünkü en azını yapar: backend'i bilet oluşturmayı başaramaz. Junie'nin $7,58'i orta sıradan bir %74,7 satın alır ve şişirilmiş bir üst sınırdır.
- Goose en azı için en çoğunu öder: $3,23 ile ikinci en pahalıdır, ancak alandaki en düşük temiz puandır (%62,5). Puanda ilk üç ucuz kalır (Opencode $1,03, Claude Code $1,83, Grok $2,03).
- Ne en hızlı ne de en yavaş ajan kazanır: Kiro (439s) ve Gemini (1.158s, proxy ek yükü) ikisi de orta sırada yer alır. Ekstra harcama, problem çözme derinliği değil, yeniden denemeler ve yeniden doğrulama satın alır.
- Token sayıları çoğunlukla önbellekleme ile ilgilidir. Codex, Claude Code, Cline, Opencode, Gemini ve Grok girdilerinin %86–%98'ini önbelleğe alır, bu yüzden Claude Code'un 4,18M brüt token'ı etkili 115k'ye düşer. Junie, Goose, Kiro, Forge ve Aider önbelleğe almaz, bu yüzden yeniden gönderdikleri her token için ödeme yaparlar; Junie'nin 2,36M'sinin alandaki en yüksek olmasının nedeni budur.
- Sayılarla ilgili üç uyarı: önbelleğe almayan beş ajan için etkili girdi, gönderdikleri her şeydir, bu yüzden bunu bir tavan olarak okuyun; Kiro'nun $1,72'si bir tabandır (kredi faturalı, $2,23'e daha yakın); Cline'ın %64,4'ü, bir frontend göndermeden önce hata sınırına ulaştığı dört görevi içerir, her biri 0 puan aldı.
Metodolojimizi aşağıda görebilirsiniz.
Agentic CLI araçları nasıl çalışır
Agentic CLI araçları, terminal içinde çalışan otonom ajanlardır. Çoğu kullanıcı bunları kodlama görevleri için kullansa da, kabuk komutları aracılığıyla gerçekleştirilebilen herhangi bir iş akışını yürütebilirler.
Bu ajanlar genellikle üç aşamadan oluşan bir döngü içinde çalışır:
- Bağlamı topla
- Eylemde bulun
- Sonuçları doğrula
Doğrulamanın ardından ajan güncellenmiş bağlamı toplar ve görevi tamamlayana veya bir durdurma koşuluna ulaşana kadar döngüyü tekrarlar.
Döngü iki kaynaktan etkilenir:
- İlk görevi sağlayan ve yürütmeyi kesebilen insan kullanıcı
- Planlama, muhakeme ve eylem seçimi gerçekleştiren model
Ajan framework'ü modelin etrafında yapı sağlar. Modelin nasıl planlayacağını, komutları ne zaman yürüteceğini, sonuçları nasıl doğrulayacağını ve hangi araçların kullanılabilir olduğunu tanımlar. Bu araçlar kabuk yürütme, dosya sistemi erişimi, tarayıcı kontrolü, bilgisayar kullanımı, MCP entegrasyonları veya yeniden kullanılabilir "beceriler" içerebilir.
Farklı ajan mimarileri, farklı planlama stratejileri, yeniden deneme politikaları ve doğrulama mantığı dayatır. Bazı ajanlar, daha yüksek token kullanımı ve gecikme pahasına hassasiyeti ve daha derin muhakemeyi önceliklendirir. Diğerleri, azaltılmış davranışsal sağlamlıkla hızı ve daha düşük maliyeti önceliklendirir.
Model zekası ve ajan mimarisi
Agentic CLI araçları arasındaki performans farkları tek bir kaynaktan gelmez. İki katmandan ortaya çıkarlar: temel model ve onu saran orkestrasyon framework'ü.
Bu benchmark, her iki ajanı da aynı temel model üzerinde test eder: Claude Sonnet 4.6. Puandaki herhangi bir fark bu nedenle orkestrasyondaki bir farktır: CLI'nin bağlamı nasıl topladığı, komutları ne zaman yürüttüğü, çıktıyı nasıl doğruladığı ve başarısızlıktan sonra yeniden deneyip denemediği.
Opencode ve Claude Code her ikisi de doğrudan Sonnet 4.6 kullanır. Opencode %77,3 backend puanı alır; Claude Code %74,9 puan alır. İki ajan, aynı model, backend doğruluğunda 2,4 yüzde puanı fark. Kiro ve Opencode her ikisi de Sonnet 4.6 kullanır. Kiro %64,2 backend puanı alır; Opencode %77,3 puan alır. 13 puanlık fark CLI'nin katkısıdır.
Aşağıdaki iki gözlemevi benchmark'ı bunu daha da ileriye taşır. Aynı ortak model testini web araştırması ve bağlam sıkıştırma üzerinde çalıştırırlar; burada farklar 13 puan değil, doğru cevabı bulmak ile yanlış bir cevap uydurmak arasındaki farktır.
Web araştırması temellendirmesi
Her ajandan framework belgelerini denetlemesini istedik: hangi sürümün bir özelliği tanıttığını, mevcut durumunun ne olduğunu ve son zamanlarda neyin değiştiğini. Her cevap bir resmi kaynağa atıf yapmak zorundaydı. Sondayı iki kez çalıştırdık; bir kez Unity'de ve bir kez Next.js/React'te. Gerçekler, doğru cevabın yalnızca güncel, yayınlanmış bir sayfada bulunacağı şekilde seçildi. Eğitim verisinden cevap vermek kendinden emin, yanlış bir cevap üretir. Tek bir şeyi kontrol ettik: ajan, atıf yaptığı sayfayı gerçekten getirdi mi?
Dört ajanın yerleşik web araması vardır. Bunlardan üçü (Codex, Gemini, Grok) Sonnet olmayan yerel modellerinde çalıştı; diğer sekizi, Claude Code dahil, Sonnet 4.6 üzerinde çalıştı.
Dört kalıp ortaya çıktı.
- Gerçek canlı arama Codex, Claude Code, Gemini ve Grok güncel sayfaları getirir ve son değişiklikleri yakalar. En zor gerçeklerin bulunduğu geliştirici forumuna ulaşan tek ajan Codex oldu.
- Arama yapar, ancak eski sayfalara iner Cline iki düzine gerçek dokümantasyon sayfası getirdi ve yine değiştirilmiş bir sürümü bildirdi. Getirmeler gerçekti; sayfalar bayattı.
- Arama yok, eğitimden cevap verir Aider taramaz ve bunu söyler. Bu dürüst bir yanıttır.
- Uydurulmuş kaynaklar Forge çalışan hiçbir şey getirmedi, ancak Next.js sondasında 31 kaynak gösterdi. Atıf yapılan sayfalar mevcut değil. Kapanış ifadesi: "her hücre, bu oturum sırasında gerçekten getirilen bir sayfadan kaynaklanmıştır."
Next.js sondasında, tarama yapan diğer tüm ajanlar atıflarının neredeyse tamamını gerçekten getirdikleri sayfalara dayandırdı. Forge hiçbirini dayandırmadı. Grafik, her ajanın temellendirilmiş atıflarını uydurulmuş olanlara karşı yığar; böylece dürüst ajanlar tam yeşil çubuklar, Forge ise tek kırmızı bir çubuk olarak okunur. Grafik, URL başına doğrulanabilir getirme günlüğüne sahip sekiz ajanı kapsar. Grok (sunucu tarafı arama), Gemini (kesilmiş çalıştırma) ve Aider (atıf yok) yukarıdaki tabloda görünür ancak burada hariç tutulmuştur.
Bu testte Cline ve Claude Code her ikisi de Sonnet 4.6 üzerinde çalıştı. Claude Code doğru cevaba sahip sayfayı buldu ve açtı. Cline bulamadı. Aynı model, farklı sonuç.
Her cevabı olgusal doğruluk için puanladık, ancak bu puanlar şu anda incelenmekte olan bir cevap anahtarına bağlıdır. Anahtar kesinleşene kadar doğruluk tablolarını yayınlamıyoruz.
Bağlam sıkıştırma
Bir oturum uzadığında, ajan bağlamını sıkıştırır: ayrıntılı geçmişi kısa bir özetle değiştirir ve orijinalleri atar. Özetin önemli olanı koruyup korumadığını test ettik.
Her ajana yaklaşık 112.000 token belge verdik; içlerine 13 uydurulmuş gerçek gömülüydü: bir nöbetçi PIN'i, bir bulut bölgesi, bir derleme etiketi ve on tane daha. Uydurulmuş, değerlerin eğitim verisinde hiçbir varlığı olmayan benzersiz dizgiler olduğu anlamına gelir. Ajan belgeleri okudu ve sıkıştırdı. Ardından kaynak dosyaları sildik ve 13 gerçeğin tamamını sorduk. Dosyalar silindiğinde, tek olası kaynak sıkıştırma özetidir.
Dört ajan her gerçeği korudu. Üçü hiçbirini korumadı. Bellekten 0 puan alan üçü, dosyaları hâlâ yeniden okuyabildikleri sırada 13 / 13 yanıtlamıştı. Her sorguda yeniden okuyorlardı. Dosyalar gittiğinde, tahmin etmek yerine "bilinmiyor" yazdılar.
Goose, Forge, Opencode ve Kiro'nun hepsi Sonnet 4.6 çalıştırır. Kiro 13'ün tamamını korudu. Diğer üçü hiçbirini korumadı. Aynı model, zıt sonuç.
Opencode derleme benchmark'ında birinci sıradadır ve sıkıştırmada hiçbir şey korumaz. Kiro derleme benchmark'ında yedinci sıradadır ve sıkıştırmada her şeyi korur. Güçlü derleme performansı ile güçlü sıkıştırma bağımsız özelliklerdir.
Dört ajan, her biri somut bir nedenle bu testin kapsamı dışında kaldı. Cline sıkıştırma eşiğine getirilemedi. 863.000 token'lık bir belge seti oluşturduk ve her dosyayı okuttuk, ancak cline her araç çıktısını yaklaşık 2.000 karaktere kısaltır, bu yüzden belgeler kısa önizlemelere dönüştü. Bağlamı 214.000 token'da, bir milyon token'lık penceresinin %21'inde plato yaptı ve sıkıştırma hiç tetiklenmedi. Bir sayı tahmin etmek yerine cline'ı bu protokol altında ölçülemez olarak rapor ediyoruz. Grok'un bir sıkıştırma komutu vardır, ancak belgelerimizi tam olarak yüklemek yerine parçalar halinde okudu, bu yüzden sıkıştırması için hiçbir zaman eksiksiz bir bağlam oluşmadı. Aider'ın özetleyicisi, gerçeklerin yaşadığı yer olan oturuma eklenen dosyaların içeriklerini değil, sohbet dönüşlerini sıkıştırır. Junie'nin sıkıştırma özelliği yoktur.
Görev 6'daki ajan davranışları
Ajanları 10 görevde değerlendirdik. Aşağıda, hepsi aynı model üzerinde çalışırken farklı CLI mimarilerinin aynı kısıtlar altında nasıl davrandığını göstermek için Görev 6'nın ayrıntılı bir dökümü bulunmaktadır.
Görev 6: Yardım masası bilet sistemi (Web)
Görev 6, aşağıdakileri içeren tam yığın bir yardım masası bilet sistemi oluşturmayı gerektirdi:
- İki kullanıcı rolü (müşteri ve ajan)
- JWT tabanlı kimlik doğrulama
- Katı durum iş akışı geçişleri
- Veri izolasyonu (çapraz kullanıcı erişimi için 403 yerine 404)
- FastAPI backend
- React/Vue/Svelte + Vite frontend
- Deterministik çalıştırma komutları
Duman testi şunları doğruladı:
- Sağlık kontrolü
- Çift rollü kimlik doğrulama
- Bilet CRUD işlemleri
- Atama ve yanıtlar
- Durum geçişleri
- Rol uygulama
- Veri izolasyonu
- UI girişi ve giriş sonrası davranış
Bu görev durum yönetimini, kimlik doğrulama doğruluğunu, REST sözleşme disiplinini ve frontend-backend entegrasyonunu zorlar. Görev ayrıntılarını görmek için GitHub'ı ziyaret edin.
Tek bir modelde, alan üç gruba ayrıldı.
- %60 backend, yedi ajan (codex, claude-code, cline, grok, goose, junie, opencode): üç yeniden çalıştırmanın tamamında aynı altı başarısız adım. Kimlik doğrulama, bilet CRUD, yanıtlar ve veri izolasyonu geçti; her iki başarısızlık da
/tickets/{id}/assignve/tickets/{id}/statusüzerindeydi; burada şartnamenin ayrı rotaları yerine tek bir birleşikPATCH /tickets/{id}oluşturdular. İş mantığı doğru, REST sözleşmesi yanlış. Gemini 3 Pro üzerindeki önceki yerel çalıştırmada, Opencode ayrı endpoint'leri oluşturdu ve %93,3 puan aldı; Sonnet 4.6 üzerinde ise diğerleri gibi birleşik tasarımı seçti. - %13,3, üç ajan (aider, forge, gemini-cli): kimlik doğrulama çalıştı, ancak bilet oluşturmanın kendisi başarısız oldu, bu yüzden bağımlı her adım kademeli olarak çöktü.
- %24,4, Kiro: istikrarsızlık, tek bir başarısızlık modu değil. Birinci çalıştırmada dokuz adımı geçti, ikinci çalıştırmada iki adımı geçti ve üçüncü çalıştırmada backend hiç başlamadı (sağlık kontrolü başarısız oldu). Diğer on ajan her yeniden çalıştırmada aynı şekilde tekrar etti.
- %60 kümesindeki UI: claude-code ve cline aynı CORS hatasında girişte başarısız oldu; frontend, backend'i bir
127.0.0.1kaynağındanlocalhost:8000üzerinde çağırdı ve tarayıcı bunu engelledi, bu yüzden ikisi de %75 puan aldı; diğer beşi %100 ile temiz şekilde render etti ve giriş yaptı. - Çıkarım yakınsamadır: aynı modelde yedi farklı CLI aynı REST sözleşme hatasını yaptı, bu yüzden burada model baskındır ve orkestrasyon neredeyse hiç önemli değildir; aşağıdaki gözlemevi benchmark'larının tersi.
Codex
Kurulum
Genel olarak şununla kurun:
- npm install -g @openai/codex
Alternatif olarak Homebrew ile genel kurulum (macOS/Linux)
- brew install –cask codex
Kimlik doğrulama
Codex'i kurduktan sonra ChatGPT Hesabınızla veya OpenAI API Anahtarınızla devam edebilirsiniz. Sağlayıcı seçeneği yoktur.
Görev Raporu
Codex 454 saniyede çalışan bir sistem oluşturdu ve %60 kümesine girdi. İş mantığı doğruydu; alandaki diğerleri gibi atama ve durumda REST sözleşmesini kaçırdı.
Backend Davranışı
Kimlik doğrulama, bilet CRUD, yanıtlar ve veri izolasyonu geçti. Altı başarısızlık, `/tickets/{id}/assign` ve `/tickets/{id}/status` hedeflerine yönelik atama ve durum geçişi adımlarıydı. Codex her ikisini de birleşik bir güncelleme endpoint'i üzerinden yönlendirdi, bu yüzden bu çağrılar 404 döndürdü. Üç yeniden çalıştırmanın tamamında istikrarlı.
UI Davranışı
Frontend sekiz doğrulama adımının tamamını geçti. Giriş ve giriş sonrası durum doğru davrandı. %100 UI.
Junie
Kurulum
Junie, JetBrains Toolbox aracılığıyla veya bağımsız bir CLI olarak kullanılabilir:
- curl -fsSL https://junie.jetbrains.com/install | bash
Kimlik doğrulama
JetBrains hesabınızla devam edin veya junie.jetbrains.com/cli adresinde bir JUNIE_API_KEY oluşturun veya Anthropic, OpenAI, Google veya diğer desteklenen sağlayıcılardan kendi API anahtarınızı dışa aktarın. Birden çok sağlayıcı seçeneği mevcuttur.
Görev Raporu
Junie 444 saniyede eksiksiz bir tam yığın sistem üretti ve ana kümede %60 backend puanı aldı. Bu görevdeki etkili girdisi, bilinen bir önbellek muhasebesi hatasından etkilenen önbelleksiz bir üst sınır olan 1,52M ile alandaki en yüksektir (sonuç tablosu notuna bakın).
Backend Davranışı
On altı adımdan dokuzu geçti: kimlik doğrulama, bilet CRUD, yanıtlar ve veri izolasyonu. Altı başarısızlık, atama ve durum geçişi adımlarıydı. Junie, durum ve atamayı birleşik bir güncelleme endpoint'i üzerinden ele aldı, bu yüzden şartnamenin `/tickets/{id}/assign` ve `/tickets/{id}/status` rotaları 404 döndürdü. Geçiş mantığının kendisi doğruydu. Üç yeniden çalıştırmanın tamamında istikrarlı.
UI Davranışı
Frontend sekiz doğrulama adımının tamamını geçti. %100 UI.
Kiro CLI
Kurulum
macOS/Linux/WSL için:
- curl -fsSL https://cli.kiro.dev/install | bash
Alternatif Linux AppImage (taşınabilir seçenek):
- İndirme: https://desktop-release.q.us-east-1.amazonaws.com/latest/kiro-cli.appimage
Ardından çalıştırın:
- chmod +x kiro-cli.appimage && ./kiro-cli.appimage
Kimlik doğrulama
Kiro-Code planınızla devam edebilirsiniz. Sağlayıcı seçeneği yoktur.
Görev Raporu
Kiro, puanı tek bir tasarım tercihinden ziyade istikrarsızlığı yansıtan tek ajandır. %24,4 backend'i, üç farklı sonuç üreten üç yeniden çalıştırmanın ortalamasıdır. Çalıştığında derlemenin kendisi sağlamdı; sorun, iki kez aynı şekilde çalışmamasıydı.
Backend Davranışı
İlk çalıştırmada Kiro, %60 kümesiyle aynı profil olan on altı adımdan dokuzunu geçti; yalnızca atama ve durum rotalarında başarısız oldu. İkinci çalıştırmada iki adımı geçti. Üçüncüde backend hiç açılmadı ve sağlık kontrolü bile başarısız oldu. Ortalaması alındığında bu %24,4'tür. Kiro'yu buradaki kümeden ayıran, endpoint tasarımı değil, istikrarsızlıktır.
UI Davranışı
Backend açıkken, frontend sekiz doğrulama adımının tamamını geçti. %100 UI. Bu, giriş formunun bağlamada 422 hatasında render edilemediği önceki çalıştırmaya göre bir değişikliktir.
Claude Code
Kurulum
macOS/Linux/WSL için, tercih ettiğiniz paket yöneticisini göz önünde bulundurarak Claude Code'u şunlardan biriyle kurabilirsiniz:
- curl -fsSL https://claude.ai/install.sh | bash
- npm install -g @anthropic-ai/claude-code
Kimlik doğrulama
Claude Code'u kurduktan sonra Claude Hesabınızla devam edebilirsiniz. Sağlayıcı seçeneği yoktur.
Görev Raporu
Claude Code, ana kümede 379 saniyede %60 backend puanı aldı. Bu, bir JWT doğrulama hatasının her kimlik doğrulamalı rotada 401 döndürdüğü ve 16 adımdan 13'ünün başarısız olduğu önceki çalıştırmaya göre belirgin bir iyileşmedir. Bu çalıştırmada backend çalıştı; kayıp UI'daydı.
Backend Davranışı
Kimlik doğrulama, bilet CRUD, yanıtlar ve veri izolasyonu geçti. Altı başarısızlık, şartnamenin ayrı yolları yerine birleşik bir güncelleme endpoint'i üzerinden yönlendirilen atama ve durum geçişi adımlarıydı. Üç yeniden çalıştırmanın tamamında istikrarlı.
UI Davranışı
Giriş adımı başarısız oldu. Frontend, sayfa bir 127.0.0.1 kaynağından sunulurken backend'i localhost:8000 üzerinde çağırdı ve tarayıcı CORS politikası kapsamında giriş isteğini engelledi. Beş adım geçti, biri başarısız oldu, ikisi engellendi. %75 UI. Cline aynı şekilde başarısız oldu.
Aider
Kurulum
Python 3.8-3.13 zaten kuruluysa, önce aider'ı kurun:
- python -m pip install aider-install
- aider-install
Kimlik doğrulama
OpenRouter hesabınıza giriş yapın ve yetkilendirin veya API Anahtarınızı ortamınızda şununla dışa aktarın:
- export OPENROUTER_API_KEY=”sk-or-v1-…”
Görev Raporu
Aider 236 saniye ile en hızlı ajan ve 1,3k girdi ile 18k çıktı token'ıyla en hafifiydi. Ayrıca %13,3 backend puanı aldı. Kimlik doğrulama çalıştı, ancak bilet oluşturma başarısız oldu ve mevcut bir bilet gerektiren her adım da onunla birlikte başarısız oldu.
Backend Davranışı
İki adım geçti. Derleme bilet oluşturmada kırıldı, bu yüzden müşteri ve ajan bilet listeleri, yanıtlar, atama, durum geçişleri ve rol kontrolleri kademeli olarak başarısız oldu. Üç yeniden çalıştırmanın tamamında istikrarlı. Bu, biletleri doğru oluşturan ve yalnızca atama ve durum rotalarını kaçıran %60 kümesinden farklı bir başarısızlık sınıfıdır.
UI Davranışı
Giriş adımı, claude-code ve cline'da görülen aynı CORS kaynak uyuşmazlığında başarısız oldu. Beş adım geçti, biri başarısız oldu, ikisi engellendi. %75 UI.
OpenCode
Kurulum
macOS/Linux/WSL için:
- curl -fsSL https://opencode.ai/install | bash
Genel olarak şununla kurun:
- npm i -g opencode-ai
macOS/Linux için, tercih ettiğiniz paket yöneticisini göz önünde bulundurarak:
- bun add -g opencode-ai
- brew install anomalyco/tap/opencode
- paru -S opencode
Kimlik doğrulama
Çok sayıda sağlayıcı seçeneği vardır; istediğiniz sağlayıcıyı seçin ve /connect ile kimlik doğrulayın
Görev Raporu
Opencode genel benchmark'ın lideridir, ancak Görev 6'da 542 saniyede ana kümede %60 backend puanı aldı. Bu, makaledeki en net tek model kanıtıdır. Gemini 3 Pro Preview üzerindeki önceki yerel model çalıştırmasında Opencode şartnamenin ayrı endpoint'lerini oluşturdu ve burada %93,3 puan aldı. Aynı CLI, Sonnet 4.6 üzerinde birleşik endpoint'i seçti ve %60'a düştü. Araç değişmedi; model değişti.
Backend Davranışı
Kimlik doğrulama, bilet CRUD, yanıtlar ve veri izolasyonu geçti. Altı başarısızlık, birleşik bir güncelleme endpoint'i üzerinden yönlendirilen atama ve durum geçişi adımlarıydı. Üç yeniden çalıştırmanın tamamında istikrarlı.
UI Davranışı
Frontend sekiz doğrulama adımının tamamını geçti. %100 UI.
Grok Build
Kurulum
macOS/Linux için:
- curl -fsSL https://x.ai/cli/install.sh | bash
Kimlik doğrulama
İlk başlatmada xAI hesabınızla oturum açın veya headless kullanım için bir API anahtarı ayarlayın:
- export XAI_API_KEY=”xai-…”
Görev Raporu
Grok, derleme benchmark'ında %75,4 backend ile genel olarak ikinci bitirdi. Görev 6'da 433 saniyede ana kümede %60 backend puanı aldı. Bu çalıştırmada Grok, OpenRouter aracılığıyla Sonnet 4.6'ya ulaştı.
Backend Davranışı
On altı adımdan dokuzu geçti: kimlik doğrulama, bilet CRUD, yanıtlar ve veri izolasyonu. Altı başarısızlık, /tickets/{id}/assign ve /tickets/{id}/status hedeflerine yönelik atama ve durum geçişi adımlarıydı. Grok her ikisini de birleşik bir güncelleme endpoint'i üzerinden yönlendirdi, bu yüzden bu çağrılar ve onlara bağımlı rol kontrolleri 404 döndürdü. Üç yeniden çalıştırmanın tamamında istikrarlı.
UI Davranışı
Frontend sekiz doğrulama adımının tamamını geçti. Giriş ve giriş sonrası durum doğru davrandı. %100 UI.
Forge
Kurulum
macOS/Linux/WSL için:
- curl -fsSL https://forgecode.dev/cli | sh
Kimlik doğrulama
Sağlayıcı kimlik bilgilerinizi şununla etkileşimli olarak yapılandırın:
- forge provider login
Ve sağlayıcınızı seçin.
Görev Raporu
Forge 844 saniyede %13,3 backend puanı aldı. Çıktı token sayısı 1,6k ile alandaki en düşüktür; bu da sığ bir uygulamaya işaret eder. Önceki çalıştırmada olduğu gibi, derleme bilet oluşturmada kırıldı ve kademeli olarak çöktü.
Backend Davranışı
İki adım geçti. Bilet oluşturma başarısız oldu, bu yüzden bilet listeleri, yanıtlar, atama, durum geçişleri ve rol kontrolleri de onunla birlikte başarısız oldu. Üç yeniden çalıştırmanın tamamında istikrarlı; aider ve gemini-cli ile aynı %13,3 profili.
UI Davranışı
Giriş adımı, claude-code, cline ve aider'da görülen aynı CORS kaynak uyuşmazlığında başarısız oldu. Beş adım geçti, biri başarısız oldu, ikisi engellendi. %75 UI.
Gemini CLI
Kurulum
Anında çalıştırın:
- npx @google/gemini-cli
Veya genel olarak kurun:
- npm install -g @google/gemini-cli
- brew install gemini-cli
Kimlik doğrulama
Seçenek 1 (Google OAuth): GOOGLE_CLOUD_PROJECT=”YOUR_PROJECT_ID” dışa aktarın, ardından gemini'yi başlatın.
Seçenek 2 (API anahtarı): GEMINI_API_KEY=”YOUR_API_KEY” dışa aktarın, ardından gemini'yi başlatın.
Seçenek 3 (Vertex AI): GOOGLE_API_KEY + GOOGLE_GENAI_USE_VERTEXAI=true dışa aktarın.
Görev Raporu
Gemini CLI, alandaki en yavaş iki ajandan biri olarak 926 saniyede %13,3 backend puanı aldı. Kimlik doğrulama çalıştı, ancak bilet oluşturma başarısız oldu ve kademeli olarak çöktü. Önceki çalıştırmada Node 18 ile Vite 7 uyumsuzluğunda tamamen başarısız olan frontend'i, bu sefer her adımı geçti.
Backend Davranışı
İki adım geçti. Bilet oluşturma başarısız oldu, bu yüzden tüm bağımlı adımlar başarısız oldu. Üç yeniden çalıştırmanın tamamında istikrarlı; aider ve forge ile aynı %13,3 profili.
UI Davranışı
Frontend sekiz doğrulama adımının tamamını geçti. Önceki çalıştırmadaki %0'dan %100 UI'ya yükseldi. Kimlik doğrulamalı bir çağrıda konsolda bir 401 göründü, ancak render edilen akışı engellemedi.
Cline
Kurulum
Genel olarak şununla kurun:
- npm install -g cline
Kimlik doğrulama
`cline auth` yazarak Cline hesabınızı seçebilir veya istediğiniz sağlayıcıyla devam edebilirsiniz.
Görev Raporu
Cline, ana kümede 648 saniyede %60 backend puanı aldı. Bu, sekiz hata sınırının derlemeyi erken sonlandırdığı ve boş bir frontend bıraktığı önceki çalıştırmaya göre büyük bir değişikliktir. Burada tam yığını tamamladı.
Backend Davranışı
Kimlik doğrulama, bilet CRUD, yanıtlar ve veri izolasyonu geçti. Altı başarısızlık, birleşik bir güncelleme endpoint'i üzerinden yönlendirilen atama ve durum geçişi adımlarıydı. Üç yeniden çalıştırmanın tamamında istikrarlı.
UI Davranışı
Giriş adımı, claude-code'da görülen aynı CORS kaynak uyuşmazlığında, bir localhost backend'ini çağıran bir 127.0.0.1 sayfasında başarısız oldu. Beş adım geçti, biri başarısız oldu, ikisi engellendi. %75 UI.
Goose
Kurulum
macOS/Linux/WSL için:
- curl -fsSL https://github.com/block/goose/releases/download/stable/download_cli.sh | bash
Görev Raporu
Goose, ana kümede 553 saniyede %60 backend puanı aldı, ancak oraya ulaşmak için 1,06M girdi token'ı tüketti. Önceki çalıştırmada frontend dizininin boş bırakıldığı duruma göre bir değişiklik olarak bu sefer tam yığını tamamladı.
Backend Davranışı
Kimlik doğrulama, bilet CRUD, yanıtlar ve veri izolasyonu geçti. Altı başarısızlık, birleşik bir güncelleme endpoint'i üzerinden yönlendirilen atama ve durum geçişi adımlarıydı. Üç yeniden çalıştırmanın tamamında istikrarlı.
UI Davranışı
Frontend sekiz doğrulama adımının tamamını geçti. Önceki çalıştırmadaki %0'dan %100 UI'ya yükseldi.
Yapay zeka kodlama araçları
Yapay zeka kodlama araçları üç kategoriye ayrılabilir:
- Agentic CLI: Terminal tabanlı geliştirme iş akışları için araçlar; prompt'lar ve komut satırı etkileşimleri aracılığıyla kod üretir, düzenler ve yeniden düzenler.
- Örnekler: Aider, Junie, Opencode, Claude Code, Codex
- Yapay zeka kod editörleri: Agentic IDE'ler olarak da bilinir; bu araçlar VS Code'a benzer bir GUI sağlar (çoğu VS Code üzerine inşa edilmiştir).
- Örnekler: Antigravity, Cursor, Kiro Code, Windsurf
- Prompt'tan uygulamaya oluşturucular: Doğal dil prompt'ları ve görsel iş akışları kullanarak uygulama oluşturmak için düşük kodlu/kod'suz platformlar.
- Örnekler: Bolt, Lovable, v0.dev, Firebase Studio, Dazl
Yapay zeka kod inceleme araçları
Yapay zeka tarafından üretilen kod daha yaygın hale geldikçe, kod inceleme araçları hataları ve güvenlik açıklarını yakalamak için gereklidir. RevEval benchmark'ımızda en iyi araçları 309 PR üzerinde değerlendirdik.
Agentic CLI araçları ne yapabilir?
Codex, Junie, Kiro ve Claude Code gibi araçlarda ortak yetenekler şunlardır:
- Uçtan uca kod çalışması: Dosyaları oluşturun ve değiştirin, hataları düzeltin, kodu yeniden düzenleyin ve doğrudan terminalden testler veya linter'lar çalıştırın.
- Agentic iş akışları: Görev zincirleme, sorun giderme, arama ve yinelemeli hata ayıklama gibi çok adımlı görevleri gerçekleştirin.
- Git ve proje yönetimi: Geçmişi inceleyin, birleştirmeleri çözün, dalları yönetin ve commit'ler veya pull request'ler oluşturun.
- Command yürütme ve otomasyon: Kabuk komutları çalıştırın, analizleri otomatikleştirin ve doğal dili karmaşık CLI işlemlerine çevirin.
- Derin bağlam işleme: Bağımlılıklar ve proje yapısı farkındalığıyla tam depolarda çalışın.
- Model esnekliği: Birden çok bulut modelini ve bazı durumlarda yerel modelleri destekleyin; bazı araçlar kendi API anahtarınızı kullanmanıza veya planlar arasında seçim yapmanıza izin verir.
- Korumalı alan veya kontrollü erişim: Salt okunurdan tam otomasyona kadar değişen modlar sunar; genellikle güvenlik için yalıtılmış ortamlarla.
Metodoloji
A-CODE-CLI Benchmark
Ajanları, insan müdahalesi olmadan otonom yeteneği ölçmek için tek seferlik yürütme kurulumu altında değerlendirdik. Ajanlar daha sonra altyapı hazırlığını ve davranışsal doğruluğu ölçmek için backend ve frontend duman testleri kullanılarak değerlendirildi.
Model yapılandırması. 11 ajanın tamamı Claude Sonnet 4.6 (muhakeme dışı) üzerinde çalıştı. İki ajan bu modele ulaşmak için bir proxy gerektirdi:
- Codex (OpenAI CLI), Anthropic modellerine yerel olarak işaret edemez. OpenRouter/Anthropic'e bir LiteLLM ağ geçidi üzerinden yönlendirildi; bir önbellek şimi prompt önbelleğe almayı geri yükler. Proxy, muhakeme token'larını sıyırır (yetenek maliyeti) ve gecikme ekler.
- Gemini CLI, Anthropic modellerini yerel olarak çağıramaz. Bir SSE şimi ve LiteLLM ağ geçidi üzerinden yönlendirildi. Yardımcı model çağrıları (döngü algılama, hatalı araç onarımı, bağlam sıkıştırma) proxy üzerinden başarısız olur veya geçersiz içerik döndürür, bu yüzden kendi güvenlik ağları olmadan çalıştı.
Forge, yanıtlardan genişletilmiş düşünme bloklarını sıyırmak için ayrı bir proxy gerektirdi; Forge bunları zorla etkinleştirir ve bunlar geri yankılandığında 400 hatalarına neden olur. Diğer tüm ajanlar, yerel sağlayıcı yapılandırmaları veya OpenRouter aracılığıyla doğrudan Sonnet 4.6 kullandı.
Proxy yalnızca codex ve gemini-cli'ı dezavantajlı hale getirebilir; onları asla şişiremez. Puanları muhafazakârdır.
Junie, Sonnet 4.6 birincil modelinin yanında geçersiz kılınamayan bir GPT-4.1-mini yardımcıyı birlikte çalıştırır. Derleme sırasında ikinci bir modeli etkin olan tek ajandır. Puanları çok modelli bir yıldız işareti taşır.
Claude Code, kullanıcı aboneliği (OAuth) üzerinden çalıştı. Kiro, Kiro barındırmalı krediler üzerinde çalıştı (Bedrock destekli, 1,3x çarpan).
Hiçbir ajanın sıcaklık, yeniden deneme veya muhakeme parametreleri ayarlanmadı. Her biri varsayılan yapılandırmasında çalıştı.
Puanlama. Backend: işlevsel duman (adaptive_avg_step_pass_rate). Frontend: Playwright aracılığıyla UI dumanı. Birleşik: 0,7 × backend + 0,3 × frontend (tam UI verisine sahip ajanlar için). Backend puanı birincil sıralama eksenidir. Frontend performansı alan genelinde doygunluğa ulaşır.
Aider t-3 ve t-4. Her iki görev de başlangıçta çöken backend'ler üretti. İki taze derleme boyunca doğrulandı (aynı hatalar: t-3'te class Card üzerinde TypeError, t-4'te User.auctions üzerinde AmbiguousForeignKeysError). Bir backend_never_ready bayrağıyla 0 puan aldı, hariç tutulmadı.
Değerlendirme metodolojisi için ziyaret edin: Yapay zeka kodlama benchmark metodolojisi
CLI sürümleri (Haziran 2026 benchmark çalıştırması)
Benchmark VPS kutularından okunan sürümler. Derleme çalıştırması 5-8 Haziran 2026'da yürütüldü.
- Claude Code: 2.1.165
- Cline: 3.0.27
- Codex: 0.140.0
- Aider: 0.86.2
- Gemini CLI: 0.26.0
- Forge: 2.13.11
- Goose: 1.37.0
- Grok: 0.2.54
- Junie: 26.06.01 (derleme 1831.35)
- Kiro CLI: 2.6.1
- Opencode: 1.17.7
Web araştırması temellendirme metodolojisi
İki sonda: bir Unity geçiş denetimi (sonda 2) ve bir Next.js/React sürüm denetimi (sonda 3). Her biri ajandan belirtilen framework özellikleri için sürüm, durum ve zaman çizelgesini raporlamasını ve her iddia için bir resmi URL'ye atıf yapmasını istedi.
Derecelendirme iki paralel yöntem kullandı. Temel gerçek kapısı: bir iddia, yalnızca atıf yapılan URL ajanın gerçek getirme günlüğünde görünüyorsa VE getirilen sayfa doğrulanmış bir cevap anahtarına göre ölçülen gerçeği içeriyorsa puan alır. Davranışsal sınıflandırma: bir LLM yargıcı her ajanın tam transkriptini okudu ve onu dört davranışsal kategoriden birine atadı. Davranışsal sınıflandırma birincil çıktıdır; puanlanmış doğruluk tabloları, cevap anahtarı insan çapa incelemesini tamamladıktan sonra yayınlanacaktır.
Yerleşik aramaya sahip ajanlar (Codex, Gemini, Grok), görev yerleşik arama yeteneklerini gerektirdiğinden yerel modellerinde çalıştı. Kalan sekizi Claude Sonnet 4.6 üzerinde çalıştı. N=1.
Bağlam sıkıştırma metodolojisi
Ajanlar, 13 uydurulmuş altyapı gerçeği içeren yaklaşık 112.000 token dolgu belgesi aldı. Ajan belgeleri okuyup bağlamını sıkıştırdıktan sonra, soru sormadan önce kaynak dosyaları sildik. Puanlama: 13 uydurulmuş değere karşı birebir eşleşme, gerçek başına bir regex içeren bir derecelendirme skriptiyle otomatikleştirildi. N=3.
Dosyalar mevcutken 13/13 ve dosyalar silindiğinde 0/13 puan alan ajanlar yeniden okuyucular olarak sınıflandırılır. Dosyalar silindiğinde 13/13 puan alan ajanlar gerçek koruyucular olarak sınıflandırılır. Dosya silme, yeniden okumayı ekarte eder; uydurulmuş gerçekler, eğitim verisi hatırlamasını ekarte eder.
Codex (GPT-5.5) ve Gemini (Gemini 2.5 Pro) hariç tüm ajanlar Sonnet 4.6 üzerinde çalıştı. Ajan başına kullanılan model, sonuç tablosunda listelenmiştir.
Daha fazlasını okuyun
Agentic geliştirici araçlarının daha geniş ekosistemini keşfedenler için en son benchmark'larımız:
- MCP benchmark'ı: Web erişimi için en iyi MCP sunucularının karşılaştırması.
- Uzak tarayıcılar: Gelişmekte olan tarayıcı altyapısının yapay zeka ajanlarının web ile güvenli şekilde etkileşime girmesini nasıl sağladığı.
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{kalelioglu2026,
author = {Kalelioğlu, Berk and Dilmegani, Cem},
title = {{A-CODE-CLI Bench: Agentic CLI Benchmark}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/agentic-cli}},
note = {AIMultiple. Erişim tarihi: 29 Haziran 2026}
}139 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, 4 CSV dosyası ve bir README içeren ZIP dosyası olarak indirin.
Değişiklik günlüğü
21 güncelleme- 2026
Eklendi, giriş bölümüne tüm ajanların aynı model üzerinde çalıştığını açıklayan bir cümle.
Metodoloji bölümü güncellendi, kullanılan model yapılandırması, puanlama ve CLI sürümleri hakkında daha ayrıntılı bir açıklama sunularak okuyuculara deneysel kurulum hakkında daha net bir anlayış sağlandı.
Girişteki kıyaslama metodolojisi genişletildi, test titizliğine dair daha net bir anlayış sunuldu.
Ayrıntılı metodoloji kaldırıldı, makalenin uzunluğu azaltıldı.
Başlıkların biçimlendirmesi, okunabilirliği ve tutarlılığı artırmak için güncellendi.
Girişte karşılaştırmanın kapsamı azaltıldı, okuyuculara değerlendirmenin genişliği hakkında daha doğru bir anlayış sunuldu.
Metodoloji bölümü genişletildi, ajanlar için değerlendirme kurulumu, model konfigürasyonları ve puanlama mekanizmalarının ayrıntılı bir açıklaması sunuldu.
Giriş, 'Proje havuzu ve model yapılandırmaları' bölümü, 'Fonksiyonel kontrol listeleri (tarayıcı tarafı denetimi)' bölümü, 'Örnek karşılaştırma görevi: Çevrimiçi eğitim platformu panosu' bölümü, 'Proje kapsamı ve teknoloji yığını' bölümü, 'Ayrıntılı karşılaştırma sonuçları: Kiro ve Gemini CLI Kiro performansı (%95 başarı)' bölümü, 'Yukarıda görüldüğü gibi, Kiro profesyonel düzeyde bir kullanıcı arayüzü sundu: işlevsel bir arama çubuğu, kapsamlı bir kenar çubuğu, etkileşimli ilerleme kartları ve
Okuyucular için yetenekleri ve faydaları hakkında daha ayrıntılı bir açıklama sunarak 'CLI tabanlı kodlama aracıları nelerdir?' bölümü genişletildi.
Giriş güncellendi, karşılaştırmanın kapsamı ve metodolojisi hakkında daha net bir genel bakış sunuldu.
Metodoloji bölümüne, daha adil bir karşılaştırma için CLI araçlarının nasıl yönlendirildiğini açıklayan bir cümle eklendi.
- 2025
Metodoloji bölümü genişletildi, 'EduSphere' projesinin detaylı bir vaka çalışması sunularak okuyuculara karşılaştırmanın uygulaması ve sonuçları hakkında daha derin bir anlayış sağlandı.
Eklendi, Makaleye sonuçlar, okuyuculara araç performansı analizi ve kullanılan metodolojiyi sunarak.
Giriş, "Kod düzenleme iş akışınızı kolaylaştırmak ve geliştirmek için önde gelen ajans CLI araçlarını keşfedin" bölümü güncellendi, ajans CLI araçlarının tanımını ve kapsamını netleştirmek için.
Claude Code'un performans ve bağlam işleme açıklamasını basitleştirerek 'Çıktı ve bağlam işleme' bölümünden ayrıntılar kaldırıldı.
Claude Code ve Cline CLI, ürün açıklamalarında, bilgi akışını iyileştirmek için taşındı.
Okuyuculara dört yeni araç hakkında bilgi sağlayarak 'CLI Tabanlı Kodlama Aracıları' bölümüne Gemini CLI, OpenHands, Cline CLI ve Codex CLI eklendi.
Claude Code'un ideal kullanım alanları hakkındaki bilgiyi azaltan 'En iyi kullanım durumları' bölümü kaldırıldı.
Giriş, makalenin önde gelen ajans CLI araçlarına odaklanmasını daha iyi yansıtacak şekilde güncellendi.
Giriş güncellendi, okuyuculara büyük dil modellerinin güncel örnekleri sunuldu.
AI kodlama araçları bölümündeki 'CLI tabanlı kodlama aracıları' açıklamasını güncelleyerek işlevleri hakkında daha net bir anlayış sağlandı.




Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.