Hizmetler
Bize Ulaşın

Bilgisayar Kullanım Ajanları: Kıyaslama & Mimari

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Güncellenme tarihi: 22 Haz 2026

Bilgisayar kullanım ajanları gerçek masaüstlerinde ve web uygulamalarında çalışır. Tasarımları, sınırları ve ödünleri genellikle belirsizdir. Önde gelen sistemlerin nasıl çalıştığını, nasıl öğrendiklerini ve mimarilerinin nasıl farklılaştığını inceliyoruz. Ayrıca, 100 masaüstü ekran görüntüsü üzerinde, 4 görev türü ve her örnek için 5 çalıştırma ile odaklanmış bir UI temellendirme kıyaslamasına atıfta bulunuyoruz. Bu kıyaslama, görsel algı kalitesini izole eder ve güçlü görü-dil modellerinin bileşik ajanlar için bile neden önemli olduğunu gösterir.

UI temellendirme kıyaslaması sonuçları

Loading Chart

Kıyaslama metodolojisi detayları için kıyaslama detayları bölümünü okuyun.

  • Qwen3-VL modelleri, düşük hata (≈7–9 piksel) ile ~%90 doğruluk elde eder.
  • UI-özel modeller gibi UI-TARS, özellikle duruma bağlı ve yoğun arayüzlerde daha düşük performans (~%38 doğruluk) gösterir ve yüksek varyans ve büyük hatalar sergiler.
  • Duruma bağlı ve yoğun UI'lar çoğu model için en zor durumlardır.

En iyi bilgisayar kullanım ajanları

Tablodaki özellikler için özellikler bölümüne ve bilgisayar kullanım ajanlarının mimarisiyle ilgili detaylar için mimari yaklaşımlar bölümüne bakın.

OpenAI Computer Use Preview

OpenAI'nin bilgisayar kullanım önizlemesi, Responses API'si aracılığıyla bilgisayar görevlerini anlamak ve yürütmek için oluşturulmuş özel bir modeldir. Metin girişi ve çıkışına odaklanır, isteğe bağlı görüntü girişini destekler, ancak ses veya video desteklemez.

Anthropic Claude Computer Use

Claude Computer Use, Claude'ın bir kişi gibi masaüstü veya pencereli bilgisayar ortamıyla etkileşime girmesini sağlayan bir beta özelliğidir. Ekranı görerek, fareyi hareket ettirerek ve klavyede yazarak çalışır.

Claude, bir geliştiricinin kurulumu olmadan kendi başına hareket edemez. Gerçek bilgisayarınıza otomatik olarak erişmez; sağladığınız alanla etkileşime girer.

Open Interpreter (OS Mode)

Open Interpreter, açık kaynaklı bir terminal ajanıdır. Kod çalıştırır ve işletim sistemiyle etkileşime girer. Open Interpreter yerel makinede çalışır, bu nedenle yerel dosyalara, programlara ve tarayıcıya doğrudan erişir. Kullanıcı düz dilde talimatlar verir ve ajan bunları koda dönüştürür. Herhangi bir kod çalıştırılmadan önce, Open Interpreter planlanan komutu gösterir ve onay bekler.

Simular Agent S/S3

Simular Agent S3, ekranları gözlemleyerek, eylemleri planlayarak ve karmaşık görevleri tamamlamak için fare ve klavyeyi kontrol ederek çalışan bir bilgisayar kullanım ajanıdır. Otonom GUI etkileşimi için açık Agent S framework'ünün bir parçasıdır.

Davranış Best-of-N (bBoN), Agent S3'ün tek bir çalıştırma yerine birden çok olası eylem dizisi ("rollouts") oluşturmasını sağlayan temel bir yöntemdir. Her bir rollout'u, ne olduğunu özetleyen basit bir davranış anlatısına dönüştürür. Ardından ayrı bir değerlendirme adımı en iyi çalıştırmayı seçer.

Cua YZ

Cua YZ, görü modellerini, akıl yürütme modellerini ve alanlanmış işletim sistemi ortamlarını tek bir sisteme bağlayarak masaüstü ortamlarında bilgisayar kullanımı yapay zeka ajanları oluşturmayı, çalıştırmayı ve test etmeyi sağlayan açık kaynaklı bir framework'tür. Cua, uzak alanları kullanarak ajanları bulutta çalıştırabilir. Ayrıca daha fazla kontrol veya gizlilik isterseniz bunları yerel olarak çalıştırmanıza da olanak tanır.

Cua ayrıca UI ekran görüntüleri ve ajan eylem günlükleri oluşturmanıza yardımcı olur. Çok adımlı etkileşimleri kaydedebilir, eğitim verisi oluşturabilir ve ajanların ne kadar iyi performans gösterdiğini görmek için kıyaslamalar çalıştırabilirsiniz.

Claude Cowork

Claude Cowork, Claude Code'un ajan tabanlı tasarımını kod yazmayan kişilere getirir. Claude masaüstü uygulamasında, Sohbet ve Kodun yanındaki bir sekmede çalışır. Kullanıcı onu bir klasöre yönlendirir ve Claude bir görevi tamamlamak için oradaki dosyaları okur, düzenler ve oluşturur.

Cowork net bir sırayı takip eder: önce bağlayıcı, ikinci tarayıcı, son ekran. Slack veya Google Drive gibi bir MCP bağlayıcısı varsa ona uzanır. API'si olmayan web sayfaları için Chrome'daki Claude'a geri döner. Başka bir yol işe yaramadığında ekranı doğrudan kontrol eder. Ekran kontrolü bir araştırma önizlemesidir ve her uygulamadan önce izin ister.

Cowork, bir görevi paralel çalışan alt ajanlara bölebilir ve ardından sonuçları birleştirebilir. Ayrıca, bir klasöre kaydedilen haftalık durum taslağı gibi zamanlanmış görevleri belirli bir aralıkta çalıştırabilir.

Kapsam ve sınırlamalar:

  • Ocak 2026'daki bir araştırma önizlemesinin ardından ücretli planlarda macOS ve Windows'ta kullanılabilir.
  • Varsayılan model Sonnet 4.6'dır. Daha zor görevler için Opus seçilebilir kalır.
  • Oturumlar yerel makinede kalır. Cowork'ta sohbet paylaşımı, yapı paylaşımı ve Bellek çalışmaz.
  • iOS ve Android'de tek bir kalıcı iş parçacığı, masaüstüne iş atayabilir; masaüstünün uyanık kalması gerekir.

OSWorld kıyaslaması

Bilgisayar kullanım ajanı yapay zekası için sonuçlar

Feragatname: Aynı model farklı sıralarda görünebilir çünkü OSWorld sonuçları tam değerlendirme konfigürasyonuna (ajan framework, temellendirme veya planlama modeli, Best-of-N ayarı, çalıştırma sayısı ve adım sınırı) göre listeler ve bu ayarlardaki küçük değişiklikler bile farklı performans sonuçlarıyla ayrı girişler olarak ele alınır.

Metodoloji

Kıyaslama, 369 gerçek dünya görevini (veya manuel kurulum gerektiren Google Drive görevleri hariç 361 görevi) içerir. Görevler web ve masaüstü uygulamalarını, işletim sistemi dosya işlemlerini ve çoklu uygulama iş akışlarını kapsar. Her görev tekrarlanabilir bir başlangıç durumundan başlar ve özel bir yürütme tabanlı değerlendirme betiği ile eşleştirilmiştir, böylece güvenilir puanlama sağlanır.

Değerlendirme süreci

Ajanlar canlı bir işletim sistemi ortamıyla etkileşime girer. Başarı, ajanın gerçekte ne yaptığı ile ölçülür, metin çıktılarıyla değil. Ortamlar paralel ve başsız yürütmeyi destekleyerek ölçeklenebilir testlere olanak tanır.

Kıyaslama kapsamı

OSWorld, rastgele uygulamalar arasında açık uçlu görevleri, çok modlu girdileri, çapraz uygulama iş akışlarını ve ara başlangıç durumlarını destekler. Önceki kıyaslamalara kıyasla daha geniş kapsam ve daha gerçekçi koşullar sunar.

Temel çizgiler ve analiz

Kıyaslama, genel modelleri, özel modelleri ve ajansal framework'leri LLM ve VLM aileleri arasında değerlendirir. Sonuçlar, insan performansı (~%72) ile mevcut ajanlar arasında, GUI temellendirme ve işletim bilgisindeki zorlukları vurgulayan büyük bir fark olduğunu gösterir. OSWorld ayrıca görev türleri, UI karmaşıklığı, girdiler ve işletim sistemleri arasında ayrıntılı analiz sağlar.

Bilgisayar kullanım modellerine iki mimari yaklaşım

Bugün, çoğu bilgisayar kullanım ajanı iki tasarım deseninden birine girer:

  • Uçtan Uca (E2E) Ajanlar
  • Bileşik Ajanlar

Her ikisi de bilgisayarda görevleri tamamlamayı hedefler. Algı, akıl yürütme ve eylemi bölme şekillerinde farklılaşırlar.

Uçtan Uca (E2E) ajanlar

Uçtan uca ajanlar, tüm döngüyü yönetmek için tek bir görü-dil modeli kullanır. Model bir ekran görüntüsü ve bir görev tanımı alır. Ardından doğrudan bir sonraki eylemi verir.

Görme, akıl yürütme ve eylem arasında net bir sınır yoktur. Bu süreçler aynı model içinde birlikte öğrenilir.

E2E ajanları nasıl çalışır?

Ekran Görüntüsü + Görev → Birleşik Temsil → Eylem

Model doğrudan pikseller ve metin üzerinde akıl yürütür. Açık bir düğme veya alan listesi oluşturmaz. Bunun yerine, eğitim sırasında görsel desenler ve eylemler arasındaki ilişkileri öğrenir.

Güçlü yönler

  • Daha basit sistem tasarımı
  • Hata olabilecek daha az entegrasyon noktası
  • Uzun görevlerde genellikle daha kararlı

Sınırlamalar

  • Bir eylemin neden seçildiğine dair sınırlı görünürlük
  • Bir şeyler ters gittiğinde hata ayıklamak daha zor
  • Ara akıl yürütme adımları üzerinde daha az kontrol

Pratik çıkarımlar

Algı ve planlama sıkı sıkıya bağlı olduğu için, küçük görsel hataların tam başarısızlığa dönüşme olasılığı daha düşüktür. Bir eylem işe yaramadığında, ajan güncellenmiş ekranı yeniden değerlendirebilir ve uyum sağlayabilir.

Ödün: Ara kararları incelemek veya başarısızlık kaynağını izole etmek zordur.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Bileşik ajanlar

Bileşik ajanlar, etkileşim döngüsünü ayrı aşamalara böler. Her aşama farklı bir model veya alt sistem tarafından yönetilir.

Bileşik yapay zeka ajanları nasıl çalışır?

Tipik bir işlem hattı şuna benzer:

  1. Temellendirme: Ekran görüntüsünden grafiksel kullanıcı arayüzü öğelerini tespit et
  2. Planlama: Sonra yapılacak olana karar ver
  3. Yürütme: Sistem üzerinde görevleri gerçekleştir

Bu tasarım her adımı açık hale getirir.

Güçlü yönler

  • Sorumlulukların net ayrımı
  • Ara çıktıları incelemek daha kolay
  • Araştırma ve kontrollü deneyler için daha uygun

Sınırlamalar

  • Daha yüksek sistem karmaşıklığı
  • Hatalar bileşenler arasında yayılabilir
  • Genellikle gerçek masaüstü ortamlarında daha az güvenilir

Pratik çıkarımlar

Bileşik ajanlar, tespit edilen düğmeler veya metin alanları gibi ekranın yapılandırılmış temsillerine dayanır. Bu, şeffaflığı artırır ancak kırılganlık ekler. Temellendirme yanlışsa, planlama kararları büyük olasılıkla başarısız olur.

Ödün: Uzun görevler özellikle zordur. Algılanan ve gerçek ekran durumu arasındaki küçük uyumsuzluklar birikebilir.

Bilgisayar kullanan ajanların (CUA'lar) temel yapı taşları

Modern bilgisayar kullanım ajanları üç ana bileşen kullanılarak oluşturulur:

1. Görü-dil modelleri (VLM'ler)

Tek VLM'ler çoğu uçtan uca ajanın çekirdeğini oluşturur. Ekran görüntülerini ve talimatları birlikte işler ve doğrudan eylemler çıktılar.

Ekran Görüntüsü + Görev → Ortak Görü-Dil Uzayı → Eylem

Model, görsel ve metinsel girdileri paylaşılan bir iç uzayda kodlar. Bu uzayda, açık etiketler olmadan görsel desenlerin eylemlerle nasıl ilişkili olduğunu öğrenir.

Ayrı bir temellendirme adımı yoktur. UI anlayışı ve görev planlaması dolaylı ve aynı anda gerçekleşir.

Pratik çıkarımlar: Tek VLM'ler mimari karmaşıklığı azaltır ve hataların yayılmasını sınırlar. Şeffaflık ve ince ayarlı kontrol yerine sağlamlık ve basitliği tercih ederler.

2. Temellendirme modelleri

Temellendirme modelleri yalnızca algıya odaklanır ve bileşik ajanlarda önemli bir rol oynar. İşleri, ham ekran görüntülerini bilgisayar arayüzünün yapılandırılmış tanımlarına dönüştürmektir. Hedefler hakkında akıl yürütmez veya eylem seçmezler.

Ekran Görüntüsü → Temellendirme Modeli → Yapılandırılmış UI Temsili

Çıktılar genellikle şunları içerir:

  • Tespit edilen UI öğeleri
  • Uzamsal konumlar (sınırlayıcı kutular)
  • Anlamsal etiketler (düğme, giriş alanı, metin)
  • Çıkarılan metin

Bu temsil bir planlama modeline iletilir.

Güçlü yönler

  • Net ve incelenebilir algı
  • Hataları günlüğe kaydetmek ve analiz etmek daha kolay
  • Geliştirilmiş şeffaflık

Sınırlamalar

  • Hatalar alt akışa yayılır
  • Görsel değişikliklere ve dinamik düzenlere duyarlı
  • Birçok adım boyunca tutarlılığı korumak zor

Pratik çıkarımlar: Temellendirme, bileşik sistemlerde genellikle en zayıf halkadır. Eksik veya güncel olmayan öğeler planlama modellerini yanıltabilir ve tekrarlanan başarısızlıklara neden olabilir.

UI Temellendirme kıyaslaması: Görü kalitesi neden önemlidir?

Görsel algının rolünü izole etmek için, modellerin bir UI öğesinin tam piksel konumunu doğal dil talimatından ne kadar iyi belirlediğini değerlendiren odaklanmış bir UI temellendirme kıyaslamasına atıfta bulunuyoruz.

Kıyaslama kurulumu

  • 100 masaüstü ekran görüntüsü
  • 4 görev türü: basit, ilişkisel, duruma bağlı, yoğun UI
  • Tutarlılığı ölçmek için her örnek için 5 çalıştırma
  • Sabit çözünürlük: 2560×1440

Daha ayrıntılı veri kümesi ve metodoloji için HuggingFace'te AIMultiple UI Temellendirme sayfasını ziyaret edin.

Çıkarım
Doğru UI temellendirme büyük bir darboğaz olmaya devam ediyor. Mevcut kanıtlar, özellikle gerçek masaüstlerinde çalışan güvenilir bilgisayar kullanım ajanları için dar UI uzmanlaşmasından ziyade sağlam görsel algı ve örtük UI anlayışının daha önemli olduğunu göstermektedir.

Planlama modelleri

Planlama modelleri sonraki adımları belirler. Yapılandırılmış UI verileri, görev hedefleri ve etkileşim geçmişi ile çalışırlar. Ham görüntüleri işlemezler. Bu modeller, bileşik ajan mimarisinde önemli bir rol oynar.

Yapılandırılmış UI + Görev Hedefi → Planlama Modeli → Sonraki Eylem

Planlama modelleri şunları yapabilir:

  • Görevleri adımlara bölmek
  • İlerlemeyi takip etmek
  • Kurallar veya sezgiler uygulamak
  • Akıl yürütmeyi açıkça günlüğe kaydetmek

Uygulamadaki zorluklar

  • Girdi hatalarına karşı yüksek hassasiyet
    Yanlış temellendirme hatalı planlara yol açar.
  • Zamanla durum kayması
    UI değişiklikleri daha önceki varsayımları geçersiz kılabilir.
  • Sınırlı başarısızlık kurtarma
    Güçlü geri bildirim olmadan, planlayıcılar döngüye girebilir veya durabilir.
  • Yürütme uyumsuzlukları
    Zamanlama, odak veya koordinasyon hataları planları bozabilir.

Pratik çıkarımlar: Planlama modelleri yapı ve şeffaflık ekler, ancak etkinlikleri büyük ölçüde doğru algıya ve güvenilir yürütmeye bağlıdır.

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Ana bilgisayar kullanım ajanı özelliklerinin açıklaması

Çalışma zamanı ortamı

Bilgisayar kullanım ajanının nerede çalıştığını ve işletim sistemini nasıl kontrol ettiğini tanımlar (bulut VM, yerel makine veya konteyner tabanlı çalışma zamanı).

Yerel sistem erişimi

Bu, ajanın uzak bir alanda değil, kullanıcının gerçek makinesindeki dosyaları okuyup yazamayacağını gösterir. Yerel erişim kişisel iş akışları için kullanışlıdır ancak daha yüksek güvenlik endişeleri doğurur.

Ajanlar bilgisayara nasıl erişir: ekran vs terminal

Bilgisayar kullanımı artık ikinci bir çizgi boyunca ayrılıyor: ajanın sisteme nasıl eriştiği.

Ekran temellendirme ajanları ekranı bir görüntü olarak okur. Düğmeleri ve alanları bulur, ardından belirli koordinatlara tıklar ve yazar. OpenAI Computer Use, Claude Computer Use, Simular Agent S3 ve UI-TARS bu şekilde çalışır. Güçlü yanı, ajanın bir kişinin görebildiği herhangi bir uygulamayı yönetebilmesi sayesinde geniş erişimdir. Zayıflığı temellendirmedir. Yanlış okunan bir öğe adımı bozar ve ekran değiştikçe uzun görevler kayar.

Terminal ve bağlayıcı ajanlar, daha temiz bir yol olduğunda ekranı atlar. Kabuk komutları çalıştırır, bağlayıcılar aracılığıyla API'leri çağırır ve dosyaları doğrudan düzenler. OpenClaw, Open Interpreter ve Claude Cowork burada yer alır. Cowork sırayı açıkça belirtir: önce bağlayıcı, ikinci tarayıcı, son ekran. Güç, bir komut veya bir API çağrısının piksel algılamaya bağlı olmaması nedeniyle güvenilirliktir. Zayıflık, API'si veya komut satırı olmayan bir uygulamanın hala ekran kontrolüne ihtiyaç duyması nedeniyle kapsamdır.

Birçok sistem artık her ikisini de karıştırır. Hız ve doğruluk için bağlayıcıları ve komutları tercih ederler, ardından başka bir arayüz sunmayan uygulamalar için ekran temellendirmeye geri dönerler.

E2E ve bileşik ajanlar arasındaki genel ödün nedir?

Uçtan uca ajanlar şu anda kişisel bilgisayarlarda doğrudan kullanım için daha güvenilirdir. Birleşik tasarımları koordinasyon sorunlarını ve başarısızlık noktalarını azaltır.

Bileşik ajanlar doğası gereği daha zayıf değildir. Daha fazla esneklik, özelleştirme ve yorumlanabilirlik sunarlar. Ancak, gerçek ortamlarda iyi performans göstermek için daha güçlü temellendirme, daha sıkı durum yönetimi ve dikkatli entegrasyon gerektirirler.

Asıl ödün, yetenek değil, sağlamlık ile kontrol arasındadır.

Bilgisayar kullanım ajanları nedir?

Bilgisayar kullanım ajanları, bir bilgisayarı bir insan gibi çalıştırmak üzere tasarlanmış sistemlerdir. Ekrana bakarlar, ne yapacaklarına karar verirler ve tıklama, yazma ve kaydırma gibi eylemlerle etkileşime girerler.

İlk bakışta bu basit görünür. Uygulamada zordur. Masaüstü ortamları dinamiktir. Arayüzler sık sık değişir. Güvenilecek sabit API'ler veya kararlı yapılar yoktur. Bu ajanlar ekranda gördüklerinden çalışmak ve gerçek zamanlı olarak bunun hakkında akıl yürütmek zorundadır.

Farklı uygulamalara rağmen, çoğu bilgisayar kullanım ajanı aynı temel döngüyü takip eder:

Gözlemle → Yorumla → Karar Ver → Yürüt

Bu döngünün nasıl uygulandığı, bir ajanın gerçek kullanımda ne kadar kararlı, esnek ve güvenilir olduğunu belirler.

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Ezgi Arslan, PhD. and Berk Kalelioğlu (2026) - "Bilgisayar Kullanım Ajanları: Kıyaslama & Mimari". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 22 Haziran 2026, kaynak: https://aimultiple.com/computer-use-agents [Çevrimiçi Kaynak]

PhD., E. A., & Kalelioğlu, B. (2026, 22 Haziran). Bilgisayar Kullanım Ajanları: Kıyaslama & Mimari. AIMultiple. https://aimultiple.com/computer-use-agents

@misc{phd2026,
  author = {PhD., Ezgi Arslan, and Kalelioğlu, Berk},
  title  = {{Bilgisayar Kullanım Ajanları: Kıyaslama & Mimari}},
  year   = {2026},
  month  = jun,
  howpublished    = {\url{https://aimultiple.com/computer-use-agents}},
  note   = {AIMultiple. Erişim tarihi: 22 Haziran 2026}
}
Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Endüstri Analisti
Ezgi, finans alanında uzmanlaştığı İşletme alanında doktora yapmıştır ve AIMultiple'da Endüstri Analisti olarak görev yapmaktadır. Teknoloji ve iş dünyasının kesiştiği noktada araştırma ve içgörüler üretmekte olup; sürdürülebilirlik, anket ve duygu analizi, finansta AI agent uygulamaları, cevap motoru optimizasyonu, firewall yönetimi ve satın alma teknolojileri gibi alanlarda uzmanlığa sahiptir.
Tam Profili Görüntüle
Teknik olarak inceleyen
Berk Kalelioğlu
Berk Kalelioğlu
Yapay Zeka Araştırmacısı
Berk, AIMultiple'da yapay zeka araştırmacısıdır; etmen tabanlı yapay zeka sistemleri ve dil modellerine odaklanmaktadır.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450