Hizmetler
Bize Ulaşın

Mobil Yapay Zeka Ajanları 65 Gerçek Dünya Görevinde Test Edildi

Cem Dilmegani
Cem Dilmegani
Güncellenme tarihi: 9 Haz 2026

Dört mobil yapay zeka ajanını (DroidRun, Mobile-Agent, AutoDroid ve AppAgent), takvim yönetimi, kişi oluşturma, fotoğraf çekme, ses kaydı ve dosya işlemleri gibi uygulamalarla bir Android emülatörü kullanarak 65 gerçek dünya görevinde 3 gün boyunca benchmark ettik.

Gerçek dünya performans karşılaştırması, maliyetler ve yürütme süreleri dahil benchmark sonuçlarını inceleyin:

Mobil yapay zeka ajanları performans karşılaştırması

Loading Chart

DroidRun

En yüksek başarı oranı (%43), başarılı görev başına yüksek maliyetle ($0.075, ~3.225 token)

DroidRun, 65 görev genelinde %43 başarı oranıyla en güçlü performansı gösterdi. Yalnızca tüm ajanların başarıyla tamamladığı görev incelendiğinde, DroidRun görev başına ortalama 3.225 token tüketerek $0.075 maliyet oluşturdu.

Bu önemli kaynak tüketimi, DroidRun'ın ajanın ayrıntılı durum takibi yaptığı, açık eylem planları oluşturduğu ve her karar için açıklamalar sağladığı çok adımlı muhakeme mimarisini yansıtır. Pahalı olmakla birlikte, bu kapsamlı yaklaşım mobil yapay zeka ajanları benchmark'ında en yüksek başarı oranını sunar.

Mobile-Agent

Güçlü performans (%29) ve maliyet etkin ($0.025, ~1.130 token)

Mobile-Agent, makul maliyet etkinliğini korurken %29 ile en yüksek ikinci başarı oranına ulaştı. Tüm ajanlar arasında ortak başarılı görevlerde, Mobile-Agent görev başına ortalama $0.025 ve 1.130 token tüketti.

Bu, DroidRun'ın görev başına maliyetinin yaklaşık üçte birini temsil ederken başarı oranının yaklaşık üçte ikisine ulaşarak, Mobile-Agent'ı bütçe kısıtlamalarının önemli olduğu dağıtımlar için cazip bir seçenek haline getirir.

Ancak, başarı oranındaki 14 puanlık fark, DroidRun'ın ek muhakeme yeteneklerinin, sağlık hizmetleri veya bankacılık iş akışları gibi güvenilirliğin en önemli olduğu uygulamalar için anlamlı değer sağladığını göstermektedir.

AutoDroid

En iyi maliyet etkinliği (%14 başarı, $0.017, ~765 token) ancak sınırlı etkililik

AutoDroid, ortak başarılı görevlerde görev başına yalnızca $0.017 ve 765 token ile en düşük maliyeti göstererek benchmark'taki en ekonomik seçenek oldu.

Ancak, Mobile-Agent'ın performansının yarısından az ve DroidRun'ın yaklaşık üçte biri olan %14 başarı oranı, bu maliyet avantajının güvenilirlikte önemli ödünleşimlerle geldiğini gösterir.

DroidRun'a benzer eylem tabanlı bir yaklaşım kullanmasına rağmen, AutoDroid'in minimum muhakeme yükü önemli maliyet tasarrufu ancak sınırlı görev tamamlama yeteneğiyle sonuçlanır.

AppAgent

En düşük performans (%7 başarı) ve en yüksek maliyet ($0,90, ~2.346 token)

AppAgent, %7 ile en düşük başarı oranını ve ortak başarılı görevlerde görev başına $0,90 ve 2.346 token ile en yüksek maliyeti kaydetti; bu, DroidRun'dan on iki kat, AutoDroid'den ise elli kattan fazla daha pahalıdır.

Bu düşük maliyet-performans oranı, AppAgent'ın her etkileşim için etiketlenmiş ekran görüntülerini multimodal LLM'ler aracılığıyla işleyen görüntü tabanlı yaklaşımından kaynaklanır. Multimodal LLM'ye gönderilen her ekran görüntüsü, görüntü işleme için önemli miktarda girdi token'ı tüketirken, gerçek metin yanıtları (tamamlama token'ları) nispeten mütevazı kalır.

Bu, görüntü işleme yükünün, görev tamamlamada karşılık gelen iyileştirmeler olmadan maliyete hakim olduğu oldukça dengesiz bir token dağılımı yaratır; çünkü ajan, mobil arayüzlerde koordinat hesaplamaları ve UI öğesi tanımlama konusunda zorluk çeker.

Mobil yapay zeka ajanları yürütme süresi karşılaştırması

Tüm ajanların başarıyla tamamladığı tek görevde, AutoDroid 57 saniye ile en hızlısı oldu, onu 66 saniye ile Mobile-Agent yakından takip etti. DroidRun görevi 78 saniyede tamamlayarak, çok adımlı muhakeme mimarisinin daha yüksek token tüketimine rağmen hala verimli yürütme sağladığını gösterdi.

AppAgent, her etkileşim için multimodal LLM'ler aracılığıyla kapsamlı ekran görüntüsü işleme gerektiren görüntü tabanlı yaklaşımı nedeniyle 180 saniye ile önemli ölçüde daha yüksek gecikme sergiledi.

Benchmark metodolojimizi buradan inceleyebilirsiniz.

Mobil yapay zeka ajanlarına genel bakış

DroidRun

DroidRun, mobil uygulamaları ve telefonları otonom olarak kontrol edebilen mobil yerel yapay zeka ajanları oluşturan açık kaynaklı bir framework'tür. Kullanıcı arayüzlerini büyük dil modellerinin etkileşime girebileceği yapılandırılmış verilere dönüştüren, doğrudan mobil cihazlarda karmaşık otomasyonu mümkün kılan temel bir framework'tür.

Çalışırken görün:

AutoDroid

AutoDroid, herhangi bir Android uygulamasında manuel kurulum olmadan rastgele görevleri gerçekleştirmek üzere tasarlanmış bir mobil görev otomasyon sistemidir. GPT‑4 ve Vicuna gibi büyük dil modellerinin sağduyulu muhakemesinden, otomatik uygulamaya özel analizle birlikte yararlanır.

AutoDroid, uygulama arayüzlerini LLM'lerle bağlamak için işlevsellik farkındalıklı bir UI temsili sunar, modele uygulamaya özel davranışları öğretmek için keşif tabanlı bellek enjeksiyonu kullanır ve inference maliyetlerini azaltmak için sorgu optimizasyonu içerir. 158 görevlik bir benchmark'ta değerlendirildiğinde, %90,9 eylem doğruluğu ve %71,3 görev başarısı elde ederek yalnızca GPT‑4 temel çizgilerinden daha iyi performans gösterdi.1

Mobile-Agent

GitHub reposu X-PLUG/MobileAgent, görsel UI temsillerini algılayarak ve üzerinde muhakeme yaparak mobil uygulamaları otonom olarak kontrol etmek üzere tasarlanmış bir yapay zeka ajan framework'ü olan Mobile-Agent'ın resmi uygulamasıdır.

Bu proje, Tsinghua Üniversitesi'ndeki X-PLUG grubundan gelmektedir ve ICLR 2024'te sunulmuş olup, multimodal öğrenme, özellikle görsel algı ve talimat takibini kullanarak mobil ajanların sınırlarını zorlamayı amaçlamaktadır. Çalışırken görmek için videoyu izleyin.

AppAgent

GitHub deposu TencentQQGYLab/AppAgent, Tencent'in QQG Y-Lab'ından açık kaynaklı bir araştırma projesidir. Her bir uygulama için insan tarafından yazılmış kod olmadan Android uygulamalarını otonom olarak çalıştırmak ve üzerinde muhakeme yapmak üzere tasarlanmış bir mobil yapay zeka ajan framework'ü olan AppAgent'ı tanıtır.

Kaynak: AppAgent2

Tecno EllaClaw

Tecno, OpenClaw teknolojisini Ella yapay zeka asistanına entegre ederek bu kombinasyonu "EllaClaw" olarak markalaştırdı.3

EllaClaw, Tecno'nun Android tabanlı mobil işletim sistemi olan HIOS üzerinde çalışır ve iki başlangıç becerisiyle gelir: banka bildirimleri ve faturalar gibi önemli mesajları işaretleyen Akıllı SMS Özeti ve takvim etkinliklerini, hava durumunu ve haberleri günlük bir özette derleyen Günlük Program.

Sistem, kullanıcı tercihlerini öğrenmek için kalıcı bellek kullanır ve seçili Tecno cihazlarında beta olarak, Camon 50 Ultra amiral gemisinden başlayarak kullanıma sunulmaktadır.4

Samsung Galaxy S26

Galaxy S26 serisi, kullanıcıların üç yapay zeka asistanı arasında geçiş yapmasına olanak tanıyan bir multi-agent kurulumu sundu:5

  • Bixby, içerik görüntülerken ekran zaman aşımını önlemek için ayarları düzenleme gibi doğal dilde cihaz kontrolü için Perplexity'nin yardımını kullanacak şekilde yenilendi.
  • Google Gemini, kullanıcı diğer telefon aktivitelerine devam ederken yolculuk rezervasyonu veya yemek siparişi gibi arka plan görev yürütme için yeni bir beta yeteneğiyle.
  • Perplexity, Sonar API'si aracılığıyla sistem düzeyinde entegre edilmiş, Notlar, Takvim ve Galeri dahil yerel uygulamalarda kullanılabilir ve bir uyandırma ifadesi veya yan düğmeye basarak hands-ücretsiz şekilde çağrılabilir.

Perplexity başlangıçta "Hey, Plex" uyandırma ifadesiyle kullanıma sunuldu, ancak sonraki bir yazılım güncellemesi, Plex medya akış cihazıyla karışıklığı önlemek için bunu "Hey, Perplexity" olarak değiştirdi.6

Google Gemini Intelligence ve Android 17

Google, amiral gemisi yeteneği kullanıcı onayıyla çok adımlı, uygulamalar arası görev yürütme olan bir özellik paketi olan Gemini Intelligence'ı duyurdu.7

Gösterilen kullanım örnekleri arasında, bir YouTube yemek videosundan malzemeleri belirleyip otomatik olarak sipariş etmek, bir spin dersi rezervasyonu yapmak ve Gmail'den bir ders müfredatını alıp gerekli kitaplarla alışveriş sepetini doldurmak yer alır.

Bu ajan yetenekleri, ilk olarak Gemini uygulaması aracılığıyla Samsung Galaxy S26 serisi ile Google Pixel 10 ve Pixel 10 Pro'da kullanıma sunulacak, daha sonra saatlere, arabalara, gözlüklere ve dizüstü bilgisayarlara yaygınlaştırılması planlanmaktadır. Cihaz içi kısım, Gemini Nano modellerini çalıştırabilen donanım gerektirir; Google, temel olarak en az 12GB RAM ve nitelikli işlemciler belirtmektedir.8

Android lideri Sameer Samat, Android 17'yi platformun "bir işletim sisteminden akıllı bir sisteme" dönüştüğü dönüm noktası olarak tanımladı ve Android 17'nin "erken ajan yeteneklerinin daha geniş çapta kullanıma sunulmaya başladığı noktayı" işaretleyeceğini, başlangıçta sınırlı uygulama desteğiyle olacağını belirtti.9

AGI, Inc. ve Qualcomm

AGI, Inc., cihaz içi mobil ajanı AGI-0'ı Snapdragon destekli cihazlara getirmek için Qualcomm ile bir iş birliği duyurdu.10

AGI-0 yerel olarak çalışır, herhangi bir uygulamada uygulamaya özel entegrasyonlar gerektirmeden ekranı görmek ve eylemde bulunmak için görüntü-dil-eylem modellerini kullanır ve veri işlemeyi bulut API'leri üzerinden yönlendirmek yerine cihazda tutarak gizliliğe önem verir.

Mobil yapay zeka ajanlarının özellikleri

Hedef odaklı komut işleme

Kullanıcılar ne yapılmasını istediklerini belirtir ("Havaalanına bir yolculuk rezervasyonu yap") ve ajan hangi uygulamaları açacağına, hangi eylemleri gerçekleştireceğine ve hangi sırayla yapacağına karar verir. Kullanıcıdan hedefi bireysel dokunuşlara ve kaydırmalara çevirmesi istenmez.

LLM destekli muhakeme

Mobil yapay zeka ajanları, doğal dil taleplerinden kullanıcı niyetini belirlemek, ekrandaki içeriği yorumlamak, adım adım eylem planları oluşturmak ve yükleme ekranları, diyalog açılır pencereleri veya gezinme geçişleri gibi uygulama durumları arasında UI değiştiğinde uyum sağlamak için büyük dil modellerine güvenir.

Yapılandırılmış, yerel uygulama kontrolü

Mobil yapay zeka ajanları, ekrandan pikselleri kazımak yerine, düğmeleri, alanları ve diğer etkileşimli öğeleri tanımlayan yapılandırılmış UI hiyerarşilerini, genellikle XML tabanlı ağaçları çıkarır ve doğrudan bu öğeler üzerinde çalışır. Örneğin DroidRun, bir ekran görüntüsünden koordinatları tahmin etmek yerine gerçek UI öğelerini okumak ve bunlar üzerinde eylemde bulunmak için Android Erişilebilirlik API'lerini kullanır.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Mobil yapay zeka ajanları için bulut ve cihaz içi yürütme

Bulut tabanlı ajanlar, modellere API çağrıları aracılığıyla bağlanır. Karmaşık muhakemeyi iyi yönetirler, ancak ekran verilerinin ve kullanıcı bağlamının harici sunuculara iletilmesini gerektirir, bu da hassas uygulamalar için gizlilik endişeleri doğurur. Performans ayrıca istikrarlı ağ bağlantısına bağlıdır.

Cihaz içi ajanlar, modelleri doğrudan mobil donanım üzerinde çalıştırarak tüm verileri yerel tutar. Bu, iletim risklerini ortadan kaldırır ve çevrimdışı işlevsellik sağlar. Mevcut mobil NPU'lar ve GPU'lar, daha derin muhakeme veya daha uzun bağlam pencereleri gerektiren görevlerde doğruluğu azaltabilen model boyutunu kısıtlar.

Hibrit mimariler her iki yaklaşımı birleştirir. Hafif cihaz içi modeller rutin görevleri ve ilk niyet sınıflandırmasını yönetirken, karmaşık işlemler bulut LLM'lerine yönlendirilir. Apple Intelligence ve Gemini Nano bu modeli izler, basit talepleri yerel olarak işler ve gerektiğinde yükseltir.

Mobil yapay zeka ajanlarında güvenlik & gizlilik riskleri

Mobil yapay zeka ajanlarını kullanışlı kılan aynı yetenekler, yeni saldırı yüzeyleri de yaratır:

  • Ekran içeriğinin ifşası: Ajanlar, işleme için şifreleri, mesajları ve finansal verileri bulut LLM'lerine iletebilir.
  • Kimlik bilgisi sızıntısı: Otomatik oturum açma iş akışları, kayıtlı şifreleri ve kimlik doğrulama token'larını istemeden ifşa edebilir.
  • Belirsiz veri saklama: Birçok ajan sağlayıcısı, yakalanan ekran görüntülerinin, eylem günlüklerinin ve ekran kayıtlarının ne kadar süreyle saklandığını veya gelecekteki modelleri eğitmek için kullanılıp kullanılmadığını yayınlamaz.
  • Prompt enjeksiyon riski: Kötü amaçlı uygulama içeriği, "Önceki talimatları yoksay" yazan sahte bir düğme etiketi gibi hazırlanmış UI metni aracılığıyla ajan davranışını manipüle edebilir.

Azaltma önlemleri tüm yığını kapsar:

  • Cihaz içi işleme, hassas ekran verilerini tamamen harici sunuculardan uzak tutar ve model boyutunun izin verdiği yerlerde en güçlü kontrolü sağlar.
  • Kişisel olarak tanımlanabilir bilgi (PII) redaksiyonu, herhangi bir bulut API çağrısından önce adlar, telefon numaraları ve hesap kimlikleri gibi verileri otomatik olarak tespit eder ve kaldırır.
  • İzin sınırları, ajanın erişilebilirlik hizmeti kapsamını kısıtlar, böylece bankacılık, sağlık veya mesajlaşma gibi belirli uygulama kategorileri içinde okuyamaz veya eylemde bulunamaz.
  • Şeffaf sağlayıcı politikaları, genel gizlilik dili yerine yayınlanmış saklama süreleri, işleme yargı bölgeleri ve eğitim verisi kullanımı hakkında açık beyanlar anlamına gelir.
Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Mobil yapay zeka ajanları arasında performans neden farklılık gösterir

Gözlemlenen farklılıklar esas olarak mimari tercihlerden ve etkileşim yöntemlerinden kaynaklanır.

DroidRun, çok adımlı muhakeme, açık planlama ve durum takibi yoluyla güvenilirliğe öncelik verir. Bu, görev başarısını artırır ancak token kullanımını ve maliyeti yükseltir.

Mobile-Agent, performans ve verimliliği dengeler. Daha hafif muhakemesi ve görsel anlayışı, maliyeti düşürürken orta düzeyde başarı oranlarını korur, bu da onu bütçe duyarlı kullanım durumları için uygun hale getirir.

AutoDroid, minimum muhakeme yüküyle eylem tabanlı yürütmeye odaklanır. Bu, en düşük maliyet ve en hızlı yürütme süreleriyle sonuçlanır, ancak aynı zamanda karmaşık veya belirsiz görevleri ele alma yeteneğini de sınırlar.

AppAgent, multimodal LLM'ler kullanarak büyük ölçüde görüntü tabanlı etkileşime dayanır. Sık ekran görüntüsü işleme, gecikmeyi ve maliyeti artırırken, UI koordinat zorlukları görev başarısını azaltır.

Mobil yapay zeka ajanları benchmark metodolojisi

Android işletim sisteminde çalışan yapay zeka mobil ajanlarının gerçek dünya görevlerindeki performansını değerlendirmek için bir benchmark değerlendirmesi gerçekleştirdik. AndroidWorld framework'ünü kullandık ve tüm ajanları aynı standart görevlerde test ettik.

AndroidWorld Framework'ü

AndroidWorld, mobil ajanları değerlendirmek için Google Research tarafından özel olarak geliştirilmiş açık kaynaklı bir benchmark platformudur. Bu platform, standartlaştırılmış görevler aracılığıyla gerçek Android uygulamalarında çalışan ajanların performansını ölçmeyi amaçlar.

AndroidWorld'ün en önemli özelliği, yapay test ortamları yerine gerçek Android uygulamalarını kullanması ve ajanların performansını otomatik olarak değerlendirebilmesidir. Bu çalışmada 65 görev kullandık. Bu görevler, takvim yönetimi, kişi ekleme, ses kaydı, fotoğraf çekme ve dosya işlemleri gibi günlük mobil cihaz kullanım senaryolarını kapsar.

Ortam Kurulumu

Sistem yapılandırması: Benchmark ortamını kurmak için önce Windows 11 işletim sistemine Android Studio'yu kurduk ve Google'ın resmi Android Emülatörü'nü yapılandırdık.

Sanal cihaz kurulumu: Pixel 6 cihazını simüle eden bir sanal cihaz oluşturduk. Bu sanal cihazın özellikleri Android 13 (API Seviye 33) işletim sistemi, 1080×2400 çözünürlük, 8GB RAM ve 20GB depolama alanı olarak ayarlandı.

Emülatör yapılandırması: Emülatörü AndroidWorld ile entegre etmek için gRPC portunu 8554 olarak yapılandırdık, çünkü AndroidWorld emülatörle bu port üzerinden iletişim kurar.

Python ortam kurulumu: Python ortamını hazırlamak için Miniconda kullanarak Python 3.11 ile yeni bir conda ortamı oluşturduk. AndroidWorld deposunu GitHub'dan klonladıktan sonra, pip kullanarak tüm bağımlılıkları kurduk. AndroidWorld'ün en kritik adımlarından biri emülatör kurulum sürecidir.

Kurulum komutu yaklaşık 45-60 dakika sürdü. Bu süreçte AndroidWorld, test edilecek tüm Android uygulamalarını emülatöre otomatik olarak yükledi.

Başlangıç durumu verisi oluşturma: Her uygulama için başlangıç durumu verileri oluşturdu, örneğin takvim uygulamasına bazı etkinlikler ekledi, kişiler uygulamasına kişiler ekledi ve podcast uygulamasına "banana" adlı bir podcast ekledi. Ayrıca her görev için anlık görüntüler kaydetti, böylece her görev temiz bir başlangıç durumundan başlayabilir.

Ajan entegrasyonları

AutoDroid

AutoDroid Entegrasyonu: AutoDroid'i entegre etmek için önce depoyu GitHub'dan klonladık ve gerekli Python paketlerini kurduk. AutoDroid'in ana özelliği, XML'i ayrıştırarak UI öğelerini tanımlamak ve eylem tabanlı bir yaklaşımla görevleri tamamlamaktır.

Ajan, ekrandaki her tıklanabilir veya odaklanabilir öğeye bir dizin numarası atar ve LLM'den "tap(5)" veya "text('hello')" gibi komutlar alır.

AutoDroid sarmalayıcısı: AndroidWorld ile entegrasyon için autodroid_agent.py adlı bir sarmalayıcı sınıfı oluşturduk. Bu sarmalayıcı, AutoDroid'in başlatma yönteminde gerekli yapılandırmaları gerçekleştirir, AndroidWorld'den gelen görev hedefini AutoDroid'in anlayabileceği bir prompt formatına dönüştürür ve AutoDroid tarafından oluşturulan eylemleri AndroidWorld'ün execute_adb_call fonksiyonlarını kullanarak gerçek ADB komutlarına çevirir.

Yürütme akışı: AutoDroid'in step yönteminde, ajan önce ekranın ekran görüntüsünü ve XML dökümünü alır, UI öğelerini ayrıştırır, bu bilgiyi LLM'ye gönderir ve alınan yanıta göre dokunma, kaydırma veya metin girişi eylemlerini gerçekleştirir.

DroidRun

DroidRun entegrasyonu: DroidRun için benzer bir entegrasyon süreci izledik. DroidRun deposunu GitHub'dan klonladıktan sonra, requirements.txt'deki bağımlılıkları kurduk.

DroidRun'ın mimari yapısı daha karmaşıktır çünkü çok adımlı bir muhakeme ve durum takip sistemine sahiptir. DroidRun, yalnızca her adımda ne yapacağını değil, aynı zamanda nedenini de açıklayabilir ve önceki adımların sonuçlarını bir sonraki adımda kullanabilir.

DroidRun sarmalayıcısı: AndroidWorld entegrasyonu için droidrun_agent.py sarmalayıcısını oluşturduk. Bu sarmalayıcıdaki en önemli kısım, DroidRun'ın kendi CodeActAgent sınıfını AndroidWorld'ün temel ajan arayüzüyle uyumlu hale getirmekti.

Yürütme süreci: DroidRun'ın execute_task yöntemini çağırdığımızda, ajan bir görev planlama aşamasından geçer, ardından her adımı yürütür ve sonuçları değerlendirir. Bu süreci AndroidWorld'ün adım adım yürütme modeline uyarladık. Ayrıca DroidRun tarafından kullanılan araçları (tap_by_index, start_app, list_packages, vb.) AndroidWorld'ün ADB komutlarıyla uyguladık.

AppAgent

AppAgent entegrasyonu: AppAgent'ın entegrasyonu diğerlerinden farklıydı çünkü görüntü tabanlı bir yaklaşım kullanır. AppAgent deposunu klonladıktan sonra, scripts klasöründeki Python dosyalarını AndroidWorld'e entegre ettik.

Görüntü tabanlı yaklaşım: AppAgent'ın çalışma prensibi şöyledir: önce ekranın ekran görüntüsünü alır, ardından UI öğelerinin sınırlayıcı kutularını hesaplar, bu kutuları ekran görüntüsüne çizer, her birine bir numara atar ve bu etiketlenmiş ekran görüntüsünü bir multimodal LLM'ye gönderir. LLM, hangi öğeye tıklanması gerektiğini görsel olarak belirler.

Sarmalayıcı yapılandırması: AppAgent'ı entegre etmenin en önemli adımı, AppAgent'ın and_controller.py modülünü kullanarak Android cihazla iletişim kuran kısmı AndroidWorld'ün emülatörüne yönlendirmekti. appagent_agent.py sarmalayıcısında, AppAgent'ın get_screenshot ve get_xml yöntemlerini AndroidWorld'ün API'leriyle çalışacak şekilde yeniden uyguladık. Ayrıca AppAgent'ın OpenAI API formatını kullanan model.py dosyasını OpenRouter API'si ile uyumlu hale getirdik.

Mobile-Agent (M3A)

Mobile-Agent (M3A) entegrasyonu: M3A'nın entegrasyonu en kapsamlı süreçti çünkü tamamen görüntü tabanlı çalışır ve çok ayrıntılı bir UI analiz sistemine sahiptir. M3A deposunu klonladıktan sonra, M3A bu framework'e bağlı olduğu için Mobile-Env Android etkileşim framework'ünü de kurduk.

Çok adımlı analiz: M3A'nın çalışma prensibi, ekranı ızgaralara bölmeye, her ızgarayı ayrı ayrı analiz etmeye ve çok adımlı planlama yapmaya dayanır. m3a_agent.py sarmalayıcısını oluştururken, M3A'nın kendi ortam sistemini AndroidWorld'ün ortamıyla entegre etmemiz gerekti. M3A normalde kendi Mobile-Env'ini kullanır, ancak biz bunu AndroidWorld'ün env'ine yönlendirdik.

Çoklu LLM çağrıları: M3A'nın her adımda birden fazla LLM çağrısı yaptığını (planlama, eylem seçimi, doğrulama gibi) gözlemledik ve bunları AndroidWorld'ün adım sınırlarıyla uyumlu hale getirdik.

Test prosedürü ve veri toplama

Test akışı: Her ajan için test prosedürü şöyle çalıştı: Önce emülatörü temiz bir anlık görüntüyle başlattık. Emülatör tamamen açıldıktan sonra AndroidWorld'ün run.py'sini çalıştırdık. Her ajan için 65 görevi sırayla çalıştırdık ve tüm ajanlar için Claude 4.5 Sonnet kullandık.

Görev yürütme: AndroidWorld her görev için otomatik olarak şu adımları gerçekleştirdi: görevin başlangıç durumunu yükle, ajanı başlat, görev hedefini ajana gönder, ajanın adımlarını takip et, maksimum adım sayısına ulaşıldığında veya ajan "görev tamamlandı" dediğinde dur ve görevin başarılı olup olmadığını kontrol et.

Başarı kriterleri: AndroidWorld'ün görev değerlendirme sistemi önceden tanımlanmış başarı kriterlerini içerir. Örneğin, "John Doe adlı kişiyi ekle" görevi için AndroidWorld, kişinin eklendiğini onaylamak üzere kişiler veritabanını sorgular.

Takvim görevleri için, etkinliğin doğru tarih, saat, başlık ve açıklamayla oluşturulup oluşturulmadığını veritabanından kontrol eder. Her görev yürütmesinin sonunda AndroidWorld bize yürütme süresi ve başarı durumu (True/False) sağladı. Bu veriler otomatik olarak kaydedildi ve analiz için kullanıldı.

Veri toplama: Tüm benchmark'ı tamamladıktan sonra, tüm ajanların başarıyla tamamladığı görevi belirledik. Bu görevlerin her biri daha sonra her ajan tarafından 10 kez yürütüldü ve daha güvenilir performans metrikleri için ortalama yürütme süresi, maliyet ve token tüketimi hesaplandı.

SSS'ler

Mobil yapay zeka ajanları, kullanıcılar adına görevleri tamamlamak için doğal dil girdilerini ve hedef odaklı muhakemeyi kullanarak kullanıcılarla ve mobil uygulamalarla otonom olarak etkileşime giren yazılım sistemleridir. Geleneksel otomasyon araçlarının veya erken dönem kişisel asistanların aksine, bu ajanlar yapay zeka tarafından desteklenir. Bazı kullanım örnekleri şunlardır:

Test script'leri olmadan Mobil QA otomasyonu
Kimlik belgelerini yükleme veya profil ayarlarını değiştirme gibi Mobil iş akışlarını otomatikleştirme
Görme engelliler, yaşlılar veya diğer herkes için uygulamaları çalıştıran Yapay zeka asistanları
Takvimde etkinlik oluşturma ve hatta Duolingo derslerini tamamlama gibi Günlük genel görevler.

Bu araştırmayı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Cem Dilmegani (2026) - "Mobil Yapay Zeka Ajanları 65 Gerçek Dünya Görevinde Test Edildi". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 9 Haziran 2026, kaynak: https://aimultiple.com/mobile-ai-agent [Çevrimiçi Kaynak]

Dilmegani, C. (2026, 9 Haziran). Mobil Yapay Zeka Ajanları 65 Gerçek Dünya Görevinde Test Edildi. AIMultiple. https://aimultiple.com/mobile-ai-agent

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{Mobil Yapay Zeka Ajanları 65 Gerçek Dünya Görevinde Test Edildi}},
  year   = {2026},
  month  = jun,
  howpublished    = {\url{https://aimultiple.com/mobile-ai-agent}},
  note   = {AIMultiple. Erişim tarihi: 9 Haziran 2026}
}
Cem Dilmegani
Cem Dilmegani
Baş Analist
Cem, 2017'den beri AIMultiple'da baş analisttir. AIMultiple, her ay Fortune 500'ün %60'ı dahil olmak üzere (similarWeb'e göre) yüz binlerce işletmeyi bilgilendirmektedir.

Cem'in çalışmaları Business Insider, Forbes, Washington Post gibi önde gelen küresel yayınlar, Deloitte, HPE gibi küresel firmalar, Dünya Ekonomik Forumu gibi STK'lar ve Avrupa Komisyonu gibi uluslarüstü kuruluşlar tarafından alıntılanmıştır.

Cem, kariyeri boyunca teknoloji danışmanı, teknoloji alıcısı ve teknoloji girişimcisi olarak görev yapmıştır. On yıldan fazla bir süre McKinsey & Company ve Altman Solon'da işletmelere teknoloji kararlarında danışmanlık yapmıştır. Ayrıca dijitalleşme üzerine bir McKinsey raporu yayımlamıştır.

CEO'ya rapor verirken bir telekomünikasyon şirketinin teknoloji stratejisini ve satın alımını yönetmiştir. Ayrıca, 2 yıl içinde 0'dan 7 haneli yıllık yinelenen gelire ve 9 haneli değerlemeye ulaşan derin teknoloji şirketi Hypatos'un ticari büyümesini yönetmiştir. Cem'in Hypatos'taki çalışmaları TechCrunch ve Business Insider gibi önde gelen teknoloji yayınları tarafından ele alınmıştır.

Cem, uluslararası teknoloji konferanslarında düzenli olarak konuşma yapmaktadır. Boğaziçi Üniversitesi'nden bilgisayar mühendisi olarak mezun olmuş ve Columbia Business School'dan MBA derecesine sahiptir.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450