Berk Kalelioğlu
Araştırma ilgi alanları
Berk, makine öğrenimi, etmen tabanlı yapay zeka araçları ve büyük ve küçük dil modelleri (LLM'ler ve SLM'ler) üzerine odaklanmaktadır.Kendisi, AIMultiple benchmark ekibinin bir parçasıdır; değerlendirmeler yapmakta ve okuyucuların yeni gelişen teknolojileri ve gerçek dünyadaki uygulamalarını anlamalarına yardımcı olacak içgörüler sunmaktadır.
Profesyonel deneyim
Kariyerine ODTU IVME-R'de Teknoloji Proje Lideri olarak başladı ve burada fiziksel kuantum ve sözde rastgele sayı üreteçleri geliştirme projesine liderlik etti.IVME-R'deki görevinden sonra bir oyun geliştirme şirketi kurdu ve Steam'de bir oyun yayımladı.
Daha sonra kariyerini yapay zekaya yöneltti ve AIMultiple'a Araştırmacı olarak katıldı.
Eğitim
Berk, Ankara Üniversitesi'nden matematik alanında lisans derecesine sahiptir.Berk Tarafından Son Makaleler
DecisionBench: Jev vs Kev vs LLM'ler
Karar modelleri, aynı zamanda System One modelleri olarak adlandırılır,1 bir ajanın bir sonraki eylemini, metni token üretmek yerine tek geçişte seçer. Tarayıcı otomasyonunu LLM'lerden daha ucuz hale getirip getiremeyeceklerini görmek için aynı 50 tarayıcı görevinde üç karar modelini ve iki LLM'yi, Gemini 3.8 Flash ve GPT-6 Astra'yı, toplam 250 denemeyle çalıştırdık. Kev-9B 50 görevin…
AIM Agentic Web Benchmark
Agents rely on web interfaces to complete tasks on the web. To measure how interface choice affects task completion, we built the AIM Agentic Web Benchmark and attempted 3.500 tasks (100 tasks completed via 7 web interfaces across 5 runs). A Bright Data interface led every run. The Bright Data CLI retrieved 8 more tasks…
Agentic IT: Yapay Zeka Ajanları Bir Benchmark Tasarlayabilir mi?
16 model'i text-to-SQL ve araç çağırma alanında bir benchmark tasarımında test ettik. Her model konu başına bir benchmark oluşturdu; toplam 32 gönderim oldu. Hiçbir gönderim tüm rubrik ölçütlerini geçemedi. Ajanlar testleri oluşturup çalıştırabildi ancak hiçbiri kendi puanlayıcısına ait hem boş-yanıt testini hem de doğru-yanıt testini gösteremedi. Text-to-SQL, sade bir dille yazılmış soruyu bir veritabanı sorgusuna…
AIM Enterprise: Otonom Kurumsal Benchmark
Kuruluşlar düzenli görevleri için her gün LLM'ler kullanır. En maliyet etkin LLM'leri bulmak için, strateji, pazarlama, İK, satış ve operasyonları kapsayan 69 gerçek kurumsal görev kullandığımız etmen tabanlı bir kurumsal benchmark olan AIM Enterprise'ı tasarladık, İki hakem model, kontrolleri geçen her dosyayı puanladı. Bireysel puanların %32,7'sinde iki hakem ölçeğin dörtte birinden fazla farklılaştı ve bu…
Yapay Zeka Derin Araştırma: Claude vs ChatGPT vs Grok
Yapay zeka derin araştırma, kullanıcılara yapay zeka arama motorlarından daha geniş bir arama sonucu yelpazesi sunar. Farklı yapay zeka derin araştırma araçlarındaki performansı görmek için üç yeni benchmark sunuyoruz: DR-50 (Derin Araştırma 50) Bench, araçları altı soru tipini kapsayan 50 soru üzerinden değerlendirir, DR-2T (Derin Araştırma 2 Görev) Bench, araçları rapor oluşturma kalitesi, kaynak kapsamı…
En İyi Sabit Ücretli LLM API Sağlayıcıları
Sabit ücretli LLM sağlayıcıları, token başına faturalandırma yerine aylık sabit bir fiyat karşılığında sınırsız model kullanımı sunar. Bu model, ajan tabanlı kodlama oturumları on milyonlarca token kullanabildiğinden, token başına faturanın tahmin edilmesi zor olduğu için yaygınlaştı. Gerçek bir sabit ücret sunan çok az sağlayıcı vardır; sabit olarak pazarlanan çoğu planın altında bir kullanım kotası yatar.…
AI VC Benchmark: 16 Yapay Zekâ Ajanı Müşteri Tespitinde
Müşteri tespiti ticari durum tespitinin bir parçasıdır. Üç araştırma ve inceleme sitesi için müşteri listesi araştırmasında 16 modeli test ettik; bunlardan biri AIMultiple olup gönderimlerini derlediğimiz cevap anahtarlarına ve atıf yaptıkları sayfalara göre puanladık. Hiçbir model için akıl yürütme çabası ayarlamadık. Her biri kendi ajan programının varsayılanında çalıştı ve puanlama modeli sıcaklık 0'da çağrıldı. Medyan…
OpenClaw Alternatifleri: Hermes vs ZeroClaw vs Grok Bot
Otonom yapay zeka ajanları, OpenClaw ve Hermes agent gibi, normalde sürekli insan girdisi gerektirecek çok adımlı görevleri otomatikleştirir. OpenClaw en yaygın benimsenen her zaman açık otonom ajan haline gelmiş olsa da, birçok kullanıcı zorlu dağıtım süreci ve karmaşık yapılandırma gereksinimleri nedeniyle alternatifler aramaktadır. OpenClaw'ın otonom görev yürütme yaklaşımından nasıl farklılaştıklarını vurgulayarak önde gelen 5 OpenClaw…
Bilgisayar Kullanım Ajanları: Kıyaslama & Mimari
Bilgisayar kullanım ajanları gerçek masaüstlerinde ve web uygulamalarında çalışır. Tasarımları, sınırları ve ödünleri genellikle belirsizdir. Önde gelen sistemlerin nasıl çalıştığını, nasıl öğrendiklerini ve mimarilerinin nasıl farklılaştığını inceliyoruz. Ayrıca, 100 masaüstü ekran görüntüsü üzerinde, 4 görev türü ve her örnek için 5 çalıştırma ile odaklanmış bir UI temellendirme kıyaslamasına atıfta bulunuyoruz. Bu kıyaslama, görsel algı kalitesini…
MCP Gateway Karşılaştırması: 6 Gateway'in Gecikme ve Güvenliği
Bir MCP gateway, bir yapay zeka ajanı ile onun çağırdığı araçlar arasında yer alır ve satıcılar onu bu trafik için güvenlik katmanı olarak konumlandırır. Altı MCP gateway'i, tek bir makinede enstrümante edilmiş tek bir arka uca karşı kıyasladık; eklenen gecikmeyi, araç bazında yetkilendirmeyi, içerik korumasını ve denetim bütünlüğünü ölçtük. Bir ürün yalnızca ilgili kontrol ürünle…
AIMultiple Bülteni
Haftada 1 ücretsiz e-posta ile en son B2B teknoloji haberleri ve uzman içgörüler ile işletmenizi hızlandırın.