Premium
Hizmetler
Premium
Berk Kalelioğlu

Berk Kalelioğlu

Yapay Zeka Araştırmacısı
15 Makale
B2B Teknolojisinde Güncel Kalın
Berk, AIMultiple'da yapay zeka araştırmacısıdır. Oyun geliştirme ve kaotik sistemler kullanarak sözde rastgele sayı üreteçleri geliştirme konusunda önceden deneyime sahiptir.

Araştırma ilgi alanları

Berk, makine öğrenimi, etmen tabanlı yapay zeka araçları ve büyük ve küçük dil modelleri (LLM'ler ve SLM'ler) üzerine odaklanmaktadır.

Kendisi, AIMultiple benchmark ekibinin bir parçasıdır; değerlendirmeler yapmakta ve okuyucuların yeni gelişen teknolojileri ve gerçek dünyadaki uygulamalarını anlamalarına yardımcı olacak içgörüler sunmaktadır.

Profesyonel deneyim

Kariyerine ODTU IVME-R'de Teknoloji Proje Lideri olarak başladı ve burada fiziksel kuantum ve sözde rastgele sayı üreteçleri geliştirme projesine liderlik etti.

IVME-R'deki görevinden sonra bir oyun geliştirme şirketi kurdu ve Steam'de bir oyun yayımladı.

Daha sonra kariyerini yapay zekaya yöneltti ve AIMultiple'a Araştırmacı olarak katıldı.

Eğitim

Berk, Ankara Üniversitesi'nden matematik alanında lisans derecesine sahiptir.

Berk Tarafından Son Makaleler

Yapay Zeka
Kıyaslama
24 Eyl

DecisionBench: Jev vs Kev vs LLM'ler

Karar modelleri, aynı zamanda System One modelleri olarak adlandırılır,1 bir ajanın bir sonraki eylemini, metni token üretmek yerine tek geçişte seçer. Tarayıcı otomasyonunu LLM'lerden daha ucuz hale getirip getiremeyeceklerini görmek için aynı 50 tarayıcı görevinde üç karar modelini ve iki LLM'yi, Gemini 3.8 Flash ve GPT-6 Astra'yı, toplam 250 denemeyle çalıştırdık. Kev-9B 50 görevin…

Otonom Yapay Zeka
21 Eyl

AIM Agentic Web Benchmark

Agents rely on web interfaces to complete tasks on the web. To measure how interface choice affects task completion, we built the AIM Agentic Web Benchmark and attempted 3.500 tasks (100 tasks completed via 7 web interfaces across 5 runs). A Bright Data interface led every run. The Bright Data CLI retrieved 8 more tasks…

Yapay Zeka
Kıyaslama
18 Eyl

Agentic IT: Yapay Zeka Ajanları Bir Benchmark Tasarlayabilir mi?

16 model'i text-to-SQL ve araç çağırma alanında bir benchmark tasarımında test ettik. Her model konu başına bir benchmark oluşturdu; toplam 32 gönderim oldu. Hiçbir gönderim tüm rubrik ölçütlerini geçemedi. Ajanlar testleri oluşturup çalıştırabildi ancak hiçbiri kendi puanlayıcısına ait hem boş-yanıt testini hem de doğru-yanıt testini gösteremedi. Text-to-SQL, sade bir dille yazılmış soruyu bir veritabanı sorgusuna…

Yapay Zeka
Kıyaslama
17 Eyl

AIM Enterprise: Otonom Kurumsal Benchmark

Kuruluşlar düzenli görevleri için her gün LLM'ler kullanır. En maliyet etkin LLM'leri bulmak için, strateji, pazarlama, İK, satış ve operasyonları kapsayan 69 gerçek kurumsal görev kullandığımız etmen tabanlı bir kurumsal benchmark olan AIM Enterprise'ı tasarladık, İki hakem model, kontrolleri geçen her dosyayı puanladı. Bireysel puanların %32,7'sinde iki hakem ölçeğin dörtte birinden fazla farklılaştı ve bu…

Otonom Yapay Zeka
Kıyaslama
12 Eyl

Yapay Zeka Derin Araştırma: Claude vs ChatGPT vs Grok

Yapay zeka derin araştırma, kullanıcılara yapay zeka arama motorlarından daha geniş bir arama sonucu yelpazesi sunar. Farklı yapay zeka derin araştırma araçlarındaki performansı görmek için üç yeni benchmark sunuyoruz: DR-50 (Derin Araştırma 50) Bench, araçları altı soru tipini kapsayan 50 soru üzerinden değerlendirir, DR-2T (Derin Araştırma 2 Görev) Bench, araçları rapor oluşturma kalitesi, kaynak kapsamı…

Yapay Zeka
Açık Dünya Değerlendirmesi
10 Eyl

En İyi Sabit Ücretli LLM API Sağlayıcıları

Sabit ücretli LLM sağlayıcıları, token başına faturalandırma yerine aylık sabit bir fiyat karşılığında sınırsız model kullanımı sunar. Bu model, ajan tabanlı kodlama oturumları on milyonlarca token kullanabildiğinden, token başına faturanın tahmin edilmesi zor olduğu için yaygınlaştı. Gerçek bir sabit ücret sunan çok az sağlayıcı vardır; sabit olarak pazarlanan çoğu planın altında bir kullanım kotası yatar.…

Otonom Yapay Zeka
Kıyaslama
10 Eyl

AI VC Benchmark: 16 Yapay Zekâ Ajanı Müşteri Tespitinde

Müşteri tespiti ticari durum tespitinin bir parçasıdır. Üç araştırma ve inceleme sitesi için müşteri listesi araştırmasında 16 modeli test ettik; bunlardan biri AIMultiple olup gönderimlerini derlediğimiz cevap anahtarlarına ve atıf yaptıkları sayfalara göre puanladık. Hiçbir model için akıl yürütme çabası ayarlamadık. Her biri kendi ajan programının varsayılanında çalıştı ve puanlama modeli sıcaklık 0'da çağrıldı. Medyan…

Otonom Yapay Zeka
Özellik Karşılaştırması
3 Eyl

OpenClaw Alternatifleri: Hermes vs ZeroClaw vs Grok Bot

Otonom yapay zeka ajanları, OpenClaw ve Hermes agent gibi, normalde sürekli insan girdisi gerektirecek çok adımlı görevleri otomatikleştirir. OpenClaw en yaygın benimsenen her zaman açık otonom ajan haline gelmiş olsa da, birçok kullanıcı zorlu dağıtım süreci ve karmaşık yapılandırma gereksinimleri nedeniyle alternatifler aramaktadır. OpenClaw'ın otonom görev yürütme yaklaşımından nasıl farklılaştıklarını vurgulayarak önde gelen 5 OpenClaw…

Otonom Yapay Zeka
Kıyaslama
31 Ağu

Bilgisayar Kullanım Ajanları: Kıyaslama & Mimari

Bilgisayar kullanım ajanları gerçek masaüstlerinde ve web uygulamalarında çalışır. Tasarımları, sınırları ve ödünleri genellikle belirsizdir. Önde gelen sistemlerin nasıl çalıştığını, nasıl öğrendiklerini ve mimarilerinin nasıl farklılaştığını inceliyoruz. Ayrıca, 100 masaüstü ekran görüntüsü üzerinde, 4 görev türü ve her örnek için 5 çalıştırma ile odaklanmış bir UI temellendirme kıyaslamasına atıfta bulunuyoruz. Bu kıyaslama, görsel algı kalitesini…

Otonom Yapay Zeka
Kıyaslama
24 Ağu

MCP Gateway Karşılaştırması: 6 Gateway'in Gecikme ve Güvenliği

Bir MCP gateway, bir yapay zeka ajanı ile onun çağırdığı araçlar arasında yer alır ve satıcılar onu bu trafik için güvenlik katmanı olarak konumlandırır. Altı MCP gateway'i, tek bir makinede enstrümante edilmiş tek bir arka uca karşı kıyasladık; eklenen gecikmeyi, araç bazında yetkilendirmeyi, içerik korumasını ve denetim bütünlüğünü ölçtük. Bir ürün yalnızca ilgili kontrol ürünle…