Berk Kalelioğlu
Araştırma ilgi alanları
Berk makine öğrenimi, etmen tabanlı AI araçları ve büyük ve küçük dil modellerine (LLM'ler ve SLM'ler) odaklanmaktadır.Kendisi, AIMultiple benchmark ekibinin bir parçası olup değerlendirmeler yapmakta ve okuyucuların yeni ortaya çıkan teknolojiler ile bunların gerçek dünyadaki uygulamalarını anlamalarına yardımcı olacak içgörüler sunmaktadır.
Profesyonel deneyim
Kariyerine ODTÜ IVME-R'de Teknik Proje Lideri olarak başlamış, burada fiziksel kuantum ve sözde rastgele sayı üreteçleri oluşturma projesini yönetmiştir.IVME-R'deki görevinin ardından bir oyun geliştirme şirketi kurmuş ve Steam'de bir oyun yayınlamıştır.
Daha sonra kariyerini AI'ya kaydırmış ve AIMultiple'a Araştırmacı olarak katılmıştır.
Eğitim
Berk, Ankara Üniversitesi'nden Matematik alanında lisans derecesine sahiptir.Berk Tarafından Son Makaleler
En İyi Sabit Ücretli LLM API Sağlayıcıları
Sabit ücretli LLM sağlayıcıları, token başına faturalandırma yerine aylık sabit bir fiyat karşılığında sınırsız model kullanımı sunar. Bu model, ajan tabanlı kodlama oturumları on milyonlarca token kullanabildiği için yaygınlaştı; bu nedenle token başına bir faturanın tahmin edilmesi zordur. Çok az sayıda sağlayıcı gerçek bir sabit ücret sunar; sabit olarak pazarlanan çoğu planın altında bir kullanım…
A-CODE-LLM Bench: Ajan Kodlama Kıyaslaması
En iyi Büyük Dil Modellerini (LLM'leri) 10 yazılım geliştirme görevi üzerinde bir ajansal CLI aracı kullanarak kıyasladık. Her model için hem API hem de UI katmanlarında ~3.500 otomatik doğrulama adımı çalıştırdık. Her alias 10 görevde 3 kez çalıştırıldı (alias başına 30 örnek, 40 alias boyunca yineleme başına 400 hücre). Daha fazla ayrıntı için metodolojiye bakın.…
AIM Otonom Pazarlama Kıyaslaması
AIM Otonom Pazarlama Kıyaslamasını tanıtıyoruz; bu kıyaslama, rekabetçi boşluk analizi ve ABM hedef listesi hazırlamada ajan performansını ölçer. 11 modelin performansını test ettik ve uçtan uca yürütme performansını ölçtük: Görev puanları 0–100 ölçeğine normalleştirilmiştir. Genel puan, iki görev puanının aritmetik ortalamasıdır ve farklı rubrik boyutlarına rağmen her göreve eşit ağırlık verir. Geçersiz veya eksik gönderiler…
AI VC Benchmark: 11 AI Ajanı Gerçek Girişim Sermayesi Görevlerinde
Erken aşama VC’lerle ortaklık kurarak iki analist iş akışını insan tarafından doğrulanmış altın standartlı karşılaştırmalara dönüştürdük ve 11 AI ajanını bunlarla puanladık. Görevleri, sonuçları ve puanlama yöntemini görün: 11 modelin her biri her görevi bir kez çalıştırdı. Puanlar 100 üzerindendir. Kimi K3 puanlanabilir fırsat belirleme çalışması üretemedi ve 0 olarak kaydedildi. Her iki görev de…
Moltbook: Ajan Güdümlü Sosyal Medya
OpenClaw'ın hızlı büyümesi, alışılmadık bir sosyal deneyi tetikledi: Ajanların birbiriyle etkileşime girdiği Reddit benzeri bir sosyal platform olan Moltbook. 28th Ocak 2026'da yayına başladı ve kısa sürede ilgi görmeye başladı. İlk haftasında 1.5m'den fazla ajana ulaştı. Yapay zeka ajanları için diğer platformlar için, OpenClaw Ekosistemi İçinde: 8 Yapay Zeka Ajan Güdümlü Platform başlıklı yazıyı okuyun.…
OpenClaw (Moltbot/Clawdbot) Kullanım Alanları ve Güvenlik
OpenClaw (eski adıyla Moltbot ve Clawdbot), yerel bilgi işlem görevlerini yürütmek ve standart mesajlaşma platformları aracılığıyla kullanıcılarla etkileşim kurmak için tasarlanmış açık kaynaklı, kendi kendine barındırılan bir yapay zeka asistanıdır. Metin üreten danışmanlar olarak işlev gören geleneksel sohbet botlarının aksine, OpenClaw kabuk komutlarını yürütebilen, dosyaları yönetebilen ve ana makinede tarayıcı işlemlerini otomatikleştirebilen otonom bir ajan…
A-CODE-CLI Bench: Otonom CLI Benchmark'ı
Otonom CLI araçları, dosya oluşturabilen ve silebilen, komut çalıştırabilen, planlama yapabilen ve tüm projenin kodlamasını yürütebilen yapay zeka kodlama araçlarıdır. Önde gelen araçları 10 gerçek dünya web geliştirme senaryosu üzerinde benchmark'a tabi tuttuk, ajan başına ~600 atomik doğrulama kontrolü ve arka uç mantığını, ön uç işlevselliğini ve çoklu çalıştırma tutarlılık doğrulamasını kapsayan toplam ~5.000'den fazla…
Tabular Model Karşılaştırması: 19 Veri Kümesinde Performans
8 tablosal öğrenme modelini, yaklaşık 260,000 örnek içeren 19 gerçek dünya veri kümesi üzerinde karşılaştırdık; veri kümesi boyutları 435 ile 48,800 satır arasında değişiyor. Her model aynı makinede 5 katlı çapraz doğrulama ve aynı bölmelerle çalıştırıldı. Her veri kümesi, birincil metriğe göre belirlenen modeller arası birebir karşılaşmalardan oluşan bir turnuva formatındadır. Elo, model başına 483…
VPS Karşılaştırması: Hetzner vs Digital Ocean
6 Sanal Özel Sunucu (VPS) sağlayıcısını, CPU, bellek, disk G/Ç ve ağ hızında sysbench, fio ve speedtest-cli kullanarak sunucu başına ~1.200 otomatik test çalıştırarak karşılaştırdık. Ayrıca her sağlayıcı için kayıttan SSH'a kadar olan tüm deneyimi belgeledik. Her sağlayıcının 4 vCPU (Paylaşımlı) / 8 GB planlarını, herhangi bir ekstra veya hizmet eklemeden kullandık. En ucuz sağlayıcılar…
AIMultiple Bülteni
Haftada 1 ücretsiz e-posta ile en son B2B teknoloji haberleri ve uzman içgörüler ile işletmenizi hızlandırın.