Yapay Zeka Modelleri
Yapay zekâ modelleri, eğitim verilerine dayanarak tahminlerde bulunur. Sayılar, metin veya multimedya gibi her alanda çalışabilirler.
LLM Pazar Payı: Kullanım ve Benimsemeyi Karşılaştırın
Biz LLM pazar payını, kullanım tabanlı verileri ve web ziyareti tahminlerini birleştirerek, büyük dil modellerine olan talebin yapay zeka laboratuvarları ve yapay zeka uygulamaları arasında nasıl dağıldığını göstermek için analiz ettik: Bu sonuçları nasıl ölçtüğümüzü ve hesapladığımızı görmek için yöntemi okuyun. Birleşik Devletler, tüm dört ay boyunca web ziyaretlerinde hakimdi ve sürekli olarak 85.5–%90,5 oranına…
AIM-Decision: Jev vs Kev vs LLM'ler
Karar model'leri, System One model'leri olarak da adlandırılır,1 bir ajanın sonraki eylemini metni token üretmek yerine tek geçişte seçer. Tarayıcı otomasyonunu LLM'lerden daha ucuz hale getirip getiremeyeceklerini görmek için üç karar model'ini ve iki LLM'yi, Gemini 3.8 Flash ve GPT-6 Astra'yı, aynı 50 tarayıcı görevinde, toplam 250 denemede çalıştırdık. Kev-9B 20/50 görevi tamamladı ve…
Finans Alanında 40+ LLM Kıyaslaması: Claude Fable 5 ve GPT-5.6 Sol
LLM'leri FinanceReasoning kıyaslamasındaki 238 zor soru üzerinde değerlendirdik (Tang ve ark.).1 Bu alt küme, en zorlu finansal muhakeme görevlerini hedefler; finansal kavramları ve formülleri içeren karmaşık, çok adımlı nicel akıl yürütmeyi değerlendirir. Değerlendirmemizde özel bir prompt tasarımı ve doğruluk ile token tüketimi puanlama kriterleri kullanılmıştır. Bu metriklerin nasıl hesaplandığına ve bu değerlendirme için kullanılan framework'e…
Çok Modlu Yapay Zeka Modellerini Görsel Muhakeme Konusunda Karşılaştırın
Önde gelen 15 çok modlu yapay zeka modelini 200 görsel tabanlı soru kullanarak görsel muhakeme konusunda kıyasladık. Değerlendirme iki parkurdan oluşuyordu: veri görselleştirme yorumlamasını test eden 100 grafik anlama sorusu ve örüntü tanıma ile uzamsal muhakemeyi değerlendiren 100 görsel mantık sorusu. Tutarlı ve güvenilir sonuçlar sağlamak için her soru 5 kez çalıştırıldı. Test prosedürlerimizi öğrenmek…
Büyük Multimodal Model'ler (LMM'ler) vs LLM'ler
Finansal akıl yürütme görevlerinde Büyük Multimodal Model'lerin (LMM'lerin) performansını özenle seçilmiş bir dataset kullanarak değerlendirdik. Yüksek kaliteli finansal örneklerin bir alt kümesini analiz ederek, model'lerin finans alanındaki multimodal verileri işleme ve bu verilerle akıl yürütme yeteneklerini değerlendiriyoruz. metodoloji bölümü kullanılan dataset ve değerlendirme framework'ü hakkında ayrıntılı bilgiler sunar. Büyük multimodal model'leri keşfedin ve bunları büyük…
LLM Kendi Kendine Barındırma için VRAM Hesaplayıcı
Bir LLM'yi kendi kendine barındırmak, çıkarımı operatörün kontrol ettiği donanımda, üçüncü taraf bir API aracılığıyla değil, çalıştırmak anlamına gelir; bu da maliyeti, veri kontrolünü ve gizlilik profilini değiştirir. Bir modelin hiç çalışıp çalışmayacağı belleğe bağlıdır. Hesaplayıcı, modele, hassasiyetine, bağlam uzunluğuna ve hedef donanıma bağlı olarak bir modelin yerel olarak çalıştırılması için gereken VRAM veya birleşik…
Agentic IT: Yapay Zeka Ajanları Bir Benchmark Tasarlayabilir mi?
16 model'i text-to-SQL ve araç çağırma alanında bir benchmark tasarımında test ettik. Her model konu başına bir benchmark oluşturdu; toplam 32 gönderim oldu. Hiçbir gönderim tüm rubrik ölçütlerini geçemedi. Ajanlar testleri oluşturup çalıştırabildi ancak hiçbiri kendi puanlayıcısına ait hem boş-yanıt testini hem de doğru-yanıt testini gösteremedi. Text-to-SQL, sade bir dille yazılmış soruyu bir veritabanı sorgusuna…
AIM Enterprise: Otonom Kurumsal Benchmark
Kuruluşlar düzenli görevleri için her gün LLM'ler kullanır. En maliyet etkin LLM'leri bulmak için, strateji, pazarlama, İK, satış ve operasyonları kapsayan 69 gerçek kurumsal görev kullandığımız etmen tabanlı bir kurumsal benchmark olan AIM Enterprise'ı tasarladık, İki hakem model, kontrolleri geçen her dosyayı puanladı. Bireysel puanların %32,7'sinde iki hakem ölçeğin dörtte birinden fazla farklılaştı ve bu…
Büyük Dil Modellerinin Geleceği
büyük dil modellerinin geleceğini, kendi kendine eğitim, doğruluk kontrolü ve seyrek uzmanlık gibi umut verici yaklaşımlara inerek görün; bunlar LLM sınırlamalarını giderebilir. LLM'lerin başarı oranı karşılaştırması Claude Sonnet 4.6, genel 0.748 puanla benchmark'a liderlik etti; base ve thinking varyantları üç ondalık basamağa kadar eşitti. Claude Opus 4.8 (0.702), Opus 4.6 base (0.706) ve Opus 4.6…
Dünya Temel Modelleri: 10 Kullanım Alanı
Robotları ve otonom araçları (AV'leri) fiziksel dünyada eğitmek maliyetli, zaman alıcı ve riskli olabilir. Dünya Temel Modelleri, gerçek dünya ortamlarının gerçekçi simülasyonlarını mümkün kılarak ölçeklenebilir bir alternatif sunar. Bu modeller, fiziksel testlere bağımlılığı azaltarak robotik, otonom araçlar (AV'ler) ve diğer alanlarda geliştirme ile dağıtımı hızlandırır. Dünya Temel Modelleri'nin nasıl çalıştığını, gerçek hayattaki kullanım alanlarını ve…