Yapay Zeka Modelleri
Yapay zekâ modelleri, eğitim verilerine dayanarak tahminlerde bulunur. Sayılar, metin veya multimedya gibi her alanda çalışabilirler.
İlişkisel Temel Modelleri Karşılaştırma
Semantik-sayısal spektrumu, küçük/yüksek semantik tabloları, karma iş dataset'lerini ve büyük düşük semantik sayısal dataset'leri kapsayan 17 tablo dataset'i üzerinde SAP-RPT-1-OSS'i gradyan boosting'e (LightGBM, CatBoost) karşı benchmark ettik. Amacımız, ilişkisel bir LLM'in önceden eğitilmiş semantik ön bilgilerinin geleneksel ağaç modellerine göre nerede avantaj sağlayabileceğini ve ölçek veya düşük semantik yapı altında nerede zorluklarla karşılaştığını ölçmektir. Aşağıda,…
Siber Güvenlikte Büyük Dil Model'leri
7 büyük dil model'ini 9 siber güvenlik alanında, güvenlik görevleri için geniş ölçekli ve çok formatlı bir kıyaslama olan SecBench'i kullanarak değerlendirdik. Her model'i, veri güvenliği, kimlik ve erişim yönetimi, ağ güvenliği, zafiyet yönetimi ve bulut güvenliğini kapsayacak şekilde 44.823 çoktan seçmeli soru (MCQ) ve 3.087 kısa yanıtlı soru (SAQ) üzerinde test ettik. MCQ'lar (Çoktan…
LLM Ölçekleme Yasaları: Yapay Zeka Araştırmacılarından Analiz
Büyük dil modelleri, metin verilerinden öğrenilen kalıplara dayanarak bir sonraki token'ı tahmin eder. LLM ölçekleme yasaları terimi, model performansını eğitim sırasında kullanılan hesaplama miktarı, eğitim verisi ve model parametreleriyle ilişkilendiren deneysel düzenlilikleri ifade eder. Bu ilişkilerin pratikte modern model tasarımını nasıl etkilediğini anlamak için 8 akademik makaleden bulguları ve 3 büyük yapay zeka laboratuvarı ile…
Sağlık Hizmetlerinde 9 Büyük Dil Modelini Karşılaştırın
MedQA dataset'ini kullanarak 9 LLM'i benchmark ettik; bu, USMLE sorularından türetilen lisansüstü düzeyde bir klinik sınav benchmark'ıdır. Her model, standart bir prompt kullanarak aynı çoktan seçmeli klinik senaryoları yanıtladı; bu da doğrulukların doğrudan karşılaştırılmasını sağladı. Ayrıca, toplam çalışma süresini tamamlanan MedQA öğesi sayısına bölerek soru başına gecikme süresini kaydettik. Benchmark metodolojisi: Bu benchmark, sağlık hizmetlerindeki…
Kitle Simülasyonu: LLM'ler İnsan Davranışını Tahmin Edebilir mi?
Pazarlamada, LLM'lerin insan davranışını ne kadar doğru tahmin ettiğini değerlendirmek; kitle ihtiyaçlarını öngörme ve yanlış hizalama, etkisiz iletişim veya istenmeyen etki gibi riskleri tanıma konusundaki etkinliklerini değerlendirmek için kritik önem taşır. Kitle simülasyonu, LLM'lerle birlikte sanal kitlelerin modellenmesini sağlayarak kuruluşların maliyetli anketlere veya odak gruplarına başvurmadan içeriklere veya ürünlere verilecek tepkileri öngörmelerine yardımcı olur. Yapay…
HALC-Bench: LLM Uzun Bağlam Geri Getirme Benchmark'ında Halüsinasyon
HALC-Bench (LLM Uzun Bağlam Geri Getirme Benchmark'ında Halüsinasyon) büyük bir dil modelinin, hedef dokümanda bulunmayan bir metrik için kanıt uydurmaya karşı direncini, modelin bağlam penceresinin başına, ortasına ve sonuna yerleştirilmiş 3 samanlık kullanarak, 204 soru ile ölçer. claude-fable-5 her samanlık konumunda 204 tuzağın hepsini doğru yanıtladı. Kalan modeller arasında en az halüsinasyon gösteren gpt-5.5 oldu.…
AI Gateways for OpenAI: OpenRouter Alternatives
OpenRouter, SambaNova, TogetherAI, Groq ve AI/ML API'yi üç gösterge (ilk token gecikmesi, toplam gecikme ve çıktı token sayısı) açısından, toplam gecikme için kısa prompt'lar (yaklaşık 18 token) ve uzun prompt'lar (yaklaşık 203 token) kullanan 300 test ile benchmark ettik. Bu AI ağ geçitlerinden birini kullanmayı planlıyorsanız şunları yapabilirsiniz: Bu benchmark'ta OpenRouter, SambaNova, TogetherAI, Groq ve…
En İyi Sabit Ücretli LLM API Sağlayıcıları
Sabit ücretli LLM sağlayıcıları, token başına faturalandırma yerine aylık sabit bir fiyat karşılığında sınırsız model kullanımı sunar. Bu model, ajan tabanlı kodlama oturumları on milyonlarca token kullanabildiğinden, token başına faturanın tahmin edilmesi zor olduğu için yaygınlaştı. Gerçek bir sabit ücret sunan çok az sağlayıcı vardır; sabit olarak pazarlanan çoğu planın altında bir kullanım kotası yatar.…
LLM Gözlemlenebilirlik Araçları: Weights & Biases, Langsmith
LLM uygulamaları, tek turlu sohbetlerden araçları kullanan, veritabanlarını sorgulayan ve diğer modellerle koordine olan çok adımlı ajanlara doğru genişledi; bu da davranışlarını yorumlamayı zorlaştırıyor. LLM gözlemlenebilirliği, bu karmaşık iş akışlarına sürekli görünürlük sağlayarak kuruluşların kaliteyi izlemesine, hataları tespit etmesine, sorunları gidermesine ve performans ile maliyetleri yönetmesine yardımcı olur. W&B Weave, Weights & Biases'in LLM gözlemlenebilirlik…
Büyük Görüntü Modellerini Karşılaştırın: GPT-4o vs YOLOv8n
Büyük görüntü modelleri (LVM'ler), kusur tespiti, tıbbi teşhis ve çevresel izleme gibi görsel görevleri otomatikleştirebilir ve geliştirebilir. Her biri 1.000 görüntü üzerinden YOLOv8n, DETR ve GPT-4o Vision olmak üzere üç nesne tespit modelini test ettik; mAP@0.5, çıkarım hızı, FLOPs ve parametre sayısı gibi metrikleri ölçtük. Adil bir karşılaştırma sağlamak amacıyla tüm görüntüler 800×800 piksele yeniden…