Hizmetler
Bize Ulaşın
Şevval Alper

Şevval Alper

Yapay Zeka Araştırmacısı
21 Makale
B2B Teknolojisinde Güncel Kalın
Şevval, AIMultiple'da bir yapay zeka araştırmacısıdır. Kaotik sistemler kullanarak sözde rastgele sayı üretimi konusunda daha önce araştırma deneyimine sahiptir.

Araştırma İlgi Alanları

Şevval, yapay zeka kodlama araçları, yapay zeka ajanları ve kuantum teknolojilerine odaklanmaktadır.

Kendisi, AIMultiple benchmark ekibinin bir parçası olup okuyucuların çeşitli gelişen teknolojileri ve uygulamalarını anlamalarına yardımcı olmak için değerlendirmeler yapmakta ve içgörüler sağlamaktadır.

Mesleki Deneyim

Türkiye'de düzenlenen üç “CERN International Masterclasses - hands-on particle physics” etkinliğinde katılımcıların organize edilmesine ve yönlendirilmesine katkıda bulundu; öğrenmeyi kolaylaştırmak için öğretim üyeleriyle birlikte çalıştı.

Eğitim

Şevval, Middle East Technical University'den Fizik alanında lisans derecesine sahiptir.

Şevval Tarafından Son Makaleler

Yapay Zeka
Kıyaslama
1 Eyl

Kitle Simülasyonu: LLM'ler İnsan Davranışını Tahmin Edebilir mi?

Pazarlamada, LLM'lerin insan davranışını ne kadar doğru tahmin ettiğini değerlendirmek; kitle ihtiyaçlarını öngörme ve yanlış hizalama, etkisiz iletişim veya istenmeyen etki gibi riskleri tanıma konusundaki etkinliklerini değerlendirmek için kritik önem taşır. Kitle simülasyonu, LLM'lerle birlikte sanal kitlelerin modellenmesini sağlayarak kuruluşların maliyetli anketlere veya odak gruplarına başvurmadan içeriklere veya ürünlere verilecek tepkileri öngörmelerine yardımcı olur. Yapay…

Otonom Yapay Zeka28 Ağu

Yapay Zeka Ajanları: Operator vs Tarayıcı Kullanımı vs Project Mariner

Yapay zeka ajanları giderek uçtan uca dijital çalışanlar olarak pazarlanıyor, ancak gerçek dünya performansı görev, araçlar ve yürütme ortamına bağlı olarak büyük ölçüde değişebilir. Bu sistemlerin bugün gerçekten ne sunabileceğini anlamak için, pratik iş senaryolarında uygulamalı benchmarking gerçekleştirdik. En iyi 5 AI agent'ı test etmek için 40 saatten fazla zaman harcadık ve bunların şu konularda…

Otonom Yapay Zeka
Kıyaslama
27 Ağu

Kod Yürütme ile MCP: Yapay Zeka Ajanı Verimliliğine Yeni Bir Yaklaşım

Anthropic, yapay zeka ajanlarının Model Bağlam Protokolü (MCP) sunucularıyla, yürütülebilir kod yazarak etkileşimde bulunduğu araçlara doğrudan çağrı yapmak yerine. Ajan, araçları bilgisayardaki dosyalar gibi ele alır, ihtiyacı olanı bulur ve bunları doğrudan kodla kullanır; böylece ara verilerin modelin belleğinden geçmesi gerekmez. Bu yaklaşımı, aynı başarı oranını korurken token maliyetini azaltıp azaltmadığını görmek için test ettik.…

Yapay Zeka
Kıyaslama
24 Ağu

Yapay Zeka Kodlama Karşılaştırması: Claude Code vs Cursor

Yapay zeka kodlamada pazar iki kategoriye ayrıldı: Agentic CLI araçları ve IDE'lere gömülü yapay zeka kod editörleri. Her biri geliştirmeyi otomatikleştirdiğini iddia ediyor. Çok az karşılaştırma, özdeş iş yükleri altında nasıl farklılaştıklarını gösteriyor. Her ajanı 10 tam yığın web geliştirme görevinde karşılaştırdık, ajan başına ~600 atomik doğrulama kontrolü ve 9.600'den fazla toplam otomatik test yürütmesi…

Otonom Yapay Zeka
Kıyaslama
21 Ağu

Yapay Zeka Ajan Platformları Kıyaslaması: Claude Yönetilen Ajanlar ve Google Vertex Agent Engine

4 yapay zeka ajan platformunu 3 boyutta değerlendirdik: görev tamamlama (10 kodlama görevi × 3 çalıştırma), harness'e özgü yetenekler (yönlendirme, yeniden bağlanma, uzun konuşma hatırlama, büyük dosya işleme) ve maliyet. Claude Yönetilen Ajanlar ve Vertex AI Agent Engine, görev paketinde %100 geçme oranına ulaşıyor; maliyette Vertex kazanıyor ($1,45 karşısında $2,50). Yalnızca yönetilen platformlarda bulunan, akış…

Otonom Yapay Zeka
Kıyaslama
21 Ağu

RELC-Bench: Uzun Bağlamda Erişim Karşılaştırması

RELC-Bench (RELC-Bench: Uzun Bağlamda Erişim Karşılaştırması), bir modelin bağlamındaki bir veya daha fazla belgeden belirli bir sayısal değeri bulma ve çıkarma yeteneğini ölçmeyi amaçlar. Modelin, girdide az önce gördüğü belirli bir gerçeği hatırlayıp hatırlamadığını ve geri getirip getirmediğini test eder. claude-fable-5, 100 doğrudan hatırlama öğesinde %97,0 puan alır, saman balyası konumları boyunca sabittir (başlangıç %97,0,…

Otonom Yapay Zeka
Kıyaslama
21 Ağu

MCP Karşılaştırma: Web Erişimi için En İyi MCP Sunucuları

Web araması ve çıkarma ile tarayıcı otomasyonu görevlerinde, 4 farklı görevi uygun tüm MCP'ler üzerinde 5 kez çalıştırarak 8 MCP sunucusunu karşılaştırdık. Ayrıca, 250 eş zamanlı yapay zeka ajanını içeren bir yük testi gerçekleştirdik. *Web araması ve çıkarma görevleri, Bright Data’nın varsayılan MCP sunucusu ile çalıştırılırken, tarayıcı otomasyonu görevleri, tarayıcı otomasyonu için gereken araçlar Pro…

Yapay Zeka
İçgörü
21 Ağu

LLM Parametreleri: GPT-5 High, Orta, Düşük ve Minimal

OpenAI'in GPT-5 ailesi gibi bazı LLM'ler, farklı sürümlerde (ör. GPT-5, GPT-5-mini ve GPT-5-nano) ve yüksek, orta, düşük ve minimal dahil olmak üzere çeşitli parametre ayarlarıyla gelir. Aşağıda, bu model sürümleri arasındaki farkları, benchmark performanslarını ve benchmark'ları çalıştırmanın maliyetlerini inceleyerek keşfediyoruz. Analizimizde GPT-5 ailesini kullandık. Muhakeme, kodlama, talimat takibi ve matematik dahil olmak üzere çeşitli alanlarda…

Yapay Zeka
Kıyaslama
21 Ağu

HALC-Bench: LLM Uzun Bağlam Geri Getirme Benchmark'ında Halüsinasyon

HALC-Bench (LLM Uzun Bağlam Geri Getirme Benchmark'ında Halüsinasyon) büyük bir dil modelinin, hedef dokümanda bulunmayan bir metrik için kanıt uydurmaya karşı direncini, modelin bağlam penceresinin başına, ortasına ve sonuna yerleştirilmiş 3 samanlık kullanarak, 204 soru ile ölçer. claude-fable-5 her samanlık konumunda 204 tuzağın hepsini doğru yanıtladı. Kalan modeller arasında en az halüsinasyon gösteren gpt-5.5 oldu.…

Yapay Zeka
Kıyaslama
21 Ağu

En İyi Yapay Zeka Kod Düzenleyicisi: Cursor vs Windsurf vs Replit

Kodlama becerisi olmadan uygulama yapmak şu anda oldukça popüler. Peki bu araçlar başarılı bir şekilde uygulama oluşturup dağıtabilir mi? 6 yapay zeka kod düzenleyicisini 10 gerçek dünya web geliştirme zorluğu üzerinde kıyasladık. Her görev backend, frontend, kimlik doğrulama, durum yönetimi gibi uygulamalar gerektiriyordu. Backend doğruluğunu, frontend davranışını ve birleşik performansı değerlendirdik ve her ajanın yürütme…