Premium
Hizmetler
Premium
Şevval Alper

Şevval Alper

Yapay Zeka Araştırmacısı
19 Makale
B2B Teknolojisinde Güncel Kalın
Şevval, AIMultiple'da bir yapay zeka araştırmacısıdır. Kaotik sistemler kullanarak sözde rastgele sayı üretimi konusunda daha önce araştırma deneyimine sahiptir.

Araştırma İlgi Alanları

Şevval, yapay zeka kodlama araçları, yapay zeka ajanları ve kuantum teknolojilerine odaklanmaktadır.

Kendisi, AIMultiple benchmark ekibinin bir parçası olup okuyucuların çeşitli gelişen teknolojileri ve uygulamalarını anlamalarına yardımcı olmak için değerlendirmeler yapmakta ve içgörüler sağlamaktadır.

Mesleki Deneyim

Türkiye'de düzenlenen üç “CERN International Masterclasses - hands-on particle physics” etkinliğinde katılımcıların organize edilmesine ve yönlendirilmesine katkıda bulundu; öğrenmeyi kolaylaştırmak için öğretim üyeleriyle birlikte çalıştı.

Eğitim

Şevval, Middle East Technical University'den Fizik alanında lisans derecesine sahiptir.

Şevval Tarafından Son Makaleler

Otonom Yapay Zeka
Kıyaslama
22 Eyl

A-CODE-LLM Bench: Ajansal Kodlama Kıyaslaması

En iyi Büyük Dil Modellerini (LLM'leri) 10 yazılım geliştirme görevinde ajan bir CLI aracı kullanarak kıyasladık. Her modelde hem API hem de UI katmanlarında ~3.500 otomatik doğrulama adımı çalıştırdık. Her takma ad 10 görevde 3 kez çalıştırıldı (takma ad başına 30 örnek, 40 takma ad genelinde iterasyon başına 400 hücre). Daha fazla ayrıntı için metodoloji…

Yapay Zeka
Kıyaslama
22 Eyl

Yapay Zeka Kod İnceleme Araçları Karşılaştırması

Yapay zeka kodlama araçlarının kullanımının artmasıyla kod tabanları güvenlik açıklarına daha yatkın hale geldi ve bu da etkili kod incelemelerine olan ihtiyacı artırdı. Bunu ele almak için, en iyi dört yapay zeka kod inceleme aracını farklı boyutlardaki depolardan gelen 309 çekme isteği üzerinde karşılaştıran ve 10 geliştiricinin girdisini ve bir LLM-as-a-judge kullanarak performanslarını değerlendiren RevEval…

Otonom Yapay Zeka
21 Eyl

Ajan Benchmarks

Yapay Zeka
Kıyaslama
18 Eyl

Agentic IT: Yapay Zeka Ajanları Bir Benchmark Tasarlayabilir mi?

16 model'i text-to-SQL ve araç çağırma alanında bir benchmark tasarımında test ettik. Her model konu başına bir benchmark oluşturdu; toplam 32 gönderim oldu. Hiçbir gönderim tüm rubrik ölçütlerini geçemedi. Ajanlar testleri oluşturup çalıştırabildi ancak hiçbiri kendi puanlayıcısına ait hem boş-yanıt testini hem de doğru-yanıt testini gösteremedi. Text-to-SQL, sade bir dille yazılmış soruyu bir veritabanı sorgusuna…

Yapay Zeka
Kıyaslama
16 Eyl

Yapay Zeka Kodlama Benchmark: Claude Code vs Cursor

Yapay zeka kodlamada pazar iki kategoriye ayrıldı: Ajanik CLI araçları ve IDE'lere gömülü yapay zeka kod editörleri. Her biri geliştirmeyi otomatikleştirdiğini iddia ediyor. Aynı iş yükleri altında nasıl farklılaştıklarını gösteren az sayıda karşılaştırma var. Her bir ajanı 10 tam yığın web geliştirme görevinde değerlendirdik; ajan başına ~600 atomik doğrulama kontrolü ve backend mantığı, ön yüz…

Otonom Yapay Zeka
Kıyaslama
15 Eyl

VELC-Bench: Uzun Bağlam Benchmark'ında Doğrulama

Modelin bağlam içinde belirli bir metriği bulma, değerini bir iddiayla karşılaştırma ve onaylama veya reddetme yeteneği. Bu, uzun bağlam koşullarında ince taneli değer eşleştirmeyi test eder. Model hem değeri almalı hem de hassas bir karşılaştırma yapmalıdır. Modeller aşağıdaki bağlam pencerelerinde test edilmiştir: claude-fable-5 EVET'i doğrulamada %90,0 ve HAYIR'ı doğrulamada %94,0 puan alır. Bu fark, aşağıda…

Otonom Yapay Zeka
Kıyaslama
15 Eyl

RELC-Bench: Uzun Bağlamda Erişim Karşılaştırması

RELC-Bench (RELC-Bench: Uzun Bağlamda Erişim Karşılaştırması), bir modelin bağlamındaki bir veya daha fazla belgeden belirli bir sayısal değeri bulma ve çıkarma yeteneğini ölçmeyi amaçlar. Modelin, girdide az önce gördüğü belirli bir gerçeği hatırlayıp hatırlamadığını ve geri getirip getirmediğini test eder. claude-fable-5, 100 doğrudan hatırlama öğesinde %97,0 puan alır, saman balyası konumları boyunca sabittir (başlangıç %97,0,…

Yapay Zeka
Kıyaslama
15 Eyl

Kitle Simülasyonu: LLM'ler İnsan Davranışını Tahmin Edebilir mi?

Pazarlamada, LLM'lerin insan davranışını ne kadar doğru tahmin ettiğini değerlendirmek; kitle ihtiyaçlarını öngörme ve yanlış hizalama, etkisiz iletişim veya istenmeyen etki gibi riskleri tanıma konusundaki etkinliklerini değerlendirmek için kritik önem taşır. Kitle simülasyonu, LLM'lerle birlikte sanal kitlelerin modellenmesini sağlayarak kuruluşların maliyetli anketlere veya odak gruplarına başvurmadan içeriklere veya ürünlere verilecek tepkileri öngörmelerine yardımcı olur. Yapay…

Yapay Zeka
Kıyaslama
15 Eyl

HALC-Bench: LLM Uzun Bağlam Geri Getirme Benchmark'ında Halüsinasyon

HALC-Bench (LLM Uzun Bağlam Geri Getirme Benchmark'ında Halüsinasyon) büyük bir dil modelinin, hedef dokümanda bulunmayan bir metrik için kanıt uydurmaya karşı direncini, modelin bağlam penceresinin başına, ortasına ve sonuna yerleştirilmiş 3 samanlık kullanarak, 204 soru ile ölçer. claude-fable-5 her samanlık konumunda 204 tuzağın hepsini doğru yanıtladı. Kalan modeller arasında en az halüsinasyon gösteren gpt-5.5 oldu.…

Otonom Yapay Zeka
Kıyaslama
11 Eyl

Kod Çalıştırma ile MCP: Yapay Zeka Ajanı Verimliliğine Yeni Bir Yaklaşım

Anthropic bir yöntem tanıttı: bu yöntemde yapay zeka ajanları Model Context Protocol (MCP) sunucularıyla çalıştırılabilir kod yazarak etkileşim kurması yerine doğrudan araçlara çağrı yapmak. Ajan, araçları bilgisayardaki dosyalar gibi ele alır, ihtiyaç duyduğunu bulur ve bunları doğrudan kodla kullanır; böylece ara verilerin model'in belleğinden geçmesi gerekmez. Bu yaklaşımı, aynı başarı oranını korurken token maliyetini azaltıp…