Hizmetler
Bize Ulaşın

+100 ML ve Yapay Zeka Modelleri için Veri Setleri

Cem Dilmegani
Cem Dilmegani
Güncellenme tarihi: 2 Eyl 2026

Üretken yapay zeka veya konuşma yapay zekası çözümleri geliştirmek veya bunlardan yararlanmak için veri gereklidir. Piyasada bulunan mevcut veri setlerini kullanabilir veya bir veri toplama hizmeti kiralayabilirsiniz.

Makine öğrenimi ve yapay zeka modellerini eğitmek ve değerlendirmek için 100'den fazla veri seti belirledik.

Büyük Dil Modelleri (LLM'ler) ve Ajanik Yapay Zeka veri setleri

Veri Seti / Kıyaslama
Açıklama
Ücretsiz / Ücretli
Son Güncelleme
MMLU (Massive Multitask Language Understanding)
Genel akıl yürütme ve akademik bilgi için kıyaslama
Ücretsiz
Devam ediyor
HumanEval+
Üretken kod için Python kodlama kıyaslaması
Ücretsiz
Devam ediyor
FineWeb
Hugging Face'in LLM ön eğitimi için veri seti
Ücretsiz
Devam ediyor
FineWeb-Edu
FineWeb'in eğitim alt kümesi
Ücretsiz
Devam ediyor
BFCL (Berkeley Function Calling Leaderboard)
Araç/fonksiyon çağrısını değerlendirmek için sürekli güncellenen standart
Ücretsiz
Devam ediyor
AIMultiple UI Zeminleme Kıyaslaması
Bilgisayar kullanımı ve görü-dil modelleri için UI zeminleme kıyaslaması
Ücretsiz
2026
Superior-Reasoning-SFT
Alibaba-Apsara'nın Long-CoT akıl yürütme veri seti
Ücretsiz
2026
Terminal-Bench 2.0
89 gerçekçi terminal görevi (dosya manipülasyonu, sistem yönetimi, hata ayıklama, araştırma kodunu yeniden uygulama)
Ücretsiz
2026
MMMU (Massive Multi-disciplinary Multimodal Understanding)
Çok modlu kıyaslama (görüntü + metin akıl yürütme)
Ücretsiz
2025
Humanity’s Last Exam (HLE)
MMLU'nun ötesinde öncü LLM'leri test etmek için çok modlu kıyaslama
Ücretsiz
2025
  • Büyük dil modeli kıyaslamaları gibi MMLU ve GPQA, genel ve bilimsel akıl yürütmeyi ölçer.
  • Çok modlu veri setleri, LAION-5B gibi, metin ve görüntüleri birleştirerek her iki formatı da işleyebilen modelleri eğitir.
  • Öncü değerlendirmeler, Humanity’s Last Exam, ARC-AGI-2 ve AI Idea Bench gibi, modellerin yaratıcılığını, olgusal doğruluğunu ve karmaşık prompt'lara uyum sağlama yeteneğini test eder.
  • Ajanik ve araç kullanımı kıyaslamaları, GAIA, BFCL (Berkeley Function Calling Leaderboard) ve ComplexFuncBench gibi, çok adımlı akıl yürütme, araç çağrısı ve görev tamamlamayı değerlendirir.
  • UI zeminleme kıyaslamaları, AIMultiple UI Zeminleme Kıyaslaması gibi, bilgisayar kullanımı modellerinin doğal dil talimatından doğru arayüz öğesini belirleyip konumunu tahmin edip edemediğini değerlendirir. Yöntem ve model sonuçları için bilgisayar kullanımı ajanları kıyaslamasına bakın.
  • Ön eğitim derlemleri, FineWeb, Nemotron-CC ve Essential-Web v1.0 gibi, temel modelleri eğitmek için büyük ölçekli token koleksiyonları sağlar.

Yapay zeka kodlama ve yazılım mühendisliği veri setleri

  • The Heap ve MADE-WIC gibi veri setleri, kodlama doğruluğunu ve teknik borcu değerlendirmek için çok dilli ve açıklamalı kod içerir.
  • HumanEval ve APPS, kod üretimi kalitesini kıyaslamak için referans çözümleriyle kodlama problemleri sağlar.
  • Depo düzeyinde ve ajanik kıyaslamalar, SWE-Bench Pro, SWE-Bench Multilingual, SWE-Lancer ve Terminal-Bench 2.0 gibi, modelleri izole fonksiyonlar yerine gerçek GitHub sorunları ve uçtan uca yazılım görevleri üzerinde değerlendirir.
  • Amazon CodeWhisperer ve GitHub Copilot gibi tescilli veri setleri, ticari kodlama asistanlarını destekler.

HumanEval ve SWE-bench Verified gibi eski kıyaslamalar artık yaygın olarak kontamine veya doymuş kabul ediliyor; bunun sonucunda SWE-Bench Pro gibi kontaminasyona dirençli halefler ortaya çıktı.

Siber güvenlik ve veri güvenliği veri setleri

  • CICIDS2017 ve TON_IoT, saldırı ve anomali tespit sistemlerini eğitmek için yaygın olarak kullanılır.
  • EMBER ve VirusShare veri setleri, model tabanlı sınıflandırma için etiketli kötü amaçlı yazılım verileri içerir.
  • CVE-MITRE veritabanı, bilinen yazılım güvenlik açıkları hakkında yapılandırılmış bilgiler sağlar.

Veri, sentetik veri ve gizlilik veri setleri

  • Appen, Amazon Mechanical Turk, ve Telus International gibi platformlar, denetimli öğrenme için insan tarafından üretilen veri setleri sağlar.
  • Hazy ve Gretel.ai, kurumsal kullanım için sentetik yapılandırılmış veri üretir.
  • Kaggle Datasets ve Google Dataset Search gibi açık depolar, birden çok alanda herkese açık veri sağlar.
Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Web verisi veri setleri

  • Ticari web veri sağlayıcıları, Bright Data ve Coresignal gibi, e-ticaret, sosyal, gayrimenkul ve iş ilanı kaynaklarını kapsayan önceden toplanmış ve özel veri setleri satar. Datarade gibi pazar yerleri bunları satıcılar arasında bir araya getirir.
  • Ham ve filtrelenmiş taramalar, Common Crawl, C4, RefinedWeb ve RedPajama-Data-v2 gibi, toplu ön eğitim token'ları sağlar.
  • Çok dilli derlemler, FineWeb-2, OSCAR 23.01 ve HPLT v2 gibi, çoğu tarama kaynaklı veri setinin aşırı temsil ettiği İngilizcenin ötesine kapsamı genişletir.
  • Açık lisanslı derlemler, Common Corpus ve Common Pile gibi, kaynakları kamu malı veya izin verilen lisanslı sayfalarla sınırlayarak ölçekten feragat edip savunulabilir bir köken hikayesi sağlar.
  • Yapılandırılmış web verileri, Web Data Commons ve schema.org tablo derlemleri gibi, web sitelerinin gömdüğü makine tarafından okunabilir işaretlemeyi çıkarır; bu da ürün, etkinlik ve kuruluş varlıkları için HTML ayrıştırmayı atlar.
  • Web ajanı kıyaslamaları, Online-Mind2Web, WebArena ve BrowseComp gibi, modellerin canlı sitelerde gezinebilip gezinemediğini test eder.
  • Dikey web veri setleri, Amazon Reviews 2023, Yelp Open Dataset ve GDELT gibi; yorumları, yerel işletmeleri ve haberleri kapsar ve öneri ile duygu analizi çalışmalarında yaygın olarak kullanılır.

Alana özgü ve sektörel veri setleri

  • MIMIC-IV ve PhysioNet, tıbbi araştırmaları ve sağlık hizmetleri analitiğini destekler.
  • Waymo Open Dataset ve KITTI, otonom araçlarda bilgisayarlı görü için kullanılır.
  • Robotik ve bedenlenmiş yapay zeka veri setleri, AGIBOT WORLD 2026, EgoDex ve EgoVerse gibi, fiziksel yapay zeka ve insansı sistemleri eğitmek için birinci şahıs (egosantrik) video ve manipülasyon verileri sağlar.
  • Çok modlu tıbbi kıyaslamalar, GMAI-MMBench ve OmniMedVQA gibi, birçok görüntüleme modalitesinde klinik görsel soru yanıtlamayı değerlendirir.
  • World Bank Open Data ve OECD veri setleri, ekonomik ve finansal göstergeler sağlar.
  • Common Voice ve Free Music Archive, ses ve dil modeli geliştirmeyi destekler.
Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

ML veri setleri nedir?

Makine öğrenimi veri seti, makine öğrenimi modellerini eğitmek için özel olarak toplanan ve hazırlanan yapılandırılmış bir veri topluluğudur. Bu ML veri setleri, modelin desenleri öğrenmesine, anlamlı özellikler çıkarmasına ve görülmemiş veriler üzerinde tahminler yapmasına yardımcı olan örnekler işlevi görür.

Göreve bağlı olarak makine öğrenimi veri seti aşağıdakiler dahil çeşitli veri türlerinden oluşabilir:

  • Metin verileri: doğal dil işleme, duygu analizi ve makine çevirisi gibi uygulamalarda kullanılır.
  • Görüntü verileri: El yazısı rakam tanıma veya çelik plaka hatalarını tespit etme gibi görevler için çoğunlukla bilgisayarlı görü ve evrişimli sinir ağlarında kullanılır.
  • Ses verileri: Konuşma tanıma veya ses sınıflandırma görevleri için.
  • Video verileri: Nesne takibi veya gerçek zamanlı video analizi için.
  • Sayısal veriler: Regresyon veya sınıflandırma görevlerinde kullanılır; bazen kütle spektrometrisi verilerinden veya zaman damgası günlüklerinden gelir.

Çoğu makine öğrenimi projesi ham verilerle başlar; bu veriler daha sonra etiketlenir veya açıklanır. Bu etiketleme, makine öğrenimi sisteminin sınıflandırma, regresyon veya diğer tahmin görevleri için beklenen sonucu anlamasına yardımcı olur.

Genellikle açık, herkese açık veya uzmanlaşmış makine öğrenimi depolarından elde edilen iyi bir veri seti, model performansını önemli ölçüde artırabilir.

Makine öğrenimi için veri setleri neden hazırlanmalı?

Yüksek kaliteli veri setleri hazırlamak ve seçmek, yapay zeka sistemleri geliştirmenin en kritik adımlarından biridir. Birçok kuruluş, veri hazırlığının makine öğrenimi projelerini başarıya götürebileceğini ya da başarısızlığa uğratabileceğini kabul eder.

Eğitim verilerinin kalitesi, modellerin gerçek dünya senaryolarına ne kadar iyi genelleştiğini ve belirli sorunları ne kadar doğru ele aldığını etkiler. Makine öğrenimi veri setinin üç temel amacı vardır:

Modeli eğitmek

Eğitim seti, makineye veri içindeki ilişkileri ve desenleri öğretir. Bu, açıklamalı veya etiketli verilerin verilmesini içerir; böylece model parametrelerini ayarlayabilir ve benzer girdilerde tahminlerini iyileştirebilir.

Model doğruluğunu ölçmek

Eğitimden sonra test veri seti (veya test seti), modelin performansını değerlendirmek için kullanılır. Bu, modelin görülmemiş verileri ne kadar iyi işlediğini ve eğitim setine aşırı uyum sağlayıp sağlamadığını veya anlamlı desenler öğrenip öğrenmediğini belirlemeye yardımcı olur.

Modeli dağıtım sonrasında iyileştirmek

Dağıtımdan sonra ekipler, ek toplanan verileri kullanarak makine öğrenimi modellerini iyileştirir; böylece modellerin yeni koşullara veya sınıflara uyum sağlamasına yardımcı olur. Doğrulama setleri ayrıca ayarlamaya ve aşırı uyumu önlemeye yardımcı olur.

Bu araştırmayı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Cem Dilmegani and Sıla Ermut (2026) - "+100 ML ve Yapay Zeka Modelleri için Veri Setleri". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 2 Eylül 2026, kaynak: https://aimultiple.com/datasets-for-ml [Çevrimiçi Kaynak]

Dilmegani, C., & Ermut, S. (2026, 2 Eylül). +100 ML ve Yapay Zeka Modelleri için Veri Setleri. AIMultiple. https://aimultiple.com/datasets-for-ml

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Ermut, Sıla},
  title  = {{+100 ML ve Yapay Zeka Modelleri için Veri Setleri}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/datasets-for-ml}},
  note   = {AIMultiple. Erişim tarihi: 2 Eylül 2026}
}
Tüm verileri indir

118 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, 6 CSV dosyası içeren ZIP dosyası olarak indirin.

Son güncelleme: 17 Ağustos 2026
İndir

Değişiklik günlüğü

11 güncelleme
  1. 2026

    Eğitim, doğrulama ve test alt kümelerini kapsayan "ML veri kümesi türleri" bölümü kaldırıldı.

  2. 2025

    “Veri kümesi kategorileri” bölümü, Büyük Dil Modelleri (LLM'ler) ve Ajan Yapay Zeka, Yapay Zeka kodlama ve yazılım mühendisliği, Siber güvenlik ve veri güvenliği, Veri, sentetik veri ve gizlilik ile Alan odaklı ve endüstriyel veri kümeleri gibi yeni kategorilerle değiştirildi.

  3. Şekil 1'in URL'si güncellendi.

  4. Giriş, veri kümesi türleri ve açıklamalarının bir listesiyle genişletildi.

  5. 2024

    SSS bölümüne bir soru ve cevap eklendi.

  6. Added the "FAQs" section.

  7. 2023

    Girişe ML veri kümeleri ve veri kaynakları tablosu eklendi.

  8. Generative AI, "ML veri kümeleri nereden temin edilebilir?" bölümüne eklendi.

  9. ML veri kümesi sağlayıcıları listesine yeni bir satıcı olan Clickworker eklendi.

  10. Sponsorlu bölüm "Yapay Zeka/Makine Öğrenimi veri kümelerinin amacı nedir?" bölümünden kaldırıldı.

  11. Sponsorlu bir ürün olarak Clickworker eklendi.

Cem Dilmegani
Cem Dilmegani
Baş Analist
Cem, 2017'den beri AIMultiple bünyesinde baş analisttir. Cem'in AIMultiple'daki çalışmaları; Business Insider, Forbes, Morning Brew ve Washington Post gibi önde gelen küresel yayınlar, Deloitte ve HPE gibi küresel firmalar, Dünya Ekonomik Forumu gibi STK'lar ve Avrupa Komisyonu gibi uluslarüstü kuruluşlar tarafından alıntılanmıştır. [1], [2], [3], [4], [5] Kariyeri boyunca Cem; teknoloji danışmanı, teknoloji alıcısı ve teknoloji girişimcisi olarak görev yaptı. On yılı aşkın süre boyunca McKinsey & Company ve Altman Solon'da işletmelere teknoloji kararlarında danışmanlık yaptı. Ayrıca dijitalleşme üzerine bir McKinsey raporu yayımladı. CEO'ya rapor verirken bir telekom şirketinin teknoloji stratejisini ve satın alma süreçlerini yönetti. Ayrıca 2 yıl içinde 0'dan 7 haneli yıllık yinelenen gelire ve 9 haneli değerlemeye ulaşan derin teknoloji şirketi Hypatos'un ticari büyümesini yönetti. Cem'in Hypatos'taki çalışmaları TechCrunch ve Business Insider gibi önde gelen teknoloji yayınları tarafından ele alındı. Cem, uluslararası teknoloji konferanslarında düzenli olarak konuşma yapmaktadır. Boğaziçi Üniversitesi'nden bilgisayar mühendisi olarak mezun oldu ve Columbia Business School'dan MBA derecesine sahiptir.
Tam Profili Görüntüle
Araştıran
Sıla Ermut
Sıla Ermut
Sektör Analisti
Sıla Ermut, AIMultiple'da yapay zeka model'lerini, yapay zeka altyapısını, yapay zeka yönetişimini ve kurumsal yapay zeka uygulamalarını ele alan bir sektör analistidir. Araştırmaları çoğunlukla yapay zekanın pazarlama, sağlık hizmetleri, tedarik zincirleri ve sürdürülebilirlik alanlarındaki kullanımına odaklanmaktadır.
Daha önce proje yönetimi ve danışmanlık firmalarında işe alım uzmanı olarak çalıştı. Sıla, Sosyal Psikoloji alanında yüksek lisans derecesine ve Uluslararası İlişkiler alanında lisans derecesine sahiptir.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450