Üretken yapay zeka veya konuşma yapay zekası çözümleri geliştirmek veya bunlardan yararlanmak için veri gereklidir. Piyasada bulunan mevcut veri setlerini kullanabilir veya bir veri toplama hizmeti kiralayabilirsiniz.
Makine öğrenimi ve yapay zeka modellerini eğitmek ve değerlendirmek için 100'den fazla veri seti belirledik.
Büyük Dil Modelleri (LLM'ler) ve Ajanik Yapay Zeka veri setleri
Veri Seti / Kıyaslama | Açıklama | Ücretsiz / Ücretli | Son Güncelleme |
|---|---|---|---|
MMLU (Massive Multitask Language Understanding) | Genel akıl yürütme ve akademik bilgi için kıyaslama | Ücretsiz | Devam ediyor |
HumanEval+ | Üretken kod için Python kodlama kıyaslaması | Ücretsiz | Devam ediyor |
FineWeb | Hugging Face'in LLM ön eğitimi için veri seti | Ücretsiz | Devam ediyor |
FineWeb-Edu | FineWeb'in eğitim alt kümesi | Ücretsiz | Devam ediyor |
BFCL (Berkeley Function Calling Leaderboard) | Araç/fonksiyon çağrısını değerlendirmek için sürekli güncellenen standart | Ücretsiz | Devam ediyor |
AIMultiple UI Zeminleme Kıyaslaması | Bilgisayar kullanımı ve görü-dil modelleri için UI zeminleme kıyaslaması | Ücretsiz | 2026 |
Superior-Reasoning-SFT | Alibaba-Apsara'nın Long-CoT akıl yürütme veri seti | Ücretsiz | 2026 |
Terminal-Bench 2.0 | 89 gerçekçi terminal görevi (dosya manipülasyonu, sistem yönetimi, hata ayıklama, araştırma kodunu yeniden uygulama) | Ücretsiz | 2026 |
MMMU (Massive Multi-disciplinary Multimodal Understanding) | Çok modlu kıyaslama (görüntü + metin akıl yürütme) | Ücretsiz | 2025 |
Humanity’s Last Exam (HLE) | MMLU'nun ötesinde öncü LLM'leri test etmek için çok modlu kıyaslama | Ücretsiz | 2025 |
- Büyük dil modeli kıyaslamaları gibi MMLU ve GPQA, genel ve bilimsel akıl yürütmeyi ölçer.
- Çok modlu veri setleri, LAION-5B gibi, metin ve görüntüleri birleştirerek her iki formatı da işleyebilen modelleri eğitir.
- Öncü değerlendirmeler, Humanity’s Last Exam, ARC-AGI-2 ve AI Idea Bench gibi, modellerin yaratıcılığını, olgusal doğruluğunu ve karmaşık prompt'lara uyum sağlama yeteneğini test eder.
- Ajanik ve araç kullanımı kıyaslamaları, GAIA, BFCL (Berkeley Function Calling Leaderboard) ve ComplexFuncBench gibi, çok adımlı akıl yürütme, araç çağrısı ve görev tamamlamayı değerlendirir.
- UI zeminleme kıyaslamaları, AIMultiple UI Zeminleme Kıyaslaması gibi, bilgisayar kullanımı modellerinin doğal dil talimatından doğru arayüz öğesini belirleyip konumunu tahmin edip edemediğini değerlendirir. Yöntem ve model sonuçları için bilgisayar kullanımı ajanları kıyaslamasına bakın.
- Ön eğitim derlemleri, FineWeb, Nemotron-CC ve Essential-Web v1.0 gibi, temel modelleri eğitmek için büyük ölçekli token koleksiyonları sağlar.
Yapay zeka kodlama ve yazılım mühendisliği veri setleri
- The Heap ve MADE-WIC gibi veri setleri, kodlama doğruluğunu ve teknik borcu değerlendirmek için çok dilli ve açıklamalı kod içerir.
- HumanEval ve APPS, kod üretimi kalitesini kıyaslamak için referans çözümleriyle kodlama problemleri sağlar.
- Depo düzeyinde ve ajanik kıyaslamalar, SWE-Bench Pro, SWE-Bench Multilingual, SWE-Lancer ve Terminal-Bench 2.0 gibi, modelleri izole fonksiyonlar yerine gerçek GitHub sorunları ve uçtan uca yazılım görevleri üzerinde değerlendirir.
- Amazon CodeWhisperer ve GitHub Copilot gibi tescilli veri setleri, ticari kodlama asistanlarını destekler.
HumanEval ve SWE-bench Verified gibi eski kıyaslamalar artık yaygın olarak kontamine veya doymuş kabul ediliyor; bunun sonucunda SWE-Bench Pro gibi kontaminasyona dirençli halefler ortaya çıktı.
Siber güvenlik ve veri güvenliği veri setleri
- CICIDS2017 ve TON_IoT, saldırı ve anomali tespit sistemlerini eğitmek için yaygın olarak kullanılır.
- EMBER ve VirusShare veri setleri, model tabanlı sınıflandırma için etiketli kötü amaçlı yazılım verileri içerir.
- CVE-MITRE veritabanı, bilinen yazılım güvenlik açıkları hakkında yapılandırılmış bilgiler sağlar.
Veri, sentetik veri ve gizlilik veri setleri
- Appen, Amazon Mechanical Turk, ve Telus International gibi platformlar, denetimli öğrenme için insan tarafından üretilen veri setleri sağlar.
- Hazy ve Gretel.ai, kurumsal kullanım için sentetik yapılandırılmış veri üretir.
- Kaggle Datasets ve Google Dataset Search gibi açık depolar, birden çok alanda herkese açık veri sağlar.
Web verisi veri setleri
- Ticari web veri sağlayıcıları, Bright Data ve Coresignal gibi, e-ticaret, sosyal, gayrimenkul ve iş ilanı kaynaklarını kapsayan önceden toplanmış ve özel veri setleri satar. Datarade gibi pazar yerleri bunları satıcılar arasında bir araya getirir.
- Ham ve filtrelenmiş taramalar, Common Crawl, C4, RefinedWeb ve RedPajama-Data-v2 gibi, toplu ön eğitim token'ları sağlar.
- Çok dilli derlemler, FineWeb-2, OSCAR 23.01 ve HPLT v2 gibi, çoğu tarama kaynaklı veri setinin aşırı temsil ettiği İngilizcenin ötesine kapsamı genişletir.
- Açık lisanslı derlemler, Common Corpus ve Common Pile gibi, kaynakları kamu malı veya izin verilen lisanslı sayfalarla sınırlayarak ölçekten feragat edip savunulabilir bir köken hikayesi sağlar.
- Yapılandırılmış web verileri, Web Data Commons ve schema.org tablo derlemleri gibi, web sitelerinin gömdüğü makine tarafından okunabilir işaretlemeyi çıkarır; bu da ürün, etkinlik ve kuruluş varlıkları için HTML ayrıştırmayı atlar.
- Web ajanı kıyaslamaları, Online-Mind2Web, WebArena ve BrowseComp gibi, modellerin canlı sitelerde gezinebilip gezinemediğini test eder.
- Dikey web veri setleri, Amazon Reviews 2023, Yelp Open Dataset ve GDELT gibi; yorumları, yerel işletmeleri ve haberleri kapsar ve öneri ile duygu analizi çalışmalarında yaygın olarak kullanılır.
Alana özgü ve sektörel veri setleri
- MIMIC-IV ve PhysioNet, tıbbi araştırmaları ve sağlık hizmetleri analitiğini destekler.
- Waymo Open Dataset ve KITTI, otonom araçlarda bilgisayarlı görü için kullanılır.
- Robotik ve bedenlenmiş yapay zeka veri setleri, AGIBOT WORLD 2026, EgoDex ve EgoVerse gibi, fiziksel yapay zeka ve insansı sistemleri eğitmek için birinci şahıs (egosantrik) video ve manipülasyon verileri sağlar.
- Çok modlu tıbbi kıyaslamalar, GMAI-MMBench ve OmniMedVQA gibi, birçok görüntüleme modalitesinde klinik görsel soru yanıtlamayı değerlendirir.
- World Bank Open Data ve OECD veri setleri, ekonomik ve finansal göstergeler sağlar.
- Common Voice ve Free Music Archive, ses ve dil modeli geliştirmeyi destekler.
ML veri setleri nedir?
Makine öğrenimi veri seti, makine öğrenimi modellerini eğitmek için özel olarak toplanan ve hazırlanan yapılandırılmış bir veri topluluğudur. Bu ML veri setleri, modelin desenleri öğrenmesine, anlamlı özellikler çıkarmasına ve görülmemiş veriler üzerinde tahminler yapmasına yardımcı olan örnekler işlevi görür.
Göreve bağlı olarak makine öğrenimi veri seti aşağıdakiler dahil çeşitli veri türlerinden oluşabilir:
- Metin verileri: doğal dil işleme, duygu analizi ve makine çevirisi gibi uygulamalarda kullanılır.
- Görüntü verileri: El yazısı rakam tanıma veya çelik plaka hatalarını tespit etme gibi görevler için çoğunlukla bilgisayarlı görü ve evrişimli sinir ağlarında kullanılır.
- Ses verileri: Konuşma tanıma veya ses sınıflandırma görevleri için.
- Video verileri: Nesne takibi veya gerçek zamanlı video analizi için.
- Sayısal veriler: Regresyon veya sınıflandırma görevlerinde kullanılır; bazen kütle spektrometrisi verilerinden veya zaman damgası günlüklerinden gelir.
Çoğu makine öğrenimi projesi ham verilerle başlar; bu veriler daha sonra etiketlenir veya açıklanır. Bu etiketleme, makine öğrenimi sisteminin sınıflandırma, regresyon veya diğer tahmin görevleri için beklenen sonucu anlamasına yardımcı olur.
Genellikle açık, herkese açık veya uzmanlaşmış makine öğrenimi depolarından elde edilen iyi bir veri seti, model performansını önemli ölçüde artırabilir.
Makine öğrenimi için veri setleri neden hazırlanmalı?
Yüksek kaliteli veri setleri hazırlamak ve seçmek, yapay zeka sistemleri geliştirmenin en kritik adımlarından biridir. Birçok kuruluş, veri hazırlığının makine öğrenimi projelerini başarıya götürebileceğini ya da başarısızlığa uğratabileceğini kabul eder.
Eğitim verilerinin kalitesi, modellerin gerçek dünya senaryolarına ne kadar iyi genelleştiğini ve belirli sorunları ne kadar doğru ele aldığını etkiler. Makine öğrenimi veri setinin üç temel amacı vardır:
Modeli eğitmek
Eğitim seti, makineye veri içindeki ilişkileri ve desenleri öğretir. Bu, açıklamalı veya etiketli verilerin verilmesini içerir; böylece model parametrelerini ayarlayabilir ve benzer girdilerde tahminlerini iyileştirebilir.
Model doğruluğunu ölçmek
Eğitimden sonra test veri seti (veya test seti), modelin performansını değerlendirmek için kullanılır. Bu, modelin görülmemiş verileri ne kadar iyi işlediğini ve eğitim setine aşırı uyum sağlayıp sağlamadığını veya anlamlı desenler öğrenip öğrenmediğini belirlemeye yardımcı olur.
Modeli dağıtım sonrasında iyileştirmek
Dağıtımdan sonra ekipler, ek toplanan verileri kullanarak makine öğrenimi modellerini iyileştirir; böylece modellerin yeni koşullara veya sınıflara uyum sağlamasına yardımcı olur. Doğrulama setleri ayrıca ayarlamaya ve aşırı uyumu önlemeye yardımcı olur.
Bu araştırmayı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Ermut, Sıla},
title = {{+100 ML ve Yapay Zeka Modelleri için Veri Setleri}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/datasets-for-ml}},
note = {AIMultiple. Erişim tarihi: 2 Eylül 2026}
}118 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, 6 CSV dosyası içeren ZIP dosyası olarak indirin.
Değişiklik günlüğü
11 güncelleme- 2026
Eğitim, doğrulama ve test alt kümelerini kapsayan "ML veri kümesi türleri" bölümü kaldırıldı.
- 2025
“Veri kümesi kategorileri” bölümü, Büyük Dil Modelleri (LLM'ler) ve Ajan Yapay Zeka, Yapay Zeka kodlama ve yazılım mühendisliği, Siber güvenlik ve veri güvenliği, Veri, sentetik veri ve gizlilik ile Alan odaklı ve endüstriyel veri kümeleri gibi yeni kategorilerle değiştirildi.
Şekil 1'in URL'si güncellendi.
Giriş, veri kümesi türleri ve açıklamalarının bir listesiyle genişletildi.
- 2024
SSS bölümüne bir soru ve cevap eklendi.
Added the "FAQs" section.
- 2023
Girişe ML veri kümeleri ve veri kaynakları tablosu eklendi.
Generative AI, "ML veri kümeleri nereden temin edilebilir?" bölümüne eklendi.
ML veri kümesi sağlayıcıları listesine yeni bir satıcı olan Clickworker eklendi.
Sponsorlu bölüm "Yapay Zeka/Makine Öğrenimi veri kümelerinin amacı nedir?" bölümünden kaldırıldı.
Sponsorlu bir ürün olarak Clickworker eklendi.
Daha önce proje yönetimi ve danışmanlık firmalarında işe alım uzmanı olarak çalıştı. Sıla, Sosyal Psikoloji alanında yüksek lisans derecesine ve Uluslararası İlişkiler alanında lisans derecesine sahiptir.
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.