Veri, üretken yapay zeka veya konuşmalı yapay zeka çözümlerinden yararlanmak ya da oluşturmak için gereklidir. Piyasada bulunan mevcut veri setlerini kullanabilir veya bir veri toplama hizmeti ile anlaşabilirsiniz.
Makine öğrenimi ve yapay zeka modellerini eğitmek ve değerlendirmek için 100'den fazla veri seti belirledik.
Büyük Dil Modelleri (LLM'ler) ve Ajan Yapay Zeka Veri Setleri
Veri Seti / Benchmark | Açıklama | Ücretsiz / Ücretli | Son Güncelleme |
|---|---|---|---|
MMLU (Massive Multitask Language Understanding) | Genel akıl yürütme ve akademik bilgi için benchmark | Ücretsiz | Devam ediyor |
HumanEval+ | Üretken kod için Python kodlama benchmark'ı | Ücretsiz | Devam ediyor |
FineWeb | Hugging Face'in LLM ön eğitimi için veri seti | Ücretsiz | Devam ediyor |
FineWeb-Edu | FineWeb'in eğitim alt kümesi | Ücretsiz | Devam ediyor |
BFCL (Berkeley Function Calling Leaderboard) | Araç/fonksiyon çağrısını değerlendirmek için sürekli güncellenen standart | Ücretsiz | Devam ediyor |
Superior-Reasoning-SFT | Alibaba-Apsara'nın Uzun-CoT akıl yürütme veri seti | Ücretsiz | 2026 |
Terminal-Bench 2.0 | 89 gerçekçi terminal görevi (dosya manipülasyonu, sistem yönetimi, hata ayıklama, araştırma kodunu yeniden uygulama) | Ücretsiz | 2026 |
MMMU (Massive Multi-disciplinary Multimodal Understanding) | Çoklu mod benchmark'ı (görüntü + metin akıl yürütme) | Ücretsiz | 2025 |
Humanity’s Last Exam (HLE) | MMLU'nun ötesinde en ileri LLM'leri test etmek için çoklu mod benchmark'ı | Ücretsiz | 2025 |
YZ Idea Bench (2025) | LLM'lerin yeni araştırma fikirleri sentezleme yeteneğini test eder | Ücretsiz (araştırma) | 2025 |
Bu kategori, gelişmiş dil ve çoklu mod modellerini eğitmek ve değerlendirmek için tasarlanmış veri setlerini ve benchmark'ları içerir. Bu veri setleri, akıl yürütme, metin üretimi, soru cevaplama ve yaratıcı görevlerde model yeteneklerini değerlendirmeye yardımcı olur.
- Büyük dil modeli benchmark'ları MMLU ve GPQA gibi genel ve bilimsel akıl yürütmeyi ölçer.
- Çoklu mod veri setleri, LAION-5B gibi, metin ve görüntüleri birleştirerek her iki formatı da işleyebilen modelleri eğitir.
- İleri düzey değerlendirmeler, Humanity’s Last Exam, ARC-AGI-2 ve YZ Idea Bench gibi, modellerin yaratıcılığını, olgusal doğruluğunu ve karmaşık istemlere uyum yeteneğini test eder.
- Ajan ve araç kullanımı benchmark'ları, GAIA, BFCL (Berkeley Function Calling Leaderboard) ve ComplexFuncBench gibi, çok adımlı akıl yürütmeyi, araç çağırmayı ve görev tamamlamayı değerlendirir.
- Ön eğitim derlemeleri, FineWeb, Nemotron-CC ve Essential-Web v1.0 gibi, temel modelleri eğitmek için büyük ölçekli token koleksiyonları sağlar.
Yapay Zeka Kodlama ve Yazılım Mühendisliği Veri Setleri
Bu kategori, kod üretimi, anlama, hata ayıklama ve çeviri için veri setlerini kapsar. Programcılara yardımcı olan veya yazılım geliştirme görevlerini otomatikleştiren sistemler oluşturmak ve değerlendirmek için kullanılırlar.
- The Heap ve MADE-WIC gibi veri setleri, kodlama doğruluğunu ve teknik borcu değerlendirmek için çok dilli ve açıklamalı kod içerir.
- HumanEval ve APPS, kod üretim kalitesini kıyaslamak için referans çözümlerle birlikte kodlama problemleri sağlar.
- Repo düzeyinde ve ajan benchmark'ları, SWE-Bench Pro, SWE-Bench Multilingual, SWE-Lancer ve Terminal-Bench 2.0 gibi, modelleri yalıtılmış fonksiyonlar yerine gerçek GitHub sorunları ve uçtan uca yazılım görevleri üzerinde değerlendirir.
- Amazon CodeWhisperer ve GitHub Copilot gibi ticari veri setleri, ticari kodlama asistanlarını destekler.
HumanEval ve SWE-bench Verified gibi eski benchmark'lar artık yaygın olarak kontamine olmuş veya doygunluğa ulaşmış kabul edilmektedir; bunun sonucunda SWE-Bench Pro gibi kontaminasyona dayanıklı halefler ortaya çıkmıştır. Bu veri setleri, kodlama modellerinin tutarlı bir şekilde test edilmesini sağlar ve yazılımı verimli bir şekilde analiz edebilen veya üretebilen araçların oluşturulmasını destekler.
Siber Güvenlik ve Veri Güvenliği Veri Setleri
Siber güvenlik veri setleri, dijital tehditleri tespit etmek, sınıflandırmak ve önlemek için bilgi sağlar. Ağ trafiği günlükleri, zararlı yazılım örnekleri ve güvenlik açığı veritabanlarını içerirler.
- CICIDS2017 ve TON_IoT, saldırı ve anomali tespit sistemlerini eğitmek için yaygın olarak kullanılır.
- EMBER ve VirusShare veri setleri, model tabanlı sınıflandırma için etiketlenmiş zararlı yazılım verileri içerir.
- CVE-MITRE veritabanı, bilinen yazılım güvenlik açıkları hakkında yapılandırılmış bilgi sağlar.
Bu veri setleri, siber güvenlik alanında araştırma ve model eğitimini destekleyerek sistemlerin gerçek saldırı desenlerinden öğrenmesine ve tehdit tanımlamayı geliştirmesine olanak tanır.
Veri, Sentetik Veri ve Gizlilik Veri Setleri
Bu kategori, kuruluşların veri gizliliğini ve kalitesini korurken modelleri eğitmelerine yardımcı olan açık ve sentetik veri setlerini içerir. Sentetik veri, kişisel veya özel bilgileri ifşa etmeden gerçek dünya dağılımlarını taklit eder.
- Appen, Amazon Mechanical Turk ve Telus International gibi platformlar, denetimli öğrenme için insan tarafından üretilmiş veri setleri sağlar.
- Hazy ve Gretel.ai, kurumsal kullanım için sentetik yapılandırılmış veri üretir.
- Kaggle Datasets ve Google Dataset Search gibi açık depolar, birden çok alanda herkese açık veri sağlar.
Bu veri setleri, makine öğrenimi modellerinin gizlilik standartlarına uyarken çeşitli ve temsili verilere erişmesini sağlar.
Alana Özgü ve Sektörel Veri Setleri
Alana özgü veri setleri, sağlık, finans, robotik ve otonom sürüş gibi belirli sektörlerdeki uygulamalara odaklanır. Sektörle ilgili görevlerde model eğitimi için özel, etiketli veri sağlarlar.
- MIMIC-IV ve PhysioNet tıbbi araştırma ve sağlık analitiğini destekler.
- Waymo Open Dataset ve KITTI, otonom araçlarda bilgisayarlı görü için kullanılır.
- AGIBOT WORLD 2026, EgoDex ve EgoVerse gibi robotik ve somutlaştırılmış yapay zeka veri setleri, fiziksel yapay zeka ve insansı sistemlerin eğitimi için birinci şahıs (benmerkezci) video ve manipülasyon verisi sağlar.
- GMAI-MMBench ve OmniMedVQA gibi çoklu modlu tıbbi benchmark'lar, birçok görüntüleme modalitesinde klinik görsel soru cevaplamayı değerlendirir.
- World Bank Open Data ve OECD veri setleri ekonomik ve finansal göstergeler sağlar.
- Common Voice ve Free Music Archive ses ve dil modeli geliştirmeyi destekler.
Bu veri setleri, kuruluşların ve araştırmacıların sektör zorluklarına ve belirli veri ortamlarına uygun modeller geliştirmesine yardımcı olur.
ML Veri Setleri Nedir?
Bir makine öğrenimi veri seti, makine öğrenimi modellerini eğitmek için özel olarak toplanmış ve hazırlanmış yapılandırılmış bir veri koleksiyonudur. Bu makine öğrenimi veri setleri, modelin desenleri öğrenmesine, anlamlı özellikler çıkarmasına ve görülmeyen veriler üzerinde tahminler yapmasına yardımcı olan örnekler görevi görür.
Göreve bağlı olarak, makine öğrenimi veri seti aşağıdakiler dahil çeşitli veri türlerinden oluşabilir:
- Metin verisi: Doğal dil işleme, duygu analizi ve makine çevirisi gibi uygulamalarda kullanılır.
- Görüntü verisi: Çoğunlukla el yazısı rakam tanıma veya çelik plaka hata tespiti gibi görevler için bilgisayarlı görü ve evrişimli sinir ağlarında kullanılır.
- Ses verisi: Konuşma tanıma veya ses sınıflandırma görevleri için.
- Video verisi: Nesne takibi veya gerçek zamanlı video analizi için
- Sayısal veri: Bazen kütle spektrometresi verilerinden veya zaman damgası günlüklerinden gelen, regresyon veya sınıflandırma görevlerinde kullanılır.
Çoğu makine öğrenimi projesi, daha sonra etiketlenen veya açıklanan ham verilerle başlar. Bu etiketleme, makine öğrenimi sisteminin sınıflandırma, regresyon veya diğer tahmin görevleri için beklenen sonucu anlamasına yardımcı olur.
Genellikle açık, herkese açık veya özel makine öğrenimi depolarından elde edilen iyi bir veri seti, model performansını önemli ölçüde artırabilir.
Makine Öğrenimi İçin Veri Setleri Neden Hazırlanır?
Yapay zeka sistemleri geliştirmede en kritik adımlardan biri, yüksek kaliteli veri setleri hazırlamak ve seçmektir. Birçok kuruluş, veri hazırlamanın makine öğrenimi projelerini başarıya ulaştırabileceğini veya başarısızlığa uğratabileceğini kabul etmektedir.
Eğitim verilerinin kalitesi, modellerin gerçek dünya senaryolarına ne kadar iyi genelleme yaptığını ve belirli sorunları ne kadar doğru ele aldığını etkiler. Bir makine öğrenimi veri setinin üç temel amacı vardır:
Modeli eğitmek
Eğitim seti, makineye veri içindeki ilişkileri ve desenleri öğretir. Bu, açıklamalı veya etiketli verileri beslemeyi içerir ve modelin parametrelerini ayarlayarak benzer girdiler üzerindeki tahminlerini geliştirmesini sağlar.
Model doğruluğunu ölçmek
Eğitimden sonra, test veri seti (veya test seti) modelin performansını değerlendirmek için kullanılır. Bu, modelin görülmeyen verileri ne kadar iyi işlediğini ve eğitim setine aşırı uyum sağlayıp sağlamadığını veya anlamlı desenler öğrenip öğrenmediğini belirlemeye yardımcı olur.
Dağıtım sonrası modeli iyileştirmek
Dağıtıldıktan sonra, makine öğrenimi modelleri genellikle ek toplanan veriler kullanılarak rafine edilir, bu da yeni koşullara veya sınıflara uyum sağlamalarına yardımcı olur. Doğrulama setleri ayrıca ayarlamaya ve aşırı uyumu önlemeye yardımcı olur.
Bir Veri Ortağıyla Çalışmak
Veri setleri hazırlamak, özellikle kapsamlı koleksiyonlar, eksik değerler veya karmaşık açıklamalar söz konusu olduğunda kaynak yoğun olabilir. Birçok kuruluş bu süreci bir veri toplama veya üretim hizmeti sağlayıcısı ile yürütür.
İster duygu analizi, metin sınıflandırması veya yüz bitki türünü tanımlama gibi görüntü tabanlı görevler için makine öğrenimi veri setlerine ihtiyacınız olsun, alana özgü veri setleri oluşturmak için bir veri kitle kaynak platformu veya veri bilimi hizmetlerinde uzmanlaşmış bir şirketle işbirliği yapabilirsiniz.
Bazen veriler, web kazıma yoluyla toplanır veya Google Dataset Search veya açık veri girişimleri gibi araçlar aracılığıyla erişilir.
Derin öğrenme modelleri veya bilgisayarlı görü sistemleri için veri setleri gibi özel ihtiyaçlar için, seçilmiş herkese açık veri setlerine veya ücretsiz veri setlerine güvenmek, eğitim verilerinin gerekli örnek ve sınıf aralığını kapsamasını sağlar.
Sonuç
Doğru veri setini seçmek, herhangi bir makine öğrenimi veya yapay zeka projesinde temel bir adımdır. İster insan tarafından üretilmiş veri, ister makine tarafından üretilmiş sentetik veri veya serbestçe erişilebilen açık veri setlerini tercih edin, önemli olan veri seçiminizi projenizin belirli hedefleri ve zorluklarıyla uyumlu hale getirmektir.
Yüksek kaliteli ve iyi hazırlanmış veri setleri, bir modelin ne kadar etkili öğrendiğini, genelleme yaptığını ve gerçek dünya uygulamalarında performans gösterdiğini doğrudan etkiler.
Kuruluşlar ve uygulayıcılar, veri setlerinin türlerini ve rollerini, eğitim, doğrulama ve test setlerini anlayarak ve mevcut veri kaynaklarının zengin ekosistemini keşfederek yapay zeka geliştirmenin karmaşıklıklarında daha iyi yol alabilirler.
Veri kalitesine, uygunluğuna ve çeşitliliğine gösterilen özen, modellerin doğru olmasını ve gelişen ihtiyaçlara uyarlanabilir olmasını sağlar.
SSS'ler
Makine öğrenimi için veri setleri bulmak amacıyla, veri bilimciler demografik veri, ekonomik ve finansal veri ve kamu hükümet verileri dahil olmak üzere çeşitli veri setleri sunan çeşitli veri depolarını keşfedebilirler. Bu seçilmiş veri setleri, doğal dil işleme, duygu analizi, bilgisayarlı görü ve sağlık gibi bir dizi uygulamayı kapsar.
Açık veri setleri, ücretsiz veri setleri ve herkese açık veri setleri gibi kaynaklar, CSV dosyaları gibi çeşitli veri formatlarında yüksek kaliteli eğitim verileri, doğrulama veri setleri ve test veri setleri sağlar. Popüler kaynaklar arasında hükümet portalları, akademik kurumlar ve Uluslararası Para Fonu gibi kuruluşlar bulunur ve makine öğrenimi projeleri, tahmine dayalı modeller ve derin öğrenme algoritmaları için kapsamlı veri seti koleksiyonları sunar.
İyi bir makine öğrenimi veri seti, doğal dil işleme, görüntü sınıflandırma veya duygu analizi gibi belirli görevler için uygun, zengin meta verilere sahip, yüksek kaliteli, çeşitli bir veri setidir ve genellikle herkese açık veri depolarından veya açık veri setlerinden temin edilebilir.
Bu araştırmayı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Ermut, Sıla},
title = {{+100 ML & YZ Modelleri için Veri Seti}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/datasets-for-ml}},
note = {AIMultiple. Erişim tarihi: 10 Haziran 2026}
}Cem'in çalışmaları Business Insider, Forbes, Washington Post gibi önde gelen küresel yayınlar, Deloitte, HPE gibi küresel firmalar, Dünya Ekonomik Forumu gibi STK'lar ve Avrupa Komisyonu gibi uluslarüstü kuruluşlar tarafından alıntılanmıştır.
Cem, kariyeri boyunca teknoloji danışmanı, teknoloji alıcısı ve teknoloji girişimcisi olarak görev yapmıştır. On yıldan fazla bir süre McKinsey & Company ve Altman Solon'da işletmelere teknoloji kararlarında danışmanlık yapmıştır. Ayrıca dijitalleşme üzerine bir McKinsey raporu yayımlamıştır.
CEO'ya rapor verirken bir telekomünikasyon şirketinin teknoloji stratejisini ve satın alımını yönetmiştir. Ayrıca, 2 yıl içinde 0'dan 7 haneli yıllık yinelenen gelire ve 9 haneli değerlemeye ulaşan derin teknoloji şirketi Hypatos'un ticari büyümesini yönetmiştir. Cem'in Hypatos'taki çalışmaları TechCrunch ve Business Insider gibi önde gelen teknoloji yayınları tarafından ele alınmıştır.
Cem, uluslararası teknoloji konferanslarında düzenli olarak konuşma yapmaktadır. Boğaziçi Üniversitesi'nden bilgisayar mühendisi olarak mezun olmuş ve Columbia Business School'dan MBA derecesine sahiptir.
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.