Hizmetler
Bize Ulaşın

+100 ML & YZ Modelleri için Veri Seti

Cem Dilmegani
Cem Dilmegani
Güncellenme tarihi: 10 Haz 2026

Veri, üretken yapay zeka veya konuşmalı yapay zeka çözümlerinden yararlanmak ya da oluşturmak için gereklidir. Piyasada bulunan mevcut veri setlerini kullanabilir veya bir veri toplama hizmeti ile anlaşabilirsiniz.

Makine öğrenimi ve yapay zeka modellerini eğitmek ve değerlendirmek için 100'den fazla veri seti belirledik.

Büyük Dil Modelleri (LLM'ler) ve Ajan Yapay Zeka Veri Setleri

Veri Seti / Benchmark
Açıklama
Ücretsiz / Ücretli
Son Güncelleme
MMLU (Massive Multitask Language Understanding)
Genel akıl yürütme ve akademik bilgi için benchmark
Ücretsiz
Devam ediyor
HumanEval+
Üretken kod için Python kodlama benchmark'ı
Ücretsiz
Devam ediyor
FineWeb
Hugging Face'in LLM ön eğitimi için veri seti
Ücretsiz
Devam ediyor
FineWeb-Edu
FineWeb'in eğitim alt kümesi
Ücretsiz
Devam ediyor
BFCL (Berkeley Function Calling Leaderboard)
Araç/fonksiyon çağrısını değerlendirmek için sürekli güncellenen standart
Ücretsiz
Devam ediyor
Superior-Reasoning-SFT
Alibaba-Apsara'nın Uzun-CoT akıl yürütme veri seti
Ücretsiz
2026
Terminal-Bench 2.0
89 gerçekçi terminal görevi (dosya manipülasyonu, sistem yönetimi, hata ayıklama, araştırma kodunu yeniden uygulama)
Ücretsiz
2026
MMMU (Massive Multi-disciplinary Multimodal Understanding)
Çoklu mod benchmark'ı (görüntü + metin akıl yürütme)
Ücretsiz
2025
Humanity’s Last Exam (HLE)
MMLU'nun ötesinde en ileri LLM'leri test etmek için çoklu mod benchmark'ı
Ücretsiz
2025
YZ Idea Bench (2025)
LLM'lerin yeni araştırma fikirleri sentezleme yeteneğini test eder
Ücretsiz (araştırma)
2025

Bu kategori, gelişmiş dil ve çoklu mod modellerini eğitmek ve değerlendirmek için tasarlanmış veri setlerini ve benchmark'ları içerir. Bu veri setleri, akıl yürütme, metin üretimi, soru cevaplama ve yaratıcı görevlerde model yeteneklerini değerlendirmeye yardımcı olur.

  • Büyük dil modeli benchmark'ları MMLU ve GPQA gibi genel ve bilimsel akıl yürütmeyi ölçer.
  • Çoklu mod veri setleri, LAION-5B gibi, metin ve görüntüleri birleştirerek her iki formatı da işleyebilen modelleri eğitir.
  • İleri düzey değerlendirmeler, Humanity’s Last Exam, ARC-AGI-2 ve YZ Idea Bench gibi, modellerin yaratıcılığını, olgusal doğruluğunu ve karmaşık istemlere uyum yeteneğini test eder.
  • Ajan ve araç kullanımı benchmark'ları, GAIA, BFCL (Berkeley Function Calling Leaderboard) ve ComplexFuncBench gibi, çok adımlı akıl yürütmeyi, araç çağırmayı ve görev tamamlamayı değerlendirir.
  • Ön eğitim derlemeleri, FineWeb, Nemotron-CC ve Essential-Web v1.0 gibi, temel modelleri eğitmek için büyük ölçekli token koleksiyonları sağlar.

Yapay Zeka Kodlama ve Yazılım Mühendisliği Veri Setleri

Bu kategori, kod üretimi, anlama, hata ayıklama ve çeviri için veri setlerini kapsar. Programcılara yardımcı olan veya yazılım geliştirme görevlerini otomatikleştiren sistemler oluşturmak ve değerlendirmek için kullanılırlar.

  • The Heap ve MADE-WIC gibi veri setleri, kodlama doğruluğunu ve teknik borcu değerlendirmek için çok dilli ve açıklamalı kod içerir.
  • HumanEval ve APPS, kod üretim kalitesini kıyaslamak için referans çözümlerle birlikte kodlama problemleri sağlar.
  • Repo düzeyinde ve ajan benchmark'ları, SWE-Bench Pro, SWE-Bench Multilingual, SWE-Lancer ve Terminal-Bench 2.0 gibi, modelleri yalıtılmış fonksiyonlar yerine gerçek GitHub sorunları ve uçtan uca yazılım görevleri üzerinde değerlendirir.
  • Amazon CodeWhisperer ve GitHub Copilot gibi ticari veri setleri, ticari kodlama asistanlarını destekler.

HumanEval ve SWE-bench Verified gibi eski benchmark'lar artık yaygın olarak kontamine olmuş veya doygunluğa ulaşmış kabul edilmektedir; bunun sonucunda SWE-Bench Pro gibi kontaminasyona dayanıklı halefler ortaya çıkmıştır. Bu veri setleri, kodlama modellerinin tutarlı bir şekilde test edilmesini sağlar ve yazılımı verimli bir şekilde analiz edebilen veya üretebilen araçların oluşturulmasını destekler.

Siber Güvenlik ve Veri Güvenliği Veri Setleri

Siber güvenlik veri setleri, dijital tehditleri tespit etmek, sınıflandırmak ve önlemek için bilgi sağlar. Ağ trafiği günlükleri, zararlı yazılım örnekleri ve güvenlik açığı veritabanlarını içerirler.

  • CICIDS2017 ve TON_IoT, saldırı ve anomali tespit sistemlerini eğitmek için yaygın olarak kullanılır.
  • EMBER ve VirusShare veri setleri, model tabanlı sınıflandırma için etiketlenmiş zararlı yazılım verileri içerir.
  • CVE-MITRE veritabanı, bilinen yazılım güvenlik açıkları hakkında yapılandırılmış bilgi sağlar.

Bu veri setleri, siber güvenlik alanında araştırma ve model eğitimini destekleyerek sistemlerin gerçek saldırı desenlerinden öğrenmesine ve tehdit tanımlamayı geliştirmesine olanak tanır.

Veri, Sentetik Veri ve Gizlilik Veri Setleri

Bu kategori, kuruluşların veri gizliliğini ve kalitesini korurken modelleri eğitmelerine yardımcı olan açık ve sentetik veri setlerini içerir. Sentetik veri, kişisel veya özel bilgileri ifşa etmeden gerçek dünya dağılımlarını taklit eder.

  • Appen, Amazon Mechanical Turk ve Telus International gibi platformlar, denetimli öğrenme için insan tarafından üretilmiş veri setleri sağlar.
  • Hazy ve Gretel.ai, kurumsal kullanım için sentetik yapılandırılmış veri üretir.
  • Kaggle Datasets ve Google Dataset Search gibi açık depolar, birden çok alanda herkese açık veri sağlar.

Bu veri setleri, makine öğrenimi modellerinin gizlilik standartlarına uyarken çeşitli ve temsili verilere erişmesini sağlar.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Alana Özgü ve Sektörel Veri Setleri

Alana özgü veri setleri, sağlık, finans, robotik ve otonom sürüş gibi belirli sektörlerdeki uygulamalara odaklanır. Sektörle ilgili görevlerde model eğitimi için özel, etiketli veri sağlarlar.

  • MIMIC-IV ve PhysioNet tıbbi araştırma ve sağlık analitiğini destekler.
  • Waymo Open Dataset ve KITTI, otonom araçlarda bilgisayarlı görü için kullanılır.
  • AGIBOT WORLD 2026, EgoDex ve EgoVerse gibi robotik ve somutlaştırılmış yapay zeka veri setleri, fiziksel yapay zeka ve insansı sistemlerin eğitimi için birinci şahıs (benmerkezci) video ve manipülasyon verisi sağlar.
  • GMAI-MMBench ve OmniMedVQA gibi çoklu modlu tıbbi benchmark'lar, birçok görüntüleme modalitesinde klinik görsel soru cevaplamayı değerlendirir.
  • World Bank Open Data ve OECD veri setleri ekonomik ve finansal göstergeler sağlar.
  • Common Voice ve Free Music Archive ses ve dil modeli geliştirmeyi destekler.

Bu veri setleri, kuruluşların ve araştırmacıların sektör zorluklarına ve belirli veri ortamlarına uygun modeller geliştirmesine yardımcı olur.

ML Veri Setleri Nedir?

Bir makine öğrenimi veri seti, makine öğrenimi modellerini eğitmek için özel olarak toplanmış ve hazırlanmış yapılandırılmış bir veri koleksiyonudur. Bu makine öğrenimi veri setleri, modelin desenleri öğrenmesine, anlamlı özellikler çıkarmasına ve görülmeyen veriler üzerinde tahminler yapmasına yardımcı olan örnekler görevi görür.

Göreve bağlı olarak, makine öğrenimi veri seti aşağıdakiler dahil çeşitli veri türlerinden oluşabilir:

  • Metin verisi: Doğal dil işleme, duygu analizi ve makine çevirisi gibi uygulamalarda kullanılır.
  • Görüntü verisi: Çoğunlukla el yazısı rakam tanıma veya çelik plaka hata tespiti gibi görevler için bilgisayarlı görü ve evrişimli sinir ağlarında kullanılır.
  • Ses verisi: Konuşma tanıma veya ses sınıflandırma görevleri için.
  • Video verisi: Nesne takibi veya gerçek zamanlı video analizi için
  • Sayısal veri: Bazen kütle spektrometresi verilerinden veya zaman damgası günlüklerinden gelen, regresyon veya sınıflandırma görevlerinde kullanılır.

Çoğu makine öğrenimi projesi, daha sonra etiketlenen veya açıklanan ham verilerle başlar. Bu etiketleme, makine öğrenimi sisteminin sınıflandırma, regresyon veya diğer tahmin görevleri için beklenen sonucu anlamasına yardımcı olur.

Genellikle açık, herkese açık veya özel makine öğrenimi depolarından elde edilen iyi bir veri seti, model performansını önemli ölçüde artırabilir.

Makine Öğrenimi İçin Veri Setleri Neden Hazırlanır?

Yapay zeka sistemleri geliştirmede en kritik adımlardan biri, yüksek kaliteli veri setleri hazırlamak ve seçmektir. Birçok kuruluş, veri hazırlamanın makine öğrenimi projelerini başarıya ulaştırabileceğini veya başarısızlığa uğratabileceğini kabul etmektedir.

Eğitim verilerinin kalitesi, modellerin gerçek dünya senaryolarına ne kadar iyi genelleme yaptığını ve belirli sorunları ne kadar doğru ele aldığını etkiler. Bir makine öğrenimi veri setinin üç temel amacı vardır:

Modeli eğitmek

Eğitim seti, makineye veri içindeki ilişkileri ve desenleri öğretir. Bu, açıklamalı veya etiketli verileri beslemeyi içerir ve modelin parametrelerini ayarlayarak benzer girdiler üzerindeki tahminlerini geliştirmesini sağlar.

Model doğruluğunu ölçmek

Eğitimden sonra, test veri seti (veya test seti) modelin performansını değerlendirmek için kullanılır. Bu, modelin görülmeyen verileri ne kadar iyi işlediğini ve eğitim setine aşırı uyum sağlayıp sağlamadığını veya anlamlı desenler öğrenip öğrenmediğini belirlemeye yardımcı olur.

Dağıtım sonrası modeli iyileştirmek

Dağıtıldıktan sonra, makine öğrenimi modelleri genellikle ek toplanan veriler kullanılarak rafine edilir, bu da yeni koşullara veya sınıflara uyum sağlamalarına yardımcı olur. Doğrulama setleri ayrıca ayarlamaya ve aşırı uyumu önlemeye yardımcı olur.

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Bir Veri Ortağıyla Çalışmak

Veri setleri hazırlamak, özellikle kapsamlı koleksiyonlar, eksik değerler veya karmaşık açıklamalar söz konusu olduğunda kaynak yoğun olabilir. Birçok kuruluş bu süreci bir veri toplama veya üretim hizmeti sağlayıcısı ile yürütür.

İster duygu analizi, metin sınıflandırması veya yüz bitki türünü tanımlama gibi görüntü tabanlı görevler için makine öğrenimi veri setlerine ihtiyacınız olsun, alana özgü veri setleri oluşturmak için bir veri kitle kaynak platformu veya veri bilimi hizmetlerinde uzmanlaşmış bir şirketle işbirliği yapabilirsiniz.

Bazen veriler, web kazıma yoluyla toplanır veya Google Dataset Search veya açık veri girişimleri gibi araçlar aracılığıyla erişilir.

Derin öğrenme modelleri veya bilgisayarlı görü sistemleri için veri setleri gibi özel ihtiyaçlar için, seçilmiş herkese açık veri setlerine veya ücretsiz veri setlerine güvenmek, eğitim verilerinin gerekli örnek ve sınıf aralığını kapsamasını sağlar.

Sonuç

Doğru veri setini seçmek, herhangi bir makine öğrenimi veya yapay zeka projesinde temel bir adımdır. İster insan tarafından üretilmiş veri, ister makine tarafından üretilmiş sentetik veri veya serbestçe erişilebilen açık veri setlerini tercih edin, önemli olan veri seçiminizi projenizin belirli hedefleri ve zorluklarıyla uyumlu hale getirmektir.

Yüksek kaliteli ve iyi hazırlanmış veri setleri, bir modelin ne kadar etkili öğrendiğini, genelleme yaptığını ve gerçek dünya uygulamalarında performans gösterdiğini doğrudan etkiler.

Kuruluşlar ve uygulayıcılar, veri setlerinin türlerini ve rollerini, eğitim, doğrulama ve test setlerini anlayarak ve mevcut veri kaynaklarının zengin ekosistemini keşfederek yapay zeka geliştirmenin karmaşıklıklarında daha iyi yol alabilirler.

Veri kalitesine, uygunluğuna ve çeşitliliğine gösterilen özen, modellerin doğru olmasını ve gelişen ihtiyaçlara uyarlanabilir olmasını sağlar.

SSS'ler

Makine öğrenimi için veri setleri bulmak amacıyla, veri bilimciler demografik veri, ekonomik ve finansal veri ve kamu hükümet verileri dahil olmak üzere çeşitli veri setleri sunan çeşitli veri depolarını keşfedebilirler. Bu seçilmiş veri setleri, doğal dil işleme, duygu analizi, bilgisayarlı görü ve sağlık gibi bir dizi uygulamayı kapsar.

Açık veri setleri, ücretsiz veri setleri ve herkese açık veri setleri gibi kaynaklar, CSV dosyaları gibi çeşitli veri formatlarında yüksek kaliteli eğitim verileri, doğrulama veri setleri ve test veri setleri sağlar. Popüler kaynaklar arasında hükümet portalları, akademik kurumlar ve Uluslararası Para Fonu gibi kuruluşlar bulunur ve makine öğrenimi projeleri, tahmine dayalı modeller ve derin öğrenme algoritmaları için kapsamlı veri seti koleksiyonları sunar.

İyi bir makine öğrenimi veri seti, doğal dil işleme, görüntü sınıflandırma veya duygu analizi gibi belirli görevler için uygun, zengin meta verilere sahip, yüksek kaliteli, çeşitli bir veri setidir ve genellikle herkese açık veri depolarından veya açık veri setlerinden temin edilebilir.

Bu araştırmayı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Cem Dilmegani and Sıla Ermut (2026) - "+100 ML & YZ Modelleri için Veri Seti". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 10 Haziran 2026, kaynak: https://aimultiple.com/datasets-for-ml [Çevrimiçi Kaynak]

Dilmegani, C., & Ermut, S. (2026, 10 Haziran). +100 ML & YZ Modelleri için Veri Seti. AIMultiple. https://aimultiple.com/datasets-for-ml

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Ermut, Sıla},
  title  = {{+100 ML & YZ Modelleri için Veri Seti}},
  year   = {2026},
  month  = jun,
  howpublished    = {\url{https://aimultiple.com/datasets-for-ml}},
  note   = {AIMultiple. Erişim tarihi: 10 Haziran 2026}
}
Cem Dilmegani
Cem Dilmegani
Baş Analist
Cem, 2017'den beri AIMultiple'da baş analisttir. AIMultiple, her ay Fortune 500'ün %60'ı dahil olmak üzere (similarWeb'e göre) yüz binlerce işletmeyi bilgilendirmektedir.

Cem'in çalışmaları Business Insider, Forbes, Washington Post gibi önde gelen küresel yayınlar, Deloitte, HPE gibi küresel firmalar, Dünya Ekonomik Forumu gibi STK'lar ve Avrupa Komisyonu gibi uluslarüstü kuruluşlar tarafından alıntılanmıştır.

Cem, kariyeri boyunca teknoloji danışmanı, teknoloji alıcısı ve teknoloji girişimcisi olarak görev yapmıştır. On yıldan fazla bir süre McKinsey & Company ve Altman Solon'da işletmelere teknoloji kararlarında danışmanlık yapmıştır. Ayrıca dijitalleşme üzerine bir McKinsey raporu yayımlamıştır.

CEO'ya rapor verirken bir telekomünikasyon şirketinin teknoloji stratejisini ve satın alımını yönetmiştir. Ayrıca, 2 yıl içinde 0'dan 7 haneli yıllık yinelenen gelire ve 9 haneli değerlemeye ulaşan derin teknoloji şirketi Hypatos'un ticari büyümesini yönetmiştir. Cem'in Hypatos'taki çalışmaları TechCrunch ve Business Insider gibi önde gelen teknoloji yayınları tarafından ele alınmıştır.

Cem, uluslararası teknoloji konferanslarında düzenli olarak konuşma yapmaktadır. Boğaziçi Üniversitesi'nden bilgisayar mühendisi olarak mezun olmuş ve Columbia Business School'dan MBA derecesine sahiptir.
Tam Profili Görüntüle
Araştıran
Sıla Ermut
Sıla Ermut
Endüstri Analisti
Sıla Ermut, AIMultiple'da yapay zeka model'leri, yapay zeka altyapısı, yapay zeka yönetişimi ve kurumsal yapay zeka uygulamalarını kapsayan bir endüstri analistidir. Araştırmaları çoğunlukla yapay zekanın pazarlama, sağlık hizmetleri, tedarik zincirleri ve sürdürülebilirlik alanlarındaki kullanımına odaklanmaktadır. Daha önce proje yönetimi ve danışmanlık firmalarında işe alım uzmanı olarak çalışmıştır. Sıla, Sosyal Psikoloji alanında Yüksek Lisans ve Uluslararası İlişkiler alanında Lisans derecesine sahiptir.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450