Premium
Hizmetler
Premium

Konuşmadan Metne Karşılaştırma: Deepgram vs. Whisper

Cem Dilmegani
Cem Dilmegani
Güncellenme tarihi: 21 Ağu 2026

Önde gelen konuşmadan metne (STT) sağlayıcılarını, özellikle sağlık hizmeti uygulamalarına odaklanarak karşılaştırdık. Karşılaştırmamız, hassasiyetin kritik olduğu tıbbi bağlamlarda transkripsiyon doğruluğunu değerlendirmek için gerçek dünya örneklerini kullandı.

Konuşmadan metne karşılaştırma sonuçları

Hem kelime hata oranı (WER) hem de karakter hata oranı (CER) sonuçlarına göre, GPT-4o-transcribe değerlendirilen tüm konuşmadan metne sistemleri arasında en yüksek transkripsiyon doğruluğunu gösteriyor. Deepgram Nova-v3 ve Gladia da her iki ölçümde düşük hata oranlarını koruyarak güçlü performans sergiliyor.

Grafik Yükleniyor

Metodoloji

Dataset

Hem küçük ve çeşitli örneklerde hem de uzun bir örnekte model'lerin performanslarını değerlendirmek istedik; bu nedenle iki görev gerçekleştirdik:

Görev 1: Sağlık hizmeti ses verileri

  • Toplam örnek sayısı: 100
  • Toplam süre: 9 dakika ve 25 saniye
  • Örnek başına ortalama süre: 5,65 saniye
  • İçerik: Tıbbi terminoloji, hasta etkileşimleri ve klinik görüşmeler dahil sağlık hizmeti ses verileri
  • Çeşitlilik: Farklı konuşmacılar, değişen ses kalitesi ve İngilizce konuşulan çeşitli tıbbi bağlamlar

Ses özellikleri:

  • Format: WAV
  • Kanallar: 1 (Mono)
  • Örnek genişliği: 16-bit
  • Örnekleme hızı: 16 kHz
  • Sabit bit hızı: 256 kbps
  • Süre aralığı: dosya başına ~4.5 ila 11,5 saniye

Görev 2: Bir anatomi dersi

  • Toplam örnek sayısı: 1
  • Toplam süre: 8 dakika ve 35 saniye
  • İçerik: Bir doktor tarafından verilen, tıbbi terminolojiyi de içeren bir anatomi dersi
  • Çeşitlilik: Videonun ilk yarısında bir konuşmacı İngilizce konuşuyor; arka planda müzik çalıyor.

Ses özellikleri:

  • Format: WAV
  • Kanallar: 2 (Stereo)
  • Örnek genişliği: 16-bit
  • Örnekleme hızı: 48 kHz
  • Sabit bit hızı: 1536 kbps

Değerlendirme ölçütleri

Transkripsiyon doğruluğu için değerlendirme ölçütleri olarak kelime hata oranı (WER) ve karakter hata oranı (CER) kullandık. Kelime hata oranı şu şekilde hesaplanır:

WER = (S + D + I) / N

Burada:

  • S = Değiştirme sayısı
  • D = Silme sayısı
  • I = Ekleme sayısı
  • N = Referans metindeki toplam kelime sayısı

Formül, hipotezi referansa dönüştürmek için gereken minimum kelime düzeyindeki işlem sayısını, referanstaki kelime sayısına bölerek hesaplar. Daha düşük WER daha iyi doğruluğu gösterir; %0 mükemmel eşleşmedir.

Karakter hata oranı (CER), toplam karakter düzeyindeki hata sayısının (eklemeler, silmeler ve değiştirmeler dahil) referans metnindeki toplam karakter sayısına bölünmesiyle hesaplanır.

Ses dosyalarını metne dönüştürmek için konuşmadan metne API'leri kullandık.

Sağlayıcılar tarafından bir defada girilebilen maksimum dosya boyutu tabloda gösterilmiştir:

*Vosk yerel olarak çalıştığı için girdi dosya boyutunda bir sınır yoktur. Ancak uzun ses dosyaları beam sınırını aşarak bazı olasılıkların kaybolmasına neden olabilir. Bu nedenle dosyaların 1–2 dakikalık bölümlere ayrılması önerilir.

Google MedASR da yerel olarak çalışır ve maksimum dosya boyutu sınırı uygulamaz. Optimum performans ve kaynak yönetimi için uzun dosyaların daha küçük bölümler hâlinde işlenmesi önerilir.

Not: Daha küçük dosya boyutu sınırlarına sahip sağlayıcılar için (örneğin Google ve OpenAI), daha büyük ses dosyaları işlenmeden önce daha küçük parçalara bölünmelidir. Bunu Görev 2'de gerçekleştirdik.

Konuşma tanıma

Konuşma tanıma, bilgisayarların makine öğrenmesi algoritmalarını kullanarak ses dosyalarını metne dönüştürmesini sağlar. Bir transkripsiyon hizmetinin API'si, toplu transkripsiyon için çeşitli programlama dilleriyle kullanılabilir. Bu platformlar hem gerçek zamanlı hem de eşzamansız transkripsiyonu destekler.

Konuşma tanıma teknolojisinin transkripsiyon, sesli asistanlar ve dil çevirisi dahil çok sayıda uygulaması vardır.

Transkripsiyon için konuşma tanıma kullanmanın faydaları

  • Ses dosyalarının hızlı transkripsiyonu
  • Zaman ve çaba tasarrufu
  • Gerçek zamanlı transkripsiyon ve çeviri
  • Engelli bireyler için erişilebilirlik
Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Konuşmadan metne yapay zeka araçları nasıl çalışır?

Transkripsiyon süreci şunları içerir:

  • Ses verileri konuşmadan metne aracına yüklenir veya akışla iletilir
  • Ses verilerini analiz etmek ve konuşmadaki kalıpları belirlemek için makine öğrenmesi algoritmalarının kullanılması
  • Araç, bir konuşmadan metne motoru kullanarak konuşmayı metne dönüştürür
  • Transkripsiyonu yapılan metin daha sonra kullanıcıya gösterilir.

SSS'ler

Sesin transkripsiyonu ve video kayıtları şu alanlarda kullanılabilir:
Sesli asistanlar ve sanal asistanlar
Dil çevirisi ve yorumlama
Engelli bireyler için konuşmadan metne (ASR) sistemleri

Önceden eğitilmiş model'leri, kayıtlı ses ve video dosyaları için otomatik konuşma tanımayı (ASR) sağlar. Yüksek doğruluklu ses transkripsiyonları otomatik noktalama ve konu tespiti içerir.
Şirketinizin hâlihazırda çalıştığı bir hizmetten açık kaynaklı bir motor veya bir konuşma tanıma sağlayıcısı (ör. Google Cloud, AWS transcribe), şirketinizin ihtiyaçları için transkripsiyon çözümü olarak seçilebilir. Bazıları ayrıca ücretsiz kredi sunar, ancak veri güvenliği konusunda dikkatli olmanızı öneririz.

Bir konuşmadan metne API'si, ses dosyalarını metne dönüştürmeye yardımcı olabilir. Ses verilerinin işlenmesi ve analizi:
Ses verileri gürültü azaltma ve yankı giderme gibi teknikler kullanılarak işlenir
Ses verileri daha sonra konuşmadaki kalıpları belirlemek için makine öğrenmesi algoritmaları ile analiz edilir
Algoritmalar, konuşulan sözcükleri ve ifadeleri tanımak için akustik model'ler ve dil model'leri kullanır
Makine öğrenmesi algoritmaları kullanarak konuşmayı metne dönüştürme:
Makine öğrenmesi algoritmaları, büyük ses ve metin verisi dataset'leri üzerinde eğitilir
Algoritmalar konuşmadaki kalıpları tanımayı ve bunları metne dönüştürmeyi öğrenir
Algoritmalar belirli kullanım alanları ve diller için fine-tune edilebilir ve özelleştirilebilir

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

İleri okuma

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Cem Dilmegani and Şevval Alper (2026) - "Konuşmadan Metne Karşılaştırma: Deepgram vs. Whisper". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 21 Ağustos 2026, kaynak: https://aimultiple.com/speech-to-text [Çevrimiçi Kaynak]

Dilmegani, C., & Alper, Ş. (2026, 21 Ağustos). Konuşmadan Metne Karşılaştırma: Deepgram vs. Whisper. AIMultiple. https://aimultiple.com/speech-to-text

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Alper, Şevval},
  title  = {{Konuşmadan Metne Karşılaştırma: Deepgram vs. Whisper}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/speech-to-text}},
  note   = {AIMultiple. Erişim tarihi: 21 Ağustos 2026}
}
Tüm verileri indir

12 veri noktasının sonuçları ve zaman damgaları. Bu makaledeki grafik ve tablolarda gösterilen özet verileri, bir CSV dosyası içeren ZIP dosyası olarak indirin.

Son güncelleme: 27 Eylül 2026
İndir

Arkasındaki ayrıntılı veriyi ister misiniz? Premium'a katılın

Değişiklik günlüğü

1 güncelleme
  1. “Benchmark sonuçları” bölümündeki benchmark sonuçları güncellendi.

Cem Dilmegani
Cem Dilmegani
Baş Analist
Cem, 2017'den beri AIMultiple bünyesinde baş analisttir. Cem'in AIMultiple'daki çalışmaları; Business Insider, Forbes, Morning Brew ve Washington Post gibi önde gelen küresel yayınlar, Deloitte ve HPE gibi küresel firmalar, Dünya Ekonomik Forumu gibi STK'lar ve Avrupa Komisyonu gibi uluslarüstü kuruluşlar tarafından alıntılanmıştır. [1], [2], [3], [4], [5] Kariyeri boyunca Cem; teknoloji danışmanı, teknoloji alıcısı ve teknoloji girişimcisi olarak görev yaptı. On yılı aşkın süre boyunca McKinsey & Company ve Altman Solon'da işletmelere teknoloji kararlarında danışmanlık yaptı. Ayrıca dijitalleşme üzerine bir McKinsey raporu yayımladı. CEO'ya rapor verirken bir telekom şirketinin teknoloji stratejisini ve satın alma süreçlerini yönetti. Ayrıca 2 yıl içinde 0'dan 7 haneli yıllık yinelenen gelire ve 9 haneli değerlemeye ulaşan derin teknoloji şirketi Hypatos'un ticari büyümesini yönetti. Cem'in Hypatos'taki çalışmaları TechCrunch ve Business Insider gibi önde gelen teknoloji yayınları tarafından ele alındı. Cem, uluslararası teknoloji konferanslarında düzenli olarak konuşma yapmaktadır. Boğaziçi Üniversitesi'nden bilgisayar mühendisi olarak mezun oldu ve Columbia Business School'dan MBA derecesine sahiptir.
Tam Profili Görüntüle
Araştıran
Şevval Alper
Şevval Alper
Yapay Zeka Araştırmacısı
Şevval, AIMultiple'da bir yapay zeka araştırmacısıdır. Kaotik sistemler kullanarak sözde rastgele sayı üretimi konusunda daha önce araştırma deneyimine sahiptir.
Şevval, yapay zeka kodlama araçları, yapay zeka ajanları ve kuantum teknolojilerine odaklanmaktadır.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450