Önde gelen konuşmadan metne (STT) sağlayıcılarını, özellikle sağlık hizmeti uygulamalarına odaklanarak karşılaştırdık. Karşılaştırmamız, hassasiyetin kritik olduğu tıbbi bağlamlarda transkripsiyon doğruluğunu değerlendirmek için gerçek dünya örneklerini kullandı.
Konuşmadan metne karşılaştırma sonuçları
Hem kelime hata oranı (WER) hem de karakter hata oranı (CER) sonuçlarına göre, GPT-4o-transcribe değerlendirilen tüm konuşmadan metne sistemleri arasında en yüksek transkripsiyon doğruluğunu gösteriyor. Deepgram Nova-v3 ve Gladia da her iki ölçümde düşük hata oranlarını koruyarak güçlü performans sergiliyor.
Metodoloji
Dataset
Hem küçük ve çeşitli örneklerde hem de uzun bir örnekte model'lerin performanslarını değerlendirmek istedik; bu nedenle iki görev gerçekleştirdik:
Görev 1: Sağlık hizmeti ses verileri
- Toplam örnek sayısı: 100
- Toplam süre: 9 dakika ve 25 saniye
- Örnek başına ortalama süre: 5,65 saniye
- İçerik: Tıbbi terminoloji, hasta etkileşimleri ve klinik görüşmeler dahil sağlık hizmeti ses verileri
- Çeşitlilik: Farklı konuşmacılar, değişen ses kalitesi ve İngilizce konuşulan çeşitli tıbbi bağlamlar
Ses özellikleri:
- Format: WAV
- Kanallar: 1 (Mono)
- Örnek genişliği: 16-bit
- Örnekleme hızı: 16 kHz
- Sabit bit hızı: 256 kbps
- Süre aralığı: dosya başına ~4.5 ila 11,5 saniye
Görev 2: Bir anatomi dersi
- Toplam örnek sayısı: 1
- Toplam süre: 8 dakika ve 35 saniye
- İçerik: Bir doktor tarafından verilen, tıbbi terminolojiyi de içeren bir anatomi dersi
- Çeşitlilik: Videonun ilk yarısında bir konuşmacı İngilizce konuşuyor; arka planda müzik çalıyor.
Ses özellikleri:
- Format: WAV
- Kanallar: 2 (Stereo)
- Örnek genişliği: 16-bit
- Örnekleme hızı: 48 kHz
- Sabit bit hızı: 1536 kbps
Değerlendirme ölçütleri
Transkripsiyon doğruluğu için değerlendirme ölçütleri olarak kelime hata oranı (WER) ve karakter hata oranı (CER) kullandık. Kelime hata oranı şu şekilde hesaplanır:
WER = (S + D + I) / N
Burada:
- S = Değiştirme sayısı
- D = Silme sayısı
- I = Ekleme sayısı
- N = Referans metindeki toplam kelime sayısı
Formül, hipotezi referansa dönüştürmek için gereken minimum kelime düzeyindeki işlem sayısını, referanstaki kelime sayısına bölerek hesaplar. Daha düşük WER daha iyi doğruluğu gösterir; %0 mükemmel eşleşmedir.
Karakter hata oranı (CER), toplam karakter düzeyindeki hata sayısının (eklemeler, silmeler ve değiştirmeler dahil) referans metnindeki toplam karakter sayısına bölünmesiyle hesaplanır.
Ses dosyalarını metne dönüştürmek için konuşmadan metne API'leri kullandık.
Sağlayıcılar tarafından bir defada girilebilen maksimum dosya boyutu tabloda gösterilmiştir:
*Vosk yerel olarak çalıştığı için girdi dosya boyutunda bir sınır yoktur. Ancak uzun ses dosyaları beam sınırını aşarak bazı olasılıkların kaybolmasına neden olabilir. Bu nedenle dosyaların 1–2 dakikalık bölümlere ayrılması önerilir.
Google MedASR da yerel olarak çalışır ve maksimum dosya boyutu sınırı uygulamaz. Optimum performans ve kaynak yönetimi için uzun dosyaların daha küçük bölümler hâlinde işlenmesi önerilir.
Not: Daha küçük dosya boyutu sınırlarına sahip sağlayıcılar için (örneğin Google ve OpenAI), daha büyük ses dosyaları işlenmeden önce daha küçük parçalara bölünmelidir. Bunu Görev 2'de gerçekleştirdik.
Konuşma tanıma
Konuşma tanıma, bilgisayarların makine öğrenmesi algoritmalarını kullanarak ses dosyalarını metne dönüştürmesini sağlar. Bir transkripsiyon hizmetinin API'si, toplu transkripsiyon için çeşitli programlama dilleriyle kullanılabilir. Bu platformlar hem gerçek zamanlı hem de eşzamansız transkripsiyonu destekler.
Konuşma tanıma teknolojisinin transkripsiyon, sesli asistanlar ve dil çevirisi dahil çok sayıda uygulaması vardır.
Transkripsiyon için konuşma tanıma kullanmanın faydaları
- Ses dosyalarının hızlı transkripsiyonu
- Zaman ve çaba tasarrufu
- Gerçek zamanlı transkripsiyon ve çeviri
- Engelli bireyler için erişilebilirlik
Konuşmadan metne yapay zeka araçları nasıl çalışır?
Transkripsiyon süreci şunları içerir:
- Ses verileri konuşmadan metne aracına yüklenir veya akışla iletilir
- Ses verilerini analiz etmek ve konuşmadaki kalıpları belirlemek için makine öğrenmesi algoritmalarının kullanılması
- Araç, bir konuşmadan metne motoru kullanarak konuşmayı metne dönüştürür
- Transkripsiyonu yapılan metin daha sonra kullanıcıya gösterilir.
SSS'ler
Sesin transkripsiyonu ve video kayıtları şu alanlarda kullanılabilir:
Sesli asistanlar ve sanal asistanlar
Dil çevirisi ve yorumlama
Engelli bireyler için konuşmadan metne (ASR) sistemleri
Önceden eğitilmiş model'leri, kayıtlı ses ve video dosyaları için otomatik konuşma tanımayı (ASR) sağlar. Yüksek doğruluklu ses transkripsiyonları otomatik noktalama ve konu tespiti içerir.
Şirketinizin hâlihazırda çalıştığı bir hizmetten açık kaynaklı bir motor veya bir konuşma tanıma sağlayıcısı (ör. Google Cloud, AWS transcribe), şirketinizin ihtiyaçları için transkripsiyon çözümü olarak seçilebilir. Bazıları ayrıca ücretsiz kredi sunar, ancak veri güvenliği konusunda dikkatli olmanızı öneririz.
Bir konuşmadan metne API'si, ses dosyalarını metne dönüştürmeye yardımcı olabilir. Ses verilerinin işlenmesi ve analizi:
Ses verileri gürültü azaltma ve yankı giderme gibi teknikler kullanılarak işlenir
Ses verileri daha sonra konuşmadaki kalıpları belirlemek için makine öğrenmesi algoritmaları ile analiz edilir
Algoritmalar, konuşulan sözcükleri ve ifadeleri tanımak için akustik model'ler ve dil model'leri kullanır
Makine öğrenmesi algoritmaları kullanarak konuşmayı metne dönüştürme:
Makine öğrenmesi algoritmaları, büyük ses ve metin verisi dataset'leri üzerinde eğitilir
Algoritmalar konuşmadaki kalıpları tanımayı ve bunları metne dönüştürmeyi öğrenir
Algoritmalar belirli kullanım alanları ve diller için fine-tune edilebilir ve özelleştirilebilir
İleri okuma
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Alper, Şevval},
title = {{Konuşmadan Metne Karşılaştırma: Deepgram vs. Whisper}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/speech-to-text}},
note = {AIMultiple. Erişim tarihi: 21 Ağustos 2026}
}12 veri noktasının sonuçları ve zaman damgaları. Bu makaledeki grafik ve tablolarda gösterilen özet verileri, bir CSV dosyası içeren ZIP dosyası olarak indirin.
Arkasındaki ayrıntılı veriyi ister misiniz? Premium'a katılın
Değişiklik günlüğü
1 güncelleme“Benchmark sonuçları” bölümündeki benchmark sonuçları güncellendi.
Şevval, yapay zeka kodlama araçları, yapay zeka ajanları ve kuantum teknolojilerine odaklanmaktadır.
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.