Önde gelen konuşmadan metne (STT) sağlayıcılarını, özellikle sağlık hizmetleri uygulamalarına odaklanarak karşılaştırdık. Karşılaştırmamız, tıbbi bağlamlarda transkripsiyon doğruluğunu değerlendirmek için gerçek dünya örnekleri kullandı; bu bağlamlarda hassasiyet kritik önem taşır.
Konuşmadan metne karşılaştırma sonuçları
Kelime hata oranı (WER) ve karakter hata oranı (CER) sonuçlarına dayanarak, GPT-4o-transcribe, değerlendirilen tüm konuşmadan metne sistemleri arasında en yüksek transkripsiyon doğruluğunu göstermektedir. Deepgram Nova-v3 ve Gladia da her iki metrikte düşük hata oranlarını koruyarak güçlü bir performans sergilemektedir.
Metodoloji
Veri seti
Modellerin hem küçük ve çeşitli örneklerde hem de uzun bir örnekteki performanslarını değerlendirmek istedik, bu yüzden iki görev yürüttük:
Görev 1: Sağlık hizmetleri ses verileri
- Toplam örnek sayısı: 100
- Toplam süre: 9 dakika ve 25 saniye
- Örnek başına ortalama süre: 5.65 saniye
- İçerik: Tıbbi terminoloji, hasta etkileşimleri ve klinik tartışmalar dahil sağlık hizmetleri ses verileri
- Çeşitlilik: Farklı konuşmacılar, değişen ses kalitesi ve İngilizce konuşulan çeşitli tıbbi bağlamlar
Ses özellikleri:
- Format: WAV
- Kanallar: 1 (Mono)
- Örnek genişliği: 16-bit
- Örnekleme hızı: 16 kHz
- Sabit bit hızı: 256 kbps
- Süre aralığı: dosya başına ~4.5 ila 11.5 saniye
Görev 2: Bir anatomi dersi
- Toplam örnek sayısı: 1
- Toplam süre: 8 dakika ve 35 saniye
- İçerik: Bir doktor tarafından verilen, tıbbi terminoloji içeren bir anatomi dersi
- Çeşitlilik: Videoda bir konuşmacı ilk yarıda İngilizce konuşur; arka planda müzik çalar.
Ses özellikleri:
- Format: WAV
- Kanallar: 2 (Stereo)
- Örnek genişliği: 16-bit
- Örnekleme hızı: 48 kHz
- Sabit bit hızı: 1536 kbps
Değerlendirme metrikleri
Transkripsiyon doğruluğu için kelime hata oranı (WER) ve karakter hata oranı (CER) değerlendirme metriği olarak kullandık. Kelime hata oranı şu şekilde hesaplanır:
WER = (S + D + I) / N
Burada:
- S = Yer değiştirme sayısı
- D = Silme sayısı
- I = Ekleme sayısı
- N = Gerçek referanstaki toplam kelime sayısı
Formül, hipotezi referansa dönüştürmek için gereken minimum kelime düzeyindeki işlem sayısını, referanstaki kelime sayısına böler. Daha düşük WER daha iyi doğruluğu gösterir; 0% mükemmel eşleşme anlamına gelir.
Karakter hata oranı (CER), toplam karakter düzeyindeki hata sayısının (ekleme, silme ve yer değiştirme dahil) referans metindeki toplam karakter sayısına bölünmesiyle hesaplanır.
Ses dosyalarını metne dönüştürmek için konuşmadan metne API'leri kullandık.
Sağlayıcıların tek seferde kabul ettiği maksimum dosya boyutu tabloda gösterilmiştir:
*Vosk yerel olarak çalıştığı için girdi dosya boyutunda bir sınır yoktur. Ancak, uzun ses dosyaları ışın sınırını aşarak bazı olasılıkların kaybolmasına neden olabilir. Bu nedenle dosyaların 1–2 dakikalık segmentlere bölünmesi önerilir.
Google MedASR da yerel olarak çalışır ve maksimum dosya boyutu sınırı koymaz. Optimum performans ve kaynak yönetimi için uzun dosyaların daha küçük segmentler halinde işlenmesi önerilir.
Not: Daha küçük dosya boyutu sınırları olan sağlayıcılar için (Google ve OpenAI gibi), daha büyük ses dosyaları işlenmeden önce daha küçük parçalara bölünmelidir. Bunu Görev 2'de gerçekleştirdik.
Konuşma tanıma
Konuşma tanıma, bilgisayarların ses dosyalarını metne dönüştürmesini sağlar; bunun için makine öğrenimi algoritmaları kullanılır. Bir transkripsiyon hizmetinin API'si, toplu transkripsiyon için çeşitli programlama dilleriyle kullanılabilir. Bu platformlar hem gerçek zamanlı hem de eşzamansız transkripsiyonu destekler.
Konuşma tanıma teknolojisinin transkripsiyon, sesli asistanlar ve dil çevirisi gibi çok sayıda uygulaması vardır.
Konuşma tanımayı transkripsiyon için kullanmanın faydaları
- Ses dosyalarının hızlı transkripsiyonu
- Zaman ve emek tasarrufu
- Gerçek zamanlı transkripsiyon ve çeviri
- Engelli bireyler için erişilebilirlik
Konuşmadan metne yapay zeka araçları nasıl çalışır?
Transkripsiyon süreci şunları içerir:
- Ses verileri konuşmadan metne aracına yüklenir veya akış olarak gönderilir
- Ses verilerini analiz etmek ve konuşmadaki kalıpları belirlemek için makine öğrenimi algoritmalarının kullanılması
- Araç, konuşmadan metne motoru kullanarak konuşmayı metne dönüştürür
- Ardından transkribe edilmiş metin kullanıcıya gösterilir.
SSS'ler
Ses transkripsiyonu ve video kayıtları şu alanlarda kullanılabilir:
Sesli asistanlar ve sanal asistanlar
Dil çevirisi ve tercüme
Engelli bireyler için konuşmadan metne (ASR) sistemleri
Önceden eğitilmiş modelleri, kaydedilmiş ses ve video dosyaları için otomatik konuşma tanıma (ASR) sağlar. Yüksek doğruluklu ses transkripsiyonları, otomatik noktalama ve konu tespiti içerir.
Şirketinizin halihazırda çalıştığı bir hizmetten açık kaynaklı bir motor veya bir konuşma tanıma sağlayıcısı (ör. Google Cloud, AWS transcribe) transkripsiyon çözümü olarak seçilebilir. Bazıları ayrıca ücretsiz kredi sunar, ancak veri güvenliği konusunda dikkatli olunmasını öneririz.
Bir konuşmadan metne API'si, ses dosyalarını metne dönüştürmeye yardımcı olabilir. Ses verilerinin işlenmesi ve analizi:
Ses verileri, gürültü azaltma ve yankı iptali gibi teknikler kullanılarak işlenir
Ardından ses verileri, konuşmadaki kalıpları belirlemek için makine öğrenimi algoritmaları kullanılarak analiz edilir
Algoritmalar, konuşulan kelimeleri ve ifadeleri tanımak için akustik modeller ve dil modelleri kullanır
Makine öğrenimi algoritmalarını kullanarak konuşmayı metne dönüştürme:
Makine öğrenimi algoritmaları, büyük ses ve metin veri kümeleri üzerinde eğitilir
Algoritmalar, konuşmadaki kalıpları tanımayı ve bunları metne dönüştürmeyi öğrenir
Algoritmalar, belirli kullanım durumları ve diller için ince ayar yapılabilir ve özelleştirilebilir
Daha fazla bilgi
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Alper, Şevval},
title = {{Konuşmadan Metne Karşılaştırması: Deepgram vs. Whisper}},
year = {2026},
month = jan,
howpublished = {\url{https://aimultiple.com/speech-to-text}},
note = {AIMultiple. Erişim tarihi: 22 Ocak 2026}
}
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.