Yazar
Eren, Eray, Demiroğlu, Cenk
Basım Tarihi
2023-06
Basım Yeri
-
Elsevier
Konu
Tartışmalı eğitim, Derin öğrenme, Son filtre, Konuşmacı uyarlaması, Konuşma sentezi, Transformatör
Tür
Süreli Yayın
Dil
İngilizce
Dijital
Evet
Yazma
Hayır
Kütüphane
Özyeğin Üniversitesi
Demirbaş Numarası
0885-2308
Kayıt Numarası
9af7a4e2-a8f8-476c-998f-82b0414a9459
Lokasyon
Elektrik ve Elektronik Mühendisliği
Tarih
2023-06
Örnek Metin
Uçtan uca (e2e) konuşma sentezi sistemleri, kodlayıcı-kod çözücü tabanlı sinir mimarilerini kullanan Tacotron gibi metinden spektrograma dönüştürme sistemlerinin yakın zamanda piyasaya sürülmesiyle popüler hale geldi. Bu diziden diziye sistemler, metin işleme ön ucu olmadan harflerden mel-spektrogramlar üretebilse de, yüksek SNR'ye ve minimum miktarda yapaylığa sahip, iyi işlenmiş, etiketlenmiş önemli miktarda ses verisine ihtiyaç duyarlar. Bu veri gereksinimleri, özellikle düşük kaynaklı diller için uçtan uca sistemlerin sıfırdan oluşturulmasını zorlaştırıyor. Üstelik e2e sistemlerinin çoğu küçük belleğe ve CPU kaynaklarına sahip cihazlar için tasarlanmamıştır. Burada, akustik modelleme için geleneksel bir derin sinir ağının (DNN) ve ağ tarafından üretilen konuşma özelliklerini iyileştiren bir son filtrenin kullanımını araştırıyoruz. Önerilen mimariler nispeten gürültülü, çok hoparlörlü Wall Street Journal (WSJ) veritabanıyla eğitildi ve görünmeyen hoparlörlerle test edildi. İnce son filtre katmanı, test için minimum veriyle hedef konuşmacıya uyarlandı. Çeşitli filtre sonrası mimarileri araştırdık ve bunları hem nesnel hem de öznel testlerle karşılaştırdık. Tamamen bağlantılı ve transformatör tabanlı mimariler, öznel testlerde en iyi performansı gösterdi. Uyarlanabilir ayırıcı kaybına sahip yeni çekişmeli transformatör tabanlı mimari, objektif testlerde en iyi performansı gösterdi. Üstelik hem eğitim hem de çıkarım açısından diğer mimarilere göre daha hızlıydı. Bu nedenle, önerdiğimiz hafif transformatör tabanlı son filtre mimarimiz, konuşma kalitesini önemli ölçüde iyileştirdi ve birkaç veri çekimi ve yüzlerce eğitim yinelemesi ile yeni hoparlörlere verimli bir şekilde uyarlandı, bu da onu hesaplama açısından verimli ve ölçeklenebilirlik için uygun hale getirdi.
DOI
10.1016/j.csl.2023.101520
Cilt
81