Metinden konuşmaya sentez sistemleri için derin öğrenmeyle hoparlör uyarlaması

İsim Metinden konuşmaya sentez sistemleri için derin öğrenmeyle hoparlör uyarlaması
Yazar Eren, Eray
Basım Tarihi: 2022-06-08T10:49:40Z
Konu Metin seslendirme, Text to speech, Yapay sinir ağları, Artificial neural networks, Yapay zeka, Artificial intelligence
Tür Belge
Dil İngilizce
Dijital Evet
Yazma Hayır
Kütüphane: Özyeğin Üniversitesi
Kayıt Numarası 5eb81fca-f018-420a-b714-7a4d6ca4d869
Lokasyon Bilgisayar Bilimleri Bölümü
Tarih 2022-06-08T10:49:40Z
Örnek Metin Uçtan uca (e2e) konuşma sentezi sistemleri, kodlayıcı-kod çözücü tabanlı sinir mimarilerini kullanan Tacotron gibi harften spektrograma dönüştürme sistemlerinin yakın zamanda piyasaya sürülmesiyle popüler hale geldi. Bu diziden diziye sistemler, bir metin işleme ön ucu olmadan harflerden mel-spektrogramlar üretebilse de, yüksek SNR'ye ve minimum miktarda yapaylığa sahip, iyi masajlanmış, etiketlenmiş önemli miktarda ses verisine ihtiyaç duyarlar. Bu veri gereksinimleri, özellikle düşük kaynaklı diller için uçtan uca sistemlerin sıfırdan oluşturulmasını zorlaştırıyor. Üstelik e2e sistemlerinin çoğu küçük hafıza ve işlemci kaynaklarına sahip cihazlar için tasarlanmamıştır. Burada, akustik modelleme için geleneksel bir derin sinir ağının (DNN) ve ağ tarafından üretilen konuşma özelliklerini iyileştiren bir son filtrenin kullanımını araştırıyoruz. Önerilen mimariler nispeten gürültülü, çok hoparlörlü Wall Street Journal (WSJ) veritabanıyla eğitildi ve görünmeyen hoparlörlerle test edildi. İnce son filtre katmanı, test için minimum veriyle hedef konuşmacıya uyarlandı. Çeşitli filtre sonrası mimarileri araştırdık ve bunları hem nesnel hem de öznel testlerle karşılaştırdık. Tamamen bağlantılı ve transformatör tabanlı mimariler, öznel testlerde en iyi performansı gösterdi. Transformatör tabanlı mimari objektif testlerde en iyi performansı gösterdi. Üstelik hem eğitim hem de çıkarım hızları açısından diğer mimarilerden daha hızlıydı. Tacotron gibi son zamanlarda ortaya çıkan harften-spektrograma dönüşüm sistemleriyle gizyazar-gizçözer nörolojik ağı mimarilerini kullanan uçtan-uca (uu) ses sentezi sistemleri popüler hale geldi. Bu diziden-diziye sistemler, metin düzenleyen önyüze gerek duymadan mel-spektrogramları üretebilse de; Yüklü miktarda, iyi yoğrulmuş, yüksek sinyal-gürültü oranlı ve minimum düzeyde kusurlu etiketli ses verisine ihtiyaç duymaktadır. Bu veri ihtiyacının düşük kaynağa sahip olması için uçtan-uca sistemlerinin inşa edilmesinin zor olduğu belirtiliyor. Üstelik sistemlerin birçoğu düşük hafıza ve CPU kaynaklarına sahip sistemler için tasarlanmamıştır. Biz bu çözümü, geleneksel derin sinir ağları tarafından üretilen konuşma özniteliklerini iyileştirici postfiltrelerin bu sinir ağlarıyla birlikte kullanımlarının akustik aralığıne olan yoğunluğu araştırdık. Önerilen sistemlere göre Wall Street Journal (WSJ) verisiyle birlikte gösterilip gösterilmediği için test edildi. İnce postfiltre katmanı minimum veri ile hedef kitlenin testi için uyarlandı. Birkaç farklı filtre sonrası mimariyi araştırdık ve bunları birbirinden ayırdık ve ayrıntılı testlerle karşılaştırdık. Tambağlı ve trafonun teknolojik mimarileri testlerde en iyi sonucu verdi. Transformatörün elektriksel mimari testlerinde en iyi sonucu verdi. Ayrıca diğer mimarilerden hem eğitimde hem de tahminde daha hızlıydı.
Kaynağa git Özyeğin Üniversitesi Özyeğin Üniversitesi - Tarihî eser, arşiv ve süreli yayın arama motoru
Özyeğin Üniversitesi - Tarihî eser, arşiv ve süreli yayın arama motoru Özyeğin Üniversitesi

Metinden konuşmaya sentez sistemleri için derin öğrenmeyle hoparlör uyarlaması

Yazar Eren, Eray
Basım Tarihi 2022-06-08T10:49:40Z
Konu Metin seslendirme, Text to speech, Yapay sinir ağları, Artificial neural networks, Yapay zeka, Artificial intelligence
Tür Belge
Dil İngilizce
Dijital Evet
Yazma Hayır
Kütüphane Özyeğin Üniversitesi
Kayıt Numarası 5eb81fca-f018-420a-b714-7a4d6ca4d869
Lokasyon Bilgisayar Bilimleri Bölümü
Tarih 2022-06-08T10:49:40Z
Örnek Metin Uçtan uca (e2e) konuşma sentezi sistemleri, kodlayıcı-kod çözücü tabanlı sinir mimarilerini kullanan Tacotron gibi harften spektrograma dönüştürme sistemlerinin yakın zamanda piyasaya sürülmesiyle popüler hale geldi. Bu diziden diziye sistemler, bir metin işleme ön ucu olmadan harflerden mel-spektrogramlar üretebilse de, yüksek SNR'ye ve minimum miktarda yapaylığa sahip, iyi masajlanmış, etiketlenmiş önemli miktarda ses verisine ihtiyaç duyarlar. Bu veri gereksinimleri, özellikle düşük kaynaklı diller için uçtan uca sistemlerin sıfırdan oluşturulmasını zorlaştırıyor. Üstelik e2e sistemlerinin çoğu küçük hafıza ve işlemci kaynaklarına sahip cihazlar için tasarlanmamıştır. Burada, akustik modelleme için geleneksel bir derin sinir ağının (DNN) ve ağ tarafından üretilen konuşma özelliklerini iyileştiren bir son filtrenin kullanımını araştırıyoruz. Önerilen mimariler nispeten gürültülü, çok hoparlörlü Wall Street Journal (WSJ) veritabanıyla eğitildi ve görünmeyen hoparlörlerle test edildi. İnce son filtre katmanı, test için minimum veriyle hedef konuşmacıya uyarlandı. Çeşitli filtre sonrası mimarileri araştırdık ve bunları hem nesnel hem de öznel testlerle karşılaştırdık. Tamamen bağlantılı ve transformatör tabanlı mimariler, öznel testlerde en iyi performansı gösterdi. Transformatör tabanlı mimari objektif testlerde en iyi performansı gösterdi. Üstelik hem eğitim hem de çıkarım hızları açısından diğer mimarilerden daha hızlıydı. Tacotron gibi son zamanlarda ortaya çıkan harften-spektrograma dönüşüm sistemleriyle gizyazar-gizçözer nörolojik ağı mimarilerini kullanan uçtan-uca (uu) ses sentezi sistemleri popüler hale geldi. Bu diziden-diziye sistemler, metin düzenleyen önyüze gerek duymadan mel-spektrogramları üretebilse de; Yüklü miktarda, iyi yoğrulmuş, yüksek sinyal-gürültü oranlı ve minimum düzeyde kusurlu etiketli ses verisine ihtiyaç duymaktadır. Bu veri ihtiyacının düşük kaynağa sahip olması için uçtan-uca sistemlerinin inşa edilmesinin zor olduğu belirtiliyor. Üstelik sistemlerin birçoğu düşük hafıza ve CPU kaynaklarına sahip sistemler için tasarlanmamıştır. Biz bu çözümü, geleneksel derin sinir ağları tarafından üretilen konuşma özniteliklerini iyileştirici postfiltrelerin bu sinir ağlarıyla birlikte kullanımlarının akustik aralığıne olan yoğunluğu araştırdık. Önerilen sistemlere göre Wall Street Journal (WSJ) verisiyle birlikte gösterilip gösterilmediği için test edildi. İnce postfiltre katmanı minimum veri ile hedef kitlenin testi için uyarlandı. Birkaç farklı filtre sonrası mimariyi araştırdık ve bunları birbirinden ayırdık ve ayrıntılı testlerle karşılaştırdık. Tambağlı ve trafonun teknolojik mimarileri testlerde en iyi sonucu verdi. Transformatörün elektriksel mimari testlerinde en iyi sonucu verdi. Ayrıca diğer mimarilerden hem eğitimde hem de tahminde daha hızlıydı.
Özyeğin Üniversitesi - Tarihî eser, arşiv ve süreli yayın arama motoru
Özyeğin Üniversitesi yönlendiriliyorsunuz...

Lütfen bekleyiniz.