سازگاری بلندگو با حداقل داده ها در سیستم های آماری سنتز گفتار
| عنوان | سازگاری بلندگو با حداقل داده ها در سیستم های آماری سنتز گفتار |
|---|---|
| نویسنده | محمدی، امیر |
| تاریخ انتشار: | 2014-09 |
| موضوع | مهندسی برق و الکترونیک، متن به گفتار، سنتز گفتار آماری، انطباق با سخنران، آموزش تطبیقی خوشه، سازگاری صدای ویژه، نزدیکترین همسایه |
| نوع | سند |
| زبان | انگلیسی |
| دیجیتال | بله |
| نسخه خطی | خیر |
| کتابخانه: | دانشگاه اوزیغین |
| شماره ثبت | 27707384-9dda-4df2-8513-e1a1db65db90 |
| محل کتابخانه | گروه مهندسی برق و الکترونیک |
| تاریخ | 2014-09 |
| متن نمونه | سیستمهای سنتز گفتار آماری (SSS) این توانایی را دارند که با چند دقیقه دادههای انطباق با یک سخنران هدف سازگار شوند. توسعه الگوریتمهای انطباق برای کاهش بیشتر تعداد گفتههای انطباق به چند ثانیه داده میتواند تأثیر قابلتوجهی بر استقرار این فناوری در برنامههای کاربردی زندگی واقعی مانند دستگاههای الکترونیکی مصرفی داشته باشد. روش سنتی برای دستیابی به چنین انطباق سریع، تکنیک صدای ویژه است که در تشخیص گفتار به خوبی کار می کند، اما شناخته شده است که مصنوعات ادراکی در سنتز گفتار آماری ایجاد می کند. در اینجا، ما سه روش را برای کاهش مشکلات کیفیت الگوریتم انطباق صدای ویژه پایه و در عین حال اجازه انطباق بلندگو با حداقل داده را پیشنهاد میکنیم. روش اول ما مبتنی بر استفاده از رویکرد صدای ویژه بیزی برای محدود کردن الگوریتم سازگاری برای حرکت در جهتهای واقعی در فضای بلندگو برای کاهش مصنوعات است. روش دوم ما مبتنی بر یافتن بلندگوهای مرجع از پیش آموزشدیده نزدیک به بلندگوی هدف و استفاده از آن مدلهای بلندگوی مرجع در دومین تکرار تطبیق صدای ویژه است. هر دو تکنیک به طور قابلتوجهی بهتر از روش صدای ویژه پایه در آزمونهای هدف عمل کردند. به طور مشابه، هر دو کیفیت گفتار را در آزمونهای ذهنی در مقایسه با روش صدای ویژه پایه بهبود بخشیدند. در روش سوم، استفاده پشت سر هم از روش eigenvoice پیشنهادی با تکنیک تطبیق مبتنی بر رگرسیون خطی پیشرفته برای بهبود انطباق ویژگیهای برانگیختگی یافت میشود.، Uyarlama için gereken konuşma sürelerini daha da aşağıya, birkaç saniyeye, düşürmek için geliştirilen uyarlama algoritmaları, teknolojinin tuketici elektroniği gibi gerçek hayattaki uygulamalarda yaygınönlaşirilen Bu tarz hızlı uyarlamayı başarmanın geleneksel yöntemi özses tekniğidir ki konuşma tanımada iyi çalışmaktadır fakat istatistiksel ses sentezinde algısal artifeksler ürettiği bilinmektedir. Burada, hem temel özses uyarlama algoritmasının kalite problemini giderebilecek hem de asgari veri kullanarak konuşmacı uyarlamayı sağlayacak üç yöntem önerdik. Birinci yöntemimiz uyarlama algoritmasını, artifeksleri azaltmak için konuşmacı uzayında realistik doğrultularda hareket ettirmek amacıyla sınırlamak için önerdiğimiz Bayes özses yaklaşımınöny. İkinci metodumuz ise hedef konuşmacıya yakın، önceden eğitilmiş referans konuşmacıları bulmaya ve o referans konuşmacı modellerini ikinci bir özses uyarlama iterasyonunda kullanmaya dayanır. Her iki teknik de nesnel testlerde temel özses metodundan önemli ölçüde daha iyi sonuçlar verdi. بنزر شِکیلده، هر ایکیسی ده تمل اوزسِس متدویلا کییاسلندیغیندا اوزنل تستلرده سه کالیتسینی آرتیردی. Üçüncü metodda, önerilen özses metodu ile son teknoloji doğrusal regresyon tekniğinin ardışık kullanımının uyarım özniteliklerinin uyarlanmasını geliştirdiği görüldü. |