سازگاری بلندگو با یادگیری عمیق برای سیستمهای سنتز متن به گفتار
| عنوان | سازگاری بلندگو با یادگیری عمیق برای سیستمهای سنتز متن به گفتار |
|---|---|
| نویسنده | ارن، ایری |
| تاریخ انتشار: | 2022-06-08T10:49:40Z |
| موضوع | صدای متن، متن به گفتار، شبکه های عصبی مصنوعی، هوش مصنوعی، هوش مصنوعی |
| نوع | سند |
| زبان | انگلیسی |
| دیجیتال | بله |
| نسخه خطی | خیر |
| کتابخانه: | دانشگاه اوزیغین |
| شماره ثبت | 5eb81fca-f018-420a-b714-7a4d6ca4d869 |
| محل کتابخانه | گروه علوم کامپیوتر |
| تاریخ | 2022-06-08T10:49:40Z |
| متن نمونه | سیستمهای سنتز گفتار انتها به انتها (e2e) با معرفی اخیر سیستمهای تبدیل حروف به طیفگرام، مانند تاکوترون، که از معماریهای عصبی مبتنی بر رمزگذار-رمزگشا استفاده میکنند، محبوب شدهاند. حتی اگر این سیستمهای ترتیب به دنباله میتوانند طیفنگاری مل را از حروف بدون صفحه پردازش متن تولید کنند، به مقادیر قابلتوجهی از دادههای صوتی برچسبگذاریشده و خوب ماساژ داده شده که SNR بالا و حداقل مقادیر مصنوع دارند، نیاز دارند. این نیازهای داده، ساختن سیستمهای انتها به انتها را از ابتدا بهویژه برای زبانهای کم منبع دشوار میسازد. علاوه بر این، بیشتر سیستمهای e2e برای دستگاههایی با حافظه کوچک و منابع cpu طراحی نشدهاند. در اینجا، ما با استفاده از یک شبکه عصبی عمیق سنتی (DNN) برای مدلسازی صوتی همراه با یک پس فیلتر که ویژگیهای گفتاری تولید شده توسط شبکه را بهبود میبخشد، بررسی میکنیم. معماری های پیشنهادی با پایگاه داده وال استریت ژورنال (WSJ) نسبتاً پر سر و صدا و با چند بلندگو آموزش دیده و با بلندگوهای دیده نشده آزمایش شدند. لایه نازک پس فیلتر با حداقل داده به بلندگوی هدف برای آزمایش تطبیق داده شد. ما چندین معماری پس فیلتر را بررسی کردیم و آنها را با آزمون های عینی و ذهنی مقایسه کردیم. معماری های کاملا متصل و مبتنی بر ترانسفورماتور بهترین عملکرد را در تست های ذهنی داشتند. معماری مبتنی بر ترانسفورماتور در آزمایش های عینی بهترین عملکرد را داشت. علاوه بر این، هم در آموزش و هم در سرعت استنتاج سریعتر از معماریهای دیگر بود. Bu diziden-diziye sistemler, metin işleyen önyüze gerek duymadan mel-spektrogramları üretebilse de; یوکلو میکتاردا، اییی یوغرولموش، یوکسک سینیال-گورولتو اورانلی و حداقل دوزیده کوسورلو اتیکتلی سه وریسینه احتیاچ دویماکتادیر. Bu veri ihtiyacı bilhassa düşük kaynağa sahip dilller için uçtan-uca sistemleri inşa etmeyi zor duruma getirmektedir. Dahası, uu sistemlerin birçoğu düşük hafıza ve cpu kaynaklarına sahip sistemler için tasarlanmamıştır. بیز بو چالیشمادا، گلنکسل درین سینیر آغی تارافیندان اورتیلن کونوشما اوزنیتلیکلرینی اییلهشتیرن پُستفیلترلرین بو سینیر آغلارییلا برابر کولانیملارینین آکوستیک مدللمه اولان اتکیسینی آراشتیردیک. Önerilen sistemler görece gürültülü Wall Street Journal (WSJ) versiyle eğitilip görülmemiş konuşmacılar için test edildi. İnce postfiltre katmanı حداقل veri ile hedef konuşmacının testi için uyarlandı. Birkaç farklı postfiltre mimarisini araştırdık ve bunları taraflı ve tarafsız testlerle karşılaştırdık. Tam-bağlı ve transformer temelli mimariler taraflı testlerde en iyi sonucu verdi. Transformer temelli mimari tarafsız testlerde en iyi sonucu verdi. آیریجا، دیغر میماریلردن هم اغیتیمده هم د تهمنده داها هیزلییدی. |