پس فیلترینگ سازگار با سخنران مبتنی بر یادگیری عمیق با داده های انطباق محدود برای سیستم های ترکیب متن به گفتار تعبیه شده
| عنوان | پس فیلترینگ سازگار با سخنران مبتنی بر یادگیری عمیق با داده های انطباق محدود برای سیستم های ترکیب متن به گفتار تعبیه شده |
|---|---|
| نویسنده | Eren، Eray، Demiroğlu، Cenk |
| تاریخ انتشار: | 2023-06 |
| محل انتشار | - الزویر |
| موضوع | آموزش خصمانه، یادگیری عمیق، پس فیلتر، سازگاری با سخنران، ترکیب گفتار، ترانسفورماتور |
| نوع | دوره ای |
| زبان | انگلیسی |
| دیجیتال | بله |
| نسخه خطی | خیر |
| کتابخانه: | دانشگاه اوزیغین |
| شناسه دارایی کتابخانه | 0885-2308 |
| شماره ثبت | 9af7a4e2-a8f8-476c-998f-82b0414a9459 |
| محل کتابخانه | مهندسی برق و الکترونیک |
| تاریخ | 2023-06 |
| متن نمونه | سیستمهای سنتز گفتار انتها به انتها (e2e) با معرفی اخیر سیستمهای تبدیل متن به طیفگرام، مانند تاکوترون، که از معماریهای عصبی مبتنی بر رمزگذار-رمزگشا استفاده میکنند، محبوب شدهاند. حتی اگر این سیستمهای دنباله به دنباله میتوانند از حروف بدون صفحه پردازش متن، طیفنگاری مل تولید کنند، اما به مقادیر قابلتوجهی از دادههای صوتی برچسبگذاریشده و با دستکاری خوب نیاز دارند که دارای SNR بالا و حداقل مقادیر مصنوع هستند. این نیازهای داده، ساختن سیستمهای انتها به انتها را از ابتدا، بهویژه برای زبانهای کم منبع، دشوار میسازد. علاوه بر این، بیشتر سیستمهای e2e برای دستگاههایی با حافظه کوچک و منابع CPU طراحی نشدهاند. در اینجا، ما با استفاده از یک شبکه عصبی عمیق سنتی (DNN) برای مدلسازی صوتی همراه با یک پس فیلتر که ویژگیهای گفتاری تولید شده توسط شبکه را بهبود میبخشد، بررسی میکنیم. معماری های پیشنهادی با پایگاه داده وال استریت ژورنال (WSJ) نسبتاً پر سر و صدا و با چند بلندگو آموزش دیده و با بلندگوهای دیده نشده آزمایش شدند. لایه نازک پس فیلتر با حداقل داده به بلندگوی هدف برای آزمایش تطبیق داده شد. ما چندین معماری پس فیلتر را بررسی کردیم و آنها را با آزمون های عینی و ذهنی مقایسه کردیم. معماری های کاملا متصل و مبتنی بر ترانسفورماتور بهترین عملکرد را در تست های ذهنی داشتند. معماری مبتنی بر ترانسفورماتور متخاصم جدید با از دست دادن تفکیک کننده تطبیقی بهترین عملکرد را در آزمون های عینی داشت. علاوه بر این، چه در آموزش و چه در استنتاج سریعتر از معماری های دیگر بود. بنابراین، معماری postfilter مبتنی بر ترانسفورماتور سبک پیشنهادی ما به طور قابل توجهی کیفیت گفتار را بهبود بخشید و به طور موثر با بلندگوهای جدید با عکسهای کمی از دادهها و صدها تکرار آموزشی سازگار شد و آن را از نظر محاسباتی کارآمد و برای مقیاسپذیری مناسب ساخت. |
| DOI | 10.1016/j.csl.2023.101520 |
| Cilt | 81 |