پس فیلترینگ سازگار با سخنران مبتنی بر یادگیری عمیق با داده های انطباق محدود برای سیستم های ترکیب متن به گفتار تعبیه شده

عنوان پس فیلترینگ سازگار با سخنران مبتنی بر یادگیری عمیق با داده های انطباق محدود برای سیستم های ترکیب متن به گفتار تعبیه شده
نویسنده Eren، Eray، Demiroğlu، Cenk
تاریخ انتشار: 2023-06
محل انتشار - الزویر
موضوع آموزش خصمانه، یادگیری عمیق، پس فیلتر، سازگاری با سخنران، ترکیب گفتار، ترانسفورماتور
نوع دوره ای
زبان انگلیسی
دیجیتال بله
نسخه خطی خیر
کتابخانه: دانشگاه اوزیغین
شناسه دارایی کتابخانه 0885-2308
شماره ثبت 9af7a4e2-a8f8-476c-998f-82b0414a9459
محل کتابخانه مهندسی برق و الکترونیک
تاریخ 2023-06
متن نمونه سیستم‌های سنتز گفتار انتها به انتها (e2e) با معرفی اخیر سیستم‌های تبدیل متن به طیف‌گرام، مانند تاکوترون، که از معماری‌های عصبی مبتنی بر رمزگذار-رمزگشا استفاده می‌کنند، محبوب شده‌اند. حتی اگر این سیستم‌های دنباله به دنباله می‌توانند از حروف بدون صفحه پردازش متن، طیف‌نگاری مل تولید کنند، اما به مقادیر قابل‌توجهی از داده‌های صوتی برچسب‌گذاری‌شده و با دستکاری خوب نیاز دارند که دارای SNR بالا و حداقل مقادیر مصنوع هستند. این نیازهای داده، ساختن سیستم‌های انتها به انتها را از ابتدا، به‌ویژه برای زبان‌های کم منبع، دشوار می‌سازد. علاوه بر این، بیشتر سیستم‌های e2e برای دستگاه‌هایی با حافظه کوچک و منابع CPU طراحی نشده‌اند. در اینجا، ما با استفاده از یک شبکه عصبی عمیق سنتی (DNN) برای مدل‌سازی صوتی همراه با یک پس فیلتر که ویژگی‌های گفتاری تولید شده توسط شبکه را بهبود می‌بخشد، بررسی می‌کنیم. معماری های پیشنهادی با پایگاه داده وال استریت ژورنال (WSJ) نسبتاً پر سر و صدا و با چند بلندگو آموزش دیده و با بلندگوهای دیده نشده آزمایش شدند. لایه نازک پس فیلتر با حداقل داده به بلندگوی هدف برای آزمایش تطبیق داده شد. ما چندین معماری پس فیلتر را بررسی کردیم و آنها را با آزمون های عینی و ذهنی مقایسه کردیم. معماری های کاملا متصل و مبتنی بر ترانسفورماتور بهترین عملکرد را در تست های ذهنی داشتند. معماری مبتنی بر ترانسفورماتور متخاصم جدید با از دست دادن تفکیک کننده تطبیقی ​​بهترین عملکرد را در آزمون های عینی داشت. علاوه بر این، چه در آموزش و چه در استنتاج سریعتر از معماری های دیگر بود. بنابراین، معماری postfilter مبتنی بر ترانسفورماتور سبک پیشنهادی ما به طور قابل توجهی کیفیت گفتار را بهبود بخشید و به طور موثر با بلندگوهای جدید با عکس‌های کمی از داده‌ها و صدها تکرار آموزشی سازگار شد و آن را از نظر محاسباتی کارآمد و برای مقیاس‌پذیری مناسب ساخت.
DOI 10.1016/j.csl.2023.101520
Cilt 81
مشاهده در منبع دانشگاه اوزیغین دانشگاه اوزیغین - موتور جستجوی آثار تاریخی، آرشیوها و نشریات
دانشگاه اوزیغین - موتور جستجوی آثار تاریخی، آرشیوها و نشریات دانشگاه اوزیغین

پس فیلترینگ سازگار با سخنران مبتنی بر یادگیری عمیق با داده های انطباق محدود برای سیستم های ترکیب متن به گفتار تعبیه شده

نویسنده Eren، Eray، Demiroğlu، Cenk
تاریخ انتشار 2023-06
محل انتشار - الزویر
موضوع آموزش خصمانه، یادگیری عمیق، پس فیلتر، سازگاری با سخنران، ترکیب گفتار، ترانسفورماتور
نوع دوره ای
زبان انگلیسی
دیجیتال بله
نسخه خطی خیر
کتابخانه دانشگاه اوزیغین
شناسه دارایی کتابخانه 0885-2308
شماره ثبت 9af7a4e2-a8f8-476c-998f-82b0414a9459
محل کتابخانه مهندسی برق و الکترونیک
تاریخ 2023-06
متن نمونه سیستم‌های سنتز گفتار انتها به انتها (e2e) با معرفی اخیر سیستم‌های تبدیل متن به طیف‌گرام، مانند تاکوترون، که از معماری‌های عصبی مبتنی بر رمزگذار-رمزگشا استفاده می‌کنند، محبوب شده‌اند. حتی اگر این سیستم‌های دنباله به دنباله می‌توانند از حروف بدون صفحه پردازش متن، طیف‌نگاری مل تولید کنند، اما به مقادیر قابل‌توجهی از داده‌های صوتی برچسب‌گذاری‌شده و با دستکاری خوب نیاز دارند که دارای SNR بالا و حداقل مقادیر مصنوع هستند. این نیازهای داده، ساختن سیستم‌های انتها به انتها را از ابتدا، به‌ویژه برای زبان‌های کم منبع، دشوار می‌سازد. علاوه بر این، بیشتر سیستم‌های e2e برای دستگاه‌هایی با حافظه کوچک و منابع CPU طراحی نشده‌اند. در اینجا، ما با استفاده از یک شبکه عصبی عمیق سنتی (DNN) برای مدل‌سازی صوتی همراه با یک پس فیلتر که ویژگی‌های گفتاری تولید شده توسط شبکه را بهبود می‌بخشد، بررسی می‌کنیم. معماری های پیشنهادی با پایگاه داده وال استریت ژورنال (WSJ) نسبتاً پر سر و صدا و با چند بلندگو آموزش دیده و با بلندگوهای دیده نشده آزمایش شدند. لایه نازک پس فیلتر با حداقل داده به بلندگوی هدف برای آزمایش تطبیق داده شد. ما چندین معماری پس فیلتر را بررسی کردیم و آنها را با آزمون های عینی و ذهنی مقایسه کردیم. معماری های کاملا متصل و مبتنی بر ترانسفورماتور بهترین عملکرد را در تست های ذهنی داشتند. معماری مبتنی بر ترانسفورماتور متخاصم جدید با از دست دادن تفکیک کننده تطبیقی ​​بهترین عملکرد را در آزمون های عینی داشت. علاوه بر این، چه در آموزش و چه در استنتاج سریعتر از معماری های دیگر بود. بنابراین، معماری postfilter مبتنی بر ترانسفورماتور سبک پیشنهادی ما به طور قابل توجهی کیفیت گفتار را بهبود بخشید و به طور موثر با بلندگوهای جدید با عکس‌های کمی از داده‌ها و صدها تکرار آموزشی سازگار شد و آن را از نظر محاسباتی کارآمد و برای مقیاس‌پذیری مناسب ساخت.
DOI 10.1016/j.csl.2023.101520
Cilt 81
دانشگاه اوزیغین - موتور جستجوی آثار تاریخی، آرشیوها و نشریات
دانشگاه اوزیغین شما در حال هدایت مجدد هستید...

لطفاً صبر کنید