سازگاری بلندگو با یادگیری عمیق برای سیستم‌های سنتز متن به گفتار

عنوان سازگاری بلندگو با یادگیری عمیق برای سیستم‌های سنتز متن به گفتار
نویسنده ارن، ایری
تاریخ انتشار: 2022-06-08T10:49:40Z
موضوع صدای متن، متن به گفتار، شبکه های عصبی مصنوعی، هوش مصنوعی، هوش مصنوعی
نوع سند
زبان انگلیسی
دیجیتال بله
نسخه خطی خیر
کتابخانه: دانشگاه اوزیغین
شماره ثبت 5eb81fca-f018-420a-b714-7a4d6ca4d869
محل کتابخانه گروه علوم کامپیوتر
تاریخ 2022-06-08T10:49:40Z
متن نمونه سیستم‌های سنتز گفتار انتها به انتها (e2e) با معرفی اخیر سیستم‌های تبدیل حروف به طیف‌گرام، مانند تاکوترون، که از معماری‌های عصبی مبتنی بر رمزگذار-رمزگشا استفاده می‌کنند، محبوب شده‌اند. حتی اگر این سیستم‌های ترتیب به دنباله می‌توانند طیف‌نگاری مل را از حروف بدون صفحه پردازش متن تولید کنند، به مقادیر قابل‌توجهی از داده‌های صوتی برچسب‌گذاری‌شده و خوب ماساژ داده شده که SNR بالا و حداقل مقادیر مصنوع دارند، نیاز دارند. این نیازهای داده، ساختن سیستم‌های انتها به انتها را از ابتدا به‌ویژه برای زبان‌های کم منبع دشوار می‌سازد. علاوه بر این، بیشتر سیستم‌های e2e برای دستگاه‌هایی با حافظه کوچک و منابع cpu طراحی نشده‌اند. در اینجا، ما با استفاده از یک شبکه عصبی عمیق سنتی (DNN) برای مدل‌سازی صوتی همراه با یک پس فیلتر که ویژگی‌های گفتاری تولید شده توسط شبکه را بهبود می‌بخشد، بررسی می‌کنیم. معماری های پیشنهادی با پایگاه داده وال استریت ژورنال (WSJ) نسبتاً پر سر و صدا و با چند بلندگو آموزش دیده و با بلندگوهای دیده نشده آزمایش شدند. لایه نازک پس فیلتر با حداقل داده به بلندگوی هدف برای آزمایش تطبیق داده شد. ما چندین معماری پس فیلتر را بررسی کردیم و آنها را با آزمون های عینی و ذهنی مقایسه کردیم. معماری های کاملا متصل و مبتنی بر ترانسفورماتور بهترین عملکرد را در تست های ذهنی داشتند. معماری مبتنی بر ترانسفورماتور در آزمایش های عینی بهترین عملکرد را داشت. علاوه بر این، هم در آموزش و هم در سرعت استنتاج سریع‌تر از معماری‌های دیگر بود. Bu diziden-diziye sistemler, metin işleyen önyüze gerek duymadan mel-spektrogramları üretebilse de; یوکلو میکتاردا، اییی یوغرولموش، یوکسک سینیال-گورولتو اورانلی و حداقل دوزیده کوسورلو اتیکتلی سه وریسینه احتیاچ دویماکتادیر. Bu veri ihtiyacı bilhassa düşük kaynağa sahip dilller için uçtan-uca sistemleri inşa etmeyi zor duruma getirmektedir. Dahası, uu sistemlerin birçoğu düşük hafıza ve cpu kaynaklarına sahip sistemler için tasarlanmamıştır. بیز بو چالیشمادا، گلنکسل درین سینیر آغی تارافیندان اورتیلن کونوشما اوزنیتلیکلرینی اییلهشتیرن پُستفیلترلرین بو سینیر آغلارییلا برابر کولانیملارینین آکوستیک مدللمه اولان اتکیسینی آراشتیردیک. Önerilen sistemler görece gürültülü Wall Street Journal (WSJ) versiyle eğitilip görülmemiş konuşmacılar için test edildi. İnce postfiltre katmanı حداقل veri ile hedef konuşmacının testi için uyarlandı. Birkaç farklı postfiltre mimarisini araştırdık ve bunları taraflı ve tarafsız testlerle karşılaştırdık. Tam-bağlı ve transformer temelli mimariler taraflı testlerde en iyi sonucu verdi. Transformer temelli mimari tarafsız testlerde en iyi sonucu verdi. آیریجا، دیغر میماریلردن هم اغیتیمده هم د تهمنده داها هیزلییدی.
مشاهده در منبع دانشگاه اوزیغین دانشگاه اوزیغین - موتور جستجوی آثار تاریخی، آرشیوها و نشریات
دانشگاه اوزیغین - موتور جستجوی آثار تاریخی، آرشیوها و نشریات دانشگاه اوزیغین

سازگاری بلندگو با یادگیری عمیق برای سیستم‌های سنتز متن به گفتار

نویسنده ارن، ایری
تاریخ انتشار 2022-06-08T10:49:40Z
موضوع صدای متن، متن به گفتار، شبکه های عصبی مصنوعی، هوش مصنوعی، هوش مصنوعی
نوع سند
زبان انگلیسی
دیجیتال بله
نسخه خطی خیر
کتابخانه دانشگاه اوزیغین
شماره ثبت 5eb81fca-f018-420a-b714-7a4d6ca4d869
محل کتابخانه گروه علوم کامپیوتر
تاریخ 2022-06-08T10:49:40Z
متن نمونه سیستم‌های سنتز گفتار انتها به انتها (e2e) با معرفی اخیر سیستم‌های تبدیل حروف به طیف‌گرام، مانند تاکوترون، که از معماری‌های عصبی مبتنی بر رمزگذار-رمزگشا استفاده می‌کنند، محبوب شده‌اند. حتی اگر این سیستم‌های ترتیب به دنباله می‌توانند طیف‌نگاری مل را از حروف بدون صفحه پردازش متن تولید کنند، به مقادیر قابل‌توجهی از داده‌های صوتی برچسب‌گذاری‌شده و خوب ماساژ داده شده که SNR بالا و حداقل مقادیر مصنوع دارند، نیاز دارند. این نیازهای داده، ساختن سیستم‌های انتها به انتها را از ابتدا به‌ویژه برای زبان‌های کم منبع دشوار می‌سازد. علاوه بر این، بیشتر سیستم‌های e2e برای دستگاه‌هایی با حافظه کوچک و منابع cpu طراحی نشده‌اند. در اینجا، ما با استفاده از یک شبکه عصبی عمیق سنتی (DNN) برای مدل‌سازی صوتی همراه با یک پس فیلتر که ویژگی‌های گفتاری تولید شده توسط شبکه را بهبود می‌بخشد، بررسی می‌کنیم. معماری های پیشنهادی با پایگاه داده وال استریت ژورنال (WSJ) نسبتاً پر سر و صدا و با چند بلندگو آموزش دیده و با بلندگوهای دیده نشده آزمایش شدند. لایه نازک پس فیلتر با حداقل داده به بلندگوی هدف برای آزمایش تطبیق داده شد. ما چندین معماری پس فیلتر را بررسی کردیم و آنها را با آزمون های عینی و ذهنی مقایسه کردیم. معماری های کاملا متصل و مبتنی بر ترانسفورماتور بهترین عملکرد را در تست های ذهنی داشتند. معماری مبتنی بر ترانسفورماتور در آزمایش های عینی بهترین عملکرد را داشت. علاوه بر این، هم در آموزش و هم در سرعت استنتاج سریع‌تر از معماری‌های دیگر بود. Bu diziden-diziye sistemler, metin işleyen önyüze gerek duymadan mel-spektrogramları üretebilse de; یوکلو میکتاردا، اییی یوغرولموش، یوکسک سینیال-گورولتو اورانلی و حداقل دوزیده کوسورلو اتیکتلی سه وریسینه احتیاچ دویماکتادیر. Bu veri ihtiyacı bilhassa düşük kaynağa sahip dilller için uçtan-uca sistemleri inşa etmeyi zor duruma getirmektedir. Dahası, uu sistemlerin birçoğu düşük hafıza ve cpu kaynaklarına sahip sistemler için tasarlanmamıştır. بیز بو چالیشمادا، گلنکسل درین سینیر آغی تارافیندان اورتیلن کونوشما اوزنیتلیکلرینی اییلهشتیرن پُستفیلترلرین بو سینیر آغلارییلا برابر کولانیملارینین آکوستیک مدللمه اولان اتکیسینی آراشتیردیک. Önerilen sistemler görece gürültülü Wall Street Journal (WSJ) versiyle eğitilip görülmemiş konuşmacılar için test edildi. İnce postfiltre katmanı حداقل veri ile hedef konuşmacının testi için uyarlandı. Birkaç farklı postfiltre mimarisini araştırdık ve bunları taraflı ve tarafsız testlerle karşılaştırdık. Tam-bağlı ve transformer temelli mimariler taraflı testlerde en iyi sonucu verdi. Transformer temelli mimari tarafsız testlerde en iyi sonucu verdi. آیریجا، دیغر میماریلردن هم اغیتیمده هم د تهمنده داها هیزلییدی.
دانشگاه اوزیغین - موتور جستجوی آثار تاریخی، آرشیوها و نشریات
دانشگاه اوزیغین شما در حال هدایت مجدد هستید...

لطفاً صبر کنید