التصفية اللاحقة للتكيف مع المتحدث المستندة إلى DNN مع بيانات التكيف المحدودة لأنظمة تركيب الكلام الإحصائية

العنوان التصفية اللاحقة للتكيف مع المتحدث المستندة إلى DNN مع بيانات التكيف المحدودة لأنظمة تركيب الكلام الإحصائية
المؤلف أوزتورك، إم جي، أولوسوي، أو.، ديمير أوغلو، جينك
تاريخ النشر: 2019
مكان النشر - IEEE
الموضوع التكيف مع المتحدث، تركيب الكلام، Postfilter، التعلم العميق
النوع وثيقة
اللغة الإنجليزية
رقمي نعم
مخطوط لا
المكتبة: جامعة اوزيجين
معرف أصل المكتبة 978-1-4799-8131-1
رقم السجل e71c62e2-a7a5-42e2-9f26-22a7d09970d2
موقع المكتبة الهندسة الكهربائية والإلكترونية
التاريخ 2019
ملاحظات توبيتاك
نص عينة تم نشر الشبكات العصبية العميقة (DNNs) بنجاح للنمذجة الصوتية في أنظمة تركيب الكلام الإحصائي (SPSS). علاوة على ذلك، فقد ثبت أيضًا أن المرشحات اللاحقة (PF) المستندة إلى DNN تتفوق في الأداء على المرشحات اللاحقة التقليدية المستخدمة على نطاق واسع في أنظمة SPSS لزيادة جودة الكلام المركب. ومع ذلك، يتم تدريب المرشحات اللاحقة القائمة على DNN باستخدام قواعد البيانات المعتمدة على المتحدثين. نظرًا لأن أنظمة SPSS يمكنها التكيف بسرعة مع مكبرات الصوت الجديدة من النماذج العامة، فهناك حاجة إلى مرشحات لاحقة قائمة على DNN يمكنها التكيف مع مكبرات الصوت الجديدة بأقل قدر من بيانات التكيف. هنا، نقوم بمقارنة المرشحات اللاحقة المستندة إلى DNN وRNN وCNN مع تدريب الخصومة (GAN) والتهيئة القائمة على المجموعة (CI) من أجل التكيف السريع. تشير النتائج إلى أن شبكة DNN المغذية (FF)، جنبًا إلى جنب مع GAN وCI، تتفوق بشكل كبير على المرشحات اللاحقة الأخرى المقترحة مؤخرًا.
DOI 10.1109/ICASSP.2019.8683714
عرض في المصدر جامعة اوزيجين جامعة اوزيجين - محرك بحث الآثار التاريخية والأرشيفات والدوريات
جامعة اوزيجين - محرك بحث الآثار التاريخية والأرشيفات والدوريات جامعة اوزيجين

التصفية اللاحقة للتكيف مع المتحدث المستندة إلى DNN مع بيانات التكيف المحدودة لأنظمة تركيب الكلام الإحصائية

المؤلف أوزتورك، إم جي، أولوسوي، أو.، ديمير أوغلو، جينك
تاريخ النشر 2019
مكان النشر - IEEE
الموضوع التكيف مع المتحدث، تركيب الكلام، Postfilter، التعلم العميق
النوع وثيقة
اللغة الإنجليزية
رقمي نعم
مخطوط لا
المكتبة جامعة اوزيجين
معرف أصل المكتبة 978-1-4799-8131-1
رقم السجل e71c62e2-a7a5-42e2-9f26-22a7d09970d2
موقع المكتبة الهندسة الكهربائية والإلكترونية
التاريخ 2019
ملاحظات توبيتاك
نص عينة تم نشر الشبكات العصبية العميقة (DNNs) بنجاح للنمذجة الصوتية في أنظمة تركيب الكلام الإحصائي (SPSS). علاوة على ذلك، فقد ثبت أيضًا أن المرشحات اللاحقة (PF) المستندة إلى DNN تتفوق في الأداء على المرشحات اللاحقة التقليدية المستخدمة على نطاق واسع في أنظمة SPSS لزيادة جودة الكلام المركب. ومع ذلك، يتم تدريب المرشحات اللاحقة القائمة على DNN باستخدام قواعد البيانات المعتمدة على المتحدثين. نظرًا لأن أنظمة SPSS يمكنها التكيف بسرعة مع مكبرات الصوت الجديدة من النماذج العامة، فهناك حاجة إلى مرشحات لاحقة قائمة على DNN يمكنها التكيف مع مكبرات الصوت الجديدة بأقل قدر من بيانات التكيف. هنا، نقوم بمقارنة المرشحات اللاحقة المستندة إلى DNN وRNN وCNN مع تدريب الخصومة (GAN) والتهيئة القائمة على المجموعة (CI) من أجل التكيف السريع. تشير النتائج إلى أن شبكة DNN المغذية (FF)، جنبًا إلى جنب مع GAN وCI، تتفوق بشكل كبير على المرشحات اللاحقة الأخرى المقترحة مؤخرًا.
DOI 10.1109/ICASSP.2019.8683714
جامعة اوزيجين - محرك بحث الآثار التاريخية والأرشيفات والدوريات
جامعة اوزيجين يتم إعادة توجيهك...

يرجى الانتظار