تكيف المتحدث مع التعلم العميق لأنظمة تحويل النص إلى كلام

العنوان تكيف المتحدث مع التعلم العميق لأنظمة تحويل النص إلى كلام
المؤلف ايرين، ايري
تاريخ النشر: 2022-06-08T10:49:40Z
الموضوع صوت النص، تحويل النص إلى كلام، الشبكات العصبية الاصطناعية، الذكاء الاصطناعي، الذكاء الاصطناعي
النوع وثيقة
اللغة الإنجليزية
رقمي نعم
مخطوط لا
المكتبة: جامعة اوزيجين
رقم السجل 5eb81fca-f018-420a-b714-7a4d6ca4d869
موقع المكتبة قسم علوم الحاسوب
التاريخ 2022-06-08T10:49:40Z
نص عينة أصبحت أنظمة تركيب الكلام من طرف إلى طرف (e2e) شائعة مع الإدخال الأخير لأنظمة التحويل من حرف إلى مخطط طيفي، مثل Tacotron، التي تستخدم البنى العصبية القائمة على التشفير وفك التشفير. على الرغم من أن أنظمة التسلسل إلى التسلسل هذه يمكن أن تنتج مخططات طيفية ميل من الحروف دون واجهة أمامية لمعالجة النص، إلا أنها تتطلب كميات كبيرة من البيانات الصوتية ذات العلامات والتدليك الجيد والتي تحتوي على نسبة إشارة إلى ضوضاء (SNR) عالية وحد أدنى من القطع الأثرية. تجعل متطلبات البيانات هذه من الصعب بناء أنظمة شاملة من البداية خاصة للغات منخفضة الموارد. علاوة على ذلك، فإن معظم أنظمة e2e غير مصممة للأجهزة ذات الذاكرة الصغيرة وموارد وحدة المعالجة المركزية. هنا، ندرس استخدام الشبكة العصبية العميقة التقليدية (DNN) للنمذجة الصوتية جنبًا إلى جنب مع مرشح لاحق يعمل على تحسين ميزات الكلام التي تنتجها الشبكة. تم تدريب البنى المقترحة باستخدام قاعدة بيانات وول ستريت جورنال (WSJ) الصاخبة نسبيًا ومتعددة المتحدثين، وتم اختبارها باستخدام مكبرات صوت غير مرئية. تم تكييف طبقة ما بعد التصفية الرفيعة مع الحد الأدنى من البيانات للمتكلم المستهدف للاختبار. لقد قمنا بدراسة العديد من بنيات ما بعد التصفية وقمنا بمقارنتها مع كل من الاختبارات الموضوعية والذاتية. كان أداء البنى المتصلة بالكامل والقائمة على المحولات هو الأفضل في الاختبارات الذاتية. كان أداء الهندسة المعمارية القائمة على المحولات هو الأفضل في الاختبارات الموضوعية. علاوة على ذلك، كان أسرع من البنى الأخرى في كل من سرعات التدريب والاستدلال. نظام ديزيدين ديزيي، يجعل من الممكن الاستفادة من الطيف الترددي الخاص به؛ yüklü miktarda, iyi yoğrulmuş, yüksek sinyal-gürültü oranlı ve الحد الأدنى من düzeyde kusurlu etiketli ses verisine ihtiyaç duymaktadır. قد يكون من المفيد جدًا أن تقوم بذلك من خلال الأنظمة الأساسية التي يمكنك الحصول عليها بسهولة. Dahası, نظامك محمي بوحدة المعالجة المركزية ووحدة المعالجة المركزية (CPU) في نظامك الذكي. من خلال العمل، يتم استخدام أحدث التقنيات لتحسين كفاءة ما بعد التصفية من خلال إضافة نماذج صوتية رائعة. تم اختبار نظام وول ستريت جورنال (WSJ) من قبل النظام المعتمد من قبل نظام حوكمة الشركات. منذ ما بعد التصفية، تم التحقق من الحد الأدنى من الاختبارات اللازمة. Birkaç Farklı postfiltre mimarisini araştırdık ve Bunları taraflı ve tarafsız testlerle karşılaştırdık. Tam-bağlı ve Transformer temelli mimariler taraflı testlerde en iyi sonucu verdi. تم اختبار المحولات temelli mimari tarafsız en iyi sonucu verdi. ربما يكون هذا هو الحال بالنسبة لـ tahminde daha hızlıydı.
عرض في المصدر جامعة اوزيجين جامعة اوزيجين - محرك بحث الآثار التاريخية والأرشيفات والدوريات
جامعة اوزيجين - محرك بحث الآثار التاريخية والأرشيفات والدوريات جامعة اوزيجين

تكيف المتحدث مع التعلم العميق لأنظمة تحويل النص إلى كلام

المؤلف ايرين، ايري
تاريخ النشر 2022-06-08T10:49:40Z
الموضوع صوت النص، تحويل النص إلى كلام، الشبكات العصبية الاصطناعية، الذكاء الاصطناعي، الذكاء الاصطناعي
النوع وثيقة
اللغة الإنجليزية
رقمي نعم
مخطوط لا
المكتبة جامعة اوزيجين
رقم السجل 5eb81fca-f018-420a-b714-7a4d6ca4d869
موقع المكتبة قسم علوم الحاسوب
التاريخ 2022-06-08T10:49:40Z
نص عينة أصبحت أنظمة تركيب الكلام من طرف إلى طرف (e2e) شائعة مع الإدخال الأخير لأنظمة التحويل من حرف إلى مخطط طيفي، مثل Tacotron، التي تستخدم البنى العصبية القائمة على التشفير وفك التشفير. على الرغم من أن أنظمة التسلسل إلى التسلسل هذه يمكن أن تنتج مخططات طيفية ميل من الحروف دون واجهة أمامية لمعالجة النص، إلا أنها تتطلب كميات كبيرة من البيانات الصوتية ذات العلامات والتدليك الجيد والتي تحتوي على نسبة إشارة إلى ضوضاء (SNR) عالية وحد أدنى من القطع الأثرية. تجعل متطلبات البيانات هذه من الصعب بناء أنظمة شاملة من البداية خاصة للغات منخفضة الموارد. علاوة على ذلك، فإن معظم أنظمة e2e غير مصممة للأجهزة ذات الذاكرة الصغيرة وموارد وحدة المعالجة المركزية. هنا، ندرس استخدام الشبكة العصبية العميقة التقليدية (DNN) للنمذجة الصوتية جنبًا إلى جنب مع مرشح لاحق يعمل على تحسين ميزات الكلام التي تنتجها الشبكة. تم تدريب البنى المقترحة باستخدام قاعدة بيانات وول ستريت جورنال (WSJ) الصاخبة نسبيًا ومتعددة المتحدثين، وتم اختبارها باستخدام مكبرات صوت غير مرئية. تم تكييف طبقة ما بعد التصفية الرفيعة مع الحد الأدنى من البيانات للمتكلم المستهدف للاختبار. لقد قمنا بدراسة العديد من بنيات ما بعد التصفية وقمنا بمقارنتها مع كل من الاختبارات الموضوعية والذاتية. كان أداء البنى المتصلة بالكامل والقائمة على المحولات هو الأفضل في الاختبارات الذاتية. كان أداء الهندسة المعمارية القائمة على المحولات هو الأفضل في الاختبارات الموضوعية. علاوة على ذلك، كان أسرع من البنى الأخرى في كل من سرعات التدريب والاستدلال. نظام ديزيدين ديزيي، يجعل من الممكن الاستفادة من الطيف الترددي الخاص به؛ yüklü miktarda, iyi yoğrulmuş, yüksek sinyal-gürültü oranlı ve الحد الأدنى من düzeyde kusurlu etiketli ses verisine ihtiyaç duymaktadır. قد يكون من المفيد جدًا أن تقوم بذلك من خلال الأنظمة الأساسية التي يمكنك الحصول عليها بسهولة. Dahası, نظامك محمي بوحدة المعالجة المركزية ووحدة المعالجة المركزية (CPU) في نظامك الذكي. من خلال العمل، يتم استخدام أحدث التقنيات لتحسين كفاءة ما بعد التصفية من خلال إضافة نماذج صوتية رائعة. تم اختبار نظام وول ستريت جورنال (WSJ) من قبل النظام المعتمد من قبل نظام حوكمة الشركات. منذ ما بعد التصفية، تم التحقق من الحد الأدنى من الاختبارات اللازمة. Birkaç Farklı postfiltre mimarisini araştırdık ve Bunları taraflı ve tarafsız testlerle karşılaştırdık. Tam-bağlı ve Transformer temelli mimariler taraflı testlerde en iyi sonucu verdi. تم اختبار المحولات temelli mimari tarafsız en iyi sonucu verdi. ربما يكون هذا هو الحال بالنسبة لـ tahminde daha hızlıydı.
جامعة اوزيجين - محرك بحث الآثار التاريخية والأرشيفات والدوريات
جامعة اوزيجين يتم إعادة توجيهك...

يرجى الانتظار