تخطي تحديث الوزن: تقليل وقت التدريب للشبكات العصبية الاصطناعية
| العنوان | تخطي تحديث الوزن: تقليل وقت التدريب للشبكات العصبية الاصطناعية |
|---|---|
| المؤلف | سافايينيكو، ب.، أكتورك، إسماعيل |
| تاريخ النشر: | 2021-12 |
| مكان النشر | - IEEE |
| الموضوع | الشبكات العصبية الاصطناعية، زمن التدريب، التغير الزمني، تحديث الوزن |
| النوع | دورية |
| اللغة | الإنجليزية |
| رقمي | نعم |
| مخطوط | لا |
| المكتبة: | جامعة اوزيجين |
| معرف أصل المكتبة | 2-s2.0-85119441655 |
| رقم السجل | e85402e5-53f5-4d04-a896-a323c5b0cefb |
| موقع المكتبة | علوم الكمبيوتر |
| التاريخ | 2021-12 |
| نص عينة | تُعرف الشبكات العصبية الاصطناعية (ANNs) بأنها أحدث التقنيات في التعلم الآلي (ML) وقد حققت نتائج رائعة في التطبيقات كثيفة البيانات، مثل التعرف والتصنيف والتجزئة. تستخدم هذه الشبكات في الغالب طبقات عميقة من الالتفاف و/أو طبقات متصلة بالكامل مع العديد من المرشحات في كل طبقة، مما يتطلب كمية كبيرة من البيانات والمعلمات الفائقة القابلة للضبط لتحقيق دقة تنافسية. ونتيجة لذلك، فإن تكاليف التدريب والاتصالات والحسابات (وخاصة الوقت الذي يقضيه في التدريب) تصبح عوامل مقيدة لتوسيع نطاقها. في هذا البحث، نقترح منهجية تدريب جديدة للشبكات العصبية الاصطناعية التي تستغل ملاحظة تحسين الدقة وتظهر الاختلافات الزمنية التي تسمح لنا بتخطي تحديث الأوزان عندما يكون الاختلاف ضئيلًا. خلال هذه الفترات الزمنية، نستمر في تحديث التحيز الذي يضمن استمرار تدريب الشبكة وتجنب التجهيز الزائد؛ ومع ذلك، فإننا نتخطى بشكل انتقائي تحديث الأوزان (وحساباتها التي تستغرق وقتًا طويلاً). ويحقق هذا النهج التدريبي تقريبًا نفس الدقة بتكلفة حسابية أقل بكثير ويقلل الوقت المستغرق في التدريب. لقد قمنا بتطوير نوعين مختلفين من طريقة التدريب المقترحة لتحديث الأوزان بشكل انتقائي، ونطلق عليهما اسمي: 1) تخطي تحديث الوزن (WUS)، و2) تخطي تحديث الوزن مع جدولة معدل التعلم (WUS+LR). نقوم بتقييم هذين النهجين من خلال تحليل أحدث النماذج، بما في ذلك AlexNet وVGG-11 وVGG-16 وResNet-18 على مجموعات بيانات CIFAR. نستخدم أيضًا مجموعة بيانات ImageNet لـ AlexNet وVGG-16 وResnet-18. في المتوسط، خفضت WUS وWUS+LR وقت التدريب (مقارنة بخط الأساس) بنسبة 54%، و50% على وحدة المعالجة المركزية و22%، و21% على وحدة معالجة الرسومات، على التوالي لـ CIFAR-10؛ و43% و35% على وحدة المعالجة المركزية و22% و21% على وحدة معالجة الرسومات، على التوالي لـ CIFAR-100؛ وأخيرًا 30% و27% لـ ImageNet على التوالي. |
| DOI | 10.1109/JETCAS.2021.3127907 |
| Cilt | 11 |