Q-التعلم في الألعاب الميدانية المتوسطة المنتظمة
| العنوان | Q-التعلم في الألعاب الميدانية المتوسطة المنتظمة |
|---|---|
| المؤلف | أناهتارجي، بيركاي، كاريكسيز، كان ديها، سالدي، ن. |
| تاريخ النشر: | 2023-03 |
| مكان النشر | - سبرينغر |
| الموضوع | المكافأة المخفضة، ألعاب متوسط الميدان، Q-Learning، عمليات اتخاذ القرار المنتظمة لماركوف |
| النوع | دورية |
| اللغة | الإنجليزية |
| رقمي | نعم |
| مخطوط | لا |
| المكتبة: | جامعة اوزيجين |
| معرف أصل المكتبة | 2153-0785 |
| رقم السجل | 60eb43e0-5e18-444f-9a58-62e50c99b500 |
| موقع المكتبة | العلوم الطبيعية والرياضية |
| التاريخ | 2023-03 |
| ملاحظات | جائزة BAGEP من أكاديمية العلوم |
| نص عينة | في هذا البحث، نقدم لعبة متوسطة المجال منتظمة وندرس تعلم هذه اللعبة في ظل دالة المكافأة المخصومة ذات الأفق اللانهائي. يتم تقديم التنظيم عن طريق إضافة وظيفة تنظيم مقعرة بقوة إلى وظيفة المكافأة ذات المرحلة الواحدة في نموذج اللعبة الكلاسيكية لمتوسط المجال. لقد أنشأنا خوارزمية تعلم قائمة على تكرار القيمة لهذه اللعبة المنتظمة ذات المجال المتوسط باستخدام Q-Learning المجهزة. مصطلح التنظيم بشكل عام يجعل خوارزمية التعلم المعزز أكثر قوة لمكونات النظام. علاوة على ذلك، فهي تمكننا من إنشاء تحليل الأخطاء لخوارزمية التعلم دون فرض افتراضات التحدب المقيدة على مكونات النظام، والتي تكون ضرورية في حالة عدم وجود مصطلح التنظيم. |
| DOI | 10.1007/s13235-022-00450-2 |
| Cilt | 13 |