Q-التعلم في الألعاب الميدانية المتوسطة المنتظمة

العنوان Q-التعلم في الألعاب الميدانية المتوسطة المنتظمة
المؤلف أناهتارجي، بيركاي، كاريكسيز، كان ديها، سالدي، ن.
تاريخ النشر: 2023-03
مكان النشر - سبرينغر
الموضوع المكافأة المخفضة، ألعاب متوسط ​​الميدان، Q-Learning، عمليات اتخاذ القرار المنتظمة لماركوف
النوع دورية
اللغة الإنجليزية
رقمي نعم
مخطوط لا
المكتبة: جامعة اوزيجين
معرف أصل المكتبة 2153-0785
رقم السجل 60eb43e0-5e18-444f-9a58-62e50c99b500
موقع المكتبة العلوم الطبيعية والرياضية
التاريخ 2023-03
ملاحظات جائزة BAGEP من أكاديمية العلوم
نص عينة في هذا البحث، نقدم لعبة متوسطة المجال منتظمة وندرس تعلم هذه اللعبة في ظل دالة المكافأة المخصومة ذات الأفق اللانهائي. يتم تقديم التنظيم عن طريق إضافة وظيفة تنظيم مقعرة بقوة إلى وظيفة المكافأة ذات المرحلة الواحدة في نموذج اللعبة الكلاسيكية لمتوسط ​​المجال. لقد أنشأنا خوارزمية تعلم قائمة على تكرار القيمة لهذه اللعبة المنتظمة ذات المجال المتوسط ​​باستخدام Q-Learning المجهزة. مصطلح التنظيم بشكل عام يجعل خوارزمية التعلم المعزز أكثر قوة لمكونات النظام. علاوة على ذلك، فهي تمكننا من إنشاء تحليل الأخطاء لخوارزمية التعلم دون فرض افتراضات التحدب المقيدة على مكونات النظام، والتي تكون ضرورية في حالة عدم وجود مصطلح التنظيم.
DOI 10.1007/s13235-022-00450-2
Cilt 13
عرض في المصدر جامعة اوزيجين جامعة اوزيجين - محرك بحث الآثار التاريخية والأرشيفات والدوريات
جامعة اوزيجين - محرك بحث الآثار التاريخية والأرشيفات والدوريات جامعة اوزيجين

Q-التعلم في الألعاب الميدانية المتوسطة المنتظمة

المؤلف أناهتارجي، بيركاي، كاريكسيز، كان ديها، سالدي، ن.
تاريخ النشر 2023-03
مكان النشر - سبرينغر
الموضوع المكافأة المخفضة، ألعاب متوسط ​​الميدان، Q-Learning، عمليات اتخاذ القرار المنتظمة لماركوف
النوع دورية
اللغة الإنجليزية
رقمي نعم
مخطوط لا
المكتبة جامعة اوزيجين
معرف أصل المكتبة 2153-0785
رقم السجل 60eb43e0-5e18-444f-9a58-62e50c99b500
موقع المكتبة العلوم الطبيعية والرياضية
التاريخ 2023-03
ملاحظات جائزة BAGEP من أكاديمية العلوم
نص عينة في هذا البحث، نقدم لعبة متوسطة المجال منتظمة وندرس تعلم هذه اللعبة في ظل دالة المكافأة المخصومة ذات الأفق اللانهائي. يتم تقديم التنظيم عن طريق إضافة وظيفة تنظيم مقعرة بقوة إلى وظيفة المكافأة ذات المرحلة الواحدة في نموذج اللعبة الكلاسيكية لمتوسط ​​المجال. لقد أنشأنا خوارزمية تعلم قائمة على تكرار القيمة لهذه اللعبة المنتظمة ذات المجال المتوسط ​​باستخدام Q-Learning المجهزة. مصطلح التنظيم بشكل عام يجعل خوارزمية التعلم المعزز أكثر قوة لمكونات النظام. علاوة على ذلك، فهي تمكننا من إنشاء تحليل الأخطاء لخوارزمية التعلم دون فرض افتراضات التحدب المقيدة على مكونات النظام، والتي تكون ضرورية في حالة عدم وجود مصطلح التنظيم.
DOI 10.1007/s13235-022-00450-2
Cilt 13
جامعة اوزيجين - محرك بحث الآثار التاريخية والأرشيفات والدوريات
جامعة اوزيجين يتم إعادة توجيهك...

يرجى الانتظار