یادگیری Q در بازی‌های متوسط ​​منظم

عنوان یادگیری Q در بازی‌های متوسط ​​منظم
نویسنده Anahtarcı، Berkay، Karıksız، Can Deha، Saldı، N.
تاریخ انتشار: 2023-03
محل انتشار - اسپرینگر
موضوع پاداش با تخفیف، بازی‌های میدان متوسط، یادگیری Q، فرآیندهای تصمیم‌گیری منظم مارکوف
نوع دوره ای
زبان انگلیسی
دیجیتال بله
نسخه خطی خیر
کتابخانه: دانشگاه اوزیغین
شناسه دارایی کتابخانه 2153-0785
شماره ثبت 60eb43e0-5e18-444f-9a58-62e50c99b500
محل کتابخانه علوم طبیعی و ریاضی
تاریخ 2023-03
یادداشت‌ها جایزه BAGEP آکادمی علوم
متن نمونه در این مقاله، ما یک بازی میدان میانگین منظم را معرفی می‌کنیم و یادگیری این بازی را تحت تابع پاداش تخفیف افق بی‌نهایت مطالعه می‌کنیم. منظم سازی با افزودن یک تابع منظم سازی قوی مقعر به تابع پاداش یک مرحله ای در مدل بازی میانگین میدان کلاسیک معرفی می شود. ما یک الگوریتم یادگیری مبتنی بر تکرار ارزش را برای این بازی میدان میانگین منظم با استفاده از یادگیری Q برازش ایجاد می‌کنیم. اصطلاح منظم سازی به طور کلی الگوریتم یادگیری تقویتی را برای اجزای سیستم قوی تر می کند. علاوه بر این، ما را قادر می سازد تا تجزیه و تحلیل خطای الگوریتم یادگیری را بدون تحمیل مفروضات تحدب محدود بر روی اجزای سیستم، که در غیاب یک اصطلاح منظم سازی مورد نیاز هستند، ایجاد کنیم.
DOI 10.1007/s13235-022-00450-2
Cilt 13
مشاهده در منبع دانشگاه اوزیغین دانشگاه اوزیغین - موتور جستجوی آثار تاریخی، آرشیوها و نشریات
دانشگاه اوزیغین - موتور جستجوی آثار تاریخی، آرشیوها و نشریات دانشگاه اوزیغین

یادگیری Q در بازی‌های متوسط ​​منظم

نویسنده Anahtarcı، Berkay، Karıksız، Can Deha، Saldı، N.
تاریخ انتشار 2023-03
محل انتشار - اسپرینگر
موضوع پاداش با تخفیف، بازی‌های میدان متوسط، یادگیری Q، فرآیندهای تصمیم‌گیری منظم مارکوف
نوع دوره ای
زبان انگلیسی
دیجیتال بله
نسخه خطی خیر
کتابخانه دانشگاه اوزیغین
شناسه دارایی کتابخانه 2153-0785
شماره ثبت 60eb43e0-5e18-444f-9a58-62e50c99b500
محل کتابخانه علوم طبیعی و ریاضی
تاریخ 2023-03
یادداشت‌ها جایزه BAGEP آکادمی علوم
متن نمونه در این مقاله، ما یک بازی میدان میانگین منظم را معرفی می‌کنیم و یادگیری این بازی را تحت تابع پاداش تخفیف افق بی‌نهایت مطالعه می‌کنیم. منظم سازی با افزودن یک تابع منظم سازی قوی مقعر به تابع پاداش یک مرحله ای در مدل بازی میانگین میدان کلاسیک معرفی می شود. ما یک الگوریتم یادگیری مبتنی بر تکرار ارزش را برای این بازی میدان میانگین منظم با استفاده از یادگیری Q برازش ایجاد می‌کنیم. اصطلاح منظم سازی به طور کلی الگوریتم یادگیری تقویتی را برای اجزای سیستم قوی تر می کند. علاوه بر این، ما را قادر می سازد تا تجزیه و تحلیل خطای الگوریتم یادگیری را بدون تحمیل مفروضات تحدب محدود بر روی اجزای سیستم، که در غیاب یک اصطلاح منظم سازی مورد نیاز هستند، ایجاد کنیم.
DOI 10.1007/s13235-022-00450-2
Cilt 13
دانشگاه اوزیغین - موتور جستجوی آثار تاریخی، آرشیوها و نشریات
دانشگاه اوزیغین شما در حال هدایت مجدد هستید...

لطفاً صبر کنید