تقريب الحالة المحدودة لعمليات اتخاذ القرار لماركوف
| العنوان | تقريب الحالة المحدودة لعمليات اتخاذ القرار لماركوف |
|---|---|
| المؤلف | سالدي، ناسي، ليندر، تي.، يوكسيل، إس. |
| تاريخ النشر: | 2018 |
| مكان النشر | - سبرينغر |
| النوع | كتاب |
| اللغة | الإنجليزية |
| رقمي | نعم |
| مخطوط | لا |
| المكتبة: | جامعة اوزيجين |
| معرف أصل المكتبة | 978-3-319-79032-9 |
| رقم السجل | bc8e21af-ac8d-40f0-b049-399ca7f5f409 |
| موقع المكتبة | العلوم الطبيعية والرياضية |
| التاريخ | 2018 |
| نص عينة | في هذا الفصل ندرس مشكلة تقريب الحالة المحدودة للحوسبة بالقرب من السياسات المثالية لـ MDPs في الوقت المنفصل مع حالة بوريل ومساحات العمل، في ظل معايير التكاليف المخفضة والمتوسطة. على الرغم من أن الوجود والخصائص الهيكلية للسياسات المثلى لـ MDPs قد تمت دراستها على نطاق واسع في الأدبيات، فإن حساب مثل هذه السياسات يمثل بشكل عام مشكلة صعبة بالنسبة للأنظمة ذات مساحات الحالة غير المعدودة. ينشأ هذا الموقف أيضًا في التخفيض الملحوظ بالكامل لعملية اتخاذ قرار ماركوف التي تمت ملاحظتها جزئيًا حتى عندما يكون للنظام الأصلي مساحات عمل وحالة محدودة. نوضح هنا أن إحدى الطرق لحساب الحلول المثلى تقريبًا لمثل هذه MDPs هي بناء نموذج مخفض مع احتمال انتقال جديد ووظيفة تكلفة ذات مرحلة واحدة عن طريق قياس مساحة الحالة، أي عن طريق تقسيمها على شبكة محدودة. من المعقول أن نتوقع أنه عندما يكون لوظيفة التكلفة ذات المرحلة الواحدة واحتمالية الانتقال للنموذج الأصلي خصائص استمرارية معينة، فإن تكلفة السياسة المثلى للنموذج المحدود التقريبي تتقارب مع التكلفة المثلى للنموذج الأصلي عندما يصبح التمييز أكثر دقة. علاوة على ذلك، في ظل شروط الاستمرارية الإضافية على احتمالية الانتقال ودالة التكلفة ذات المرحلة الواحدة، نحصل أيضًا على حدود دقة التقريب من حيث عدد النقاط المستخدمة لتمييز مساحة الحالة، وبالتالي توفير مقايضة بين تكلفة الحساب وخسارة الأداء في النظام. وعلى وجه الخصوص، ندرس المشكلتين التاليتين. |
| DOI | 10.1007/978-3-319-79033-6_4 |