تقریب حالت محدود فرآیندهای تصمیم مارکوف

عنوان تقریب حالت محدود فرآیندهای تصمیم مارکوف
نویسنده Saldı، Naci، Linder، T.، Yüksel، S.
تاریخ انتشار: 2018
محل انتشار - اسپرینگر
نوع كتاب
زبان انگلیسی
دیجیتال بله
نسخه خطی خیر
کتابخانه: دانشگاه اوزیغین
شناسه دارایی کتابخانه 978-3-319-79032-9
شماره ثبت bc8e21af-ac8d-40f0-b049-399ca7f5f409
محل کتابخانه علوم طبیعی و ریاضی
تاریخ 2018
متن نمونه در این فصل ما مسئله تقریب حالت محدود را برای محاسبه سیاست‌های نزدیک به بهینه برای MDPهای گسسته با موقعیت بورل و فضاهای عمل، تحت معیارهای هزینه‌های تخفیف‌یافته و متوسط ​​مطالعه می‌کنیم. اگرچه وجود و ویژگی‌های ساختاری سیاست‌های بهینه MDPs به طور گسترده در ادبیات مطالعه شده است، محاسبه چنین سیاست‌هایی به طور کلی یک مشکل چالش برانگیز برای سیستم‌هایی با فضاهای حالت غیرقابل شمارش است. این وضعیت همچنین در کاهش کاملاً مشاهده‌شده یک فرآیند تصمیم‌گیری مارکوف تا حدی مشاهده‌شده حتی زمانی که سیستم اصلی دارای فضاهای حالت و عمل محدود باشد، به وجود می‌آید. در اینجا ما نشان می‌دهیم که یکی از راه‌های محاسبه تقریباً راه‌حل‌های بهینه برای چنین MDP‌هایی، ساخت یک مدل کاهش‌یافته با احتمال انتقال جدید و تابع هزینه یک مرحله‌ای با کمی کردن فضای حالت، یعنی با گسسته کردن آن در یک شبکه محدود است. منطقی است انتظار داشته باشیم که وقتی تابع هزینه یک مرحله‌ای و احتمال انتقال مدل اصلی ویژگی‌های تداوم خاصی دارد، هزینه سیاست بهینه برای مدل محدود تقریبی به هزینه بهینه مدل اصلی با دقیق‌تر شدن گسسته‌سازی همگرا می‌شود. علاوه بر این، تحت شرایط تداوم اضافی بر روی احتمال انتقال و تابع هزینه یک مرحله‌ای، ما همچنین مرزهایی را در مورد دقت تقریب بر حسب تعداد نقاط مورد استفاده برای گسسته‌سازی فضای حالت به‌دست می‌آوریم، در نتیجه یک مبادله بین هزینه محاسبات و از دست دادن عملکرد در سیستم فراهم می‌کنیم. به طور خاص، ما دو مشکل زیر را مطالعه می کنیم.
DOI 10.1007/978-3-319-79033-6_4
مشاهده در منبع دانشگاه اوزیغین دانشگاه اوزیغین - موتور جستجوی آثار تاریخی، آرشیوها و نشریات
دانشگاه اوزیغین - موتور جستجوی آثار تاریخی، آرشیوها و نشریات دانشگاه اوزیغین

تقریب حالت محدود فرآیندهای تصمیم مارکوف

نویسنده Saldı، Naci، Linder، T.، Yüksel، S.
تاریخ انتشار 2018
محل انتشار - اسپرینگر
نوع كتاب
زبان انگلیسی
دیجیتال بله
نسخه خطی خیر
کتابخانه دانشگاه اوزیغین
شناسه دارایی کتابخانه 978-3-319-79032-9
شماره ثبت bc8e21af-ac8d-40f0-b049-399ca7f5f409
محل کتابخانه علوم طبیعی و ریاضی
تاریخ 2018
متن نمونه در این فصل ما مسئله تقریب حالت محدود را برای محاسبه سیاست‌های نزدیک به بهینه برای MDPهای گسسته با موقعیت بورل و فضاهای عمل، تحت معیارهای هزینه‌های تخفیف‌یافته و متوسط ​​مطالعه می‌کنیم. اگرچه وجود و ویژگی‌های ساختاری سیاست‌های بهینه MDPs به طور گسترده در ادبیات مطالعه شده است، محاسبه چنین سیاست‌هایی به طور کلی یک مشکل چالش برانگیز برای سیستم‌هایی با فضاهای حالت غیرقابل شمارش است. این وضعیت همچنین در کاهش کاملاً مشاهده‌شده یک فرآیند تصمیم‌گیری مارکوف تا حدی مشاهده‌شده حتی زمانی که سیستم اصلی دارای فضاهای حالت و عمل محدود باشد، به وجود می‌آید. در اینجا ما نشان می‌دهیم که یکی از راه‌های محاسبه تقریباً راه‌حل‌های بهینه برای چنین MDP‌هایی، ساخت یک مدل کاهش‌یافته با احتمال انتقال جدید و تابع هزینه یک مرحله‌ای با کمی کردن فضای حالت، یعنی با گسسته کردن آن در یک شبکه محدود است. منطقی است انتظار داشته باشیم که وقتی تابع هزینه یک مرحله‌ای و احتمال انتقال مدل اصلی ویژگی‌های تداوم خاصی دارد، هزینه سیاست بهینه برای مدل محدود تقریبی به هزینه بهینه مدل اصلی با دقیق‌تر شدن گسسته‌سازی همگرا می‌شود. علاوه بر این، تحت شرایط تداوم اضافی بر روی احتمال انتقال و تابع هزینه یک مرحله‌ای، ما همچنین مرزهایی را در مورد دقت تقریب بر حسب تعداد نقاط مورد استفاده برای گسسته‌سازی فضای حالت به‌دست می‌آوریم، در نتیجه یک مبادله بین هزینه محاسبات و از دست دادن عملکرد در سیستم فراهم می‌کنیم. به طور خاص، ما دو مشکل زیر را مطالعه می کنیم.
DOI 10.1007/978-3-319-79033-6_4
دانشگاه اوزیغین - موتور جستجوی آثار تاریخی، آرشیوها و نشریات
دانشگاه اوزیغین شما در حال هدایت مجدد هستید...

لطفاً صبر کنید