کاوش در یادگیری تقویتی معکوس برای تجزیه و تحلیل مکانیسم های کنترل حرکتی و تصمیم گیری شناختی مغز

عنوان کاوش در یادگیری تقویتی معکوس برای تجزیه و تحلیل مکانیسم های کنترل حرکتی و تصمیم گیری شناختی مغز
نویسنده آردیتی، امیر
تاریخ انتشار: 2022-06-08T10:35:18Z
موضوع یادگیری ماشین، یادگیری ماشین، شبکه های عصبی مصنوعی، شبکه های عصبی مصنوعی، هوش مصنوعی، هوش مصنوعی
نوع سند
زبان انگلیسی
دیجیتال بله
نسخه خطی خیر
کتابخانه: دانشگاه اوزیغین
شماره ثبت a5742729-1127-4202-b7d4-2d39c99ec6c1
محل کتابخانه گروه علوم کامپیوتر
تاریخ 2022-06-08T10:35:18Z
متن نمونه یادگیری تقویتی چارچوبی برای ایجاد سیاست های بهینه با توجه به یک وظیفه و ساختار پاداش/تنبیه است. به همین ترتیب، یادگیری تقویتی معکوس، همانطور که از نام آن پیداست، برای بازیابی استدلال پشت یک خط مشی بهینه بر اساس نمایش های یک متخصص استفاده می شود. ما بر آن شدیم تا بررسی کنیم که آیا روش‌های اخیر یادگیری تقویتی و یادگیری تقویتی معکوس می‌توانند به عنوان یک ابزار محاسباتی برای بررسی اصول بهینه بودن کنترل حرکتی و مکانیسم‌های تصمیم‌گیری شناختی مغز عمل کنند. برای این منظور، ما چندین کار مختلف مرتبط با بخش‌های مختلف مکانیسم یادگیری حسی حرکتی مغز را هدف قرار داده‌ایم. هدف ما بازیابی اصول بهینه به کار گرفته شده توسط مغز برای کارهای مختلف کنترل و تصمیم گیری است. اگر این امر محقق شود، می‌توانیم رفتار نشان‌داده‌شده را با تعصب کمتر تحلیل، درک، تقلید و بهبود دهیم، که امیدواریم گامی رو به جلو در درک فرآیند یادگیری در سیستم‌های مبتنی بر انسان و مصنوعی باشد. برای دامنه این پایان نامه، دو وظیفه را ارزیابی کرده ایم. اولین کار بررسی کاربرد توسعه ادراکی برای یادگیری تقویتی بود. برای این کار، ما یک رژیم یادگیری مبتنی بر توسعه ادراکی را برای یک عامل یادگیری تقویتی پیشنهاد کرده‌ایم، و نتایج به‌دست‌آمده نشان می‌دهد که یک رژیم توسعه ادراکی مناسب ممکن است پیشرفت یادگیری را بهبود بخشد و عامل‌هایی با عملکرد بهتر ارائه دهد. وظیفه دوم پیش بینی پارامترهای تابع پاداش یک مسیر ارائه شده در یک سناریوی اغتشاش بود. برای این کار، ما دو رویکرد مختلف یادگیری تقویتی معکوس را پیشنهاد کرده‌ایم. نتایج ما نشان می دهد که ما قادر به استنباط پارامترهای پاداش معتبر بر روی داده های مصنوعی بودیم. بنزر شِکیلده، ترسینه پکیشتیرملی اوغرنمه ده، ادیندان آنلاشیلابیله‌جغی گیبی، بیر اوزماندان آلینان ئن اویگون پولینین آرکاسیندکی سبپلری بولمک ایچین کولانیلیر. Bu araştırmada, güncel Pekiştirmeli Öğrenme ve Tersine Pekiştirmeli Öğrenme metotlarının, beynin motor kontrol ve bilişsel karar alma mekanizmalarının arkasındaki eniyileme prensiplerini modelleyen araçlar olarak kullanılılıme. بو amaç için، beynin farklı duyusal motor özelliklerini hedefleyen farklı görevleri hedefledik. Niyetimiz, beyin tarafından farklı alanlar için oluşturulan en iyileme kriterlerini keşfedebilmek. Bu başarılabildiği takdirde, varolan veya yeni bir metot ile, insan davranışlarını daha düşük bir yanlılık ile analiz edebilir, anlayabilir ve taklit edebiliriz. بو تزین کپسامی دوغرولتوسوندا، ایکی تنه گوروی اجلدیک. ایلک گورو، الغیسال گلیشیمین پکیشیرمللی اوغرنمه یغولانبیلییرلیغینین آراشتیریلماسیدیر. بو گورو ایچین، بیر پکیشیرملی اوغرنمه آجانی، کندی اونردیغیمیز بیر الغیسال گلیشیم تابانلی گلیشیمسل رجیم ایله ایغیتتیک. Sonuçlarımız, uygun بیر algısal gelişim rejiminin, Pekiştirmeli Öğrenme'nin öğrenme ilerlemesini geliştirebileceğini ve daha iyi ajanlar üretebileceğini önerdi. İkinci görev ise, Tersine Pekiştirmeli Öğrenme ile, uzmanların ödül functionu parametrelerini keşfetmekti. Bunun için, iki tane farklı Tersine Pekiştirmeli Öğrenme mekanizması oluşturduk ve sonuçlarımız geçerli ödül functionu parametreleri keşfettiğimizi önermektedir.
مشاهده در منبع دانشگاه اوزیغین دانشگاه اوزیغین - موتور جستجوی آثار تاریخی، آرشیوها و نشریات
دانشگاه اوزیغین - موتور جستجوی آثار تاریخی، آرشیوها و نشریات دانشگاه اوزیغین

کاوش در یادگیری تقویتی معکوس برای تجزیه و تحلیل مکانیسم های کنترل حرکتی و تصمیم گیری شناختی مغز

نویسنده آردیتی، امیر
تاریخ انتشار 2022-06-08T10:35:18Z
موضوع یادگیری ماشین، یادگیری ماشین، شبکه های عصبی مصنوعی، شبکه های عصبی مصنوعی، هوش مصنوعی، هوش مصنوعی
نوع سند
زبان انگلیسی
دیجیتال بله
نسخه خطی خیر
کتابخانه دانشگاه اوزیغین
شماره ثبت a5742729-1127-4202-b7d4-2d39c99ec6c1
محل کتابخانه گروه علوم کامپیوتر
تاریخ 2022-06-08T10:35:18Z
متن نمونه یادگیری تقویتی چارچوبی برای ایجاد سیاست های بهینه با توجه به یک وظیفه و ساختار پاداش/تنبیه است. به همین ترتیب، یادگیری تقویتی معکوس، همانطور که از نام آن پیداست، برای بازیابی استدلال پشت یک خط مشی بهینه بر اساس نمایش های یک متخصص استفاده می شود. ما بر آن شدیم تا بررسی کنیم که آیا روش‌های اخیر یادگیری تقویتی و یادگیری تقویتی معکوس می‌توانند به عنوان یک ابزار محاسباتی برای بررسی اصول بهینه بودن کنترل حرکتی و مکانیسم‌های تصمیم‌گیری شناختی مغز عمل کنند. برای این منظور، ما چندین کار مختلف مرتبط با بخش‌های مختلف مکانیسم یادگیری حسی حرکتی مغز را هدف قرار داده‌ایم. هدف ما بازیابی اصول بهینه به کار گرفته شده توسط مغز برای کارهای مختلف کنترل و تصمیم گیری است. اگر این امر محقق شود، می‌توانیم رفتار نشان‌داده‌شده را با تعصب کمتر تحلیل، درک، تقلید و بهبود دهیم، که امیدواریم گامی رو به جلو در درک فرآیند یادگیری در سیستم‌های مبتنی بر انسان و مصنوعی باشد. برای دامنه این پایان نامه، دو وظیفه را ارزیابی کرده ایم. اولین کار بررسی کاربرد توسعه ادراکی برای یادگیری تقویتی بود. برای این کار، ما یک رژیم یادگیری مبتنی بر توسعه ادراکی را برای یک عامل یادگیری تقویتی پیشنهاد کرده‌ایم، و نتایج به‌دست‌آمده نشان می‌دهد که یک رژیم توسعه ادراکی مناسب ممکن است پیشرفت یادگیری را بهبود بخشد و عامل‌هایی با عملکرد بهتر ارائه دهد. وظیفه دوم پیش بینی پارامترهای تابع پاداش یک مسیر ارائه شده در یک سناریوی اغتشاش بود. برای این کار، ما دو رویکرد مختلف یادگیری تقویتی معکوس را پیشنهاد کرده‌ایم. نتایج ما نشان می دهد که ما قادر به استنباط پارامترهای پاداش معتبر بر روی داده های مصنوعی بودیم. بنزر شِکیلده، ترسینه پکیشتیرملی اوغرنمه ده، ادیندان آنلاشیلابیله‌جغی گیبی، بیر اوزماندان آلینان ئن اویگون پولینین آرکاسیندکی سبپلری بولمک ایچین کولانیلیر. Bu araştırmada, güncel Pekiştirmeli Öğrenme ve Tersine Pekiştirmeli Öğrenme metotlarının, beynin motor kontrol ve bilişsel karar alma mekanizmalarının arkasındaki eniyileme prensiplerini modelleyen araçlar olarak kullanılılıme. بو amaç için، beynin farklı duyusal motor özelliklerini hedefleyen farklı görevleri hedefledik. Niyetimiz, beyin tarafından farklı alanlar için oluşturulan en iyileme kriterlerini keşfedebilmek. Bu başarılabildiği takdirde, varolan veya yeni bir metot ile, insan davranışlarını daha düşük bir yanlılık ile analiz edebilir, anlayabilir ve taklit edebiliriz. بو تزین کپسامی دوغرولتوسوندا، ایکی تنه گوروی اجلدیک. ایلک گورو، الغیسال گلیشیمین پکیشیرمللی اوغرنمه یغولانبیلییرلیغینین آراشتیریلماسیدیر. بو گورو ایچین، بیر پکیشیرملی اوغرنمه آجانی، کندی اونردیغیمیز بیر الغیسال گلیشیم تابانلی گلیشیمسل رجیم ایله ایغیتتیک. Sonuçlarımız, uygun بیر algısal gelişim rejiminin, Pekiştirmeli Öğrenme'nin öğrenme ilerlemesini geliştirebileceğini ve daha iyi ajanlar üretebileceğini önerdi. İkinci görev ise, Tersine Pekiştirmeli Öğrenme ile, uzmanların ödül functionu parametrelerini keşfetmekti. Bunun için, iki tane farklı Tersine Pekiştirmeli Öğrenme mekanizması oluşturduk ve sonuçlarımız geçerli ödül functionu parametreleri keşfettiğimizi önermektedir.
دانشگاه اوزیغین - موتور جستجوی آثار تاریخی، آرشیوها و نشریات
دانشگاه اوزیغین شما در حال هدایت مجدد هستید...

لطفاً صبر کنید