نویسنده
آردیتی، امیر
تاریخ انتشار
2022-06-08T10:35:18Z
موضوع
یادگیری ماشین، یادگیری ماشین، شبکه های عصبی مصنوعی، شبکه های عصبی مصنوعی، هوش مصنوعی، هوش مصنوعی
نوع
سند
زبان
انگلیسی
دیجیتال
بله
نسخه خطی
خیر
کتابخانه
دانشگاه اوزیغین
شماره ثبت
a5742729-1127-4202-b7d4-2d39c99ec6c1
محل کتابخانه
گروه علوم کامپیوتر
تاریخ
2022-06-08T10:35:18Z
متن نمونه
یادگیری تقویتی چارچوبی برای ایجاد سیاست های بهینه با توجه به یک وظیفه و ساختار پاداش/تنبیه است. به همین ترتیب، یادگیری تقویتی معکوس، همانطور که از نام آن پیداست، برای بازیابی استدلال پشت یک خط مشی بهینه بر اساس نمایش های یک متخصص استفاده می شود. ما بر آن شدیم تا بررسی کنیم که آیا روشهای اخیر یادگیری تقویتی و یادگیری تقویتی معکوس میتوانند به عنوان یک ابزار محاسباتی برای بررسی اصول بهینه بودن کنترل حرکتی و مکانیسمهای تصمیمگیری شناختی مغز عمل کنند. برای این منظور، ما چندین کار مختلف مرتبط با بخشهای مختلف مکانیسم یادگیری حسی حرکتی مغز را هدف قرار دادهایم. هدف ما بازیابی اصول بهینه به کار گرفته شده توسط مغز برای کارهای مختلف کنترل و تصمیم گیری است. اگر این امر محقق شود، میتوانیم رفتار نشاندادهشده را با تعصب کمتر تحلیل، درک، تقلید و بهبود دهیم، که امیدواریم گامی رو به جلو در درک فرآیند یادگیری در سیستمهای مبتنی بر انسان و مصنوعی باشد. برای دامنه این پایان نامه، دو وظیفه را ارزیابی کرده ایم. اولین کار بررسی کاربرد توسعه ادراکی برای یادگیری تقویتی بود. برای این کار، ما یک رژیم یادگیری مبتنی بر توسعه ادراکی را برای یک عامل یادگیری تقویتی پیشنهاد کردهایم، و نتایج بهدستآمده نشان میدهد که یک رژیم توسعه ادراکی مناسب ممکن است پیشرفت یادگیری را بهبود بخشد و عاملهایی با عملکرد بهتر ارائه دهد. وظیفه دوم پیش بینی پارامترهای تابع پاداش یک مسیر ارائه شده در یک سناریوی اغتشاش بود. برای این کار، ما دو رویکرد مختلف یادگیری تقویتی معکوس را پیشنهاد کردهایم. نتایج ما نشان می دهد که ما قادر به استنباط پارامترهای پاداش معتبر بر روی داده های مصنوعی بودیم. بنزر شِکیلده، ترسینه پکیشتیرملی اوغرنمه ده، ادیندان آنلاشیلابیلهجغی گیبی، بیر اوزماندان آلینان ئن اویگون پولینین آرکاسیندکی سبپلری بولمک ایچین کولانیلیر. Bu araştırmada, güncel Pekiştirmeli Öğrenme ve Tersine Pekiştirmeli Öğrenme metotlarının, beynin motor kontrol ve bilişsel karar alma mekanizmalarının arkasındaki eniyileme prensiplerini modelleyen araçlar olarak kullanılılıme. بو amaç için، beynin farklı duyusal motor özelliklerini hedefleyen farklı görevleri hedefledik. Niyetimiz, beyin tarafından farklı alanlar için oluşturulan en iyileme kriterlerini keşfedebilmek. Bu başarılabildiği takdirde, varolan veya yeni bir metot ile, insan davranışlarını daha düşük bir yanlılık ile analiz edebilir, anlayabilir ve taklit edebiliriz. بو تزین کپسامی دوغرولتوسوندا، ایکی تنه گوروی اجلدیک. ایلک گورو، الغیسال گلیشیمین پکیشیرمللی اوغرنمه یغولانبیلییرلیغینین آراشتیریلماسیدیر. بو گورو ایچین، بیر پکیشیرملی اوغرنمه آجانی، کندی اونردیغیمیز بیر الغیسال گلیشیم تابانلی گلیشیمسل رجیم ایله ایغیتتیک. Sonuçlarımız, uygun بیر algısal gelişim rejiminin, Pekiştirmeli Öğrenme'nin öğrenme ilerlemesini geliştirebileceğini ve daha iyi ajanlar üretebileceğini önerdi. İkinci görev ise, Tersine Pekiştirmeli Öğrenme ile, uzmanların ödül functionu parametrelerini keşfetmekti. Bunun için, iki tane farklı Tersine Pekiştirmeli Öğrenme mekanizması oluşturduk ve sonuçlarımız geçerli ödül functionu parametreleri keşfettiğimizi önermektedir.