رویکرد تجدید نظر شده برای بهینهسازی سبد ارزهای دیجیتال با استفاده از چارچوبهای یادگیری پیشرفته Q و تکرار سیاست
| عنوان | رویکرد تجدید نظر شده برای بهینهسازی سبد ارزهای دیجیتال با استفاده از چارچوبهای یادگیری پیشرفته Q و تکرار سیاست |
|---|---|
| نویسنده | آلتوک، سرن |
| تاریخ انتشار: | 2024-08-30T14:23:41Z |
| موضوع | مدیریت پورتفولیو، مدلهای ریاضی، صنعت خدمات مالی، نوآوریهای فناوری، ارزهای دیجیتال، یادگیری ماشینی، یادگیری تقویتی، علم داده |
| نوع | سند |
| زبان | انگلیسی |
| دیجیتال | بله |
| نسخه خطی | خیر |
| کتابخانه: | دانشگاه اوزیغین |
| شماره ثبت | 4fb93cd6-c04a-47de-a9a2-14e731890205 |
| محل کتابخانه | گروه علوم داده |
| تاریخ | 2024-08-30T14:23:41Z |
| متن نمونه | علیرغم تمام عواملی که باعث نگرانی سرمایه گذاران می شود، مانند نوسانات و عدم تمرکز دنیای رمزنگاری، محبوبیت ارزهای دیجیتال به طور پیوسته در حال رشد است. بازار ارزهای دیجیتال به دلیل سطوح سود بالایی که در گذشته تجربه کرده است، هنوز جذابیت خود را برای بسیاری از سرمایه گذاران حفظ کرده است. با ورود سکه های جایگزین متعدد به بازار، مدیریت پورتفولیو بسیار چالش برانگیزتر می شود. در ادبیات، با مطالعات متعددی مواجه میشویم که تکنیکهای مدیریت پورتفولیو کارآمد را برای ارزهای دیجیتال پیشنهاد میکنند. این مطالعه مدلهای پیشنهادی را ارائه میکند که بر اساس تکرار خط مشی و الگوریتمهای یادگیری Q توسعه یافتهاند. تحت آموزش Q، سه مدل فرعی متمایز معرفی میشوند: شبکه Q عمیق (DQN)، شبکه دو عمقی Q (DDQN) و شبکه دو دوئل Q Double (DDDQN). تمامی این مدل ها با استفاده از دوره های آموزشی 6 ماهه آموزش داده شده و با استفاده از 10 دوره آموزشی و آزمون مختلف مقایسه می شوند. علاوه بر این، برای ارزیابی هر دو مدل تکرار سیاست پیشنهادی و مدلهای یادگیری Q، مدلهای پایه برای هر الگوریتم ایجاد شد و عملکرد مدلهای پیشنهادی در برابر این مدلهای پایه ارزیابی شد. نتایج نشان میدهد که در بین مدلهای تکرار سیاست، مدل پیشنهادی دارای بالاترین میانگین ROI معادل 3 درصد است که آن را به مدل با عملکرد برتر تبدیل میکند. به طور مشابه، در بین مدلهای یادگیری Q، مدل DQN پیشنهادی از هر دو مدل پایه و سایر مدلهای یادگیری Q با میانگین ROI 2% پیشی میگیرد. با در نظر گرفتن همه مدلها، مدل تکرار سیاست پیشنهادی به بالاترین مقدار متوسط ROI دست مییابد، در حالی که DQN پیشنهادی و مدل DDDQN پیشنهادی کمترین نوسان را از نظر انحرافات استاندارد ROI نشان میدهند. kripto para birimlerinin pop¨ulerli˘gi istikrarlı bir ¸sekilde artmaya devam et mektedir. Kripto para piyasası, ge¸cmi¸ste ya¸sadı˘gı y¨uksek kar seviyeleri sebebiyle bir¸cok yatırımcı i¸cin hala cazibesini korumaktadır. گ¨ونل¨وک اولارک بیر¸کوک آلترناتیو کریپتو پارا بیریمینین پیاسایا گیرمسییله، پورتف¨وی ی¨ونیتیمی ¸کوک داها زورلو هاله گلمکتیدیر. لیترات¨اورده، کریپتو پورتف¨ویلرینی ویریملی بیر ¸سکیلده ی¨ونتمک ای¸سین ¨onerilen بیر¸cok ¸calı¸sma bulunmaktadır. Bu ¸calı¸sma, Policy Iteration ve Q-learning algoritmalarından t¨uretilen yeni model ¨onerileri sunmaktadır. Q-learning altında Deep Q-Network (DQN)، Double Deep Q-Network (DDQN) و Double Dueling Q-Network (DDDQN) olmak ¨uzere ¨u¸c farklı alt model tanıtılmaktadır. بو مدللرین هپسی، 6 ائلیک ایغیتیم د¨ونملری کولانیلاراک ای˘گیتیلمی¸استر و 10 فارکلی ای گیتیم و تست د¨ونمی کولانیلاراک کار¸سیلا¸ستیرمالار یاپیلمی¸ستیر. Ayrıca, hem ¨onerilen politika iterasyonu hem de ¨onerilen Q-learning modellerini de˘gerlendirebilmek i¸cin iki algoritma i¸cin de basit referans modelleri olu¸sturulmu¸s ve ¨onerilen model de˘gerlendirmeleri bu referansıllari. Sonu¸clara g¨ore, ¨onerilen خط مشی Iteration modeli خط مشی Iteration modelleri arasında %3 ortalama ROI de˘geri ile en iyi modeldir. Benzer ¸sekilde, ¨onerilen Q-learning mod elleri arasında DQN modeli, hem referans modelini hem de di˘ger Q-learning mod ellerini %2 ortalama ROI de˘geri ile geride bırakmaktadır. T¨um modelleri dikkate aldı˘gımızda, ¨onerilen Politika ˙Iterasyonu modelinin en y¨uksek ortalama ROI de˘gerine sahip oldu˘gunu, ¨onerilen DQN ve DDDQN modellerinin ise ROIııns a Standard sa d¨u¸s¨uk volatiliteye sahip oldu˘gunu g¨ormekteyiz. |