نهج التعلم المعزز العميق لأتمتة التداول في سوق الأوراق المالية
| العنوان | نهج التعلم المعزز العميق لأتمتة التداول في سوق الأوراق المالية |
|---|---|
| المؤلف | قباني، تايلان |
| تاريخ النشر: | 2022-06-07T12:36:52Z |
| النوع | وثيقة |
| اللغة | الإنجليزية |
| رقمي | نعم |
| مخطوط | لا |
| المكتبة: | جامعة اوزيجين |
| رقم السجل | c7cfc9db-8f65-468f-b072-9a6593005f8b |
| موقع المكتبة | قسم علوم البيانات |
| التاريخ | 2022-06-07T12:36:52Z |
| نص عينة | يمكن لخوارزميات التعلم المعزز العميق (DRL) التوسع في حل المشكلات التي كانت مستعصية في السابق. يمكن أتمتة توليد الأرباح في سوق الأوراق المالية باستخدام DRL، من خلال الجمع بين خطوة "التنبؤ" بأسعار الأصول المالية وخطوة "تخصيص" المحفظة في عملية واحدة موحدة لإنتاج نظام مستقل تمامًا قادر على التفاعل مع بيئته لاتخاذ القرارات المثلى من خلال التجربة والخطأ. في هذه الدراسة، تم اعتماد نهج مساحة العمل المستمر لمنح وكيل التداول القدرة على ضبط أوضاع المحفظة تدريجيًا مع كل خطوة زمنية (إعادة تخصيص الاستثمارات ديناميكيًا)، مما يؤدي إلى تفاعل أفضل بين الوكيل والبيئة وتقارب أسرع لعملية التعلم. بالإضافة إلى ذلك، يدعم هذا النهج إدارة محفظة تحتوي على عدة أصول بدلاً من أصول واحدة. يمثل هذا العمل نموذج DRL جديدًا لإنشاء صفقات مربحة في سوق الأوراق المالية، والتغلب بشكل فعال على قيود أساليب التعلم الخاضعة للإشراف. نحن نقوم بصياغة مشكلة التداول كنموذج لعملية اتخاذ القرار ماركوف الخاضعة للمراقبة الجزئية (POMDP)، مع الأخذ في الاعتبار القيود التي يفرضها سوق الأوراق المالية، مثل السيولة وتكاليف المعاملات. وبشكل أكثر تحديدًا، نقوم بتصميم بيئة تحاكي عملية التداول في العالم الحقيقي من خلال زيادة تمثيل الدولة بعشرة مؤشرات فنية مختلفة وتحليل المشاعر للمقالات الإخبارية لكل سهم. قمنا بعد ذلك بحل مشكلة POMDP المصاغة باستخدام خوارزمية التدرج المزدوج للسياسة الحتمية العميقة (TD3) وحققنا نسبة شارب 2.68 في مجموعة بيانات الاختبار. من وجهة نظر التنبؤ بسوق الأوراق المالية وآلية اتخاذ القرار الذكي، توضح هذه الدراسة تفوق التعلم المعزز العميق في الأسواق المالية على الأنواع الأخرى من التعلم الآلي مثل التعلم الخاضع للإشراف وتثبت مصداقية ومزايا اتخاذ القرار الاستراتيجي باستخدام DRL. من خلال إجراء عملية جراحية عاجلة، وتأمين مالي فيات "Tahmin" وportföyün "Tahsis" adımını tek birleşik süreçte birleştirek، deneme yanılma yoluyla الأمثل kararlar almak için çevresiyle يمكن استخدام نظام التحكم الكامل في حماية DRL من خلال نظام DRL. Bu çalışmada, alım-satım aracısına portföyün pozisyonlarını Her zaman adımı için kademeli olarak ayarlama (yatırımları dinamik olarak yeniden tahsis etme) ozelliği vermek için sürekli bir eylem alanı yaklaşımı benimsenmiştir, bu da daha iyi aracı-ortam etkileşimi ve öğrenme sürecinin daha hızlı yakınsaması ile sonuçlanmıştır. يمكن أن يكون هذا أمرًا سهلاً للغاية، حيث يمكنك شراء محفظة مشترياتك من خلال بطاقة الائتمان الخاصة بك. في هذا الصدد، يتم إنشاء العديد من نماذج DRL لنماذج DRL الأكثر مبيعًا، والتي من شأنها أن تساعد في تحقيق أهدافك. يمكن أن تساعدك المشكلات والمشاكل القانونية والمشاكل التي تواجهها في الحصول على نموذج تحرير لعملية اتخاذ القرار ماركوف الخاضعة للمراقبة الجزئية (POMDP). على وجه الخصوص، تم استخدام هذه التقنية على نطاق واسع وتمكنوا من تحليل صلابة المواد الصلبة من خلال محاكاة آمنة لمحاكاة عملياتهم. تم حل مشكلة POMDP هذه بشكل صحيح من خلال خوارزمية Twin Delayed Deep Deterministic Policy Gradient (TD3) التي تم اختبارها واختبارها في 2.68 Sharpe أو آخر. Hisse senedi piyasası tahmini ve akıllı karar verme mekanizması açısından bu makale, finansal piyasalarda derin pekiştirmeli öğrenmenin denetimli öğrenme gibi diğer makin öğrenimi türlerine göre üstünlüğünü göstermekte, يمكنك الآن استخدام DRL yaklaşımının güvenilirliğini ve Strategy karar vermenin avantajlarını kanıtlamaktadır. |