رویکرد یادگیری تقویتی بازیگر- منتقد برای مذاکره دوجانبه
| عنوان | رویکرد یادگیری تقویتی بازیگر- منتقد برای مذاکره دوجانبه |
|---|---|
| نویسنده | ارسلان، فورکان |
| تاریخ انتشار: | 2022-06-06T04:18:43Z |
| موضوع | یادگیری عمیق، یادگیری عمیق، فرآیند پیشنهاد تجمعی، فرآیند پیشنهاد تجمعی، یادگیری ماشینی، یادگیری ماشینی، شبکه های عصبی مصنوعی، شبکه های عصبی مصنوعی، سیستم های چند عاملی، سیستم های چند عاملی، چانه زنی چند جانبه، چانه زنی چند جانبه |
| نوع | سند |
| زبان | انگلیسی |
| دیجیتال | بله |
| نسخه خطی | خیر |
| کتابخانه: | دانشگاه اوزیغین |
| شماره ثبت | a3b650ef-e739-4d63-8601-872b70e1a0bf |
| محل کتابخانه | گروه علوم کامپیوتر |
| تاریخ | 2022-06-06T04:18:43Z |
| متن نمونه | طراحی یک استراتژی مناقصه موثر و هوشمند یکی از قانعکنندهترین چالشهای تحقیقاتی در مذاکره خودکار است، جایی که عوامل نرمافزاری با یکدیگر مذاکره میکنند تا در صورت تضاد منافع، توافقی متقابل پیدا کنند. این پایان نامه به جای طراحی یک ماژول تصمیم گیری دست ساز، یک استراتژی پیشنهادی جدید را با اتخاذ رویکرد یادگیری تقویتی بازیگر- منتقد پیشنهاد می کند، که یاد می گیرد در یک مذاکره دوجانبه چه چیزی را ارائه دهد. یک چارچوب یادگیری تقویتکننده آنتروپی به نام \acrfull{sac} برای مشکل مناقصه اعمال میشود، و یک رویکرد خودبازی برای آموزش مدلی استفاده میشود که سودمندی هدف پیشنهاد آینده را بر اساس مبادلات پیشنهادی قبلی و زمان باقیمانده تعیین میکند. علاوه بر این، یک رویکرد یادگیری تقلیدی به نام شبیهسازی رفتار برای سرعت بخشیدن به فرآیند یادگیری اتخاذ شده است. همچنین، یک تابع پاداش جدید معرفی شده است که نه تنها مطلوبیت خود نماینده، بلکه سودمندی حریف را در پایان مذاکره نیز در نظر می گیرد. عامل توسعه یافته به صورت تجربی ارزیابی می شود. بنابراین، تعداد زیادی از جلسات مذاکره علیه مخالفان مختلفی که در حوزههای مختلف انتخاب شدهاند، با اندازه و مخالف برگزار میشوند. عملکرد نماینده با مخالفان خود و عملکرد نمایندگان خط پایه در مذاکره با مخالفان مشابه مقایسه می شود. نتایج تجربی نشان میدهد که نماینده ما با موفقیت در برابر مخالفان چالشبرانگیز در سناریوهای مختلف مذاکره بدون نیاز به اطلاعات قبلی درباره حریف یا دامنه از قبل، مذاکره میکند. علاوه بر این، نتایج بهتری نسبت به عوامل پایه در رابطه با ابزار دریافتی در پایان مذاکرات موفق به دست میآورد.، tasarlamak otomatik müzakeredeki en zorlayıcı araştırma zorluklarından biridir. بو تز د، ایله حزیرلانمیش بیر کارار ورمه مدولو تاسارلامک یرین، ایکلی بیر موزاکرئده هانگی تکلیفی سونولاکاغینی اغرنن بیر اکتور-الشتیرمن تکویلی اغرنمه یاکلاسیمینی بنیمسیین ینی بیر تکلیف استراتی. Teklif verme yaklaşımı için نرم بازیگر- منتقد (SAC) adı verilen bir entropi pekiştirmeli öğrenme yaklaşımı kullanılmıştır. اونجکی تکلیف دغیشیملرینه و کالان سوره دایالی اولاراک گِلِجِک تکلیفین هدف دغرینی بیلیرلین SAC مدلی اغیتمک ایچین بیر کندی کندی اویناما یاکلاسیمی کولانیلیر. آیریجا، اوغرنمه سورجینی هیزلندیرمک ایچین داورانیش کلونلاما آدی وریلن بیر تاکلیت اوغرنمه یاکلاشیمی بنیمسنمیشتر. بونلارا ایک اولارک، موزاکرنین سونوندا یالنیزجا تمسیلچینین آلدیغی تکلیف دگیرینی دگیل، عینی زامنده راکیبین تکلیف دغرینیده کولانان یئنی بیر اؤدول ایسلوی تانیتیلدی. Bu tez kapsamında geliştirilen SAC ajanı ampirik olarak değerlendirildi. بو آماچلا، بویوکلوک و زورلوک باکیمیندان فارکلی آلانلاردا سئچیلن چشیتلی موهالیفلره کارشی چوک سائیدا پازارلیک اوتوروملاری یوروتولدو. آجانین پرفورانسی راکیپلرییله و اینی راکیپلرله پازارلیک ایدن تمل آجانلارین اجرانسییلا کارشیلاشتیریلدی. آمپیریک سونوچلار، تمسیلسیمیزین، راکیپ ویا آلان هاکیندا اونسدن هرهنگی بیر بیلگی بایدتیرمدن farklı pazarlık senaryolarında zorlu rakiplere karşı başarılı bir şekilde pazarlık ettiğini göstermektedir. آیریجا، خوباریلی پازارلیک سونوندا آلینان تکلیف دغری گؤز اووننده بولوندورولدوغوندا تمل آراسیلاردان داها ایی سونوچلار الده اتمکتیدیر. |