Yazar
Anahtarcı, Berkay, Karıksız, Can Deha, Saldı, N.
Basım Tarihi
2023-03
Basım Yeri
-
Springer
Konu
İndirimli ödül, Ortalama alan oyunları, Q-öğrenme, Düzenlileştirilmiş Markov karar süreçleri
Tür
Süreli Yayın
Dil
İngilizce
Dijital
Evet
Yazma
Hayır
Kütüphane
Özyeğin Üniversitesi
Demirbaş Numarası
2153-0785
Kayıt Numarası
60eb43e0-5e18-444f-9a58-62e50c99b500
Lokasyon
Doğa ve Matematik Bilimleri
Tarih
2023-03
Notlar
Bilim Akademisi BAGEP Ödülü
Örnek Metin
Bu makalede, düzenlileştirilmiş bir ortalama alan oyunu tanıtıyoruz ve bu oyunun sonsuz ufuk indirimli ödül fonksiyonu altında öğrenilmesini inceliyoruz. Düzenlileştirme, klasik ortalama alan oyun modelindeki tek aşamalı ödül fonksiyonuna güçlü bir içbükey düzenleme fonksiyonu eklenerek tanıtılmaktadır. Uygun Q-öğrenmeyi kullanarak bu düzenli ortalama alan oyununa değer yinelemeye dayalı bir öğrenme algoritması kuruyoruz. Düzenleme terimi genel olarak takviyeli öğrenme algoritmasını sistem bileşenlerine karşı daha sağlam hale getirir. Ayrıca, bir düzenleme teriminin yokluğunda ihtiyaç duyulan sistem bileşenlerine kısıtlayıcı dışbükeylik varsayımları uygulamadan öğrenme algoritmasının hata analizini oluşturmamıza olanak tanır.
DOI
10.1007/s13235-022-00450-2
Cilt
13