Reward-Weighted Regression with Sample Reuse for Direct Policy Search in 
Reinforcement Learning

Hachiya, H.; Peters, J.; Sugiyama, M.

doi:10.1162/NECO_a_00199

Lokale TagsFreigabegeschichteDetailsÜbersicht

Reward-Weighted Regression with Sample Reuse for Direct Policy Search in Reinforcement Learning

Hachiya, H., Peters, J., & Sugiyama, M. (2011). Reward-Weighted Regression with Sample Reuse for Direct Policy Search in Reinforcement Learning. Neural Computation, 23(11), 2798-2832. doi:10.1162/NECO_a_00199.

Item is Freigegeben

einblenden: alle ausblenden: alle

Basisdaten

einblenden: ausblenden:

Datensatz-Permalink: https://hdl.handle.net/11858/00-001M-0000-0010-4C08-6 Versions-Permalink: https://hdl.handle.net/11858/00-001M-0000-0028-7F98-3

Genre: Zeitschriftenartikel

ausblenden:

Urheber:
Hachiya, H.¹, Autor
Peters, J.², Autor
Sugiyama, M., Autor

Affiliations:
1Max Planck Society, ou_persistent13
2Dept. Empirical Inference, Max Planck Institute for Intelligent Systems, Max Planck Society, ou_1497647

Inhalt

einblenden:

ausblenden:

Schlagwörter: MPI für Intelligente Systeme; Abt. Schölkopf;

Zusammenfassung: Direct policy search is a promising reinforcement learning framework, in particular for controlling continuous, high-dimensional systems. Policy search often requires a large number of samples for obtaining a stable policy update estimator, and this is prohibitive when the sampling cost is expensive. In this letter, we extend an expectation-maximization-based policy search method so that previously collected samples can be efficiently reused. The usefulness of the proposed method, reward-weighted regression with sample reuse (R), is demonstrated through robot learning experiments.

Details

einblenden:

ausblenden:

Sprache(n):

Datum: Erschienen: 2011-11-01

Publikationsstatus: Erschienen

Seiten: -

Ort, Verlag, Ausgabe: -

Inhaltsverzeichnis: -

Art der Begutachtung: -

Identifikatoren: eDoc: 596124
Anderer: HachiyaPS2011
DOI: 10.1162/NECO_a_00199

Art des Abschluß: -

Veranstaltung

einblenden:

Entscheidung

einblenden:

Projektinformation

einblenden:

Quelle 1

einblenden:

ausblenden:

Titel: Neural Computation

Genre der Quelle: Zeitschrift

Urheber:

Affiliations:

Ort, Verlag, Ausgabe: -

Seiten: 34 Band / Heft: 23 (11) Artikelnummer: - Start- / Endseite: 2798 - 2832 Identifikator: -

Datensatz

Basisdaten

Dateien

Externe Referenzen

Urheber

Inhalt

Details

Veranstaltung

Entscheidung

Projektinformation

Quelle 1