NeurIPS Training Reinforcement Learning Agents and Humans with Difficulty-Conditioned Generators

Poster
in
Workshop: Agent Learning in Open-Endedness Workshop

Training Reinforcement Learning Agents and Humans with Difficulty-Conditioned Generators

Sidney Tio · Pradeep Varakantham

Keywords: [ UED ] [ item response theory ]

[ Abstract ] [ Project Page ]

[ OpenReview]

Abstract:

We introduce Parameterized Environment Response Model (PERM), a method for training both Reinforcement Learning (RL) Agents and human learners in parameterized environments by directly modeling difficulty and ability. Inspired by Item Response Theory (IRT), PERM aligns environment difficulty with individual ability, creating a Zone of Proximal Development-based curriculum. Remarkably, PERM operates without real-time RL updates and allows for offline training, ensuring its adaptability across diverse students. We present a two-stage training process that capitalizes on PERM's adaptability, and demonstrate its effectiveness in training RL agents and humans in an empirical study.

Chat is not available.

Poster in Workshop: Agent Learning in Open-Endedness Workshop

Training Reinforcement Learning Agents and Humans with Difficulty-Conditioned Generators

Sidney Tio · Pradeep Varakantham

Poster
in
Workshop: Agent Learning in Open-Endedness Workshop