One-line meaning
Learning a policy from interaction to improve expected cumulative reward.
Nuance
A reward can proxy the real task imperfectly; simulation-trained policies require careful real-robot validation.
Related concepts
Sources
Primary source to be added. This entry is a working explanation awaiting source review.