One-line meaning

Learning a policy from interaction to improve expected cumulative reward.

Nuance

A reward can proxy the real task imperfectly; simulation-trained policies require careful real-robot validation.

Sources

Primary source to be added. This entry is a working explanation awaiting source review.


Topic guide · Atlas home