Models, reasoning & training · Concept

PPO

Also called: proximal policy optimization

Proximal Policy Optimization: a policy-gradient reinforcement-learning method using constrained updates.

Related terms

Pretraining · Post-training · Base model

Primary references

Reference definition