Models, reasoning & training · Concept

DPO

Also called: direct preference optimization

Direct Preference Optimization: train on preference pairs without a conventional separate online RL optimization stage.

Related terms

Pretraining · Post-training · Base model

Primary references

Reference definition