Models, reasoning & training · Concept
DPO
Also called: direct preference optimization
Direct Preference Optimization: train on preference pairs without a conventional separate online RL optimization stage.
Related terms
Primary references
Reference definition