Direct Preference Optimization [ftip-003L]

Direct Preference Optimization rewrites a KL-regularized reward objective as a policy loss on preference pairs. The derivation proceeds through an optimal-policy identity, a reward--policy reparameterization, and a Bradley--Terry comparison probability. Keeping those steps separate makes its assumptions and its difference from reward-model PPO visible.