Finite KL-regularized alignment [ftip-008F]

This subsection studies an exact, finite optimization model. A reference law is exponentially tilted by a declared scalar reward. In this setting, reward gain admits two exact descriptions: a Jeffreys-divergence identity and a covariance under the reference law.

The statements do not model approximate optimization, neural training cost, reward validity, or independent capability evaluation.