Reference. Demystifying Reinforcement Learning Post-Training of Language Models [clay2026demystifying]

@article{clay2026demystifying,
  title = {Demystifying Reinforcement Learning Post-Training of Language Models},
  author = {Clay, Donovan and Gollapudi, Saket and Harilal, Sankar and Jang, Min and Morrison, Jacob and Oh, Sewoong and Jaques, Natasha},
  year = {2026},
  url = {https://arxiv.org/abs/2608.24949v1},
  journal = {arXiv preprint arXiv:2608.24949}
}