Skip to yearly menu bar Skip to main content


Poster Wed, Dec 9, 2026 • 5:00 PM – 8:00 PM AEDT Hall 1-4

The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning

Jing Liang ⋅ Hongyao Tang ⋅ Yi Ma ⋅ Yancheng He ⋅ Weixun Wang ⋅ Xiaoyang Li ⋅ Wenbo Su ⋅ Jinyi Liu ⋅ YAN ZHENG ⋅ Jianye Hao ⋅ Bo Zheng

Abstract

Chat is not available.