Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization
Policy optimization for LLMs faces a stability-exploration trade-off mediated by Policy-KL regularization, which constrains response behavior and consumes the exploration budget when enforced, yet leaves optimization wit…
→ View original source