The paper introduces Proxy-guided Update Signal Transfer (PUST), a modular post‑training paradigm that decouples policy exploration from distribution alignment in large language model refinement. By generating reusable update signals via proxy guidance, PUST enables asynchronous generation, reuse, and cross‑model transfer of optimization signals, reducing the cost of on‑policy exploration. This approach aims to improve domain‑specific capabilities while mitigating the inefficiencies of existing reward optimization and distribution matching methods.

Read original