TTPO: Test-Time Policy Optimization

TTPO: Test-Time Policy Optimization

Aozhe Wang, Zhengxi Lu, Jianze Wang, Shangke Lv, Ying Liu 2026-08-26

TTPO introduces Test-Time Policy Optimization to enable test-time training for large language models in mathematical reasoning. It addresses the fragility of using majority-vote pseudo-labels, which can corrupt model tra…

→ View original source
Loading more articles...