Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation
The study applies reference-free post‑training to open large language models for multilingual machine translation, using Group Relative Policy Optimization with a reward that averages two reference‑free quality estimatio…
→ View original source