AREX-2 is a 27‑parameter long‑horizon agent model from the Beijing Academy of Artificial Intelligence, built on Qwen3‑8 27B, that iteratively improves solutions via propose‑measure‑reflect‑revise cycles at test time. Trained on machine‑learning and algorithmic programming tasks with verifiable feedback plus existing AREX deep‑research data, it acquires self‑improvement behavior that transfers to deep research without requiring additional search trajectories.
Read original
reddit/r/LocalLLaMA