inclusionAI has released Ling-3.0-flash, a sparse MoE execution model designed for low-latency agent graph nodes such as Loop, Router, and single-step executor roles. With 124B total parameters but only 5.1B active, 256K context, and TTFT under 100ms, it prioritizes fast, reliable tool calls over deep reasoning. The model is available on OpenRouter as AntLing-3.0-flash.
Read original
reddit/r/LocalLLM