Qwen 3.8 27B demonstrates strong performance, outperforming larger models despite some overthinking tendencies, aided by innovations such as PLE/n-gram tables pulled from SSD. The architecture is effective now and shows scalability from small to large model sizes.
Read original
reddit/r/LocalLLM