A custom inference engine achieved 218 tokens per second running
reddit/r/LocalLLM
A custom inference engine achieved 218 tokens per second running