The ggml-cpu pull request adds a tiled mul_mat kernel for k‑quant models that uses VNNI instructions to speed up CPU prompt processing by 3‑7× while keeping implementation complexity low.

Read original