Speculative decoding accelerates large language model inference by drafting several tokens cheaply and validating them with a single target-model pass. A rejection-sampling step ensures the resulting distribution matches plain decoding, guaranteeing lossless quality while delivering speed gains.
Read original
dev.to