Source-linked briefing Technology

Google’s Gemma 4 Gains Up to 3x Speed via Multi‑Token Prediction

Google’s Gemma 4 Gains Up to 3x Speed via Multi‑Token Prediction

Google introduced experimental Multi‑Token Prediction drafters for its Gemma 4 open models, using speculative decoding to anticipate future tokens. Ars Technica reports the approach can significantly speed up generation on edge hardware compared with standard decoding.

Original headline

Google's Gemma 4 AI models get 3x speed boost by predicting future tokens