Tehnologie. Digital. Inovație.
Tehnologie

Decodificarea speculativă accelerează vLLM pe GPU-urile AMD

AMD GPU users can now leverage speculative decoding in vLLM to accelerate large language model inference, with the feature officially supported starting…

Decodificarea speculativă accelerează vLLM pe GPU-urile AMD

Cum accelerează decodarea speculativă inferența pe GPU-urile AMD?

Utilizatorii de GPU-uri AMD pot acum folosi decodificarea speculativă în vLLM pentru a accelera inferența modelelor mari de limbaj, cu suport oficial disponibil începând cu august 2026. Această inovație permite unui model draft să genereze tokeni candidați în paralel, care sunt apoi verificați de modelul principal, reducând latența fără a afecta calitatea ieșirii.

Integrarea visează îmbunătățirea treptatului pentru sarcini de servire pe GPU-urile AMD Instinct și Radeon.

Mecanismul de bază se bazează pe un model draft ușor care propune simultan mai mulți tokeni viitori, pe care modelul țintă îi evaluează într-o singură trecere. Tokenii acceptați sunt păstrați; cei respinsi declanșează un returnare și un nou esantionare din distribuția corectă.

Metodele de draft includ arbori în stil Medusa, MTP (Medusa Token Prediction), EAGLE-3 și variante specializate precum FlashDraft și Spark, fiecare echilibrando viteza și acuratețea diferit.

MTPGemma 4 MTP este evidențiat ca o opțiune particulă eficientă pentru hardware-ul AMD datorită operațiilor tensorilor optimize.

Abordajele diferite de draft afectează atât rata de acceptare, cât și supraincarcarea computațională. Arbori în stil Medusa generează tokeni candidați printr-o rețea auxiliară mică, în timp ce MTP extinde aceasta prin predicția tokenilor la poziții viitoare multiple.

EAGLE-3 introduce eșantionare conștientă de entropie pentru a prioriza predicțiile cu încredere ridicată, reducând calculul pierdut.

FlashDraft se concentrează pe minimizarea utilizării bandei de memorie, esențială pentru GPU-urile AMD cu VRAM limitat, în timp ce Spark accentuează generarea de propuneri cu latență scăzută pentru aplicații în timp real.

Cum accelerează decodificarea speculativă inferența pe GPU-urile AMD?

Ratele de acceptare variă de obicei între 30% și 60% în funcție de metodă și dimensiunea modelului, afectând direct accelerarea eficientă.

Pentru a activa decodificarea speculativă în vLLM pe GPU-urile AMD, utilizatorii trebuie să instaleze cea mai recentă versiune de vLLM cu suport ROCm 6.2+ și să încarce modele draft compatibile de pe Hugging Face sau din zoo-ul de modele al vLLM. Modelul țintă rulează în FP16 sau BF16, în timp ce modelele draft folosesc adesea cuantizare INT8 pentru a se potrivi în constrângerile de memorie. Se recomandă un minim de 24 GB VRAM pentru modele de clasă 7B, iar modelele mai mari precum Llama 3 70B necesită configurări multi-GPU.

Considerațiile de memorie includ alocarea spațului pentru cache-urile modelului draft, tampoanele KV și arborii temporari de tokeni, pe care vLLM le gestionează automat prin programare dinamică.

Măsurătorile de performanță arată o accelerare de până la 2,1x în latența generării de tokeni pentru Llama 3 8B pe un AMD Instinct MI300X, cu EAGLE-3 oferind cel mai bun echilibru între calitate și accelerare.

Sporurile de treptat sunt cele mai evidente pentru dimensiuni de lot de 4 la 8, tipice pentru scenarii de chatbot și servicii API. Funcționalitatea se activează prin flag-ul `—speculative-draft-model` în argumentele motorului vLLM, cu opțiuni de tunare precum `—num-speculative-tokens` și `—speculative-acceptance-threshold`.

Funcționează decodificarea speculativă cu toate modelele de limbaj în vLLM? Funcționează cu majoritatea modelelor doar-decodere precum Llama, Mistral și familiei Gemma, pentru că este disponibil un model draft compatibil pentru arhitectura țintă.

Există un risc de reducere a calității ieșirii la utilizarea decodificării speculativă? Nu, deoarece tokenii respinsi sunt eliminate și modelul țintă resamplează din distribuția condițională corectă, păstrând corectitudinea statistică.

Se poate combina decodificarea speculativă cu alte optimizări din vLLM precum cuantizarea sau paralelismul tensor? Da, se stivează cu cuantizarea FP8, paralelismul tensor și prefill-ul în bucăți, permițând îmbunătățiri cumulative a performanței în setările de implementare.

More stories:

Content written by Elena Popescu for stiri-blockchain.ro editorial team, AI-assisted.

Share:

Leave a comment