Stivirea 3D a memoriei va revoluționa inferența AI?
La conferința Hot Chips 2026 de această săptămână, d-Matrix a prezentat Raptor, noul său accelerator de AI conceput special pentru sarcini de inferență generativă.
Culture picks
Meta se compromite cu 18 miliarde de dolari pentru siguranța tânilor
Candidatii au semnat un pact pentru regularea centrelor de date și siguranța AI
Xbox lansează pachet special de aniversare cu consolă verde translucidă
Apple are nevoie de un Mac de intrare: golul lăsat de scumpirea Mac miniCompania afirmă că Raptor este primul accelerator de AI cu memorie DRAM stivuită în 3D de acest tip, integrând direct un die de calcul personalizat pe procesul TSMC de 4nm cu straturi de memorie de bandă largă.
În prezentare, au evidențiat capacitatea de a oferi 100 de terabiti pe secundă de bandă de memorie pe placă — o valoare gândită pentru a face față cerințelor în creștere ale modelelor de limbaj mari în mediile de producție.
Arhitectura Raptor se bazează pe o abordare nouă de stivire 3D, unde die-ul de logică este lipit față cu față cu straturile personalizate de DRAM, ceea ce reduce distanța parcursă de date și scade latența. Această concepire permite d-Matrix să evite gârlele de memorie tradiționale care au limitat performanța inferenței la generațiile anterioare de hardware pentru AI.
Ce obstacole rămân pentru adoptarea largă a Raptor?
Prin co-proiectarea stratelor de calcul și memorie, companie spune că poate obține o eficiență și un debit mai mari fără a depinde de module externe HBM sau GDDR.
Procesul TSMC de 4nm care susține die-ul de calcul permite o înglobare densă a tranzistorilor și o eficiență energetică îmbunătățită pentru sarcini de AI continue.
Tehnica de stivire 3D utilizată la Raptor reduce distanța fizică între unitățile de procesare și celulele de memorie, ceea ce duce direct la accesul mai rapid la date și la un consum de energie mai mic pe operație. Inginerii d-Matrix au explicat că această apropiere permite acceleratorului să mențină rate ridicate de utilizare în timpul generării de tokeni — o fază critică în AI generativă, unde bandă de memoire devesește adesea factorul limitant.
Compania a subliniat că Raptor nu se referă doar la viteză brută, ci și la performanță prevedibilă în condiții de loturi și lungimi de secvențe variabile, situații frecvente în implementările reale.
Deși specificațiile sunt promitoare, d-Matrix a recunoscut că compatibilitatea software-ului și pregătirea ecosistemului rămân obstacole pentru penetrarea mai largă pe piață. Companie lucrează cu parteneri selecționați pentru a optimiza cadrele de inferență și bibliotecile de nuclee pentru arhitectura unică a Raptorului. Au menționat, de asemenea, că gestionarea termică pachetelor dense stivite necesită inginerie atentă, deși siliciul timpuriu a arătat funcționare stabilă în limitele de putere așteptate. d-Matrix planuiește să înceapă echantionarea Raptorului la furnizorii de cloud și clienții enterprise mai târziu în 2026, cu producerea în volum dependentă de validarea rendimentului de la TSMC.
De ce stivirea 3D a memoriei schimbă regulile inferenței AI?
Ce face Raptor să se deosebească de alte acceleratoare de AI de pe piață? Raptor se distinge prin proiectarea sa de memorie DRAM stivuită în 3D, unde die-ul de calcul este lipit direct de straturile personalizate de memorie, folosind procesul TSMC de 4nm, ceea ce permite 100 de terabiti pe secundă de bandă de memorie pe placă, fără a necesita module externe de memorie.
Raptor este destinat sarcini de antrenare sau de inferență?
d-Matrix a poziționat Raptorul specific pentru inferență generativă, concentrându-se pe generarea de tokeni cu latență scăzută și debit ridicat, mai degrabă decât pe antrenament, care de obicei profite de alte compensări arhitecturale.
Când va fi disponibil Raptorul pentru clienți? Echantionarea se așteaptă să înceapă mai târziu în 2026, cu disponibilitate mai largă dependentă de validarea cu succes și creșterea rendimentului la facilitățile de fabricație TSMC.
