Meta tuplasi tekoälypohjaisen mainosjärjestelmänsä koulutustehokkuuden – taustalla uudet kyvyt ja 5D-rinnakkaisuus

Meta on tuplannut Instagramin ja Facebookin mainossuosituksia pyörittävän GEM-tekoälymallinsa koulutuksen tehokkuuden samalla kun se nelinkertaisti laskentakapasiteetin.

Metan kehittämä Generative Ads Recommendation Model (GEM) on perusmalli, joka vastaa mainossuosituksista sekä Instagramissa että Facebookissa. Meta kertoo tuplanneensa mallin päästä päähän -koulutustehokkuuden (E2E MFU) 20–25 prosenttiin samalla, kun sen koulutuksessa käytettyjen laskutoimitusten kokonaismäärä (FLOPs) nelinkertaistettiin vuoden sisällä.

GEM-mallia koulutetaan useiden tuhansien uusimman sukupolven näytönohjainten (GPU) voimin. Suositusmallien kouluttaminen tässä mittakaavassa tuo mukanaan poikkeuksellisia haasteita, sillä perinteiset kielimalleille (LLM) optimoidut tekoälyinfrastruktuurit eivät sovellu sellaisenaan suositusjärjestelmille.

Miksi suositusmallin kouluttaminen on vaikeaa?

GEM yhdistää hybridiarkkitehtuurissaan miljardeja tiheitä parametreja ja biljoonia harvoja embedding-parametreja. Mallia koulutetaan mainossisällöillä ja käyttäjien aktiivisuustiedoilla. Koulutuksessa kohtaavat kaksi merkittävää teknistä haastetta:

  • Heikko yksittäisen näytönohjaimen käyttöaste: Käyttäjien aktiivisuus- ja historiasuoritukset ovat epätasaisia (engl. jagged inputs). Jos kaikki syötteet täytettäisiin maksimipituuteen, jopa 50 prosenttia laskentatehosta menisi hukkaan. Lisäksi muistikaistan rajoitteet ja laskennan epäsymmetrisyys heikentävät laitteiston hyödyntämistä.
  • Skaalautuvuus tuhansille näytönohjaimille: Pelkkä näytönohjainten lisääminen ei takaa suoraa suorituskyvyn kasvua. Erittäin suuret parametrimäärät aiheuttavat raskasta tiedonsiirtoa ja muistin ylikuormittumista, mikä pakottaa uudelleenlaskentaan ja heikentää kuormantasausta eri laskentasolmukoiden välillä.

Räätälöidyt koodikirjastot ja ultra-matala tarkkuus

Laskentatehon optimoimiseksi Meta kehitti suositusjärjestelmille räätälöidyn koodikirjaston (kernel library). Kirjastoon kuuluvat muun muassa:

  • Jagged Flash Attention (JFA): Poistaa epätasaisten syötteiden täyttöpaineen ja säästää hukkakapasiteettia. JFA v4 parantaa suorituskykyä 40–140 prosenttia aiempiin versioihin verrattuna.
  • Generalized Dot-Product Attention (GDPA): Yhdistää ja nopeuttaa eri huomiomekanismeja (attention). Se saavuttaa parhaimmillaan jopa 3,5-kertaisen nopeutusvoiton standardiin Flash Attention 4 -toteutukseen verrattuna lyhyillä koodipätkillä.
  • BlockAttention: Pienentää pitkien käyttäjähistorioiden huomiomekanismin laskentakustannusta neliöllisestä O(L²) lineaariseksi O(L).

Lisäksi Meta otti käyttöön sekoitetun ultra-matalan tarkkuuden koulutuksen (mukaan lukien MXFP8-tarkkuuden huomiomekanismeissa ja MLP-kerroksissa). Siirtymä matalampaan FP8-tarkkuuteen tuplaa teoreettisen suorituskyvyn standardiin FP16-tarkkuuteen verrattuna. Laskennan tarkkuuden heikkeneminen ja kvantisointivirheet estettiin menetelmillä kuten Random Hadamard -muunnoksilla ja satunnaistetulla pyöristyksellä (stochastic rounding).

Skaalautuvuus verkko-arkkitehtuurin ja 5D-rinnakkaisuuden avulla

Jotta mallin koulutus skaalautuisi tehokkaasti tuhansien näytönohjaimien yli, Meta hyödyntää topologia-tietoista 5D-rinnakkaisuutta. Siinä tiheät parametrit jaetaan yhdistämällä 2D FSDP -rakennetta ja asiantuntijarinnakkaisuutta (Expert Parallelism), kun taas harvat parametrit jaetaan täysin ositetulla 2D-mallirinnakkaisuudella.

Tiedonsiirron viiveitä pienennetään sovittamalla tiedonsiirtovolyymi Metan kolmiportaiseen verkkotopologiaan (isännän sisäinen NVLink, tekoälyalueen sisäinen RoCE ja alueiden välinen verkko). SM-vapaat (Streaming Multiprocessor) kollektiivit mahdollistavat tiedonsiirron ja laskennan rinnakkaiselon siten, ettei tiedonsiirto vie arvokkaita laskentaresursseja.

Näiden teknisten ratkaisujen yhdistelmä on mahdollistanut sen, että Metan mainosjärjestelmän perusmalli saavuttaa huomattavasti suuremman koulutusnopeuden ja hyödyntää nykyistä datakeskusinfrastruktuuria huomattavasti aiempaa tehokkaammin.


Lähde: Engineering at Meta: GEM Training: How Meta Doubled the Efficiency of Its LLM-Scale Ads Foundation Model

Tekoälyavusteinen sisältö: Artikkeli on tuotettu tekoälyä hyödyntäen alkuperäislähteen pohjalta.