Lue tiivistelmäSulje
Lue tiivistelmä
- Meta esitteli uuden monivaiheisen sekvenssimallin mainosten tehokkaampaan kohdentamiseen.
- Järjestelmä erottaa raskaan taustalaskennan ja nopean reaaliaikaisen järjestämisen toisistaan.
- Uusi arkkitehtuuri toi 6 % lisäyksen Instagramin konversioihin ja 3 % kasvatuksen Facebookissa.
- Tekniikka tuo kielimalleista tutut ennustettavat skalautuvuussäännöt mainossuositteluihin.
- Laskenta tukeutuu 'LLaTTE'-tutkimuspaperissa kuvattuun tiiviiseen tokenisointiin ja kohdeohjattuun huomiomekanismiin.
Meta on esitellyt uuden tekoälyarkkitehtuurin, joka uudistaa yhtiön alustoilla tapahtuvaa mainosten kohdentamista ja järjestämistä. Uudistuksen ansiosta mainosten suosittelujärjestelmiin on saatu tuotua suuriin kielimalleihin (LLM) verrattavissa olevia ennustettavia skalautuvuussääntöjä, joissa mallin suorituskyky paranee suoraan laskentatehon kasvaessa.
Metan suosittelujärjestelmät käsittelevät päivittäin miljardeja käyttäjien toimintoja, kuten katselukertoja, klikkauksia ja ostotapahtumia. Jotta järjestelmä pystyy käymään läpi miljoonia mainosehdokkaita sekunnissa ja järjestämään niistä parhaat millisekuntien viiveellä, laskenta vaatii poikkeuksellista tehokkuutta.
Kaksivaiheinen malli erottaa taustalaskennan ja reaaliaikaisuuden
Perinteisesti mainosjärjestelmät ovat nojanneet hybridimalleihin tai manuaalisesti suunniteltuihin ominaisuuksiin, jotka muodostavat pullonkaulan mallien koon kasvattaessa kapea-alaisia sekvenssejä. Metan ratkaisu ongelmaan on kaksivaiheinen järjestelmäarkkitehtuuri, joka erottaa raskaan käyttäjämallinnuksen ja nopean reaaliaikaisen järjestämisen toisistaan:
- Taustalla toimiva käyttäjämalli (Offline User Model): Tämä ensimmäinen vaihe käsittelee asynkronisesti käyttäjän pitkää historiaa tuottamalla tuhansien tapahtumien pituisista sekvensseistä tiiviitä esityksiä (embedding). Nämä tallennetaan välimuistiin käyttäjätasolla, ja laskenta tapahtuu täysin erillään yksittäisistä mainosehdokkaista.
- Reaaliaikainen järjestämismalli (Online Ranking Model): Toinen vaihe yhdistää välimuistiin tallennetut käyttäjätiedot tuoreisiin tilanne- ja mainosehdokassignaaleihin. Tämä osio on optimoitu mahdollisimman nopeaksi, jotta se täyttää tiukat viivevaatimukset ilman, että taustalla toimivan mallin monimutkaisuuden kasvattaminen nostaa tuotantokustannuksia jyrkästi.
Tiivis tokenisointi ja kohdeohjattu huomiomekanismi
Arkkitehtuurisen vaiheistuksen lisäksi Meta julkisti kaksi muuta keskeistä teknistä ratkaisua. Ensimmäinen on tiivis tokenisointi (dense tokenization), joka yhdistää erilliset harvat ominaisuudet ja käyttäjän sarjamuotoisen käyttäytymisen yhteen sanastoon. Tämä mahdollistaa sen, että malli oppii ominaisuuksien välisiä vuorovaikutuksia suoraan datasta ilman ihmisen tekemää muotoilua.
Toinen ratkaisu on muistitehokas kohdeohjattu huomiomekanismi (target-aware multi-head attention). Sen avulla mallin eri kerrokset pystyvät vertaamaan käyttäjän historiallista toimintaa suoraan siihen tiettyyn mainokseen, jota kulloinkin pisteytetään.
Mittaustulokset osoittavat selvän hyödyn
Metan mukaan uusi sekvenssimallinnuksen alusta on keskeinen osa yhtiön generatiivista mainosten suosittelumallia (GEM). Uudistuksen ja muiden malli-innovaatioiden ansiosta toteutuneet tulokset ovat olleet merkittäviä:
- Instagramin konversiot kasvoivat 6 prosenttia.
- Facebookin konversiot kasvoivat 3 prosenttia.
- Facebookin mainosklikkaukset lisääntyivät 3,5 prosenttia.
Skalautumisen neljä avainta
Meta havaitsi, että mainosten suosittelujärjestelmissä suorituskyvyn paraneminen noudattaa tehon kasvaessa log-lineaarista suhdetta samaan tapaan kuin kielimalleissa. Tätä kehitystä ohjaa neljä tekijää:
- Tasapainoinen mallin muoto: Mallin syvyyden, leveyden ja sekvenssipituuksien on kasvettava tasapainoisesti, jotta yksittäiset osat eivät muodostu suorituskyvyn pullonkauloiksi.
- Monivaiheinen säädettävyys: Järjestelmä mahdollistaa joko reaaliaikaisen tai taustamallin joustavan kasvattamisen ilman viiveongelmia.
- Monipuoliset sekvenssit: Käyttäjän toimintahistorian monipuolisuus (kuten katseluiden, klikkausten ja ostojen sekoitus) tuottaa parempia tuloksia kuin pelkästään yhden tyyppisten toimintojen pitkät ketjut.
- Semanttiset ominaisuudet: Perusmalleista saatavat semanttiset sisällöt täydentävät perinteistä suodatusta ja auttavat erityisesti uutta sisältöä tai uusia mainostajia koskevissa
Tekoälyavusteinen sisältö: Artikkeli on tuotettu tekoälyä hyödyntäen alkuperäislähteen pohjalta.
