Maaliskuussa esitelty Android Bench -vertailualusta on saanut merkittävän päivityksen. Google ilmoitti siirtyneensä käyttämään uudistettua Harbor-viitekehystä, jonka tarkoituksena on tarjota aiempaa täsmällisempää tietoa siitä, miten suuret kielimallit (LLM) suoriutuvat todellisista Android-kehitystehtävistä.
Alun perin yleiskäyttöiseen mini-swe-agent v1 -työkaluun pohjautunut mittausjärjestelmä on nyt korvattu uudella standardilla. Standardoinnin ansiosta kehittäjät voivat ajaa testejä helpommin itse, arvioida omia kokoonpanojaan ja jakaa tuloksia avoimesti.
Uusi viitekehys muutti pisterajoja
Mittausmetodologian päivittämisen myötä kaikkien mallien suorituskyky arvioitiin uudelleen uuden pohjatason luomiseksi. Tämän seurauksena pisteytyksissä on tapahtunut pieniä muutoksia aiempaan verrattuna. Vanhat tulokset säilyvät kuitenkin edelleen tarkasteltavissa alustan arkistossa.
Uudistetulla alustalla testataan, miten kielimallit selviytyvät konkreettisista Android-kehityksen haasteista, kuten Jetpack Compose -migraatioista, pukettavien laitteiden verkkoyhteyksistä sekä alustan rajapintapäivityksistä.
Tekoälymallien kärjestä löytyy uusia nimiä
Mittaustavan uudistamisen lisäksi tuloslistalle on lisätty kahdeksan uutta kielimallia: Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus ja Qwen 3.7 Max.
Kokonaiskilpailun kärkeen kiilasi Claude Fable 5 tuloksella 84,5. Toisena listalla on GPT 5.5 (80,2 pistettä) ja kolmantena Claude Sonnet 5 (76,2 pistettä).
Avoimen painotuksen mallien (open-weight) luokassa kärkisijaa pitää hallussaan GLM 5.2 tuloksella 72,2. Toisena avointen mallien vertailussa on Kimi K2.7 Code 70,4 pisteellä.
Yhteisölle mahdollisuus vaikuttaa testeihin
Google avaa Android Benchein kehitystä aiempaa enemmän myös kehittäjäyhteisölle. Android-kehittäjät voivat jatkossa osallistua toimintaan kahdella eri tavalla:
- Suunnittelemalla ja lähettämällä omia Android-kehitystehtäviä arvioitavaksi, jotta testit vastaavat paremmin käytännön tarpeita.
- Ajamalla testejä itse ja jakamalla arviointeja omien tai valmiiden tehtäväsettien pohjalta.
Submitted tasks will be reviewed for potential inclusion in future benchmark updates to ensure the suite directly reflects developer workflows globally.
Lähdekoodit ja tehtävät ovat saatavilla GitHubissa, ja tuloksia sekä testimetodologiaa voi seurata suoraan viralliselta tulossivustolta.
Lähde: Android Developers Blog: Evolving how LLMs are measured for Android: the next era of Android Bench
Tekoälyavusteinen sisältö: Artikkeli on tuotettu tekoälyä hyödyntäen alkuperäislähteen pohjalta.
