Teknologi

Alibabas AI der læser din skærm opnår 92% på rigtige telefoner – og kører på din egen hardware

Susan Hill

Alibabas Qwen-UI-Agent behøver ikke særlig adgang til dine apps. Den læser skærmen, identificerer, hvad der er på den, og klikker – og håndterer opgaver lige fra beskeder til dokumentredigering udelukkende gennem visuel perception. Modelvægtene – MAI-UI-2B og MAI-UI-8B – blev lagt på Hugging Face i denne uge, hvilket sætter systemet inden for rækkevidde af enhver udvikler med et GPU.

Benchmarkene er konkrete. På MobileWorld, den standardiserede evaluering for mobile agenter, scorede Qwen-UI-Agent 82,1 % og slog dermed GPT-5.6 med 12 procentpoint og Claude Opus 4.8 med 14,6 point. Forskellen er ikke marginal – sammenlignelige vestlige systemer har i måneder ligget fast i lav-til-mellem 70’erne på samme test. På test med rigtige enheder – opgaver kørt på faktiske Android-telefoner frem for emulatorer – steg scoren til 92,2 %. På AndroidDaily, en bredere evaluering på rigtige telefoner, ramte modellen 97,5 %. Til computerbrug på skrivebordet, målt via OSWorld-Verified, opnåede den 79,5 % – foran både GPT-5.5 og Gemini 3.1 Pro.

Alibaba trænede modellen på data fra over 100 rigtige mobile enheder, der kørte 150 forskellige apps, og byggede derefter sin egen benchmark – MobileWorld-Real – med mere end 400 opgaver for at verificere ydelsen uden for laboratoriet. Omkring 40 % af skrivebordsopgaverne involverede batch-kommandolinjeoperationer kombineret med visuelle klik – et designvalg, der afspejler, hvordan rigtig computerbrug fungerer, snarere end hvordan demoer iscenesættes.

Et sikkerhedslag er indbygget i arbejdsgangen. Modellen afviser opgaver, den markerer som ulovlige eller højrisiko, og den stopper ved følsomme operationer – betalinger, sletning af data, privatlivstilladelser – og beder om udtrykkelig brugerbekræftelse, før den fortsætter. Systemet håndterer sekvenser længere end 100 trin ved hjælp af forstærkningslæring trænet på tværs af omkring 10.000 simulerede miljøer samtidigt.

Benchmark-scoringer efterlader de svære spørgsmål ubesvarede. Qwen-UI-Agent blev evalueret på strukturerede opgaver; rigtig telefonbrug er afbrydelsestung, fyldt med notifikationer og involverer apps, der opdaterer deres grænseflader uden varsel. Skærmlæsende AI rejser også et privatlivsspørgsmål, som Alibabas tekniske rapport ikke adresserer: En model, der behandler hver pixel på din skærm, har adgang til bankoplysninger, private beskeder og data, som de fleste brugere aldrig har overvejet at overdrage til et tredjepartssystem. Retningslinjer for, hvad der sker med disse data i tredjepartsimplementeringer, er fraværende.

Projektet er hostet på Tongyi-MAI/MAI-UI på GitHub; modelvægtene ligger på Hugging Face nu. Der er ikke offentliggjort nogen kommerciel API eller prissætning for implementering. Den næste test for Qwen-UI-Agent er ikke en benchmark – det er, om udviklere, der bygger på de åbne vægte, kan matche i produktion, hvad Alibaba opnåede i laboratoriet.

Tags: , , , , ,

Debat

Der er 0 kommentarer.