Teknik

Alibabas AI som läser din skärm når 92% på riktiga telefoner – och körs på din egna hårdvara

Susan Hill

Alibabas Qwen-UI-Agent kräver ingen särskild åtkomst till dina appar. Systemet läser av skärmen, identifierar vad som visas och klickar – och hanterar allt från meddelanden till dokumentredigering enbart genom visuell avläsning. Modellvikterna – MAI-UI-2B och MAI-UI-8B – publicerades på Hugging Face i veckan och gör systemet tillgängligt för alla utvecklare med ett grafikkort.

Riktmärkena är konkreta. På MobileWorld, standardutvärderingen för mobilagenter, nådde Qwen-UI-Agent 82,1 procent och slog därmed GPT-5.6 med 12 procentenheter och Claude Opus 4.8 med 14,6 procentenheter. Gapet är inte marginellt – jämförbara västerländska system har stannat på mellan 70 och 75 procent i samma test i månader. Vid tester på riktiga enheter – uppgifter som körs på verkliga Android-mobiler i stället för emulatorer – steg resultatet till 92,2 procent. På AndroidDaily, en bredare utvärdering på äkta telefoner, nådde modellen 97,5 procent. För stationära datorer, mätt med OSWorld-Verified, landade den på 79,5 procent, före både GPT-5.5 och Gemini 3.1 Pro.

Alibaba tränade modellen på data från över 100 verkliga mobila enheter som körde 150 olika applikationer och byggde därefter sitt eget riktmärke – MobileWorld-Real – med fler än 400 uppgifter för att verifiera prestandan utanför laboratoriet. Ungefär 40 procent av skrivbordsuppgifterna innefattade batch-kommandon i terminalen vid sidan av visuella klick – ett designval som speglar hur verkligt datorarbete fungerar snarare än hur demonstrationer iscensätts.

Ett säkerhetslager är inbyggt i arbetsflödet. Modellen avvisar uppgifter som den flaggar som olagliga eller högriskfyllda, och den stoppar vid känsliga operationer – betalningar, borttagning av data, integritetsgodkännanden – och begär explicit bekräftelse från användaren innan den fortsätter. Systemet hanterar sekvenser längre än 100 steg med hjälp av förstärkningsinlärning tränad över cirka 10 000 samtidiga simulerade miljöer.

Riktmärkena lämnar de svårare frågorna öppna. Qwen-UI-Agent utvärderades på strukturerade uppgifter; verklig telefonanvändning är avbrottstung, proppfull med notiser och innehåller appar som uppdaterar sina gränssnitt utan förvarning. Skärmläsande AI väcker också en integritetsfråga som Alibabas tekniska rapport inte adresserar: en modell som processar varje pixel på din skärm får tillgång till bankuppgifter, privata meddelanden och data som de flesta användare aldrig övervägt att lämna till ett tredjepartssystem. Riktlinjer för vad som händer med den datan vid implementeringar från tredje part saknas.

Projektet finns på Tongyi-MAI/MAI-UI på GitHub; modellvikterna ligger på Hugging Face nu. Ingen kommersiell API-tjänst eller prissättning för driftsättning har tillkännagetts. Nästa test för Qwen-UI-Agent är inte ett riktmärke – det är huruvida utvecklare som bygger vidare på de öppna vikterna kan matcha i produktion vad Alibaba uppnådde i laboratoriet.

Taggar: , , , , ,

Diskussion

Det finns 0 kommentarer.