Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI dots: Astra 24/7 – Pro stengt i EØS, 4000 apper • AISI: Astra 29 prosent – falsk identitet, payload utenfor scope • OpenAI-agenter: 16 500 UNCTAD-skann – XSS-spill, 82 rate-limits • OpenAI: DNS-hull – pause i trening av de mest kapable • OpenAI-agenter la ut 53 brukerbilder – kan ikke varsle ofrene

Qwen Intelligence: 2,41 dollar/1 000 – 27B, vektene er stengt
QwenAlibabaCIOCISOAI-modellerAgenterMobilLeverandørstyring

Qwen Intelligence: 2,41 dollar/1 000 – 27B, vektene er stengt

JH
Joachim Høgby
22. september 202622. september 20265 min lesingKilde: Alibaba

Alibaba slipper 22. september 2026 Qwen Intelligence: tre agenter for telefonprodusenter, lansert på Yunqi-konferansen i Hangzhou. Mobile Planner Agent 27B scorer 77,05 prosent på MobilePA-Bench og 2,41 dollar per 1 000 oppgaver i ut-tokens, ifølge Alibabas egen rapport. Det slår GPT-6 Astra (76,84) og Claude Opus 5 (75,71) i samme tabell, med deployment-harness inkludert. GitHub-repoet er nettside og teknisk rapport. Vektene, treningskoden og agentkoden er ikke åpnet. Honor Magic9 28. september og Honor Robot Phone er første enheter, ifølge Alibabas nyhetsrom. Minne, proaktiv tjeneste og endeside-SDK står som under planlegging. For CIO er 2,41 dollar et forskningsanslag, ikke en listepris. For CISO er det GUI-styring av ekte telefon, betaling og tverr-app, med data mot Alibaba.

Hva Alibaba faktisk lanserer

Qwen Intelligence er en fullstack for telefonprodusenter, ikke en forbrukerapp. Offisiell lab-konto @Alibaba_Qwen. Tre produkter i første fase: Mobile Planner Agent (plan, dekomponering, orkestrering), Mobile-Use Agent (API først, GUI som reserve) og Mobile Creative Agent (bildegenerering og redigering). Steven Hoi, sjef for Qwen Mobile AI i Token Foundry og visepresident i Alibaba Token Hub, kaller agenttelefonen «porten mellom personlig AI og den fysiske verden». Dokumentasjonen er kinesisk. Kommersiell tilgang går via Alibaba Cloud og qwenintelligence.com. Pris, kvote og region står som forretningsavtale; kontakt er qwenintelligence@alibaba-inc.com.

Arkitekturen har tre lag: mobiloptimalisert Qwen-grunnmodell, modulær plattform med egen modelldrift, harness-tilpasning og verktøystyring, og ferdige agenter. Produsenten kan ta hele stakken eller enkeltmoduler. Memory & Proactive, endeside-SDK og økosystemagenter er merket under planlegging. Det er ikke en ferdig EØS-tjeneste med SLA, DPA og regionvalg i dokumentene hogby har sett.

27B-planleggeren og tallet 2,41

Qwen-Planner-Agent kobler en trent 27B-planlegger til en tilstandsfull harness for verktøy, Skills, minne og eksekveringsbevis. MAI-teamet i Alibaba Token Hub rapporterer 77,05 totalt på MobilePA-Bench, 9,83 poeng over egen 27B-baseline (67,22). Delscore: verktøy 77,79, minne 74,76, Skills 86,25, sub-agent 59,55. Kostnad: 2,41 dollar per 1 000 oppgaver. Rapporten er tydelig: beløpet dekker ut-tokens inkludert tenking. Inn-tokens, verktøy, enhetskjøring og ekstra harness-prosessering er holdt utenfor. Claude Fable 5 leder sub-agent (68,54) og minne (76,33). GPT-6 Astra leder Skills (93,25) og ligger 0,21 poeng bak totalt.

Den offentlige MobilePA-Bench-listen viser ikke Qwen-Planner-Agent 27B. Der leder Claude Opus 5 med 75,52 og 6,54 dollar per 1 000, foran Fable 5 (75,31 / 13,43) og Kimi K3 (73,01 / 4,05). Evalueringen er konfidensiell: man sender et HTTPS-endepunkt, skjjulte oppgaver og fasit forblir private, rapport innen tre virkedager, én forespørsel per konto hver sjuende dag. 1 705 oppgaver, 212 verktøy, 13 domener. Totalscore vektes 50 prosent verktøy, 20 minne, 20 Skills, 10 sub-agent. Å slå Astra på egen tabell med harness er ikke det samme som å ligge øverst på den åpne listen.

Minneharness løfter 27B på BEAM-10M fra 21,99 til 67,24 når historikken overstiger aktiv kontekst. Direkte kontekst bruker 256K og kutter eldste historikk. Det er nyttig for telefonagenter som skal huske preferanser. Det er også et personvernhull: langtidshukommelse av kalender, meldinger og posisjon hos leverandøren.

Mobile-Use: 82,1 – og 90 prosent uten oppsett

@Alibaba_Qwen oppgir Mobile-Use til MobileWorld 82,1, MobileWorld-Real 92,2, AndroidDaily 97,2 og «90 prosent ende-til-ende». Qwen-UI-Agent-rapporten viser 82,1 / 92,2 / 97,5 på de tre navngitte settene. 90-tallet mangler oppsett og skal ikke sammenlignes med de navngitte. MobileWorld: 201 oppgaver i 20 apper, snitt 27,8 steg, 62,2 prosent tverr-app. MobileWorld-Real: 409 oppgaver, 104 levende Android-apper. Dokumentasjonen sier at agenten skal pause på sensitive steg. Demoene er kinesiske tjenester: 12306, DingTalk, Amap, Dianping, Xiaohongshu, Hema. Ett scenario ber agenten fylle ut Singapores ankomstkort i nettleser. Et annet laster kvitteringer fra telefon til PC og sender reiseregning. Qwen-UI-Agent er også desktop og web, ikke bare mobil.

Creative Agent: labben hevder bilde på om lag tre sekunder, omtrent dobbelt så raskt som «ledende rivaler». Produktstakken skiller lettversjon (om lag seks sekunder, uten nett) og standard (om lag ti sekunder, med søk). Det er leverandørens tall, ikke en hogby-måling.

Honor 28. september – det som mangler

Alibaba sier Honor er første partner. Magic9 28. september og Robot Phone skal være første enheter, bygd på Qwen Intelligence og MagicOS. Alibaba oppgir inntil 91,8 prosent oppgavenøyaktighet og flyter over 100 steg. Det er partnerpåstand, ikke uavhengig EØS-test. Honor selger i Europa. Alibaba sier ikke at agentstakken er godkjent for EØS, at inferens ligger i EU, eller at MDM-kontroll er på plass. Endeside-SDK, som skulle holde mer på enheten, er under planlegging.

Hva ledergruppen faktisk må gjøre

CIO: dette er OEM-innkjøp, ikke en ChatGPT-erstatning. Be om region, underleverandør, listepris per 1 000 fullførte oppgaver inkludert inn-tokens og GUI-steg, og hva som skjer når Honor bytter modell. 2,41 dollar er et gulv i en sandkasse. CISO: GUI-agent med betaling, meldinger og skjermdeling er MDM- og BYOD-sak før den er produktivitetsgevinst. Kreve pause og menneskelig godkjenning på betaling, sending og kontoendring, og logg som juridisk kan tas ut av Alibaba. Personvern: lang minne og tverr-app betyr kalender, kart og chat hos en kinesisk sky. Juridikk: overføring utenfor EØS, AI-forordningen for systemer som handler i brukerens navn, og at vektene ikke kan auditeres lokalt. Ikke rull ut på tjenestetelefon før region, DPA og kill-switch er skriftlig.

Kilder og medier

Primærkilde: Alibaba, https://www.alizila.com/alibaba-launches-qwen-intelligence-to-power-next-generation-agentic-smartphones/ Teknisk rapport Qwen-Planner-Agent 27B og 2,41 dollar per 1 000: https://tongyi-mai.github.io/Qwen-Planner-Agent/ Produkt: https://www.qwenintelligence.com/ Dokumentasjon Planner og Mobile-Use: https://docs.qwenintelligence.com/zh/agents/plan-agent/overview og https://docs.qwenintelligence.com/zh/agents/mobile-use-agent/overview Offentlig MobilePA-Bench: https://tongyi-mai.github.io/MobilePA-Bench/ Qwen-UI-Agent: https://tongyi-mai.github.io/Qwen-UI-Agent/ Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.