Qwen åpner Qwen4-arkitekturen: intern kjøring ja, MaaS krever avtale
Qwen la 26. august 2026 ut vektene til Qwen3.8-Flash-Next. Labens GitHub kaller det en tidlig forhåndsvisning av arkitekturen som skal bære Qwen4. Det er en multimodal MoE-modell: 125 milliarder parametre i hovedmodellen, 6 milliarder aktive per token, pluss 51 milliarder n-gram-innbygginger og et 4 milliarder MTP-lag. Native kontekst er 262 144 tokener. YaRN kan strekke den til én million.
For CIO og CISO er tre fakta mer verdifulle enn Qwens egne tabeller. Vektene er åpne, men lisensen er Qwen Community License 1.0, ikke Apache. Intern bruk er tillatt. Modell-som-tjeneste og et selvstendig AI-produkt for koding eller kontor krever egen avtale med Qwen. Maskinen er ikke en bærbar. Og Flash-Next er ikke produksjons-API-et. Det heter Qwen3.8-Flash hos Qwen Cloud, med 1 million tokener og innebygde verktøy.
Hva som ble åpnet
Qwen beskriver samme grep som da Qwen3-Next kom før Qwen3.5: arkitekturen slippes tidlig, slik at vLLM, SGLang og TokenSpeed kan støtte den før Qwen4-familien. Fire endringer skilles ut.
Oppmerksomheten er hybrid. Gated DeltaNet komprimerer historikken. Qwen Sparse Attention velger viktige mikroblokker i stedet for enkelt-tokener, med budsjett på 512 blokker eller 2048 tokener. Residualstrømmen utvides til fire grener med Gated Residual. Kapasitet skaleres med n-gram-innbygging som kan ligge i vertens RAM og forhåndshentes asynkront. Treningen bruker Muon og AdamW på ulike vekter. Qwen hevder treningskostnaden er om lag en niendedel av Qwen3.7-Plus, med bedre resultat på koding og kontorarbeid.
Modellkortet er konkret. 48 lag, skjult dimensjon 2560, 512 eksperter med 10 rutet pluss én delt. Layouten er 12 ganger tre GDN-MoE-lag etterfulgt av ett QSA-MoE-lag. Modellen er nativt multimodal: tekst, bilde og video inn, tekst ut. Tenkemodus står på som standard, med innsats xhigh, medium eller low. Qwen advarer selv om at lavere resonnering i agentløkker kan gi flere forsøk og høyere totalkostnad.
Dette er ikke Qwen3.8-27B. 27B er en tett lokal modell under Apache 2.0. Flash-Next er den sparsomme Qwen4-forhåndsvisningen. Det er heller ikke Qwen3.8-Max på 2,4 billioner parametre.
Tallene er Qwens egne
På Hugging Face-kortet slår Qwen3.8-Flash-Next Claude Opus 4.6 Max på flere agent- og kodebenker, målt av Qwen. SWE-bench Pro: 62,5 mot 53,4. SWE-bench Multilingual: 81,0 mot 77,5. CoWorkBench: 73,9 mot 68,2. JobBench: 55,7 mot 36,6. LiveCodeBench v6: 91,9 mot 88,8. GPQA Diamond: 91,7 mot 91,3. På HLE taper den: 35,9 mot 40,0. DeepSWE 1.1: 58,7 mot DeepSeek V4 Flash 54,4. Toolathlon Verified: 73,5 mot 70,3 for V4 Flash.
Fotnotene betyr mer enn fet skrift. SWE-bench Pro er kjørt i Claude Code-harness med 256K kontekst, unntatt Opus der Qwen siterer offisielt tall. CoWorkBench og RecreationBench er interne. DeepSWE 1.1 rapporterer beste av to harnesser. Uavhengig lederboard er ikke publisert for dette sjekkpunktet ennå. Behandle tabellen som labens egne målinger, ikke som innkjøpsgrunnlag.
Lisensen som stenger produktet
Lisensen gir rett til å bruke, kopiere, endre, hoste, finjustere og lage derivater, med to vilkår som treffer styret.
Har produktet mer enn 100 millioner månedlige brukere, eller mer enn 20 millioner dollar i månedsomsetning, skal modellnavnet vises tydelig i brukergrensesnittet.
Driver virksomheten modell-som-tjeneste eller en selvstendig AI-arbeidsassistent for koding eller kontor, kreves egen lisens fra Qwen før kommersiell bruk. Intern bruk er unntatt, så lenge verken vektene, output eller evnene gjøres tilgjengelig for tredjepart. Modell-som-tjeneste defineres som å gi tredjepart kontroll over inferens eller finjustering, for eksempel via API. Unntaket treffer ikke en AI-funksjon inne i et produkt som primært handler om noe annet enn koding og kontor.
Det er den praktiske grensen. En bank kan evaluere modellen bak brannmuren. Et selskap som vil selge en hostet kodeagent på Flash-Next, må snakke med Qwen først. Kontaktadressen i lisensen er model-business@notice.qwencloud.com. Vektene leveres som de er, uten garanti.
Maskin, ikke laptop
Seks milliarder aktive parametre er inferenstallet. Lagringsbildet er hovedmodellen pluss n-gram-tabellen. N-gram-tabellen kan avlastes til systemminne. vLLM, SGLang og TokenSpeed har oppskrifter fra dag én. Transformers kan tjene en OpenAI-kompatibel API, men Qwen peker produksjon mot de dedikerte motorene.
Qwen3.8-27B er fortsatt den realistiske lokale 16 GB-kandidaten. Flash-Next er for de som har GPU-rack, og for de som vil teste Qwen4-arkitekturen før Max-klassen kommer på samme oppskrift.
Hva ledelsen bør gjøre
Sett Flash-Next i evalueringskøen for intern kode- og kontoragent, med lisensgjennomgang før noen tenker produkt eller kundetilgang. Ikke bytt ut Claude eller GPT på Qwens egne SWE-tall. Vent på uavhengig eval. Skill tydelig mellom intern PoC, Qwen Cloud-API og et tenkt eget MaaS-tilbud. Det siste krever avtale.
Kilder og medier
Primærkilde: https://huggingface.co/Qwen/Qwen3.8-Flash-Next Kilde: Qwen, modellkort og Qwen Community License 1.0 på Hugging Face. Teknisk rapport og slippnotat: https://github.com/QwenLM/Qwen3.8-Flash-Next. Blogg: https://qwen.ai/blog?id=qwen3.8-flash-next Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.