Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Claude designer proteinbindere autonomt – og laben bekrefter • OpenAI bremser frontier-RL til sikkerheten tar igjen evnene • NVIDIA og OpenAI låser 8 GW AI-fabrikk i Ohio • Brockman: Forsvarernes vindu er åpent – men det lukker seg

Qwen3.8 Max løfter Alibaba inn i agenttoppen
AIModellerStrategi

Qwen3.8 Max løfter Alibaba inn i agenttoppen

JH
Joachim Høgby
8. august 20268. august 20264 min lesingKilde: Qwen / Alibaba

Qwen, Alibabas modellteam, melder at Qwen3.8 Max nå ligger som nummer fem på Artificial Analysis Intelligence Index og nummer én på deres Agentic Index. Det er ikke en vanlig lanseringspost med store løfter. Det er en posisjoneringssak om hvem som faktisk begynner å levere på agentiske arbeidsflyter, ikke bare chat.

For CIO-er, CISO-er og teknologiledere er dette mer interessant enn enda en modellnavn-oppdatering. Agentiske modeller er de som brukes til planlegging, verktøybruk, kode, analyse, lange oppgaver og operasjonelle arbeidsflyter. Det er akkurat her kostnad, kontroll og leverandørvalg begynner å bite. Når en kinesisk modell fra Alibaba hevder førsteplass i en agentindeks, og en uavhengig eval-side plasserer den i øvre sjikt av total intelligens, er det et innkjøpssignal. Ikke fordi én indeks avgjør alt, men fordi konkurransebildet blir bredere.

Artificial Analysis sin modellside viser Qwen3.8 Max som en proprietær reasoning-modell med 1 million tokens kontekstvindu, støtte for tekst, bilde og video som input, og tekst som output. Siden oppgir en Intelligence Index-score på 58, over medianen for sammenlignbare reasoning-modeller, og måler hastigheten til rundt 68 tokens per sekund på Alibaba API. Prisbildet som oppgis er 2 dollar per million input-tokens, 6 dollar per million output-tokens og 0,25 dollar per million cache-hit tokens. Det gjør modellen relevant i samtaler der man tidligere ofte sammenlignet nesten alt mot OpenAI, Anthropic, Google og et par open-weight-alternativer.

Det viktigste er ikke om Qwen3.8 Max er «best». Det viktigste er at den ser sterk nok ut til at den må inn i eval-settet til virksomheter som allerede kjøper eller bygger agentløsninger. Hvis dere vurderer kodeagenter, analyseagenter, supportautomatisering, dokumentflyt, sikkerhetsoperasjoner eller interne kunnskapsagenter, holder det ikke lenger å teste én standardmodell og konkludere. Modellruting, pris per oppgave, latency, kontekstvindu, compliance og datalokasjon blir en del av arkitekturen.

Agenttoppen er også et risikosignal. En modell kan se glimrende ut på lange agentoppgaver og samtidig være mindre egnet i miljøer der man trenger determinisme, sporbarhet og stram policy-kontroll. Artificial Analysis-siden peker på at Qwen3.8 Max er svært verbal i evalueringene, med høyere tokenbruk enn medianen. Det kan være en fordel når modellen skal resonnere tungt, men det kan også bli dyrt, tregt eller støyete i produksjon hvis agenten ikke er stramt orkestrert. Her må ledere måle kostnad per fullført oppgave, ikke bare pris per token.

For norske virksomheter betyr dette tre praktiske grep. Først: bygg en liten intern modellbench for egne oppgaver. Ikke generiske prompts. Bruk ekte, av-identifiserte saker: en supportdialog, en kodeendring, en kravspesifikasjon, en avvikssak, en SOC-triage, en Excel-rapport. Mål ferdig resultat, tid, kostnad, feil og behov for menneskelig korreksjon.

Deretter: skill mellom modell og system. Qwen3.8 Max kan være sterk, men verdien i agentbruk kommer også fra verktøytilgang, rettighetsmodell, logging, prompt-injeksjonsvern, eval-loop, rollback og menneskelig godkjenning. En god modell i en dårlig agentplattform er fortsatt en dårlig produksjonsrisiko.

Til slutt: behandle nye sterke modeller fra Alibaba, Moonshot, DeepSeek, MiniMax og Qwen som seriøse alternativer, men ikke som gratis gevinst. Spør leverandøren hvor data prosesseres, hvilke logger som lagres, hvordan enterprise-policy håndheves, hvilke modeller som faktisk ligger bak produktet, og hvordan bytte eller fallback fungerer. Kinesiske frontiermodeller skjerper konkurransen, men de skjerper også kravene til styring.

Denne saken er derfor mindre «Alibaba slår X» og mer «modellmarkedet blir multipolart». Qwen3.8 Max viser at agentkapasitet, multimodal input, lang kontekst og lavere prispress ikke bare kommer fra de amerikanske labene. Det er bra for kjøpere. Men bare hvis virksomheten har disiplin nok til å evaluere, rute og styre modellene som infrastruktur.

Kilder og medier

Primærkilde: Qwen / Alibaba, https://x.com/Alibaba_Qwen/status/2085299356190802058

Supplerende evalkilde: Artificial Analysis, https://artificialanalysis.ai/models/qwen3-8-max

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.