Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI lover teknisk rapport etter Hugging Face-hendelse • Anthropic gjør Claude Opus 5 til ny toppmodell for agentarbeid • Falske AI-plugins stjal utviklernes API-nøkler • AI-agentpakker på npm ble kapret i 27 minutter • Beijing tvinger Meta til å reversere Manus-kjøp

MiniMax-M3 gjør AMD til et mer reelt inferensvalg

JH
Joachim Høgby
24. juli 202624. juli 20265 min lesingKilde: AMD ROCm Blog

AMD har publisert en teknisk gjennomgang av hvordan MiniMax-M3 kjøres på AMD Instinct MI355X med ATOM og ATOMesh. På papiret høres det ut som en klassisk leverandørbenchmark. I praksis er det mer interessant: en stor, åpen multimodal MoE-modell med 428 milliarder parametere, 22 milliarder aktive per token og opptil 1 million token kontekst kjøres på en alternativ GPU-stack med resultater som flere steder ligger tett på, eller over, NVIDIA-baserte oppsett i de publiserte målingene.

Det viktigste for ledere er ikke om én kurve slår en annen i én test. Det viktige er at inferensmarkedet begynner å ligne et marked igjen. Når store modeller kan serveres effektivt på flere akseleratorfamilier, får virksomheter mer reell forhandlingsmakt på pris, kapasitet, risiko og skybinding. Det er akkurat der mange AI-strategier sliter nå: modellene blir bedre, agentene blir mer nyttige, men kost, ventetid og tilgang på regnekraft bestemmer hvor mye som faktisk kan settes i produksjon.

MiniMax-M3 er ikke en liten demonstrasjonsmodell. AMD beskriver den som en nativt multimodal Mixture-of-Experts-modell med tekst, bilde og video i samme arkitektur. MiniMax Sparse Attention skal redusere beregningen per token kraftig ved lang kontekst, og modellen er relevant for kode, agenter og store arbeidsflyter der én million token faktisk kan bety noe. Det gjør benchmarken mer interessant enn en ren syntetisk hastighetstest. Dette er nærmere den typen last en virksomhet kan møte når lange dokumenter, kodebaser, supporthistorikk, sikkerhetslogger og multimodale data skal analyseres av agentiske systemer.

AMD peker på to nivåer i stacken. ATOM er ROCm-native inferensmotoren for enkeltnode-kjøring. ATOMesh er orkestreringslaget for distribuerte oppsett, blant annet med separasjon av prefill og decode. Det siste er viktig for lange kontekster og MoE-modeller, fordi første gjennomlesning av mye input og etterfølgende tokengenerering har helt ulike ressursprofiler. Hvis de fasene kan plasseres og skaleres smartere, blir både ventetid og kapasitetsutnyttelse bedre.

Den mest konkrete ytelsespåstanden er enkeltnode-testen. AMD skriver at MI355X med ATOM, EAGLE3 spekulativ dekoding og FP4 når 340–370 token per sekund per bruker i den høye interaktivitetsenden, omtrent på nivå med B200 med vLLM og EAGLE3 i FP8. I samme område oppgir AMD rundt 0,6 tusen token per sekund per GPU for MI355X mot rundt 0,2 tusen for B200. I høyere gjennomstrømming, over 17–135 token per sekund per bruker, oppgir AMD 3,6–8,5 tusen token per sekund per GPU mot 2,5–7,7 tusen for B200.

På multi-node-siden hevder AMD at MI355X med ATOMesh og ATOM i FP4 leverer 0,3–5 tusen token per sekund per GPU i området 60–150 token per sekund per bruker. Det sammenlignes med NVIDIA B300 med Dynamo vLLM FP8 på 0,2–3,9 tusen. Tallene kommer med vanlige forbehold om presisjon, topologi, programvareversjon, benchmark-oppsett og arbeidslast. Det bør de også gjøre. Ingen CIO bør kjøpe AI-infrastruktur på én leverandørgraf.

Likevel er retningen verdt å få med seg. AI-infrastruktur er i ferd med å flytte seg fra «hvilken modell er smartest?» til «hvilken komplett kjede gir best resultat per krone, per millisekund og per risikopunkt?». Det inkluderer modellarkitektur, kvantisering, spekulativ dekoding, KV-cache, nettverk, observability, køstyring, datasuverenitet og evnen til å flytte workloads mellom leverandører uten å bygge alt på nytt.

For norske virksomheter er dette et innkjøpssignal. Hvis AI-bruk skal skaleres fra piloter til produksjon, må man slutte å kjøpe kapasitet som om én GPU-leverandør og én modellplattform alltid blir fasit. Riktig spørsmål til leverandører er ikke bare «støtter dere GPT, Claude eller Gemini?». Det er også: Hvilke åpne modeller kan vi kjøre? På hvilke akseleratorer? Med hvilken observability? Hvilken latency under faktisk last? Hva koster en fullført agentoppgave, ikke bare én million tokens? Og hvor raskt kan vi flytte dersom pris, regulatorikk eller kapasitet endrer seg?

Dette er også relevant for CISO. Lange kontekster og agentiske arbeidsflyter betyr mer sensitiv input i modellkjeden. Når inferens kan kjøres på flere stacks, blir lokal eller kontrollert drift mer realistisk for enkelte use cases. Ikke alle skal selvhoste en 428B-modell. Men flere vil kunne kreve tydeligere svar om hvor data prosesseres, hvordan cache håndteres, hvilke logger som lagres, og om workloads kan isoleres bedre enn i en ren API-avtale.

Min vurdering: Dette er ikke en bred modellnyhet som alle skal teste i morgen. Det er en infrastrukturindikator. MiniMax-M3 på AMD viser at åpen modell, lang kontekst og alternativ GPU-stack kan bli en seriøs del av enterprise AI-regnestykket. Det gjør 2026 mindre binært. Bra. Markedet trenger mindre religiøs NVIDIA-vs-alle-andre-prat og mer målbar produksjonsøkonomi.

For ledelsen er neste steg praktisk: bygg en liten eval for egne tunge workloads. Ta én kodebase, én dokumentmengde, én sikkerhetslogg eller én kundeserviceflyt. Mål kvalitet, ventetid, totalkost, driftsrisiko og flyttbarhet på tvers av minst to modell- og inferensoppsett. Hvis leverandøren ikke kan svare på det, selger de fortsatt demo, ikke drift.

Kilder og medier

Primærkilde: AMD ROCm Blog, "Efficient MiniMax-M3 Inference on AMD Instinct GPUs with ATOM and ATOMesh" — https://rocm.blogs.amd.com/artificial-intelligence/minmax-m3-atomesh/README.html Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.