NVIDIA splitter agent-AI: billig utførelse, dyrt resonnement
NVIDIA har sluppet Nemotron 3.5 Lightning – en åpen 30B mixture-of-experts-modell med bare rundt 3 milliarder aktive parametere – sammen med det åpne ruterbiblioteket NeMo Switchyard. Budskapet er tydelig: lange, alltid-på AI-agenter skal ikke kjøre all tenking og all utførelse på samme dyre frontier-modell.
Det er ikke en ny flaggskipmodell for chat. Det er en arkitekturmelding til virksomheter som allerede har agenter i produksjon. Mesteparten av tokenforbruket i et agentløp går ikke til strategiske valg, men til høyt volum av rutine: verktøykall, validering av svar, formatering, git-operasjoner, delegering til underagenter og statusoppdateringer. Når hver av disse stegene treffer en frontier-modell, blir både kostnad og latens et styreproblem – ikke bare et utviklerproblem.
Hva NVIDIA faktisk slipper
Ifølge NVIDIAs tekniske blogg (11. august 2026) er Lightning bygget spesielt for utførelseslaget i always-on-agenter. MoE-designet sender hvert token bare til et fåtall eksperter, slik at kapasiteten til en større modell kombineres med beregningskostnaden til en mindre. NVIDIA hevder opptil fire ganger høyere utgangshastighet enn tilsvarende modeller i klassen, og at agentiske arbeidsmengder på PinchBench fullføres opptil 30 prosent raskere enn Qwen3.6 35B ved sammenlignbar nøyaktighet (86 prosent på PinchBench).
Vektene, treningsdata og oppskrifter slippes åpent under OpenMDW-1.1. Det følger med støtte for spekulativ dekoding (multi-token prediction, DSpark og DFlash), NVFP4-kvantisering ved siden av BF16, og et åpent agentisk RL-datasett (Nemotron-RL Agentic Terminal Pivot) brukt i deler av kodeagent-treningen. Modellen er ment å kjøre fra lokal maskinvare – Jetson, GeForce RTX, DGX Spark og DGX Station – til datasenter og sky.
NeMo Switchyard er den andre halvdelen av pakken: et åpent bibliotek for smart ruting inne i eksisterende agentverktøy. Tanken er at planlegging og kompleks resonnering kan gå opp til frontier-modeller (for eksempel Nemotron 3 Ultra eller andre lukkede modeller), mens høyvolum-utførelse går ned til Lightning – uten at utviklerne må skrive om hele applikasjonen. NVIDIA viser også til integrasjoner og økosystem rundt harnesser, inferens og skyplattformer.
CNBC bekrefter tidspunkt og strategisk kontekst: Lightning er NVIDIAs første åpne modellslipp etter at konsernsjef Jensen Huang offentlig forsvarte open-weight-modeller, med poenget at «gratis AI» fortsatt driver GPU-etterspørsel. Den kommersielle logikken er ikke filantropi. Den er å gjøre agentvolum billigere og mer lokalt – på NVIDIA-stacken.
Hvorfor dette treffer norske ledere nå
Mange norske virksomheter har gått fra pilot-chatboter til agenter med verktøytilgang i kode, kundeservice, økonomi og sikkerhet. Det skaper tre umiddelbare lederbeslutninger:
- Kostnadsarkitektur. Hvis 80 prosent av agentkallene er «små» og 20 prosent er «tunge», er det sløseri å prise hele flåten som frontier. Lightning/Switchyard-mønsteret formaliserer det mange allerede forsøker ad hoc: billig modell til bulk, dyr modell til unntak. CFO og CIO må se tokenregningen per prosess, ikke bare per leverandør.
- Kontrollplan og leverandørbinding. Når ruting blir en egen komponent, blir spørsmålet hvem som eier policyen: hvilke modeller får hvilke oppgaver, under hvilke dataregioner, med hvilke logger og kill-switcher. Switchyard er åpen, men den sitter tett på NVIDIAs agent- og GPU-økosystem. Det er en mulighet for mer kontroll – og en ny type lock-in hvis ruter, telemetri og fine-tuning blir umulig å flytte.
- Lokal og suveren drift. Lightning er eksplisitt posisjonert for edge og on-prem. For virksomheter med personvern, beredskap eller sektorregulering betyr det at deler av agentflåten kan kjøre uten at hvert verktøykall forlater kontrollert infrastruktur. Det er relevant for bank, helse, kraft, offentlig sektor og leverandører som leverer til dem.
CISO-vinkelen: raskere agenter, større angrepsflate
Raskere utførelsesmodeller øker ikke bare produktivitet. De øker også tempoet i misbruk hvis en agent har for vide fullmakter. En modell som er god på verktøykall og terminalarbeid, er nettopp den typen komponent som trenger:
- streng identitet og kortvarige credentials per agent
- policy utenfor selve prompten (hva agenten får lov til, ikke bare hva den blir bedt om)
- logging av hvert verktøykall, modellvalg og ruterbeslutning
- menneskelig godkjenning på handlinger som treffer penger, produksjon, identitet eller ekstern kommunikasjon
- evaluering av fine-tunes: domene-tilpasning kan øke treffsikkerhet – og utilsiktet svekke sikkerhetsavvisninger
NVIDIA trekker selv frem at Lightning er trent for populære agent-harnesser og at partnere som CrowdStrike tilpasser den for cybersikkerhet. Det understreker poenget: dette er ikke en nøytral tekstmodell. Det er en utførelsesmotor i systemer som allerede rører ved privilegerte flater.
Hva styret bør spørre om i neste AI-status
Dropp «har vi testet den nyeste modellen?». Still heller:
- Hvor stor andel av agent-tokenene våre går til planlegging versus utførelse i dag?
- Har vi en eksplisitt rutingpolicy, eller velger hvert team modell ad hoc?
- Kan vi kjøre utførelseslaget on-prem/edge der dataene krever det, uten å miste observabilitet?
- Hva er patch-, eval- og rollback-rutinen når en billig spesialmodell finjusteres på interne data?
- Hvem eier kostnads-SLA og sikkerhets-SLA for multi-modell-agenter – produkt, plattform eller sikkerhet?
Konkurransebildet
Lightning treffer et marked der åpne, effektive modeller allerede kjemper om agentvolum: Qwen-klassen, Meta Muse Glimmer for lokal agentbruk, og europeiske plattformer som vil hoste tredjeparts open weights under regionale kontroller. NVIDIAs differensiering er ikke bare modellkortet, men kombinasjonen av åpen utførelsesmodell, ruter, GPU-stakk og partnerøkosystem for post-training og drift.
For norske virksomheter er den praktiske lærdommen enkel: agentøkonomi blir et systemdesignspørsmål. Den som fortsetter å sende all agenttrafikk til én dyr modell, vil tape på kostnad. Den som slipper billige utførelsesmodeller løs uten kontrollplan, vil tape på risiko. Lightning og Switchyard gjør begge utfall mer akutte – fordi de senker terskelen for å bygge always-on agentflåter for alvor.
Kilder og medier
Primærkilde: NVIDIA Technical Blog, https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/ NVIDIA Blog (produktkontekst): https://blogs.nvidia.com/blog/nemotron-lightning-switchyard-rtx-dgx/ Korroborering: CNBC, https://www.cnbc.com/2026/08/11/nvidia-releases-nemotron-3point5-lightning-open-source-ai-model-.html Offisiell X-post: https://x.com/nvidia/status/2087172614896988545 Thumbnail: OpenAI Image 2 / hogby.ai📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.