Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI lover teknisk rapport etter Hugging Face-hendelse • Anthropic gjør Claude Opus 5 til ny toppmodell for agentarbeid • Falske AI-plugins stjal utviklernes API-nøkler • AI-agentpakker på npm ble kapret i 27 minutter • Beijing tvinger Meta til å reversere Manus-kjøp

Grok 4.5 rulles ut bredt for kode- og agentarbeid
AI-modellerxAIGrokKodeagenterCIO

Grok 4.5 rulles ut bredt for kode- og agentarbeid

JH
Joachim Høgby
24. juli 202624. juli 20264 min lesingKilde: Grok / xAI

xAI har gjort Grok 4.5 bredt tilgjengelig på grok.com, X, iOS og Android, med en tydelig posisjonering mot koding, agentiske arbeidsflyter og tungt kunnskapsarbeid. Det er ikke en liten produktknapp. Det er xAI som prøver å flytte Grok fra samtalemodell til arbeidsmodell.

Den ferske meldingen fra Grok-kontoen sier at Grok 4.5 nå er live på tvers av de viktigste flatene, med bedre ytelse i koding, agentiske oppgaver og kunnskapsarbeid, raskere responser på over 80 tokens per sekund og bedre tokeneffektivitet. xAI peker også på lavere kost og færre plattformgrenser. I lanseringsnotatet beskrives modellen som selskapets sterkeste modell for real-world engineering, og som standardmodell i Grok Build.

For ledere er dette mer interessant enn enda en rangering i modellkrigen. Spørsmålet er ikke om Grok 4.5 kan skrive en pen demo. Spørsmålet er om den kan gjøre dyre agentløp billigere nok til at virksomheten tør å bruke dem ofte. Hvis en modell løser samme type utvikler- eller kontoroppgave med færre output-tokens, færre runder og høy nok treffsikkerhet, endrer det regnestykket for intern automatisering.

Hva som faktisk er nytt

xAI beskriver Grok 4.5 som en modell bygget for koding, agentiske oppgaver og kunnskapsarbeid, ikke bare generell chat. Den offisielle gjennomgangen løfter frem flere konkrete punkter: modellen er trent på datasett innen koding, vitenskap, engineering og matematikk; den bruker forsterkende læring på mange flertrinnsoppgaver; og den er laget for lange agentiske rollouts der modellen må planlegge, bruke verktøy, rette feil og fortsette uten at alt blir en ettprompt-demo.

Selskapet hevder også at Grok 4.5 serveres med rundt 80 TPS og omtrent dobbelt tokeneffektivitet mot sammenlignbare ledende modeller på samme type oppgaver. I ett eksempel fra lanseringssiden oppgis Grok 4.5 til 15 954 output-tokens i snitt per SWE Bench Pro-oppgave, mot 67 020 for Opus 4.8 max. Det er en påstand fra leverandøren, og bør behandles som det. Men retningen er viktig: xAI konkurrerer ikke bare på toppscore, men på kost per løst arbeidsstykke.

Benchmarksiden viser også at Grok 4.5 ligger høyt på flere kode- og terminaltester. xAI oppgir blant annet 62,0 prosent på DeepSWE 1.0, 83,3 på Terminal Bench 2.1 og 64,7 prosent resolve rate på SWE Bench Pro. Tallene må benchmarkes lokalt før de brukes i innkjøpsbeslutninger. Likevel er det nok signal til at CTO- og CIO-team bør vurdere Grok 4.5 i en kontrollert modellruting, særlig der kostnaden ved lange agentløp allerede er irriterende synlig.

Hvorfor CIO og CISO bør bry seg

Grok 4.5 er mest relevant der oppgaven har høy kontekst, mange steg og et faktisk leveransekrav: kodegjennomgang, bugfixing, repoanalyse, dokumentproduksjon, regnearkmodeller, kravspesifikasjoner og operativ feilsøking. Dette er også arbeidsflater der svake modeller ofte blir dyre på en usynlig måte. De svarer raskt, men bruker flere forsøk, mer menneskelig opprydding og flere avklaringsrunder.

Hvis Grok 4.5 leverer bedre forhold mellom intelligens, fart og outputmengde, kan den bli nyttig som del av en modellportefølje. Ikke nødvendigvis som standardmodell for alt. Mer sannsynlig som en kandidat for agentjobber der bedriften allerede bruker Claude, GPT eller Gemini, og der man vil teste om xAI kan presse kost eller ventetid ned uten at kvaliteten faller.

CISO-vinkelen er todelt. På den positive siden kan bedre kode- og agentmodeller brukes til sårbarhetsjakt, sikker kodegjennomgang og raskere triage. På den negative siden betyr bedre flertrinnsmodeller også at policy, logging og datagrense må være på plass før utviklere slipper modellen løs på interne repoer, kundedata eller produksjonsnære verktøy. En modell som er god på å handle, må styres hardere enn en modell som bare er god på å prate. Surprise, sa ingen sikkerhetssjef noensinne.

Hva virksomheter bør teste først

Den riktige testen er ikke et tilfeldig promptbatteri. Start med tre interne oppgaver som allerede koster tid: en bug fra et faktisk repo, en kodegjennomgang med sikkerhetsfunn, og en dokument-/regnearkoppgave med flere kilder. Kjør samme oppgave mot dagens foretrukne modell og Grok 4.5. Mål fem ting: ferdig kvalitet, antall runder, total ventetid, tokenkost og hvor mye menneskelig etterarbeid som trengs.

Deretter bør modellen testes med policy aktivert, ikke i fri lek. Hvilke filer får den lese? Kan den kjøre kode? Kan den skrive tilbake? Hvilke kommandoer er forbudt? Hvilke data skal aldri inn? For agentmodeller er disse rammene like viktige som modellvalget. Uten dem ender evalueringen i demo-teater. Med dem får ledelsen et faktisk beslutningsgrunnlag.

Vurdering

Dette er en relevant modellnyhet fordi xAI nå knytter Grok 4.5 tydeligere til produksjonsflater: Grok, X, mobil, API, Cursor og Grok Build. Det gjør modellen lettere å teste i ekte arbeidsflyt, ikke bare på en isolert leaderboard.

Den nøkterne konklusjonen: Grok 4.5 bør inn i eval-køen for kodeagenter og kunnskapsarbeid, spesielt hvis organisasjonen allerede bruker mye penger på lange agentkjøringer. Den bør ikke inn ukritisk som ny standardmodell. Start med avgrensede oppgaver, mål kost per godkjent leveranse, og la sikkerhetsmodellen styre tilgangen.

Kilder og medier

Primærkilde: Grok / xAI, https://x.com/grok/status/2080639315600658488 Bakgrunn: xAI, https://x.ai/news/grok-4-5 Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.