Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

NVIDIA og Microsoft åpner AI-sikkerhetsallianse • WSJ: Nvidia forhandler 250 milliarder dollar i garantier for OpenAI-datasenter • OpenAI lover teknisk rapport etter Hugging Face-hendelse • Anthropic gjør Claude Opus 5 til ny toppmodell for agentarbeid • Falske AI-plugins stjal utviklernes API-nøkler

xAI gjør Grok Build til orkestrator for parallelle agenter
AI-modellerAgenterKodeagenterxAICISO

xAI gjør Grok Build til orkestrator for parallelle agenter

JH
Joachim Høgby
27. juli 202627. juli 20264 min lesingKilde: xAI

xAI har lagt workflows inn i Grok Build. Det høres ut som en produktfunksjon. I praksis er det et signal om hvor kodeagenter er på vei: fra én lang chat til styrte arbeidsløp med mange spesialiserte agenter, innebygget verifikasjon og gjenbrukbare kommandoer.

Den offisielle xAI-siden beskriver workflows som orkestreringsskript Grok Build kan skrive og kjøre selv. Brukeren beskriver en stor oppgave i vanlig språk. Grok planlegger arbeidet, deler det i faser, kjører parallelle agenter i bakgrunnen og samler resultatet i én rapport. Eksemplene xAI trekker frem er ikke små demoer: gjennomgang av en stor pull request, triage av de siste 100 issue-sakene og revisjon av en kodebase for én bestemt feilklasse, for eksempel manglende autentiseringssjekker.

Det viktige tallet er skalaen. xAI skriver at kjøringer får et budsjett på 128 agenter, og opptil 1 024 for store jobber. Det betyr ikke at alle virksomheter bør slippe tusen agenter løs i repoet mandag morgen. Det betyr at leverandørene nå designer agentverktøy for arbeid som er for stort for én samtale og for rotete for én prompt. Når verktøyet også har uavhengige skeptikere som kan kontrollere funn før de havner i sluttrapporten, blir dette mer enn raskere autocomplete. Det blir en arbeidsmodell for kvalitetskontroll.

For CIO-er er hovedpoenget kapasitet og styring. Agentene kan gjøre det billig å spørre: Har vi samme auth-feil i flere tjenester? Hvilke issues bør egentlig prioriteres? Hva endret seg i denne store PR-en? Men de kan også gjøre det billig å skape støy. Hvis hver utvikler kan starte bakgrunnskjøringer som bruker hundrevis av agenter, må plattformteamet vite hvordan kost, tilgang, logger og stoppkriterier håndteres. Ellers flytter man bare køen fra mennesker til tokens.

For CISO-er er dette enda mer konkret. xAI nevner revisjon av route handlers for manglende auth-sjekker som et eksempel. Det er akkurat typen arbeid sikkerhetsteam ofte vil gjøre oftere enn de faktisk rekker. Men agentdrevet sikkerhetsgjennomgang må behandles som produksjonsnær automatisering, ikke som en hyggelig kodechat. Den trenger klare regler for hvilke repoer agentene kan lese, hvilke verktøy de kan kjøre, hva som logges, og hvordan funn merkes som verifisert, usikkert eller forkastet.

Den mest interessante delen er gjenbruk. xAI skriver at Grok kan lagre workflows i .grok/workflows/ for teamdeling, eller i ~/.grok/workflows/ for personlig bruk. En vellykket PR-review kan dermed bli en egen slash-kommando med argumenter. Det gjør agentarbeid mer standardisert. Samtidig gjør det dårlige workflows farligere, fordi en svak prosess plutselig kan bli enkel å gjenta mange ganger.

/deep-research trekkes frem som en innebygget workflow. Den deler forskningsspørsmål mellom parallelle undersøkere, verifiserer påstander mot kilder og returnerer en rapport med sitater. Det er en nyttig peker for lederteam: agentverdi handler ikke bare om å skrive kode raskere. Den neste konkurransen står om hvem som kan gjøre komplekse kunnskapsprosesser reproduserbare, etterprøvbare og raske nok til å brukes i hverdagen.

Dette er fortsatt en leverandørannonsering fra xAI, ikke en uavhengig måling av kvaliteten på workflows i store virksomhetsmiljøer. Det bør derfor leses som produktretning, ikke som fasit. Men retningen er tydelig: modellnyhetene flytter seg fra rene benchmark-tall til agentorkestrering, verifikasjon og operasjonell kontroll.

Det praktiske rådet er enkelt. Ikke start med tusen agenter. Start med én avgrenset workflow der fasiten kan sjekkes: PR-review mot en definert sjekkliste, issue-triage med menneskelig godkjenning, eller sikkerhetsrevisjon av én kjent feilklasse. Mål presisjon, tidsbruk, kost og hvor ofte mennesker må overstyre resultatet. Hvis workflowen ikke tåler revisjon, skal den ikke skaleres.

Kilder og medier

Primærkilde: xAI, https://x.ai/news/workflows

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.