Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face • Bloomberg: NVIDIA-kunder varsles om over 15 prosent prishopp på AI-servere • OpenAI kutter GPT-5.6 Sol mer enn 20 prosent – i tre måneder

GitHub HydraFusion: frontier-kvalitet med flere modeller – 67 prosent billigere
GitHubGitHub CopilotHydraFusionAI-agenterKodingCIOCISOFinOpsMicrosoft

GitHub HydraFusion: frontier-kvalitet med flere modeller – 67 prosent billigere

JH
Joachim Høgby
4. september 20264. september 20265 min lesingKilde: GitHub

GitHub slipper Project HydraFusion som research preview i GitHub Copilot. Poenget er ikke en ny modell. Poenget er at Copilot selv skal sette sammen en kjøreplan på tvers av modellleverandører: én modell utkast, en annen kritikk, en tredje eskalering når kvaliteten ikke holder.

I kontrollerte offline-tester hevder GitHub at de beste HydraFusion-oppsettene matcher eller slår Claude Opus 5 på agentisk koding, med vesentlig lavere estimert kostnad. På TerminalBench 2.1: 4,9 poeng bedre kvalitet og 67 prosent lavere kostnad enn Opus 5. På DeepSWE: 1,5 poeng bak, 36 prosent billigere. På CheckpointBench, bygget på ekte Copilot-sesjoner: 0,1 poeng bak, 65 prosent billigere.

For norske CIO-er er dette FinOps og styring, ikke en ny modellpicker. Når én «modell» i verktøyet i praksis kaller flere leverandører, flytter både kostnad, logging og datagrense.

Tre kjøremønstre, ikke én modell

HydraFusion velger per oppgave ett av tre mønstre:

Single: én valgt modell løser oppgaven direkte. Billig og raskt når det holder.

Cascade: en effektiv modell lager et utkast. En kvalitetsport avgjør om svaret godtas eller eskaleres til en sterkere modell.

Critique: én modell skriver, en uavhengig skrivebeskyttet kritiker fra en annen modellfamilie leser, og utkastmodellen reviderer én gang. GitHub sammenligner mønsteret med Rubber Duck-gjennomgangen i Copilot CLI.

Runtime-et bruker signaler for resonnering, kodegenerering, debugging og verktøybruk. Målet er minste arbeidsflyt som treffer kvalitetsbar. Nye modeller i Copilot-katalogen kan tas inn i poolen etter hvert.

GitHub hadde allerede Auto model selection, som matcher oppgave til én modell. HydraFusion går et steg videre: sammensatte arbeidsflyter i runtime, ikke bare valg av én vinner.

Hva tallene faktisk sier

Evalueringen brukte faste policyer mot tre agentiske kodebenchmarks, med Claude Opus 5 og GPT-5.6 Sol som baselinjer. Samme oppgaveinput, verktøy, tidsgrenser, prisantakelser og karaktersetting. Kostnaden inkluderer alle bein: utkast, kritikk, revisjon, eskalering, retry og fallback. Alle modeller kjørte på samme medium reasoning-nivå.

GitHub er tydelig på begrensningene. Tallene gjelder de evaluerte benchmark-revisjonene, arbeidsflytene, modellpoolen og prisantakelsene. Research preview-en skal teste om det holder i ekte utviklerarbeid. Første anbefaling er førstetur, én-prompt kodeoppgaver i autopilot. Fler-tur og lange sesjoner kommer senere. Resultater, modeller, navn og produktatferd kan endre seg.

Tilgang: research preview for brukere på alle Copilot-planer via /experimental i GitHub Copilot CLI. Bruk prises etter tokenene modellene faktisk bruker, til hver modells vanlige pris.

Styringsprinsippene som betyr noe for CISO

GitHub beskriver fem driftsprinsipper som er mer interessante enn benchmark-grafene.

Komplett regnskap: aggregert kostnad og bruk på tvers av alle bein. Uten det blir «67 prosent billigere» umulig å ettergå i produksjon.

Avgrenset kjøring: eksplisitt timeout og avbrudd per bein, så kostnad og tid ikke løper løpsk.

Isolert review: kritikktrinn kjører uten verktøy, i isolert kontekst. Løser-trinnet bruker delt workspace og den vanlige, tillatelsesbevisste agentløkken. Kritikeren skal ikke endre repoet.

Fail-safe: ingen patch hvis arbeidsflyten avbrytes eller validering feiler.

Validert routing: sjekk av arbeidsflytdefinisjon, modellbinding, fallback og tilgjengelighet før kjøring starter.

Internt logges rolle, utfall, kostnad, latenstid og diagnostikk per bein. Utvikleren skal se ett svar og ett tillatelsesbevisst endringssett.

Det er et godt mønster. Det er også et nytt angreps- og revisjonsflate: hvilken modell så koden, hvilken så bare review-konteksten, og hva som gikk til hvilken leverandør.

Hva norske ledere bør gjøre

Ikke slå på HydraFusion i produksjonsrepoer med hemmeligheter fordi en intern Microsoft-ingeniør synes resonneringen er «på nivå med Opus». Det er en research preview.

Gjør tre ting. Sett modellpolicy før noen slår på /experimental: hvilke leverandører kan se kildekode, og om cascade/critique får krysse skygrenser. Krev at Copilot-admin kan vise kostnad per bein, ikke bare per «HydraFusion-kall». Og test content exclusions. GitHub har samtidig gjort content exclusions GA i Copilot-appen og CLI; det er relevant nettopp fordi sammensatte agenter ellers kan sende sensitiv kode til flere modeller enn brukeren tror.

HydraFusion er GitHubs første tydelige veddemål på at neste løft i kodeagenter kommer fra orkestrering, ikke fra å velge «beste modell» én gang. For CIO og CISO er spørsmålet det samme som for all agentdrift: hvem styrer ruten, hvem betaler for hvert bein, og hvem kan slå av flyten når den tar feil.

Kilder og medier

Primærkilde: GitHub, «Project HydraFusion: Frontier quality via multi-model orchestration», 4. september 2026, https://github.blog/ai-and-ml/github-copilot/project-hydrafusion-frontier-quality-via-multi-model-orchestration/

GitHub Changelog, «GitHub Copilot weekly releases — August 31», 4. september 2026, https://github.blog/changelog/2026-09-04-github-copilot-weekly-releases-august-31/

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.