GitHub HydraFusion: frontier-kvalitet med flere modeller – 67 prosent billigere
GitHub slipper Project HydraFusion som research preview i GitHub Copilot. Poenget er ikke en ny modell. Poenget er at Copilot selv skal sette sammen en kjøreplan på tvers av modellleverandører: én modell utkast, en annen kritikk, en tredje eskalering når kvaliteten ikke holder.
I kontrollerte offline-tester hevder GitHub at de beste HydraFusion-oppsettene matcher eller slår Claude Opus 5 på agentisk koding, med vesentlig lavere estimert kostnad. På TerminalBench 2.1: 4,9 poeng bedre kvalitet og 67 prosent lavere kostnad enn Opus 5. På DeepSWE: 1,5 poeng bak, 36 prosent billigere. På CheckpointBench, bygget på ekte Copilot-sesjoner: 0,1 poeng bak, 65 prosent billigere.
For norske CIO-er er dette FinOps og styring, ikke en ny modellpicker. Når én «modell» i verktøyet i praksis kaller flere leverandører, flytter både kostnad, logging og datagrense.
Tre kjøremønstre, ikke én modell
HydraFusion velger per oppgave ett av tre mønstre:
Single: én valgt modell løser oppgaven direkte. Billig og raskt når det holder.
Cascade: en effektiv modell lager et utkast. En kvalitetsport avgjør om svaret godtas eller eskaleres til en sterkere modell.
Critique: én modell skriver, en uavhengig skrivebeskyttet kritiker fra en annen modellfamilie leser, og utkastmodellen reviderer én gang. GitHub sammenligner mønsteret med Rubber Duck-gjennomgangen i Copilot CLI.
Runtime-et bruker signaler for resonnering, kodegenerering, debugging og verktøybruk. Målet er minste arbeidsflyt som treffer kvalitetsbar. Nye modeller i Copilot-katalogen kan tas inn i poolen etter hvert.
GitHub hadde allerede Auto model selection, som matcher oppgave til én modell. HydraFusion går et steg videre: sammensatte arbeidsflyter i runtime, ikke bare valg av én vinner.
Hva tallene faktisk sier
Evalueringen brukte faste policyer mot tre agentiske kodebenchmarks, med Claude Opus 5 og GPT-5.6 Sol som baselinjer. Samme oppgaveinput, verktøy, tidsgrenser, prisantakelser og karaktersetting. Kostnaden inkluderer alle bein: utkast, kritikk, revisjon, eskalering, retry og fallback. Alle modeller kjørte på samme medium reasoning-nivå.
GitHub er tydelig på begrensningene. Tallene gjelder de evaluerte benchmark-revisjonene, arbeidsflytene, modellpoolen og prisantakelsene. Research preview-en skal teste om det holder i ekte utviklerarbeid. Første anbefaling er førstetur, én-prompt kodeoppgaver i autopilot. Fler-tur og lange sesjoner kommer senere. Resultater, modeller, navn og produktatferd kan endre seg.
Tilgang: research preview for brukere på alle Copilot-planer via /experimental i GitHub Copilot CLI. Bruk prises etter tokenene modellene faktisk bruker, til hver modells vanlige pris.
Styringsprinsippene som betyr noe for CISO
GitHub beskriver fem driftsprinsipper som er mer interessante enn benchmark-grafene.
Komplett regnskap: aggregert kostnad og bruk på tvers av alle bein. Uten det blir «67 prosent billigere» umulig å ettergå i produksjon.
Avgrenset kjøring: eksplisitt timeout og avbrudd per bein, så kostnad og tid ikke løper løpsk.
Isolert review: kritikktrinn kjører uten verktøy, i isolert kontekst. Løser-trinnet bruker delt workspace og den vanlige, tillatelsesbevisste agentløkken. Kritikeren skal ikke endre repoet.
Fail-safe: ingen patch hvis arbeidsflyten avbrytes eller validering feiler.
Validert routing: sjekk av arbeidsflytdefinisjon, modellbinding, fallback og tilgjengelighet før kjøring starter.
Internt logges rolle, utfall, kostnad, latenstid og diagnostikk per bein. Utvikleren skal se ett svar og ett tillatelsesbevisst endringssett.
Det er et godt mønster. Det er også et nytt angreps- og revisjonsflate: hvilken modell så koden, hvilken så bare review-konteksten, og hva som gikk til hvilken leverandør.
Hva norske ledere bør gjøre
Ikke slå på HydraFusion i produksjonsrepoer med hemmeligheter fordi en intern Microsoft-ingeniør synes resonneringen er «på nivå med Opus». Det er en research preview.
Gjør tre ting. Sett modellpolicy før noen slår på /experimental: hvilke leverandører kan se kildekode, og om cascade/critique får krysse skygrenser. Krev at Copilot-admin kan vise kostnad per bein, ikke bare per «HydraFusion-kall». Og test content exclusions. GitHub har samtidig gjort content exclusions GA i Copilot-appen og CLI; det er relevant nettopp fordi sammensatte agenter ellers kan sende sensitiv kode til flere modeller enn brukeren tror.
HydraFusion er GitHubs første tydelige veddemål på at neste løft i kodeagenter kommer fra orkestrering, ikke fra å velge «beste modell» én gang. For CIO og CISO er spørsmålet det samme som for all agentdrift: hvem styrer ruten, hvem betaler for hvert bein, og hvem kan slå av flyten når den tar feil.
Kilder og medier
Primærkilde: GitHub, «Project HydraFusion: Frontier quality via multi-model orchestration», 4. september 2026, https://github.blog/ai-and-ml/github-copilot/project-hydrafusion-frontier-quality-via-multi-model-orchestration/
GitHub Changelog, «GitHub Copilot weekly releases — August 31», 4. september 2026, https://github.blog/changelog/2026-09-04-github-copilot-weekly-releases-august-31/
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.