Upstage lanserer Solar Pro 4 for agentarbeid som faktisk må bli ferdig
Upstage har lansert Solar Pro 4, en proprietær reasoning-modell bygget for agentarbeid: lange dokumenter, terminaloppgaver, verktøykall og leveranser som skal kunne sendes videre uten at et menneske må rydde opp i hvert mellomledd.
Det er en annen type modellnyhet enn de store frontier-lanseringene fra OpenAI, Anthropic, Google eller xAI. Solar Pro 4 prøver ikke å vinne hele verden på generell intelligens. Den prøver å eie et mer praktisk felt: kontorarbeid, analyse, dokumentgjennomgang og agentflyter der modellen må lese, gjøre, verifisere og stoppe når grunnlaget ikke holder.
For ledere er det nettopp her mye av den reelle verdien og risikoen ligger. De fleste virksomheter trenger ikke bare en modell som svarer pent i chat. De trenger modeller som kan gjennomføre arbeidsstykker på tvers av filer, policyer, systemer og godkjenningspunkter. Da er spørsmålet ikke bare «hvor smart er modellen?», men: fullfører den, holder den orden på kildene, bruker den verktøy riktig, og klarer den å si nei når dokumentene ikke støtter svaret?
Upstage beskriver Solar Pro 4 som «The Agentic Model That Finishes the Job». Modellen støtter 512K kontekst og opptil 128K output tokens, og er tekst-inn/tekst-ut. Den er laget for engelsk, koreansk og japansk, og API-prisingen er oppgitt til 0,30 dollar per million input tokens, 1,20 dollar per million output tokens og 0,06 dollar for cached input. Under lanseringen kjører Upstage 90 prosent rabatt via egen konsoll og OpenRouter.
Det viktigste er likevel hva modellen er optimalisert for. Upstage trekker frem Terminal-Bench v2.1 på 57, τ³-Banking på 23 og AA-LCR på 71. Det er ikke perfekte tall, men de peker mot samme retning: modellen er sterkere der oppgaven ligner arbeid, ikke eksamen. Terminal-Bench måler evne til å utføre flertrinnsjobber i et faktisk shell. τ³-Banking måler policyhenting og verktøybruk i samtaler over flere runder. AA-LCR handler om resonnering over lange dokumenter.
Artificial Analysis sin uavhengige gjennomgang gir et mer nøkternt bilde. Solar Pro 4 scorer 42 på deres Intelligence Index, kraftig opp fra Solar Pro 3 på 14. Største sprang kommer på agentiske og lange kontekster: Terminal-Bench går fra 12 prosent til 57 prosent, AA-LCR fra 31 til 71 og τ³-Banking fra 9 til 23. På GDPval-AA v2, som tester reelle arbeidsleveranser, går modellen fra Elo 498 til 1277 og passerer den menneskelige baseline på 1000.
Men dette er ikke en gratis seier. Artificial Analysis peker også på treghet og verbositet. Solar Pro 4 bruker rundt 43 000 output tokens per Intelligence Index-oppgave, mindre enn Solar Pro 3, men fortsatt mye. Gjennomsnittlig oppgavetid i testen er 8,6 minutter, opp fra 6,0 for forrige generasjon. Kort sagt: dette ser ut som en modell for arbeid som får lov til å ta litt tid, ikke for lavlatens kundedialog.
Den mest interessante delen er Upstage sin vektlegging av «ikke verifiserbart». Selskapet skriver at Solar Pro 4 er bygget for å si at noe ikke kan verifiseres, i stedet for å fylle hullene med plausible påstander. I eksemplet deres får modellen en tjenesteavtale og et tilbud, og må skille mellom klausuler som faktisk finnes, klausuler som mangler, og tall som er ulike mellom dokumentene. Det er akkurat den typen adferd virksomheter bør kreve før agentarbeid får bevege seg nær økonomi, kontrakter, compliance eller kundedata.
For CIO og CISO er læringen enkel: agentmodeller må evalueres på oppgavekjeder, ikke bare svar. Hvis en modell skal lage Excel-arbeidsbok, rapport og presentasjon fra samme datasett, må tall overleve fra første til siste leveranse. Hvis den skal tolke kontrakter, må den kunne vise hvor svaret kommer fra. Hvis den bruker interne verktøy, må den kunne holde policy og handlingsnivå fra hverandre.
Solar Pro 4 er også et signal om at modellmarkedet blir mer spesialisert. Upstage har Solar Open 2 for åpne vekter og egen drift, mens Solar Pro 4 er API-modellen for tyngre kommersielle agentløp. Det speiler en bredere trend: én modell trenger ikke være best på alt. Bedrifter vil ende med en portefølje av modeller, der noen er raske, noen billige, noen suverene, noen åpne, og noen er best på å fullføre komplekse arbeidsstykker.
Bør norske virksomheter hoppe på Solar Pro 4 direkte? Ikke blindt. Den er proprietær, tekstbasert og foreløpig ikke en full multimodal arbeidsmodell. Den bør testes mot egne dokumenter, egne policyer og egne verktøysløyfer før den får produksjonstillit. Men den er verdt å merke seg fordi Upstage angriper et konkret enterprise-problem: ikke flere demoer, men færre halvferdige agentløp.
Den praktiske testen blir derfor brutal og enkel: gi modellen en virkelig arbeidsmappe, et sett med regler, et verktøy den må bruke, og et resultat som kan kontrolleres. Mål fullføringsgrad, feil i mellomregning, kildebruk, kostnad per ferdig jobb og hvor ofte den stopper riktig. Hvis den vinner der, er den interessant. Hvis den bare skriver langt og selvsikkert, er den bare enda en modell med slips.
Kilder og medier
Primærkilde: Upstage — https://www.upstage.ai/blog/en/solar-pro-4 Verifisering: Artificial Analysis — https://artificialanalysis.ai/articles/upstage-solar-pro-4 Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.