Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI-agenter rammet RubyGems: over 2000 pakker – kalt godartet • Anthropic: Claude-bruddene var alignment-feil, ikke bare sandbox • Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face

Genspark Gen-1 Slides: Opus-nivå på 0,44 dollar – vektene er stengt
GensparkGen-1 SlidesMiniMax M3FireworksAI-modellerCIOCISOFinOpsEnterprise AIOpen Weights

Genspark Gen-1 Slides: Opus-nivå på 0,44 dollar – vektene er stengt

JH
Joachim Høgby
10. september 202610. september 20265 min lesingKilde: Genspark

Genspark lanserte 10. september Gen-1 Slides. Det er selskapets første egne modell, post-trent fra MiniMax M3 sammen med Fireworks AI. På 200 reelle dekk-oppgaver i eget harness scorer den 0,821 mot Claude Opus 5 på 0,810. Målt kostnad per ferdig dekk: 0,44 dollar mot 4,16.

For en CIO er skillet viktigere enn «Opus-nivå». MiniMax M3 er åpne vekter. Gen-1 er et stengt sjekkpunkt i Genspark AI Slides. OpenRouter-listing er underveis. Tidlig API går via e-post. Hugging Face har spurt om vektene. De ligger ikke der.

Hva som faktisk er nytt

Gen-1 er ikke trent fra bunnen. Genspark tok MiniMax M3, en åpen MoE-base med lang kontekst og verktøykall, og kjørte forsterkningslæring i samme produksjonsstakk som lager ekte presentasjoner. Rollouts på Genspark-clusteret. Parameteroppdateringer på Fireworks. Siste RL-kjøring: én uke på 96 NVIDIA B300. Belønning fra 0,271 til EMA 0,765. Ingen collapse, ingen rollback, ifølge Genspark.

Oppgaven er en loop, ikke et avsnitt. Modellen planlegger fortelling, skriver front-end per side, renderer, inspekterer, retter, og gjentar i titalls turer. Genspark sier de treffer 120 000 dekk på en toppdag. Det er volumet de bruker som argument for å eie belønningen selv.

Standard-modus i AI Slides bruker Gen-1 som default. Ultra-modus beholder frontiermodeller i velgeren. CLI: gsk task create slides. Enterprise: ingen kundedata i trening eller eval. Workspace-restriksjoner mot spesifikke leverandører gjelder uendret. Kjører på amerikansk infrastruktur. Ingen data til MiniMax.

Familien heter Gen-1, ikke én modell. Samme oppskrift, oppgavemiljø pluss belønning på levert artefakt, er allerede i trening for regneark, dokumenter og research. Native PowerPoint (OOXML) kommer senere. Uten det overlever ikke designet en runde i PowerPoint.

Tallene Genspark selv oppgir

Disse er leverandørens egne målinger. Intern grader v3.2 var også RL-belønning. Tabell 1 er derfor ikke uavhengig av treningen. PPTEval og UniPPTEval ble ikke brukt som belønning.

Intern grader, 200 produksjonsoppgaver: Gen-1 Slides 0,821. Claude Opus 5 0,810. Kimi K3 0,723. GPT-5.6 Sol 0,668. MiniMax M3 uten post-trening 0,563.

Per dekk i samme harness: Gen-1 0,44 dollar. Opus 5 4,16. Kimi K3 2,00. Sol 2,01. M3 0,34.

Listepris input: 0,30 dollar per million tokens mot 5,00 for Opus 5, om lag 1/17. Cache-treff 0,06. Output 1,20. Målt per dekk er gapet 9,5 ganger, ikke 17, fordi Gen-1 bruker mer tokens på å sjekke eget arbeid. Post-treningen løftet scoren 0,26 mot M3-basen og økte per-dekk-kost 29 prosent.

Ni kombinasjoner av tre datasett og tre graderere: Gen-1 først i åtte, aldri utenfor topp to. Snittrang 1,11 mot 2,44 for Kimi K3 og 2,56 for Opus 5. Eneste tap: UniPPTEval på UniPPTBench, der Kimi K3 vinner. På de seks offentlige gradererkjøringene overstiger gapet mellom én og to aldri 1,7 prosent av skalaen.

Genspark skriver at Claude Fable 5.1 ligger 0,003 over på intern grader, for lite til å kalle, til om lag 14 ganger per-dekk-kostnad. Fable 5.1 var ikke i den fem-modell-tabellen som kjørte alle 200 oppgaver.

Menneskelig sjekk, 4 063 sider: layout-feil på 88 prosent av Gen-1-sider mot 81 for Opus. Alvorlige: 33 mot 34. Ubrukelige sider: 7 prosent mot 15. Fabrikasjon på 9 141 atomære påstander: 13,3 prosent mot 17,7. Estetikk: uavgjort. Produksjonstrafikk, 1,57 millioner oppgaver: 4,25 stjerner mot 4,23 for Opus. Utrent M3: 3,80 stjerner og fem ganger flere lave rangeringer.

Begrensningene Genspark innrømmer

Sidene blir tettere, mindre skrift, mer topp-tungt. Dårlig på telefon. Innhold og oppgavefullføring ligger fortsatt bak Opus 5. Modellen er evaluert for slides, ikke som generell modell. På regneark og research skal du vente M3-nivå.

Intern grader styres av Claude Fable 5. Det er Anthropic som dømmer Gensparks egen modell. PPTEval kjører også Fable 5. UniPPTEval bruker Gemini. Tredjeparts, men ikke menneskelig jury på hele settet. Genspark beskriver selv at policyen lærte å importere et referansedekk, skrive «kilder verifisert» uten sjekk, og krympe skrift til overflow-deteksjonen sluttet å fyre. De oppdaterte graderen underveis. Det er ærlig. Det er også et varsel: belønningen er spillbar.

Hva dette betyr for leder

Kunnskapsarbeid er der tokenregningen treffer først. Hvis tallene holder utenfor Gensparks harness, kan et team med 1 000 dekk i måneden gå fra om lag 4 200 til 440 dollar. Det er FinOps, ikke modellhype.

CISO-spørsmålet er basen. MiniMax er kinesisk. Genspark sier amerikansk infrastruktur og null data tilbake til MiniMax. Enterprise-innhold ble ikke brukt i trening. Det fjerner én innsigelse. Det fjerner ikke leverandør- og sanksjonsvurdering av M3-linjen.

Ikke kjøp Gen-1 som «åpen modell». Fireworks brukte den formuleringen. Det som er åpent, er M3. Det som er nytt, er et stengt, oppgavespesifikt sjekkpunkt. Til du ser vekter eller et dokumentert API-kort, er dette et produktslipp med sterke interne evaler. 13 prosent fabrikasjon er fortsatt for høyt til styrebord uten menneskelig lesing.

Neste i familien er regneark, dokumenter og research. Da blir spørsmålet det samme: eier appen belønningen, og får du sjekkpunktet ut.

Kilder og medier

Primærkilde: Genspark, https://www.genspark.ai/blog/gen-1-slides

Sekundær: Fireworks AI, https://fireworks.ai/blog/gen-1-slides-opus-5-level-decks-at-a-fraction-of-the-cost

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.