StepFun slipper StepAudio 3: AA-duplex 98,9 – 8,8 s til første lyd
StepFun, kjent som 阶跃星辰, slapp 15. september 2026 fem nye lydmodeller under navnet StepAudio 3. Realtime, ASR Max, TTS, Gen og Music er i åpen plattform og API samme dag. Realtime og Chat er merket preview og tidsbegrenset gratis.
For CIO og CISO er dette ikke «nok en kinesisk stemmemodell». Det er en full stack mot Google Gemini 3.8 Live og OpenAI GPT-Live-1: native full dupleks, tenking mens den snakker, og asynkrone verktøykall. Tallene som selger saken er Artificial Analysis. Tallet som avgjør produksjon er 8,83 sekunder til første lyd.
Hva som faktisk er lansert
Modell-ID-ene er stepaudio-3-realtime-preview, stepaudio-3-chat-preview, stepaudio-3-asr-max, stepaudio-3-tts, stepaudio-3-gen-preview og stepaudio-3-music-preview. De tre preview-navnene er ikke permanente. StepFuns egen dokumentasjon sier at preview-versjonen tas ned når gratisperioden er over, og at en betalt versjon kommer i stedet. Hardkod preview-ID i produksjon, og dere får en bruddvarsel senere.
Realtime er flaggskipet for stemmeagenter. Den tar lyd eller tekst inn og gir lyd pluss tekst ut over WebSocket. Den skal håndtere avbrudd, tur-taking, fyllord og bakgrunnskall uten å kutte samtalen. Chat-varianten går via vanlige Chat Completions og svarer i tekst. ASR Max er transkripsjon. TTS er syntese. Gen lager tale, effekter, miljølyd og musikk i samme klipp. Music lager sanger, instrumental og cover.
Teknisk rapport på arXiv, datert 12. september, beskriver Realtime som en MoE på om lag 196 milliarder parametere totalt og 11 milliarder aktive per token. Språkryggraden er Step 3.7 Flash. Lydfronten er Audio Transformer-enkoderen fra Qwen3-Omni. Forhåndstrening: 32K sekvens og 1,2 billioner tokens. Midtraining utvider kontekst til 128K. Det er labens egne tall, ikke en uavhengig måling.
Språk er en hard grense. Realtime-endepunktet støtter kinesisk og engelsk. TTS og ASR oppgir også japansk, koreansk, fransk og spansk i preview. Norsk er ikke på lista.
Duplex-seier, indeks-hull, 8,8 sekunder
Artificial Analysis plasserer StepAudio 3 Realtime først på Conversational Dynamics med 98,9 prosent, foran Qwen Audio 3.0 Realtime Plus på 98,4, GPT-Live-1 (Sol, low) på 97,3 og Gemini 3.8 Live på 96,1. Samme modell leder Speech Reasoning med 99,7 prosent på Big Bench Audio, ifølge AA. Tabellen runder resonnering til 100 prosent.
Det som mangler, er like viktig. StepAudio 3 Realtime har ikke Speech to Speech Index-score hos AA. Indeksen krever resonnering, agentisk treff, arena-preferanse og oppgavefullføring. Uten de tre siste er duplex-gullet et delresultat, ikke en samlet seier mot Gemini 3.8 Live Extended Thinking (82,6) eller GPT-Live-1 Astra (81,5).
Latensen er synlig. AA måler 8,83 sekunder til første lyd på Big Bench Audio. Gemini 3.8 Live ligger på 1,18 sekunder. GPT-Live-1 ligger rundt 1,2–1,3. En kundesenteragent som venter nesten ni sekunder før den åpner munnen, taper samtalen uansett hvor pent den tar avbrudd etterpå. StepFuns eget API-notat sier at AA-tallene bygger på interne parameteroppsett, og at tjenesten kan avvike.
Labens egen τ-Voice-macro er 56,0 prosent i teknisk rapport. AA gir Qwen Audio 3.0 Realtime Plus 54,6 prosent agentisk treff og Gemini 3.8 Live Extended Thinking 68,6. Realtime leder altså på samtalerytme og lydresonnering, ikke på å løse kundesaker.
StepFun og kinesiske medier oppgir 1,7 prosent WER og delt førsteplass på AA sin ikke-strømmende ASR-liste for ASR Max. Internt hevder de 0,57 prosent feil på kontekstresonnering, mot 1,59 på StepAudio 2.5 ASR. Vi tar det som leverandørkrav til dere har kjørt egne saksnummer, legemiddelnavn og blandet norsk-engelsk.
Prisen er preview, inntil den ikke er det
Realtime og Chat er tidsbegrenset gratis. TTS koster 0,36 dollar per 10 000 tegn, mot 0,85 for 2.5 TTS. Stemmekloning er 1,50 dollar per stemme. ASR Max koster 0,24 dollar per time, mot 0,022 for 2.5 ASR. Ti ganger prisen for «forståelse», ikke bare transkripsjon. Gen og Music er gratis i en periode.
For FinOps: en gratis preview-linje uten timepris er ikke en kostnadsmodell. Den er en frist til å bygge mot et ID som skal vekk. Mål mot 2.5-prisene og mot Gemini 3.8 Live på 0,005/0,018 dollar per minutt inn/ut, ikke mot null.
API-et ligger på api.stepfun.ai. Det er kinesisk sky, ikke EØS. Databehandleravtale, underleverandører, logglagring og overføring ut av EØS er åpne spørsmål i dokumentasjonen vi har sett. CISO skal behandle dette som tredjeland inntil juristene har en avtale, ikke som «OpenAI-kompatibel base URL, ferdig».
Det finnes ikke et frontier safety-modellkort i Google-stil for denne sluppen. Papiret er CC BY-NC-ND. Vektene er stengt. Dette er API, ikke noe dere hoster selv.
Hva dette betyr for ledere
Ikke bytt Gemini 3.8 Live eller GPT-Live-1 i produksjon på bakgrunn av duplex-listen. Bruk StepAudio 3 Realtime som kontrollarm på kinesisk og engelsk stemmeflyt: avbrudd, fyllord, verktøykall. Mål tid til første lyd på deres egne samtaler, ikke på AA-raden alene.
Ikke hardkod *-preview. Lag et modell-ID-lag, og krev skriftlig varsel før gratisperioden slutter. ASR Max inn i møtereferat og fagspråk bare etter feilrate på deres termer. TTS og kloning inn i kommunikasjons- og personvernvurdering før kundestemme.
Norske flater faller utenfor Realtime-språklisten. En intern IT-bot på bokmål er ikke use case. En engelsk eller kinesisk supportlinje kan være det, hvis data får lov å ligge i Kina.
Sett StepFun på leverandørkartet som lydspesialist, ikke som ny default for stemmeagenter i Norden. Gemini tok Search Live og Enterprise-preview 15. september. StepFun tok duplex-listen samme dag. Produksjon vinner den som svarer før kunden legger på.
Kilder og medier
Primærkilde: StepFun, Audio Models, https://platform.stepfun.ai/docs/en/guides/models/audio
StepFun, StepAudio 3 Realtime, https://platform.stepfun.ai/docs/en/guides/models/stepaudio-3-realtime
StepFun, pris og rate limits, https://platform.stepfun.ai/docs/en/guides/pricing/details
StepFun, offisiell X-kunngjøring, https://x.com/StepFun_ai/status/2099916376274313630
StepFun-Audio Team, «StepAudio 3 Realtime Technical Report», arXiv:2609.14005, https://arxiv.org/abs/2609.14005
Artificial Analysis, Speech to Speech, https://artificialanalysis.ai/speech-to-speech
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.