Muse Realtime Avatar: 870 ms – 12 sesjoner per GB200, ikke API
Meta slipper 23. september 2026 Muse Realtime Avatar. Det er en ny sanntids videomodell som gjør Muse Realtime Voice om til en levende avatar. Referanse kan være portrett, helkroppsillustrasjon, dyr eller gjenstand. Ut: 448×768 portrettvideo ved 25 bilder i sekundet. Ca. 870 millisekunder fra slutt på brukerens tur til første byte med synket stemme og video. 12 samtidige videosesjoner på én NVIDIA GB200. Ingen offentlig API. Ingen åpne vekter. Muse er 18+. For CIO er dette et ansikt på en forbrukeragent, ikke en enterprise-videotjeneste. For CISO er det syntetisk identitet i sanntid: Meta merker rammene med Video Seal, og tester selv mot Runway Characters og HeyGen LiveAvatar i samtaler på to til tre minutter.
Hva Meta faktisk lanserer
Forskningsbloggen kaller det «state-of-the-art embodiment technology». Det konkrete: Muse Realtime Voice og Muse Realtime Avatar er ett strømmesystem. Voice lager vektorkvantiserte tale-tokens som bærer både innhold og prosodi. En lyddekoder gjør tokens om til tale. Avatar-modellen, en lydstyrt diffusion transformer, spiser samme token-strøm pluss referansemedia og et rullende vindu av nylige video-latenter. Deling av strømmen skal holde leppebevegelse, tempo og mimikk i takt uten etterbehandling.
Modellen genererer korte kausale biter. Når en bit er ferdig, blir de nyeste latentene bevegelseskontekst for neste. Fast kontekstvindu holder regnestykket begrenset, slik at samtalen kan vare. Connect-keynoten 23. september viser produktet rundt modellen: videochat med en personlig Muse-avatar, Mac som agenten skal kunne styre, egen e-postadresse «snart», Muse på briller «i månedene som kommer», og nøkkelringen Charm til jul. Det er produkt. Modellen er Avatar-stakken.
120 evalueringer blir 2
Læreren er for dyr for live. 40 diffusjonssteg med treveis classifier-free guidance: tre modellpass per steg, 120 evalueringer per videobit. Eleven er kausal, uten guidance, to evalueringer per bit. Meta kaller det 60 ganger færre nevrale evalueringer.
Oppskriften er self-forcing, slik at eleven trener på egen generert kontekst og motstår drift når små feil hoper seg opp, pluss distillasjon som overfører både lærerens fordeling og effekten av CFG. Meta sier menneskelige vurderere valgte lærer og elev omtrent like ofte. Det er Metas egen test, ikke en uavhengig lab.
På GB200: hvert steg lager åtte rammer, 320 ms avspilling, på 20 ms. Effektivt 2,5 ms modelltid per ramme. Firebits quantization-aware training, fused kernels, CUDA Graphs, cache-aware ruting og latenstyrt batching. Meta sier 8 ganger mer kapasitet enn to-stegs BF16-baselinjen. Tallene er for GB200. Ingen tall for H100, A100 eller forbruker-GPU.
Preferanse Meta selv rapporterer
Live mot Runway Characters og HeyGen LiveAvatar, hver i sitt eget live-produkt. Matchede identiteter. To til tre minutter. Dimensjoner: visuell kvalitet, synk, karakterkonsistens, manerer. Meta rapporterer 78 prosent preferanse mot Runway og 88 prosent mot HeyGen. Manerer mot Runway var ikke statistisk skilt fra likhet. Uavhengig test over lengre samtaler, andre identiteter og annet nett mangler.
Det som ikke følger med
Ingen modellvekter. Ingen Meta Model API for Avatar. Ingen SLA, DPA eller provisioned throughput. Tilgang er Muse-appen, 18 år og eldre. Alle rammer får usynlig Meta Video Seal uten ekstra latenstid, ifølge bloggen. Du kan ikke audittere merkingen. Eksemplene i bloggen «illustrerer modellkapasitet» og er ikke alle tilgjengelige i appen.
CIO: ansikt er ikke kontroll
Muse Spark er agentmodellen. Avatar er innkapslingen. Et ansikt øker tillit og tid foran skjermen. Det endrer ikke at Mac-agenten kan styre skrivebordet, at e-postadresse kommer, og at Stripe, Shopify, PayPal og butikk-koblinger er del av Connect-pakken. For norsk virksomhet: dette er forbruker-Muse. Ikke sett det i samme kurv som en avtalt videotjeneste. Hvis ansatte bruker Muse privat på jobbmaskin, er det samme klasse risiko som forrige 0-dag i Mac-agenten, bare med et ansikt foran.
CISO: syntetisk identitet i 870 ms
Hvilket som helst referansebilde kan bli en pratende kropp. Det er dypforfalskning som produkt, merket av leverandøren. Video Seal er sporbarhet Meta kontrollerer. Det er ikke en kontroll du eier. Sosial manipulering blir lettere når agenten har mimikk og kan sitte i video. Behandle live Muse-avatar som syntetisk media i policy. Forby bruk mot kunder og i intern kommunikasjon inntil dere har et ja eller nei på merking, logging og 18-årsgrensen. Ikke stol på Metas 2–3-minutters preferansetest som sikkerhetsbevis.
Hva du gjør nå
Ikke kjøp Avatar som enterprise-video. Den finnes ikke som API. Kartlegg om ansatte kjører Muse på Mac med datamaskin-tilgang. Skill produktløfter (briller, Charm, e-post) fra modellfakta (870 ms, 12 sesjoner per GB200, 60× kutt). Vent på uavhengig eval før dere sammenligner med Runway og HeyGen. Sett syntetisk videochat på CISO-lista sammen med stemmekloning.
Kilder og medier
Primærkilde: Meta, https://research.meta.ai/blog/bringing-your-muse-to-life
Connect-dekning og produktkontekst: TechCrunch og The Verge. Offisiell tråd: AI at Meta på X, https://x.com/AIatMeta/status/2102997291732766943
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.