Tavus Griffin: 26 av 54 – 10 sek stemme, stengt for kunder
Tavus i San Francisco slipper 1. oktober Griffin, som laben kaller den første Human Interaction Model. Det som faktisk skippes er Griffin-Lite: en research preview for utvalgte testere. Kunder får den ikke. Pris er ikke publisert. Modellen er ikke på plattformen.
For CIO er dette ikke en innkjøpssak. Phoenix-4.5, Raven-1 og Sparrow-2 er fortsatt det 150 000 utviklere og virksomheter kan bygge PAL-er på. For CISO er tre tall viktigere enn merkenavnet HIM: 26 av 54 i labens egen ettminuttsstudie trodde partneren var et menneske, stemmen klones fra om lag 10 sekunder lyd, og hele videorammen lages fra ett referansebilde.
Hva Tavus faktisk slipper
Griffin er full-dupleks video-til-video. Percepsjon, beslutning om når og hvordan den skal svare, og generering av tale og bilde kjører samtidig. Laben setter det opp mot kaskader som først transkriberer, så kjører et språkmodell-svar, så TTS og avatar. Hver overlevering kaster tone, blikk og det som er i kamera.
Systemet har to deler. En Continuous Conversational Modeling-motor leser innkommende lyd og video og sender kontrollsignaler for timing, holdning, mimikk og gest. En Audio-Visual Generation-motor gjør signalene om til strømmende tale og video. Beslutningene tas i mini-turer under ett sekund, ikke når du er ferdig med setningen. Tavus skriver at tidslinjene i diagrammene er illustrative og ikke målt fra en ekte økt.
Video: 720p i 320 ms-biter, 25 bilder per sekund, ett latent om gangen fra ett referansefoto. Laben sier hele scenen genereres, ikke bare ansiktet: stol, skygger og bakgrunn. Lyd-til-video-forsinkelse: 0,43 sekunder i snitt på H100, ifølge Tavus, halve tiden mot neste raskeste metode de sammenlignet. Tale: autoregressiv diffusjonstransformator som kloner stemme fra om lag 10 sekunder. Infrastruktur bak previewen: Baseten, Daily og Cerebrium. Forskning med Queen Mary University of London.
Griffin-Lite er ikke i API. Tavus skriver at den kommer når de har løst sikker utgivelse. Inntil da er det Phoenix som lager ansiktet, Raven som ser, og Sparrow som vet når den skal snakke.
Tallene som skal bære påstanden
Tavus kaller Griffin «the first model to pass the real-time, video Turing test». Det er labens egen formulering. Studien er deres.
Protokoll: deltakere rekruttert via en «uavhengig forskningsplattform» som ikke navngis. De fikk vite at de skulle snakke med en annen deltaker i ett minutt om hva de gledet seg til i år. Partneren var en PAL på Griffin-Lite. Først på slutten av undersøkelsen ble de spurt om det hadde slått dem at partneren kanskje ikke var et menneske. Alle fikk deretter vite at det var AI.
Resultat: 26 av 54 (48 prosent) sa at partneren var et menneske. Samme protokoll på Phoenix-4.5 + Sparrow-2 + Raven-1: 1 av 41 (2,4 prosent). De som sa menneske, oppga 79 prosent sikkerhet. De som sa AI, 81 prosent. De som tvilte, tvilte som regel innen 20 sekunder. Samtalen fikk 4,9 av 7 for flyt, laveste delscore Tavus trekker fram. Ingen utenforstående evaluator. Ingen egen artikkel med full metode. Ett minutt er kort. Deltakerne ble primet til å tro at partneren var et menneske. Ikke les 48 prosent som at Griffin passerer en standardisert Turing-protokoll.
NVIDIA VideoFDB er den uavhengige delen. Benchmarken har 237 klipp fra ekte videosamtaler, 11 nonverbale dynamikker, og en språkmodell-dommer 0–5. NVIDIA scorer selv. Percepsjon (leser personen): Griffin Lite 3,73 mot menneske 4,20. MiniCPM-o 4.5 ligger på 3,40. Gemini 2.5 Flash Native 3,17. OpenAI gpt-realtime 2,75. Generering (egen stemme og ansikt): Griffin Lite 3,83 mot menneske 3,92. Neste system, Gemini 2.5 + Anam, 2,80. NVIDIA scoringsdato: september 2026.
Latens er motvekten. På percepsjonssporet er median svartid 2 232 ms for Griffin Lite mot 1 400 ms for menneske og 720 ms for MiniCPM-o 4.5. På genereringssporet: 1 892 ms mot 900 ms for menneske. TOR-alignment 62,8 prosent på generering, best i klassen der, men ikke menneskelig tempo. Tavus’ 0,43 sekunder på H100 er labens eget lyd-til-video-mål for generatoren, ikke NVIDIAs median for hele agenten. Bland ikke de to.
Hva leder og CISO skal gjøre med det
Tavus skriver det selv: de samme egenskapene som gjør HIM-er til naturlige grensesnitt, lar dem lure et menneske til å tro at det ikke er AI. Derfor holder de Griffin-Lite unna kunder, jobber med «safe disclosure features» og med organisasjoner som jobber med AI-sikkerhet. Hva disclosure faktisk er, står ikke. Ingen DPA, ingen region, ingen EØS-geo, ingen lagringstid.
CISO-listen er konkret. Video-KYC, ansettelsesintervju på kamera, banksamtale med «rådgiver», og CEO-svindel over video. Ett stillbilde plus 10 sekunder lyd er nok til å kjøre en live scene, ifølge laben. Eksisterende PAL-stack (Phoenix, Raven, Sparrow) er allerede i produksjon hos 150 000. Griffin er farligere fordi den ikke venter på tur og reagerer på det den ser. Inntil disclosure er spesifisert og testet av andre enn Tavus, er dette en trusselmodell, ikke en leverandør.
CIO skal ikke budsjettere Griffin. Preview krever søknad. «Very soon» etter sikkerhetsarbeid er ikke en dato. Brukstilfellene Tavus peker på (tutor som ser at forklaringen ikke sitter, øving på en vanskelig samtale, kunde som holder en ødelagt del opp i kamera) er salgsargumenter for PAL-plattformen som allerede selges, ikke for en modell du kan kjøpe 2. oktober.
Hvis du likevel tester Griffin-Lite: krev at motparten merkes som AI i bildet, ikke bare i vilkår. Ta opp. Ikke bruk den mot ekte kunder, søkere eller pasienter. Sjekk om identitetsleverandøren din fortsatt stoler på ett minutt live video.
Kilder og medier
Primærkilde: Tavus, «Griffin: The First Human Interaction Model», 1. oktober 2026: https://www.tavus.io/griffin
Uavhengig eval: NVIDIA, VideoFDB-leaderboard: https://research.nvidia.com/labs/amri/projects/video-fdb/
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.