Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face • Bloomberg: NVIDIA-kunder varsles om over 15 prosent prishopp på AI-servere • OpenAI kutter GPT-5.6 Sol mer enn 20 prosent – i tre måneder

Google gjør tegnspråk til mobilgrensesnitt med SL2T

JH
Joachim Høgby
13. august 202613. august 20265 min lesingKilde: Google DeepMind

Google DeepMind har lansert SL2T, en sign-language-to-text-modell som gjør amerikansk tegnspråk om til engelsk tekst i Gboard og Live Transcribe på Pixel 11. Det høres smalt ut. Det er det ikke. Dette er en modellnyhet som peker rett inn i neste fase av AI i virksomheter: ikke flere chatbot-vinduer, men nye inputflater der kamera, kropp, språk, privatliv og produktdesign flettes sammen.

Det konkrete først: SL2T oversetter tegnspråk til tekst. Ved lansering gjelder det ASL til engelsk, først på Pixel 11, med flere enheter og språk senere. Brukeren kan signere der hun ellers ville skrevet: søk, meldinger, dokumenter, korte assistentkommandoer og enkle samtaler via Live Transcribe. DeepMind sier modellen er trent på over 100.000 timer tegnspråkdata på tvers av mer enn 50 tegnspråk, med omtrent en fjerdedel i ASL.

Det viktige for CIO-er og digitale ledere er at Google ikke presenterer dette som en demo. SL2T er inne i forbrukerprodukter. Det er den terskelen mange AI-lanseringer aldri kommer over. Når en modell flytter fra paper til tastatur og tilgjengelighetsapp, endres risikobildet. Da handler ikke evaluering bare om benchmarkscore, men om latency, feilmodus, brukerens kontroll, dataminimering, støtteflyt, opplæring og hvilke situasjoner systemet eksplisitt ikke skal brukes i.

SL2T løser ikke tegnspråk ved å lage en enkel ord-for-ord-maskin. Det er poenget. Tegnspråk er egne språk med grammatikk, romlig struktur, ansiktsuttrykk og samtidige bevegelser. DeepMind beskriver derfor modellen som maskinoversettelse, ikke transkripsjon. Systemet bruker MediaPipe Holistic på enheten til å trekke ut 2D-landemerker for ansikt, kropp og hender. Råvideoen blir ikke sendt som hovedinput til oversettelsen; serveren får geometriske koordinater som modellen oversetter til tekst. Det er et bevisst personvernvalg, men ikke magi. Landemerker kan fortsatt være sensitive, og modellen mister noe kontekst som råvideo kunne gitt.

Benchmarken er likevel sterk nok til at dette fortjener oppmerksomhet. DeepMind oppgir 70 BLEURT zero-shot på FLEURS-ASL sd-test, samt egne tall for enhåndssigning, PRESTO-ASL og fingerspelling. Det er interessant fordi produktet må fungere i nettopp den rotete virkeligheten modellen skal møte: en bruker holder telefonen med én hånd, tegn skjer raskt, kameraet er ikke perfekt, og venstrehendte signere må ikke behandles som kanttilfeller.

For ledere er dette et bra eksempel på hva «produksjonsklar AI» faktisk betyr. DeepMind skriver at de har jobbet med streaming-latency, hallucination på ikke-signering, rettferdighet for venstrehendte og enhåndsbruk. Det er kjedelige detaljer. Derfor er de viktige. En modell som ser imponerende ut på en scene, kan feile brutalt når en person går inn i kamerabildet, når brukeren pauser, eller når språket bærer mening i ansikt og kropp samtidig.

Google har også publisert en felles impact-rapport med AI Sign Language Advisory Committee. Den setter tydelige grenser. Bruksområdene er lavrisiko: meldinger, diktering, søk, assistentkommandoer og uformelle én-til-én-samtaler. Medisinske, juridiske, akademiske og andre høyrisikosituasjoner er eksplisitt utenfor scope. Dette er en mal flere AI-leverandører burde kopiere. Ikke fordi den fjerner risiko, men fordi den gjør produktkontrakten synlig.

Den kontrakten er særlig relevant for norske virksomheter som bygger AI inn i kunde- og ansattflater. Det holder ikke lenger å spørre hvilken modell som scorer høyest. Man må spørre: Hvilke inputdata behandles? Hvor skjer prosesseringen? Hva beholdes? Hva forkastes? Hvilke feil er forventet? Hvilke brukstilfeller er forbudt? Hvem er i loopen når modellen tar feil?

SL2T viser også hvor tilgjengelighet er på vei. AI-tilgjengelighet har ofte vært ettermontert: teksting, skjermlesere, oversettelse og assistanse rundt eksisterende grensesnitt. Her blir tilgjengelighet selve grensesnittet. Det gjør saken strategisk. Når ansatte, kunder eller innbyggere kan bruke egen modalitet direkte mot digitale tjenester, flytter man både adopsjon og ansvar.

Det er samtidig lett å overselge dette. SL2T støtter ikke alle tegnspråk. Den starter med ASL til engelsk. Den er ikke en erstatning for tolk i høyrisikosituasjoner. Den er heller ikke fri for feil. Impact-rapporten peker på begrensninger i landemerke-representasjonen, blant annet at enkelte artikulatorer og miljøkontekst ikke fanges godt nok. Brukeren må derfor kunne lese, kontrollere og redigere teksten før den brukes videre.

Den praktiske lederlesningen er enkel: Dette er ikke «enda en modell». Det er et tidlig bilde av AI som infrastruktur for menneskelige grensesnitt. Virksomheter som har tung kundeservice, offentlig kontakt, helse, utdanning, retail eller feltarbeid bør følge dette tett. Ikke for å kjøpe Pixel 11 i bulk i morgen, men for å forstå hvordan kravene til AI-produktstyring endres når input ikke lenger bare er tastatur og tale.

Min vurdering: SL2T er viktigere som produktmønster enn som generell språkmodell. Den viser hvordan en lab kan kombinere modell, mobilplattform, dataminimering, community-governance og tydelig bruksavgrensning i én lansering. Det er akkurat den typen disiplin mange enterprise-AI-programmer mangler.

Neste steg for Google blir å bevise robusthet over tid, flere språk, flere enheter og tydeligere API-/plattformtilgang uten at styringen glipper. Neste steg for ledere er å bruke saken som sjekkliste: Hvis vår AI møter mennesker i en ny modalitet, har vi like tydelige grenser, feilmodeller og bruker-kontroll som dette? Hvis svaret er nei, er modellen kanskje ikke problemet. Produktstyringen er det.

Kilder og medier

Primærkilde: Google DeepMind, «Putting sign language AI into users’ hands» — https://deepmind.google/blog/putting-sign-language-ai-into-users-hands

Supplerende kilde: Google DeepMind / AISLAC, «Joint Impact Report for SL2T 1.0» — https://storage.googleapis.com/deepmind-media/DeepMind.com/Blog/putting-sign-language-ai-into-users-hands/aislac-joint-impact-report-for-sl2t-1-0.pdf

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.