Spring til indhold
Mickey Liechtenstein
Blog

18. august 2026

AI-nyheder Automatisering & AI

AI kan nu oversætte tegnsprog direkte til tekst – og det er større, end det måske lyder

Google DeepMinds nye SL2T-model oversætter tegnsprog til tekst gennem telefonens kamera. Her er hvad den kan, hvor den fejler, og hvorfor den er interessant.

Mand bruger tegnsprog foran en smartphone, som viser live-transskription af tegnsproget til skrevet tekst
Tale er for længst blevet et førsteklasses input i vores digitale systemer. Tegnsprog har ikke været det — og det er præcis dét, der er ved at ændre sig.

Vi har efterhånden vænnet os til, at telefonen kan forstå, hvad vi siger. Vi dikterer beskeder. Vi taler til digitale assistenter. Vi får automatisk tekstet videoer. Og hvis tastaturet føles for langsomt, kan vi bare sige det højt.

Men den udvikling har i høj grad været bygget omkring talte sprog. For mennesker, der bruger tegnsprog som deres primære sprog, har der ikke eksisteret noget tilsvarende velfungerende inputlag.

Det er Google DeepMind nu begyndt at ændre på.

Den 12. august 2026 præsenterede Google DeepMind en ny model kaldet SL2T – sign-language-to-text. Modellen kan se tegnsprog gennem telefonens kamera og oversætte det direkte til skrevet tekst.

Og det mest interessante er egentlig ikke modellen i sig selv. Det er, at teknologien nu bevæger sig ud af laboratoriet og ind i almindelige produkter.

Forestil dig tale-til-tekst – bare med tegnsprog

Den første udgave understøtter amerikansk tegnsprog, ASL, til engelsk. Den er lanceret i Gboard og Live Transcribe på Pixel 11, og Google skriver, at flere enheder følger.

I stedet for at skrive en besked med fingrene på skærmen kan brugeren bruge tegnsprog foran kameraet. Telefonen omsætter derefter tegnene til tekst.

Tegnsprog bliver til tekst, som derefter kan bruges som helt almindeligt input — her til et spørgsmål til Gemini. Video: Google DeepMind

Det betyder eksempelvis, at brugeren kan:

  • skrive beskeder
  • lave websøgninger
  • skrive dokumenter
  • stille spørgsmål til Gemini
  • bruge tegnsprog som input i apps, hvor man normalt ville bruge tastaturet

Teknologien bruges også i Live Transcribe, hvor en døv bruger kan svare med tegnsprog i en samtale og få svaret omsat til tekst.

Det kan lyde som en relativt lille funktion. Men set fra et tilgængelighedsperspektiv er det noget andet. For tale er allerede blevet et førsteklasses inputformat i vores digitale systemer. Tegnsprog har ikke været det.

Tegnsprog er ikke bare “talt sprog med hænderne”

Det er samtidig en af grundene til, at problemet er vanskeligere, end man måske umiddelbart tror.

Et tegnsprog er ikke bare dansk, engelsk eller et andet talesprog, hvor hvert ord er erstattet af en bestemt håndbevægelse. Tegnsprog er selvstændige naturlige sprog med egen grammatik, ordforråd og struktur.

Betydning skabes desuden ikke kun med hænderne. Ansigtsudtryk, hovedets bevægelser, overkroppen, placering i rummet og bevægelsesmønstre kan alle være en del af sproget.

Derfor er opgaven heller ikke bare: “Genkend håndtegnet og find det tilsvarende engelske ord.” Systemet skal både forstå en kompleks visuel sekvens og derefter oversætte mellem to forskellige sprog.

Det er lidt mere ambitiøst end et kamera, der kan genkende et thumbs-up.

Mere end 100.000 timers tegnsprog

Ifølge Google DeepMind er SL2T trænet på mere end 100.000 timers data fra over 50 forskellige tegnsprog. Omtrent en fjerdedel af materialet består af amerikansk tegnsprog.

Pointen med at træne modellen på mange forskellige tegnsprog er blandt andet, at den kan lære nogle af de visuelle og sproglige strukturer, der går igen på tværs af datasættene. DeepMind oplyser, at deres flersprogede tilgang i egne eksperimenter har klaret sig bedre end modeller, der kun er trænet på ét tegnsprog.

Det er interessant af en anden grund. Den første produktversion er ganske vist ASL til engelsk. Men fundamentet er ikke bygget som en ren amerikansk specialløsning. Google siger selv, at flere tegnsprog skal følge.

Det betyder dog ikke, at vi har automatisk dansk tegnsprog-til-dansk på telefonen i morgen. Den nuværende produktversion er ASL → engelsk.

Kameraet sender ikke videoen videre

Diagram i tre trin: kvinde der tegner foran en telefon, derefter en skeletmodel af ansigt, krop og hænder, og til sidst den færdige tekst
Videoen bliver på telefonen. Det, der sendes videre, er koordinater for kroppens bevægelser — ikke billedet af personen.

Når man hører “AI'en filmer en person, der bruger tegnsprog”, dukker et andet spørgsmål ret hurtigt op: Hvad sker der med videoen?

Her har Google valgt en interessant arkitektur. Telefonen bruger en lokal model til at identificere en række punkter på brugerens ansigt, krop og hænder. Det, der sendes videre til oversættelsesmodellen, er altså ikke det fotorealistiske kamerabillede, men geometriske koordinater for kroppens bevægelser.

Selve videoen behandles på enheden og kasseres med det samme. Ifølge den tilhørende impact-rapport gemmer Google heller ikke logs over brugerens input eller output, medmindre brugeren specifikt har godkendt det i forbindelse med en evalueringsundersøgelse.

Nørdet detalje

Inputtet er 2D-koordinater for 130 punkter på ansigt, krop og hænder, udtrukket billede for billede med MediaPipe Holistic.

Det mere interessante valg er dog, at modellen oversætter direkte fra de koordinater til tekst. Tidligere arbejde med maskinoversættelse af tegnsprog har typisk gået vejen om et mellemled kaldet glosser — en slags skriftlig annotering af de enkelte tegn. Problemet er, at glosser dårligt indfanger de ikke-manuelle elementer og den rumlige brug, som er en del af sproget, og at de sætter en kunstig grænse for ordforrådet. Ved at springe mellemledet over kan kvaliteten i stedet skalere med mængden af data.

Det er et godt eksempel på en pointe, der bliver stadig vigtigere med AI: man behøver ikke altid sende alle rå data til AI'en, bare fordi man teknisk kan. Man kan ofte reducere data til det, modellen faktisk har brug for.

Der er stadig fejl

Og her er det værd at dæmpe AI-fanfaren en smule. SL2T er ikke en perfekt digital tegnsprogstolk. Google og deres rådgivende udvalg beskriver selv flere begrænsninger. Modellen kan blandt andet have problemer med:

  • sjældne og regionale tegn
  • tegn med flere mulige betydninger
  • hurtig fingerstavning
  • komplekse grammatiske konstruktioner
  • ansigtsudtryk og andre såkaldte non-manual markers
  • navne og forkortelser
  • dårlige lysforhold og kraftigt modlys
  • usædvanlige kameravinkler

Der er også observeret klassiske AI-problemer som hallucinationer, hvor systemet genererer tekst, der faktisk ikke blev tegnet. Ifølge impact-rapporten sker det blandt andet, hvis en ekstra person kommer ind i billedet, eller hvis den, der tegner, holder en pause for at samle tankerne.

En beslægtet fejltype har fået navnet “ghost text”: i tidligere versioner kunne det udløse tekst, hvis man lod hænderne blive stående i billedet efter en afsluttet sætning. Rapporten noterer samtidig, at tale efter tegnsproget stadig kan blive fejlagtigt transskriberet via mundaflæsning.

Det lyder måske mindre imponerende. Men jeg synes egentlig, det gør lanceringen mere interessant. For Google har ikke kun offentliggjort de flotte demoer. De har samtidig defineret områder, hvor teknologien ikke bør bruges.

Nej, den skal ikke erstatte en tegnsprogstolk på hospitalet

To personer sidder ved et bord med kaffe; den ene bruger tegnsprog, den anden holder en telefon, der viser den oversatte tekst
Uformelle samtaler i en butik eller på en café er præcis den type situation, den første version er designet til.

Den første version er specifikt udviklet til relativt uformelle situationer med lav risiko. Eksempelvis beskeder, søgninger, noter, navigation, sociale medier og korte samtaler i butikker, på restauranter eller på caféer.

Til gengæld beskriver Google DeepMind og deres rådgivende udvalg en række områder, hvor modellen udtrykkeligt ikke bør bruges som erstatning for en kvalificeret menneskelig tolk:

  • sundhedsvæsen, herunder konsultationer, akutbehandling og psykologisk rådgivning
  • juridiske forhold, politiafhøringer, retssager og vidneforklaringer
  • formel undervisning og evaluering, herunder eksamen og møder om specialundervisning
  • jobsamtaler, personalesager, tjenstlige samtaler og medarbejderudviklingssamtaler
  • offentlig sagsbehandling, hvor der træffes afgørelser om ydelser og rettigheder

Begrundelsen er ret enkel: en kvalificeret tolk gør mere end at oversætte ord. Der indgår kontekst, kultur, vurdering, afklaring og ansvar.

Udvalget peger samtidig på en risiko, der ikke er teknisk: at myndigheder og virksomheder kan fristes til at spare tolkeudgiften væk og lade en app træde i stedet. Det er værd at hæfte sig ved, at den bekymring står i Googles egen rapport.

SL2T er heller ikke designet som en fuld tovejstolk. Den oversætter i denne version tegnsprog til tekst, men laver ikke talt sprog om til tegnsprog. Det er en vigtig skelnen.

Brugeren er stadig med i loopet

En anden designbeslutning synes jeg også er værd at bemærke. Når modellen oversætter tegnsprog til tekst, bliver teksten ikke bare automatisk sendt. Brugeren får mulighed for at se og redigere oversættelsen først.

I Live Transcribe bestemmer brugeren selv, hvornår den oversatte tekst skal vises eller læses op for den anden person.

Det er endnu et eksempel på noget, jeg synes vi alt for ofte glemmer, når vi taler AI: automatisering behøver ikke betyde, at mennesket fjernes fra processen. Nogle gange er den bedste løsning, at AI'en udfører 90 procent af arbejdet, mens mennesket beholder kontrollen over de sidste 10 procent.

Her er det ikke bare et sikkerhedsdesign. Det giver brugeren kontrol over sit eget sprog.

Udviklet sammen med døve brugere

Google DeepMind fremhæver også, at løsningen er blevet udviklet med deltagelse fra døve brugere og organisationer.

Projektet har et rådgivende udvalg – AI Sign Language Advisory Committee, forkortet AISLAC – med deltagelse fra blandt andet døveorganisationer, akademiske institutioner og professionelle tolke. Udvalget har været involveret i test, feedback, vurdering af risici og udarbejdelsen af en fælles impact-rapport, som er offentliggjort sammen med modellen.

Det er især vigtigt med denne type teknologi. For tilgængelighedsløsninger bliver ikke nødvendigvis gode, bare fordi de teknisk virker.

Hvis man udvikler til en gruppe mennesker uden at involvere dem i udviklingen, risikerer man at løse det problem, man tror, de har. Ikke nødvendigvis det problem, de faktisk har.

Det her handler om mere end tegnsprog

Det er selvfølgelig først og fremmest en vigtig udvikling for mennesker, der bruger tegnsprog. Men teknologisk synes jeg også, SL2T viser noget større.

AI betyder, at computere bliver i stand til at forstå stadig flere former for input. Vi er gået fra tastatur → tekst, til tale → tekst, og i stigende grad billeder, video og bevægelser → sprog.

Grænsen mellem den måde, mennesker naturligt kommunikerer på, og den måde, computere forventer, at vi kommunikerer på, bliver langsomt mindre.

Tidligere tilpassede vi os computeren. Vi lærte tastaturet. Vi lærte menuerne. Vi lærte de rigtige kommandoer. Nu bevæger teknologien sig i stigende grad den modsatte vej: computeren forsøger at forstå os.

Det synes jeg er noget af det mest interessante ved den nuværende AI-udvikling, og det er en af de historier, jeg helst fortæller, når jeg holder foredrag om AI. Ikke at vi kan få endnu en chatbot til at skrive en mail. Men at mennesker, som tidligere har været dårligt understøttet af digitale grænseflader, potentielt får nye og mere naturlige måder at bruge teknologien på.

Stadig kun begyndelsen

Den første version af SL2T er begrænset. Den understøtter i produktform amerikansk tegnsprog til engelsk. Den laver fejl. Den kan ikke bruges som erstatning for professionelle tolke i alvorlige situationer. Og en lang række tegnsprog mangler stadig.

Men det ændrer ikke ved, at dette er et vigtigt skridt. Tegn-til-tekst er nu på vej fra forskningsprojekt til reel funktion på almindelige smartphones.

Google DeepMind arbejder ifølge deres egen roadmap videre med flere tegnsprog, bedre forståelse og på længere sigt også generering af tegnsprog — altså den modsatte vej, hvor tekst bliver omsat til tegnsprog.

Den modsatte vej — tekst til tegnsprog — er stadig forskning og ikke en del af den lancerede funktion. Video: Google DeepMind

Hvis udviklingen fortsætter, er det ikke svært at forestille sig en fremtid, hvor tegnsprog bliver lige så naturligt et inputformat til vores digitale systemer, som tale er blevet for mange af os.

Og det er nok en AI-funktion, hvor værdien er lidt lettere at få øje på end endnu en knap, der kan skrive vores mails for os.

Se Google DeepMinds egen præsentation

Google har lagt annonceringen ud i to udgaver — og det er værd at bemærke, at den ene er på amerikansk tegnsprog. Det er en ret passende detalje for netop dette projekt.

Google DeepMinds præsentation af SL2T. Video: Google DeepMind
Samme præsentation på amerikansk tegnsprog. Video: Google DeepMind

Kilder: Google DeepMinds blogindlæg “Putting sign language AI into users' hands” (12. august 2026) og den tilhørende AISLAC Joint Impact Report for SL2T 1.0, udarbejdet sammen med det rådgivende udvalg.

Skal jeg holde et foredrag om, hvor AI faktisk er på vej hen?

Jeg holder foredrag om AI med udgangspunkt i konkrete eksempler frem for hype — hvad teknologien kan i dag, hvor den fejler, og hvad det betyder for helt almindelige arbejdsgange.

Kommentarer

Der er endnu ingen kommentarer. Du kan blive den første.

Skriv en kommentar

Har du en erfaring, et modargument eller et spørgsmål? Skriv endelig med. Din mailadresse bliver ikke offentliggjort.

Offentliggøres ikke.

Når du kommenterer, gemmer jeg dit navn, din mailadresse og din IP-adresse for at kunne moderere. Se privatlivspolitikken.

Skriv til mig

Beskriv din opgave med et par linjer, så vender jeg tilbage — typisk samme dag.

Dine oplysninger bruges kun til at svare dig — ingen nyhedsbreve.