Alle artikelen
3 min leestijd

Google DeepMind laat gebruikers gebarentaal typen op de Pixel 11

Door AI Gekkie ·

Google DeepMind heeft op 12 augustus 2026 SL2T aangekondigd, een model dat gebarentaal direct omzet in geschreven tekst. Het is verwerkt in de toetsenbordapp Gboard en in Live Transcribe, en debuteert op de Pixel 11 die op 20 augustus verschijnt. Daarmee wordt dat toestel volgens Google het eerste smartphonemodel waarop een dove gebruiker rechtstreeks kan gebaren in plaats van typen, in elk tekstveld. Bij lancering ondersteunt SL2T alleen Amerikaanse Gebarentaal (ASL) naar Engels, terwijl wereldwijd zo'n 70 miljoen dove en slechthorende mensen zo'n 200 verschillende gebarentalen gebruiken.

Wat er precies is gelanceerd

Een dove gebruiker kan met SL2T voor de camera van de telefoon gebaren, waarna dat direct als tekst verschijnt in het tekstveld waar hij mee bezig is. Dat werkt voor een zoekopdracht op het web, een bericht of document, of een vraag aan Gemini. In Live Transcribe, de app die gesproken taal live omzet naar tekst voor dove gebruikers, kan een gesprekspartner voortaan ook terug gebaren in plaats van typen, zo meldt Google DeepMind zelf.

De functie is bij lancering gratis en beperkt tot de Pixel 11 via Gboard en Live Transcribe. Google zegt meer apparaten te laten volgen, maar heeft daar nog geen datum voor genoemd.

Hoe het model werkt

SL2T werkt in twee stappen. Eerst zet een model op het toestel zelf de camerabeelden om in een reeks geometrische coördinaten van lichaam, handen en gezicht, met behulp van het bestaande MediaPipe Holistic-systeem. Alleen die coördinaten gaan naar Google's servers voor de daadwerkelijke vertaling naar tekst; de video zelf wordt volgens Engadget meteen verwijderd.

Waar eerdere systemen vaak eerst via een tussenstap van vaste gebaren-labels ('glosses') werkten, vertaalt SL2T de coördinatenreeks rechtstreeks naar tekst. Dat moet beter recht doen aan gezichtsuitdrukkingen en ruimtelijke grammatica die bij gebarentalen horen, maar in eerdere systemen vaak verloren gingen. SiliconANGLE wijst erop dat eerdere pogingen tot automatische gebarentaalherkenning zich vaak beperkten tot handgebaren, terwijl gebarentalen volwaardige visuele talen zijn die het hele lichaam gebruiken, inclusief mimiek en houding.

Het model is getraind op meer dan 100.000 uur gebarentaaldata uit meer dan 50 talen, waarvan ongeveer een kwart ASL, en haalt een score van 70 BLEURT op de FLEURS-ASL-benchmark: volgens SiliconANGLE een aanzienlijke verbetering ten opzichte van eerder gerapporteerde systemen op diezelfde benchmark.

Ontwikkeld met de dove gemeenschap

Het project is mede vormgegeven door de dove Google-medewerker Sam Sepah, met dove partners die betrokken waren bij het verzamelen en beoordelen van data. Daarnaast richtte Google een adviescommissie op, de AI Sign Language Advisory Committee, met internationale dovenorganisaties. "We believe in building with the Deaf community, not just for it," schrijft het team in de aankondiging.

Wat dit betekent voor gebruikers

Voor ASL-gebruikers met een Pixel 11 verandert er iets concreets: waar typen op een scherm voorheen de enige manier was om tekst in te voeren, kan dat nu ook door te gebaren, in het eigen tempo en de eigen taal in plaats van via vertaling naar geschreven Engels door iemand anders. Voor de overgrote meerderheid van dove gebruikers wereldwijd verandert er bij deze lancering nog niets: wie een andere gebarentaal gebruikt dan ASL, of geen Pixel 11 heeft, blijft aangewezen op typen of interpretatie door derden.

Google noemt uitbreiding naar meer talen en apparaten als vervolgstap, zonder tijdspad. Tot die tijd blijft de impact beperkt tot een deelverzameling van een deelverzameling: ASL-sprekers die specifiek een Pixel-toestel aanschaffen.

Voor werkgevers en dienstverleners die toegankelijkheid serieus nemen, verandert er wel iets aan de onderkant van de verwachtingen: een grote techpartij laat zien dat direct gebaren naar tekst technisch haalbaar is zonder tussenstap van een menselijke tolk of typen op een schermtoetsenbord. Dat kan de lat verhogen voor wat als een redelijke toegankelijkheidsvoorziening geldt in apps en diensten die nu nog volledig op typen leunen, ook buiten Google's eigen producten.

Centrale verwerking als ontwerpkeuze

De manier waarop SL2T is gebouwd, laat zien dat Google bewust rekening hield met privacy: de camerabeelden zelf verlaten het toestel niet, alleen abstracte coördinaten doen dat. Tegelijk blijft de daadwerkelijke vertaling afhankelijk van Google's eigen servers, gebonden aan één telefoonmodel en gebaseerd op een model waarvan de gewichten niet beschikbaar zijn: zonder Pixel-toestel en zonder verbinding met Google's servers werkt SL2T niet.

🤖 Verdiep of relativeer dit artikel

Plak deze prompt in ChatGPT, Claude of een andere chatbot om dieper op dit onderwerp in te gaan, of het juist te laten tegenspreken.

Reageren? Volgend artikel
💬