SignBuddy: van gebarentaalonderzoek naar schaalbare oplossingen via co-creatie

Toon Vandendriessche, Caro Brosens, Hannes De Durpel, Mathieu De Coster en Joni Dambre

Aanleiding

In het online woordenboek Vlaamse Gebarentaal – Nederlands kan een gebruiker op verschillende manieren zoeken: door een Nederlands woord te typen, of te zoeken op een categorie of regio. Zoeken van Vlaamse Gebarentaal (VGT) naar Nederlands kon ook, maar was tot nu toe beperkt tot zoeken op fonologische kenmerken (parameters) als handvorm en locatie. De Universiteit Gent (UGent) en het Vlaams Gebarentaalcentrum (VGTC) hebben in 2024 en 2025 samengewerkt om daar verandering in te brengen.

Samen met de UGent ontwikkelden wij SignBuddy: een nieuwe, video-gebaseerde zoekfunctie voor het woordenboek. Met SignBuddy kan een gebruiker in het woordenboek een gebaar aan de webcam tonen, waarna het systeem dit gebaar met behulp van artificiële intelligentie automatisch herkent en opzoekt. 

In de laatste tien jaar werd er meer en meer ingezet op het ontwikkelen van taaltechnologie voor gebarentalen, vaak vooral of uitsluitend door niet-gebarentalige onderzoekers. Dit leidde vaak tot resultaten die niet gewenst, bruikbaar of nauwkeurig waren. Wij wilden onze technische en taalkundige expertise daarom omzetten naar een praktische toepassing die nuttig en bruikbaar zou zijn voor de gebarentalige gemeenschap. 

De vragen ‘Wat vindt de gemeenschap wenselijk?’ en ‘Wat is technisch haalbaar?’ werden samengebracht tot het onderzoeksdoel. Kennis over gebarentaal en de visie van gebaarders speelden in elke fase van het project mee. SignBuddy is dus van in het begin ontstaan vanuit co-creatie, het hele proces was een wisselwerking tussen dove en slechthorende gebarentalige gebruikers en horende en gebarentalige dove en slechthorende onderzoekers/ontwikkelaars. 

Om te garanderen dat de applicatie effectief nuttig zou zijn voor de gebruikers, werden er door het VGTC voorwaarden bepaald waar die aan moest voldoen:

  • De beste voorspellingen (top-6 of top-9) moesten op één scherm passen binnen de lay-out van het woordenboek
  • De gebruiker vindt idealiter in minimum 2 van de 3 zoekopdrachten (66,6%) het gezochte gebaar tussen de top-6 of de top-9, als streefdoel werd 70% gehanteerd. 

Hoe kwam het tot stand?

Om de grens van 70% te halen, was het cruciaal dat er veel voorbeelden waren van gebarentalige mensen die iets opzochten in het woordenboek. Daarom werd er een dataverzamelingsomgeving opgezet met de naam SignBuddy. Gebruikers kregen daar een gebaar uit het woordenboek te zien waarna ze gevraagd werden om het te kopiëren voor hun camera. Daarbij werd ook een beroep gedaan op hun expertise via (optionele) bijvragen over de handvorm, locatie, beweging en het mondbeeld. Deze vragen lieten het team toe om na te gaan welke parameters nog een struikelblok vormden voor de diepe neurale netwerken die gebruikt worden voor deze automatische herkenning.

Bij het verzamelen van deze data werden waarden als privacy, toegankelijkheid en gebruiksvriendelijkheid hoog in het vaandel gedragen. Zo werd enkel de abstracte weergave van het gebaar in punten en lijnen, ook wel keypoints genoemd, bewaard en doorgestuurd, de eigenlijke video verliet de computer van de gebruiker nooit. Naast een vraag die peilde naar gebarentaalvaardigheid (ken je gebarentaal? – ja, een beetje, nee), moesten mensen zich ook niet aanmelden. Deze aspecten maakten deelname zo anoniem mogelijk. De gebruikersinterface werd gemodelleerd naar de rest van het woordenboek zodat het intuïtief zou aanvoelen en even gebruiksvriendelijk zou zijn als het woordenboek zelf. Alle informatie werd aangeboden in geschreven Nederlands en in VGT, en alles werd waar mogelijk zo visueel mogelijk gemaakt door bijvoorbeeld het gebruik van transparante symbolen. Nadat ze een gebaar hebben gekopieerd, kregen gebruikers ook meteen de vraag/optie om nog een gebaar te doen. Dit alles met het oog op de drempel tot deelname zo veel mogelijk te verlagen.

Via deze gerichte dataverzameling werden 1868 opnamen verzameld van zowel beginnende als gevorderde gebaarders. Dit leverde voorbeelden voor 377 unieke gebaren op. Uit de analyse van deze data kwamen enkele waardevolle inzichten naar voren: 

  • De taalvaardigheid van de gebaarder heeft blijkbaar een impact op de prestatie van het model: gebaren van vloeiende gebaarders worden gemakkelijker herkend dan die van beginnende. 
  • Ook de omgeving waarin de video wordt opgenomen, heeft een invloed. Niet iedereen heeft immers toegang tot een egale achtergrond, goede verlichting of een hoogwaardige webcam en internetverbinding. 
  • Het model blijft het daarnaast moeilijk hebben om handen die elkaars pad kruisen te onderscheiden van elkaar. 
  • Tot slot weten we door de antwoorden van vlotte gebaarders op de optionele bijvragen bij welke parameters er nog winst te rapen valt, voornamelijk beweging en mondbeeld. Vooral het mondbeeld blijft een grote uitdaging.

Dankzij deze inzichten konden de nodige verbeteringen worden doorgevoerd voor de grote lancering van de videozoekfunctie in het online woordenboek. Zo werden de instructies over hoe je in beeld moet komen verder verfijnd, en werd er geopteerd om toch de top 9 resultaten te tonen in plaats van de top 6 om de slaagkansen van een zoekopdracht zo groot mogelijk te maken. SignBuddy is het eerste volledig schaalbare gebaar-naar-tekst-zoekmodel. Het is dus flexibel toepasbaar op het volledige woordenboek en hoeft niet bij elke uitbreiding van het woordenboek volledig opnieuw getraind te worden.

Dit onderzoeksproject werd onder de naam “Wat gebaar jij?!” gefinancierd door AMAI Vlaanderen.

Meer weten over dit onderzoek? Lees dan zeker het artikel of contacteer ons bij verdere vragen.

Scroll naar boven