Een woordspel heeft meer nodig dan een lijst geldige tekenreeksen. Het moet kunnen zeggen wat elk woord betekent, en betekenis is het moeilijkst op te slaan.
In het Engels geschreven en geredigeerd. Deze Nederlandse versie is met machinevertaling gemaakt; waar precisie ertoe doet, is het Engelse origineel leidend. Lees het origineel in het Engels →
WordChess wordt gespeeld op een bord van 25×25 met een Engels woordenboek van 148.941 woorden 6, met gemiddeld 8,6 letters per woord en de langste tot 27 letters. Dat is het makkelijke deel. Een lijst geldige woorden is gewoon een verzameling tekenreeksen die het spel accepteert. Het interessante deel is een speler vertellen wat de reeks op het bord betekent, en dat in tweeëntwintig talen tegelijk.
Lexicografen trekken een scherpe grens tussen een lemma en zijn verbogen vormen. Het lemma is het trefwoord dat je opzoekt: run (rennen), house (huis), be (zijn). Daaromheen draait een paradigma van oppervlaktevormen: runs, ran, running. Elk draagt dezelfde kernbetekenis, gekleed voor een andere grammaticale rol. 3 Een woordenboek besteedt zijn tekst aan het lemma en laat de schaduwen naar huis verwijzen.
Hoeveel schaduwen een woord werpt, hangt af van de taal. Het Engels is analytisch: het leunt op woordvolgorde en kleine hulpwoordjes, zodat een werkwoord zelden meer dan een handvol vormen heeft. Het Fins is agglutinerend: het bouwt betekenis op door achtervoegsels aan een stam te plakken. Eén Fins zelfstandig naamwoord wordt verbogen in zo’n vijftien naamvallen, in enkelvoud en meervoud, nog voordat bezittelijke uitgangen en clitica erbovenop worden gestapeld; het praktische aantal verschillende vormen loopt in de duizenden. 4 Het Hongaars perst een hele Engelse woordgroep, in my house (in mijn huis), in één woord: házamban. 5
De definities komen uit Wiktionary, het vrije woordenboek dat iedereen kan bewerken. Het is enorm en meertalig: het project omvat ruim honderd actieve taaledities en tientallen miljoenen lemma’s, gezamenlijk geschreven door vrijwilligers in plaats van een betaalde redactie. 1 Voor een spel dat in 22 talen draait, komt geen ander vrij lexicon qua dekking ook maar in de buurt.
Maar dekking op papier is nog geen dekking die je kunt voorlezen. Wiktionary slaat verbogen vormen op een manier op die menselijke redacteuren bespaart om dezelfde omschrijving tienduizend keer te schrijven. In plaats van een definitie uit te schrijven, bevat een niet-lemma-item een form-of-sjabloon, een kleine verwijzing die in feite zegt: “dit is een bepaalde grammaticale vorm van dat lemma”. 2 Het item voor smoulders (smeult) is geen lopende tekst; het is een sjabloon dat wordt weergegeven als “third-person singular simple present form of smoulder” (vorm van de derde persoon enkelvoud tegenwoordige tijd van smoulder, smeulen). 1
Deze verwijzingen zijn geen afrondingsfout. Op de Engelse Wiktionary zijn van de ruwweg 1,27 miljoen definities er zo’n 478.000, ruim een derde, “form of”-definities in plaats van uitgeschreven betekenissen. 1 De gegevens zijn er. Ze zijn alleen opgevouwen.
De uitdaging die ertoe deed, was dus nooit “het woord ontbreekt”. Het was dat de betekenis van het woord in een sjabloon zat dat een naïeve parser zou weggooien. De definities van WordChess zijn gebouwd door de ruwe Wiktionary-dumps te lezen en de verbuigingssjablonen taal voor taal uit te vouwen: de parser leren wat elke verwijzing betekent en die herschrijven tot een eenvoudige omschrijving. 6
Elke taal verbergt haar vormen achter andere machinerie. Het Spaans stopt werkwoordsvormen achter {{forma verbo}}, dat wordt omgezet in “werkwoordsvorm van X”. Het Duits gebruikt {{Grundformverweis Dekl/Konj}} voor verbogen en vervoegde vormen. Het Fins leunt op {{taivutusmuoto}}. Het Russisch slaat vaak helemaal geen vormsjabloon op: het verbogen woord is een kale doorverwijzing (собаки → собака) die gevolgd moet worden om een “vorm van”-omschrijving te achterhalen. 6 Behandel elke conventie, en de dekking maakt een sprong.
| Taal | Vóór | Na | Winst |
|---|---|---|---|
| Duits | 45% | 92% | +47 |
| Nederlands | 58% | 90% | +32 |
| Fins | 54% | 74% | +20 |
| Russisch | 20% | 70% | +50 |
| Grieks | 15% | 57% | +42 |
Gemeten aan de hand van de ontwerp- en bouwnotities van dit project. De percentages zijn het aandeel woordenboekitems met een bruikbare definitie of een opgeloste “vorm van”-omschrijving.
De gegevens ontbraken nooit. Ze waren opgevouwen in een verwijzing, en een machine het woord geven betekende leren die uit te vouwen.
Het loont om eerlijk te zijn over wat het spel nu in huis heeft. Als WordChess laat zien dat собаки een vorm is van собака, “hond”, heeft het niets begrepen. Het heeft de ene tekenreeks gekoppeld aan een andere tekenreeks, een omschrijving, door dezelfde verwijzingen te volgen die een menselijke redacteur heeft achtergelaten. Dit is lemmatisering, het werkpaard van natuurlijke-taalverwerking: een oppervlaktevorm terugbrengen tot zijn grondvorm, zodat een machine minder verschillende dingen hoeft bij te houden. 7
Dat is een echte en nuttige vorm van kennen. Het laat het spel de vraag “wat is dit woord?” beantwoorden in Athene of Amsterdam zonder een lexicograaf in dienst. Maar het is kennen als opzoeken, niet kennen als begrijpen. De omschrijving is een belofte dat iemand die haar leest het woord zal herkennen. De machine bewaart de belofte; de lezer levert de betekenis.
Sommige talen stuiten op een plafond dat geen parser kan optillen, omdat de gegevens er simpelweg niet zijn om uit te vouwen. Hongaarse items bevatten vaak alleen een etymologie en een tabel met vertalingen, helemaal geen definitietekst, zodat zelfs een perfecte lezer met lege handen staat. De moeilijkste gevallen clusteren waar de taalkunde het moeilijkst is: agglutinerende talen zoals het Fins en het Hongaars, die enorme paradigma’s voortbrengen, en het Cyrillische en Griekse schrift, waar de dekking door de gemeenschap al dunner is. Het Grieks klom van 15% naar 57%; dat het ver onder de 92% van het Duits blijft, zegt iets over de bron, niet over de code. 6