Had ik in de jaren tachtig maar beter opgelet. Ik studeerde computertaalkunde, en het waren de hoogtijdagen van de gedachte dat we taalkundige theorieën konden gebruiken om de computer te leren om te praten, te schrijven, te spreken en te verstaan. Er was in de voorafgaande decennia een heleboel wetenschappelijke kennis over taal verzameld. Je hoefde die alleen maar zo precies op te schrijven dat een computer het zou begrijpen, en dan had je een taalmachine!
Walter Daelemans schrijft over die periode in zijn boek AI en taal dat je als je met de computers van toen een Groot Taalmodel had willen trainen, zoals waarop Claude en ChatGPT gebaseerd zijn, je zeven miljard jaar had moeten nemen om zo'n ding te trainen. Men moest dus wel zuinig zijn, en gebruik maken van bestaande theorieën was een logische stap:
Dit was een boeiende periode voor taalkundigen. Verschillende taalkundige theorieën konden expliciet gemaakt worden, vergeleken en op objectieve manier gestet in concrete systemen.
Wat hij er niet bij schrijft: dat er op de opleiding die ik volgde één docent was die heel sceptisch was over de slagingskansen van zo'n methode, die veel meer zag in het toepassen van grootschalige statistische redeneringen – van het soort die uiteindelijk tot de doorbraak van de Grote Taalmodellen zouden leiden. Die ene persoon was Walter Daelemans.
Mij leek toen dat hij ongelijk had, net zoals de meeste docenten en studenten, maar Walter Daelemans, bescheiden, viert zijn gelijk niet. Wel schreef hij met AI en taal een heel heldere en tegelijkertijd voldoende diepgaande gids in hoe chatbots in elkaar zitten. Het is geen boek over de doem die op ons afkomt, of over het paradijs dat aanstaande is, maar een uitleg van hoe het eigenlijk kan, dat een hoop aan elkaar geschakelde siliconen ineens een essay kunnen schrijven over willekeurig welk onderwerp.
Een ding dat dus moest gebeuren is dat de computers zelf onvoorstelbaar veel sneller werden, en compacter, zodat de truc die in de jaren tachtig onmogelijk was, alsnog kon worden uitgevoerd. Maar ook moest er gewerkt worden aan hoe die neurale netwerken zelf konden werken. Ik heb daarover toch waarachtig de afgelopen jaren wel het een en ander gelezen, ik ben en blijf zelf een voormalig taaltechnoloog – maar zelden iets dat zo duidelijk is als het proza van Daelemans:
De formulering van de taak die een taalmodel moet leren oplossen is gênant eenvoudig: voorspel het meest waarschijnlijke volgende woord gegeven de vorige woorden. Voorbeelden als tekstaanvulling op een smartphone of bij het intikken van een zoekopdracht in Google zijn bij iedereen bekend.
Alleen: je komt niet tot coherente teksten als je alleen maar kijkt naar de voorafgaande vijf of tien woorden, om het allemaal vloeiend te laten lopen moet je naar veel meer woorden kijken. Zelfs bij de krachtige computers van nu loop je dan al snel tegen grenzen aan. De belangrijkste truc, 10 jaar geleden, door ingenieurs bij Google ontdekt, is aandacht. Je bepaalt wat de belangrijke woorden zijn en vooral aan die woorden aandacht te besteden. Zo kun je in zekere zin naar minder woorden kijken. 'Attention Is All You Need', heette het artikel van die Google-ingenieurs. De titel is volgens Daelemans een teken dat ze er zelf niet het gigantische belang van zagen, maar je kunt ook zeggen: deze ene uitvinding zorgde voor de doorbraak.
Ik vind dat dit boek verplicht is voor iedereen die in onze tijd met taal bezig is en/of over taal nadenkt. Wees niet zoals ik ooit was! Lees Walter Daelemans.
Reacties