In deze klantcase gaan we in op de samenwerking tussen Daria Koppes, data analist bij KWF, en Hugo Koopmans, datascience coach bij DIKW Intelligence. Hugo helpt Daria en haar team met datascience expertise in het realiseren van waardevolle datascience usecases.
Daria vertelt: “Elk jaar ontvangt KWF een groot aantal projectaanvragen van onderzoekers, waarvan uiteindelijk een beperkt deel wordt toegekend. Alle aanvragen worden inhoudelijk geclassificeerd door een Science Liaison (SL’er) van KWF. Deze classificatie is essentieel om analyses op de KWF onderzoeksportefeuille mogelijk te maken. De classificatie omvat meerdere onderdelen, waaronder de classificatie van het zogenaamde onderzoeksthema.”

Het classificeren van projectaanvragen is een tijdsintensief en deels interpretatiegevoelig proces. Door het grote volume aan aanvragen die binnen een bepaalde tijdsperiode geclassificeerd moeten worden, leidt dit tot piekbelasting van de SL’ers. Daarnaast kunnen interpretatieverschillen leiden tot variatie in classificaties binnen de organisatie.
Om deze uitdagingen aan te pakken, is onderzocht in hoeverre kunstmatige intelligentie kan bijdragen aan een efficiëntere en consistentere inrichting van dit proces. Met behulp van het AI Model Canvas van DIKW is de use case verder uitgewerkt en is gestart met de ontwikkeling van een classificatietool voor SL’ers. Daarbij is gebruikgemaakt van een omvangrijke historische dataset met projectaanvragen en bijbehorende classificaties (2016–heden), waarop supervised machine-learning kon worden toegepast. Alle data is hierbij uitsluitend lokaal verwerkt.
Tijdens het uitwerken van de testcase zijn tussentijdse resultaten regelmatig besproken met Hugo Koopmans, datascience coach bij DIKW. Op basis van deze evaluaties zijn vervolgstappen gezamenlijk bepaald en is de aanpak iteratief aangescherpt.
De testcase richtte zich specifiek op de classificatie van het primaire onderzoeksthema van projectaanvragen. Omdat dit kenmerk wordt afgeleid uit grotendeels ongestructureerde tekst, is het noodzakelijk om de tekst om te zetten naar een numerieke representatie. Hiervoor bestaan verschillende methoden, variërend van klassieke technieken zoals TF-IDF tot moderne embedding-gebaseerde benaderingen.
Binnen deze testcase is geëxperimenteerd met BERTopic voor topicmodellering, waarbij gebruik werd gemaakt van de scientific abstract, aangevuld met de keywords en de titel van het project. De tekst is hierbij vertaald naar semantische embeddings, die vervolgens zijn geclusterd tot een set topics. Voor ieder document zijn daarna topic distribution scores berekend, die aangeven in welke mate de inhoud overeenkomt met een bepaald topic.

Door te kiezen voor embedding-based similarity in plaats van een traditionele TF-IDF-benadering, worden semantische overeenkomsten tussen woorden en zinsdelen beter meegenomen. Deze aanpak leidde tot een duidelijke prestatieverbetering: de weighted average F1-score steeg met circa 0,15 ten opzichte van modellen die uitsluitend embeddings gebruikten of topic scores op basis van TF-IDF. Deze resultaten laten zien dat de combinatie van semantische embeddings en topicmodellering niet alleen beter interpreteerbaar is, maar ook tot betere classificatieprestaties leidt.
Momenteel wordt verder gewerkt aan de proof of concept van de classificatietool. Daarbij zijn twee onderdelen van de classificatie geselecteerd om nader uit te werken en te valideren samen met de SL’ers. Deze focus maakt het mogelijk om de technische aanpak verder te verfijnen en tegelijkertijd inzicht te krijgen in de toegevoegde waarde van de tool binnen het bestaande classificatieproces.
“Door structuur aan te brengen in de vele mogelijkheden van datascience, machine-learning en AI via het AI Model Canvas creëren we rust en overzicht in de pijplijn van usecases in de experimenteer fabriek.”
Hugo Koopmans – datascience coach – DIKW
Verwachte impact: door de inzet van AI zal het classificatieproces naar verwachting aanzienlijk sneller en consistenter verlopen. KWF verwacht hiermee de werkdruk voor SL’ers te verlagen, betrouwbaarder inzicht te creëren en de uniformiteit van de classificaties te verhogen. Deze efficiëntieslag vermindert administratieve inzet, zodat donateursgelden maximaal ten goede komen aan de missie van KWF.
Hugo Koopmans, datascience coach bij DIKW, vult aan: “Door structuur aan te brengen in de vele mogelijkheden van datascience, machine learning en AI via het AI Model Canvas creëren we rust en overzicht in de pijplijn van usecases in de experimenteer fabriek. Het canvas en de workshop helpen bovendien om gezamenlijk prioriteiten af te stemmen en helder te communiceren met de organisatie. Bij projecten als deze sparren we zo vaak als nodig over de resultaten en richting. Mijn rol is om kennis, structuur en pragmatiek te brengen, zodat het team sneller waarde kan realiseren. Het is mooi om te zien hoe KWF state-of-the-art machine learning inzet voor een efficiëntere classificatieronde van onderzoeksprojecten.”

Datascience Coach
Ja, mijn team kan ook ondersteuning gebruiken van een coach van DIKW
Ook andere organisaties staan vaak voor de uitdaging om datascience-initiatieven structureel te vertalen naar praktische meerwaarde. Een datascience coach van DIKW helpt daarbij door samen met het team te werken aan concrete usecases, te leren van iteraties en tegelijkertijd de organisatie volwassen te maken in het gebruik van data en AI. Of het nu gaat om verbetering van processen, kwaliteitsverhoging of innovatie, een coach brengt focus, versnelling en zekerheid in het resultaat.
Wilt u weten wat een DIKW datascience coach voor uw organisatie kan betekenen? Neem contact op met DIKW Intelligence voor een vrijblijvend gesprek of workshop rondom uw data- & AI-uitdagingen.
Of plan een virtueel kopje koffie met datascience coach Hugo Koopmans.
