
Met synthetische data naar open en reproduceerbaar onderzoek
Zoeken naar balans tussen openheid en privacy
Wie wetenschappelijk onderzoek wil controleren, moet bij de data kunnen. Maar wat als die data vanwege privacy niet gedeeld mogen worden? De TU/e onderzoekt of synthetische data uitkomst kunnen bieden: kunstmatige datasets die lijken op echte onderzoeksdata, maar geen gevoelige informatie van echte personen bevatten.
Onderzoekers worden steeds nadrukkelijker aangemoedigd om hun onderzoeksdata te delen. Open science is belangrijk: als andere wetenschappers toegang hebben tot de data achter een onderzoek, kunnen zij resultaten controleren, onderzoek reproduceren en nieuwe vragen stellen. Maar wat als die data niet zomaar gedeeld mogen worden?
Dat is de paradox waar veel onderzoekers mee te maken hebben. Onderzoeksfinanciers zoals NWO en de European Research Council (ERC) verwachten dat data zo veel mogelijk beschikbaar worden gesteld om onderzoek reproduceerbaar te maken.
Tegelijkertijd bevatten datasets vaak persoonsgegevens of bedrijfsgevoelige informatie. Die data openbaar maken kan daarom in strijd zijn met privacywetgeving, afspraken met bedrijven of andere juridische en ethische voorwaarden.
Open waar het kan
Het uitgangspunt binnen open science is daarom niet dat alle onderzoeksdata altijd volledig openbaar moeten zijn. Het gaat erom data zo toegankelijk mogelijk te maken, maar rekening te houden met de gevoeligheid ervan: open waar het kan, gesloten waar het moet.
Het Data Steward-team van de TU/e helpt onderzoekers bij het maken van die afweging. “We denken met onderzoekers mee over hoe ze hun data zo toegankelijk mogelijk kunnen maken en tegelijkertijd gevoelige informatie kunnen beschermen”, zegt Liz Guzman-Ramirez, leider van het Data Steward-team van de TU/e.
Er zijn verschillende manieren om gevoelige data minder herleidbaar te maken. Bij interviews kunnen bijvoorbeeld namen en andere herleidbare gegevens handmatig worden verwijderd. Bij grote hoeveelheden kwantitatieve data kan dat proces echter complex en tijdrovend zijn. Bovendien kan het verwijderen van informatie gevolgen hebben voor de waarde van de dataset voor verder onderzoek.
Synthetische data bieden een andere mogelijkheid.
Een dataset die echt lijkt, maar het niet is
Bij synthetische data wordt een model getraind op een bestaande dataset. Het model analyseert onder meer de statistische verbanden tussen de verschillende variabelen en gebruikt die informatie vervolgens om een nieuwe dataset te genereren.
Die nieuwe gegevens zijn geen kopie van de oorspronkelijke dataset. Er worden nieuwe, fictieve records gemaakt. Tegelijkertijd probeert het model de statistische eigenschappen van het origineel zo goed mogelijk te behouden.
Een eenvoudig voorbeeld: stel dat onderzoekers een grote enquête hebben uitgevoerd waarin deelnemers vragen hebben beantwoord over leeftijd, opleiding en voorkeuren. De synthetische dataset bevat vervolgens geen echte deelnemers meer. Wel probeert het model bijvoorbeeld dezelfde verbanden tussen leeftijd, opleiding en de antwoorden op de enquêtevragen te behouden.
Het resultaat is een dataset waarmee anderen analyses kunnen uitvoeren zonder toegang te krijgen tot de oorspronkelijke persoonsgegevens.
“Je kunt nog steeds doen wat je met de data wilt doen en de data publiek beschikbaar maken, maar je brengt de privacy van de deelnemers niet in gevaar en behoudt hun rechten”, aldus Guzman-Ramirez.
Dat kan ook uitkomst bieden bij kwesties rondom intellectueel eigendom of bedrijfsgevoelige informatie. Wanneer de oorspronkelijke data onder een geheimhoudingsovereenkomst vallen, kan het bijvoorbeeld voor een student onmogelijk zijn om ermee te werken. Met synthetische data kan die student wél oefenen met de dataset en analyses uitvoeren.
Niet zomaar een druk op de knop
Synthetische data klinken misschien als een eenvoudige oplossing, maar het proces vraagt de nodige zorgvuldigheid. Het model moet voldoende informatie hebben om de statistische patronen in de oorspronkelijke dataset te herkennen.
Vooral bij kwantitatieve datasets met relatief veel gegevens kan dat goed werken. Voor kleine datasets of kwalitatief onderzoek, zoals een beperkt aantal interviews, is de methode veel minder geschikt.
Ook moet de oorspronkelijke dataset goed worden voorbereid. Onderzoekers moeten bijvoorbeeld aangeven welke typen gegevens in de verschillende kolommen staan en welke gegevens mogelijk naar een persoon te herleiden zijn. Het systeem herkent standaard bepaalde persoonsgegevens, zoals namen, adressen en e-mailadressen, maar onderzoekers kunnen zelf aanvullende variabelen aanwijzen die mogelijk gevoelig zijn.
Reproduceerbaarheid
Volgens Guzman ligt de belangrijkste meerwaarde van synthetische data niet per se in het uitvoeren van volledig nieuw onderzoek op de synthetische dataset. De grootste winst zit in het kunnen reproduceren van bestaande analyses.
Stel dat een onderzoeker een interessante correlatie beschrijft in een wetenschappelijke publicatie. Een andere onderzoeker wil controleren of die analyse klopt, maar kan de oorspronkelijke dataset niet inzien omdat die persoonsgegevens bevat. Normaal gesproken zou die tweede onderzoeker de volledige dataverzameling opnieuw moeten uitvoeren.
Met een synthetische dataset kan een andere onderzoeker de beschreven analyse opnieuw uitvoeren en controleren of die tot dezelfde resultaten leidt.
Kanttekening
Daarbij is wel een belangrijke kanttekening nodig. Synthetische data kunnen helpen om te controleren of een beschreven analyse opnieuw kan worden uitgevoerd, maar nieuwe conclusies kun je er niet zonder meer aan verbinden. Stel dat een onderzoeker in de synthetische dataset een interessante nieuwe correlatie ontdekt. Dan is het niet zeker dat die correlatie ook in de oorspronkelijke dataset bestaat.
Guzman ziet synthetische data daarom vooral als een manier om analyses voor te bereiden, onderzoeksmethoden uit te proberen, studenten te laten oefenen en bestaande analyses te reproduceren. Wie op basis van een synthetische dataset een nieuwe wetenschappelijke bevinding doet, zou die bevinding vervolgens moeten toetsen op echte data.
Synthetische en echte data zijn daarmee geen concurrerende alternatieven, maar kunnen elkaar juist aanvullen.
Bijna net zo goed als echte data
De TU/e onderzoekt deze mogelijkheden momenteel in een pilot. Voor het genereren van synthetische data, werkt de universiteit samen met BlueGenAI, een start-up die op basis van echte datasets synthetische data produceert. Daarbij wordt gebruikgemaakt van anDREa, een beveiligde cloudomgeving voor onderzoeksdata.
Een van de onderzoekers die aan de pilot meewerkt, is Freek Relouw. Hij zit in het laatste jaar van zijn promotieonderzoek aan de faculteit Biomedical Engineering. In samenwerking met het Radboudumc gebruikt hij echte medische data om een model te ontwikkelen dat kan voorspellen of een patiënt na een operatie nierfalen krijgt.
Op een gegeven moment kwam de vraag of hij wilde meedoen aan een pilot om het gebruik van synthetische data te testen. “Daar wilde ik wel aan meewerken”, zegt Relouw.
BlueGenAI creëerde op basis van echte patiëntdata synthetische datasets waarop Relouws model werd getraind. “Ik had al een werkend model liggen, dus daaraan zou het niet liggen als het niet zou werken”, zegt Relouw. Zo kon worden getest of het model ook met synthetische data goede resultaten zou opleveren.
Het resultaat? “Het bleek bijna net zo goed te werken als met echte data”, zegt Relouw. Tegelijkertijd zijn synthetische data niet perfect: de kwaliteit ervan hangt af van het model waarmee ze worden gegenereerd. Toch ziet Relouw synthetische data als “een handige nieuwe tool in de toolbox”.
Minder rompslomp
De promovendus merkte daarnaast dat het werken met synthetische data een aantal voordelen heeft. “Met echte data werk je in een beveiligde omgeving – een soort cloud. Maar dan zit je op een computer waarvoor je voor iedere minuut moet betalen.
Doordat BlueGenAI de data privacy-ongevoelig maakt, kun je die gewoon naar de TU/e halen. Ik kan de data op mijn eigen computer downloaden en er overal gratis aan werken of met anderen delen.”
Ik wil me op mijn onderzoek richten en niet op de juridische en bureaucratische rompslomp eromheen
Ook maakt synthetische data de werkwijze een stuk eenvoudiger. “Normaal gesproken moet je met een ziekenhuis een contract opstellen over hoe de data worden afgeschermd. Daarna moeten de data vaak ook nog handmatig worden geanonimiseerd voordat je ze kunt delen. Dat kost superveel tijd”, zegt hij. “Ik wil me op mijn onderzoek richten en niet op de juridische en bureaucratische rompslomp eromheen.”
Verder met de pilot
Guzman hoopt de universiteit de pilot kan voortzetten, zodat ze de mogelijkheden van synthetische data verder kan verkennen. “We nodigen onderzoekers graag uit om van deze diensten gebruik te maken en de meerwaarde ervan te ontdekken.”
“Mijn grootste doel zou zijn dat wanneer een onderzoeker een publicatie leest en denkt: ‘Die correlatie heb ik nog niet eerder gezien. Ik wil controleren of die klopt’, de auteur kan zeggen: ‘Mijn data zijn gevoelig, maar hier zijn synthetische data waarmee je kunt reproduceren wat ik heb gedaan’”, besluit ze.


Discussie