AI-modellen en platforms
Het Monetizeren van Onderzoek voor AI-Training: De Risico’s en Beste Praktijken
Naarmate de vraag naar generatieve AI toeneemt, neemt ook de behoefte aan hoge kwaliteit data om deze systemen te trainen toe. Wetenschappelijke uitgevers zijn begonnen hun onderzoeksinhoud te monetizeren om trainingsdata voor grote taalmodellen (LLM’s) te bieden. Hoewel deze ontwikkeling een nieuwe inkomstenstroom voor uitgevers creëert en generatieve AI voor wetenschappelijke ontdekkingen empowerd, roept het kritische vragen op over de integriteit en betrouwbaarheid van het gebruikte onderzoek. Dit roept een cruciale vraag op: zijn de verkochte datasets betrouwbaar, en wat zijn de implicaties van deze praktijk voor de wetenschappelijke gemeenschap en generatieve AI-modellen?
De Opkomst van Gemonetiseerde Onderzoeksdeal
Grote academische uitgevers, waaronder Wiley, Taylor & Francis en anderen, hebben aanzienlijke inkomsten gemeld uit het licenseren van hun inhoud aan technologiebedrijven die generatieve AI-modellen ontwikkelen. Zo heeft Wiley alleen al dit jaar meer dan $40 miljoen aan inkomsten uit dergelijke deal gemeld. Deze overeenkomsten stellen AI-bedrijven in staat om toegang te krijgen tot diverse en uitgebreide wetenschappelijke datasets, waardoor de kwaliteit van hun AI-hulpmiddelen verbetert.
Het verhaal van de uitgevers is eenvoudig: licenseren zorgt voor betere AI-modellen, waardoor de samenleving wordt gebaat en auteurs royalty’s ontvangen. Dit zakenmodel is gunstig voor zowel technologiebedrijven als uitgevers. Echter, de toenemende trend om wetenschappelijke kennis te monetizeren, houdt risico’s in, vooral wanneer twijfelachtig onderzoek deze AI-trainingsdatasets binnendringt.
De Schaduw van Vals Onderzoek
De wetenschappelijke gemeenschap is niet onbekend met problemen van frauduleus onderzoek. Studies suggereren dat veel gepubliceerde bevindingen gebrekkig, bevooroordeeld of onbetrouwbaar zijn. Een enquête uit 2020 toonde aan dat bijna de helft van de onderzoekers problemen meldden zoals selectieve gegevensrapportage of slecht ontworpen veldstudies. In 2023 werden meer dan 10.000 papers ingetrokken vanwege vervalste of onbetrouwbare resultaten, een aantal dat jaarlijks blijft stijgen. Deskundigen geloven dat dit cijfer slechts de top van de ijsberg is, met talloze twijfelachtige studies die circuleren in wetenschappelijke databases.
De crisis is voornamelijk gedreven door “onderzoeks papiermolens,” schaduworganisaties die gefabriceerde studies produceren, vaak als reactie op academische druk in regio’s zoals China, India en Oost-Europa. Men schat dat ongeveer 2% van de journaalindieningen wereldwijd afkomstig zijn van papiermolens. Deze schijnbaar legitieme papers kunnen fictieve gegevens en basisloze conclusies bevatten. Bezorgend genoeg, komen dergelijke papers door peer review en belanden ze in gerespecteerde tijdschriften, waardoor de betrouwbaarheid van wetenschappelijke inzichten in gevaar komt. Bijvoorbeeld, tijdens de COVID-19-pandemie, gebrekkige studies over ivermectine suggereerden ten onrechte dat het een effectieve behandeling was, waardoor verwarring ontstond en effectieve publieke gezondheidsreacties werden vertraagd. Dit voorbeeld benadrukt de potentiële schade van het verspreiden van onbetrouwbaar onderzoek, waarbij onjuiste resultaten een aanzienlijke impact kunnen hebben.
Gevolgen voor AI-Training en Vertrouwen
De implicaties zijn diepgaand wanneer LLM’s worden getraind op databases die frauduleus of van lage kwaliteit onderzoek bevatten. AI-modellen gebruiken patronen en relaties binnen hun trainingsdata om outputs te genereren. Als de invoerdata corrupt is, kunnen de outputs onnauwkeurigheden in stand houden of zelfs versterken. Dit risico is vooral hoog in gebieden zoals geneeskunde, waar onjuiste AI-gegenereerde inzichten levensbedreigende gevolgen kunnen hebben.
Bovendien bedreigt dit probleem het vertrouwen van het publiek in de academische wereld en AI. Terwijl uitgevers voortgaan met het maken van overeenkomsten, moeten ze zich richten op de kwaliteit van de verkochte data. Als ze dit niet doen, kan dit de reputatie van de wetenschappelijke gemeenschap schaden en de potentieel gunstige effecten van AI ondermijnen.
Garanderen van Betrouwbaarheidsgegevens voor AI
Het reduceren van de risico’s van gebrekkig onderzoek dat AI-training verstoort, vereist een gezamenlijke inspanning van uitgevers, AI-bedrijven, ontwikkelaars, onderzoekers en de bredere gemeenschap. Uitgevers moeten hun peer-reviewproces verbeteren om onbetrouwbare studies te detecteren voordat ze in trainingsdatasets terechtkomen. Het bieden van betere beloningen voor reviewers en het stellen van hogere standaarden kan helpen. Een open reviewproces is hier cruciaal. Het brengt meer transparantie en verantwoordelijkheid, waardoor vertrouwen in het onderzoek wordt opgebouwd.
AI-bedrijven moeten voorzichtiger zijn over wie ze samenwerken bij het zoeken naar onderzoek voor AI-training. Het kiezen van uitgevers en tijdschriften met een sterke reputatie voor hoogwaardig, goed beoordeeld onderzoek is essentieel. In deze context is het de moeite waard om naar de trackrecord van een uitgever te kijken – zoals hoe vaak ze papers intrekken of hoe open ze zijn over hun reviewproces. Selectief zijn verbetert de betrouwbaarheid van de data en bouwt vertrouwen op in de AI- en onderzoeksgemeenschappen.
AI-ontwikkelaars moeten verantwoordelijkheid nemen voor de data die ze gebruiken. Dit betekent samenwerken met experts, onderzoek zorgvuldig controleren en resultaten van meerdere studies vergelijken. AI-hulpmiddelen kunnen ook worden ontworpen om verdachte data te identificeren en de risico’s van twijfelachtig onderzoek te reduceren.
Transparantie is ook een essentieel factor. Uitgevers en AI-bedrijven moeten openlijk details delen over hoe onderzoek wordt gebruikt en waar royalty’s naartoe gaan. Hulpmiddelen zoals de Generatieve AI-licentieovereenkomst Tracker laten veelbelovende resultaten zien, maar hebben bredere adoptie nodig. Onderzoekers moeten ook een zeg te hebben in hoe hun werk wordt gebruikt. Opt-in-beleid, zoals die van Cambridge University Press, biedt auteurs controle over hun bijdragen. Dit bouwt vertrouwen op, garandeert eerlijkheid en maakt auteurs actief deelgenoot van dit proces.
Bovendien moet open toegang tot hoogwaardig onderzoek worden aangemoedigd om inclusiviteit en eerlijkheid in AI-ontwikkeling te garanderen. Overheden, non-profitorganisaties en industrie spelers kunnen open toegangsinitiatieven financieren, waardoor de afhankelijkheid van commerciële uitgevers voor kritieke trainingsdatasets wordt vermindert. Bovendien heeft de AI-industrie duidelijke regels nodig voor het ethisch sourcen van data. Door ons te richten op betrouwbare, goed beoordeelde onderzoeken, kunnen we betere AI-hulpmiddelen bouwen, de integriteit van de wetenschap beschermen en het vertrouwen van het publiek in wetenschap en technologie behouden.
De Kern
Het monetizeren van onderzoek voor AI-training biedt zowel kansen als uitdagingen. Hoewel het licenseren van academische inhoud de ontwikkeling van krachtigere AI-modellen mogelijk maakt, roept het ook vragen op over de integriteit en betrouwbaarheid van de gebruikte data. Gebrekkig onderzoek, inclusief dat van “papiermolens”, kan AI-trainingsdatasets corrumperen, leidend tot onnauwkeurigheden die het vertrouwen van het publiek en de potentieel gunstige effecten van AI kunnen ondermijnen. Om ervoor te zorgen dat AI-modellen zijn gebouwd op betrouwbare data, moeten uitgevers, AI-bedrijven en ontwikkelaars samenwerken om peer-reviewprocessen te verbeteren, transparantie te vergroten en prioriteit te geven aan hoogwaardig, goed beoordeeld onderzoek. Door dit te doen, kunnen we de toekomst van AI waarborgen en de integriteit van de wetenschappelijke gemeenschap handhaven.












