AI-modeller och plattformar

Monetisering av forskning för AI-utbildning: Risker och bästa praxis

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Med den ökande efterfrågan på generativ AI växer också hungern efter högkvalitativa data för att träna dessa system. Vetenskapliga förlag har börjat monetisera sin forskningsinnehåll för att tillhandahålla träningsdata för stora språkmodeller (LLM). Medan denna utveckling skapar en ny intäktsström för förlag och möjliggör generativ AI för vetenskapliga upptäckter, väcker den också kritiska frågor om integriteten och tillförlitligheten hos den forskning som används. Detta väcker en avgörande fråga: Är de dataset som säljs tillförlitliga, och vilka implikationer har denna praxis för den vetenskapliga gemenskapen och generativa AI-modeller?

Upptakten för monetiserade forskningsavtal

Stora akademiska förlag, inklusive Wiley, Taylor & Francis och andra, har rapporterat betydande intäkter från licensiering av sitt innehåll till teknikföretag som utvecklar generativa AI-modeller. Till exempel avslöjade Wiley över 40 miljoner dollar i intäkter från sådana avtal under det senaste året. Dessa avtal möjliggör för AI-företag att få tillgång till diversifierade och omfattande vetenskapliga dataset, vilket förmodligen förbättrar kvaliteten på deras AI-verktyg.

Förlagens pitch är rak: licensiering säkerställer bättre AI-modeller, som gynnar samhället samtidigt som författarna belönas med royalty. Denna affärsmodell gynnar både teknikföretag och förlag. Men den ökande trenden att monetisera vetenskaplig kunskap har risker, särskilt när tvivelaktig forskning tränger in i dessa AI-träningsdataset.

Skuggan av bedräglig forskning

Den vetenskapliga gemenskapen är ingen främling för problem med bedräglig forskning. Studier tyder på att många publicerade fynd är felaktiga, partiska eller bara opålitliga. En undersökning från 2020 fann att nästan hälften av forskarna rapporterade problem som selektiv dataredovisning eller dåligt utformade fältstudier. År 2023 drogs över 10 000 artiklar tillbaka på grund av falsifierade eller opålitliga resultat, ett antal som fortsätter att öka varje år. Experter tror att denna siffra representerar toppen av ett isberg, med otaliga tvivelaktiga studier som cirkulerar i vetenskapliga databaser.

Krisen har i huvudsak drivits av “paper mills“, skuggorganisationer som producerar fabricerade studier, ofta som svar på akademiska påtryckningar i regioner som Kina, Indien och Östeuropa. Det uppskattas att cirka 2% av tidskriftsinskick globalt kommer från paper mills. Dessa skenstudier kan likna legitim forskning men är fulla av falsk data och grundlösa slutsatser. Förskräckande nog kan sådana artiklar smita förbi peer review och hamna i respekterade tidskrifter, vilket komprometterar tillförlitligheten hos vetenskapliga insikter. Till exempel under COVID-19-pandemin visade felaktiga studier om ivermectin falskt dess effektivitet som behandling, vilket sådde förvirring och försenade effektiva folkhälsoåtgärder. Detta exempel belyser den potentiella skadan av att sprida opålitlig forskning, där felaktiga resultat kan ha en betydande inverkan.

Konsekvenser för AI-utbildning och tillit

Implikationerna är djupgående när LLM tränas på databaser som innehåller bedräglig eller lågkvalitativ forskning. AI-modeller använder mönster och relationer inom sin träningsdata för att generera utdata. Om indata är korrupta, kan utdatan fortsätta eller till och med förstärka felaktigheter. Denna risk är särskilt hög inom områden som medicin, där felaktiga AI-genererade insikter kan ha livshotande konsekvenser.
Dessutom hotar problemet allmänhetens tillit till akademin och AI. När förlag fortsätter att ingå avtal måste de hantera frågor om kvaliteten på de data som säljs. Om de inte lyckas kan det skada anseendet för den vetenskapliga gemenskapen och undergräva AI:s potentiella samhällsnytta.

Säkerställande av tillförlitliga data för AI

Att minska riskerna med felaktig forskning som stör AI-utbildning kräver ett gemensamt arbete från förlag, AI-företag, utvecklare, forskare och den bredare gemenskapen. Förlag måste förbättra sin peer-review-process för att fånga opålitliga studier innan de hamnar i träningsdataset. Att erbjuda bättre belöningar för granskare och högre standarder kan hjälpa. En öppen granskningsprocess är avgörande här. Den bringar mer transparens och ansvar, vilket hjälper till att bygga tillit till forskningen.
AI-företag måste vara mer försiktiga med vem de samarbetar med när de hämtar forskning för AI-utbildning. Att välja förlag och tidskrifter med ett starkt rykte för högkvalitativ, välgranskad forskning är nyckeln. I detta sammanhang är det värt att titta närmare på en förläggares spårrekord – som hur ofta de drar tillbaka artiklar eller hur öppna de är om sin granskningsprocess. Att vara selektiv förbättrar datans tillförlitlighet och bygger tillit över AI- och forskargemenskaperna.

AI-utvecklare måste ta ansvar för de data de använder. Detta innebär att arbeta med experter, noggrant kontrollera forskning och jämföra resultat från flera studier. AI-verktyg kan också utformas för att identifiera misstänkta data och minska riskerna med tvivelaktig forskning som sprids vidare.

Transparens är också en avgörande faktor. Förlag och AI-företag bör öppet dela information om hur forskning används och var royalty går. Verktyg som Generative AI Licensing Agreement Tracker visar löfte men behöver bredare antagande. Forskare bör också ha ett ord med i laget om hur deras arbete används. Opt-in-policyer, som de från Cambridge University Press, erbjuder författare kontroll över sina bidrag. Detta bygger tillit, säkerställer rättvisa och gör att författare aktivt deltar i denna process.

Dessutom bör öppen tillgång till högkvalitativ forskning uppmuntras för att säkerställa inclusivitet och rättvisa i AI-utveckling. Regeringar, ideella organisationer och branschaktörer kan finansiera öppna tillgångsinitiativ, vilket minskar beroendet av kommersiella förlag för kritiska träningsdataset. Utöver detta behöver AI-branschen tydliga regler för etisk datainsamling. Genom att fokusera på tillförlitlig, välgranskad forskning kan vi bygga bättre AI-verktyg, skydda vetenskaplig integritet och upprätthålla allmänhetens tillit till vetenskap och teknik.

Sammanfattning

Att monetisera forskning för AI-utbildning presenterar både möjligheter och utmaningar. Medan licensiering av akademiskt innehåll möjliggör utveckling av kraftfullare AI-modeller, väcker det också frågor om integriteten och tillförlitligheten hos de data som används. Felaktig forskning, inklusive den från “paper mills”, kan korrumpera AI-träningsdataset, vilket leder till felaktigheter som kan undergräva allmänhetens tillit och AI:s potentiella fördelar. För att säkerställa att AI-modeller byggs på tillförlitliga data måste förlag, AI-företag och utvecklare arbeta tillsammans för att förbättra peer-review-processer, öka transparens och prioritera högkvalitativ, välgranskad forskning. Genom att göra detta kan vi säkra AI:s framtid och upprätthålla den vetenskapliga gemenskapens integritet.

Dr. Tehseen Zia är en fast anställd biträdande professor vid COMSATS University Islamabad, med en doktorsexamen i AI från Vienna University of Technology, Österrike. Specialiserad på artificiell intelligens, maskinlärning, datavetenskap och datorseende, har han gjort betydande bidrag med publikationer i ansedda vetenskapliga tidskrifter. Dr. Tehseen har också lett olika industriprojekt som huvudutredare och tjänstgjort som AI-konsult.