Modele și platforme AI
Monetizarea cercetării pentru antrenarea inteligenței artificiale: Riscuri și cele mai bune practici
Pe măsură ce crește cererea de inteligență artificială generativă, crește și foamea de date de înaltă calitate pentru a antrena aceste sisteme. Editorii academici au început să-și monetizeze conținutul de cercetare pentru a furniza date de antrenament pentru modelele de limbaj mare (LLM). Deși acest lucru creează un nou flux de venituri pentru editori și împuternicește inteligența artificială pentru descoperiri științifice, ridică întrebări critice despre integritatea și fiabilitatea cercetării utilizate. Acest lucru ridică o întrebare crucială: Sunt seturile de date vândute de încredere, și ce implicații are această practică pentru comunitatea științifică și modelele de inteligență artificială?
Apariția acordurilor de cercetare monetizate
Editorii academici majore, inclusiv Wiley, Taylor & Francis și alții, au raportat venituri substanțiale din licențierea conținutului lor către companiile tehnologice care dezvoltă modele de inteligență artificială generativă. De exemplu, Wiley a dezvăluit peste 40 de milioane de dolari în câștiguri din astfel de acorduri în acest an singur. Aceste acorduri permit companiilor de inteligență artificială să acceseze seturi de date științifice diverse și extinse, presupunând îmbunătățirea calității instrumentelor lor de inteligență artificială.
Prezentarea editorilor este simplă: licențierea asigură modele de inteligență artificială mai bune, beneficiind societatea și răsplătind autorii cu drepturi de autor. Acest model de afaceri beneficiază atât companiile tehnologice, cât și editorii. Cu toate acestea, tendința crescândă de a monetiza cunoașterea științifică are riscuri, în special atunci când cercetările discutabile pătrund în aceste seturi de date de antrenament pentru inteligență artificială.
Umbra cercetării false
Comunitatea științifică nu este străină de problemele cercetărilor frauduloase. Studiile sugerează că multe descoperiri publicate sunt defectuoase, părtinitoare sau pur și simplu neverosimile. Un sondaj din 2020 a arătat că aproape jumătate dintre cercetători au raportat probleme precum raportarea selectivă a datelor sau studii de teren prost proiectate. În 2023, peste 10.000 de articole au fost retractate din cauza rezultatelor falsificate sau neverosimile, un număr care continuă să crească anual. Experții cred că această cifră reprezintă vârful aisbergului, cu nenumărate studii discutabile circulând în bazele de date științifice.
Criza a fost provocată în primul rând de “fabricile de articole de cercetare“, organizații umbroase care produc studii fabricate, adesea ca răspuns la presiunile academice în regiuni precum China, India și Europa de Est. Se estimează că aproximativ 2% din depunerile de articole de reviste la nivel global provin de la aceste fabrici de articole. Aceste articole false pot semăna cu cercetări legitime, dar sunt pline de date fictive și concluzii fără bază. În mod îngrijorător, astfel de articole trec prin procesul de peer review și ajung în reviste respectate, compromițând fiabilitatea insight-urilor științifice. De exemplu, în timpul pandemiei COVID-19, studii defectuoase despre ivermectină au sugerat în mod fals eficacitatea sa ca tratament, semănând confuzie și întârziind răspunsurile eficiente de sănătate publică. Acest exemplu subliniază potențialul de rău al diseminării cercetărilor neverosimile, unde rezultatele defectuoase pot avea un impact semnificativ.
Consecințe pentru antrenarea inteligenței artificiale și încrederea
Implicațiile sunt profunde atunci când modelele LLM se antrenează pe baze de date care conțin cercetări frauduloase sau de calitate scăzută. Modelele de inteligență artificială folosesc modele și relații din datele de antrenament pentru a genera ieșiri. Dacă datele de intrare sunt corupte, ieșirile pot perpetua inexactități sau chiar le pot amplifica. Acest risc este deosebit de ridicat în domenii precum medicina, unde informațiile generate de inteligența artificială pot avea consecințe cu adevărat periculoase.
Mai mult, problema amenință încrederea publică în academia și inteligența artificială. Pe măsură ce editorii continuă să încheie acorduri, ei trebuie să abordeze îngrijorările cu privire la calitatea datelor vândute. Eșecul de a face acest lucru poate dăuna reputației comunității științifice și poate submina beneficiile potențiale ale inteligenței artificiale.
Asigurarea datelor de încredere pentru inteligența artificială
Reducerea riscurilor cercetărilor defectuoase care perturbă antrenamentul inteligenței artificiale necesită un efort comun din partea editorilor, companiilor de inteligență artificială, dezvoltatorilor, cercetătorilor și comunității mai largi. Editorii trebuie să îmbunătățească procesul de peer review pentru a prinde studii neverosimile înainte de a ajunge în seturile de date de antrenament. Oferirea unor recompense mai bune pentru recenzori și stabilirea unor standarde mai înalte poate ajuta. Un proces de peer review deschis este esențial aici. Acesta aduce mai multă transparență și responsabilitate, ajutând la construirea încrederii în cercetare.
Companiile de inteligență artificială trebuie să fie mai atente atunci când aleg cu cine lucrează pentru a obține cercetări pentru antrenamentul inteligenței artificiale. Alegerea editorilor și revistelor cu o reputație puternică pentru cercetări de înaltă calitate, bine examinate, este cheia. În acest context, este important să se examineze cu atenție istoricul unui editor – cum ar fi frecvența cu care retractează articole sau cât de deschis este despre procesul de peer review. A fi selectiv îmbunătățește fiabilitatea datelor și construiește încredere în comunitățile de inteligență artificială și cercetare.
Dezvoltatorii de inteligență artificială trebuie să-și asume responsabilitatea pentru datele pe care le utilizează. Acest lucru înseamnă colaborarea cu experți, verificarea atentă a cercetărilor și compararea rezultatelor din multiple studii. Uneltele de inteligență artificială însele pot fi, de asemenea, proiectate pentru a identifica date suspecte și a reduce riscurile cercetărilor discutabile care se răspândesc mai departe.
Transparența este, de asemenea, un factor esențial. Editorii și companiile de inteligență artificială ar trebui să facă publice detaliile despre modul în care se utilizează cercetarea și unde merg drepturile de autor. Unelte precum Generative AI Licensing Agreement Tracker arată promițător, dar necesită o adoptare mai largă. Cercetătorii ar trebui, de asemenea, să aibă un cuvânt de spus în ceea ce privește modul în care este utilizată munca lor. Politicile de opt-in, precum cele de la Orcid, oferă autorilor control asupra contribuțiilor lor. Acest lucru construiește încredere, asigură echitate și face ca autorii să participe activ la acest proces.
Mai mult, ar trebui încurajată accesul liber la cercetări de înaltă calitate pentru a asigura inclusivitate și echitate în dezvoltarea inteligenței artificiale. Guvernele, organizațiile non-profit și jucătorii din industrie pot finanța inițiative de acces liber, reducând dependența de editori comerciali pentru seturile de date de antrenament critice. Pe lângă aceasta, industria inteligenței artificiale are nevoie de reguli clare pentru obținerea datelor în mod etic. Concentrându-se pe cercetări de încredere, bine examinate, putem construi unelte de inteligență artificială mai bune, proteja integritatea științifică și menține încrederea publică în știință și tehnologie.
Concluzia
Monetizarea cercetării pentru antrenarea inteligenței artificiale prezintă atât oportunități, cât și provocări. În timp ce licențierea conținutului academic permite dezvoltarea unor modele de inteligență artificială mai puternice, ridică și îngrijorări cu privire la integritatea și fiabilitatea datelor utilizate. Cercetarea defectuoasă, inclusiv cea de la “fabricile de articole”, poate corupe seturile de date de antrenament, ducând la inexactități care pot submina încrederea publică și beneficiile potențiale ale inteligenței artificiale. Pentru a asigura ca modelele de inteligență artificială să fie construite pe date de încredere, editorii, companiile de inteligență artificială și dezvoltatorii trebuie să lucreze împreună pentru a îmbunătăți procesele de peer review, a crește transparența și a prioritiza cercetări de înaltă calitate, bine verificate. Prin a face acest lucru, putem proteja viitorul inteligenței artificiale și menține integritatea comunității științifice.












