Modely a platformy AI

Monetizace výzkumu pro školení AI: Rizika a nejlepší postupy

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Vzhledem k rostoucí poptávce po generativním umělém inteligenci (AI) roste také poptávka po vysokokvalitních datech pro školení těchto systémů. Akademické vydavatelství začala monetizovat svůj výzkumný obsah, aby poskytla data pro školení velkých jazykových modelů (LLM). Ačkoli tento vývoj vytváří nový zdroj příjmů pro vydavatelství a umožňuje generativnímu AI dělat vědecká objevy, vyvolává také kritické otázky týkající se integrity a spolehlivosti použitého výzkumu. To vede k zásadní otázce: Jsou prodávané datové sady důvěryhodné a jaké jsou důsledky této praxe pro vědeckou komunitu a modely AI?

Růst monetizovaných výzkumných dohod

Velké akademické vydavatelství, jako je Wiley, Taylor & Francis a další, hlásí významné příjmy z licencování svého obsahu technologickým společnostem, které vyvíjí generativní modely AI. Například Wiley uvedl, že získal přes 40 milionů dolarů z těchto dohod pouze letos. Tyto dohody umožňují společnostem AI přístup k rozmanitým a rozsáhlým vědeckým datovým sadám, což by mělo zlepšit kvalitu jejich nástrojů AI.

Argument vydavatelství je jednoduchý: licencování zajišťuje lepší modely AI, které prospějí společnosti a zároveň odmění autory royalty. Tento obchodní model prospívá jak technologickým společnostem, tak vydavatelstvím. Nicméně, rostoucí trend monetizace vědeckých znalostí má rizika, zejména když se pochybný výzkum dostane do datových sad pro školení AI.

Stín pochybného výzkumu

Vědecká komunita není cizí s problémy s podvodným výzkumem. Studie naznačují, že mnoho publikovaných zjištění je vadných, zkreslených nebo prostě nespolehlivých. Průzkum z roku 2020 ukázal, že téměř polovina výzkumníků uváděla problémy, jako je selektivní reporting dat nebo špatně navržené terénní studie. V roce 2023 bylo kvůli falšovaným nebo nespolehlivým výsledkům staženo více než 10 000 článků, a toto číslo každoročně roste. Odborníci se domnívají, že toto číslo představuje pouze špičku ledovce, s mnoha pochybnými studiemi, které cirkulují ve vědeckých databázích.

Krizi主要 způsobují “paper mills“, stínové organizace, které vyrábějí falešné studie, často jako reakci na akademický tlak v regionech, jako je Čína, Indie a východní Evropa. Odhaduje se, že asi 2% odeslaných článků po celém světě pocházejí z paper mills. Tyto falešné články mohou vypadat jako legitimní výzkum, ale jsou plné vymyšlených dat a bezdůvodných závěrů. Zarážející je, že tyto články procházejí recenzním řízením a končí v uznávaných časopisech, což ohrožuje spolehlivost vědeckých poznatků. Například během pandemie COVID-19 chybné studie o ivermektinu falešně naznačovaly jeho účinnost jako léčby, což způsobilo zmatky a zpožďovalo efektivní reakce veřejného zdraví. Tento příklad ukazuje potenciální újmu způsobenou šířením nespolehlivého výzkumu, kde chybné výsledky mohou mít významný dopad.

Důsledky pro školení AI a důvěru

Důsledky jsou hluboké, když se LLM učí z databází, které obsahují podvodný nebo nízkokvalitní výzkum. Modely AI používají vzorce a vztahy ve svých trénovacích datech k generování výstupů. Pokud jsou vstupní data poškozená, výstupy mohou šířit nepřesnosti nebo je dokonce zesilovat. Toto riziko je obzvláště vysoké v oblastech, jako je medicína, kde chybné AI-generované poznatky mohou mít život ohrožující důsledky.

Kromě toho tato otázka ohrožuje důvěru veřejnosti ve vědu a AI. Když vydavatelství uzavírají dohody, musí řešit obavy o kvalitě prodávaných dat. Nesplnění tohoto požadavku by mohlo poškodit reputaci vědecké komunity a podkopat potenciální benefity AI.

Zajištění důvěryhodných dat pro AI

Snížení rizik poškozeného výzkumu, který narušuje školení AI, vyžaduje společné úsilí vydavatelství, společností AI, vývojářů, výzkumníků a širší komunity. Vydavatelství musí zlepšit svůj recenzní proces, aby chybné studie odhalily, než se dostanou do trénovacích datových sad. Nabízení lepších odměn recenzentům a stanovení vyšších standardů může pomoci. Otevřený recenzní proces je zde zásadní. Přináší větší transparentnost a odpovědnost, což pomáhá budovat důvěru ve výzkum.

Společnosti AI musí být při výběru zdrojů výzkumu pro školení AI více pečlivé. Výběr vydavatelství a časopisů s dobrou reputací pro vysokokvalitní, důkladně recenzovaný výzkum je klíčový. V tomto kontextu je vhodné pečlivě prozkoumat historii vydavatelství – jako například, jak často stahují články nebo jak otevřeně komunikují o svém recenzním procesu. Selektivita zlepšuje spolehlivost dat a buduje důvěru napříč komunitami AI a výzkumu.

Vývojáři AI musí nést odpovědnost za data, která používají. To znamená spolupráci s odborníky, pečlivé ověřování výzkumu a srovnávání výsledků z více studií. Nástroje AI lze také navrhnout tak, aby identifikovaly podezřelá data a snižovaly rizika šíření pochybného výzkumu.

Transparentnost je také zásadním faktorem. Vydavatelství a společnosti AI by měly otevřeně sdílet informace o tom, jak se výzkum používá a kam jdou royalty. Nástroje, jako je Generative AI Licensing Agreement Tracker, ukazují slib, ale potřebují širší přijetí. Výzkumníci by také měli mít možnost říci, jak se jejich práce používá. Opt-in politiky, jako ty od Cambridge University Press, nabízejí autorům kontrolu nad svými příspěvky. To buduje důvěru, zajišťuje spravedlnost a činí autory aktivními účastníky tohoto procesu.

Kromě toho by se měla podporovat otevřená dostupnost kvalitního výzkumu, aby se zajistila inkluzivita a spravedlnost ve vývoji AI. Vládny, neziskové organizace a průmysloví hráči mohou financovat iniciativy otevřeného přístupu, snižující tak závislost na komerčních vydavatelstvích pro kritická trénovací data. Kromě toho průmysl AI potřebuje jasná pravidla pro etické získávání dat. Soustředěním se na spolehlivý, důkladně recenzovaný výzkum můžeme budovat lepší nástroje AI, chránit vědeckou integritu a udržovat důvěru veřejnosti ve vědu a technologii.

Závěrečné stanovisko

Monetizace výzkumu pro školení AI představuje jak příležitosti, tak výzvy. Zatímco licencování akademického obsahu umožňuje vývoj výkonnějších modelů AI, také vyvolává obavy o integritě a spolehlivosti použitých dat. Chybný výzkum, včetně toho z “paper mills”, může znehodnotit trénovací datové sady AI, což může vést k nepřesnostem, které podkopávají důvěru veřejnosti a potenciální benefity AI. Aby se zajistilo, že modely AI jsou postaveny na důvěryhodných datech, vydavatelství, společnosti AI a vývojáři musí spolupracovat, aby zlepšili recenzní procesy, zvýšili transparentnost a priorizovali kvalitní, důkladně ověřený výzkum. Tímto způsobem můžeme zajistit budoucnost AI a zachovat integritu vědecké komunity.

Dr. Tehseen Zia je docent s trvalým úvazkem na COMSATS University Islamabad, držitel titulu PhD v oblasti AI z Vienna University of Technology, Rakousko. Specializuje se na umělou inteligenci, strojové učení, datové vědy a počítačové vidění, a významně přispěl publikacemi v renomovaných vědeckých časopisech. Dr. Tehseen také vedl různé průmyslové projekty jako hlavní výzkumník a působil jako konzultant pro umělou inteligenci.