Модели и платформы ИИ

Монетизация исследований для обучения ИИ: риски и лучшие практики

mm
Добавьте Unite.AI в избранные источники в Google

По мере роста спроса на генеративный ИИ растет и потребность в высококачественных данных для обучения этих систем. Издатели научных журналов начали монетизировать свою исследовательскую деятельность, чтобы предоставить обучающие данные для крупномасштабных языковых моделей (LLM). Хотя это развитие создает новый источник дохода для издателей и способствует научным открытиям с помощью генеративного ИИ, оно также вызывает серьезные вопросы о целостности и надежности используемых исследований. Это вызывает важный вопрос: являются ли продаваемые наборы данных достоверными, и какие последствия это имеет для научного сообщества и моделей ИИ?

Рост монетизированных исследовательских сделок

Крупные академические издатели, включая Wiley, Taylor & Francis и других, сообщили о значительных доходах от лицензирования своего контента технологическим компаниям, разрабатывающим генеративные модели ИИ. Например, Wiley раскрыла более 40 миллионов долларов дохода от таких сделок в этом году. Эти соглашения позволяют компаниям ИИ получить доступ к разнообразным и обширным научным наборам данных, что, как предполагается, улучшает качество их инструментов ИИ.

Аргументация издателей проста: лицензирование обеспечивает лучшие модели ИИ, принося пользу обществу и вознаграждая авторов роялти. Эта бизнес-модель выгодна как для технологических компаний, так и для издателей. Однако растущая тенденция монетизации научных знаний несет в себе риски, особенно когда сомнительные исследования проникают в эти наборы данных для обучения ИИ.

Тень поддельных исследований

Научное сообщество не чуждо проблемам с мошенническими исследованиями. Исследования показывают, что многие опубликованные результаты ошибочны, предвзяты или просто ненадежны. Опрос 2020 года показал, что почти половина исследователей сообщили о проблемах, таких как селективное сообщение о данных или плохо спланированные полевые исследования. В 2023 году более 10 000 статей были отозваны из-за фальсифицированных или ненадежных результатов, и это число продолжает расти ежегодно. Эксперты считают, что эта цифра представляет собой только верхушку айсберга, и что бесчисленные сомнительные исследования циркулируют в научных базах данных.

Кризис в основном вызван “фабриками исследовательских работ“, тенью организациями, которые производят фальшивые исследования, часто в ответ на академическое давление в регионах, таких как Китай, Индия и Восточная Европа. Оценивается, что около 2% журнальных статей во всем мире поступают от фабрик исследовательских работ. Эти фальшивые статьи могут выглядеть как законные исследования, но они наполнены вымышленными данными и безосновательными выводами. Волнительно, что такие статьи проходят через рецензирование и попадают в уважаемые журналы, компрометируя надежность научных прозрений. Например, во время пандемии COVID-19 ошибочные исследования об ивермектине ложно предполагали его эффективность в качестве лечения, сея путаницу и задерживая эффективные общественные меры здравоохранения. Этот пример подчеркивает потенциальный вред от распространения ненадежных исследований, где ошибочные результаты могут иметь значительное влияние.

Последствия для обучения ИИ и доверия

Последствия глубоки, когда ИИ обучается на базах данных, содержащих фальшивые или низкокачественные исследования. Модели ИИ используют закономерности и отношения внутри своих обучающих данных для генерации выводов. Если входные данные испорчены, выводы могут увековечить неточности или даже усилить их. Этот риск особенно высок в областях, таких как медицина, где неправильные выводы ИИ могут иметь угрожающие жизни последствия.
Кроме того, эта проблема угрожает общественному доверию к академии и ИИ. По мере того, как издатели продолжают заключать соглашения, они должны решить проблемы качества продаваемых данных. Неудача в этом может нанести ущерб репутации научного сообщества и подорвать потенциальные выгоды ИИ.

Обеспечение достоверных данных для ИИ

Снижение рисков, связанных с ошибочными исследованиями, которые нарушают обучение ИИ, требует совместных усилий издателей, компаний ИИ, разработчиков, исследователей и более широкого сообщества. Издатели должны улучшить процесс рецензирования, чтобы поймать ненадежные исследования, прежде чем они попадут в наборы данных для обучения. Предоставление лучших наград рецензентам и установление более высоких стандартов может помочь. Открытый процесс рецензирования имеет решающее значение здесь. Он приносит больше прозрачности и подотчетности, помогая построить доверие к исследованиям.
Компании ИИ должны быть более осторожными при выборе партнеров для получения исследований для обучения ИИ. Выбор издателей и журналов с сильной репутацией за высококачественные, хорошо проверенные исследования является ключевым. В этом контексте стоит внимательно изучить репутацию издателя – например, как часто они отзывают статьи или насколько открыты они в отношении своего процесса рецензирования. Быть избирательным улучшает надежность данных и строит доверие в сообществах ИИ и исследований.

Разработчики ИИ должны взять на себя ответственность за используемые ими данные. Это означает работу с экспертами, тщательную проверку исследований и сравнение результатов из нескольких исследований. Инструменты ИИ также могут быть разработаны для выявления подозрительных данных и снижения рисков распространения сомнительных исследований.

Прозрачность также является важным фактором. Издатели и компании ИИ должны открыто делиться информацией о том, как используются исследования и куда идут роялти. Инструменты, такие как Отслеживатель лицензионных соглашений ИИ, показывают перспективы, но им необходима более широкая поддержка. Исследователи также должны иметь возможность высказаться о том, как используется их работа. Политики согласия, такие как те, которые предлагает Cambridge University Press, предоставляют авторам контроль над их вкладом. Это строит доверие, обеспечивает справедливость и делает авторов активными участниками этого процесса.

Кроме того, открытый доступ к высококачественным исследованиям должен быть поощрен для обеспечения инклюзивности и справедливости в разработке ИИ. Правительства, некоммерческие организации и отраслевые игроки могут финансировать инициативы по открытому доступу, снижая зависимость от коммерческих издателей для критически важных наборов данных для обучения. Кроме того, отрасль ИИ нуждается в ясных правилах для этичного получения данных. Сосредоточившись на надежных, хорошо проверенных исследованиях, мы можем создать лучшие инструменты ИИ, защитить научную целостность и сохранить общественное доверие к науке и технологиям.

Итог

Монетизация исследований для обучения ИИ представляет как возможности, так и проблемы. Хотя лицензирование академического контента позволяет разработать более мощные модели ИИ, оно также вызывает обеспокоенность по поводу целостности и надежности используемых данных. Ошибочные исследования, включая те, которые поступают от “фабрик исследовательских работ”, могут испортить наборы данных для обучения ИИ, что может привести к неточностям, которые могут подорвать общественное доверие и потенциальные выгоды ИИ. Чтобы обеспечить, чтобы модели ИИ были построены на достоверных данных, издатели, компании ИИ и разработчики должны работать вместе, чтобы улучшить процессы рецензирования, повысить прозрачность и отдать приоритет высококачественным, хорошо проверенным исследованиям. Таким образом, мы можем защитить будущее ИИ и сохранить целостность научного сообщества.

Доктор Техсин Зия является доцентом в университете COMSATS в Исламабаде, имеющим степень PhD в области ИИ в Венском техническом университете, Австрия. Специализируясь в области искусственного интеллекта, машинного обучения, науки о данных и компьютерного зрения, он внес значительный вклад с публикациями в авторитетных научных журналах. Доктор Техсин также возглавлял различные промышленные проекты в качестве основного исследователя и служил консультантом по ИИ.