Modelos y plataformas de IA

Monetizar la investigación para el entrenamiento de IA: Riesgos y mejores prácticas

mm
Añade Unite.AI a tus fuentes preferidas en Google

A medida que crece la demanda de IA generativa, también lo hace el hambre de datos de alta calidad para entrenar estos sistemas. Los editores académicos han comenzado a monetizar su contenido de investigación para proporcionar datos de entrenamiento para grandes modelos de lenguaje (LLM). Si bien este desarrollo crea una nueva fuente de ingresos para los editores y permite el desarrollo de IA para descubrimientos científicos, plantea preguntas críticas sobre la integridad y confiabilidad de la investigación utilizada. Esto plantea una pregunta crucial: ¿Son de confianza los conjuntos de datos que se venden, y qué implicaciones tiene esta práctica para la comunidad científica y los modelos de IA?

El auge de los acuerdos de investigación monetizados

Los principales editores académicos, incluidos Wiley, Taylor & Francis, y otros, han informado sobre ingresos sustanciales por licenciar su contenido a empresas de tecnología que desarrollan modelos de IA generativa. Por ejemplo, Wiley reveló más de $40 millones en ganancias de tales acuerdos este año solo. Estos acuerdos permiten a las empresas de IA acceder a conjuntos de datos científicos diversificados y amplios, lo que presumiblemente mejora la calidad de sus herramientas de IA.

La propuesta de los editores es directa: la licencia garantiza mejores modelos de IA, beneficiando a la sociedad y recompensando a los autores con regalías. Este modelo de negocio beneficia a las empresas de tecnología y a los editores. Sin embargo, la tendencia creciente de monetizar el conocimiento científico conlleva riesgos, sobre todo cuando la investigación cuestionable se infiltra en estos conjuntos de datos de entrenamiento de IA.

La sombra de la investigación falsa

La comunidad académica no es ajena a los problemas de investigación fraudulenta. Los estudios sugieren que muchos hallazgos publicados están defectuosos, sesgados o simplemente poco fiables. Una encuesta de 2020 encontró que casi la mitad de los investigadores informaron problemas como la presentación selectiva de datos o estudios de campo mal diseñados. En 2023, más de 10,000 artículos fueron retractados debido a resultados falsificados o poco fiables, una cifra que continúa aumentando anualmente. Los expertos creen que esta cifra representa la punta del iceberg, con innumerables estudios dudosos circulando en bases de datos científicas.

La crisis ha sido impulsada principalmente por “fábricas de artículos de investigación“, organizaciones sombrías que producen estudios fabricados, a menudo en respuesta a presiones académicas en regiones como China, la India y Europa del Este. Se estima que alrededor del 2% de las presentaciones de artículos en revistas a nivel mundial provienen de fábricas de artículos. Estos artículos falsos pueden parecer investigación legítima pero están llenos de datos ficticios y conclusiones infundadas. Desconcertantemente, estos artículos se filtran a través de la revisión por pares y terminan en revistas respetadas, comprometiendo la confiabilidad de las perspectivas científicas. Por ejemplo, durante la pandemia de COVID-19, estudios defectuosos sobre ivermectina sugirieron falsamente su eficacia como tratamiento, sembrando confusión y retrasando las respuestas de salud pública efectivas. Este ejemplo destaca el daño potencial de difundir investigación poco fiable, donde los resultados defectuosos pueden tener un impacto significativo.

Consecuencias para el entrenamiento de IA y la confianza

Las implicaciones son profundas cuando los LLM entrenan con bases de datos que contienen investigación fraudulenta o de baja calidad. Los modelos de IA utilizan patrones y relaciones dentro de sus datos de entrenamiento para generar salidas. Si los datos de entrada están corruptos, las salidas pueden perpetuar inexactitudes o incluso amplificarlas. Este riesgo es particularmente alto en campos como la medicina, donde las perspectivas generadas por IA incorrectas podrían tener consecuencias letales.
Además, el problema amenaza la confianza del público en la academia y la IA. A medida que los editores continúan haciendo acuerdos, deben abordar las preocupaciones sobre la calidad de los datos que se venden. No hacerlo podría dañar la reputación de la comunidad científica y socavar los beneficios potenciales de la IA.

Garantizar datos de confianza para IA

Reducir los riesgos de que la investigación defectuosa perturbe el entrenamiento de IA requiere un esfuerzo conjunto de los editores, las empresas de IA, los desarrolladores, los investigadores y la comunidad en general. Los editores deben mejorar su proceso de revisión por pares para detectar estudios poco fiables antes de que lleguen a los conjuntos de datos de entrenamiento. Ofrecer mejores recompensas a los revisores y establecer estándares más altos puede ayudar. Un proceso de revisión abierto es crucial aquí. Trae más transparencia y responsabilidad, ayudando a construir confianza en la investigación.
Las empresas de IA deben ser más cuidadosas al elegir con quién trabajan cuando buscan investigación para el entrenamiento de IA. Elegir editores y revistas con una sólida reputación por investigación de alta calidad y bien revisada es clave. En este contexto, es importante examinar de cerca el historial de un editor, como la frecuencia con la que retiran artículos o cuán abiertos son sobre su proceso de revisión. Ser selectivos mejora la confiabilidad de los datos y construye confianza en las comunidades de IA y investigación.

Los desarrolladores de IA necesitan asumir la responsabilidad de los datos que utilizan. Esto significa trabajar con expertos, verificar cuidadosamente la investigación y comparar resultados de múltiples estudios. Las herramientas de IA también pueden diseñarse para identificar datos sospechosos y reducir los riesgos de que la investigación cuestionable se propague aún más.

La transparencia también es un factor esencial. Los editores y las empresas de IA deberían compartir abiertamente detalles sobre cómo se utiliza la investigación y a dónde van las regalías. Herramientas como el Seguimiento de acuerdos de licencia de IA generativa muestran promesa pero necesitan una adopción más amplia. Los investigadores también deberían tener voz en cómo se utiliza su trabajo. Las políticas de opt-in, como las de Cambridge University Press, ofrecen a los autores el control sobre sus contribuciones. Esto construye confianza, garantiza la equidad y hace que los autores participen activamente en este proceso.

Además, se debe fomentar el acceso abierto a la investigación de alta calidad para garantizar inclusividad y equidad en el desarrollo de IA. Los gobiernos, las organizaciones sin fines de lucro y los actores de la industria pueden financiar iniciativas de acceso abierto, reduciendo la dependencia de los editores comerciales para conjuntos de datos de entrenamiento críticos. Además, la industria de IA necesita reglas claras para la obtención de datos de manera ética. Al centrarse en la investigación confiable y bien revisada, podemos construir mejores herramientas de IA, proteger la integridad científica y mantener la confianza del público en la ciencia y la tecnología.

En resumen

Monetizar la investigación para el entrenamiento de IA presenta tanto oportunidades como desafíos. Si bien la licencia de contenido académico permite el desarrollo de modelos de IA más potentes, también plantea preocupaciones sobre la integridad y confiabilidad de los datos utilizados. La investigación defectuosa, incluida la proveniente de “fábricas de artículos”, puede corromper los conjuntos de datos de entrenamiento de IA, lo que puede socavar la confianza del público y los beneficios potenciales de la IA. Para garantizar que los modelos de IA se construyan sobre datos de confianza, los editores, las empresas de IA y los desarrolladores deben trabajar juntos para mejorar los procesos de revisión por pares, aumentar la transparencia y priorizar la investigación de alta calidad y bien verificada. Al hacerlo, podemos salvaguardar el futuro de la IA y mantener la integridad de la comunidad científica. Para garantizar que los modelos de IA se construyan sobre datos de confianza, los editores, las empresas de IA y los desarrolladores deben trabajar juntos para mejorar los procesos de revisión por pares, aumentar la transparencia y priorizar la investigación de alta calidad y bien verificada. Al hacerlo, podemos salvaguardar el futuro de la IA y mantener la integridad de la comunidad científica.

El Dr. Tehseen Zia es un profesor asociado titular en la Universidad COMSATS de Islamabad, con un doctorado en Inteligencia Artificial de la Universidad Técnica de Viena, Austria. Especializado en Inteligencia Artificial, Aprendizaje Automático, Ciencia de Datos y Visión por Computadora, ha hecho contribuciones significativas con publicaciones en revistas científicas reputadas. El Dr. Tehseen también ha liderado varios proyectos industriales como investigador principal y ha servido como consultor de Inteligencia Artificial.