AI 모델 및 플랫폼

AI 훈련을 위한 연구 물품화: 위험과 최선의 관행

mm
Unite.AI를 Google의 선호 소스에 추가

AI의 발전으로 인해 고품질의 훈련 데이터가 필요하게 되었습니다. 학술 출판사들은 대규모 언어 모델(LLM)을 개발하는 기술 회사에 연구 내용을 라이선스하여 새로운 수익원을 창출하고 있습니다. 이 개발은 출판사와 기술 회사에ประโยชน을 가져다주지만, 사용되는 연구의完整성과 신뢰성에 대한 중요한 질문을 제기합니다. 이러한 질문은 데이터의 품질과 과학 공동체 및 AI 모델에 대한 영향에 대해 의문을 제기합니다.

연구 물품화의 증가

주요 학술 출판사인 Wiley, Taylor & Francis 등은 기술 회사에 연구 내용을 라이선스하여 상당한 수익을 올리고 있습니다. 예를 들어, Wiley는 올해만 4,000만 달러 이상의 수익을 올렸습니다. 이러한 협약은 AI 회사들이 다양한 과학 데이터에 접근할 수 있도록 해주어 AI 도구의 품질을 향상시킵니다.

출판사의 제안은 간단합니다. 라이선스를 통해 더好的 AI 모델을 개발하여 사회에ประโยชน를 가져다주시고, 저자들에게 로열티를 지불합니다. 이 비즈니스 모델은 기술 회사와 출판사 모두에게ประโยชน를 가져다줍니다. 그러나 과학 지식을 물품화하는 경향은 위험을 수반합니다. 특히 의심스러운 연구가 AI 훈련 데이터에 침투할 때입니다.

가짜 연구의 그림자

학술 공동체는 부정확한 연구에 익숙합니다. 연구에 따르면 많은 출판된 결과가 결함이 있거나 신뢰할 수 없습니다. 2020년 조사에 따르면 거의 절반의 연구자들이 데이터 보고나 연구 설계와 관련된 문제를 경험했습니다. 2023년에는 10,000개 이상의 논문이 결과가 신뢰할 수 없거나 위조된 것으로 판명되어 철회되었습니다. 이 숫자는 매년 증가하고 있습니다. 전문가들은 이 숫자가 빙산의 일각에 불과하다고 믿습니다.

이 위기는 주로 “연구 밀”이라고 불리는 조직에 의해 주도됩니다. 이러한 조직은 종종 학술 압력에 의해 중국, 인도, 동유럽 등에서 운영됩니다.全球적으로 약 2%의 저널 제출이 이러한 밀에서 나온다고 추정됩니다. 이러한 가짜 논문은 합법적인 연구와 비슷하게 보이지만 허위 데이터와 근거 없는 결론으로 가득 차 있습니다. 이러한 논문은 심사 과정에서 통과하여 존경받는 저널에 게재되며 과학적 통찰력의 신뢰성을 손상시킵니다. 예를 들어, COVID-19 팬데믹期间, 이버메кт린에 대한 결함이 있는 연구는 그 효과를 잘못 나타내어 혼란을 초래하고 효과적인 공중 보건 대응을 지연시켰습니다. 이러한 예는 부정확한 연구를 확산할 때 발생할 수 있는 잠재적인 피해를 강조합니다.

AI 훈련과 신뢰에 대한 영향

부정확하거나 낮은 품질의 연구를 포함하는 데이터베이스에서 LLM을 훈련시키는 것은 심각한 영향을 미칩니다. AI 모델은 훈련 데이터 내의 패턴과 관계를 사용하여 출력을 생성합니다. 입력 데이터가 오염되면 출력은 부정확하거나 심지어 잘못된 정보를 확대할 수 있습니다. 특히 의료 분야에서 이 위험은 특히 높습니다. 여기서 잘못된 AI 생성 통찰력은 생명에 위협이 될 수 있습니다.

또한 이 문제는 학술 공동체와 AI에 대한 공공의 신뢰를 위협합니다. 출판사들이 계속해서 협약을 체결함에 따라, 데이터의 품질에 대한 우려를 해결해야 합니다. 그렇지 않으면 과학 공동체의 명성과 AI의 잠재적인 사회적ประโยชน이 손상될 수 있습니다.

신뢰할 수 있는 데이터를 위한 보장

부정확한 연구가 AI 훈련을 방해하는 위험을 줄이기 위해서는 출판사, AI 회사, 개발자, 연구자 및 더广泛한 공동체의 공동 노력이 필요합니다. 출판사들은 심사 과정에서 불신뢰할 수 있는 연구를 걸러내기 위해 더 나은 심사 과정을 마련해야 합니다. 심사자에게 보다好的 보상을 제공하고 기준을 높이는 것이 도움이 될 수 있습니다. 공개 심사 과정은 여기에서 중요합니다. 그것은 더 많은 투명성과 책임성을 가져오며 연구에 대한 신뢰를 구축하는 데 도움이 됩니다.

AI 회사들은 AI 훈련을 위한 연구를 구할 때 더주의해야 합니다. 높은 品質의 연구와 심사를 수행하는 출판사와 저널을 선택하는 것이 중요합니다. 이 контек스트에서 출판사의 기록을 면밀히 검토하는 것이 가치 있습니다. 예를 들어, 논문을 철회하는 빈도나 심사 과정에 대한 공개 정도를 살펴볼 수 있습니다. 이러한 선택은 데이터의 신뢰성을 높이고 AI 및 연구 공동체 간의 신뢰를 구축하는 데 도움이 됩니다.

AI 개발자들은 사용하는 데이터에 대한 책임을 져야 합니다. 이는 전문가와 협력하여 연구를 주의 깊게 검토하고 여러 연구의 결과를 비교하는 것을 의미합니다. AI 도구 자체도 의심스러운 데이터를 식별하고 부정확한 연구가 더 확산되는 위험을 줄이는 데 설계될 수 있습니다.

투명성 또한 중요한 요소입니다. 출판사와 AI 회사들은 연구가 어떻게 사용되고 로열티가 어디로 가는지에 대한 세부 정보를 공개적으로 공유해야 합니다. 예를 들어, 제너레이티브 AI 라이선스 협약 트래커와 같은 도구는 약속을 보여주지만 더广泛한 채택이 필요합니다. 연구자들은 자신의 연구가 어떻게 사용되는지에 대한 발언권을 가져야 합니다. 옵트인 정책과 같은 케임브리지 대학 출판사의 정책은 저자들에게 기여도에 대한 통제권을 제공합니다. 이것은 신뢰를 구축하고, 공정성을 보장하며, 저자들이 이 과정에积極적으로 참여하도록 합니다.

또한, 고품질의 연구에 대한 공개 접근을 장려하여 AI 개발에서 包容性와 공정성을 보장해야 합니다. 정부, 비영리 단체, 산업계는 공개 접근 이니셔티브를资助하여 중요한 훈련 데이터セット에 대한 상업적 출판사의 의존도를 줄일 수 있습니다. 또한, AI 산업은 데이터를 윤리적으로 구할 수 있는 명확한 규칙이 필요합니다. 신뢰할 수 있는, 잘 심사된 연구에 초점을 맞추면 더好的 AI 도구를 구축하고 과학적 完整性을 보호하며 공공의 과학 및 기술에 대한 신뢰를 유지할 수 있습니다.

결론

AI 훈련을 위한 연구 물품화는 기회와 도전을 모두 제공합니다. 학술 내용을 라이선스하여 더 강력한 AI 모델을 개발할 수 있지만, 사용되는 데이터의 完整性과 신뢰성에 대한 우려도 있습니다. 부정확한 연구, 특히 “연구 밀”에서 나온 연구는 AI 훈련 데이터를 오염시켜 부정확성을 퍼뜨리거나 심지어 확대할 수 있습니다. 이것은 공공의 신뢰와 AI의 잠재적인ประโยชน을 손상시킬 수 있습니다. 출판사, AI 회사, 개발자들이 함께 노력하여 심사 과정을 개선하고 투명성을 높이며 높은 품질의 연구를 우선시하면, 우리는 AI의 미래를 보호하고 과학 공동체의 完整性을 유지할 수 있습니다. 출판사, AI 회사, 개발자들이 함께 노력하여 심사 과정을 개선하고 투명성을 높이며 높은 품질의 연구를 우선시하면, 우리는 AI의 미래를 보호하고 과학 공동체의 完整性을 유지할 수 있습니다. 출판사, AI 회사, 개발자들이 함께 노력하여 심사 과정을 개선하고 투명성을 높이며 높은 품질의 연구를 우선시하면, 우리는 AI의 미래를 보호하고 과학 공동체의 完整性을 유지할 수 있습니다. 출판사, AI 회사, 개발자들이 함께 노력하여 심사 과정을 개선하고 투명성을 높이며 높은 품질의 연구를 우선시하면, 우리는 AI의 미래를 보호하고 과학 공동체의 完整性을 유지할 수 있습니다.

Dr. Tehseen Zia는 COMSATS University Islamabad의 정교수이며, 오스트리아 비엔나 기술대학교에서 인공지능 박사학위를 취득했습니다. 인공지능, 기계학습, 데이터 과학, 컴퓨터 비전을 전문으로 하며, 유명한 과학 저널에 발표된 논문으로 знач적인 기여를 했습니다. Dr. Tehseen은 주요 연구자로서 다양한 산업 프로젝트를 이끌었으며, 인공지능 컨설턴트로도 활동했습니다.