Anderson의 관점
과학 저널리즘에서 과장 탐지에 대한 NLP 접근

덴마크의 연구자들은 과학 저널리스트들이 새로운 과학 연구 논문을 요약하고 보도할 때 과장된 결과를 내놓는 것을 방지하기 위한 ‘과장 탐지’ 시스템을 개발했습니다. 이 연구는 COVID-19에 대한 새로운 연구가 보도 채널에서 왜곡되는 정도에 의해 촉발되었습니다. 그러나 저자들은 이 문제가 일반 과학 보도 분야 전반에 걸쳐 적용될 수 있다고 인정합니다.
코펜하겐 대학교의 연구 논문은 의학 과학 보도 자료의 반감독 학습 과장 탐지라는 제목으로, 원래 연구 논문에 대한 소스 링크를 포함하지 않는 출판물의 경향이 문제를 악화시키고 있음을 지적합니다. 이는 원래 논문이 공개적으로 उपलब할 때에도 발생하는 점진적인 저널리즘 관행입니다.

논문에서 과학 논문의 과장된 표현 소스: https://arxiv.org/pdf/2108.13493.pdf
이 문제는 외부 저널리스트의 반응에만 국한되지 않습니다. 내부 대학 및 연구 기관의 홍보 노력, 뉴스 아웃レット의 관심을 유도하기 위한 홍보 자료, 저널리스트가 ‘반응’할 때 발생하는 유용한 추천 링크(및 자금 조달 라운드에 대한 잠재적弹藥)와 같은 다른 종류의 요약에도 확장될 수 있습니다.
이 연구는 새로운 과학 논문의 과장 탐지를 위한 새로운 작업 정의를 개발했다고 주장하며, 자연어 처리(NLP)를 새로운 데이터셋에 적용합니다. 연구자들은 이 연구의 코드와 데이터를 GitHub에 곧 공개할 예정입니다.
과장성 대처
과학적 과장성 문제는 지난 30년 동안 여러 연구에서 다루어졌으며, 이를 통해 발생할 수 있는 잘못된 정보에 주목했습니다. 미국 과학 사회학자 도로시 넬킨(Dorothy Nelkin)은 1987년 책 과학 판매: 언론이 과학 및 기술을 다루는 방식에서 이 문제를 두드러지게 다루었습니다. 2006년 Embo 보고서 헤드라인의 나쁨 과학는 과학적으로 훈련된 저널리스트가 더 필요하다고 강조했습니다. 2014년 영국 의학 저널(British Medical Journal)은 이 문제를 보고서에서 강조했습니다. 2019년 웰컴 오픈 리서치(Wellcome Open Research)의 연구에서는 과학 논문의 과장이 뉴스 아웃レット이나 다른 보도 시스템에益을 주지 않는다는 것을 밝혔습니다.
그러나 팬데믹의 발생으로 인해 이러한 과장의 부정적인 영향이 크게 부각되었습니다. 구글 검색 결과 페이지와 코넬 대학교의 Arxiv 과학 논문 색인과 같은 다양한 정보 플랫폼에서는 COVID-19 관련 콘텐츠에 경고 메시지를 자동으로 추가하고 있습니다.

COVID 관련 검색 및 콘텐츠의 수정된 인터페이스
이전 연구에서는 과학 논문의 과장 탐지를 위해 NLP를 활용했습니다. 2019년 홍콩과 중국의 연구자들 간의 협력과 2017년 덴마크의 다른 연구가 이러한 노력을 대표합니다. 이 연구들은 PubMed과 EurekAlert의 추상과 요약에서 가져온 주장을 레이블링하고, 기계 학습 모델을 훈련하여 미래의 데이터에서 주장의 강도를 예측했습니다.
이 새로운 연구는 과학 논문의 과장 탐지를 위한 새로운 작업 정의를 개발했다고 주장하며, 자연어 처리(NLP)를 새로운 데이터셋에 적용합니다. 연구자들은 이 연구의 코드와 데이터를 GitHub에 곧 공개할 예정입니다.
MT-PET
새로운 연구는 보도 자료와 추상을 결합한 데이터 엔티티를 생성하고, MT-PET라고 하는 패턴 탐색 훈련의 다중 작업 가능 버전을 사용하여 이 데이터셋을 활용합니다. MT-PET는 2020년에 처음 발표된 Exploiting Cloze Questions for Few Shot Text Classification and Natural Language Inference라는 연구에서 처음 제시된 패턴 탐색 훈련의 확장입니다.
이 작업에 적합한 기존 데이터셋이 없어서, 팀은 전문가들이 과장된 정도를 평가한 추상과 관련된 보도 자료의 짝을 이루는 새로운 데이터셋을 수집했습니다.
연구자들은 Few-Shot 텍스트 분류 프레임워크인 PETAL을 사용하여 자동으로 패턴-버벌라이저 쌍을 생성하고, 데이터를 반복적으로 처리하여 두 가지 특성(과장 탐지 및 주장 강도)에 대해 대략적으로 동등한 튜플을 찾았습니다.
‘골드’ 데이터는 이전 연구 프로젝트에서 재사용되었으며, 823개의 추상 및 보도 자료 쌍으로 구성되었습니다. 연구자들은 2014년 BMJ 데이터를 사용하지 않기로 결정했는데, 이는 문장의 일부가 다시 쓰여졌기 때문입니다.
이 프로세스는 과장 및 주장 강도에 레이블이 달린 663개의 추상/보도 자료 쌍의 데이터셋을 생성했습니다. 연구자들은 100개의 샘플을 무작위로 선택하여 Few-Shot 학습 훈련 데이터로 사용하고, 553개의 예제를 테스트용으로 남겼습니다. 또한, 1,138개의 문장이 포함된 작은 훈련 세트를 생성했으며, 이들은 요약 또는 보도 자료의 주요 결론을 나타내는지 여부에 따라 분류되었습니다. 이러한 문장은 미레이블링된 쌍에서 결론 문장을 식별하는 데 사용되었습니다.
테스트
연구자들은 세 가지 구성에서 접근 방식을 테스트했습니다. 완전하게 지도 학습 환경, 단일 작업 PET 시나리오, 및 새로운 MT-PET입니다. MT-PET는 보조 작업으로 두 번째 형식화 스레드를 추가합니다.
연구자들은 MT-PET가 테스트 환경에서 기본 PET 결과를 개선했으며, 주장 강도를 식별하는 것이 과장 탐지에 대한 소프트 레이블링 훈련 데이터를 생성하는 데 도움이 된다고 발견했습니다. 그러나 이 논문은 특정 구성에서, 특히 주장 강도와 관련하여, 전문가가 레이블링한 데이터의 존재가 개선된 결과에 기여할 수 있다고 지적합니다.
연구자들은 MT-PET가 직접적인 인과 관계 주장과 약한 주장을 식별하고 구분하는 더 어려운 경우에 도움이 되며, 가장 좋은 접근 방식은 원본 및 대상 문서의 문장의 개별 주장 강도를 분류하고 비교하는 것이라고 결론지었습니다.
마지막으로, 이 연구는 MT-PET가 더广い 범위의 과학 논문(건강 분야 외)에 적용될 수 있을 뿐만 아니라, 저널리스트가 과학 논문에 대한 더 나은 개요를 생성하는 데 도움이 되는 도구의 기초가 될 수 있으며, 연구 커뮤니티가 복잡한 아이디어를 설명하는 언어 사용을 더 분명히 하는 데 도움이 될 수 있다고 주장합니다. 또한, 이 논문은 다음과 같이 관찰합니다.
‘과학 저널리스트가 작성한 보도 자료에 대한 예측 성능 결과는 이 논문에서 보고된 것입니다. 과학 논문을 더 강하게 단순화하는 보도 자료의 경우 더 나쁨의 결과를 기대할 수 있습니다.’












