Anderson의 관점

자동과학작성의 방향으로

mm
Unite.AI를 Google의 선호 소스에 추가

오늘 아침, 나는 대부분의 아침과 마찬가지로, 컴퓨터 과학 섹션의 Arxiv를 살펴보았고, 브라질의 Federal University of Ceara에서 나온 최근의 논문을 발견했다. 이 논문은 과학 논문의 요약과 핵심 데이터 추출을 자동화하기 위한 새로운 자연어 처리 프레임워크를 제시했다.

이것은 내가 매일 하는 일과 거의 동일하므로, 이 논문은 올해 초에 Reddit 작가 스레드에서 한 댓글을 생각나게 했다. 그 댓글은 과학 작성이 기계 학습에 의해 대체될 최초의 저널리즘 직업 중 하나가 될 것이라고 예측했다.

명확하게 말하자면 – 나는 絶対적으로 자동과학작성이 다가오고 있으며, 이 글에서 내가 제기하는 모든 도전은 현재 해결 가능하거나 궁극적으로 해결될 것이라고 믿는다. 가능하다면, 예를 들어 설명한다. 또한, 나는 현재 또는 근미래의 과학작성 AI가 유창하게 글을 쓸 수 있는지 여부를 다루고 있지 않다. 이 분야의 NLP에 대한 관심 수준을 고려하면, 이 도전은 궁극적으로 해결될 것이라고 가정한다.

나는 자동과학작성 AI가 관련 과학 이야기를 출판사의 다양한 원하는 결과에 따라 식별할 수 있는지 묻고 있다.

나는 그것이 임박하지 않다고 생각한다. 매주 약 2000개의 새로운 과학 논문을 살펴보면서, 학술 제출물을 알고리즘적으로 분해하는 정도에 대해 상당히 더 비관적인 견해를 가지고 있다. 일반적으로, 그것은 저자를 방해하는 사람들 때문이다.

자동과학작성의 필수요소

자동과학报道의 도전을 고려해 보자. 공정하게 유지하기 위해, 우리는 주로 코넬 대학교의 非유료 Arxiv 도메인의 컴퓨터 과학 카테고리에 국한시킬 것이다. 이는 데이터 추출 파이프라인에 연결할 수 있는 일련의 체계적이고 템플릿화된 특징을 제공한다.

새로운 브라질 논문과 같이, 과학 논문의 제목, 요약, 메타데이터 및(정당한 경우) 본문 내용을 통해 상수, 신뢰할 수 있는 매개변수, 토큰 및 작용 가능한 도메인 정보를 검색하는 과제를 가정해 보자.

이것은 새 프레임워크가 지진 보고, 스포츠 작기, 금융 저널리즘 및 건강 보도와 같은 분야에서 지면을 얻고 있는 원리이다.

브라질의 새로운 제안의 워크플로. PDF 과학 논문은 UTF-8 평문 텍스트로 변환된다(이 경우 이태릭 강조가 의미를 가진 경우 제거됨). 섹션 레이블이 지정되고 추출된 후 필터링을 위해 전달된다. 해체된 텍스트는 문장으로 분할되고 데이터 프레임이 병합된 후 토큰 식별 및 두 개의 문서 토큰 매트릭스 생성

브라질의 새로운 제안의 워크플로. PDF 과학 논문은 UTF-8 평문 텍스트로 변환된다(이 경우 이태릭 강조가 의미를 가진 경우 제거됨). 섹션 레이블이 지정되고 추출된 후 필터링을 위해 전달된다. 해체된 텍스트는 문장으로 분할되고 데이터 프레임이 병합된 후 토큰 식별 및 두 개의 문서 토큰 매트릭스 생성 출처: https://arxiv.org/ftp/arxiv/papers/2107/2107.14638.pdf

템플릿 복잡화

하나의 장려하는 계층은 Arxiv가 제출에 대해 꽤 잘 적용된 템플릿을 강제한다는 것이다. 또한 제출 저자에 대한 자세한 지침을 제공한다. 따라서 논문은 일반적으로 해당 작업에 적용되는 프로토콜의 일부에 따라 규칙을 준수한다.

따라서 자동과학작성 AI의 전처리 시스템은 이러한 섹션을 하위 도메인으로 처리할 수 있다: 초록, 소개, 관련/이전 연구, 방법론/데이터, 결과/발견, 제거 연구, 토론, 결론.

그러나 실제로 이러한 섹션 중 일부가 누락되거나 이름이 바뀌었거나 다른 섹션에 속하는 내용을 포함할 수 있다. 또한 저자들은 템플릿에 맞지 않는 헤딩과 서브헤딩을 포함할 수 있다. 따라서 NLP/NLU는 컨텍스트에서 관련 섹션 관련 내용을 식별해야 한다.

난관에 직면하다

헤더 계층은 NLP 시스템이 내용 블록을 초기에 분류하는 쉬운 방법이다. 많은 Arxiv 제출물은 Microsoft Word에서 내보낸 것으로(제목 헤더에 ‘Microsoft Word’가 남아 있는 Arxiv PDF를 통해 확인할 수 있음), 적절한 섹션 헤딩을 Word에서 사용하면 PDF 내보내기 시 계층적인 헤딩으로 재생성되어 기계 리포터의 데이터 추출 프로세스에 유용하다.

그러나 이것은 저자들이 실제로 Word 또는 다른 문서 생성 프레임워크에서 이러한 기능을 사용하고 있다고 가정한다. TeX 및 파생물(Arxiv 제출에서 원生的 대안 형식으로 거의 제공되지 않음)은 드물다.

나의 경험에 비추어보면, 대부분의 Arxiv 논문에는 해석 가능한 구조적 메타데이터가 없다. 제목은 웹 브라우저 또는 PDF 리더에서 문서 자체의 전체 제목(확장자 포함)으로 보고된다.

이 경우, 논문의 의미적 해석 가능성이 제한되며, 자동과학작성 AI 시스템은 Arxiv 도메인에서 관련 메타데이터에 연결하기 위해 프로그래밍 방식으로 다시 연결해야 한다. Arxiv 규칙에 따라 기본 메타데이터는 또한 제출된 PDF의 1페이지에 큰 회색 글자로 삽입된다(아래 이미지 참조). 안타깝게도, 출판 날짜나 버전 번호를 찾을 수 있는 유일한 신뢰할 수 있는 장소이기 때문에 종종 생략된다.

많은 저자들은 스타일을 전혀 사용하지 않거나, 오직 H1(最高 헤딩/제목) 스타일만 사용하므로, NLU는 컨텍스트에서 헤딩을 추출해야 하거나(아마도 그렇게 어렵지 않을 것임) 문서 경로의 제목을 구성하는 참조 번호를 파싱하여 네트워크 기반의 메타데이터를 사용할 수 있다.

이후에는 섹션에 해당하는 컴퓨터 과학의 일부를 식별할 수 있으므로, 날짜 및 버전 정보를 제공할 것이다.

구절 반환에서 글루된 텍스트

PDF 및 PostScript가 가장 일반적인 Arxiv 제출 형식인 경우, NLP 시스템은 PDF 형식의 불행한 기본 최적화 방법에 의해 연결된 줄의 끝 단어와 다음 줄의 시작 단어를 분리하는 루틴이 필요하다.

단어의 분리(및 하이픈 제거)는 Perl 및 다른 많은 단순 재귀 루틴에서 수행할 수 있다. 그러나 Python 기반 접근 방식이 ML 프레임워크에 더 적합하고 시간이 덜 걸릴 수 있다. PDF 형식의 원래 개발자인 Adobe는 또한 ‘ Liquid Mode’라는 AI 기반 변환 시스템을 개발했으며, PDF의 베이커드 텍스트를 ‘리플로우’할 수 있다. 그러나 모바일 영역을 넘어서는 배포는 느리게 진행되고 있다.

불량한 영어

영어는 여전히 과학 논문을 제출하는 세계적인 표준 언어이지만, 이는 논란의 여지가 있다. 따라서 흥미롭고 뉴스 가치가 있는 논문은 때때로 비영어권 연구자로부터 끔찍한 영어를 포함할 수 있다. 만약 영어 사용의 유창함을 가치의 척도로 포함하면, 좋은 이야기는 종종 손실되고, 허술한 저품질 출력은 더 잘 쓰여져서 더 높은 등급을 받을 수 있다.

NLP 시스템이 이 점에서 유연하지 않으면, 특히 화학 및 이론 물리학과 같은 가장 엄격하고 매개변수화된 과학 분야에서 데이터 추출에 추가적인 장애물이 발생할 수 있다. 기계 학습 논문은 종종 수식으로 구성되지만, 이러한 수식은 과학적 합의가 확립되지 않은 경우 제출의 정의 값이 아닐 수 있다.

선택: 대상 청중 요구 사항 결정

우리는 곧 과학 논문을 분해하는 많은 문제로 돌아갈 것이다. 지금은 우리의 청중과 목표를 고려해 보자. 이것은 자동과학작성 AI가 수천 개의 논문을 걸러내는 데 도움이 될 것이다. 잠재적인 뉴스 스토리의 성공을 예측하는 것은 이미 기계 학습에서 활발한 분야이다.

예를 들어, 과학 작성이 더 넓은 저널리즘 제공의 하나의 플랭크인 웹사이트에서 높은 볼륨의 ‘과학 트래픽’이 유일한 목표라면(이는 영국의 데일리 메일 과학 섹션의 경우임), AI는 트래픽에서 가장 높은 수익을 올리는 주제를 결정해야 하며, 선택을 그쪽으로 최적화해야 한다. 이 과정은 상대적으로 낮은 과일인 로봇, 드론, 딥페이크, 개인 정보보안 취약점을 우선시킬 수 있다.

이것은 현재 추천 시스템의 최신 기술과 일치하며, 자동과학작성 AI가 이러한 주제에 대한 과학 논문에 더 많은 주목을 기울이게 할 수 있다. 그러나 이것은 또한 ‘필터 버블’ 문제를 일으킬 수 있다. 알고리즘이 이러한 주제에 대한 과학 논문에 더 많은 주목을 기울이게 되고, 다른 주제의 훨씬 더 가치 있는 ‘이스터 에그’를 무시하게 된다.

한 번하고 끝!

좋은 과학 뉴스 재료는 때때로 예상치 못한 곳에서 나올 수 있으며, 이전에 과일이 없는 것으로 판명된 섹터나 주제에서 나올 수 있다. 자동과학작성 AI를 더 혼란스럽게 하는 것은, 오프비트 히트의 원천은 다시는 결코 유용한 자료를 생산하지 않을 것이며, 계속해서 가치가 낮은 정보 흐름을 생산할 것이라는 것이다.

무엇을 할 수 있는지에 대해 반복 기계 학습 아키텍처는 무엇을 알 수 있을까? 이전에 식별된 수천 개의 아웃라이어 뉴스 소스를 다시 우선순위에 둘 것인가? 주제 자체가 뉴스 원천에서보다 활성화 계층에서 더 가치 있는지 여부를 결정할 것인가?

보다 유용하게, 시스템은 패턴을 구성하는 데 더 높은 차원으로 이동하거나 하위로 이동해야 한다는 것을 학습할 수 있다. 즉, 내 늦은 기자 할아버지는 ‘뉴스 감’이라고 불렀던, 일상적으로 예측할 수 없는 추상적인 품질인 ‘뉴스 가치’를 특징으로 한다.

가설 실패 식별

학술 부서의 할당량 압력으로 인해 때때로 가설이 완전히(또는 거의) 실험에서 실패한 작품이 출판된다. 이러한 실망은 종종 요약에 표시되지 않으며, 최악의 경우, 반증된 가설은 결과 그래프만 읽음으로써 식별할 수 있다. 이것은 메서드에 대한詳細한 이해를 요약에서 추론하는 것을 의미하며, 또한 그래프와 표를 의미 있게 해석할 수 있는熟練한 그래프 해석 알고리즘이 필요하다.

학술 논문에서 숨겨진 실패의 이전 예는(훈련을 위해) 패턴으로 일반화하기 어렵다. 이것은 주로 생략 또는 약화의 범죄이기 때문이며, 따라서难 감지된다.

극단적인 경우, 자동과학작성 AI는 결과를 의미하는 것을 이해하기 위해 저장소 데이터(예: GitHub에서)를 찾고 테스트하거나, 사용 가능한 보충 자료를 파싱해야 할 수 있다. 따라서 기계 학습 시스템은 자동화된 검증 프로세スの 도전을 겪게 될 것이다.

‘화이트 박스’ 시나리오

일부 AI 중심 보안 논문에서 제기되는 가장 극단적인 주장은 원본 코드 또는 원본 인프라에 대한 비정상적으로 높은 수준의 액세스가 필요하다. ‘화이트 박스’ 공격은 이전에 알려지지 않은 AI 시스템 아키텍처의 특이점을 외삽하는 데 유용하지만, 거의 실제로 khai thác 가능한 공격 표면을 나타내지 않는다. 따라서 자동과학작성 AI는 효과적인 배포에 대한 확률을 분해하기 위해 보안 주장에 대한 훌륭한 불쏘시개가 필요하다.

자동과학작성 AI는 ‘화이트 박스’ 언급을 의미 있는 컨텍스트로 분리하는 능동적인 NLU 루틴이 필요하다. 또한 언급되지 않은 경우 ‘화이트 박스’ 방법론을 추론하는 기능이 필요하다.

다른 ‘갯츠’

불가능성과 가설 실패가 숨겨질 수 있는 또 다른 곳은 제거 연구이다. 이 연구에서는 새로운 공식이나 방법의 핵심 요소를 체계적으로 제거하여 결과가 부정적으로 영향을 받는지, 또는 ‘핵심’ 발견이 탄탄한지 여부를 확인한다. 실제로 제거 연구를 포함하는 논문은 일반적으로 자신의 발견에 자신감을 가지고 있지만, 주의 깊은 독자는 때때로 ‘블러핑’을 발견할 수 있다. 기계 학습 연구에서 이 블러핑은 종종 과적합을 의미한다. 여기서 기계 학습 시스템은 원래 연구 데이터에서 훌륭하게 수행하지만, 새로운 데이터에 일반화하거나, 다른 비재현성 제약 조건하에서 작동하지 않는다.

잘 구조화된 추출을 위한 또 다른 유용한 섹션 헤딩은 제한이다. 이것은 과학 작가(인간 또는 AI)가 건너뛰어야 하는 첫 번째 섹션이다. 여기에는 전체 가설을 무효화하는 정보가 포함될 수 있기 때문이다. 최악의 경우, 논문에는 제한 섹션이 있지만, 妥協的事実은 여기에는 포함되지 않고, 다른 곳에 포함된다.

다음은 이전 연구이다. 이는 Arxiv 템플릿의 초기에 발생하며, 현재 논문이 이전 12~18개월 동안의 훨씬 더 혁신적인 프로젝트에 대한 사소한 발전일 수 있다. 이 단계에서 자동과학작성 AI는 이전 연구가 여전히 관련성이 있는지, 이전 연구가 당시에 발표되었을 때 주목을 받지 못했는지, 새로운 논문이 잘 다루어진 이전 프로젝트에 대한 사소한 후속 작업인지 여부를 결정해야 한다.

재처리 및 ‘신선함’ 평가

제2판은 종종 이전 버전에 대한 오류 수정을 제외하고는 거의 아무 것도 하지 않는다. 그러나 때때로 논문은 두 번째 기회를 заслуж한다. 언론의 관심이 원래 출판 시 다른 곳에 있었을 수 있거나, 제출이 많아진 시기(예: 가을, 늦은 겨울)에 발표되어 보도되지 않았을 수 있다.

유용한 기능은 Arxiv에서 제출 제목에附加된 [UPDATE] 태그이다. 자동과학작성 AI의 내부 ‘추천 시스템’은 [UPDATE]가 ‘재생산’을 의미하는지 여부를 신중하게 고려해야 한다. 특히 자동과학작성 AI는 인간보다 훨씬 빠르게 업데이트된 논문을 평가할 수 있기 때문이다.

Arxiv는 또한 요약 페이지에서 다른 논문과 텍스트의 상당한 중복을 가진 논문을 식별하는 정보를 제공하며, 자동과학작성 AI 시스템은 [UPDATE] 태그가 없는 경우 ‘중복/재처리’ 상태로 파싱할 수 있다.

확산 결정

대부분의 저널리스트와 마찬가지로, 우리의 자동과학작성 AI는 보고되지 않은 또는 부족하게 보고된 뉴스를 찾고 있다. 따라서 TechCrunch, The Verge 및 EurekaAlert와 같은 주요 아웃レット에서 처음으로 발표된 과학적인 돌파구를 다시 보고하는 것은 무의미하다. 이러한 대형 플랫폼은 내용을 완벽한 홍보 기계로 지원하기 때문에, 논문의 보도는 거의 보장된다.

따라서 자동과학작성 AI는 이야기가 추적할 가치가 있는지 여부를 결정해야 한다.

이론적으로 가장 쉬운 방법은 핵심 연구 페이지(요약, PDF, 학술 부서 웹사이트 뉴스 섹션 등)에 대한 최근 인바운드 링크를 식별하는 것이다. 일반적으로 최신 인바운드 링크 정보를 제공하는 프레임워크는 오픈 소스나 저렴하지 않지만, 주요 출판사들은 새로운sworthiness 평가 프레임워크의 일부로 SaaS 비용을 부담할 수 있다.

이러한 액세스를 가정하면, 자동과학작성 AI는 많은 과학 보도 아웃レット이 심지어 정보가 무료로 사용 가능한 경우에도 논문에 대한 인용을 하지 않는다는 문제에 직면한다. 아웃릿은 보조 보고서가 자신에게 연결되기를 원하기 때문이다.

따라서 자동과학작성 AI는 논문에서 작용 가능한 키워드를 추출하여 시간 제한 검색을 수행해야 하며, 이미 보도된 경우에 대한 이전 확산을 평가해야 한다.

때때로 논문은 YouTube에 보충 비디오 자료를 제공하며, ‘조회 수’는 확산의 지표로 사용될 수 있다. 또한 자동과학작성 AI는 논문에서 이미지를 추출하여 체계적인 이미지 기반 검색을 수행하여 이미지가 재게시된 경우에 대한 위치와 시점을 확인할 수 있다.

이스터 에그

때때로 ‘마른’ 논문은 저자들이 언급하지 않았거나 무시했거나 저감시했을 수 있는 발견의 중요하고 뉴스 가치가 있는 의미를 드러낸다. 이러한 ‘이스터 에그’는 전체 논문을 읽고 수학을 수행해야만 드러날 수 있다.

때때로 이것은 저자들이 일반 대중보다 학술적 수용에 더 관심이 있기 때문일 수 있다. 그들은 핵심 개념이 일반 소비자에게 충분히 단순화될 수 없다고 생각할 수 있다. 그러나 그들은 종종 자신의 기관의 PR 부서의 과장된 노력에도 불구하고 그렇다.

그러나 저자들이 자신의 연구의 의미를 간과하거나 인식하지 못하는 경우가 거의 равно한다. 공식적으로 ‘과학적 거리’를 취하고 있다. 때때로 이러한 ‘이스터 에그’는 긍정적 지표가 아니며, 복잡한 표에 숨겨져 있을 수 있다.

아르시브를 넘어서

아르시브와 같은 도메인에서 컴퓨터 과학에 관한 논문을 매개변수화하는 것이 상대적으로 쉽다는 것을 고려해야 한다. 여기에는 일련의 일관된 템플릿화된 ‘후크’가 있으며, 대부분의 기능에 로그인할 필요가 없다.

모든 과학 출판물에 액세스할 수 있는 것은 아니다. 자동과학작성 AI가 Sci-Hub를 통해 유료 벽을 회피하거나, 유료 벽을 피하기 위해 아카이빙 사이트를 사용할 수 있는지 여부는 실제 또는 법적 관점에서 여전히 명확하지 않다.

또한 아르시브는 자동과학작성 AI의 뉴스 평가 루틴을 더 인간적인 속도로 늦추게 할 가능성이 있는 속도 제한이 있다.

사회적 AI 과학 작가

아르시브와 같은 ‘개방형’ 과학 출판 플랫폼의 공개 및 접근 가능한 영역을 넘어서서, 흥미로운 새로운 논문을 얻는 것 자체가 도전이 될 수 있다. 이는 저자에게 접근 경로를 찾고, 작업을 읽으려는 요청을 보내는 것을 포함한다(시간 압박이 주된 고려 사항이 아닌 경우, 즉 대부분의 경우). 이것은 아르시브에서 논문의 저자 이메일 주소를 공개하려면 로그인해야 하므로, 과학 도메인과 계정을 생성하는 자동화된 탐색을 포함할 수 있다.

대부분의 경우 LinkedIn은 응답을 얻는 가장 빠른 방법이다. 그러나 현재 AI 시스템은 LinkedIn 회원에게 연락하는 것이 금지되어 있다.

연구자들이 자동과학작성 AI로부터의 이메일 요청을 어떻게 받을지에 대해서는, 아마도 아웃렛의 영향력에 따라 다를 것이다. 와이어드와 같은 아웃렛에서 자동과학작성 AI가 저자에게 연락한다면, 아마도 호스트적인 반응을 받을 수 있을 것이다.

대부분의 경우, 저자는 이러한 반자동 교환으로 인해 궁극적으로 인간이 루프에 들어올 것이라고 기대할 것이다. 그러나 아마도 VOIP 인터뷰는 일정 임계값 아래로 예상되는 기사의 타당성에서 AI에 의해 촉진될 수 있다.

AI로 뉴스 식별

여기서 설명된 대부분의 원칙과 도전은 저널리즘의 다른 분야에서 자동화의 잠재성에도 적용된다. 또한, 잠재적인 이야기를 식별하는 것이 핵심 도전이다. 대부분의 인간 기자들은 실제로 이야기를 쓰는 것이 노력의 마지막 10%에 불과하다고 인정할 것이다. 키보드가 타자되는 순간, 대부분의 작업은 이미 끝난 후이다.

주된 도전은 기계 학습 시스템을 개발하는 것이다. 이러한 시스템은 많은 플랫폼을 탐색하여 이야기를 식별하고, 조사하고, 인증할 수 있어야 한다. 이러한 플랫폼은 이미 인간이든 기계든 탐색과 데이터 추출에 저항하기 위해 강화되어 있다.

과학 보도의 경우, 새로운 논문의 저자들은 다른 뉴스 스토리의 잠재적인 주요 출처와 마찬가지로 깊은 자기 이익을 가진 의도이다. 따라서 잠재적인 자동과학작성 AI는 오늘 뉴스가 어디에 있는지 결정하기 위해 단순한 NLP 루틴보다 더 많은 것을 필요로 한다. 이는 뉴스 도메인이 특히 계층화된 경우, 즉 주식, 전염병 통계, 스포츠 결과, 지진 활동 및 기타 순수한 통계적 뉴스 출처와 같은 경우를 제외하고는 마찬가지이다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai