Anderson의 관점
인공 지능을 위한 역사적 언어의 도전
자연어 처리(NLP) 시스템의 핵심 도전은 다양한 서면 자료에서 필수적인 통찰력을 도출하는 것입니다. 새로운 NLP 알고리즘의 훈련 데이터 세트에 기여하는 소스는 트위터, 신문, 과학 저널 등과 같이 언어적으로 매우 다양할 수 있으며, 이러한 소스 각각에는 고유한 특성이 있습니다.
대부분의 경우, 이것은 영어에만 해당하며, 최근 또는 현재의 텍스트 소스에만 해당합니다. 그러나 NLP 알고리즘이 여러 시대에 걸친 자료를 고려해야 할 때, 일반적으로 국가 및 지역 공동체 간에 시대별로 언어 또는 글쓰기 방식의 차이를 조정하는 데 어려움을 겪습니다.
그러나 여러 시대에 걸친 텍스트 데이터(예: 역사적인 논문 및 고대 과학 저술)를 사용하는 것은 주제에 대한 역사적인 개요를 생성하고, 도메인에 대한 통계적 타임라인 재구성을 생성하는 데 유용한 방법일 수 있습니다.
예를 들어, 기후 변화 예측 AI 모델에 기여하는 기상 정보는 1880년 이전에는 전 세계적으로 충분히 기록되지 않았습니다. 그러나 고대 텍스트의 데이터 마이닝은 빅토리아 시대 이전의 기상 데이터를 제공할 수 있습니다.
시간 불일치
워싱턴 대학교와 앨런 인스티튜트 สำหร AI의 새로운 논문에 따르면, 5년이라는 짧은 간격도 시간 불일치를 초래할 수 있으며, 이는 사전 훈련된 NLP 모델의 유용성을 저하할 수 있습니다.

모든 경우에 더 높은 점수가 좋습니다. 여기서 우리는 5년 기간에 걸친 4개의 텍스트 자료의 시간적 열화의 히트맵을 볼 수 있습니다. 이러한 훈련 및 평가 데이터 간의 불일치는 저자의 새로운 논문에 따르면 ‘대규모 성능 저하’를 초래할 수 있습니다. 출처: https://arxiv.org/pdf/2111.07408.pdf
이 논문은 다음과 같이 말합니다:
‘시간 불일치는 언어 모델의 일반화와 작업 성능 모두에 영향을 미칩니다. 우리는 텍스트 도메인과 작업 간에 열화의 상당한 변화를 발견했습니다. 5년 동안, 분류기의 F1 점수는 40점(트위터의 정치적 소속) 또는 1점(옐프 리뷰 등급)으로恶화될 수 있습니다. 동일한 도메인에서 정의된 두 개의 작업은 시간이 지남에 따라 서로 다른 열화 수준을 나타낼 수 있습니다.’
불균형 분할
核心적인 문제는 훈련 데이터 세트가 일반적으로 두 개의 그룹으로 나뉘는데, 이는 때때로 80/20의 불균형한 비율로 이루어집니다. 더 큰 데이터 그룹은 신경망에서 훈련되며, 나머지 데이터는 알고리즘의 정확성을 테스트하는 데 사용됩니다.
여러 해에 걸친 자료를 포함하는 혼합 데이터 세트의 경우, 평가 데이터는 특정 시대에 해당하는 자료로 구성될 수 있습니다.
이로 인해 모델이 더 다양한 시대에 걸친 자료로 훈련된 경우, 평가 데이터는 모델을 테스트하는 데 적합하지 않을 수 있습니다. 이는 당신의 할아버지에게最新의 K-POP 아이돌을 평가하라는 것과 같습니다.
긴 작업은 더 제한적인 데이터 세트에서 여러 모델을 훈련하고, 각 모델의 결과에서 호환되는 특징을 수집하는 것입니다. 그러나 랜덤 모델 초기화만으로도, 이러한 접근 방식은 자체적인 문제를 가지고 있으며, 이는 다중 모델 간의 일관성과 평등성을 달성하는 데 어려움을 겪습니다.
데이터 및 훈련
시간 불일치를 평가하기 위해, 저자들은 네 개의 텍스트 코퍼스를 네 개의 도메인에 걸쳐 훈련했습니다.
트위터
…저자들은 2015년에서 2020년 사이에 균일하게 분포된 1,200만 개의 트윗을 수집하여 이름된 实体(예: 사람 및 조직)와 정치적 소속을 연구했습니다.
과학 논문
…저자들은 30년 동안 65만 개의 문서로 구성된 Semantic Scholar 코퍼스에서 비레이블 데이터를 얻었으며, 여기서 저자들은 언급 유형 분류(SciERC)와 AI 장소 분류(AIC, AAAI 또는 ICML에서 발표된지 여부를 구분)를 연구했습니다.
뉴스 기사
…저자들은 2009년에서 2016년 사이의 900만 개의 기사로 구성된 Newsroom 데이터 세트를 사용했으며, 여기서 저자들은 세 가지 작업을 수행했습니다: 뉴스룸 요약, 발행자 분류, 및 미디어 프레임 분류(MFC), 후자는 뉴스 출력에서 다양한 주제의 우선순위를 인식합니다.
음식 리뷰
…연구자들은 Yelp Open 데이터 세트를 사용하여 하나의 작업을 수행했습니다: 리뷰 등급 분류(YELPCLS), 이는 이 분야의 전형적인 감성 분석 도전입니다.
결과
모델은 GPT-2에서 평가되었으며, 다양한 F1 점수를 얻었습니다. 저자들은 시간 불일치로 인한 성능 손실이 양방향이며, 즉 최근 데이터로 훈련된 모델은 이전 데이터의 영향을 받을 수 있으며, 그 반대도 마찬가지임을 발견했습니다(그림 참조). 저자들은 이것이 특히 사회 과학 응용 분야에 중요한 의미가 있다고 주장합니다.
일반적으로, 결과는 시간 불일치가 성능 손실을 크게 악화시키며, 대부분의 작업에 광범위한 영향을 미친다는 것을 보여줍니다. 수십 년에 걸친 기간을 다루는 데이터 세트는 자연스럽게 문제를 악화시킵니다.
저자들은 또한 시간 불일치가 레이블이 지정된 및 비레이블된 사전 훈련 데이터 모두에 영향을 미친다고 관찰합니다. 또한, 저자들은 도메인 적응을 통해 이러한 효과를 완화하려는 시도가 크게 상황을 개선하지 못했지만, 데이터 세트의 정보를 세부적으로 조정하면 어느 정도 도움이 될 수 있다고 주장합니다.
결론
연구자들은 이전에 제안된 도메인 적응(DAPT) 및 시간 적응과 같은 해결책이 문제를 완화하는 데 거의 기여하지 않는다는 이전의 발견을 확인합니다.
이 논문은 다음과 같이 결론을 맺습니다:
‘우리의 실험은 이전 연구에서 발견된 것보다 작업 간에 시간적 열화의 상당한 변이를 보여주었습니다. 이러한 발견은 NLP의 다양한 응용 분야에서 시간 불일치를 계속 연구하고, 벤치마크 평가에서 이를 고려하며, 실시간 시스템 성능을 시간이 지남에 따라 모니터링할 수 있는 실무者的 주의를 필요로 합니다. ‘
‘주목할 점은, 시간적으로 일치된 데이터로 LM을 계속 훈련하는 것이 거의 영향을 미치지 않는다는 것입니다. 이는 시간적 적응 방법을 찾는 데进一步 연구를 동기를 부여합니다. 이러한 방법은 시간이 지남에 따라 주석이 달린/레이블이 지정된 데이터 세트를 계속 수집하는 것보다 비용이 적습니다.’
저자들은 지속적인 학습을 조사하는 것이 유용할 수 있으며, 개념 드리프트와 작업의 변경을 감지하는 다른 방법이 데이터 세트를 업데이트하는 데 유용한 도구가 될 수 있다고 제안합니다.
* 인라인 인용을 하이퍼링크로 변환했습니다.












