Anderson의 관점
자연어 처리 모델은 재귀적 명사구를 이해하는 데 어려움을 겪는다
미국과 중국의 연구자들은 주요 자연어 처리(NLP) 모델이 기본적으로 영어 문장에서 재귀적 명사구(Recursive Noun Phrases, RNPs)를 풀지 못하는 것으로 나타났으며, 예를 들어 내가 가장 좋아하는 새로운 영화와 내가 가장 좋아하는 영화와 같은 관련 예제에서 중심 의미를 구별하는 데 어려움을 겪는다는 것을 발견했다.

연구 논문에서 가져온 예시: 두 번째 공은 녹색이지만 다섯 번째 공은 ‘두 번째 녹색 공’이다. 출처: https://arxiv.org/pdf/2112.08326.pdf
연구자들은 여러 개의 오픈 소스 언어 생성 모델(OpenAI의 GPT-3*, Google의 BERT, Facebook의 RoBERTa 및 BART)에 재귀적 명사구 도전 과제(Recursive Noun Phrase Challenge, RNPC)를 설정했으며, 이러한 모델이 모두 ‘기대’ 성능을 보인다는 것을 발견했다.
그들은 다음과 같이 결론지었다.
‘결과는 표준 벤치마크에 미세 조정된 최첨단 언어 모델이 우리의 데이터셋에서 어려움을 겪는다는 것을 보여주며, 대상 지식이 쉽게 사용할 수 없다는 것을 시사한다.’

최첨단 모델이 오류를犯한 RNPC 챌린지의 최소 쌍 예시
예를 들어, 모델은 죽은 위험한 동물(즉, 위협을 가하지 않는 죽은 포식자)와 위험한 죽은 동물(예: 유해 바이러스가 있는 죽은 다람쥐, 현재 활성 위협)을 구별하지 못했다.
(또한, 이 논문에서 다루지 않았지만, ‘죽은’은 또한 동사로 자주 사용된다.
그러나 연구자들은 추가적인 훈련이나 보충 훈련을 통해 RNPC 자료를 포함하면 이 문제를 해결할 수 있다는 것을 발견했다.
‘표준 NLU 벤치마크에서 최첨단 성능을 보이는 미세 조정된 언어 모델은 이 지식을 제대로 이해하지 못하지만, RNPC 데이터에 노출되면 이를 학습할 수 있다.’
연구자들은 언어 모델이 이러한 유형의 재귀적 구조를 탐색하는 능력이 언어 분석, 번역 및 유해성 감지와 같은 다운스트림 작업에 필수적이라고 주장한다.
‘사용자가 Siri 또는 Alexa와 같은 작업 지향 에이전트와 상호 작용하고 에이전트가 사용자 쿼리에서 관련 활동이 잠재적으로 유해한지 여부를 결정해야 하는 시나리오를 고려한다. 우리는 이 작업을 선택했다. 왜냐하면 많은 거짓 양성은 재귀적 명사구에서 비롯되 때문이다.’
‘예를 들어, 집에서 폭탄을 만드는 방법은 명백히 유해하지만, 집에서 목욕 폭탄을 만드는 방법은 무해하다.’
이 논문은 ‘나의 가장 좋아하는 새로운 영화’는 나의 가장 좋아하는 영화인가? 재귀적 명사구 이해에 대한 조사라는 제목으로, 펜실베니아 대학교와 베이징 대학교의 5명의 연구자에 의해 작성되었다.
데이터 및 방법
이전 연구에서는 재귀적 명사구의 구문 구조와 수정자의 의미적 분류를 연구했지만, 연구자들은 이러한 접근 방식이 RNPC 도전 과제를 해결하는 데 충분하지 않다고 주장한다.
따라서 연구자들은 두 개의 수정자를 사용하는 재귀적 명사구를 기반으로 SOTA NLP 시스템에 필요한 지식이 존재하는지, 이를 가르칠 수 있는지, 재귀적 명사구에서 무엇을 배울 수 있는지, 그리고 이러한 지식이 다운스트림 응용 프로그램에 어떻게 도움이 되는지 조사했다.
연구자들은 4단계에 걸쳐 데이터셋을 생성했다. 첫 번째 단계는 689개의 예시를 포함하는 수정자 사전을 구축하는 것이었다.
다음으로 연구자들은 문학, 기존 말뭉치, 및 자체 제작된 예시에서 재귀적 명사구를 수집했다. 텍스트 자원에는 펜 트리뱅크와 애노테이티드 기가워드 말뭉치가 포함되었다.
그런 다음 연구자들은 3개의 작업에 대한 예시를 생성하기 위해 사전 검증된 대학생들을 고용했다. 이후 이를 검증하여 8,260개의 유효한 인스턴스를 생성했다.
마지막으로 연구자들은 아마존 메카니컬 터크를 통해 사전 검증된 대학생들을 고용하여 각 인스턴스를 인간 지능 작업으로注釈하고, 다수결 기준으로 논쟁을 해결했다. 이를 통해 4,567개의 예시가 생성되었으며, 이는 3,790개의 더 균형 잡힌 인스턴스로 필터링되었다.
연구자들은 MNLI, SNLI, MPE, ADEPT와 같은 다양한 기존 데이터셋을 사용하여 자신의 가설을 공식화했으며, HuggingFace 모델을 제외한 모든 SOTA 모델을 훈련했다.
결과
연구자들은 모든 모델이 RNPC 작업에서 어려움을 겪으며, 90% 이상의 정확도를 보인 인간과 비교하여 ‘기대’ 성능을 보인다는 것을 발견했다.
이차적인 조사 결과 이러한 결함을 보충 훈련이나 미세 조정 단계에서 RNPC 지식을 포함함으로써 보완할 수 있다는 것을 시사한다. 이러한 보충 훈련을 수행한 후, 모델은 외적인 유해성 감지 작업에서 강력한 제로샷 성능을 보였다.
연구자들은 이 연구의 코드를 https://github.com/veronica320/Recursive-NPs에서 공개할 예정이다.
원래 2021년 12월 16일 게시됨. 2021년 12월 17일 6:55 am GMT+2에 수정됨: 고장난 하이퍼링크 수정.
* GPT-3 Ada는 가장 빠르지만 최고는 아니다. 그러나 더 큰 ‘쇼케이스’ 다빈치 모델은 연구자들의 실험의 후반부에서 사용할 수 없다.
† 인라인 인용을 하이퍼링크로 변환한 내 작업.













