Anderson의 관점
NLP에서 잘못된 질문에 도전하기

일부 질문은 잘못된 정보를 포함하고 있기 때문에 답할 수 없습니다. 이러한 질문은 청자가 필터링하고 거부해야 하는 가정을 포함하고 있습니다. 이는 청자가 질문 자체를 잘못된 정보의 출처로 사용하는 대신 질문에 도전하기 위해 충분한 올바른 정보를 가지고 있다고 가정합니다.
이것은 GPT-3와 같은 자연어 처리(NLP) 시스템에게 도전입니다. 이러한 시스템은 대화 흐름을 유지하기 위해 정보를 ‘환상’으로 만들어내는 경향이 있습니다.
현재, GPT-3에게 “마리 퀴리가 우라늄을 언제 발명했는지”라고 묻는다면 “마리 퀴리가 1898년에 우라늄을 발명했다”라는 대답을 받을 것입니다.

출처: https://beta.openai.com/playground (다빈치 인스트럭트 베타).
실제로, 우라늄은 1789년에 독일 화학자 마틴 하인리히 클라프로트에 의해 발견되었습니다. 퀴리 부부의 1898년 발견은 라듐의 분리였습니다.
NLP 시스템이 잘못된 가정을 무시하는 문제는 올해 여러 공개된 자료에서 주목을 받았습니다. 예를 들어, 구글의 AI 지원 검색 결과는 “닐 암스트롱이 화성에 언제 발을 들였는가?”라는 질문에서 잘못된 정보를 무시합니다. 이 오류는 아직도 나타나고 있으며, 동일한 문제는 토이 스토리의 버즈 라이트イヤ에도 적용됩니다. 버즈 라이트イヤ는 1969년 7월 21일에 달에 착륙했다고 합니다.
톰 행크스, 또 다른 토이 스토리 출신 배우는, 1970년에 달에 착륙했다고 구글에 의해 인정받고 있습니다. 이는 그의 아폴로 13 캐릭터, 즉 우주인 짐 러벨이 달에 착륙하지 못한 것으로 가장 유명합니다.

NLP 대화에서 가정을 해결하는 문제
구글 리서치와 존스 홉킨스 대학교, 브라운 대학교의 연구자들은 NLP 시스템이 사실적으로 잘못된 질문에 도전할 수 있도록 새로운 기계 학습 방법을 조사하고 있습니다. 이것은 인간 교사들이 학생들과의 대화에서 반드시 해야 하는 일입니다.
최근의 논문 어느 언어학자가 전구를 발명했는가? 질문-답변을 위한 가정을 검증은 가정을 식별하고 검증하기 위한 새로운 시스템을 개발하기 위한 집중적인 노력을 설명합니다.
새로운 알고리즘은 질문을 반환하기 전에 효과적으로 질문을 전처리합니다. 질문의 ‘인증’을 3단계로 나누어 진행합니다.
대부분의 NLP 기반 훈련 루틴은 소스 데이터에 과도한 신뢰를 가지고 학습합니다. 이는 사실적으로 잘못된 정보를 포함하는 질문에 대한 올바른 대답을 생성할 수 없습니다.
최적의 접근 방법을 결정하기
연구자들은 100개의 잘못된 질문을 4개의 다른 Q&A 모델에 넣고, 인간 평가자에게 가장 좋은 해결책을 선택하도록 요청했습니다.
4개의 가능한 아키텍처 결과는 다음과 같습니다: ‘답변할 수 없음’ – 질문을 종료하는 Q&A 시스템; ‘가정을 검증한 설명’ – 시스템이 잘못된 가정을 검증하지 못한 경우; ‘추출한 설명’ – 시스템이 관련된 위키백과 문장을 가져와서 추가합니다; ‘개방형 도메인 다시 작성’ – 경쟁 시스템이 추가적인 소스를 찾습니다.

경쟁적인 도메인 기반 해결책의 복잡성을 보여주는 ‘답변할 수 없는’ 질문에 대한 4가지 가능한 답변의 예.
테스트 과정에서, 5명의 참가자(구글 내부 크라우드소싱 플랫폼에서 모집됨)는 가정을 검증한 답변을 선호했습니다. 이것은 연구자들이 새로운 프레임워크를 개발하게 만들었습니다.
데이터셋
초기 단계에서 생성된 가정을 수동으로 수정하여 검증 데이터셋을 만들었습니다. 질문에서 파생된 가정이지만 원래 질문에 없는 가정을 제거했습니다.
논문의 두 저자는 각 질문과 관련된 위키백과 페이지를 기준으로 462개의 가정을 수동으로 주석을 달았습니다. 의견 불일치는 데이터셋에 커밋되기 전에事後 토의를 통해 해결되었습니다.
결과 및 응답 형성
가장 효과적인 결과는 가장 노동 집약적인 해결책에서 얻었습니다: ALBERT QNLI와 위키 문장을 사용하여 생성된 규칙 기반/NLI 하이브리드.

위키 문장을 사용하여 생성된 검증 모델의 성능.
이 형성을 사용하여, 연구자들은 위키백과에서 가져온 사실을 ‘이 질문은 답변할 수 없습니다. 왜냐하면…’와 같은 문장에 추가하는 템플릿 시스템을 개발했습니다.
의미
이 접근 방식의 궁극적인 성능에 따라, 이는 궁극적으로 ‘답변할 수 없음’ 대신 ‘검증할 수 없음’을 대체할 수 있습니다. 이는 미래의 더 나은 검증 시스템을 위한 기반을 마련할 것입니다.
연구자들은 이미 토큰 기반 API 요청의 비용이 제한 요인이라고 인정하고 있습니다. 또한, 시스템은 현재 텍스트의 의미적 측면을 파싱하는 데 한계가 있습니다.
예를 들어, who does pip believe is estella’s mother에는 비 事実적 동사 believe아래에 포함된 소유격이 있습니다. 그러나我们的 생성기는仍然会生成 ‘estella’ has ‘mother’입니다.
연구자들은 새로운 질문-답변 시스템을 개발할 계획입니다.
미래에, 우리는 QA 시스템을 더 강력하고 협력적으로 만들기 위해 이 연구를 기반으로 할 것입니다. 예를 들어, 다른 유형의 가정을 검증할 수 있는 더 유연한 답변 전략을 개발할 수 있습니다.













