Anderson의 관점
NLG 콘텐츠 인증을 위한 인용문 사용의 위험성

의견 자연어 생성 모델인 GPT-3와 같은 모델은 허구의 정보를 생성하는 경향이 있습니다. 가짜 뉴스의 성장에 대한 우려가 매우 높은 시대에, 이러한 허구의 정보는 자동화된 글쓰기 및 요약 시스템의 개발과 AI 기반 저널리즘의 미래를 포함한 다양한 자연어 처리(NLP) 하위 분야에 대한 존재적 장애물입니다.
중심 문제는 GPT 스타일의 언어 모델이 매우 큰 훈련 텍스트 корп스에서 주요 기능과 클래스를 파생하고, 이러한 기능을 정확성이나 수용성과 관계없이 언어의 구성 요소로 사용하는 것입니다.
따라서 NLG 시스템은 현재 두 가지 접근 방식 중 하나를 사용하여 인간의 사실 확인에 의존합니다. 모델이 시드 텍스트 생성기로 사용되어 즉시 인간 사용자에게 전달되거나, 인간이 모델의 출력을 편집하거나 수정하는 경우입니다. 또는 인간이 모델을 교육하기 위한 데이터셋의 품질을 향상시키기 위한 비용이 많이 드는 필터로 사용됩니다.
구식 뉴스와 거짓 사실
자연어 생성 모델은 실제 역사, 과학, 경제 또는 의견을 요구하는 주제와 같은 의미 구조를 학습했기 때문에 설득력 있고 가능성 있는 출력을 생성할 수 있습니다.
NLG 모델이 생성하는 정보의 사실적 정확성은 모델을 훈련하는 입력 데이터가 신뢰할 수 있고 최신인지 가정합니다. 이는 전처리 및 추가 인간 기반 검증에 대한 비용이 많이 드는 부담을 나타냅니다.
GPT-3와 같은 모델은 훈련에 많은 시간과 돈이 필요하며, 한 번 훈련되면 모델의 핵심을 업데이트하는 것이 어렵습니다. 세션 기반 및 사용자 기반의 지역 수정은 모델의 유용성과 정확성을提高할 수 있지만, 이러한 이점을 모델의 핵심으로 되돌리는 것은 어려울 수 있습니다.
이러한 이유로 최신 정보를 사용하는 훈련된 언어 모델을 생성하는 것이 어렵습니다.

COVID-19 이전에 훈련된 text-davinci-002 – GPT-3의 가장 능력 있는 버전 – 는 4000 토큰을 처리할 수 있지만 COVID-19 또는 2022년 우크라이나 침공에 대해 아무것도 모릅니다.
훈련된 모델은 훈련 시간에 내부화된 ‘진실’만 액세스할 수 있으며, 모델의 주장을 검증하기 위해 정확하고 관련 있는 인용문을 얻는 것이 어렵습니다. GPT-3와 같은 모델에서 기본적으로 인용문을 얻는 실제 위험은 때때로 올바른 인용문을 생성하여 모델의 이 기능에 대한 잘못된 자신감을 유발하는 것입니다.

위, 2021년 davinci-instruct-text GPT-3에서 얻은 세 개의 정확한 인용문. 중간, GPT-3는 아인슈타인의 가장 유명한 인용문 중 하나를 인용하지 못합니다. 아래, GPT-3는 아인슈타인에게 유명하지도 않고 허구의 인용문을 할당합니다.
GopherCite
이러한 NLG 모델의 일반적인 약점을 해결하기 위해, Google의 DeepMind는 GopherCite를 제안했습니다. 이는 280억 매개변수를 갖는 모델로, 특정 증거를 인용하여 생성된 응답을 지원할 수 있습니다.



GopherCite가 실제 인용문을 사용하여 주장을 뒷받침하는 세 가지 예시.
GopherCite는 인간의 선호도를 강화하는 학습(RLHP)을 사용하여 실제 인용문을 인용하여 증거를 제공하는 질의 모델을 훈련합니다. 인용문은 검색 엔진에서 얻은 여러 문서 소스 또는 사용자가 제공한 특정 문서에서 가져옵니다.
GopherCite의 성능은 모델의 응답을 평가하는 인간 평가를 통해 측정되었으며, Google의 NaturalQuestions 데이터셋에서 80%, ELI5 데이터셋에서 67%의 경우 높은 품질의 응답을 보였습니다.
거짓 인용
그러나 GopherCite는 옥스포드 대학교의 TruthfulQA 벤치마크에 대해 평가될 때, 진실한 응답으로 평가되는 경우가 드뭅니다.
저자들은 이것이 지원된 답변의 개념이 객관적으로 진리를 정의하는 데 도움이 되지 않는다는 사실에 기인한다고 제안합니다. 즉, 출처 인용문의 유용성은 저자가 허구의 세계에 대해 작성하거나 광고 콘텐츠를 생성하거나 기타 비현실적인 자료를 생성하는 경우와 같은 다른 요인에 의해 손상될 수 있습니다.



GopherCite의 경우, 설득력 있는 것이 반드시 ‘진실’을 의미하지는 않습니다.
효과적으로, ‘지원된’와 ‘진실된’을 구별하는 것이 필요합니다. 인간 문화는 객관적인 진리 정의를 얻기 위한 방법론과 프레임워크의 사용에서 기계 학습보다 훨씬 앞서 있습니다. 중요한 진리의 본질적인 상태는 논쟁과 경미한 부정입니다.
이 문제는 인간의 합의를 진리의 기준으로 사용하는 NLG 아키텍처에서 재귀적입니다. 인간 평가자는 모델의 출력을 평가하기 위해 사용되며, 그들 사이의 분쟁을 중재하는 다른 인간도 편향되어 있습니다.
예를 들어, 초기 GopherCite 실험에서는 ‘슈퍼 평가자’ 모델을 사용하여 모델의 출력을 평가하기 위한 최고의 인간 평가자를 선택했습니다. 평가자들은 품질 보증 세트와 비교하여 85% 이상의 점수를 얻은 평가자만을 선택했습니다. 최종적으로 113명의 슈퍼 평가자가 선택되었습니다.
논리적으로, 이것은 불가능한 프랙탈 추구의 완벽한 그림입니다. 평가자를 평가하기 위한 품질 보증 세트는 또 다른 인간이 정의한 진리의 척도이며, GopherCite가 부족한 것으로 판명된 옥스포드 TruthfulQA 세트와도 같습니다.
지원된 콘텐츠와 ‘인증된’ 콘텐츠에 관해서, NLG 시스템은 인간의 데이터를 훈련하여 인간의 불일치와 다양성을 합성하기만 할 수 있습니다. 이는 자체적으로도 해결되지 않은 문제입니다. 우리는 우리의 관점을 지원하는 출처를 인용하고, 우리의 정보가 구식이거나 완전히 부정확하거나 다른 방식으로 허구로 왜곡된 경우에도 권위적으로 말하고, 이러한 관점을 직접 野에 방출하는 경향이 있습니다.
따라서 인용문을 지원하는 NLG 시스템을 개발하는 데 따른 위험은 출처 자료의 예측할 수 없는 특성과 관련이 있습니다. 모델의 출력에 대한 사용자 신뢰를 높이는 모든 메커니즘(예: 직접 인용 및 인용문)은 현재 기술 수준에서는 모델의 출력의 진실성보다 신뢰성을 더 많이 추가합니다.
이러한 기술은 NLP가 오웰의 1984의 ‘萬花筒’을 재창조할 때 유용할 것입니다. 그러나 객관적인 문서 분석, AI 중심 저널리즘 및 기계 요약 및 자발적 또는 유도된 텍스트 생성과 같은 비소설 응용 분야에는 위험한 추구입니다.
첫 번째로 게시됨: 2022년 4월 5일. 2022년 4월 5일 15:29 EET에 용어를 수정하기 위해 업데이트됨.













