AI 모델 및 플랫폼

심층 강화 학습을 사용한 문장 재구성 생성 – 사고 지도자

mm
Unite.AI를 Google의 선호 소스에 추가

글을 쓰거나 말할 때 우리는 모두 아이디어를 다른 사람에게 더 잘 전달할 수 있는 방법이 있는지 궁금해합니다. 어떤 단어를 사용해야 합니까? 생각을 어떻게 구조해야 합니까? 그들은 어떻게 반응할까요? Phrasee에서 우리는 언어에 대해 많은 시간을 생각합니다. 무엇이 효과가 있고 무엇이 효과가 없나요?

10 백만 명의 사람들에게 보내질 이메일 캠페인의 제목 줄을 작성하는 것을 상상해 보십시오. 새로운 랩톱에 20% 할인을 받을 수 있습니다.

어떤 줄을 선택하겠습니까?

  • 다음 주문에서 추가 20% 할인 받기
  • 준비되세요 – 추가 20% 할인

두 줄 모두 같은 정보를 전달하지만 하나는 다른 줄보다 거의 15% 높은 열람률을 달성했습니다 (그리고 나는 우리 모델이 어느 줄을 예측하는지 맞힐 수 있다고 생각합니다). 언어는 종종 A/B 테스트 또는 다중 무기 방정식을 통해 테스트될 수 있지만 자동으로 재구성 생성하는 것은 여전히 매우 어려운 연구 문제입니다.

두 문장이 서로의 재구성으로 간주되려면 동일한 의미를 공유해야 하며 교환 가능해야 합니다. 또 다른 중요한 점은 기계가 생성한 문장이 유창한지 여부입니다.

감독 학습과는 달리, 강화 학습(RL) 에이전트는 환경과 상호 작용하고 결과적으로 받는 보상을 관찰함으로써 학습합니다. 이 차이는 알고리즘이 작동하고 모델이 학습되는 방식에 큰 영향을 미칩니다. 심층 강화 학습은 에이전트가 복잡한 환경에서 인간을 능가하는 방법을 학습할 수 있도록 함수 근사자로 신경망을 사용합니다. 예를 들어 , 아타리, 스타크래프트 II 등이 있습니다.

이 성공에도 불구하고 강화 학습은 자연어 처리(NLP)를 포함한 실제 문제에 널리 적용되지 않았습니다.

데이터 과학 석사 학위 논문의 일부로 우리는 심층 강화 학습을 사용하여 감독 학습 방법을 능가하는 입력 텍스트의 재구성을 자동으로 생성하는 방법을 보여줍니다. 최상의 재구성을 생성하는 문제는 시맨틱 유사성을 최대화하면서 출력의 유창성을 유지하는 단어 시퀀스를 찾는 것으로 볼 수 있습니다. RL 에이전트는 제어 환경에서 최대 기대 보상을 달성하기 위한 최상의 동작 세트를 찾는 데 적합합니다.

대부분의 기계 학습 문제와는 달리, 대부분의 자연어 생성(NLG) 애플리케이션에서 가장 큰 문제는 모델링이 아니라 평가에 있습니다. 현재 인간 평가가 NLG 평가의 금본위로 간주되지만, 비용이 많이 들고, 시간이 많이 걸리고, 조정이 어려우며, 실험과 데이터셋 간에 재현성이 부족합니다 (Han, 2016). 따라서 연구자들은 인간의 판단을 반영하는 단순하고 일반화된 자동 메트릭을 오랫동안 찾고 있습니다 (Papineni et al., 2002).

기계 생성 이미지 캡션을 평가하는 가장 일반적인 자동 평가 방법은 다음과 같이 요약되며, 각 방법의 장단점이 있습니다.

강화 학습을 사용한 재구성 생성 파이프라인

우리는 높은 품질의 재구성을 생성하는 시스템인 ParaPhrasee를 개발했습니다. 시스템은 강화 학습을 효율적으로 적용하기 위해 여러 단계로 구성됩니다. 높은 수준의 파이프라인에 대한 간단한 요약은 아래에 나열되어 있으며, 자세한 내용은 학위 논문에 포함되어 있습니다.

데이터셋

연구에 사용되는 여러 재구성 데이터셋이 있습니다. Microsoft Paraphrase corpus (MSFT ), ACL의 의미 텍스트 유사성 경쟁, Quora 중복 질문, Twitter 공유 링크 등이 있습니다. 우리는 크기, 깨끗함, 두 개의 주목할만한 재구성 생성 논문에서 벤치마크로 사용된 MS-COCO를 선택했습니다. MS-COCO에는 5개의 인간 주석자가 제공한 5개의 이미지 캡션이 있는 120k개의 일반적인 장면 이미지가 포함되어 있습니다.

컴퓨터 비전 연구를 위해 주로 설계되었지만, 캡션은 높은 시맨틱 유사성을 가지고 있으며 재미있는 재구성입니다. 이미지 캡션은 다른 사람들에 의해 제공되므로 장면의 세부 정보에 약간의 차이가 있으며 생성된 문장은 세부 정보를 상상합니다.

감독 모델

강화 학습은 샘플 효율성, 훈련 시간, 일반적인 모범 사례 측면에서 크게 개선되었습니다. 그러나 RL 모델을 처음부터 훈련하는 것은 여전히 비교적 매우 느리고 불안정합니다 (Arulkumaran et al., 2017). 따라서 우리는 처음부터 훈련하는 대신 감독 모델을 훈련한 다음 이를 미세 조정하여 RL을 사용합니다.

우리는 인코더-디코더 모델 프레임워크를 사용하고 여러 기본 감독 모델의 성능을 평가합니다. RL을 사용하여 모델을 미세 조정할 때 우리는 디코더 네트워크만 미세 조정하고 인코더 네트워크를 정적으로 처리합니다. 따라서 우리는 두 가지 주요 프레임워크를 고려합니다.

  • 표준/바닐라 인코더-디코더와 함께 감독 모델을 처음부터 훈련
  • 인코더에 대해 사전 훈련된 문장 임베딩 모델 사용: GloVe, InferSent, BERT

감독 모델은 모델 간에 비교적 유사하게 수행되며 BERT와 바닐라 인코더-디코더가 최고의 성능을 달성합니다.

성능은 합리적이지만 세 가지 공통의 오류源이 있습니다. 말더듬, 문장 단편 생성, 상상입니다. 이러한 문제는 RL을 사용하여 해결하려고 합니다.

강화 학습 모델

RL 알고리즘을 구현하는 것은 매우 어렵습니다. 특히 문제가 해결될 수 있는지 모를 때 더욱 어렵습니다. 환경, 에이전트, 하이퍼파라미터, 보상 함수 또는 모든 것의 조합에서 문제가 있을 수 있습니다. 이러한 문제는 심층 강화 학습을 수행할 때 신경망을 디버깅하는 즐거움을 추가로 얻을 수 있습니다.

모든 디버깅과 마찬가지로 단순히 시작하는 것이 중요합니다. 우리는 RL 알고리즘을 테스트하고 감독 모델에서 지식을 전달하기 위한 반복 가능한 전략을 찾기 위해 잘 이해된 두 개의 玩具 RL 환경(CartPole 및 FrozenLake)의 변형을 구현했습니다.

우리는 Actor-Critic 알고리즘이 이러한 환경에서 REINFORCE를 능가하는 것을 발견했습니다. 감독 모델에서 지식을 Actor-Critic 모델로 전달하는 경우, 우리는 Actor의 가중치를 훈련된 감독 모델로 초기화하고 Critic을 사전 훈련함으로써 최고의 성능을 달성했습니다. 우리는 새로운 환경에 정교한 정책 증류 접근 방식을 일반화하는 것이 어려웠습니다. 이는 많은 새로운 하이퍼파라미터를 도입하기 때문이며 이를 조정하여 작동하도록 해야 합니다.

이러한 통찰력을 바탕으로 우리는 재구성 생성 작업에 대한 접근 방식을 개발하기 위해 나아갑니다. 먼저 환경을 생성해야 합니다.

환경은 다양한 평가 메트릭을 보상 함수로 사용하여 테스트할 수 있도록 허용합니다.

그런 다음 에이전트를 정의합니다. 여러 가지 장점이 있으므로 Actor-Critic 아키텍처를 사용합니다. Actor는 시퀀스의 다음 단어를 선택하는 데 사용되며 가중치는 감독 모델로 초기화됩니다. Critic은 상태가 받을 수 있는 기대 보상을 추정하여 Actor가 학습하도록 도와줍니다.

올바른 보상 함수 설계

RL 시스템을 설계하는 가장 중요한 구성 요소는 보상 함수입니다. 이는 RL 에이전트가 최적화하려고 하는 것입니다. 보상 함수가 잘못되면 결과가 고통을 받게 됩니다. 다른 모든 시스템의 부분이 작동하더라도 말입니다.

클래식 예는 CoastRunners입니다. 여기서 OpenAI 연구자들은 보상을 총 점수를 최대화하는 것으로 설정했습니다. 경주를 완료하는 것이 아니라 터보를 치는 루프에서 최고 점수를 얻을 수 있었습니다.

https://www.youtube.com/watch?time_continue=2&v=tlOIHko8ySg&feature=emb_title

기계 생성 문장의 품질을 평가하는 것은 자체적으로 해결되지 않은 문제입니다. 자동으로 이 목표를 캡처하는 보상 함수를 설계하는 것은 더 어렵습니다. 언어의 대부분의 측면은 선형 메트릭으로 잘 분해되지 않으며 작업에 따라 달라집니다 (Novikova et al., 2017).

RL 에이전트는 약점을 이용하여 높은 품질의 텍스트를 생성하는 대신 보상을 최대화하는 interessant 전략을 자주 발견합니다. 이는 평가 메트릭을 직접 최적화하지 않는 메트릭에서 성능이 저하되는 결과를 초래합니다.

우리는 세 가지 주요 접근 방식을 고려합니다.

  1. 단어 중복 메트릭

일반적인 NLP 평가 메트릭은 생성된 재구성과 평가 문장 사이의 단어 중복 비율을 고려합니다. 중복이 많을수록 보상이 많습니다. 단어 수준 접근 방식의 문제는 에이전트가 “a”, “is”, “on”, “of”와 같은 연결詞를 포함하는 경향이 있으며 유창성에는 측정 지표가 없다는 것입니다. 이는 매우 낮은 품질의 재구성을 생성합니다.

  1. 문장 수준 유사성 및 유창성 메트릭

생성된 재구성의 주요 속성은 유창하고 입력 문장과 의미적으로 유사해야 한다는 것입니다. 따라서 우리는 이들을 개별적으로 평가한 다음 메트릭을 결합하려고 합니다. 의미적 유사성의 경우, 우리는 사전 훈련된 모델에서 문장 임베딩 사이의 코사인 유사성을 사용합니다. 유창성의 경우, 우리는 GPT-2의 문장 당惑에서 기반한 점수를 사용합니다. 코사인 유사성과 유창성 점수가 클수록 보상이 많습니다.

우리는 여러 가지 문장 임베딩 모델과 유창성 모델의 조합을 시도했으며 성능은 합리적이지만 에이전트가 직면한 주요 문제는 의미적 유사성과 유창성을ufficiently 균형 있게 조절하지 못하는 것입니다. 대부분의 구성에서 에이전트는 유창성을 우선시하여 세부 정보를 제거하고 대부분의 엔티티를 “중간”에 넣거나 “테이블” 또는 “길가”에 옮기는 경향이 있습니다.

다중 목표 강화 학습은 매우 어렵고 여기에 열린 연구 문제입니다.

  1. 적대적 모델을 보상 함수로 사용

인간이 평가의 금본위로 간주되므로, 우리는 두 문장이 서로의 재구성인지 여부를 예측하는 별도의 모델인 판별자를 훈련합니다. RL 모델의 목표는 이 모델을 속여 입력 문장의 재구성이란 것을 확신시킵니다. 판별자는 두 문장이 서로의 재구성이 될 가능성이 있는지에 대한 점수를 생성하여 에이전트를 훈련하는 데 사용되는 보상을 제공합니다.

판별자는 5,000개의 추측마다 데이터셋에서 어느 재구성이 왔는지, 어느 것이 생성되었는지를 알립니다. 이를 통해 미래의 추측을 개선할 수 있습니다. 이 과정은 에이전트가 판별자를 속이려고 하고, 판별자가 생성된 재구성과 데이터셋의 평가 재구성을 구별하려고 하는 여러 라운드로 계속됩니다.

몇 라운드의 훈련 후, 에이전트는 감독 모델과 다른 보상 함수를 능가하는 재구성을 생성합니다.

결론 및 제한

적대적 접근 방식(게임을 위한 셀프 플레이 포함)은 명시적인 보상 함수를 정의하지 않고 특정 작업에서 인간 수준의 성능을 초과하는 RL 알고리즘을 훈련하는 데 매우 유망한 접근 방식입니다.

이 경우 RL이 감독 학습을 능가했지만, 코드, 계산, 복잡성 측면에서 추가 오버헤드는 대부분의 애플리케이션에서 성능 개선을 위해 충분하지 않습니다. RL은 감독 학습이 쉽게 적용되지 않고 보상 함수를 쉽게 정의할 수 있는 상황(예: 아타리 게임)에 남겨 둘 수 있습니다. 접근 방식과 알고리즘은 감독 학습에서 훨씬 더 성숙하며 오류 신호가 훨씬 더 강력하여 훈련이 더 빠르고 안정적입니다.

또 다른 고려 사항은, 다른 신경망 접근 방식과 마찬가지로, 에이전트가 이전에 본 입력과 다른 입력에서 매우剧적으로 실패할 수 있다는 것입니다. 이는 프로덕션 애플리케이션에서 추가적인 정당성 검사를 필요로 합니다.

최근 몇 년 동안 RL 접근 방식에 대한 관심과 계산 인프라의 발전은 특히 NLP에서 산업에서 RL을 적용하는 데 큰 기회를 열어줄 것입니다.

Andrew Gibbs-Bravo는 Phrasee의 데이터 과학자로 Phrasee의 세계 최고의 AI-Powered Copywriting 기술을 개선하는 데 중점을 두고 있습니다. 그는 또한 런던 강화 학습 커뮤니티 미팅의 공동 조직자이며 모든 RL, NLP, 기계 학습에 관심이 있습니다.