AI 모델 및 플랫폼
언어 처리를 위한 구글의 오픈 소스 BERT 모델을 통해 언어 처리의 향상
변형자 및 트랜스포머의 양방향 인코더 표현, 즉 BERT는 언어 처리 모델의 효율성과 효과를 크게 향상시킨 훈련 모델입니다. 구글이 BERT 모델을 오픈 소스로 공개함으로써 모든 산업에서 언어 처리 모델의 개선이 가능해졌습니다. 이 글에서는 BERT가 언어 처리를 오늘날 가장 강력하고 유용한 인공지능 솔루션 중 하나로 만드는 방법을 살펴보겠습니다.
검색에 BERT 모델 적용
구글의 검색 엔진은 관련된 콘텐츠를 제공하는 능력으로 유명하며, 이 자연 언어 처리 프로그램을 세계에 오픈 소스로 공개했습니다.
시스템이 자연 언어를 읽고 해석하는 능력은 데이터가指数적으로 증가함에 따라 점점 더 중요해지고 있습니다. 구글의 단어 의미, 구, 관련 콘텐츠 제공 능력은 오픈 소스입니다. 자연 언어 처리를 넘어서, BERT 모델은大量의 비정형 데이터에서 정보를 추출할 수 있으며, 任意 라이브러리에 대한 검색 인터페이스를 생성할 수 있습니다. 이 글에서는 이 기술이 에너지 부문에서 어떻게 적용될 수 있는지 살펴보겠습니다.
BERT(Bidirectional Encoder Representations from Transformers)는 언어 처리 초기 모델의 공통적인 문제인ufficient 훈련 데이터의 부족을 해결하기 위해 구글 AI 언어 그룹에서 제안한 사전 훈련 접근 방식입니다.
자세히 설명하지 않도록 하겠습니다.
모델 훈련
낮은 수준의 언어 처리 작업(예: 명명된實體 인식, 주제 분할)과 높은 수준의 언어 처리 작업(예: 감정 분석, 음성 인식)은 작업별 주석이 달린 데이터셋이 필요합니다. 이러한 데이터셋은 구하기 어렵고 비싸기 때문에,浅い 신경망 모델과 깊은 신경망 모델 모두의 성능에 중요한 역할을 합니다. 높은 품질의 추론 결과는 수백만 또는 수십억 개의 주석이 달린 훈련 예제가 있을 때만 달성할 수 있었습니다. 그리고 이것이 많은 언어 처리 작업을 접근할 수 없게 만든 문제였습니다. 그것은 BERT가 개발되기 전까지였습니다.
BERT는大量의 비주석 텍스트 데이터에 훈련된 일반적인 언어 표현 모델입니다. 모델이大量의 텍스트 콘텐츠에 노출되면, 문장 내 단어 간의 контек스트와 관계를 이해하는 법을 학습합니다. 이전의 학습 모델과 달리, 단어 수준에서 의미를 나타내지 않고(예: “은행”은 “은행 계좌”와 “草地 은행”에서 동일한 의미를 가짐), BERT는 실제로 контек스트를 고려합니다. 즉, 단어가 문장에서 앞뒤에 있는 단어와의 관계를 고려합니다. kontekst가 언어 처리 모델의 성능에 직접적인 영향을 미치는 중요한 능력임이 밝혀졌습니다. BERT와 같은 kontekst-인지 모델을 설계하는 것은 언어 처리의 새로운 시대의 시작으로 간주됩니다.
BERT를大量의 텍스트 콘텐츠에 훈련하는 것은 사전 훈련이라고 하는 기술입니다. 즉, 모델의 가중치는 일반적인 텍스트 이해 작업을 위해 조정되고, 더 세부적인 모델은 이를 기반으로 구축될 수 있습니다. 저자들은 11개의 언어 처리 작업에 BERT 기반 모델을 사용하여 최첨단 결과를 달성함으로써 이러한 기술의 우수성을 입증했습니다.
사전 훈련된 모델
가장 좋은 점은, 사전 훈련된 BERT 모델이 오픈 소스이고 공개적으로 사용할 수 있다는 것입니다. 즉, 누구든지 언어 처리 작업을 수행하고 BERT를 기반으로 모델을 구축할 수 있습니다. 이것을 능가하는 것은 없습니다. 맞습니다. 이 또한 언어 처리 모델을 작은 데이터셋에서 훈련할 수 있으며, 처음부터 훈련할 필요가 없다는 것을 의미합니다. 새로운 시대의 시작입니다.
이러한 사전 훈련된 모델은 기업이 내부 또는 외부에서 언어 처리 모델을 배포하는 데 필요한 비용과 시간을 줄이는 데 도움이 됩니다. 언어 처리 모델의 효과는 팀빌딩닷컴의 CEO인 마이클 알렉시스에 의해 강조됩니다.
“언어 처리의 가장 큰 이점은 정보의 확장 가능하고 일관된 추론 및 처리입니다.” – 마이클 알렉시스, 팀빌딩닷컴의 CEO
마이클은 언어 처리가 아이스브레이커 또는 설문조사와 같은 문화 형성 프로그램에 어떻게 적용될 수 있는지 설명합니다. 언어 처리를 통해 회사는 직원들의 반응을 분석하여 회사 문화가 어떻게 진행되고 있는지에 대한貴重한 통찰력을 얻을 수 있습니다. 이것은 단순히 텍스트를 분석하는 것만이 아니라, 텍스트의 주석을 분석함으로써 달성됩니다. 즉, 모델은 또한 “줄 사이를 읽어” 감정, 감각, 전반적인 관점에 대한 추론을 끌어냅니다. BERT는 이러한 상황에서 지표의 기초를 사전 훈련하여 언어의細微한 부분을 이해하고 더 정확한 통찰력을 제공하는 데 도움이 될 수 있습니다.
쿼리 개선
컨텍스트를 모델링하는 능력은 BERT를 언어 처리의 영웅으로 만들었으며, 구글 검색 자체를 혁신적으로 개선했습니다. 아래는 구글 검색 제품 팀의 테스트 경험에 대한 인용문입니다.
“BERT가 쿼리의 의도를 이해하는 능력을 보여주는 몇 가지 예입니다. ‘2019 브라질 여행자 미국에 비자를 필요로 한다’라는 검색을 해보겠습니다. ‘to’라는 단어와 쿼리에서 다른 단어와의 관계는 의미를 이해하는 데 매우 중요합니다. 이것은 브라질에서 미국으로 여행하는 것에 관한 것이지, 그 반대가 아닙니다. 이전에는 우리의 알고리즘은 이 연결의 중요성을 이해하지 못했으며, 브라질로 여행하는 미국 시민에 대한 결과를 반환했습니다. BERT를 사용하면 검색에서 이러한細微한 부분을 이해하고 더 관련된 결과를 제공할 수 있습니다.”

BERT 검색 예시, 이전과 이후. 출처 블로그
우리의 이전 글에서 언어 처리와 OCR에 대한 몇 가지 예를 설명했습니다. 우리는 또한 “언어 처리 도구는 이상적인 정보 추출 도구”라고 언급했습니다. 에너지 부문에서 언어 처리 기술이 어떻게 새로운 응용 프로그램 사용 사례를 가능하게 하는지 살펴보겠습니다.
언어 처리 모델은大量의 비정형 데이터에서 정보를 추출할 수 있습니다
언어 처리 모델을 사용할 수 있는 한 가지 방법은 비정형 텍스트 데이터에서 임팩트 있는 정보를 추출하는 것입니다. 이메일, 저널, 노트, 로그, 보고서는 모두 비즈니스 운영의 일환으로 발생하는 텍스트 데이터 소스입니다. 이러한 문서 중 일부는 운영 효율성을 높이고 비용을 줄이는 데 중요한 역할을 할 수 있습니다.
예를 들어, 풍차 예측 유지 보수 故障 보고서는 풍차의 다양한 구성 요소의 동작에 대한 임팩트 있는 정보를 포함할 수 있습니다. 그러나 풍차 제조업체마다 다른 데이터 수집 규칙을 가지고 있기 때문에(즉, 유지 보수 보고서는 다른 형식과 언어로 제공됨), 관련 데이터 항목을 수동으로 식별하는 것은 공장 주인에게 빠르게 비용이 많이 들 수 있습니다. 언어 처리 도구는 비정형 콘텐츠에서 관련 개념, 속성, 이벤트를 추출할 수 있습니다. 텍스트 분석을 사용하여 다른 데이터 소스에서 상관관계와 패턴을 찾을 수 있습니다. 이것은 공장 주인에게故障 보고서에서 정량적 지표를 식별하여 예측 유지 보수를 구현할 수 있는 기회를 제공합니다.
언어 처리 모델은 자연 언어 검색 인터페이스를 제공할 수 있습니다
유사하게, 석유 및 가스 회사에서 일하는 지질학자들은 과거의鑽井 작업, 우물 로그, 지진 데이터와 관련된 많은 문서를 검토해야 합니다. 이러한 문서도 다른 형식과 여러 위치(물리적 및 디지털)에 분산되어 있기 때문에, 사용자들은 정보를 잘못된 위치에서 찾는 데 많은 시간을浪費합니다. 이러한 경우에 대한 해결책은 언어 처리 기반 검색 인터페이스를 제공하는 것입니다. 사용자는 자연 언어로 데이터를 조회할 수 있으며, 언어 처리 모델은 수백 개의 문서에서 데이터를 상관시켜 쿼리에 대한 답변 세트를 반환할 수 있습니다. 작업자는 자신의 전문 지식과 모델의 출력을 기반으로 피드백을 제공할 수 있으며, 이것은 모델을 더욱 개선할 수 있습니다.
그러나 이러한 모델을 배포하는 데 기술적인 고려가 필요합니다. 한 가지 측면은 산업 특유의 용어가 전통적인 학습 모델을 혼동시킬 수 있다는 것입니다. 두 번째는 모델의 성능이 훈련 데이터셋의 크기에 영향을 받을 수 있다는 것입니다. 이것이 사전 훈련된 모델이 유용한 경우입니다. kontekstual 표현은 적절한 단어 의미를 모델링하여 산업 특유의 용어로 인한 혼동을 제거할 수 있습니다. 사전 훈련된 모델을 사용하면 더 작은 데이터셋에서 네트워크를 훈련할 수 있습니다. 이것은 처음부터 훈련하는 데 필요한 시간, 에너지, 자원을 절약합니다.
당신의 비즈니스에 대해
비용을 절감하고 운영 효율성을 높이는 데 도움이 될 수 있는 언어 처리 작업을 생각해 볼 수 있나요?
블루 오렌지 디지털의 데이터 과학 팀은 당신을 위해 BERT를 조정해 줄 것입니다!










