AI 기초

메타 러닝이란 무엇인가?

mm
Unite.AI를 Google의 선호 소스에 추가

메타 러닝이란 무엇인가?

기계 학습에서 가장 빠르게 성장하는 연구 분야 중 하나는 메타 러닝 분야입니다. 메타 러닝은 기계 학습 알고리즘을 사용하여 다른 기계 학습 모델의 훈련과 최적화를 지원하는 것입니다. 메타 러닝이 점점 더 인기 있고 다양한 메타 러닝 기술이 개발됨에 따라 메타 러닝이 무엇인지 이해하고 다양한 방법으로 적용하는 것이 유용합니다. 메타 러닝의 아이디어, 메타 러닝의 유형, 및 메타 러닝을 사용하는 몇 가지 방법을 살펴보겠습니다.

메타 러닝이라는 용어는 도날드 모즈리によって 만들어졌으며, 사람들이 배우는 것을 형성하고, 학습, 성장의 습관을 내면화하는 과정을 설명합니다. 이후 인지 과학자와 심리학자들은 메타 러닝을 “학습하는 방법을 학습하는 것”으로 설명했습니다.

기계 학습 버전의 메타 러닝에서는 “학습하는 방법을 학습하는” 일반적인 아이디어가 인공 지능 시스템에 적용됩니다. 인공 지능에서 메타 러닝은 다양한 복잡한 작업을 수행하는 능력입니다. 인공 지능 시스템은 일반적으로 많은 작은 하위 작업을 통해 작업을 수행하도록 훈련되어야 합니다. 이 훈련은 오랜 시간이 걸릴 수 있으며 인공 지능 에이전트는 하나의 작업에서 학습한 지식을 다른 작업에 쉽게 전이하지 못합니다. 메타 러닝 모델과 기술을 만들면 인공 지능이 학습 방법을 일반화하고 새로운 기술을 더 빠르게 습득할 수 있습니다.

메타 러닝의 유형

옵티마이저 메타 러닝

메타 러닝은 기존 신경망의 성능을 최적화하는 데 자주 사용됩니다. 옵티마이저 메타 러닝 방법은 일반적으로 다른 신경망의 하이퍼파라미터를 조정하여 기본 신경망의 성능을 개선합니다. 결과적으로 대상 네트워크는 훈련된 작업을 수행하는 데 더 좋아집니다. 메타 러닝 옵티마이저의 예는 그라디언트 디센트 결과를 개선하는 것입니다.

FEW-샷 메타 러닝

Few-샷 메타 러닝 접근 방식은 일반화된 학습 데이터셋에서 보지 못한 데이터셋으로 일반화할 수 있는 깊은 신경망을 설계하는 것입니다. Few-샷 분류는 일반적인 분류 작업과 유사하지만 데이터 샘플은 전체 데이터셋입니다. 모델은 많은 다른 학습 작업/데이터셋에서 훈련되고 최적의 성능을 위해 최적화됩니다. 이 접근 방식에서는 단일 훈련 샘플이 여러 클래스로 분할됩니다. 즉, 각 훈련 샘플/데이터셋은 2개의 클래스로 구성될 수 있습니다. 이 경우 전체 훈련 작업은 4-샷 2-클래스 분류 작업으로 설명될 수 있습니다.

Few-샷 학습에서는 개인 훈련 샘플이 최소한으로 유지되고 네트워크가 몇 개의 이미지만 보아도 객체를 식별할 수 있는 방법을 학습한다는 아이디어입니다. 이것은 아이가 몇 개의 이미지만 보아도 객체를 구별하는 방법을 배우는 것과 유사합니다. 이 접근 방식은 원샷 생성 모델 및 메모리 보강 신경망과 같은 기술을 만드는 데 사용되었습니다.

메트릭 메타 러닝

메트릭 기반 메타 러닝은 신경망을 사용하여 메트릭이 효과적으로 사용되고 있는지 및 네트워크 또는 네트워크가 대상 메트릭을 충족하는지 확인하는 것입니다. 메트릭 메타 러닝은 Few-샷 학습과 유사하여 훈련에 사용되는 샘플이 매우 적습니다. 동일한 메트릭을 다양한 도메인에서 사용하며 네트워크가 메트릭에서 벗어나면 실패로 간주됩니다.

リカ런트 모델 메타 러닝

リカ런트 모델 메타 러닝은 리카런트 신경망 및 장단기 메모리 네트워크에 메타 러닝 기술을 적용하는 것입니다. 이 기술은 리카런트 신경망/장단기 메모리 모델을 순차적으로 학습한 다음 이 모델을 다른 학습者的 기초로 사용합니다. 메타 러닝者는 초기 모델을 훈련하는 데 사용된 특정 최적화 알고리즘을 수신합니다. 메타 러닝者的 매개 변수화는 빠른 초기화 및 수렴을 가능하게 하지만 새로운 시나리오에 대한 업데이트도 허용합니다.

메타 러닝은 어떻게 작동하는가?

메타 러닝을 수행하는 정확한 방법은 모델과 작업의 특성에 따라 다르지만 일반적으로 첫 번째 네트워크의 매개 변수를 두 번째 네트워크/옵티마이저의 매개 변수로 복사하는 것을 포함합니다.

메타 러닝에는 두 가지 훈련 프로세스가 있습니다. 메타 러닝 모델은 일반적으로 기본 모델의 여러 단계의 훈련이 완료된 후 훈련됩니다. 기본 모델의 순방향, 역방향 및 최적화 단계 후에 옵티마이저의 순방향 훈련 단계가 수행됩니다. 예를 들어, 기본 모델의 3~4단계 훈련 후에 메타 손실을 계산합니다. 메타 손실을 계산한 후에 각 메타 매개 변수에 대한 기울기를 계산합니다. 이후 옵티마이저의 메타 매개 변수가 업데이트됩니다.

메타 손실을 계산하는 한 가지 방법은 초기 모델의 순방향 훈련 단계를 완료하고 이미 계산된 손실을 결합하는 것입니다. 메타 옵티마이저는 다른 메타 러닝者일 수 있지만, 어느 정도에서는 ADAM 또는 SGD와 같은 이산 옵티마이저를 사용해야 합니다.

많은 깊은 학습 모델에는 수백만 개의 매개 변수가 있을 수 있습니다. 완전히 새로운 매개 변수 세트를 가진 메타 러닝者를 만드는 것은 계산적으로 비용이 많이 들기 때문에 일반적으로 좌표 공유라는 전략을 사용합니다. 좌표 공유는 메타 러닝者/옵티마이저를 설계하여 기본 모델에서 단일 매개 변수를 학습하고 나머지 모든 매개 변수를 대체하는 것입니다. 결과적으로 옵티마이저가 소유한 매개 변수는 모델의 매개 변수에 의존하지 않습니다.

블로거이자 프로그래머로 Machine Learning Deep Learning 주제에 전문가입니다. 다니엘은 다른 사람들이 AI의 힘을 사회적善으로 사용하는 것을 돕기를 희망합니다.