AI 기초

트랜스포머 신경망이란 무엇인가?

mm
Unite.AI를 Google의 선호 소스에 추가

트랜스포머는 어텐션을 사용하여 토큰 간 관계를 처리하는 신경망 아키텍처입니다. 각 위치에서 은닉 상태를 전달해야 하는 순환 네트워크와 달리, 트랜스포머는 학습 중에 많은 토큰 간 상호작용을 병렬로 계산할 수 있습니다.

트랜스포머는 많은 언어, 비전, 오디오 및 다중모달 시스템에 동력을 제공하지만, 이 아키텍처가 데이터베이스이거나 추론을 보장하는 것은 아닙니다. 출력은 학습된 파라미터와 제공된 컨텍스트, 디코딩 절차에 조건화된 예측에 불과합니다.

핵심 요점

  • 셀프 어텐션은 각 토큰이 다른 허용된 토큰들로부터 컨텍스트 의존적인 표현을 구성하도록 합니다.
  • 어텐션만으로는 토큰 순서를 인코딩하지 못하므로 위치 정보를 추가합니다.
  • 인코더 전용, 디코더 전용, 인코더‑디코더 트랜스포머는 서로 다른 목표를 수행합니다.
  • 컨텍스트 길이, 계산량, 학습 데이터 및 평가가—어텐션만이 아니라—성능과 신뢰성을 결정합니다.
What Are Transformer Neural Networks? diagram showing tokens, embed + position, self-attention, feed-forward, stack blocks, output
어텐션은 컨텍스트 표현을 구축하며, 마스크와 목표가 어떤 정보가 사용 가능한지를 결정합니다.

토큰, 임베딩 및 위치

텍스트는 먼저 토큰으로 분할되며, 토큰은 단어, 서브워드 또는 문자일 수 있습니다. 각 토큰 ID는 학습된 임베딩 벡터를 선택합니다. 비전 트랜스포머는 이미지 패치를 임베딩할 수 있고, 오디오 트랜스포머는 프레임이나 학습된 음향 단위를 임베딩할 수 있습니다.

순수 어텐션 연산은 순열에 대해 동등하기 때문에 모델은 위치 정보가 필요합니다. 구현에 따라 학습된 또는 고정된 위치 인코딩을 추가하거나, 상대적 또는 회전형 위치 방식을 사용해 어텐션 점수를 조정할 수 있습니다. 결과적으로 토큰이 무엇인지와 어디에 위치하는지가 결합됩니다.

스케일된 점곱 및 멀티헤드 어텐션

각 위치마다 학습된 투영을 통해 쿼리, 키, 값을 생성합니다. 쿼리와 허용된 키 사이의 유사도가 어텐션 가중치를 만들고, 가중된 값들이 출력이 됩니다. 점곱을 스케일링하면 벡터 차원이 커질 때 소프트맥스가 수치적으로 안정적으로 유지됩니다.

멀티헤드 어텐션은 이 연산을 여러 학습된 서브스페이스에서 반복합니다. 서로 다른 헤드는 다양한 관계에 특화될 수 있지만, 시각적으로 매력적인 어텐션 패턴이 모델의 결정에 대한 충실한 설명이라고 자동으로 간주되어서는 안 됩니다.

트랜스포머 블록

어텐션 서브레이어 뒤에는 위치별 피드포워드 네트워크가 이어집니다. 잔차 연결은 각 서브레이어를 통과하면서 이전 표현을 전달하고, 정규화와 정규화 기법은 최적화를 지원합니다. 여러 블록을 쌓음으로써 딥러닝을 통해 점점 더 컨텍스트화된 특징을 구축합니다.

인과적 생성 과정에서는 마스크가 현재 위치가 미래 토큰을 읽는 것을 방지합니다. 추론 시에는 디코더가 하나의 토큰을 예측하고 이를 추가한 뒤 반복합니다. 키‑값 캐시는 이전 어텐션 투영을 재계산하는 것을 피하게 하여 생성 비용을 줄이지만 완전히 없애지는 못합니다.

인코더, 디코더 및 인코더‑디코더 계열

인코더 전용 모델은 분류, 검색 및 토큰 라벨링에 적합한 양방향 표현을 학습합니다. 디코더 전용 모델은 다음 토큰 생성을 위해 인과 어텐션을 사용합니다. 인코더‑디코더 모델은 디코더가 인코딩된 입력에 어텐션을 할 수 있게 하며, 이는 번역 및 기타 시퀀스‑투‑시퀀스 작업에 유용합니다.

현대 시스템은 종종 광범위한 사전학습으로 시작한 뒤 전이 학습, 지시 튜닝 또는 선호도 최적화를 사용합니다. 따라서 동일한 아키텍처가 목표와 데이터에 따라 매우 다른 동작을 지원할 수 있습니다.

제한, 효율성 및 평가

시퀀스 전체에 대한 풀 어텐션은 시퀀스 길이에 대해 이차적인 쌍별 상호작용을 가지므로 메모리와 계산 부담을 초래합니다. 희소 혹은 선형 어텐션, 청킹, 검색, 양자화 및 캐싱은 정확도, 컨텍스트 접근성, 지연 시간 및 구현 복잡성 사이에서 절충합니다.

더 큰 컨텍스트 윈도우가 모든 제공된 사실을 올바르게 사용한다는 보장을 제공하지는 않습니다. 사실성, 견고성, 보정, 지연 시간, 비용 및 작업별 실패 모드를 평가하십시오. 인터랙티브 시스템에서는 프롬프트 엔지니어링이 행동을 형성할 수 있지만, 확률적 모델을 무오류 소스로 바꾸지는 못합니다.

토큰에서 컨텍스트까지의 트랜스포머 계산

트랜스포머는 토큰을 벡터로 매핑하고 위치 정보를 추가한 뒤, 반복되는 어텐션 및 피드포워드 블록을 통과시킵니다. 셀프 어텐션에서는 학습된 투영을 통해 쿼리, 키, 값을 생성합니다. 스케일된 점곱은 각 쿼리와 키를 비교하고, 소프트맥스가 가중치를 생성하며, 가중된 값이 컨텍스트를 형성합니다. 여러 헤드는 서로 다른 투영 공간을 학습합니다. 잔차 연결과 정규화는 깊은 스택을 안정화하고, 피드포워드 네트워크는 어텐션 레이어 사이에서 각 토큰을 독립적으로 변환합니다.

인코더 전용 모델은 양방향 컨텍스트를 사용하여 분류 또는 표현 작업에 적합합니다. 디코더 전용 모델은 인과 마스크를 적용해 각 위치가 이전 토큰을 기반으로 예측하며, 생성 언어 모델링을 주도합니다. 인코더‑디코더 모델은 디코더가 번역 및 구조화된 생성 작업을 위해 인코딩된 입력에 어텐션을 할 수 있게 합니다. 표준 형태에서 어텐션 비용은 시퀀스 길이에 따라 이차적으로 증가하므로, 희소, 선형, 청크, 순환 및 상태공간 대안이 동기를 부여합니다. 더 긴 컨텍스트는 사용 가능한 증거를 늘리지만, 회상이나 추론을 보장하지는 않습니다.

학습, 적응 및 추론

사전학습 목표에는 다음 토큰 예측, 마스크된 토큰 복원, 시퀀스‑투‑시퀀스 손상이 포함됩니다. 데이터 혼합, 중복 제거, 토크나이저, 컨텍스트 패킹, 옵티마이저, 스케줄 및 연산량이 능력을 형성합니다. 파인튜닝은 모든 파라미터를 업데이트하거나 어댑터와 저차원 방법을 사용할 수 있으며, 지시 및 선호 튜닝은 행동을 변경합니다. 검색은 변하는 사실에 대해 종종 더 효과적이며, 튜닝은 형식 및 작업 행동에 유용합니다. 손대지 않은 평가 세트를 유지하고 공개 벤치마크로부터의 오염을 테스트하십시오.

자동회귀 추론은 이전 토큰에 대한 키‑값 투영을 저장해 재계산을 피합니다. 지연 시간은 프롬프트 처리와 순차 디코딩에 따라 달라지고, 처리량은 배치, 메모리, 캐시 관리, 정밀도 및 하드웨어에 의존합니다. 탐욕, 온도, top‑k, top‑p, 빔 탐색 방법은 결정성 및 다양성 사이를 절충합니다. 양자화는 메모리를 줄이지만 희귀 기능에 영향을 줄 수 있습니다. 실제 시퀀스 길이에서 배포된 모델, 토크나이저, 프롬프트 템플릿, 샘플러 및 런타임을 검증하십시오.

평가 및 제어

트랜스포머는 환각을 일으키거나 악의적인 검색된 지시를 따르거나 기억된 데이터를 노출시키거나 언어 및 긴 컨텍스트에서 성능이 저하될 수 있습니다. 작업 성공, 사실적 지원, 보정, 거부, 견고성, 안전성, 지연 시간 및 비용을 평가하고, 증거와 도구 행동을 별도로 검토하십시오. 권한 인식 검색, 타입된 도구, 외부 인증, 속도 제한 및 중요한 행동에 대한 인간 승인을 사용하십시오. 모델 및 프롬프트 버전, 입력 분포, 도구 오류 및 사용자 수정을 모니터링하십시오. 트랜스포머는 시퀀스 계산을 위한 아키텍처일 뿐, 이해의 증거나 진실된 출력을 보장하는 것은 아닙니다.

실제 예시: 트랜스포머 문서 어시스턴트

한 기업은 승인된 매뉴얼을 문서 ID, 버전, 섹션, 권한 및 발효일과 함께 색인합니다. 트랜스포머 기반 어시스턴트는 증거를 검색하고 재순위화한 뒤, 허용된 구절에서 인용과 함께 답변합니다. 평가 세트는 역할 및 문서 유형별로 답변 가능, 불가능, 모호, 충돌 질문을 포함합니다. 검색 재현율, 인용 정밀도, 근거 있는 답변 정확성, 거부, 긴 컨텍스트 행동, 지연 시간 및 비용을 별도로 점수화합니다.

검색된 문서는 신뢰할 수 없는 데이터로 취급되므로, 내장된 지시가 시스템 정책을 무시하거나 도구를 승인할 수 없습니다. 사용자는 검색 전에 인증을 거치며, 중요한 행동은 모델 외부에 남습니다. 로그는 불필요한 문서 내용 없이 증거 ID와 버전을 보존합니다. 모니터링은 코퍼스 변화, 지원되지 않는 답변, 권한 오류 및 사용자 수정을 감지합니다. 모델 또는 토크나이저 변경은 전체 테스트 세트에 대해 재실행되며, 새로운 시스템이 동등하거나 더 높은 안전성과 품질을 입증할 때까지 이전 구성은 유지됩니다.

구현 증거 및 운영 준비성

프로덕션 의사결정은 성공적인 시연 이상을 요구합니다. 대상 사용자, 운영 환경, 입력·출력, 종속성, 소유자 및 각 주요 실패의 결과를 정의하십시오. 튜닝 전에 재현 가능한 기준선과 버전 관리된 평가 세트를 구축하십시오. 일반적인 사례, 경계 조건, 잘못된 또는 누락된 입력, 분포 변화, 종속성 중단, 오용 및 소외될 가능성이 높은 그룹이나 환경을 테스트하십시오. 작업 품질을 보정 또는 불확실성, 지연 시간, 처리량, 자원 비용, 접근성, 프라이버시 및 보안과 함께 측정하십시오. 모든 변환 및 임계값을 기록해 독립적인 검토자가 결과를 재현하고 매력적인 프로토타입과 증거를 구분할 수 있도록 합니다.

출시 전에 릴리스, 예외, 변경, 롤백 및 폐기에 대한 권한을 지정하십시오. 단계적 롤아웃을 사용하고 안전한 폴백을 유지하며, 의도적으로 삽입한 실패를 통해 모니터링을 검증하십시오. 운영 텔레메트리는 입력 품질, 출력 행동, 모델 또는 규칙 버전, 종속성 상태, 인간 개입 및 확인된 결과를 불필요한 민감 데이터 수집 없이 밝혀야 합니다. 알림 임계값과 대응 담당자를 정의한 뒤, 오프라인 성능이 지속될 것이라고 가정하지 말고 배포 후 실제 증거를 검토하십시오. 데이터 소스, 사용자, 모델, 공급업체, 정책, 하드웨어 또는 목표가 변경될 때마다 재평가하십시오. 유지되는 시스템은 문서화된 복구, 사고 학습, 삭제 및 보존 절차, 그리고 비활성화 또는 교체 시점을 명확히 해야 합니다.

자주 묻는 질문

모든 대형 언어 모델이 트랜스포머인가요?

현재 대부분의 대형 언어 모델은 트랜스포머 변형을 사용하지만, 언어 모델은 순환, 상태공간 또는 하이브리드 아키텍처로도 구축될 수 있습니다.

셀프 어텐션이 모델이 사람처럼 텍스트를 이해한다는 뜻인가요?

아니오. 어텐션은 학습된 가중치 메커니즘일 뿐입니다. 인간과 같은 언어 행동이 인간과 같은 이해, 진실성 또는 의도를 스스로 증명하지는 않습니다.

주요 참고 문헌

블로거이자 프로그래머로 머신러닝과 딥러닝 주제에 전문가입니다. 다니엘은 다른 사람들이 AI의 힘을 사회에 도움이 되도록 사용하는 것을 돕기를 희망합니다.