AI 기초

대형 언어 모델(LLM)이란 무엇인가?

mm
Unite.AI를 Google의 선호 소스에 추가

대형 언어 모델(LLM)은 토큰 또는 관련 언어 목표를 예측하도록 대규모 시퀀스 컬렉션으로 학습된 신경망입니다. 현재 대부분의 LLM은 트랜스포머 아키텍처를 사용하며, 공통 인터페이스를 통해 언어를 생성, 분류, 요약, 번역, 검색 및 변환할 수 있습니다.

LLM은 데이터베이스나 보장된 추론 엔진이 아닙니다. 그 출력은 학습 데이터, 사후 학습, 컨텍스트, 도구 및 디코딩에 의해 형성된 조건부 예측입니다. 유창함이 사실 오류, 불확실성, 편향 또는 안전하지 않은 행동과 동시에 존재할 수 있습니다.

핵심 요점

  • 토큰화는 텍스트를 개별 단위로 변환하고, 임베딩과 어텐션은 컨텍스트 표현을 구축합니다.
  • 사전 학습은 광범위한 패턴을 학습하며, 파인튜닝 및 선호도 방법은 작업 행동을 형성합니다.
  • 검색 및 도구는 최신 증거나 행동을 추가할 수 있지만, 별도의 권한 및 검증이 필요합니다.
  • 배포된 시스템을 품질, 근거성, 안전성, 지연 시간, 비용 및 드리프트 측면에서 평가합니다.
What Are Large Language Models (LLMs)? workflow diagram
LLM은 토큰을 예측하고, 애플리케이션 계층은 증거, 권한 및 책임성을 제공합니다.

토큰, 트랜스포머 및 사전 학습

텍스트는 토큰으로 분할됩니다. 트랜스포머는 이를 벡터로 매핑하고, 어텐션 및 피드포워드 레이어를 통해 정보를 혼합하여 다음 토큰 또는 누락된 토큰에 대한 확률 분포를 생성합니다.

자기 지도 학습 목표는 원시 시퀀스로부터 학습 신호를 생성합니다. 파라미터, 데이터, 연산 규모의 확대는 손실을 일정 범위 내에서 예측 가능하게 감소시킬 수 있지만, 데이터셋 품질, 아키텍처, 최적화 및 평가가 실제로 어떤 능력이 나타나는지를 결정합니다.

사후 학습 및 추론

명령 튜닝은 데모를 사용하고, 선호도 최적화는 출력이 인간 판단이나 정책에 더 잘 맞도록 할 수 있습니다. 추론 시에는 프롬프트와 대화 기록이 컨텍스트를 정의하고, 온도와 샘플링 설정이 변동성을 좌우합니다.

RLHF 및 유사한 방법은 완전한 사실 확인기를 설치하는 것이 아니라 행동을 형성합니다. 모델은 여전히 설득력은 있지만 근거가 없는 답변을 생성할 수 있습니다.

검색, 도구 및 에이전트

검색 보강 생성은 외부 컬렉션에서 선택된 구절을 제공합니다. 도구 호출을 통해 애플리케이션 코드는 데이터베이스를 조회하고, 계산하고, 검색하거나 동작할 수 있습니다. 이러한 패턴은 일부 지식과 실행을 모델 가중치와 분리합니다.

애플리케이션은 도구 인자를 검증하고, 권한을 강제하며, 인용을 보존하고, 검색된 콘텐츠를 신뢰할 수 없는 입력으로 취급해야 합니다. 벡터 유사도 검색은 검색을 돕지만 구절이 답변을 뒷받침한다는 증명을 제공하지는 않습니다.

제한 사항 및 평가

LLM은 환각을 일으키고, 기억된 내용을 노출하며, 악의적인 지시를 따르고, 편향을 재현하며, 학습 예시와 유사해 보이는 작업에서도 실패할 수 있습니다. 긴 컨텍스트가 모든 사실이 올바르게 사용되거나 조정된다는 보장을 제공하지는 않습니다.

문서화된 프롬프트와 버전이 있는 대표적인 비공개 작업을 대상으로 평가합니다. 출처에 의한 지원, 거부, 보정, 보안, 하위 그룹 결과, 인간 작업량, 지연 시간 및 비용을 측정합니다. 모델, 데이터 및 사용자 행동이 변하기 때문에 출시 후에도 모니터링이 필요합니다.

학습 데이터 및 모델 개발

사전 학습 코퍼스는 웹 페이지, 책, 코드, 학술 자료, 대화, 그리고 라이선스가 있거나 선별된 소스를 결합합니다. 파이프라인은 언어를 감지하고, 중복을 제거하며, 품질 및 안전하지 않은 콘텐츠를 필터링하고, 개인 데이터를 처리하며, 혼합 비율을 선택합니다. 이러한 선택은 지식, 언어 범위, 스타일, 편향 및 기억을 형성합니다.

최적화 과정은 토큰 시퀀스 배치를 처리하고, 경사 하강법으로 예측 손실을 최소화합니다. 분산 학습은 데이터, 모델 텐서, 파이프라인 단계 또는 전문가를 가속기에 분산합니다. 체크포인팅, 수치 안정성, 네트워크 통신 및 장애 복구는 대규모에서 주요 엔지니어링 과제가 됩니다.

학습 중 평가는 손실과 능력 스위트를 추적하지만, 벤치마크 오염은 결과를 부풀릴 수 있습니다. 특정 기간과 독점 작업을 보류하고, 중복을 검색하며, 정확한 프롬프트, 디코딩, 도구 및 점수를 보고합니다. 모델은 평균 손실을 개선하면서도 안전성이나 저자원 언어에서 회귀가 나타날 수 있습니다.

컨텍스트 윈도우, 디코딩 및 추론

추론 시, 키‑값 캐시는 이전 토큰에 대한 어텐션 투영을 저장하여 매 단계마다 재계산할 필요가 없습니다. 캐시 메모리는 레이어, 시퀀스, 배치 및 표현에 따라 증가합니다. 양자화와 페이징은 부담을 줄이지만 품질이나 지연 시간을 변경할 수 있습니다.

그리디 디코딩은 가장 높은 확률의 토큰을 선택하고, 온도는 확률을 재조정합니다; top‑k와 top‑p는 후보 집합을 제한합니다; 빔 서치는 여러 시퀀스를 추적합니다. 최적 전략은 작업이 결정론, 다양성, 구조화된 출력 또는 시퀀스 가능성을 중시하는지에 따라 다릅니다. 생성 후에는 항상 스키마를 검증하십시오.

긴 컨텍스트는 사용 가능한 정보량을 늘리지만, 회상이나 추론을 보장하지는 않습니다. 위치, 방해 요소, 모순 및 프롬프트 구조가 활용에 영향을 미칩니다. 검색은 더 작은 증거 집합을 선택할 수 있고, 요약은 세부 정보를 잃을 위험을 감수하면서 히스토리를 압축합니다. 컨텍스트 길이와 위치에 따라 성능을 측정하십시오.

적응, 배포 및 경제성

전체 파인튜닝은 모든 파라미터를 업데이트하고, 파라미터 효율적인 방법은 어댑터 또는 저랭크 행렬을 업데이트합니다; 지속적인 사전 학습은 도메인 분포에 적응합니다; 명령 및 선호도 튜닝은 응답을 형성합니다. 검색은 자주 변하는 사실에 더 적합하고, 튜닝은 행동 및 작업 형식에 더 적합합니다. 이러한 방법은 결합될 수 있습니다.

배포 옵션에는 호스팅된 API, 관리형 엔드포인트, 자체 호스팅 오픈 가중치, 디바이스 내 모델 및 하이브리드가 포함됩니다. 데이터 처리, 버전 관리, 지연 시간, 처리량, 지역, 가용성, 모델 이식성, 지원 및 총 비용을 비교하십시오. 자체 호스팅은 보안, 확장성, 업데이트 및 악용 모니터링에 대한 책임을 이전합니다.

토큰당 비용만으로는 충분하지 않습니다. 약한 모델은 재시도, 더 긴 프롬프트, 더 많은 검토 또는 비용이 많이 드는 오류가 필요할 수 있습니다. 요구되는 품질 및 위험 수준에서 성공적으로 완료된 작업당 비용을 측정하십시오. 캐싱, 배치 처리, 더 작은 라우팅 모델 및 결정론적 코드를 사용하여 전체 워크플로우를 개선할 수 있는 경우 활용하십시오.

실제 예시: 기업 문서에 LLM 기반 적용

문서 어시스턴트는 권한을 인식한 코퍼스, 안정적인 문서 식별자, 버전 및 시행 일자, 파싱 가능한 구조, 그리고 답변 가능, 답변 불가능, 모호 및 상충 질문으로 구성된 평가 세트로 시작해야 합니다. 검색은 청크와 메타데이터를 색인하지만, 청크 크기와 겹침은 문서 구조와 일치해야 합니다. 검색 품질은 생성 전에 독립적으로 측정되어 유창한 모델이 누락된 증거를 숨길 수 없습니다.

런타임에서는 사용자를 인증하고, 접근 권한에 따라 검색을 필터링하며, 증거를 검색하고 재순위화하고, 제한된 프롬프트를 구성하고, 인용된 답변을 생성하며, 필요한 출력을 검증합니다. 모델은 출처가 충돌하거나 답변을 뒷받침하지 않을 때 이를 명시해야 합니다. 도구 사용 및 외부 행동은 별도의 권한이 필요합니다. 검색된 문서에 삽입된 지시문으로부터 보호하기 위해 콘텐츠를 데이터로 취급하고, 시스템 정책보다 높은 우선순위로 간주하지 않도록 합니다.

역할 및 문서 유형별로 검색 회수, 인용 정밀도, 답변 정확성, 근거성, 거부, 지연 시간 및 비용을 평가합니다. 모든 테스트에 대해 모델, 프롬프트, 인덱스, 파서 및 코퍼스 버전을 추적합니다. 운영 환경에서는 개인 텍스트를 노출하지 않고 증거 ID와 피드백을 기록하고, 콘텐츠 변경 후 새로 발생한 답변 불가능 질문을 모니터링하며, 안전한 대체 방안을 유지합니다. LLM 인터페이스는 기록 관리, 접근 제어 또는 책임 있는 분야 검토를 대체하지 않습니다.

용량 계획은 프롬프트 및 출력 길이 분포, 동시 사용자 수, 캐시 동작, 도구 지연 시간 및 재시도 비율을 모델링해야 합니다. 스트리밍은 인지된 지연 시간을 개선하지만, 전체 응답이 검토되기 전에 안전하지 않거나 잘못된 콘텐츠가 사용자에게 도달할 수 있어 조정 및 취소를 복잡하게 합니다. 토큰 및 도구 예산을 설정하고, 테넌트를 격리하며, 제공자 자격 증명을 보호하고, 모델 버전 간 장애 조치를 연습하여 사용자가 의존하는 동작이 조용히 변경되지 않도록 합니다.

실용적인 구현 체크리스트

개념을 제한되고 테스트 가능한 워크플로우로 전환합니다: 토큰화 → 사전 학습 → 사후 학습 → 프롬프트 → 생성 → 검증. 책임자를 지정하고, 데이터와 종속성을 문서화하며, 간단한 기준선을 설정하고, 수용 및 중단 기준을 정하고, 대표적인 실패 사례를 테스트하고, 범위 확대 전에 모니터링, 롤백 및 검토를 정의합니다. 버전과 가정을 기록하여 다른 팀이 결과를 재현하고 변경 사항을 이해할 수 있도록 합니다.

출시 전에는 시스템을 구축·운영·보안·영향 받는 사람들과 함께 문서화된 준비 검토를 수행합니다. 정상 사례, 경계 조건, 종속성 실패 및 오용을 테스트하고, 증거와 미해결 위험을 보존합니다. 릴리스를 승인하고, 임계값을 변경하며, 출력을 무시하거나 운영을 중단할 수 있는 사람을 정의합니다. 실제 데이터가 도착한 후 결정을 재검토하십시오. 기술적으로 성공적인 파일럿이더라도 더 넓은 규모에서 신뢰할 수 있는 성능을 보장하지는 않기 때문입니다.

  • 모델: 학습된 파라미터와 표현.
  • 컨텍스트: 프롬프트, 검색 및 도구.
  • 시스템: 평가, 제어, 모니터링 및 인력.

자주 묻는 질문

LLM은 왜 ‘대형’이라고 불리나요?

보편적인 파라미터 기준은 없습니다. ‘대형’은 이전 언어 모델에 비해 파라미터 수, 학습 데이터, 연산량 및 활용 범위 등 규모가 크다는 의미입니다.

LLM은 언어를 이해하나요?

LLM은 유용한 내부 표현을 구축하고 복잡한 행동을 보여주지만, ‘이해한다’는 단어에는 여러 의미가 있습니다. 성능은 유창성만으로 추론하기보다 작업별로 입증되어야 합니다.

주요 참고 문헌

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.