사상 리더

가장 강력한 AI 모델이 항상 올바른 선택은 아닙니다

mm
Unite.AI를 Google의 선호 소스에 추가
Hand selecting a glowing AI model cube from multiple options in a modern tech office, symbolizing strategic AI model selection.

가장 강력한 모델을 선택하는 것은 책임감 있고 논리적인 선택이라고 생각할 수 있습니다. AI를 사용한 제품을 개발할 때 가장 강력한 모델을 선택하는 것이 가장 좋은 선택이라고 생각할 수 있습니다. GPT-4o, Claude Opus, Gemini Ultra와 같은 모델은 인상적인 기술입니다. 그러나 이러한 모델을 선택하면 프로젝트가 커지고, 비용이 증가하며, 지연이 발생할 수 있습니다.

가장 강력한 모델과 가장 적합한 모델은 두 가지 다른 기준입니다. AI 애플리케이션 개발 서비스 제공업체는 모델을 평가하여 선택합니다. 가장 강력한 모델은 이상적인 조건에서 매우 잘 작동하지만, 비용이 많이 들고, 불완전한 입력을 처리하지 못하며, 단순한 작업에 과도한 요구를 합니다.

더 큰 것이 항상 더 좋은 것은 아닙니다

프론티어 모델은 이상적인 조건에서 매우 잘 작동하지만, 비용이 많이 들고, 불완전한 입력을 처리하지 못하며, 단순한 작업에 과도한 요구를 합니다.

GPT-4o는 시를 작성하고, 법적 계약을 분석하고, 코드를 디버깅하고, 10세에게 양자 얽ヒ를 설명할 수 있습니다. 이것은 정말로 인상적인 기능입니다. 그러나 애플리케이션이 고객 지원 티켓을 요약하거나 인보이스에서 구조화된 데이터를 추출하는 경우, 사용되지 않는 기능에 대한 비용을 지불하게 됩니다.

작은 모델은 집중된 작업을 인상적인 정확도로 처리할 수 있습니다:

  • GPT-4o 미니는 대부분의 언어 작업을 약 15배 낮은 비용으로 처리할 수 있습니다
  • Claude Haiku는 고부하, 구조화된 작업에 최적화되었습니다
  • Mistral 7B와 Llama 3.1 8B는 오픈소스 모델로 빠르고, 미세 조정이 잘 됩니다

작은 모델과 프론티어 모델 사이의 차이는 작업이 狭い 경우와 프론티어 모델이 더 강력한 경우에 더 작아집니다.

계획 회의에서 논의되지 않는 비용 수학

프론티어 모델의 API 가격은 경량 모델보다 10~30배 더 높을 수 있습니다. 이 차이는 추상적이지만, 규모에 따라 모델링하면 현실적으로 중요해집니다.

예를 들어, 애플리케이션이 월 50만 번의 API 호출을 수행한다고 가정해 보겠습니다:

모델 예상 월간 비용
GPT-4o $1,500 – $3,000
GPT-4o 미니 $150 – $300
Claude Haiku $125 – $250

同じ 기능이지만, 매우 다른 마진 이야기입니다.

일부 팀은 하이브리드 아키텍처를 사용하여, 단순한 분류 작업을 경량 모델에 라우팅하고, 더 무거운 모델을 복잡한 생성 또는 추론 단계에 예약합니다. Martian과 RouteLLM과 같은 회사들은 이러한 모델 라우팅을 위한 툴을 구축했습니다. 이것은 화려한 엔지니어링은 아니지만, CFO가 더 편안해지는 것입니다.

지연은 사용자 경험 문제입니다

빠른 음식이 있는 이유는 있습니다. 사람들은 항상 5코스 식사를 원하는 것이 아닙니다. 때때로 그들은 답변을 즉시 원합니다.

프론티어 모델은 더 느립니다. 항상 많은 차이가 나지는 않지만, 실시간 애플리케이션에서 중요합니다. 사용자가 대화형 UI, 채팅 인터페이스 또는 라이브 코딩 어시스턴트에서 AI 응답을 기다리고 있다면, 응답 지연은 제품의感觉을 직접적으로 형성합니다. 4~6초가 걸리는 모델은 기술적으로 우수한 출력을 생성하더라도 신뢰할 수 없는 것으로 느껴질 수 있습니다.

규칙은 다음과 같습니다: 사용자가 로딩 스피너를 보는 경우, 추가적인 1초마다 신뢰가 감소합니다.

Haiku, Mistral, Llama 3.1 8B는 유사한 부하 조건에서 훨씬 더 빠르게 실행됩니다(때때로 3~5배 더 빠름). 사용자에게 속도가 중요한 경우, 이는 사소한 고려 사항이 아닙니다. 이것은 제품 결정입니다.

프롬프트 엔지니어링 변수(모든 것을 변경하는)

모델 비교 스레드에서 간과되는 것 중 하나는, 작은 모델에서 잘 설계된 프롬프트가 프론티어 모델에서 느슨한 프롬프트를 이길 수 있다는 것입니다.

출력 품질은 모델 능력과 프롬프트 품질의 산물입니다. 팀이 프롬프트 엔지니어링에 투자할 때(명확한 지시, 구조화된 출력 형식, 몇 가지 예제, 잘 정의된 제약), 작은 모델은 실제 천장보다 훨씬 더 잘 수행됩니다.

여기서 알아야 할 몇 가지 툴이 있습니다:

  • LangChain과 DSPy는 프롬프트 파이프라인을 구성하고 최적화하는 데 사용됩니다
  • Guidance는 구조화된 출력과 제약된 생성에 사용됩니다
  • PromptFoo는 모델 간의 시스템적인 프롬프트 평가를 실행하는 데 사용됩니다

오늘날 프로덕션에서 가장 인상적인 AI 기능 중 일부는 능력 랭킹 상위 5위에 들지 못하는 모델에서 실행됩니다. 그러나 정말 좋은 프롬프트에서 실행됩니다.

미세 조정이 방정식을 변경합니다

일반적인 프론티어 모델과 작은 오픈소스 모델의 비교는 미세 조정이 등장할 때 매우 다르게 보입니다. 특정 도메인 데이터(용어, 에지 케이스, 원하는 출력 형식)에 미세 조정된 Llama 3.1 8B 모델은 특정 작업에서 GPT-4o를 능가할 수 있습니다.

이것은 가상적인 것이 아닙니다. 헬스케어, 법률 기술, 전자 상거래와 같은 회사들은 반복적으로 이를证明했습니다.

미세 조정을 시작하는 방법:

  • Hugging Face는 오픈소스 모델 호스팅, 데이터셋, 훈련 인프라를 제공합니다
  • Together AI는 인기 있는 오픈 모델에서 빠르고 저렴한 미세 조정을 제공합니다
  • Replicate는 사용자 자신의 GPU 인프라를 관리하지 않고 사용자 지정 모델을 배포하는 데 사용됩니다

미세 조정에는 초기 투자가 필요합니다: 데이터 큐레이션, 컴퓨팅 시간, 평가 작업. 그러나 높은 볼륨, 도메인 특정 작업의 경우, 경제학은 종종 그쪽으로 작용합니다.

보안 및 데이터 거주지는 사후 고려 사항이 아닙니다

일부 애플리케이션은 제3자 API에 데이터를 전송할 수 없습니다. 다음을 고려해 보십시오:

  • HIPAA에 따라 운영되는 헬스케어 플랫폼
  • PII 또는 규제된 트랜잭션 데이터를 처리하는 금융 도구
  • 엄격한 데이터 거주지 요구 사항이 있는 엔터프라이즈 소프트웨어

이러한 환경에는 프론티어 모델 API가 작업할 수 없는 제약이 있습니다. 자체 호스팅 모델, 즉 온프레미스 또는 개인 클라우드에서 실행되는 모델은 유일한 진전입니다. 즉, Llama 3, Mistral, Phi-3와 같은 오픈소스 모델을 사용자 자신의 인프라에서 실행하는 것입니다. 프로덕션에서 사용할 수 없는 프론티어 모델은 올바른 선택이 아닙니다.

팀이 건너뛰는 평가 단계

대부분의 팀은 모델을 선택할 때, 가장 비싼 모델이 최고라는 가정으로 선택합니다. 그러나 실제 사용 사례의 대표적인 샘플에 구조화된 평가를 실행해야 합니다.

다음은 작동하는 프로세스입니다:

  1. 100~200개의 대표적인 입력과 예상 출력이 있는 평가 세트를 구축합니다
  2. 실제 조건에서 2~3개의 후보 모델을 실행합니다
  3. 정확도, 형식 준수, 톤, 지연, 호출당 비용과 같은 실제 기준에 따라 평가합니다
  4. 데이터에 따라 결정하고, 직관이나 랭킹에 따라 결정하지 않습니다

Braintrust, PromptFoo, Weights & Biases Prompts와 같은 툴은 연구 배경이 없는 경우에도 체계적인 평가를 쉽게 제공합니다. 설정하는 데 몇 시간이 걸릴 수 있습니다. 하지만 보상은 6개월 동안 잘못된 모델을 선택하지 않는 것입니다.

프론티어 모델이 실제로 올바른 선택인 경우

공정하게 말하자면, 프론티어 모델이真正로 가격을 지불하는 작업이 있습니다.

프론티어 모델을 사용하는 경우:

  • 작업이 복잡한 다단계 추론을 필요로 하며, 명확한 템플릿이 없습니다
  • 출력 품질의 편차가 비용이 많이 들고, 볼륨이 상대적으로 낮습니다
  • 넓은 세계 지식이나 누안스한 판단이 필요하며, 프롬프트로 해결할 수 없습니다
  • 프로토타이핑 중이며, 작업 경계를 아직 정의하지 않았습니다

경량 모델을 사용하는 경우:

  • 작업이 잘 정의되고 반복됩니다
  • 속도와 비용이 중요합니다
  • 프롬프트 엔지니어링 또는 미세 조정에 투자할 수 있습니다
  • 데이터 거주지 또는 규정 준수가 제3자 API를 배제합니다

목표는 강력한 모델을 피하는 것이 아닙니다. 목표는 증거에 따라 의도적으로 선택하는 것입니다. 랭킹에 따라 가장 큰 이름을 기본적으로 선택하는 것이 아니라, 안전한 선택이라고 느끼는 것입니다.

요약

AI 모델을 애플리케이션에 선택하는 것은 прести지 경쟁처럼 느껴서는 안 됩니다. 가장 강력한 모델은 항상 올바른 선택이 아닙니다. 작업에 맞는 모델을 선택하고, 실제 데이터에 대한 평가를 실행하고, 지연, 비용, 보안 요구 사항, 프롬프트 엔지니어링 또는 미세 조정의 팀의 능력을 고려해야 합니다. 가장好的 AI 제품 결정은 이러한 세부 사항에 근거해야 합니다. 어느 회사가 지난 분기에 가장 화려한 숫자를 발표했는지에 근거해서는 안 됩니다.

그REATE AI 제품을 출하하는 팀은 항상 가장 강력한 모델을 실행하는 것이 아닙니다. 가장 적합한 모델을 실행하는 것입니다.

ur 팀의 프롬프트 엔지니어링 또는 미세 조정 능력. 가장好的 AI 제품 결정은 이러한 세부 사항에 근거해야 합니다. 어느 회사가 지난 분기에 가장 화려한 숫자를 발표했는지에 근거해서는 안 됩니다.

David Balaban은 17년 이상의 악성 코드 분석 및 안티바이러스 소프트웨어 평가 경험을 가진 컴퓨터 보안 연구자입니다. David는 MacSecurity.net Privacy-PC.com 프로젝트를 운영하며, 사회 공학, 악성 코드, 침투 테스트, 위협 인텔리전스, 온라인 개인 정보 보호, 화이트 해트 해킹을 포함한 현대 정보 보안 문제에 대한 전문가 의견을 제공합니다. David는 강력한 악성 코드 문제 해결 배경을 가지고 있으며, 최근에는 랜섬웨어 대책에 중점을 두고 있습니다.