사상 리더

마케팅에서 “최상의 LLM”이 존재하지 않는 이유

mm
Unite.AI를 Google의 선호 소스에 추가

새로운 대규모 언어 모델이 출시될 때마다 더 큰 컨텍스트 창, 더 강한 추론, 더好的 벤치마크 성능을 약속한다. 그런 다음, 곧, AI를熟知한 마케터들은 이미 뒤처지고 있는지 아닌지에 대한 불안감을 느끼기 시작한다. 그들이 사용하는 모델이 이미 낡아지고 있는지, 스위치하고 재학습하는 것이 가치 있는지, 아무 것도 하지 않고 뒤처지는 것은 아닌지.

그런 불안감은 이해할 수 있다. 하지만 그것은 또한 잘못된 것이다.

제품과 플랫폼의 관점에서 볼 때, 최근 몇 년 동안 점점 더 명확해진 것은 단 하나의 모델이 모든 마케팅 작업에서 일관되게 최고의 성능을 발휘하는 것이 아니라는 것이다. 수백 개의 마케팅 팀이 글로벌 캠페인을 시작하는 것을 목격하면서, 모델 혁신의 속도가 가속화하는 동안, 실제 마케팅 작업의 요구는 너무나 미묘하여 하나의 모델 전략이 시간이 지남에 따라 유지될 수 없다는 것이 분명하다.

“올바른” 모델을 선택하는 것이 중요하지 않다. 왜냐하면 모든 작업에 적합한 단 하나의 모델이 없기 때문이다. 중요한 것은 모델을 지속적으로 평가하고 마케터가 수행하려고 하는 특정 작업에 매칭할 수 있는 시스템을 설계하는 것이다. 이것은 개별 마케터가 관리해야 할 것이 아니라, 그들의 도구가 처리해야 할 것이다. 실제적인 결론은 간단하다. 어떤 모델이 “최선”인지 묻는 것을停止하고, 도구가 모델이 변경됨에 따라 적응할 수 있는지 묻기 시작하라.

마케팅에서 “최상의 모델” 사고가 깨지는 이유

LLM에 대한 대부분의 공개 논의는 일반적인 벤치마크를 중심으로 진행된다. 수학 문제, 추론 과제, 표준 시험 등이다. 이러한 벤치마크는 연구 진행을 나타내는 유용한 신호이지만, 실제 작업 성능을 예측하는 약한 지표이다.

마케팅 콘텐츠는 특히 다음과 같은 특징을 가지고 있다. 일반적인 벤치마크에서는 이러한 특징을 거의 포착하지 못한다.

  • 특정 제품 또는 서비스에 대한 것이다.
  • 정의된 대상에게 작성된 것이다.
  • 브랜드의 목소리, 톤, 표준을 일관되게 반영해야 한다.

예를 들어, 우리는 다른 모델이 다른 마케팅 작업에서 더 잘 수행됨을 일관되게 보아왔다. 일부 모델은 브랜드의 목소리로 콘텐츠를 생성하는 데 더 좋지만, 다른 모델은 복잡한 기술 문서를 이해하고 블로그 게시물로 요약하는 데 더 잘 수행된다. 우리는 이러한 사실을 엄격한 테스트를 통해 학습한다. 왜냐하면 새로운 기능은 빠르고 현실적으로 평가될 때만 가치를 창출하기 때문이다. 예를 들어, Gemini 3 Pro가 2025년 11월 말에 출시되었을 때, 우리 팀은 통합하고 테스트하여 24시간 내에 선택된 고객에게 실제 마케팅 워크플로우에 대한 적합성을 평가하도록 제공했다.

이 패턴은 일화적인 것이 아니다. 연구는 점점 더 모델의 성능이 작업에 따라 크게 다르다는 것을 강조하고 있다. 모델은 의미있는 변동을 작성, 요약, 추론, 지시를 따르는 작업에서 보여준다. 일반적인 추론 테스트에서 잘 수행하는 모델은 여전히 브랜드 민감한 콘텐츠 생성에서 어려움을 겪을 수 있다.

더욱 중요한 것은, 우리는 이러한 변화를 월별로 본다. 모델 리더십의 변화는 제공업체가 다른 기능, 비용 구조, 훈련 접근 방식에 대해 최적화함에 따라 발생한다. 모든 마케팅 사용 사례에서 “최선”으로 남아 있는 하나의 제공업체가 있을 것이라는 생각은 이미 구식이다.

릴리즈를 쫓는 숨겨진 비용

팀이 모델 릴리즈를 수동으로 추적하고 도구를 반응적으로 전환하려고 할 때, 운영 비용이 증가한다. 마케터는 다음과 같은 것을 경험한다.

  • 워크플로우 중단: 프롬프트, 템플릿, 프로세스가不断으로 조정되어야 하기 때문이다.
  • 일관되지 않은 출력 품질: 다른 모델이 작업에 따라 다르게 작동하기 때문이다.
  • 결정疲劳: 평가 시간이 생산적인 작업을 대체하기 때문이다.

나는 마케팅 팀이 하나의 제공업체에서 다른 제공업체로 전환하기 위해 한 분기를 모두 소비하는 것을 보았다. 그러나 그들은 예상대로 작동하지 않는 것을 발견한다. 기존에 잘 작동하던 프롬프트가 더 이상 작동하지 않는다. 콘텐츠가 브랜드와 일치하는 것처럼 느껴졌지만,突然적으로 다르게 읽힌다. 하나의 워크플로우에 익숙해진 팀 구성원들은 새로운 학습 곡선을 직면한다. 약속된 성능 개선은 거의 없다.

산업 연구는 일관되게 AI의 대부분의 가치는 모델 계층에서 손실되지 않지만, 통합 및 변경 관리에서 발생한다는 것을 보여준다. 제품 관점에서 볼 때, 가장 큰 위험은 워크플로우를 하나의 모델에 너무密接하게 결합시키는 것이다. 그것은 기술적 결합을 생성한다. 그것은 향상됨에 따라 더 어려워진다.

보다 내구성 있는 접근법: LLM-최적화된 시스템

보다 내구성 있는 접근법은 변동성을 가정하는 것이다. 그리고 그것을 설계한다.

LLM-최적화된 시스템에서, 모델은 교환 가능한 구성 요소로 처리된다. 성능은 실제 워크플로우를 사용하여 지속적으로 평가된다. 다른 모델은 관찰된 결과에 따라 작업에 따라 라우팅될 수 있다.

예를 들어, 소셜 미디어 캡션 생성은 한 모델에 라우팅될 수 있다. 한 모델은 간결성과 펀치를 잘한다. 반면에, 장형 블로그 콘텐츠는 다른 모델에 라우팅될 수 있다. 한 모델은 수천 단어에 걸쳐 일관성을 유지한다. 전략을 수립하는 에이전트는 추론에 더 좋은 모델을 사용할 수 있다. 시스템은 각 작업 유형에 대해 테스트한 모델이 가장 잘 수행한 모델을 자동으로 라우팅한다.

사용자의 관점에서, 이 프로세스는 투명해야 한다. 나는 여기서 사용하는 비유는 프랑스 요리이다. 모든 구성 요소 – 소스, 감소, 계절조미료 -에는 기술이 있다. 식사는 어디에서 왔는지 알 필요가 없다. 그는 단지 더好的 식사를 경험한다.

마케터에게도 동일한 원칙이 적용된다. 기본 엔진은 변경될 수 있지만 워크플로우는 안정적이다. 개선 사항은 점진적으로 나타난다. 브랜드 일치, 콘텐츠 만족도, 일관된 결과가 개선된다. 그러나 팀은 몇 달마다 도구를 재학습할 필요가 없다. 실제로, 마케터는 더 일관된 결과와 더 少ない 워크플로우 중단을 얻는다. 모델은 밑에서 변경되지만, 마케터는 영향을 받지 않는다.

측정값이 벤치마크보다 더 중요함을 이유

모델 결정은 실제 워크플로우에서 측정 가능한 개선을 생성할 때만 중요하다. 공개 벤치마크는 방향을 나타내는 정보를 제공하지만, 마케팅 특정 작동 질문에 대한 답을 주지 않는다.

  • 이 모델은 브랜드 음성을 더 신뢰성 있게 적용하는가?
  • 이 모델은 제품 지식을 더 少ない 오류로 통합하는가?
  • 이 모델은 편집 시간이나 거버넌스 병목 현상을 줄이는가?

최근 연구는 적용된 LLM 시스템에서 인간-루프 평가와 작업 특정 테스트의 중요성을 강조한다. 규모에서, 이러한 신호는 리더보드 순위보다 가치 예측에 더 유용하다.

에이전트 시프트가 스테이크를 높인다

AI 시스템이 더 에이전트적으로 되는 동안, 계획, 초안, 반복, 실행이 직접적인 관리 없이 진행된다. 모델 선택의 중요성이 증가한다. 동시에, 인간이 모든 결정에 대한 감독을 하는 것은 더 이상 가능하지 않다.

이것은 현재 에이전트 시스템에 대한 연구와 일치한다. 도구와 모델 선택은 신뢰성과 안전성에 큰 영향을 미친다. 이러한 환경에서, 모델 선택은 사용자 선호도보다는 인프라 결정이 된다. 시스템 자체가 각 워크플로우의 구성 요소를 해당 시점에 가장 적합한 모델로 제공하는 것을 보장해야 한다. 관찰된 성능에 따라, 습관에 따라가 아니라.

변화를 흡수하는 것보다 반응하는 것

헤드라인은 계속 나올 것이다. 새로운 모델이 계속 출시될 것이다. LLM 성능의 리더십은 계속 변경될 것이다.

성공은 모델 변동성을 흡수할 수 있는 시스템을 구축하는 것이다. 그것은 모델 릴리즈에 가능한 한 빨리 반응하는 것이 아니다. 이것은 마케터가 빠르게 작업을 확장하고, 품질과 브랜드 일치를 유지하고, 실제로 영향을 미치는 작업에 집중할 수 있는 방법이다.

나는 진정으로 마케팅에서 AI의 미래는 모델 변경이 작업을 수행하는 사람에게 무의미하도록 만드는 것이라고 믿는다. 마케터에게는 모델을 6개월마다 재학습하는 것보다 더 중요한 일들이 있다.

브라이언 차오(Bryan Tsao)는 재스퍼의 최고 제품 책임자로서 마케팅 에이전트 플랫폼에서 제품, 엔지니어링, 성장, 데이터 팀을 이끌고 있습니다. 재스퍼 이전에는 드롭박스(Dropbox)에서 성장 및 데이터 담당 부사장, 네임리(Namely)에서 제품 및 디자인 담당 부사장, 매터마크(Mattermark)에서 제품, 디자인, 데이터 담당 부사장을 역임했습니다. 그는 캘리포니아 대학교 버클리(University of California, Berkeley)에서 정보 관리 시스템 석사 학위와 샌디에고 대학교(UC San Diego)에서 인지과학 학사 학위를 가지고 있습니다.