사상 리더

클로드 “너프” 논쟁은 클로드에 관한 것이 아니다. 그것은 누군가의 결정에 따라 운영되는 경우에 발생하는 일에 관한 것이다.

mm
Unite.AI를 Google의 선호 소스에 추가
A series of glowing hexagonal glass modules containing microchips in a dark server room; one module on the left is cracked and glowing blue, while others remain intact and glowing amber, connected by flowing data cables.

이번 년초에, AMD의 AI 담당 이사인 스텔라 로렌조는 클로드 코드 세션의 telemetry를 발표했는데, 이는 엔지니어들이 느꼈지만 명확하게 설명하지 못했던 것을 문서화했다: 1월과 3월 사이에, 가시적인 추론 깊이가 73% 감소했고, API 호출이 80배 증가했으며, 모델이 편집을 하기 전에 읽는 파일이 훨씬 적어졌다. 숫자는 빠르게 퍼졌고, 해석도 더 빠르게 퍼졌다.

앤โทร픽은 이 프레임워크를 부정한다. 회사는 이러한 변경이 의도적인 제품 결정의 결과라고 말한다. 즉, 새로운 적응형 사고 메커니즘과 기본값을 중간 노력으로 변경한 결과이다. 독립적인 분석가들도 방법론의 일부를 반박했다. 논쟁은 계속되고, 합리적인 사람들은 실제로 무엇이 일어났는지에 대해 동의하지 않는다.

그러나 중요한 부분은 이 시스템 위에 비즈니스를 운영하는 경우입니다: 이것이 퇴보인지 의도적인 튜닝인지에 관계없이 기업 운영자는 예측할 수 없었다. 그들은 그것을 제어할 수 없었다. 그리고 일부는 이해하기 전에 이미 생산에서 느꼈다. 이것이 실제 이야기이고, 이것은 앤스로픽과 관련이 없다.

이것은 의존성 문제이지 모델 문제가 아니다.

우리가 설명하는 것은 이름이 있다: 모델 취약성. 이는 임무 비상 작전이 단일 모델의 동작에 밀접하게 결합되어 있는 상태로, 모델 레이어에서 발생하는 모든 변경(튜닝 결정, 새로운 기본값, 용량驱动 라우팅 전환, 조용한废弃 등)이 비즈니스에 직접적으로 영향을 미치고, 버퍼나 경고 없이 발생하는 상태이다.

이것은 새로운 패턴이 아니다. GPT-4는 2023년에 이러한 패턴을经历했다. 클로드 3.5는 2024년에 이러한 패턴을经历했다. 클로드 오퍼스는 지금 이러한 패턴을经历하고 있다. 다음 프론티어 모델에서도 이러한 패턴이 발생할 것이고, 그 다음에도 발생할 것이다. 이는 어떤 벤더가 악의적으로 행동하는 것이 아니라, 프론티어 모델을 비용, 대기 시간, 규모에 대해 최적화하는 것이 프론티어 벤더들이 해야 하는 일이기 때문이다. 그들의 인센티브와 기업의 인센티브는 관련이 있지만, 동일하지는 않다. 그것은 결코 동일하지 않을 것이다.

우리는 2023년에 큐런트를 시작했고, 기업 소프트웨어 사이클이 어떻게 작동하는지에 대한 역사적인 지식을 가지고 있다: 한 회사가 AI에 투자한다. 데모가 작동한다. 파일럿이 작동한다. 그리고 그것이 라이브로 가면, 모델 레이어에서 무언가가 변경되고, 고객이 문제를 소유하게 된다. 그들은 워크플로우를 유지하고, 회귀를 추적하고, 중단을 흡수한다. 그것은 결코 이해할 수 없는 모델이었다.

이 기업 버전의 이야기는 운영적인 것이지 기술적인 것이 아니다.

개발자에게 현재 상황은 불편하다. 토큰 예산이 더 빠르게 소모된다. 코딩 세션이 중단된다. 벤치마크가 실망스럽다. 이것은 실제 문제이지만, 회복 가능한 문제이다.

금융 작전, 컴플라이언스 워크플로우, 계정 수취 및 지불, 복잡한 백오피스 프로세스를 운영하는 기업에게는 달라진다. 이러한 워크플로우는 나쁨한 주를 흡수할 수 없다. 오류가 누적된다. 볼륨이 누적된다. SLA는 실제 고객에게 대한 약속이다. 모델이 고위험 프로세스에서 성능이 저하되기 시작하면, 누군가가 아직 이를 알아차리지 못했더라도 이미 손실이 누적되고 있다.

이것을 더 어렵게 만드는 것은 대부분의 회사가 단일 모델上的 내부 에이전트를 구축하여 AI에 앞서려고 시도했지만, 이제 그 기반이 얼마나 불완전했는지 발견하고 있다는 것이다. 첫 번째 에이전트는 쉬운 부분이었다. 구축되지 않은 것은 周囲의 인프라스트럭처였다: 행동의 변화를 고객에게 도달하기 전에 감지하는 평가 프레임워크, 모델이 성능이 저하되기 시작하면 자동으로 작업을 재라우팅하는 실패 로직, 그리고 매 분기마다 변경되는 풍경을 따라갈 수 있는 지속적인 거버넌스. 이러한 세 가지 갭은 관리 가능하게 유지되지 않는다. 그것은 예산이나 인력을 할당하지 않은 영구적인 엔지니어링 기능으로 성장한다. 그리고 그들의仕事는 본질적으로 영향을 미치지 못하는 벤더의 결정에 따라 움직이는 것이다.

생산에서 실제로 회복력이 무엇인지.

큐런트에서는 디지털 워크포스를 처음부터 모델-에이전시로 구축했다. 이것은 마케팅 포지션으로서가 아니라, 아키텍처적 요구사항으로서였다. 모든 작업은 해당 작업에 대한 최상의 성능을 낼 수 있는 모델로 라우팅된다. 그리고 이것은 지속적으로 평가된다. 더 나은 모델이 출시되면 고객은 자동으로 이를 받는다. 그리고 현재 모델이 특정 워크플로우에서 성능이 저하되면, 오케스트레이션 레이어는 몇 초 내에 작업을 재라우팅한다. 그리고 이것은 인간의 개입 없이 이루어진다. 그리고 아무도 2시의 슬랙 스레드를 깨우지 않는다.

그 아래에는 자동 시뮬레이션이 생산 워크플로우에 대해 지속적으로 실행된다. 그리고 이것은 기대되는 동작과 일치하는지 측정한다. 드리프트는 인프라스트럭처 레이어에서 감지된다. 그리고 운영 팀이 느끼기 전에, 그리고 고객이 느끼기 훨씬 전에 감지된다. 그리고 모든 디지털 워커의 결정은 로그되며 검토 가능하다. 이것은 전체적인 가시성을 제공한다. 그리고 이것은 볼 수 없는 것을 관리할 수 없기 때문이다.

이것은 프리미엄 기능이 아니다. 이것은 기업 규모에서 AI를 운영하는 데 필요한 요소이다. 대부분의 회사는 뉴스 사이클 중간에 이것을 배우고 있다. 그리고 이것은 비싼 방법으로 배우는 것이다.

이 분기에 물어야 할 질문.

만약에 의존하는 모델이 다음 분기에 나쁨한 주를 보내면, 얼마나 많은 워크플로우가 영향을 받을 것인가? 어떻게 알 수 있는가? 그리고 얼마나 빠르게 이를 우회할 수 있는가?

두 번째 질문의 답이 “고객으로부터 들을 것”이라면, 운영은 생산 준비가 되지 않은 것이다. 이것은 규모에서 실행되는 파일럿이다. 그리고 이 구분은 대부분의 리더가 실감하지 못할 때까지 중요하다.

현재의 논쟁은, 뒷면에서 유용하다. 모든 CFO와 COO는 이 상황을 지켜보면서 실제 운영 부하에서 모델 취약성이 무엇인지에 대한 무료 예측을 받았다. 그리고 이에 대한 올바른 대응은 모델을 바꾸는 것이 아니다. 그것은 단일 모델에 의존하지 않는 운영을 구축하는 것이다.

기술은 계속해서 변경될 것이다. 이것이 이 시장에서 唯一의 확실한 것이다. 이 십년간에서 가장 강력하게 나오는 기업은 올바른 모델을 선택한 것이 아니다. 그것은 운영이 단일 모델에 대해 신경 쓰지 않도록 하는 것이다.

콜린 위엘, Qurrent의 CEO이자 공동 창립자는 1990년대부터 깊이 AI와 함께 일해온 유능한 기업가입니다. 콜린의 이전 벤처에는 Mynd, 2020년에 가장 빠르게 성장하는 베이 에리아 회사로 명명된 단일 가족 임대 투자용 기술 플랫폼과 Waypoint Homes가 있습니다. Waypoint Homes는 2014년 NYSE에 상장하기 전에 3.5억 달러 이상을 조달하고 17,000개의 집을 관리했습니다. AI 혁신에 대한 그의 공로를 인정받은 콜린은 다수의 특허를 보유하고 있으며, 골드만 삭스의 최초 100대 혁신적인 기업가 중 하나로 선정되었으며, 어니스트 앤 영의 연도 기업가로 선정되었습니다.