Лидеры мнений

Дебаты о “Нерфинге” Клода Не о Клоде. Они о том, что происходит, когда ваши операции зависят от чужих решений.

mm
Добавьте Unite.AI в избранные источники в Google
A series of glowing hexagonal glass modules containing microchips in a dark server room; one module on the left is cracked and glowing blue, while others remain intact and glowing amber, connected by flowing data cables.

Ранее в этом году Стелла Лоренцо, старший директор по ИИ в AMD, опубликовала телеметрию почти 7 000 сессий кода Клода, документирующую то, что инженеры чувствовали, но не могли выразить: между январем и мартом видимая глубина рассуждений снизилась на 73%, количество вызовов API на задачу увеличилось в 80 раз, и модель читала гораздо меньше файлов, прежде чем вносить правки. Цифры быстро распространились. Интерпретация распространилась еще быстрее.

Anthropic оспаривает формулировку. Компания утверждает, что изменения отражают преднамеренные решения по продукту, включая новый механизм адаптивного мышления и переход на среднюю нагрузку в качестве значения по умолчанию. Независимые аналитики также оспорили части методологии. Дебаты продолжаются, и разумные люди не согласны с тем, что на самом деле произошло.

Но вот что важно, если вы управляете бизнесом на основе этих систем: независимо от того, было ли это ухудшением или преднамеренной настройкой, не меняет того, что операторы предприятия испытали. Они не могли предсказать это. Они не могли контролировать это. И некоторые из них почувствовали это в производстве, прежде чем поняли, что происходит. Это настоящая история, и она не имеет отношения к Anthropic в частности.

Это проблема зависимости, а не проблема модели.

То, что мы описываем, имеет название: хрупкость модели. Это состояние, при котором критически важные операции тесно связаны с поведением единственной модели, так что любое изменение на уровне модели, будь то решение о настройке, новое значение по умолчанию, сдвиг маршрутизации, обусловленный емкостью, или тихое устаревание, напрямую влияет на бизнес, без буфера и без предупреждения.

Это не новый шаблон. GPT-4 прошел через подобный опыт в 2023 году. Claude 3.5 прошел через него в 2024 году. Claude Opus проходит через него сейчас. Это произойдет снова с следующей моделью и той, что после нее. Не потому, что какой-либо поставщик действует в плохой вере, а потому, что оптимизация модели для стоимости, задержки и масштаба на глобальном объеме является именно тем, что поставщики должны делать. Их стимулы и стимулы предприятия, работающего в производстве на основе этих моделей, связаны. Они не идентичны. Они никогда не будут.

Мы начали Qurrent в 2023 году и имеем исторические знания, чтобы знать, как играют циклы программного обеспечения для предприятий: компания инвестирует в ИИ. Демонстрация работает. Пилот работает. Затем он запускается, что-то сдвигается на уровне модели, и вдруг клиент владеет проблемой. Они поддерживают рабочие процессы, преследуют регрессии, поглощают срыв. Это никогда не имело смысла для меня как устойчивой модели для операций предприятия.

Предприятие этой истории операционно, а не технически.

Для разработчиков текущая ситуация неудобна. Бюджеты токенов горят быстрее. Сессии кодирования застревают. Бенчмарки разочаровывают. Это реальная проблема, но это проблема, которую можно преодолеть.

Для предприятий, которые управляют финансовыми операциями, рабочими процессами соблюдения требований, счетами к получению и оплате, а также сложными процессами бэк-офиса, ставки другие. Эти рабочие процессы не могут поглотить плохую неделю. Ошибки накапливаются. Объем накапливается. SLA – это обязательства перед реальными клиентами, а не внутренние предпочтения. В момент, когда модель начинает работать хуже на высокоинтенсивном процессе, ущерб накапливается, независимо от того, заметили ли это кто-то.

То, что делает это более трудным, заключается в том, что большинство компаний, которые пытались опередить ИИ, построив внутренних агентов на единственной модели, теперь обнаруживают, насколько неполной была эта основа. Первый агент был легкой частью. То, что не было построено, – это окружающая инфраструктура: рамки оценки, которые обнаруживают поведенческий дрейф до того, как он достигнет клиента, логика отказа, которая перенаправляет работу автоматически, когда модель начинает работать хуже, и постоянное управление, способное идти в ногу с ландшафтом, который меняется каждым кварталом. Эти три пробела не остаются управляемыми. Они растут в постоянную инженерную функцию, которую никто не запланировал, укомплектованную людьми, чья работа по сути заключается в том, чтобы идти в ногу с решениями, принимаемыми поставщиками, на которых они не влияют.

Что такое реальная стойкость в производстве.

В Qurrent мы построили цифровую рабочую силу, чтобы быть независимой от модели с самого начала, не как маркетинговую позицию, а как архитектурное требование. Каждая задача маршрутизируется к лучшей модели для этой задачи, оцениваемой непрерывно. Когда появляется лучшая модель, клиенты получают ее автоматически. Когда текущая модель регрессирует на конкретном рабочем процессе, слой оркестровки перенаправляет эту работу за секунды, без вмешательства человека и без того, чтобы кто-то проснулся от слака в 2 часа ночи.

Под этим автоматические симуляции работают против рабочих процессов производства круглосуточно, измеряя, соответствуют ли выходные данные ожидаемому поведению. Дрейф обнаруживается на уровне инфраструктуры, прежде чем команда операций почувствует это, и гораздо раньше, чем клиент. И каждое решение, принятое каждым цифровым работником, регистрируется и просматривается, полная стеклянная коробка, потому что вы не можете управлять тем, что не видите.

Это не премиум-функции. Это цена входного билета для запуска ИИ в производство в масштабе предприятия. Большинство компаний учатся этому посреди новостного цикла, что является дорогим способом узнать.

Вопрос, который стоит задать в этом квартале.

Если модель, от которой зависят ваши операции, будет иметь плохую неделю в следующем квартале, сколько ваших рабочих процессов почувствуют это? Как вы узнаете? И как быстро сможете обойти это?

Если ответ на второй вопрос – “мы услышим от клиента”, операция не готова к производству. Это пилот, работающий в масштабе, и различие имеет значение больше, чем многие лидеры понимают, пока это не станет неразличимым.

Текущая дискуссия, в косвенной форме, полезна. Каждый финансовый директор и операционный директор, наблюдающий за этим, только что получил бесплатный предварительный просмотр того, как выглядит хрупкость модели под реальной операционной нагрузкой, не заплатив за это сами. Правильный ответ – не переключаться на другую модель. Это построить операции, которые не зависят от одной модели.

Технология будет продолжать меняться. Это единственная уверенность на этом рынке. Предприятия, которые выйдут из этого десятилетия сильнее всего, не будут теми, кто выбрал правильную модель. Они будут теми, чьи операции никогда не имели необходимости заботиться.

Колин Вил, генеральный директор и сооснователь Qurrent, является опытным предпринимателем, который глубоко работает с ИИ с 1990-х годов. Предыдущие проекты Колина включают Mynd, технологически обеспеченную платформу для инвестиций в аренду отдельных семейных домов, названную самой быстро растущей компанией в районе залива Сан-Франциско в 2020 году, и Waypoint Homes, которая привлекла более 3,5 миллиарда долларов и управляла 17 000 домами до того, как стала публичной на Нью-Йоркской фондовой бирже в 2014 году. Признанный за свои инновации в области ИИ, Колин владеет несколькими патентами, занял место в списке 100 самых инновационных предпринимателей Goldman Sachs и был назван предпринимателем года по версии Ernst & Young.