Интервью
Андрей Мисси, технический директор и сооснователь Convos – Интервью

Андрей Мисси, технический директор и сооснователь Convos, является软件-инженером и лидером продукта с опытом, охватывающим разработку продуктов ИИ, программную архитектуру, сети и полнофункциональную инженерию. До основания Convos он помог разработать и запустить два платформы, работающих на ИИ, для творческих и маркетинговых целей в Forum3, сочетая практическую инженерию с техническим управлением продуктом. Его предыдущие роли в N-able (NABL ), Autoshop Solutions и Brand IQ включали создание фронтенд-приложений, бэкенд-систем, клиентских панелей и внутренних программных инструментов с использованием технологий, включая Svelte, NestJS, Angular и JavaScript. Этот междисциплинарный опыт позволил ему объединить техническую реализацию с стратегией продукта, когда он руководит разработкой платформы Convos, работающей на ИИ.
Convos – это контролируемая платформа для текстовых сообщений, работающая на ИИ, предназначенная для помощи политическим кампаниям и коммуникационным фирмам в замене односторонних массовых сообщений на персонализированные, двусторонние разговоры с избирателями в масштабе. Платформа преобразует ответы в анализ настроений в режиме реального времени, классификацию тем, результаты призывов к действию, метрики вовлеченности и структурированные сведения об избирателях, которые кампании могут использовать для совершенствования своего охвата. Ее закрытая система ИИ работает в пределах утвержденных кампаниями материалов и ограничений сообщений, обеспечивая при этом функции, такие как сегментация контактов, истории разговоров, отслеживание ссылок, экспорт данных и аудиторные следы, ориентированные на соблюдение требований. Convos также может дополнить существующую инфраструктуру текстовых сообщений организации, не требуя от нее замены существующих систем связи.
Вы стали сооснователем Convos после того, как заметили, что политическое и организационное текстовое общение стало в основном односторонним. Какое было исходное прозрение, которое убедило вас, что есть возможность преобразовать массовые текстовые сообщения в разговоры, работающие на ИИ, и какие были самые большие технические проблемы, с которыми вы столкнулись при создании платформы?
Прозрение пришло от того, что я сам оказался на другом конце этих сообщений.
Около выборов 2024 года я получал множество политических текстовых сообщений, как и многие другие. В какой-то момент я начал отвечать на них. Я задавал вопрос или отвечал, но никогда не получал ответа. Сообщения рассылались миллионами, но когда я пытался вступить в реальный разговор, там никого не было.
Мне показалось, что это огромная упущенная возможность. Человек на другом конце уже был вовлечен. Он задавал реальный вопрос. Но ответа никогда не приходило.
Итак, идея Convos была простой. Преобразовать трансляцию в реальный разговор, в масштабе, без необходимости иметь комнату, полную людей, для его поддержания.
Самыми большими техническими проблемами стали три вещи: масштаб, задержка и соблюдение требований.
Масштаб – это очевидная вещь. Вы управляете тысячами разговоров одновременно, и каждый из них имеет свое собственное состояние и историю. Задержка имеет значение больше, чем люди ожидают. Если кто-то отвечает на сообщение, и ответ задерживается слишком долго, момент теряется. Текстовые сообщения кажутся почти мгновенными, и опыт должен соответствовать этому.
Соблюдение требований было самой трудной частью, и мы уделяли ей приоритетное внимание с самого начала. Политическое текстовое общение сильно регулируется, и ошибки в этом вопросе недопустимы. Большая часть нашей ранней инженерии была посвящена обеспечению того, чтобы система оставалась в пределах утвержденных сообщений и уважала согласие и отказы от получения сообщений способами, которые выходят за рамки простого обнаружения слова “СТОП”.
Convos работает на пересечении разговорного ИИ, крупномасштабного обмена сообщениями и анализа настроений в режиме реального времени. Какие уроки вы извлекли из развертывания систем ИИ, которые должны вовлекать тысячи людей одновременно, сохраняя при этом личный и аутентичный характер?
Самый большой урок заключается в том, что “личный в масштабе” – это то, для чего необходимо инженерное решение. Это не происходит само собой.
Когда вы ведете тысячи разговоров одновременно, возникает соблазн относиться к ним как к одной большой партии. Но человек, получающий сообщение, не заботится о вашей партии. Для него это один на один разговор, и он должен казаться таковым. Это означает, что каждый разговор должен иметь свою собственную контекстную и историческую информацию, чтобы ответ действительно реагировал на то, что сказал этот конкретный человек, а не на некоторое среднее значение всех.
Мы также научились внимательно относиться к тому, что люди нам действительно говорят. Ответ не является просто ответом. Он несет в себе настроение. Человек может ответить вопросом, с энтузиазмом, с разочарованием или с четким сигналом, что он хочет быть оставленным в покое. Правильное чтение этих нюансов – это то, что делает или ломает взаимодействие.
В конечном итоге аутентичность исходит от слушания, а не от того, чтобы звучать умно. Разговор, который кажется наиболее человеческим, – это тот, который отвечает на реальный вопрос и уважает время человека.
Вы утверждали, что многие организации слишком сильно фокусируются на показателях моделей, не обращая внимания на личность и стиль общения. Почему вы считаете, что личность становится критическим фактором в развертывании ИИ в корпоративной среде, и как организации должны ее оценивать?
Показатели измеряют способности. Они не измеряют соответствие.
Модель может набрать очень высокие баллы за рассуждение или кодирование и все равно быть неправильным выбором для разговора с избирателем. То, как она формулирует вещи, насколько она звучит тепло или формально, знает ли она, когда следует быть краткой, – все это имеет огромное значение, когда на другом конце находится реальный человек.
В нашем мире модель не решает математическую задачу. Она представляет кампанию в текстовом сообщении. Каждая кампания имеет свой собственный голос, и модель должна соответствовать ему, а не навязывать свой собственный. Если тон не тот, это не имеет значения, насколько умна лежащая в основе модель. Взаимодействие терпит неудачу.
Также есть способность, которую показатели пропускают. Кампания может дать агенту подробные указания о том, что сказать, что избегать и как обращаться с конкретными темами. Модель должна следовать всем этим, последовательно, на протяжении долгого разговора. Некоторые модели намного лучше других в том, чтобы удерживать сложные инструкции, не отклоняясь от разговора. Эта способность также является частью личности, потому что модель, которая звучит хорошо, но перестает следовать своим инструкциям, – не та, которую можно поставить перед реальными людьми.
Это почему личность становится реальным фактором в корпоративном развертывании. Когда модели становятся более способными в целом, сырой разрыв в способностях между ними сужается. Что остается, – это характер. Как они общаются, и остаются ли они в пределах, которые вы установили.
Способ оценить это – не на доске лидеров. Это протестировать модели на вашем реальном случае использования, с вашим реальным контентом, и прочитать выводы так, как это сделал бы ваш конечный пользователь. Мы проходим модели через точно такой же тип обменов, которые они будут обрабатывать в производстве, и судим их о том, чувствует ли разговор себя правильно. Это говорит нам намного больше, чем любой балл показателя.
Ваша команда протестировала несколько ведущих моделей и наблюдала значительные различия в том, как они выполняют задачи. Что вы узнали о сильных и слабых сторонах современных крупных моделей LLM, и почему некоторые из них лучше подходят для разговорной работы, чем другие?
Что мы узнали, – это то, что нет единой лучшей модели. Есть только лучшая модель для данной работы.
Некоторые модели отлично следуют инструкциям точно, что имеет значение, когда системе необходимо оставаться в строгих границах. Некоторые модели сильнее в естественном, разговорном тоне. Некоторые быстрее, что является своей собственной силой, когда задержка является частью опыта. Другие лучше в рассуждениях через сложный запрос, но кажутся жесткими или слишком долго отвечают в неформальном обмене.
Для разговорной работы в частности важными качествами являются не всегда те, которые получают заголовки. Скорость имеет значение. Последовательность имеет значение. Знание, когда быть кратким, имеет значение. Модель, которая пишет красивый трехабзацный ответ, часто является неправильным выбором, когда правильный ответ – один предложение.
Ни одна из этих вещей не появляется на доске лидеров. Вы узнаете об этом только тогда, когда поставите модели перед реальной работой и обратите внимание на то, как они с ней справляются.
Многие компании все чаще принимают стратегию использования нескольких моделей, а не полагаться на одного поставщика ИИ. Каковы преимущества построения систем, которые могут переключаться между моделями, и какие архитектурные соображения необходимы для того, чтобы это было возможно?
Основное преимущество заключается в том, что вы не закреплены.
Если вы построите все вокруг одного поставщика, вы наследуете все его ограничения. Его ценообразование, ограничения скорости, задержка, простои и график выпуска становятся вашими. Мульти-модельный подход позволяет вам маршрутизировать каждую задачу к той модели, которая с ней лучше всего справляется, и дает вам куда уйти, когда один поставщик имеет плохой день.
Он также позволяет вам сопоставить стоимость с работой. Не каждый разговор требует вашей наиболее мощной и дорогой модели. Быть в состоянии отправить простую работу на более легкую модель и сохранить тяжелую модель для сложных случаев делает реальную разницу в масштабе.
Архитектура – это то, что делает это возможным, и ключевым решением является построение абстрактного слоя между вашим приложением и любой конкретной моделью. Ваша система не должна говорить напрямую с API одного поставщика на протяжении всего кода. Она должна говорить со своим собственным внутренним интерфейсом, и этот интерфейс решает, какая модель фактически обрабатывает запрос.
Как только у вас это есть, вы можете добавить логику маршрутизации, обратные связи, когда поставщик терпит неудачу, и возможность переключаться между моделями без переписывания вашего приложения. Вам также необходимо последовательное обращение с подсказками и выводами через модели, потому что каждая из них ведет себя немного по-разному, и ваша система должна сгладить эти различия.
Это больше работы изначально. Но это покупает вам гибкость, которая очень трудна для добавления позже.
Вы недавно подчеркнули, как быстро модели ИИ эволюционируют, с новыми выпусками, которые иногда меняют характеристики производительности неожиданными способами. Как должны предприятия сбалансировать желание принять последние модели с необходимостью стабильности, надежности и предсказуемой производительности?
Честный ответ заключается в том, что новая модель не является улучшением, пока вы не докажете, что это так.
Каждый выпуск волнующий, и есть реальное давление, чтобы принять последнее сразу. Но мы видели, как новые модели меняют поведение способами, которые мы не ожидали. Что-то, что работало надежно, начинает отвечать немного по-другому, и в производственной системе эти небольшие изменения накапливаются.
Способ, которым мы с этим справляемся, прост. Никакая модель не попадает в наш конвейер, пока мы не протестируем ее сами. Когда выходит новый выпуск, мы не принимаем показатели или объявление за чистую монету. Мы садимся и проходим ее через те же ситуации, с которыми наша система сталкивается каждый день, и читаем выводы сами.
Этот ручной шаг не является необязательным для нас. Модель может выглядеть лучше на бумаге и все равно обрабатывать реальный обмен способами, которые мы не комфортно чувствуем, когда ставим их перед избирателями. Единственный способ узнать – это поставить ее в те же ситуации, с которыми наша система сталкивается каждый день, и увидеть, как она фактически реагирует.
Это еще один случай, когда абстрактный слой оправдывает себя. Поскольку наше приложение не зависит от одной конкретной модели, мы можем ввести новый выпуск, протестировать его против разговоров, которые мы фактически обрабатываем, и сравнить его честно с тем, что мы уже запускаем. Если он проходит проверку, мы переключаемся. Если нет, мы ждем.
Галлюцинации остаются одним из самых больших барьеров для принятия ИИ в корпоративной среде, особенно когда модели работают с большими наборами данных и сложной информацией. Какие практические техники оказались наиболее эффективными в снижении галлюцинаций в производственных средах?
Самая эффективная техника, которую мы обнаружили, заключается в ограничении того, что модель может знать.
Много галлюцинаций исходит от того, что модель запрашивается для ответа из своего собственного общего знания, где она с радостью заполнит пробелы чем-то, что звучит правильно. Мы делаем противоположное. Наш ИИ работает строго из информации, предоставленной кампанией. У него нет доступа к открытому интернету, и он не черпает из какой-то расплывчатой памяти мира.
Если ответ не находится в предоставленном материале, правильный ответ – сказать, что эта информация отсутствует. Этот один рубеж удаляет огромное количество риска.
Мы не останавливаемся на этом, однако. У нас есть несколько проверок, чтобы убедиться, что ответ соответствует тому, что предоставила кампания. Даже после того, как модель генерирует ответ, этот ответ проверяется против информации кампании, прежде чем он отправляется куда-либо. Если что-то не соответствует, оно не отправляется.
За пределами этого практические техники заключаются в основании и ограждении. Дайте модели конкретный, актуальный контекст, который она necesita для задачи перед ней, а не巨альную неразличимую кучу данных. Чем более сфокусирована информация, тем меньше места для отклонения.
Мы также устанавливаем четкие пределы того, что система может делать и говорить, и мы наблюдаем за реальными разговорами, а не предполагаем, что все в порядке. Вы не обнаруживаете проблемы, доверяя модели. Вы обнаруживаете их, наблюдая за выводом.
В регулируемом пространстве, таком как политическое текстовое общение, вымышленный ответ – это ответственность, поэтому мы разработали систему, чтобы предпочитать прозрачность над догадками.
Когда организации развертывают агентов ИИ через поддержку клиентов, коммуникации, маркетинг и операции, какие ошибки вы видите команды, повторяющие, когда они переходят от пилотных проектов к производственным развертываниям?
Ошибка, которую я вижу чаще всего, заключается в том, что команды тестируют, работает ли их агент, но не тестируют, может ли он быть сломан.
Я не могу посчитать, сколько раз компания выпускала агент ИИ, и в течение дня кто-то в интернете взламывал его, заставляя говорить что-то, что он никогда не должен был говорить. Его сбивали с пути, обманывали, чтобы он вышел из сценария, или манипулировали им, чтобы он представлял бренд образом, который в итоге становился скриншотом, который все передавали.
Это происходит потому, что в пилоте все хорошо себя ведут. Вы тестируете агента с разумными людьми, которые задают разумные вопросы, и он выглядит великолепно. Производство – это противоположность. Момент, когда что-то становится публичным, часть людей, которые с ним разговаривают, активно пытаются его обмануть.
Если вы не протестировали на этот адверсарный случай, вы не протестировали его по-настоящему. Вам необходимо попытаться сломать свою собственную систему, прежде чем кто-то другой сделает это. Протолкните ее, накормите ее странными и враждебными входными данными, и посмотрите, будет ли она держать свои границы, когда кто-то намеренно работает против нее.
Другая повторяющаяся ошибка заключается в том, что предполагается, что демонстрация, которая работает, – это система, которая работает. Пилот – это горстка просмотренных разговоров на счастливом пути. Производство – это тысячи людей в любое время, ведущих себя способами, которые вы не предвидели, и крайние случаи, которые вы отмахнулись, становятся ежедневными событиями в масштабе.
Мой совет – тратить меньше времени на совершенствование демонстрации и больше времени на попытки сломать эту вещь сами. Если она не может пережить вашу атаку, она не переживет публичное использование.
Агенты ИИ становятся все более способными обрабатывать разговоры, которые ранее требовали человеческого персонала. Где вы видите баланс между автоматизацией и человеческим надзором в течение следующих пяти лет, и какие рабочие процессы, по вашему мнению, всегда должны сохранять человека в цикле?
Это трудный вопрос, и я не думаю, что кто-то действительно знает точно, где лежит граница через пять лет. Таким образом, я думаю об этом, что真正ая ценность ИИ заключается в том, что он является умножителем сил. Он позволяет небольшой группе людей делать гораздо больше, чем они когда-либо могли в одиночку.
Команды, которые получают из этих инструментов максимальную пользу, используют их именно таким образом. ИИ берет на себя объем и повторение, а люди тратят свое время на суждение, стратегию и ситуации, которые действительно требуют человека. Это очень другая цель, чем попытка удалить людей из картины.
Когда цель – чистая замена, вы склонны толкать технологию за то, что она на самом деле способна, и она терпит неудачу способами, которые видны и дороги. Когда цель – умножить ваших людей, вы позволяете ИИ делать то, что он делает хорошо, и сохраняете людей там, где они добавляют наибольшую ценность. Второй подход работает лучше, и он более честен о том, где технология действительно находится сегодня.
В течение следующих пяти лет я ожидаю, что агенты возьмут на себя больше и больше рутинной нагрузки разговора, и они должны это сделать. Эта работа не требует человека, наблюдающего за каждым словом.
Рабочие процессы, которые всегда должны сохранять человека, – это те, где ставки высоки или ситуация действительно новая. Все, что касается согласия, соблюдения требований или решения, которое будет трудно отменить. Человек должен владеть направлением, и ИИ должен помочь ему охватить гораздо больше территории, чем он мог бы в одиночку.
Глядя вперед, какие разработки в разговорном ИИ вы наиболее взволнованы, и как вы представляете себе эволюцию платформ, таких как Convos, когда модели становятся более способными, мульти-модальными и автономными?
Что меня больше всего взволновало, – это то, что разговоры будут продолжать улучшаться.
Когда модели улучшаются, обмены, которые обрабатывает наша платформа, становятся более естественными и более полезными без необходимости перестраивать основу каждый раз. Поскольку мы разработали систему, которая может переключаться между моделями, мы получаем возможность вносить эти улучшения по мере их поступления.
Мульти-модальность – это развитие, за которым я наиболее внимательно слежу. Сейчас разговор – это текст. Когда модели будут лучше обрабатывать изображения и другие форматы, будет реальная возможность сделать эти обмены более богатыми, сохраняя при этом мгновенность, которая делает текстовое общение работающим.
В отношении автономности я оптимистичен, но осторожен. Более способные агенты выпускаются ежемесячно, и они смогут обрабатывать большую часть работы самостоятельно. Но в регулируемом пространстве более высокая автономность должна прийти с большей дисциплиной, а не с меньшей. Границы имеют значение больше, когда способность растет.
Я стал заниматься этим, потому что был человеком, который текстовал в пустоту и не получал ответа. Это все еще проблема, которая меня больше всего волнует. Как бы способны ни были эти модели, мера, к которой я постоянно возвращаюсь, проста. Чувствует ли человек на другом конце, что его услышали?
Спасибо за отличное интервью, читатели, которые хотят узнать больше, должны посетить Convos.












