Интервью
Стив Немзер, старший директор по росту и инновациям ИИ, TELUS Digital – Серия интервью

Стив Немзер, старший директор по росту и инновациям ИИ, TELUS Digital, возглавляет инициативы, направленные на продвижение обучения ИИ и инфраструктуры для следующего поколения систем искусственного интеллекта. Его работа включает в себя разработку наборов данных для глубоких исследовательских моделей, сред обучения с подкреплением, данных мировых моделей, суверенных инициатив ИИ и рамок смягчения рисков ИИ, с сильным акцентом на ответственной практике ИИ, такой как решение проблемы предвзятости наборов данных и поддержка справедливых условий труда для тренеров ИИ. Ранее в своей карьере Немзер основал VeriTest Labs, помогая ранним технологическим лидерам, включая Microsoft (MSFT ), Intel (INTC ), Oracle (ORCL ) и Sun Microsystems, создать процветающие экосистемы третьих сторон до тех пор, пока компания не была приобретена Lionbridge.
TELUS Digital – это глобальная технологическая компания, которая помогает организациям проектировать, создавать и эксплуатировать цифровые платформы и решения, основанные на ИИ. Оперируя в десятках стран, компания предоставляет услуги, такие как обучение ИИ и аннотация данных, инженерия цифровых продуктов и управление опытом клиентов. Ее платформы и услуги поддерживают предприятия различных отраслей, включая технологии, финансы, здравоохранение, телекоммуникации и игры, когда они модернизируют операции и развертывают передовые возможности ИИ.
Учитывая ваш опыт в области тестирования ИИ, проверки данных и ответственной эксплуатации, как вы оцениваете сдвиг от языково-ориентированного генеративного ИИ к мировым моделям, которые стремятся рассуждать о реальных ситуациях и результатах, особенно в вашей текущей роли в TELUS Digital?
Большие языковые модели (LLM) по сути являются системами прогнозирования закономерностей. Они генерируют ответы, прогнозируя следующий токен на основе закономерностей, выученных из больших, статических корпусов. Хотя это может показаться рассуждением, модель на самом деле не моделирует, как действия меняют состояние мира.
Мировые модели используют другой подход. Вместо прогнозирования следующего слова или токена они стремятся прогнозировать следующее состояние системы, моделируя переходы состояний. Это позволяет системам симулировать, как среда эволюционирует в ответ на действия. На практике это открывает двери к гипотетическому рассуждению, когда модель может оценить различные возможные результаты перед принятием решения. Для интерактивных систем это может поддерживать более надежное принятие решений и планирование.
Этот сдвиг также меняет то, как мы думаем об ответственной эксплуатации. С традиционными генеративными системами ИИ большая часть внимания была сосредоточена на проблемах, таких как предвзятость и галлюцинации. Когда модели переходят к рассуждениям об окружающей среде и действиях, другие риски становятся более заметными.
Например, организации должны учитывать “разрыв между симуляцией и реальностью”, когда поведение, выученное в симулированных средах, может не переводиться чисто в реальные условия. Сдвиг распределения также становится ключевой проблемой, поскольку среды, с которыми модели сталкиваются при развертывании, могут отличаться от данных, на которых они были обучены.
Именно здесь тестирование и проверка становятся критически важными, что является большой частью моей работы в TELUS Digital. Когда системы ИИ переходят от генерации языка к системам, которые взаимодействуют с окружающей средой и принимают решения, организации нуждаются в строгих рамках оценки, чтобы обеспечить надежное поведение моделей в реальных условиях.
Многие люди знакомы с большими языковыми моделями, но гораздо меньше людей понимают мировые модели. В простых терминах, какую проблему мировые модели пытаются решить, с которой LLM по сути борются?
Мировая модель – это система, которая может прогнозировать “что происходит дальше” учитывая текущее состояние и действие. Формула: Состояние + Действие → Следующее Состояние
Если я держу яблоко и отпускаю его, мировая модель прогнозирует, что яблоко упадет. Она не просто знает, как выглядят яблоки или что люди говорят о том, что происходит, когда яблоки падают – она прогнозирует последствие на основе понимания физики. Изощренная мировая модель прогнозирует, что произойдет, если я сделаю то же самое, находясь на Международной космической станции, а не на поверхности Земли.
Это отличается от LLM. LLM прогнозирует: “Учитывая эту последовательность токенов, какой токен следующий?” Она обучена на тексте – то, что люди написали о мире, а не о мире самом по себе. Она может сказать вам, что яблоки падают, потому что она прочитала об этом. Но у нее нет внутреннего физического движка, который симулирует падение.
Иными словами, LLM хороши в статистическом прогнозировании следующего слова в ответе на вопрос, но понимание реального мира выходит за рамки языкового описания и когерентности. Мировые модели стремятся понять, как ситуации эволюционируют шаг за шагом, каково следующее состояние, учитывая текущее состояние и действие, которое произойдет, какие ограничения есть.
Мировые модели часто описываются как системы, которые позволяют системам ИИ симулировать результаты перед принятием действия. Как это выглядит на практике, и насколько близко мы находимся к тому, чтобы увидеть это работающим надежно вне исследовательских сред?
Одной из проблем в ответе на этот вопрос является то, что термин “мировая модель” используется довольно свободно, и его значение склонно меняться в зависимости от контекста. Простая определение мировой модели заключается в том, что они позволяют агенту симулировать текущее состояние окружающей среды и прогнозировать будущие состояния, и рассуждать о последствиях. Исследователи склонны классифицировать мировые модели немного более детально, на основе их представления и методов обработки. Есть латентные мировые модели, которые выделяют “сущность” окружающей среды в компактное фокусированное пространство. Есть генеративные мировые модели, которые “понимают” физику, чтобы создать кадр за кадром визуальные представления, и есть модели архитектуры совместного прогнозирования (JEPA), которые прогнозируют результаты из прошлых действий.
Латентные мировые модели уже вышли из исследовательской лаборатории и помогают в приложениях, таких как автономное вождение, складские операции, промышленные операции и сельское хозяйство. Генеративные мировые модели появляются в создании синтетических данных для разработки игровых движков, для самоходных случаев, воплощенных случаев ИИ для видеосимуляции человеческих движений, и для создания архитектурных визуализаций,
Подход JEPA, предпочитаемый промышленными луминариями, такими как Ян Лекун, прогнозирует результаты в абстрактном представительном пространстве, а не генерирует пиксели. Роботы в основном были ограничены контролируемыми средами, но JEPA меняет это, позволяя роботам перейти к открытым, реальным условиям. Автономные транспортные средства – хороший пример – некоторые используют Genie 3 для создания гиперреалистичных, интерактивных симуляций для обучения и лучшего xửления редких событий, таких как зоны строительства.
Очевидно, что для масштабирования этих моделей из песочницы в реальный мир требуется гораздо больше тестирования безопасности и надежности.
С точки зрения предприятия, где вы ожидаете, что мировые модели принесут значительную ценность сначала, будь то в робототехнике, автономных системах принятия решений, цифровых двойниках или более абстрактных бизнес-средах?
Мое интуитивное чувство заключается в том, что цифровые двойники, скорее всего, принесут практическую ценность сначала. Повторение состояния реальной системы, чтобы протестировать сценарии, прежде чем действовать. Например, в системе цепочки поставок производитель может создать двойник своей сети партнеров-компонентов. Симуляция может быть alimentирована данными с датчиков, журналов, телеметрических данных и может ответить на вопросы, такие как “Что произойдет, если Hormuz будет закрыт?” Итак, мы можем протестировать перенаправление отправок, прежде чем фактически изменить логистику. Это помогает нам перейти от мониторинга живой системы к симуляции живой системы.
Значительная ценность мировых моделей для робототехники движется параллельно. Имея роботов, которые понимают фундаментальные свойства физики, такие как трение на поверхности при подъеме объекта, будет стимулировать развертывание воплощенного ИИ.
Большая часть вашей карьеры была сосредоточена на сборе данных, аннотации и проверке. Как меняются проблемы с данными, когда мы переходим от статического обучения текста к обучению систем, как мир ведет себя во времени?
Ситуация сбора данных для мировых моделей требует большого поворота от вчерашних методов обучения LLM. Во-первых, у нас нет огромного корпуса предварительно обученных данных, петабайт из Common Crawl и миллиардов веб-страниц. Некоторые исследователи робототехники предполагают, что у нас есть только 1/1000 необходимых данных для обучения физического интеллекта и мировых моделей, чтобы достичь эквивалентной производительности, скажем, GPT2.
Итак, это займет некоторое время, чтобы построить эти наборы данных. В случае воплощенного ИИ нам понадобятся миллионы часов аннотированных эгоцентрических многосенсорных наборов данных. Некоторые телеперированные, некоторые из синтетических сред, таких как Isaac Sim. В TELUS Digital мы сделали поворот от текста к многомодальным и многосенсорным наборам данных и наборам данных симуляции. Конечно, нам помогает наша сильная основа в сборе и аннотации данных компьютерного зрения. Мы были на переднем крае там в течение многих лет.
Помимо нехватки предварительно обученных данных и аннотированных данных тонкой настройки, будут многие другие проблемы обучения при масштабировании обучения с подкреплением. Может быть, новые трансформационные (без каламбура) парадигмы, такие как GPT и концепции RL, необходимы для ускорения прорывов в эффективности методов обучения мировых моделей.
Мировые модели влияют на принятие решений, а не просто генерируют выводы. Какие новые риски безопасности или управления это вводит по сравнению с генеративными системами ИИ?
Есть много рисков безопасности и управления, поскольку мировые модели по своей сути предназначены для поддержки агентских операций. Итак, все проблемы, которые у нас есть с сегодняшним поколением агентов ИИ, все еще применяются в сценарии мировых моделей. Нам нужен человеческий надзор за всеми важными процессами принятия решений, будь то связано с безопасностью транспорта, профессиональной безопасностью, здравоохранением, финансами и повседневной деятельностью.
Пример, специфичный для мировых моделей, – это разрыв между данными симуляции и реальными условиями. Микроскопическое изменение поверхности может сделать реальный мир грязным для роботов, которые хорошо обучены в симуляции.
Другой риск связан с поведением человека. Когда системы становятся все более и более автономными, люди начнут сильно полагаться на них, и надзор может стать слабым, и в конечном итоге система не получит необходимой переобучения.
Предвзятость и доверие остаются значительными барьерами для принятия ИИ. Как эти проблемы эволюционируют, когда системы ИИ начинают моделировать и действовать в сложных реальных или социальных средах?
От общей публики до высшего руководства доверие и уверенность в моделях ИИ уже довольно низки, и я не думаю, что это изменится значительно в ближайшем будущем.
Проблемы с концентрацией власти ИИ в слишком少их руках, о том, что ИИ отнимает работу, о предвзятости ИИ, которая ставит недостаточно представленные группы в невыгодное положение, модели, принимающие решения, которые влияют на здоровье, карьеру и финансы, модели, использующие интеллектуальную собственность без согласия, а также проблемы с глубокими подделками ИИ, уже очень высоки. Руководители беспокоятся о том, как справиться с переходами рабочей силы, защитой данных и соблюдением нормативных требований, и о том, чтобы не отстать от конкурентов в “гонке вооружений” ИИ.
Недавние события в новостях о давлении правительства на строителей фундаментальных моделей ИИ, чтобы смягчить условия использования, касающиеся таких вещей, как автономное оружие или массовое наблюдение, только усиливают эти проблемы.
С другой стороны, мы видим карманы широкого принятия ИИ и уверенности. Примером является то, как агенты кодирования взлетели в последние несколько месяцев. Менеджеры по разработке программного обеспечения имеют высокое доверие к агентам кодирования, и есть фундаментальная перемена в том, как разработка программного обеспечения осуществляется, от разработки PRD до пост-релизного тестирования регрессии. Мир разработки программного обеспечения развивается со скоростью света, и многое из этого происходит благодаря доверию к высокопроизводительным агентам кодирования. Когда доверие пользователей растет в других случаях использования, я ожидаю, что принятие будет взлететь подобным образом.
Решения для построения доверия включают в себя разнообразные наборы данных и среды на этапах обучения, а также обширное красное командное тестирование в качестве защитного барьера перед развертыванием. Прогрессивный нормативный надзор – это必须. Некоторые предложили, что строители фундаментальных моделей должны быть обязаны предоставлять “Отчеты о социальном воздействии”, аналогичные отчетам об экологическом воздействии (EIR), перед выпуском новых моделей.
В TELUS Digital большая часть работы заключается в развертывании ИИ в масштабе для реальных предприятий и реальных пользователей. Как идеи, такие как мировые модели, пересекаются с практическими проблемами, такими как прозрачность, влияние на рабочую силу и поддержание доверия клиентов?
Чтобы уточнить, TELUS Digital работает как непосредственно с фундаментальными строителями моделей, так и с предприятиями, развертывающими модели ИИ. Наша сфера деятельности – это конец в конец:

Вопрос о практических проблемах связан с предыдущим вопросом о доверии. Давайте посмотрим на доверие рабочей силы. Когда мировые модели, поддержанные ИИ, становятся более распространенными, руководителям необходимо быть прозрачными с их сотрудниками, подрядчиками и клиентами. Необходимо четкое общение о том, что модели хорошо делают, как они были обучены, какие данные были использованы для их обучения, какие ограничители были установлены, и где вмешивается человеческий надзор. Руководители предприятий должны показать текущей рабочей силе ценность новых моделей, например, делая всю рутинную работу в работе. И они должны показать пути перехода для затронутых работников, которые могут переходить на новые появляющиеся работы, поскольку предыдущие работы все больше выполняются мировыми моделями, поддержанными ИИ. Беловоротничковая рабочая сила имеет дело с этим в реальном времени, и многие ручные работы будут затронуты в ближайшие годы, поскольку автоматизация, поддержанная мировыми моделями, расширяется.
Есть растущий разрыв между тем, что понимают исследователи ИИ, и тем, что воспринимает общественность. Как организации могут общаться о достижениях, таких как мировые модели, чтобы построить доверие, не преувеличивая их возможности?
Опять же, это сводится к прозрачности об ограничениях моделей и о том, что модели хорошо делают. Общение о том, как модели были обучены, чтобы смягчить потенциальную предвзятость. Какой человеческий надзор установлен. Несколько реальных демонстраций возможностей модели и случаев использования, в сочетании с долгосрочными исследованиями, могут многое сделать для увеличения общей общественной и рабочей уверенности.
Наконец, какое одно распространенное заблуждение о моделях ИИ мира, будь то чрезмерно оптимистичное или чрезмерно осторожное, вы думаете, что нужно исправить прямо сейчас?
В той ограниченной степени, в которой общественность информирована о мировых моделях, одно заблуждение заключается в том, что мировые модели нуждаются в понимании всей физики и науки, чтобы быть эффективными. Мировые модели будут развертываться раньше, чем можно было бы ожидать, потому что отдельные случаи использования могут быть сужены. Автономное транспортное средство нужно понимать только динамику движения и физику, связанную с дорогой, и то, как текущее состояние (например, быть рядом с начальной школой или преобладание附近 стоящих SUV с высокими силуэтами) повлияет на их зрение и принятие решений. Автономное транспортное средство не нужно понимать физику, лежащую в основе того, как готовить суфле, чтобы функционировать.
Спасибо за отличный интервью, читатели, которые хотят узнать больше, должны посетить TELUS Digital.












