Интервью

Алекс Рэтнер, генеральный директор и сооснователь Snorkel AI – Интервью

mm
Добавьте Unite.AI в избранные источники в Google

Алекс Рэтнер – генеральный директор и сооснователь Snorkel AI, компании, созданной в Стэнфордской лаборатории искусственного интеллекта.

Snorkel AI делает разработку ИИ быстрой и практической, превращая ручные процессы разработки ИИ в программные решения. Snorkel AI позволяет предприятиям разрабатывать ИИ, который работает для их уникальных рабочих нагрузок, используя их собственные данные и знания в 10-100 раз быстрее.

Что изначально привлекло вас к информатике?

Существует два очень интересных аспекта информатики, когда вы молоды. Во-первых, вы можете учиться так быстро, как хотите, экспериментируя и создавая, учитывая мгновенную обратную связь, а не ожидая учителя. Во-вторых, вы можете создавать много без необходимости просить разрешения!

Я начал программировать, когда был молодым ребенком, по этим причинам. Мне также нравилась точность, которую это требовало. Мне нравился процесс абстракции сложных процессов и рутин, а затем кодирования их модульным образом.

Позже, как взрослый, я вернулся в информатику профессионально через работу в консалтинге, где мне было поручено написать скрипты для некоторых базовых анализов патентного корпуса. Меня увлекло, сколько человеческих знаний – все, что кто-либо когда-либо считал патентным – было легко доступно, но в то же время было так трудно проанализировать даже самые простые процессы над сложным техническим текстом и многообразными данными.

Это привело меня обратно в информатику, и в конечном итоге обратно в Стэнфордский университет, где я сосредоточился на НЛП, которая является областью использования МЛ/ИИ в естественном языке.

Вы впервые начали и возглавили проект Snorkel, пока были в Стэнфорде, можете ли вы рассказать нам об этом пути в ранние дни?

В то время мы, как и многие в отрасли, были сосредоточены на разработке новых алгоритмов и – т.е. всех “фантазийных” вещей, связанных с машинным обучением, над которыми люди в сообществе проводили исследования и публиковали статьи.

Однако мы всегда были очень привержены связыванию этого с реальными проблемами – в основном с врачами и учеными в Стэнфорде. Но каждый раз, когда мы представляли новый модель или алгоритм, ответ был “конечно, мы попробуем это, но нам нужно все эти помеченные данные для обучения, которых у нас нет времени создать!”

Мы видели, что большая непроговоренная проблема заключалась в процессе помечания и курирования этих данных для обучения – поэтому мы сместили все свое внимание на это, и это было началом проекта Snorkel и идеи “данных-ориентированного ИИ”.

Snorkel имеет данные-ориентированный подход к ИИ, можете ли вы определить, что это значит и как он отличается от модели-ориентированного развития ИИ?

Данные-ориентированный ИИ означает сосредоточение внимания на построении лучших данных для построения лучших моделей.

Это контрастирует с – но работает в тандеме с – модели-ориентированным ИИ. В модели-ориентированном ИИ ученые-исследователи или данные ученые предполагают, что данные статичны и тратят свою энергию на调整 архитектур моделей и параметров для достижения лучших результатов.

Исследователи все еще делают отличную работу в модели-ориентированном ИИ, но готовые модели и автоматические методы МЛ улучшились так сильно, что выбор модели стал коммодитизированным во время производства. Когда это так, лучший способ улучшить эти модели – это обеспечить их более хорошими и лучшими данными.

Каковы основные принципы данных-ориентированного подхода к ИИ?

Основной принцип данных-ориентированного ИИ прост: лучшие данные строят лучшие модели.

В нашей академической работе мы назвали это “программированием данных”. Идея заключается в том, что если вы кормите достаточно сильную модель достаточно примеров входных и ожидаемых выходных данных, модель учится дублировать эти закономерности.

Это представляет большую проблему, чем можно было бы ожидать. Огромное большинство данных не имеют меток – или, по крайней мере, нет полезных меток для вашего применения. Помечание этих данных вручную требует однообразия, времени и человеческих усилий.

Имея помеченный набор данных, также не гарантирует качество. Человеческая ошибка проникает повсюду. Каждый неправильный пример в вашей основной истине ухудшит производительность окончательной модели. Никакое количество настройки параметров не может скрыть эту реальность. Исследователи даже обнаружили неправильно помеченные записи в основых открытых наборах данных.

Можете ли вы подробнее рассказать о том, что означает для данных-ориентированного ИИ быть программным?

Ручное помечание данных представляет серьезные проблемы. Это требует много человеческих часов, и иногда эти человеческие часы могут быть дорогими. Например, медицинские документы могут быть помечены только врачами.

Кроме того, ручное помечание часто сводится к единовременным проектам. Помечающие данные аннотируют данные в соответствии с жесткой схемой. Если потребности бизнеса меняются и требуют другого набора меток, помечающие должны начать все сначала.

Программные подходы к данным-ориентированному ИИ минимизируют обе эти проблемы. Программная система помечания Snorkel AI включает разнообразные сигналы – от устаревших моделей до существующих меток до внешних баз знаний – для разработки вероятностных меток в масштабе. Наш основной источник сигнала исходит от экспертов в предметной области, которые сотрудничают с учеными-данными для построения функций помечания. Эти функции кодируют их экспертное суждение в масштабируемые правила, позволяя усилиям, вложенным в одно решение, повлиять на десятки или сотни точек данных.

Эта структура также гибкая. Вместо того, чтобы начинать все сначала, когда меняются потребности бизнеса, пользователи добавляют, удаляют и регулируют функции помечания, чтобы применить новые метки за несколько часов вместо дней.

Как данный данные-ориентированный подход позволяет быстро масштабировать непомеченные данные?

Наш программный подход к данным-ориентированному ИИ позволяет быстро масштабировать непомеченные данные, усиливая влияние каждого выбора. Как только эксперты в предметной области устанавливают первоначальный, небольшой набор основной истины, они начинают сотрудничать с учеными-данными для быстрой итерации. Они определяют несколько функций помечания, обучают быструю модель, анализируют влияние своих функций помечания, а затем добавляют, удаляют или регулируют функции помечания по мере необходимости.

Каждый цикл улучшает производительность модели, пока она не соответствует или не превышает цели проекта. Это может сократить месяцы работы по помечанию данных до нескольких часов. В одном исследовательском проекте Snorkel два наших исследователей пометили 20 000 документов за один день – объем, который мог бы занять у ручных помечающих десять недель или дольше.

Snorkel предлагает несколько решений ИИ, включая Snorkel Flow, Snorkel GenGlow и Snorkel Foundry. В чем разница между этими предложениями?

Суит Snorkel AI позволяет пользователям создавать функции помечания (например, поиск ключевых слов или закономерностей в документах), чтобы программно пометить миллионы точек данных за несколько минут, а не ручное помечание одной точки данных за раз.

Это сжимает время, необходимое компаниям для перевода собственных данных в производственные модели и начала извлечения из них ценности. Snorkel AI позволяет предприятиям масштабировать подходы “человека в цикле” путем эффективного включения человеческого суждения и знаний экспертов в предметной области.

Это приводит к более прозрачному и объяснимому ИИ, позволяя предприятиям управлять предвзятостью и обеспечивать ответственные результаты.

Если говорить о сути, Snorkel AI позволяет предприятиям Fortune 500:

  • Разрабатывать высококачественные помеченные данные для обучения моделей или улучшения RAG;
  • Настраивать модели LLM с помощью тонкой настройки;
  • Выделять модели LLM в специализированные модели, которые намного меньше и дешевле в эксплуатации;
  • Строить доменные и задачно-специфические модели LLM с предварительной подготовкой.

Вы написали некоторые революционные статьи, на ваш взгляд, какая из них является самой важной?

Одной из ключевых статей была первоначальная статья о программировании данных (помечании данных для обучения программно) и о статье для Snorkel.

Каково ваше видение будущего Snorkel?

Я вижу Snorkel как доверенного партнера для всех крупных предприятий, которые серьезно относятся к ИИ.

Snorkel Flow должен стать повсеместным инструментом для команд данных в крупных предприятиях – будь то тонкая настройка настраиваемых крупных языковых моделей для их организаций, построение моделей классификации изображений или построение простых, развертываемых логистических регрессионных моделей.

Независимо от того, какие модели нужны бизнесу, им понадобятся высококачественные помеченные данные для их обучения.

Спасибо за отличное интервью, читателям, которые хотят узнать больше, следует посетить Snorkel AI,

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.