Интервью
Ор Ленчнер, генеральный директор Bright Data – Интервью

Ор Ленчнер, генеральный директор Bright Data, возглавляет ведущую платформу сбора веб-данных с 2018 года, обеспечивая ее расширение, инновации и рост до более чем 100 миллионов долларов в годовой выручке. Bright Data позволяет корпорациям Fortune 500, ведущим бизнесам, известным университетам и государственным учреждениям получить доступ к публичным веб-данным в реальном времени и в крупном масштабе. Ленчнер является сильным сторонником открытости и доступности публичных веб-данных, подчеркивая их важную роль в стимулировании инноваций.
Что вдохновило вас на карьеру в области данных и ИИ, и как вы сформировали миссию и видение Bright Data с момента назначения генеральным директором в 2018 году?
Я всегда был увлечен силой данных, особенно тем, как они могут стимулировать принятие решений и инновации. Когда данные используются правильно, они также могут обеспечить прозрачность в бизнесе. Становление генеральным директором Bright Data в 2018 году дало мне возможность помочь сформировать, как исследователи ИИ и бизнес подходят к сбору и использованию публичных веб-данных.
Каковы основные проблемы, с которыми сталкиваются команды ИИ при сборе крупномасштабных публичных веб-данных, и как Bright Data решает эти проблемы?
Масштабируемость остается одной из основных проблем для команд ИИ. Поскольку модели ИИ требуют огромных объемов данных, эффективный сбор данных – это не простая задача. И поскольку модели ИИ только такие хороши, как данные, на которых они обучены, обеспечение того, чтобы команды имели доступ к свежим, высококачественным данным, является постоянной проблемой. Это особенно верно, поскольку веб эволюционирует в реальном времени.
Другой серьезной проблемой является соблюдение требований. Законы и требования о защите данных постоянно эволюционируют, поэтому команды ИИ должны всегда быть осведомлены об этих изменениях. Они также должны понимать, как справиться с веб-сайтами, которые применяют анти-бот механизмы, что может осложнить процесс сбора данных.
Платформа, которую мы построили в Bright Data, решает эти проблемы. Мы предоставляем масштабируемый, автоматизированный сбор данных, который доставляет структурированные данные в реальном времени. Наши инструменты, основанные на ИИ, очищают и проверяют данные, чтобы обеспечить точность. У нас есть строгие меры, чтобы обеспечить законный и этический сбор данных для соблюдения требований. Идея состоит в том, чтобы дать командам ИИ возможность сосредоточиться на построении хороших моделей, а мы будем заниматься сложностями сбора данных.
Как высококачественные веб-данные способствуют производительности моделей ИИ, и какие лучшие практики для обеспечения точности данных?
Высококачественные данные означают данные, которые полны, свободны от предубеждений и, самое главное, точны. Если данные неполны или содержат несоответствия и ошибки, результирующая модель ИИ не будет работать так, как ожидается.
Чтобы достичь точности, лучше всего собирать данные из различных публичных источников, которые имеют установленную репутацию. Использование только нескольких или, что хуже, одного источника данных, приводит к проблемам, таким как неполнота. Наличие нескольких источников позволяет пересечь данные и создать более сбалансированную и представительную выборку. Кроме того, организации должны учитывать автоматическую проверку и очистку данных, чтобы эффективно избавиться от ошибочных и несоответствующих данных.
В Bright Data мы учитываем все эти факторы. Мы предоставляем командам ИИ структурированные и актуальные данные, которые были проверены на точность. Таким образом, они могут обучать модели с уверенностью.
Каковы основные этические проблемы при сборе публичных веб-данных сегодня?
Приватность остается одной из основных проблем при сборе публичных веб-данных. Люди беспокоятся о том, что их данные могут быть раскрыты и использованы не по назначению. Чтобы обеспечить конфиденциальность данных, важно подчеркнуть прозрачность. Организации, которые собирают данные, должны быть открытыми относительно сбора и использования данных. Важно заверить общественность в том, что их данные используются в соответствии с этическими руководствами.
Другой серьезной проблемой является монополизация. Некоторые крупные компании контролируют огромные объемы данных, что создает неравные условия, при которых только несколько компаний имеют доступ к информации, необходимой для обучения моделей ИИ и стимулирования инноваций. Это не так, как должно быть. Публичные веб-данные должны оставаться доступными для бизнеса, исследователей и разработчиков. Таким образом, развитие ИИ не будет集中ироваться в руках нескольких крупных игроков.
Этика не является после мысли в Bright Data. Они встроены в каждое решение, которое мы принимаем. Мы не только следуем отраслевым стандартам – мы их устанавливаем. Мы лидируем в отрасли сбора данных в определении правильных этических стандартов. Мы хотим обеспечить, чтобы публичные веб-данные были доступны ответственно, прозрачно и в полном соответствии с глобальными правилами.
Как Bright Data обеспечивает соблюдение глобальных правил защиты данных, одновременно ermögляя крупномасштабный сбор данных?
Наша организация привержена соблюдению глобальных законов и правил, касающихся сбора и использования данных. Мы следим за тем, чтобы мы соблюдали требования GDPR, CPRA, CCPA и других соответствующих правил. Важно, что мы строго следуем протоколам Know Your Customer (KYC), чтобы обеспечить, что только законные пользователи имеют доступ к нашей платформе. Наши решения по сбору данных могут быть доступны только законным бизнесам и исследователям.
Наша Политика приемлемого использования четко определяет, какие данные можно и нельзя собирать. Это включает в себя ответственное использование. У нас есть специальная команда по соблюдению правил, которая отвечает за постоянный мониторинг правил, чтобы обеспечить, что мы актуальны с последними юридическими и правилами.
Тем не менее, мы все еще считаем, что публичные веб-данные должны оставаться доступными. Наша цель – предоставить командам ИИ данные, которые им нужны, одновременно обеспечивая соблюдение правил защиты данных и законов.
Как вы балансируете рост бизнеса с поддержанием этических практик сбора данных?
Мы всегда думаем об этике и росте как не исключающих друг друга. Доверие наших клиентов и отношения, которые мы строим с ними, являются первоочередными задачами. Мы понимаем, что мы можем добиться долгосрочного успеха только в том случае, если мы собираем данные на прозрачных условиях и в соответствии с действующими законами.
Следовательно, мы установили строгий протокол проверки для наших пользователей. Это предназначено для обеспечения того, что данные, которые мы собираем, используются этично. Мы выделяем время, усилия и ресурсы на соблюдение правил и безопасность, чтобы защитить наших клиентов и общественность в целом. Следуя этическим практикам сбора данных, мы добиваемся успеха в бизнесе, одновременно способствуя созданию прозрачной и ответственной экосистемы ИИ.
Как Bright Data опережает изменения в правилах защиты данных?
Мы понимаем, что наши процессы сбора и использования данных должны меняться, чтобы отражать изменения в соответствующих законах и правилах. Следовательно, мы регулярно консультируемся с юридическими экспертами и общаемся с регулирующими органами. Мы также участвуем в обсуждениях с законодателями и другими лицами, участвующими в разработке политики, предоставляя вклад в создание осмысленных правил защиты данных. Мы стремимся найти баланс между инновациями и защитой данных.
Наша основа для сбора и использования данных эволюционирует по мере выхода новых законов и пересмотра правил. У нас есть команда по соблюдению правил, которая активно обновляет наши политики использования данных, чтобы обеспечить, что наша платформа всегда полностью соответствует требованиям. Кроме того, мы проводим образовательные инициативы для клиентов, чтобы продвигать этичное использование данных.
Каковы основные тенденции в сборе данных ИИ, о которых компаниям следует знать?
Сбор данных в реальном времени становится необходимым для современных моделей ИИ. Это важно для них, чтобы получить доступ к последним или свежим данным, чтобы обеспечить высокий уровень точности и предоставить лучший пользовательский опыт.
Другой заметной тенденцией является использование синтетических данных для дополнения наборов данных, собранных из реальных сценариев.
Я также вижу сильный интерес к объяснимому ИИ. Большинство моделей ИИ в настоящее время страдают от эффекта “черного ящика”, или отсутствия прозрачности в их процессах принятия решений. Компании стремятся изменить эту парадигму, создавая модели ИИ, которые могут объяснить, как они пришли к выводам или решениям, которые они принимают.
Наконец, компании осознают растущие проблемы защиты данных. Поэтому методы ИИ, направленные на сохранение конфиденциальности данных, такие как федеративное обучение, становятся востребованными. Организации хотят максимизировать обучение моделей ИИ, не компрометируя конфиденциальность данных пользователей.
Мы следим за этими тенденциями, чтобы мы могли создавать решения, которые позволяют командам ИИ оставаться конкурентоспособными.
Как вы видите, как агенты ИИ и автоматизация изменят ландшафт сбора данных?
В настоящее время модели ИИ используют структурированные наборы данных, которые в основном собираются вручную. Эти наборы данных также проходят предобработку, очистку и другие процедуры, которые обычно включают человеческое вмешательство. Это должно измениться в ближайшем будущем с ростом агентов ИИ для автономного сбора и обработки данных для обучения ИИ. Они делают возможным автоматическое обучение на реальных веб-данных в беспрецедентном масштабе.
Мы создали инфраструктуру, которая поддерживает развертывание и эволюцию агентов ИИ, обеспечивая беспрепятственный доступ к высококачественным данным в реальном времени на вебе. Эта технология позволяет сложным системам ИИ непрерывно взаимодействовать с динамическими веб-данными, учиться на них и расти.
Агенты ИИ могут преобразовать отрасли, поскольку они позволяют системам ИИ получить доступ и учиться на постоянно меняющихся наборах данных на вебе, вместо того, чтобы полагаться на статические и обработанные вручную данные. Это может привести к банковским или кибербезопасным чат-ботам ИИ, например, которые могут принимать решения, отражающие самые последние реалии. Это приводит к значительному прогрессу в эффективности и большему количеству областей для автоматизации.
В Bright Data мы не только способствуем этому преобразованию в ландшафте сбора данных. Мы считаем, что мы находимся на переднем крае, вводя технологию, которая знаменует следующее поколение искусственного интеллекта. Мы рады помочь бизнесу и командам ИИ использовать полный потенциал агентов ИИ для своих операций.
Спасибо за отличное интервью, читатели, которые хотят узнать больше, могут посетить Bright Data.












