Інтерв’ю

Ор Ленчнер, генеральний директор Bright Data – Серія інтерв’ю

mm
Додайте Unite.AI до бажаних джерел у Google

Ор Ленчнер, генеральний директор Bright Data, очолює платформу збору веб-даних, яка лідирує на ринку, з 2018 року, керуючи її розширенням, інноваціями та зростанням до понад 100 мільйонів доларів США щорічного доходу. Bright Data дозволяє корпораціям Fortune 500, провідним підприємствам, відомим університетам та державним установам отримувати доступ до публічних веб-даних в режимі реального часу та у великих масштабах. Ленчнер є переконаним захисником відкритості та доступності публічних веб-даних, підкреслюючи їх важливу роль у розвитку інновацій.

Що спонукало вас до вступу у світ даних та штучного інтелекту, а з моменту призначення генеральним директором у 2018 році, як ви сформували місію та бачення Bright Data?

Я завжди був зацікавлений у потужності даних, особливо у тому, як вони можуть впливати на прийняття рішень та сприяти інноваціям. Коли дані використовуються правильно, вони також можуть забезпечувати прозорість у бізнесі. Становлення генеральним директором Bright Data у 2018 році дало мені можливість допомогти сформувати, як дослідники штучного інтелекту та підприємства підходять до збору та використання публічних веб-даних.

Які ключові виклики команд штучного інтелекту збирають великомасштабні публічні веб-дані, і як Bright Data вирішує ці проблеми?

Масштабованість залишається однією з найбільших проблем для команд штучного інтелекту. Оскільки моделі штучного інтелекту вимагають величезної кількості даних, ефективний збір даних – це не проста задача. І оскільки моделі штучного інтелекту є лише такими хорошими, як дані, на яких вони тренуються, забезпечення команд доступом до свіжих, високоякісних даних є постійним викликом. Це особливо вірно, оскільки веб-еволюція відбувається в режимі реального часу.

Іншою великою проблемою є дотримання вимог. Закони та вимоги щодо захисту даних постійно змінюються, тому команди штучного інтелекту повинні завжди бути обізнані про ці зміни. Вони також повинні розуміти, як справлятися з веб-сайтами, які застосовують анти-бот механізми, що можуть ускладнити процес збору даних.

Платформа, яку ми створили в Bright Data, вирішує ці проблеми. Ми забезпечуємо масштабований, автоматизований збір даних, який надає структуровані дані в режимі реального часу. Наші інструменти, керовані штучним інтелектом, очищують та верифікують дані, щоб забезпечити точність. У нас є суворі заходи, щоб гарантувати законний та етичний збір даних для дотримання вимог. Ідея полягає в тому, щоб дати командам штучного інтелекту можливість зосередитися на створенні великих моделей, тоді як ми займаємося складнощами збору даних.

Як високоякісні веб-дані сприяють ефективності моделей штучного інтелекту, і які є найкращими практиками забезпечення точності даних?

Високоякісні дані означають дані, які є повними, вільними від упереджень та, найважливіше, точними. Якщо дані відсутні або містять несучності та помилки, модель штучного інтелекту не буде працювати відповідно до очікувань.

Для досягнення точності найкраще джерелом даних є різноманітні публічні джерела, які мають встановлену надійність. Використання лише декількох або, що ще гірше, одного джерела даних, призводить до проблем, таких як неповнота. Маєючи кілька джерел, можна перехрестно перевіряти дані та створити більш збалансований та представлений набір даних. Крім того, організації повинні розглянути автоматичну перевірку та очищення даних, щоб ефективно позбутися помилкових та несучих даних.

У Bright Data ми беремо до уваги всі ці фактори. Ми забезпечуємо команди штучного інтелекту структурованими та реальними даними, які були перевірені на точність. Таким чином, вони можуть тренувати моделі з впевненістю.

Які найбільші етичні проблеми у зборі публічних веб-даних сьогодні?

Конфіденційність залишається однією з найбільших проблем у зборі публічних веб-даних. Люди турбуються про те, що їхні дані можуть бути відкритими для зловживання та неправильного використання. Для забезпечення конфіденційності даних необхідно підкреслити прозорість. Організації, які збирають дані, повинні бути відкритими щодо даних, які вони збирають. Важливо гарантувати громадськості, що їхні дані використовуються згідно з суворими етичними правилами.

Іншою великою проблемою є монополія. Деякі великі компанії контролюють велику кількість даних, що створює нерівну гру, у якій лише кілька компаній мають доступ до інформації, необхідної для навчання моделей штучного інтелекту та розвитку інновацій. Це не так, як повинно бути. Публічні веб-дані повинні залишатися доступними для підприємств, дослідників та розробників. Таким чином, розвиток штучного інтелекту не буде зосереджений у руках лише кількох великих гравців.

Етика не є післяthought у Bright Data. Вони вбудовані в кожне рішення, яке ми приймаємо. Ми не тільки слідуємо галузевим стандартам – ми їх встановлюємо. Ми лідеруємо в галузі збору даних у визначенні правильних етичних стандартів. Ми хочемо забезпечити, щоб публічні веб-дані були доступні відповідально, прозоро та у повній відповідності з глобальними регуляціями.

Як Bright Data забезпечує дотримання глобальних правил захисту даних під час великомасштабного збору даних?

Наша організація зобов’язана дотримуватися глобальних юридичних та регуляторних вимог щодо збору та використання даних. Ми бачимо, щоб ми дотримувалися вимог GDPR, CPRA, CCPA та інших відповідних регуляцій. Крім того, ми суворо дотримуємося протоколів Know Your Customer (KYC), щоб гарантувати, що лише легітимні користувачі можуть отримувати доступ до нашої платформи. Наші рішення з даних можуть бути доступні лише легітимним підприємствам та дослідникам.

Наша Політика прийнятного використання чітко визначає, які дані можна зібрати, а які ні. Це включає в себе відповідальне використання. У нас є спеціальна команда з дотримання вимог, яка відповідає за постійний моніторинг регуляцій, щоб гарантувати, що ми знаємо про останні юридичні та регуляторні вимоги.

Незважаючи на це, ми все ж таки вважаємо, що публічні веб-дані повинні залишатися доступними. Наша мета полягає в тому, щоб забезпечити команди штучного інтелекту даними,必要ими їм, при цьому забезпечуючи дотримання правил конфіденційності та законодавства.

Як ви балансуете бізнес-розвиток з підтриманням етичних практик збору даних?

Ми завжди вважаємо етику та зростання не взаємно виключними. Довіра наших клієнтів та відносини, які ми будемо з ними, є головними проблемами. Ми розуміємо, що ми можемо досягти довгострокового успіху лише тоді, коли збираємо дані на прозорих умовах та у відповідності з чинними законами.

Отже, ми встановили суворий протокол перевірки наших користувачів. Це призначено для забезпечення того, що дані, які ми збираємо, використовуються етично. Ми виділяємо час, зусилля та ресурси на дотримання вимог та безпеки, щоб захистити наших клієнтів та громадськість загалом. За допомогою етичного збору даних ми досягаємо успіху в бізнесі, сприяючи створенню прозорої та відповідальної екосистеми штучного інтелекту.

Як Bright Data залишається попереду змін у регуляторних правилах захисту даних?

Ми розуміємо, що наші процеси використання даних та політики повинні змінюватися, щоб відображати зміни у відповідних законах та регуляціях. Отже, ми регулярно консультуємося з юридичними експертами та спілкуємося з регуляторними органами. Ми також беремо участь у дискусіях з законодавцями та іншими учасниками політики, надаючи свій внесок у розробку значимих правил захисту даних. Ми прагнемо знайти баланс між інноваціями та захистом даних.

Наша рамка збору та використання даних еволюціонує, коли видаються нові закони та переглядаються регуляції. У нас є команда з дотримання вимог, яка активно оновлює наші політики використання даних, щоб гарантувати, що наша платформа завжди повністю відповідає вимогам. Крім того, ми проводимо освітні ініціативи для клієнтів, щоб просувати етичне використання даних.

Які є нові тенденції у зборі даних штучного інтелекту, про які компанії повинні бути обізнані?

Збір даних у режимі реального часу стає необхідним для сучасних моделей штучного інтелекту. Це важливо для них мати доступ до останніх або найсвіжіші даних, щоб забезпечити високий рівень точності та надати кращий користувальницький досвід.

Іншою помітною тенденцією є залежність від синтетичних даних, використовуваних для доповнення даних, тобто штучного інтелекту, який генерує дані, які доповнюють набори даних, зібрані з реальних сценаріїв.

Я також бачу сильний інтерес до пояснюваного штучного інтелекту. Більшість моделей штучного інтелекту наразі страждають від ефекту “чорної скриньки” або відсутності прозорості у процесах прийняття рішень. Компанії намагаються змінити цю парадигму, створюючи моделі штучного інтелекту, які можуть пояснити, як вони прийшли до висновків або рішень, які вони приймають.

Нарешті, компанії усвідомлюють зростаючі проблеми з конфіденційністю даних. Тому техніки штучного інтелекту, спрямовані на збереження конфіденційності даних, такі як федеративне навчання, стають популярними. Організації хочуть максимізувати навчання моделей штучного інтелекту без компрометації конфіденційності користувачів.

Ми стежимо за цими тенденціями, щоб ми могли створювати рішення, які дозволяють командам штучного інтелекту зберігати конкурентну перевагу.

Як ви бачите, агенти штучного інтелекту та автоматизація змінюють ландшафт збору даних?

Наразі моделі штучного інтелекту використовують структуровані набори даних, які в основному збираються вручну. Ці набори даних також проходять попередню обробку, очищення та інші процедури, які зазвичай включають втручання людини. Це має змінитися в найближчому майбутньому з появою агентів штучного інтелекту для автономного збору та обробки даних для навчання штучного інтелекту. Вони роблять можливим автоматичне навчання з веб-даних у режимі реального часу у безпрецедентних масштабах.

Ми створили інфраструктуру, яка підтримує розгортання та розвиток агентів штучного інтелекту, забезпечуючи гладкий доступ до високоякісних даних у режимі реального часу в Інтернеті. Ця технологія дозволяє складним системам штучного інтелекту безперервно взаємодіяти з динамічними веб-даними, навчатися з них та зростати.

Агенти штучного інтелекту можуть перетворити галузі, оскільки вони дозволяють системам штучного інтелекту отримувати доступ та навчатися з постійно змінюваних наборів даних у Інтернеті, а не покладатися на статичні та оброблені вручну дані. Це може привести до банківських або кібербезпекових чат-ботів штучного інтелекту, наприклад, які можуть приймати рішення, що відображають останні реалії. Це призводить до величезних успіхів у ефективності та більшої автоматизації.

У Bright Data ми не тільки дозволяємо цю трансформацію у ландшафті збору даних. Ми вважаємо, що ми перебуваємо на передовій, вводячи технологію, яка відкриває наступне покоління штучного інтелекту. Ми раді допомогти підприємствам та командам штучного інтелекту у використанні повного потенціалу агентів штучного інтелекту для своїх операцій.

Дякуємо за велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати Bright Data.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.