Інтерв’ю

Сакет Саурабх, генеральний директор і співзасновник Nexla – Інтерв’ю

mm
Додайте Unite.AI до бажаних джерел у Google

Сакет Саурабх, генеральний директор і співзасновник Nexla, – це підприємець з глибокою пристрастю до даних та інфраструктури. Він очолює розробку наступного покоління автоматизованої платформи інженерії даних, призначеної для надання масштабу та швидкості тим, хто працює з даними.

Раніше Саурабх заснував успішний мобільний стартап, який досяг значних рубежів, включаючи придбання, первинне публічне розміщення акцій та зростання у багатомільйонний бізнес. Він також внес свій внесок у розвиток кількох інноваційних продуктів і технологій під час своєї роботи в Nvidia (NVDA ).

Nexla дозволяє автоматизувати інженерію даних, щоб дані були готові до використання. Це досягається завдяки унікальному підходу до Nexsets – даних продуктів, які роблять легко інтегрувати, перетворювати, доставляти та моніторити дані.

Що надихнуло вас на співзаснування Nexla, і як ваш досвід у сфері інженерії даних сформував ваше бачення компанії?

 До заснування Nexla я розпочав свій шлях в інженерії даних у Nvidia, будуючи високомасштабні, високотехнологічні рішення на стороні обчислювальної техніки. Після цього я провів свій попередній стартап через процес придбання та первинного публічного розміщення акцій у сфері мобільної реклами, де великі об’єми даних та машинне навчання були важливою частиною нашої пропозиції, обробляючи близько 300 мільярдів записів даних щодня.

Оглядаючи ландшафт у 2015 році після того, як моя попередня компанія вийшла на біржу, я шукав наступний великий виклик, який би мене надихнув. Приходячи з цих двох напрямків, було дуже ясно, що проблеми даних та обчислювальної техніки сходяться, оскільки галузь рухалася у бік більш просунутих застосунків, що працюють на даних та штучному інтелекті.

Хоча ми не знали на той час, що генерація штучного інтелекту (GenAI) прогресуватиме так швидко, як це відбувається, було очевидно, що машинне навчання та штучний інтелект будуть основою для використання даних. Тому я почав думати про те, який тип інфраструктури потрібен людям для успішної роботи з даними, і як ми можемо зробити дані доступними та доступними для широкого кола користувачів, а не лише для інженерів.

Це призвело до бачення Nexla – спростити та автоматизувати інженерію даних, оскільки інженерія даних була дуже індивідуальною рішенням у більшості компаній, особливо при роботі з складними або великомасштабними проблемами даних. Метою було зробити дані доступними та доступними для широкого кола користувачів, а не лише для інженерів даних. Мій досвід у будівництві масштабних систем та застосунків даних підживлював це бачення щодо демократизації доступу до даних шляхом автоматизації та спрощення.

Як Nexsets втілюють місію Nexla щодо надання даних, готових до використання, для всіх, і чому це інновація є важливою для сучасних підприємств?

Nexsets втілюють місію Nexla щодо надання даних, готових до використання, для всіх, звертаючись до основної проблеми даних. 3В даних – об’єм, швидкість та різноманітність – були постійною проблемою. Галузь зробила деякий прогрес у подоланні проблем з об’ємом та швидкістю. Однак різноманітність даних залишається значною перешкодою, оскільки поширення нових систем та застосунків призвело до зростання різноманітності даних та форматів.

Підхід Nexla полягає в тому, щоб автоматично моделювати та підключати дані з різних джерел до узгодженого, упакованого об’єкта, даних продукту, який ми називаємо Nexset. Це дозволяє користувачам отримувати доступ та працювати з даними без необхідності розуміти основну складність різних джерел даних та структур. Nexset діє як шлюз, забезпечуючи простий та прямий інтерфейс до даних.

Це важливо для сучасних підприємств, оскільки це дозволяє більшій кількості людей, а не лише інженерам даних, використовувати дані у своїй щоденній роботі. Абстрагуючи різноманітність та складність даних, Nexsets робить можливим для бізнес-користувачів, аналітиків та інших безпосередньо взаємодіяти з необхідними даними без потреби у великих технічних знаннях.

Ми також працюємо над тим, щоб зробити інтеграцію легкою для використання для менш технічних споживачів даних – від інтерфейсу користувача та того, як люди співпрацюють та керують даними, до того, як вони створюють трансформації та робочі процеси. Абстрагування складності різноманітності даних є ключем до демократизації доступу до даних та надання можливості широкому колу користувачів отримувати користь від своїх інформаційних активів. Це критична здатність для сучасних підприємств, які прагнуть стати більш орієнтованими на дані та використовувати дані-підтримувані інсайти по всій організації.

Що робить дані “готовими до генерації штучного інтелекту”, і як Nexla ефективно звертається до цих вимог?

Відповідь частково залежить від того, як ви використовуєте генерацію штучного інтелекту. Більшість компаній реалізують генерацію штучного інтелекту з підтримкою пошуку (RAG). Це вимагає попередньої підготовки та кодування даних для завантаження у векторну базу даних, а потім отримання даних через пошук для додавання до будь-якого контексту як вхідних даних для великої мови моделі (LLM), яка не була навчена за допомогою цих даних. Тому дані потрібно підготувати таким чином, щоб вони працювали добре як для векторних пошуків, так і для LLM.

Відповідь частково залежить від того, як ви використовуєте генерацію штучного інтелекту. Більшість компаній реалізують генерацію штучного інтелекту з підтримкою пошуку (RAG). Це вимагає попередньої підготовки та кодування даних для завантаження у векторну базу даних, а потім отримання даних через пошук для додавання до будь-якого контексту як вхідних даних для великої мови моделі (LLM), яка не була навчена за допомогою цих даних. Тому дані потрібно підготувати таким чином, щоб вони працювали добре як для векторних пошуків, так і для LLM.

Незалежно від того, чи використовуєте ви RAG, генерацію штучного інтелекту з підтримкою навчання (RAFT) чи здійснюєте навчання моделі, існують кілька ключових вимог:

  • Формат даних: генерація штучного інтелекту LLM часто працює найкраще з даними у певному форматі. Дані потрібно структурувати таким чином, щоб моделі могли легко приймати та обробляти їх. Вони також повинні бути “порціонованими” таким чином, щоб допомогти LLM краще використовувати дані.
  • З’єднання: генерація штучного інтелекту LLM потребує δυναмічного доступу до відповідних джерел даних, а не залежності від статичних наборів даних. Це вимагає постійного з’єднання з різними корпоративними системами та репозиторіями даних.
  • Безпека та керування: при використанні чутливих корпоративних даних критично важливо мати надійні засоби безпеки та керування. Доступ та використання даних повинні бути безпечними та відповідати існуючим корпоративним політикам. Також потрібно керувати даними, використаними LLM, щоб допомогти запобігти порушенням даних.
  • Масштабованість: генерація штучного інтелекту LLM може бути інтенсивною щодо даних та обчислень, тому базова інфраструктура даних повинна бути能够 масштабуватися для задоволення вимог цих моделей.

Nexla звертається до цих вимог щодо генерації штучного інтелекту наступними способами:

  • Динамічний доступ до даних: платформа інтеграції даних Nexla забезпечує єдиний спосіб підключення до сотень джерел та використовує різні стилі інтеграції та швидкості даних, а також оркестрування, щоб забезпечити генерації штучного інтелекту LLM найбільш актуальні дані, коли вони їм потрібні, а не залежати від статичних наборів даних.
  • Підготовка даних: Nexla має можливість витягувати, перетворювати та готувати дані у форматах, оптимізованих для кожного випадку використання генерації штучного інтелекту, включаючи вбудоване порціонування даних та підтримку кількох моделей кодування.
  • Самостійна служба та співпраця: з Nexla користувачі даних не лише отримують доступ до даних самостійно та створюють Nexsets та потоки. Вони також можуть співпрацювати та ділитися своєю роботою через ринок, який забезпечує правильний формат даних та покращує продуктивність за рахунок повторного використання.
  • Автоматичне генерування: інтеграція та генерація штучного інтелекту обидві складні. Nexla автоматично генерує багато кроків, необхідних на основі вибору користувачем – за допомогою штучного інтелекту та інших технік – щоб користувачі могли виконувати роботу самостійно.
  • Керування та безпека: Nexla включає надійні засоби безпеки та керування на всіх етапах, включаючи співпрацю, щоб забезпечити, що чутливі корпоративні дані доступні та використовуються у безпечній та відповідній манері.
  • Масштабованість: платформа Nexla розроблена для масштабування для задоволення вимог генерації штучного інтелекту, забезпечуючи необхідну обчислювальну потужність та еластичну масштабованість.

З’єднана інтеграція, самостійна служба та співпраця, автоматичне генерування та керування даними потрібно будувати разом, щоб зробити демократизацію даних можливою.

Як різні типи та джерела даних внесок у успіх генерації штучного інтелекту, і яка роль грає Nexla у спрощенні процесу інтеграції?

Генерація штучного інтелекту потребує доступу до всіх видів інформації, щоб надати найкращі інсайти та генерувати відповідні виходи. Якщо ви не надасте цю інформацію, не очікуйте хороші результати. Це так само, як і з людьми.

Генерація штучного інтелекту потребує навчання на широкому спектрі даних, від структурованих баз даних до неструктурованих документів, для побудови всебічного розуміння світу. Різні джерела даних, такі як статті новин, фінансові звіти та взаємодії клієнтів, забезпечують цінну контекстну інформацію, яку ці моделі можуть використати. Виставлення генерації штучного інтелекту до різноманітних даних також дозволяє цим моделям стати більш гнучкими та адаптивними, дозволяючи їм обробляти ширший спектр запитів та завдань.

Nexla абстрагує різноманітність усіх цих даних за допомогою Nexsets та робить легко отримувати доступ майже до будь-якого джерела, а потім витягувати, перетворювати, оркеструвати та завантажувати дані, щоб користувачі даних могли зосередитися лише на даних та робили їх готовими до генерації штучного інтелекту.

Які тенденції формують екосистему даних у 2025 році та далі, особливо з ростом генерації штучного інтелекту?

Компанії в основному зосереджувалися на використанні генерації штучного інтелекту для створення помічників або копілотів, щоб допомогти людям знайти відповіді та приймати рішення. Агентний штучний інтелект, агенти, які автоматизують завдання без участі людей, є безумовно зростаючою тенденцією, коли ми рухаємося у 2025 рік. Агенти, як і копілоти, потребують інтеграції, щоб забезпечити, що дані течуть безперебійно – не лише в одному напрямку, але й у можливості штучного інтелекту діяти на основі цих даних.

Інша основна тенденція для 2025 року – зростання складності систем штучного інтелекту. Ці системи стають більш складними шляхом поєднання компонентів з різних джерел для створення цілісних рішень. Це схоже на те, як люди використовують різні інструменти протягом дня для виконання завдань. Емпаверіровані системи штучного інтелекту будуть слідувати цьому підходу, оркеструючи кілька інструментів та компонентів. Це оркестрування представляє значний виклик, але також ключову область розвитку.

З точки зору тенденцій ми бачимо рух до генерації штучного інтелекту, який просунувся за межі простого збігання шаблонів до справжнього розуміння. Є багато технологічного прогресу в цьому просторі. Хоча ці досягнення можуть не повністю трансформуватися у комерційну цінність у 2025 році, вони представляють напрямок, у якому ми рухаємося.

Інша ключова тенденція – зростання застосування прискорених технологій для інференсу штучного інтелекту, особливо з компаніями, такими як Nvidia. Традиційно GPU використовувалися в основному для навчання моделей штучного інтелекту, але виконання інференсу на час виконання – точка, у якій модель активно використовується – стає рівно важливим. Ми можемо очікувати вдосконалення інференсу, що робить його більш ефективним та впливаючим.

Крім того, є усвідомлення того, що доступні дані для навчання були в основному максимально використані. Це означає, що подальші поліпшення моделей не прийдуть від додавання більше даних під час навчання, а від того, як моделі працюють під час інференсу. На етапі виконання моделі використання нових даних для поліпшення результатів моделі стає критично важливим.

Хоча деякі технології починають досягати своїх меж, нові підходи продовжують з’являтися, в кінцевому підсумку підкреслюючи важливість гнучкості для організацій, які приймають штучний інтелект. Що працює добре сьогодні, може стати застарілим протягом шести місяців або року, тому важливо бути готовим додати або замінити джерела даних та будь-які компоненти ваших потоків штучного інтелекту. Залишатися адаптивними та відкритими до змін є критично важливим для того, щоб слідувати за швидко змінюється ландшафтом.

Які стратегії можуть прийняти організації, щоб розібрати дані-силоси та покращити потік даних по всім своїм системам?

По-перше, люди повинні визнати, що дані-силоси завжди будуть існувати. Це завжди було так. Багато організацій намагаються централізувати всі свої дані в одному місці, вважаючи, що це створить ідеальну установку та розблокує значну цінність, але це виявляється майже неможливим. Це часто перетворюється на тривалий, дорогий, багаторічний проєкт, особливо для великих підприємств.

Тому реальність така, що дані-силоси залишаються. Як тільки ми це визнаємо, питання стає: Як ми можемо працювати з даними-силосами більш ефективно?

Корисна аналогія – подумати про великі компанії. Жодна велика корпорація не працює з одного офісу, де всі працюють разом по всьому світу. Замість цього вони діляться на штаб-квартиру та кілька офісів. Метою не є опиратися цьому природному розмежуванню, а забезпечити, щоб ці офіси могли співпрацювати ефективно. Тому ми інвестуємо в інструменти продуктивності, такі як Zoom або Slack, щоб зв’язати людей та забезпечити безперебійні робочі процеси між місцями.

Аналогічно, дані-силоси – це фрагментовані системи, які завжди існуватимуть у командах, підрозділах або інших межах. Ключ не полягає в тому, щоб їх ліквідувати, а в тому, щоб зробити їх працювати разом безперешкодно. Знаючи це, ми можемо зосередитися на технологіях, які полегшують ці з’єднання.

Наприклад, технології, такі як Nexsets, забезпечують спільний інтерфейс або абстрактний шар, який працює з різними джерелами даних. Діяючи як шлюз до даних-силосів, вони спрощують процес взаємодії з даними, розкиданими по різних силосах. Це створює ефективність та мінімізує негативні впливи силосів.

По суті, стратегія повинна полягати в тому, щоб поліпшити співпрацю між силосами, а не намагатися боротися з ними. Багато підприємств роблять помилку, намагаючись консолідувати все у велике озеро даних. Але, якщо бути чесним, це майже неможлива битва.

Як сучасні платформи даних обробляють виклики, такі як швидкість та масштабованість, і що відрізняє Nexla від інших у зверненні до цих питань?

Як я бачу це, багато інструментів у сучасному стеку даних спочатку були розроблені з акцентом на легкості використання та швидкості розробки, що виникло з універсальності інструментів – наданням можливості маркетинговим аналітикам перемістити дані з маркетингової платформи безпосередньо у візуалізаційний інструмент, наприклад.

Еволюція цих інструментів часто включала розвиток розв’язків для окремих завдань, або інструментів, призначених для вирішення вузьких задач. Коли ми говоримо про масштабованість, люди часто думають про масштабування в термінах обробки більших об’ємів даних. Однак справжній виклик масштабування складається з двох основних факторів: зростаючої кількості людей, які повинні працювати з даними, та зростаючої різноманітності систем та типів даних, які організації повинні керувати.

Сучасні інструменти, будучи високоспеціалізованими, схильні вирішувати лише підмножину цих завдань. В результаті організації закінчують тим, що використовують кілька інструментів, кожен з яких вирішує окрему проблему, що в кінцевому підсумку створює свої власні проблеми, такі як перевантаження інструментами та неефективність.

Nexla звертається до цього питання, знаходячи баланс між легкістю використання та гнучкістю. З одного боку, ми забезпечуємо простоту за допомогою функцій, таких як шаблони та інтуїтивно зрозумілі інтерфейси. З іншого боку, ми пропонуємо гнучкість та можливості, дружні до розробників, які дозволяють командам продовжувати покращувати платформу. Розробники можуть додавати нові можливості до системи, але ці покращення залишаються доступними як прості кнопки та кліки для неквалифікованих користувачів. Цей підхід уникнув пастки надмірної спеціалізації інструментів, забезпечуючи широкий спектр функцій рівня підприємства.

Що真正ньо відрізняє Nexla – це її здатність поєднувати легкість використання з масштабованістю та шириною, необхідними організаціями. Наша платформа з’єднує ці два світи безперешкодно, дозволяючи командам працювати ефективно без компромісу щодо потужності чи гнучкості.

Одна з основних сильних сторін Nexla полягає в її абстрактній архітектурі. Наприклад, хоча користувачі можуть візуально проектувати конвеєр даних, спосіб виконання цього конвеєра є високоадаптивним. В залежності від вимог користувача – таких як джерело, пункт призначення чи те, чи потрібно обробляти дані в режимі реального часу – платформа автоматично відображає конвеєр на один із шести різних двигунів. Це забезпечує оптимальну продуктивність без необхідності ручного керування цими складностями.

Платформа також слабо пов’язана, тобто джерельні системи та системи призначення відокремлені. Це дозволяє користувачам легко додавати більше пунктів призначення до існуючих джерел, додавати більше джерел до існуючих пунктів призначення та забезпечувати двонаправлені інтеграції між системами.

Важливо, що Nexla абстрагує проектування конвеєрів, щоб користувачі могли обробляти пакетні дані, потокові дані та дані в режимі реального часу без зміни своїх робочих процесів чи проектування. Платформа автоматично адаптується до цих потреб, роблячи його легшим для користувачів працювати з даними у будь-якому форматі чи швидкості. Це більше про вдумливе проектування, ніж про конкретну мову програмування, забезпечуючи безперешкодний досвід.

Все це показує, що ми побудували Nexla з оглядом на кінцевого споживача даних. Багато традиційних інструментів були розроблені для тих, хто створює дані або керує системами, але ми зосередилися на потребах споживачів даних, які хочуть послідовних та простих інтерфейсів для доступу до даних, незалежно від джерела. Приоритет досвіду споживача дозволив нам розробити платформу, яка спрощує доступ до даних, зберігаючи при цьому гнучкість, необхідну для підтримки різних випадків використання.

Чи можете ви поділитися прикладами того, як функції без коду та з низьким кодом змінили інженерію даних для ваших клієнтів?

Функції без коду та з низьким кодом перетворили процес інженерії даних на真正ньо колаборативний досвід для користувачів. Наприклад, раніше команда облікових операцій DoorDash , яка керує даними для торговців, повинна була надавати вимоги інженерній команді. Інженери потім будували рішення, що призводило до ітеративного процесу, який займав багато часу.

Тепер, завдяки інструментам без коду та з низьким кодом, ця динаміка змінилася. Команда щоденних операцій може використовувати інтерфейс з низьким кодом для виконання завдань самостійно. Тим часом інженерна команда може швидко додавати нові функції та можливості через той же інтерфейс з низьким кодом, дозволяючи негайно оновлювати. Команда щоденних операцій може потім безперешкодно використовувати ці функції без затримок.

Цей зсув перетворив процес на колаборативний досвід, а не творчу瓶ячку, що призвело до значних заощаджень часу. Клієнти повідомили, що завдання, які раніше займали два-три місяці, тепер можуть бути виконані менш ніж за два тижні – поліпшення швидкості на 5-10 разів.

Як роль інженерії даних еволюціонує, особливо з зростанням прийняття штучного інтелекту?

Інженерія даних еволюціонує швидко, підштовхувана автоматизацією та прогресом, таким як генерація штучного інтелекту. Багато аспектів галузі, таких як генерація коду та створення конекторів, стають швидшими та більш ефективними. Наприклад, з генерацією штучного інтелекту темп, за яким конектори можуть бути створені, протестовані та розгорнуті, значно покращився. Однак цей прогрес також вводить нові виклики, включаючи зростаючу складність, проблеми безпеки та необхідність надійного керування.

Одним із нагальних проблем є потенційний неправильний використовування корпоративних даних. Бізнеси турбуються про те, що їхні власні дані можуть бути використані для навчання моделей штучного інтелекту та втрати конкурентної переваги або порушення даних, коли дані будуть передані іншим.

Ростом складності систем та об’ємом даних інженери даних повинні прийняти більш широкий погляд, зосереджуючись на загальних системних питаннях, таких як безпека, керування та забезпечення цілісності даних. Ці виклики не можуть бути вирішені лише штучним інтелектом.

Хоча генерація штучного інтелекту може автоматизувати нижньорівневі завдання, роль інженерії даних зміщується у бік оркестрування ширшої екосистеми. Інженери даних тепер діють як диригенти, керуючи численними взаємопов’язаними компонентами та процесами, такими як налаштування захисних механізмів для запобігання помилкам або несанкціонованому доступу, забезпечення відповідності стандартам керування та моніторинг того, як виводи, згенеровані штучним інтелектом, використовуються у бізнес-рішеннях.

Помилки та помилки в цих системах можуть бути дорогими. Наприклад, системи штучного інтелекту можуть витягувати застарілі дані політики, що призводить до неправильних відповідей, таких як обіцянка клієнту повернути гроші, коли це не дозволено. Ці типи питань вимагають суворого нагляду та добре визначених процесів для виявлення та усунення цих помилок, перш ніж вони вплинуть на бізнес.

Інша ключова відповідальність інженерних команд даних полягає в адаптації до зсуву користувачів. Інструменти штучного інтелекту більше не обмежуються лише аналітиками чи технічними користувачами, які можуть поставити під сумнів валідність звітів та даних. Ці інструменти тепер використовуються особами на краях організації, такими як агенти служби підтримки клієнтів, які можуть не мати експертизи, щоб поставити під сумнів неправильні виводи. Ця ширша демократизація технологій збільшує відповідальність інженерних команд даних за забезпечення точності та надійності даних.

Які нові функції чи вдосконалення можна очікувати від Nexla, оскільки галузь інженерії даних продовжує розвиватися?

Ми зосереджуємося на кількох вдосконаленнях для звернення до нових викликів та можливостей, оскільки інженерія даних продовжує еволюціонувати. Одним із них є рішення, кероване штучим інтелектом, для звернення до різноманітності даних. Одна з основних проблем інженерії даних полягає в керуванні різноманітністю даних з різних джерел, тому ми використовуємо штучний інтелект для спрощення цього процесу. Наприклад, коли отримання даних від сотень різних торговців, система може автоматично відображати їх у стандартну структуру. Сьогодні цей процес часто вимагає значного людського втручання, але можливості Nexla, керованої штучим інтелектом, спрямовані на мінімізацію ручної праці та підвищення ефективності.

Ми також просунуємо нашу технологію конекторів для підтримки наступного покоління робочих процесів даних, включаючи можливість легко генерувати нових агентів. Ці агенти дозволяють безперешкодне підключення до нових систем та виконання конкретних дій у цих системах. Це особливо актуально для зростаючих потреб користувачів генерації штучного інтелекту та спрощення інтеграції та взаємодії з різними платформами.

Третім, ми продовжимо інновації щодо покращення моніторингу та забезпечення якості. По мірі того, як більше користувачів споживають дані по різних системах, важливість моніторингу та забезпечення якості даних значно зросла. Наша мета – забезпечити надійні інструменти для моніторингу систем та забезпечення якості, щоб дані залишалися надійними та дієвими навіть при зростанні використання.

Нарешті, Nexla також робить кроки для відкриття частини своїх основних можливостей. Ідея полягає в тому, що, поділившись нашою технологією з ширшою спільнотою, ми можемо надати можливість більшій кількості людей скористатися вдосконаленими інструментами інженерії даних та рішеннями, що в кінцевому підсумку відображає нашу приверженість сприянню інноваціям та співробітництву в галузі.

Дякуємо за великі відповіді, читачам, які бажають дізнатися більше, слід відвідати Nexla.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.