Интервью

Сакет Саурабх, генеральный директор и сооснователь Nexla – Интервью

mm
Добавьте Unite.AI в избранные источники в Google

Сакет Саурабх, генеральный директор и сооснователь Nexla, – предприниматель с глубокой страстью к данным и инфраструктуре. Он возглавляет разработку платформы следующего поколения для автоматизированной инженерии данных, предназначенной для обеспечения масштабируемости и скорости для тех, кто работает с данными.

Ранее Саурабх основал успешный мобильный стартап, который достиг значительных вех, включая приобретение, первичное публичное предложение и рост в многомиллионный бизнес. Он также внес вклад в несколько инновационных продуктов и технологий во время своего пребывания в Nvidia (NVDA ).

Nexla позволяет автоматизировать инженерию данных, чтобы данные были готовы к использованию. Это достигается благодаря уникальному подходу к Nexsets – данным продуктам, которые делают легко интегрировать, преобразовывать, доставлять и контролировать данные.

Что вдохновило вас на создание Nexla, и как ваш опыт в инженерии данных сформировал ваше видение компании?

 До основания Nexla я начал свою карьеру в инженерии данных в Nvidia, где я занимался разработкой высокомасштабируемых, высококлассных технологий на стороне вычислений. После этого я прошел через процесс приобретения и первичного публичного предложения в области мобильной рекламы, где большие объемы данных и машинное обучение были ключевой частью нашей деятельности, обрабатывая около 300 миллиардов записей данных каждый день.

Анализируя ландшафт в 2015 году после того, как моя предыдущая компания вышла на биржу, я искал следующий большой вызов, который меня вдохновлял. Придя из этих двух областей, было rõчно, что проблемы с данными и вычислениями сходятся, поскольку отрасль движется к более продвинутым приложениям, работающим на данных и ИИ.

Хотя мы не знали в то время, что Генеративный ИИ (GenAI) прогрессирует так быстро, как он имеет, было очевидно, что машинное обучение и ИИ будут основой для использования данных. Итак, я начал думать о том, какой инфраструктуры необходим людям, чтобы быть успешными в работе с данными, и как мы можем сделать возможным для любого, не только для инженеров, использовать данные в своей повседневной профессиональной деятельности.

Это привело к видению Nexla – упростить и автоматизировать инженерию данных, поскольку инженерия данных была очень индивидуальным решением внутри большинства компаний, особенно при работе с сложными или крупномасштабными проблемами данных. Целью было сделать данные доступными и понятными для более широкого круга пользователей, не только для инженеров по данным. Мой опыт в построении масштабируемых систем и приложений данных подогрел это видение демократизации доступа к данным посредством автоматизации и упрощения.

Как Nexsets воплощают миссию Nexla по подготовке данных для всех, и почему это инновация так важна для современных предприятий?

Nexsets воплощают миссию Nexla по подготовке данных для всех, решая основную проблему данных. 3V данных – объем, скорость и разнообразие – были постоянной проблемой. Отрасль сделала некоторый прогресс в решении проблем с объемом и скоростью. Однако разнообразие данных осталось значительной проблемой, поскольку распространение новых систем и приложений привело к все возрастающему разнообразию в структурах и форматах данных.

Подход Nexla заключается в автоматическом моделировании и подключении данных из различных источников в последовательную, упаковую сущность, данный продукт, который мы называем Nexset. Это позволяет пользователям получить доступ и работать с данными без необходимости понимать основную сложность различных источников и структур данных. Nexset действует как шлюз, предоставляя простой и прямой интерфейс к данным.

Это важно для современных предприятий, поскольку оно позволяет большему количеству людей, не только инженерам по данным, использовать данные в своей повседневной работе. Абстрагируя разнообразие и сложность данных, Nexsets делает возможным для бизнес-пользователей, аналитиков и других напрямую взаимодействовать с необходимыми им данными без необходимости обширных технических знаний.

Мы также работали над тем, чтобы сделать интеграцию простой в использовании для менее технических потребителей данных – от пользовательского интерфейса и того, как люди сотрудничают и управляют данными, до того, как они строят преобразования и рабочие процессы. Абстрагирование сложности разнообразия данных является ключом к демократизации доступа к данным и расширению возможностей более широкого круга пользователей для получения ценности из своих информационных активов. Это важная способность для современных предприятий, стремящихся стать более ориентированными на данные и использовать данные, управляемые идеями, на протяжении всей организации.

Что делает данные “готовыми к GenAI”, и как Nexla эффективно решает эти требования?

Ответ частично зависит от того, как вы используете GenAI. Большинство компаний реализуют GenAI с помощью технологии Retrieval Augmented Generation (RAG). Для этого необходимо сначала подготовить и закодировать данные для загрузки в векторную базу данных, а затем извлечь данные через поиск в качестве контекста для входных данных в большую языковую модель (LLM), которая не была обучена с использованием этих данных. Итак, данные необходимо подготовить таким образом, чтобы они хорошо работали как для векторных поисков, так и для LLM.

Независимо от того, используете ли вы RAG, Retrieval Augmented Fine-Tuning (RAFT) или обучение модели, есть несколько ключевых требований:

  • Формат данных: GenAI LLM часто работает лучше всего с данными в определенном формате. Данные необходимо структурировать так, чтобы модели могли легко их принять и обработать. Они также должны быть “разбитыми” так, чтобы LLM лучше использовал данные.
  • Соединение: GenAI LLM необходимо динамически получить доступ к соответствующим источникам данных, а не полагаться на статические наборы данных. Это требует постоянного соединения с различными системами и репозиториями данных предприятия.
  • Безопасность и управление: При использовании чувствительных данных предприятия важно иметь надежные меры безопасности и управления. Доступ и использование данных должны быть безопасными и соответствовать существующим политикам организации. Также необходимо управлять данными, используемыми LLM, чтобы помочь предотвратить утечки данных.
  • Масштабируемость: GenAI LLM может быть интенсивным для данных и вычислений, поэтому основная инфраструктура данных должна быть способна масштабироваться для удовлетворения требований этих моделей.

Nexla решает эти требования для подготовки данных к GenAI несколькими ключевыми способами:

  • Динамический доступ к данным: Платформа интеграции данных Nexla предоставляет единый способ подключения к сотням источников и использует различные стили интеграции и скорость данных, а также оркестрацию, чтобы предоставить GenAI LLM наиболее recentные данные, когда они необходимы, а не полагаться на статические наборы данных.
  • Подготовка данных: Nexla имеет возможность извлекать, преобразовывать и готовить данные в форматах, оптимизированных для каждого случая использования GenAI, включая встроенную разбивку данных и поддержку нескольких моделей кодирования.
  • Самостоятельная служба и сотрудничество: С Nexla потребители данных не только получают доступ к данным самостоятельно и строят Nexsets и потоки. Они также могут сотрудничать и делиться своей работой через рынок, который обеспечивает, что данные находятся в правильном формате и улучшает производительность за счет повторного использования.
  • Автоматическая генерация: Интеграция и GenAI обе являются сложными. Nexla автоматически генерирует многие шаги, необходимые на основе выбора потребителя данных – используя ИИ и другие методы – так, чтобы пользователи могли выполнять работу самостоятельно.
  • Управление и безопасность: Nexla включает в себя надежные меры безопасности и управления на протяжении всего процесса, включая сотрудничество, чтобы обеспечить, что чувствительные данные предприятия получаются и используются в безопасной и соответствующей манере.
  • Масштабируемость: Платформа Nexla предназначена для масштабирования для удовлетворения требований рабочих нагрузок GenAI, предоставляя необходимую вычислительную мощность и эластичное масштабирование.

Совмещенная интеграция, самостоятельная служба и сотрудничество, автоматическая генерация и управление данными необходимо построить вместе, чтобы сделать возможным демократизацию данных.

Как разнообразные типы и источники данных способствуют успеху моделей GenAI, и какая роль Nexla играет в упрощении процесса интеграции?

Модели GenAI нуждаются в доступе ко всем видам информации, чтобы предоставить лучшие идеи и сгенерировать актуальные выводы. Если вы не предоставите эту информацию, вы не должны ожидать хороших результатов. Это похоже на людей.

Модели GenAI необходимо обучать на широком спектре данных, от структурированных баз данных до неструктурированных документов, чтобы построить всестороннее понимание мира. Различные источники данных, такие как новостные статьи, финансовые отчеты и взаимодействия с клиентами, предоставляют ценные контекстные сведения, которые эти модели могут использовать. Воздействие на разнообразные данные также позволяет моделям GenAI стать более гибкими и адаптируемыми, что позволяет им обрабатывать более широкий спектр запросов и задач.

Nexla абстрагирует разнообразие всех этих данных с помощью Nexsets и делает легко получить доступ почти к любому источнику, а затем извлечь, преобразовать, оркестрировать и загрузить данные, чтобы потребители данных могли сосредоточиться только на данных и сделать их готовыми к GenAI.

Какие тенденции формируют экосистему данных в 2025 году и далее, особенно с ростом GenAI?

Компании в основном были сосредоточены на использовании GenAI для построения помощников или копилотов, чтобы помочь людям найти ответы и принимать лучшие решения. Агентный ИИ, агенты, которые автоматизируют задачи без участия людей, определенно является растущей тенденцией, когда мы движемся в 2025 год. Агенты, как и копилоты, нуждаются в интеграции, чтобы обеспечить, что данные текут бесшовно – не только в одном направлении, но и в ermögлении ИИ действовать на этих данных.

Другой значительной тенденцией для 2025 года является растущая сложность систем ИИ. Эти системы становятся более сложными, сочетая компоненты из различных источников для создания целостных решений. Это похоже на то, как люди полагаются на различные инструменты на протяжении дня, чтобы выполнить задачи. Системы ИИ будут следовать этому подходу, оркестрируя несколько инструментов и компонентов. Это представляет значительную проблему, но также является ключевой областью разработки.

С точки зрения тенденций мы видим толчок к генеративному ИИ, продвигающемуся за пределы простого сопоставления с образцами к фактическому рассуждению. Там происходит много технологического прогресса в этой области. Хотя эти достижения могут не полностью перевестись в коммерческую ценность в 2025 году, они представляют направление, в котором мы движемся.

Другой ключевой тенденцией является растущее применение ускоренных технологий для вывода ИИ, особенно с компаниями, такими как Nvidia. Традиционно GPU были сильно использованы для обучения моделей ИИ, но вывод на выполнение – точка, где модель активно используется – становится все более важной. Мы можем ожидать достижений в оптимизации вывода, что делает его более эффективным и воздействующим.

Кроме того, есть осознание того, что доступные данные для обучения в значительной степени были максимально использованы. Это означает, что дальнейшие улучшения моделей не будут получены из добавления большего количества данных во время обучения, а из того, как модели работают во время вывода. Во время выполнения использования новых сведений для улучшения результатов моделей становится критической фокусировкой.

Хотя некоторые интересные технологии начинают достигать своих пределов, новые подходы будут продолжать возникать, в конечном итоге подчеркивая важность гибкости для организаций, принимающих ИИ. То, что работает хорошо сегодня, может стать устаревшим в течение шести месяцев или года, поэтому важно быть готовым добавлять или заменять источники данных и любые компоненты ваших конвейеров ИИ. Оставаться адаптивным и открытым для изменений является критически важным для поддержания темпа с быстро развивающимся ландшафтом.

Какие стратегии могут принять организации, чтобы разрушить данные-силосы и улучшить поток данных по всей своей системе?

Сначала люди должны признать, что данные-силосы всегда будут существовать. Это всегда было так. Многие организации пытаются централизовать все свои данные в одном месте, считая, что это создаст идеальную обстановку и разблокирует значительную ценность, но это оказывается почти невозможным. Это часто превращается в длительное, дорогое, многолетнее начинание, особенно для крупных предприятий.

Итак, реальность заключается в том, что данные-силосы остаются. Как только мы признаем это, вопрос становится: Как мы можем работать с данными-силосами более эффективно?

Полезная аналогия заключается в том, чтобы подумать о крупных компаниях. Никакая значительная корпорация не работает из одного офиса, где все работают вместе во всем мире. Вместо этого они разделяются на штаб-квартиру и несколько офисов. Цель не состоит в том, чтобы сопротивляться этому естественному разделению, а в том, чтобы обеспечить, что эти офисы могут сотрудничать эффективно. Это то, почему мы инвестируем в инструменты производительности, такие как Zoom или Slack, чтобы соединить людей и обеспечить бесшовные рабочие процессы по всей территории.

Аналогично, данные-силосы являются фрагментированными системами, которые всегда будут существовать на протяжении команд, отделов или других границ. Ключевым моментом является не устранение их, а то, чтобы сделать их работу вместе гладкой. Зная это, мы можем сосредоточиться на технологиях, которые облегчают эти связи.

Например, технологии, такие как Nexsets, предоставляют общий интерфейс или уровень абстракции, который работает на различных источниках данных. Действуя как шлюз к данным-силосам, они упрощают процесс взаимодействия с данными, разбросанными по различным силосам. Это создает эффективность и минимизирует негативные последствия силосов.

По сути, стратегия должна заключаться в улучшении сотрудничества между силосами, а не в попытке бороться с ними. Многие предприятия совершают ошибку, пытаясь консолидировать все в огромное озеро данных. Но, честно говоря, это почти невозможная битва, которую можно выиграть.

Как современные платформы данных решают проблемы, такие как скорость и масштабируемость, и что отличает Nexla в решении этих вопросов?

Так, как я вижу, многие инструменты в современном стеке данных изначально были разработаны с фокусом на легкости использования и скорости разработки, что произошло из-за того, что эти инструменты стали более доступными – позволяя маркетинговым аналитикам переместить свои данные из маркетинговой платформы напрямую в инструмент визуализации, например. Эволюция этих инструментов часто включала разработку решений для конкретных, узких проблем.

Когда мы говорим о масштабируемости, люди часто думают о масштабировании в терминах обработки более крупных объемов данных. Но реальная проблема масштабируемости заключается в двух основных факторах: растущем количестве людей, которым необходимо работать с данными, и растущем разнообразии систем и типов данных, которые организации должны управлять.

Современные инструменты, будучи высокоспециализированными, как правило, решают только небольшую часть этих проблем. В результате организации используют множество инструментов, каждый из которых решает отдельную проблему, что в конечном итоге создает свои собственные проблемы, такие как перегрузка инструментами и неэффективность.

Nexla решает эту проблему, балансируя между простотой использования и гибкостью. С одной стороны, мы предоставляем простоту через функции, такие как шаблоны и пользовательские интерфейсы. С другой стороны, мы предлагаем гибкость и возможности для разработчиков, которые позволяют командам постоянно улучшать платформу. Разработчики могут добавлять новые возможности в систему, но эти улучшения остаются доступными как простые кнопки и клики для непрофессиональных пользователей. Этот подход избегает ловушки чрезмерно специализированных инструментов, обеспечивая широкий спектр функций класса предприятия.

Что действительно отличает Nexla, так это ее способность объединить простоту использования с масштабируемостью и широтой, необходимыми организациям. Наша платформа соединяет эти два мира бесшовно, позволяя командам работать эффективно без компромисса в силе или гибкости.

Одна из основных сил Nexla заключается в ее абстрактной архитектуре. Например, хотя пользователи могут визуально проектировать конвейер данных, способ, которым этот конвейер выполняется, очень адаптивен. В зависимости от требований пользователя – таких как источник, назначение или необходимость данных в реальном времени – платформа автоматически сопоставляет конвейер с одним из шести различных двигателей. Это обеспечивает оптимальную производительность без необходимости ручного управления этими сложностями.

Платформа также слабо связана, что означает, что системы-источники и системы-назначения декуплированы. Это позволяет пользователям легко добавлять больше назначений к существующим источникам, добавлять больше источников к существующим назначениям и обеспечивать двусторонние интеграции между системами.

Важно, что Nexla абстрагирует проектирование конвейеров, чтобы пользователи могли обрабатывать пакетные данные, потоковые данные и данные в реальном времени без изменения своих рабочих процессов или проектов. Платформа автоматически адаптируется к этим потребностям, что делает проще для пользователей работать с данными в любом формате или скорости. Это больше связано с вдумчивым проектированием, чем с конкретными языками программирования, обеспечивая бесшовный опыт.

Все это показывает, что мы построили Nexla с учетом потребителя данных. Многие традиционные инструменты были разработаны для производителей данных или администраторов систем, но мы фокусируемся на потребностях потребителей данных, которые хотят последовательные и простые интерфейсы для доступа к данным, независимо от их источника. Приоритизация опыта потребителя позволила нам разработать платформу, которая упрощает доступ к данным, сохраняя при этом гибкость, необходимую для поддержки различных случаев использования.

Можете ли вы поделиться примерами того, как функции без кода и с низким кодом преобразовали инженерию данных для ваших клиентов?

Функции без кода и с низким кодом преобразовали процесс инженерии данных в真正е сотрудничество для пользователей. Например, ранее команда учетных операций DoorDash , которая управляет данными для продавцов, должна была предоставлять требования команде инженеров. Инженеры затем строили решения, что приводило к итеративному процессу, требующему много времени.

Теперь, с помощью инструментов без кода и с низким кодом, эта динамика изменилась. Команда ежедневных операций может использовать интерфейс с низким кодом для выполнения своих задач напрямую. Тем временем команда инженеров может быстро добавлять новые функции и возможности через тот же интерфейс с низким кодом, позволяя немедленно использовать эти функции. Команда операций может затем использовать эти функции без задержек.

Этот сдвиг превратил процесс в сотрудничество, а не в творческую блокаду, что привело к значительной экономии времени. Клиенты сообщили, что задачи, которые ранее занимали два-три месяца, теперь могут быть выполнены менее чем за две недели – улучшение скорости на 5-10 раз.

Как эволюционирует роль инженерии данных, особенно с растущим принятием ИИ?

Инженерия данных эволюционирует быстро, движимая автоматизацией и достижениями, такими как GenAI. Многие аспекты этой области, такие как генерация кода и создание соединителей, становятся быстрее и более эффективными. Например, с помощью GenAI темп, с которым могут быть сгенерированы, протестированы и развернуты соединители, значительно улучшился. Но этот прогресс также вводит новые проблемы, включая растущую сложность, проблемы безопасности и необходимость надежного управления.

Одной из насущных проблем является потенциальное неправильное использование данных предприятия. Бизнес беспокоится о том, что их проприетарные данные могут быть непреднамеренно использованы для обучения моделей ИИ и потерять свое конкурентное преимущество или столкнуться с утечкой данных, когда данные передаются другим. Растущая сложность систем и огромный объем данных требуют от команд инженерии данных принять более широкий взгляд, сосредоточившись на общесистемных проблемах, таких как безопасность, управление и обеспечение целостности данных. Эти проблемы не могут быть решены только с помощью ИИ.

Хотя генеративный ИИ может автоматизировать задачи более низкого уровня, роль инженерии данных смещается в сторону оркестровки более широкой экосистемы. Инженеры данных теперь действуют как дирижеры, управляя множеством взаимосвязанных компонентов и процессов, таких как настройка защитных мер, чтобы предотвратить ошибки или несанкционированный доступ, обеспечение соблюдения стандартов управления и мониторинг того, как выводы, сгенерированные ИИ, используются в бизнес-решениях.

Ошибки и ошибки в этих системах могут быть дорогостоящими. Например, системы ИИ могут извлечь устаревшую информацию о политике, что приводит к неправильным ответам, таким как обещание возврата денег клиенту, когда это не разрешено. Эти виды проблем требуют тщательного надзора и хорошо определенных процессов для их обнаружения и решения до того, как они повлияют на бизнес.

Другой ключевой ответственностью для команд инженерии данных является адаптация к сдвигу в демографии пользователей. Инструменты ИИ больше не ограничены аналитиками или техническими пользователями, которые могут поставить под сомнение действительность отчетов и данных. Эти инструменты теперь используются людьми на периферии организации, такими как агенты поддержки клиентов, которые могут не иметь экспертизы, чтобы оспорить неправильные выводы. Эта более широкая демократизация технологий увеличивает ответственность команд инженерии данных за обеспечение точности и надежности данных.

Какие новые функции или достижения можно ожидать от Nexla, когда область инженерии данных продолжает расти?

Мы фокусируемся на нескольких достижениях, чтобы решить возникающие проблемы и возможности, когда инженерия данных продолжает эволюционировать. Одним из них является решение, основанное на ИИ, для разнообразия данных. Одна из основных проблем в инженерии данных заключается в управлении разнообразием данных из различных источников, поэтому мы используем ИИ для упрощения этого процесса. Например, когда получаем данные от сотен различных продавцов, система может автоматически сопоставить их с стандартной структурой. Сегодня этот процесс часто требует значительного человеческого участия, но возможности Nexla, основанные на ИИ, направлены на минимизацию ручных усилий и повышение эффективности.

Мы также продвигаем вперед наше технологию соединителей, чтобы поддержать следующее поколение конвейеров данных, включая возможность легко генерировать новые агенты. Эти агенты позволяют пользователям выполнять конкретные действия в новых системах. Это особенно важно для растущих потребностей пользователей GenAI и для того, чтобы сделать более простым интеграцию и взаимодействие с различными платформами.

Третьим, мы продолжаем инновации в улучшенном мониторинге и обеспечении качества. Когда все больше пользователей потребляют данные по всей системе, важность мониторинга и обеспечения качества данных значительно возросла. Наша цель – предоставить надежные инструменты для мониторинга системы и обеспечения качества, чтобы данные оставались надежными и действенными, даже когда использование увеличивается.

Наконец, Nexla также предпринимает шаги по открытию некоторых наших основных возможностей. Мысли заключаются в том, что, поделившись нашей технологией с более широким сообществом, мы можем расширить возможности больше людей, чтобы воспользоваться передовыми инструментами и решениями в области инженерии данных, что в конечном итоге отражает нашу приверженность содействию инновациям и сотрудничеству в этой области.

Спасибо за отличные ответы, читатели, которые хотят узнать больше, должны посетить Nexla.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.