Интервью
Джей Мишра, операционный директор Astera Software – Интервью

Джей Мишра является операционным директором (COO) в Astera Software, быстро растущим поставщиком готовых решений для работы с данными. Они помогают пользователям бизнеса преодолеть разрыв между данными и информацией с помощью набора простых в использовании, но высокопроизводительных решений для извлечения данных, качества данных, интеграции данных, хранилищ данных и электронного обмена данными, которые используются как средними, так и компаниями Fortune 500 из различных отраслей.
Что изначально привлекло вас к информатике?
У меня всегда была глубокая страсть к математике, и мой путь в информатику был естественным продолжением этого. Мое высшее образование было в области математики и информатики, и это было логическим продолжением от мира математики к области информатики, что меня увлекло. Особенно меня заинтересовала сложная работа алгоритмов и продвинутых алгоритмических процессов, что привело меня к специализации в алгоритмах во время моего магистерского образования по информатике. С тех пор моя связь с информатикой остается сильной, и я постоянно стремлюсь быть в курсе последних разработок в этой области.
Вы сейчас являетесь операционным директором Astera, можете ли вы рассказать нам, чем вы занимаетесь в своей повседневной работе?
Как операционный директор Astera, моя роль многогранна, отражая динамическую природу нашей компании. Я работаю в Astera с момента ее основания, и мои обязанности охватывали различные области организации. Это включает в себя все, от активного участия в разработке и кодировании наших продуктов до обеспечения того, чтобы наши функции соответствовали меняющимся потребностям наших клиентов. Я тесно сотрудничаю с нашими клиентами, работая вместе с ними, чтобы усовершенствовать наши решения. Моя роль выходит за рамки просто разработки продукта и охватывает продажи и маркетинг, где мы выводим наши предложения на рынок.
Поскольку мы находимся в фазе роста, я взял на себя дополнительные обязанности, включая надзор за нашими целями дохода и стратегическое расширение нашего портфеля продуктов, чтобы охватить новые рынки. По сути, у меня есть роль почти во всех аспектах нашей деятельности, гарантируя, что мы не только строим исключительные продукты, но и успешно выводим их на рынок и достигаем наших бизнес-целей.
Для читателей, которые не знакомы с этим термином, что такое хранилище данных?
Хранилище данных – это архитектурный шаблон, используемый для консолидации всех корпоративных данных в централизованном репозитории, который будет служить основой для генерации различных типов аналитики, отчетов и панелей, которые будут представлять истинную картину того, где находится ваш бизнес, и также прогнозировать, как бизнес будет развиваться в будущем. Чтобы удовлетворить все это, вы объединяете данные определенным образом, и эта архитектура называется хранилищем данных.
Термин на самом деле взят из реального склада, где ваши продукты хранятся на организованных полках. Но когда вы переходите в мир данных, вы собираете данные из различных источников. Вы собираете данные из производства, вашего веб-сайта, клиентов, продаж, маркетинга, финансов и отдела кадров. Вы собираете все данные вместе, объединяете их в одно место, и это будет называться хранилищем данных и проектируется определенным образом, чтобы отчетность, особенно на основе временной шкалы, была легкой. Это основная цель хранилища данных.
Какие некоторые из ключевых тенденций в хранилищах данных сегодня?
Хранилища данных эволюционировали довольно сильно за последние 20-25 лет. Примерно decade назад мы стали свидетелями появления автоматизированных хранилищ данных, парадигмального сдвига, который ускорил процесс построения моделей данных и хранилищ данных. Недавно автоматизация заняла центральное место. Она решает повторяющуюся природу задач хранилищ данных, оптимизируя процессы для экономии времени и ресурсов.
Наш продукт, Astera Data Warehouse Builder, например, предлагает комплексный подход к автоматизации в хранилищах данных. Он охватывает все, от автоматизации конвейеров ETL (Извлечение, Преобразование, Загрузка) и моделирования данных до автоматической загрузки данных в структуры, такие как звездные схемы или хранилища данных. Кроме того, он эффективно поддерживает эти структуры через механизмы CDC (П 捕获 изменений). Этот всеобъемлющий автоматизм появился как ключевая тенденция в ландшафте хранилищ данных.
Кроме того, последняя тенденция – слияние хранилищ данных и искусственного интеллекта (ИИ). Конкретно, генеративный ИИ поднял автоматизацию на новые высоты. Он не только автоматизирует задачи, но и помогает пользователям в принятии решений.
Конфигурация компонентов хранилищ данных, конвейеров и точек принятия решений может быть руководствоваться ИИ, делая хранилища данных более мощными и эффективными, чем когда-либо прежде. По сути, это автоматизация на стероидах, и она преобразует ландшафт хранилищ данных. Пересечение между ИИ и хранилищами данных – это тенденция, которая несет огромный потенциал для будущего.
Какие четыре фундаментальных принципа, которые компании должны учитывать при разработке хранилища данных?
1. Определение четких целей
Важно начать с понимания того, что вам нужно от вашего хранилища данных. Избегайте распространенной ошибки сбора избыточных данных без четкой цели. Вместо этого определите конкретные цели, которых вы хотите достичь с помощью вашего хранилища данных. Какие отчеты и идеи вы ищете? Сосредоточившись на ваших целях, вы можете гарантировать, что вы собираете только те данные, которые актуальны, а не собираете огромное количество информации без разбора. Учитывая снижение затрат на хранение и вычислительную мощность, важно использовать эти ресурсы умно и этично.
2. Выбор правильного архитектурного шаблона
Архитектурные шаблоны очень важны. Они решают, будет ли ваше решение хранилища данных успешным или нет. Существует несколько вариантов, от стиля хранилища данных Inmon до схем звезд Kimball, а также новых шаблонов, таких как Data Vault и подход “один большой таблица”, пропагандируемый поставщиками баз данных columna. Не все шаблоны будут подходящими для каждой ситуации.
Мы видим, что в основном используется комбинация схемы звезды, расположенной над хранилищем данных. Итак, комбинация Data Vault и Star Schema все еще является наиболее широко используемым шаблоном. Но, как я сказал, для каждого требования или каждой ситуации будет другой ответ. Итак, запустите его через экспертов, посмотрите, какой архитектурный шаблон подходит для вашей ситуации.
3. Выбор правильных инструментов
Они очень важны и делают огромную разницу снова на время и ресурсы, необходимые для построения решения, а также на точность и качество вашего решения, которое определяется продуктами, которые вы будете использовать для построения и поддержки вашего хранилища данных. Обратите большое внимание на возможности продукта и посмотрите на продукты, которые могут объединить большинство требований под одной крышей. Существуют определенные области, такие как ETL (Извлечение, Преобразование, Загрузка), качество данных, моделирование данных, загрузка данных и публикация данных, которые играют значительную роль. Если вы попытаетесь использовать несколько продуктов для каждой из этих областей, это будет сложно. Итак, посмотрите на продукты, которые могут быть использованы для выполнения большинства, если не всех, различных компонентов.
4. Ваша команда
Последнее, но не менее важное – команда людей, которую вы собираете для построения вашего решения хранилища данных, является наиболее важной частью. Мы рекомендуем иметь кого-то с сильным опытом в архитектурных шаблонах данных. В плане состава команды межфункциональные команды – это лучший способ сделать это, где у вас есть смесь бизнес-пользователей и людей с некоторым программным опытом или, по крайней мере, опытом работы с данными, и имеется близкое сотрудничество между вашими хранителями данных, людьми, ответственным за данные, и, конечно, бизнесом. Создавая тесное сотрудничество между этими различными аспектами вашей организации, вы можете создать сплоченную и эффективную команду, ответственной за построение и поддержку вашего решения хранилища данных.
Успех в хранилищах данных зависит от достижения баланса между этими четырьмя принципами. Эти принципы, когда они тщательно соблюдены, оказались рецептом успеха в нашем опыте.
Почему компании нужен современный стек данных?
Это зависит от того, как мы определяем “современный” и это постоянно меняется, иногда по году, месяцу и даже по дню. Мы должны учитывать современные инструменты, разработанные с учетом меняющегося ландшафта данных. За последние несколько лет произошли значительные сдвиги в характере и объеме данных. Рост больших данных преобразовал ландшафт данных, с данными, поступающими из источников, таких как веб-сайты электронной коммерции, производственные базы данных и различные части вашего бизнеса. Эти данные меняются не только по объему, но и по своей природе.
Раньше данные были в основном структурированными, но теперь неструктурированные данные играют значительную роль. Кроме того, скорость, с которой данные генерируются и становятся доступными для использования, увеличилась. Учитывая эти изменения в данных, мы должны постоянно оценивать и адаптировать наш инструментарий, чтобы эффективно решать эти эволюционирующие проблемы данных.
Современный стек данных предназначен для обработки всех вариаций в структурах и скорости данных и хорошо оснащен для адаптации к возникающим архитектурным шаблонам, которые эволюционировали за последние несколько лет. Поэтому, если вы хотите сделать лучшее использование своих данных, вам нужно посмотреть на модернизацию своего стека данных. Это единственный способ оставаться в курсе новых проблем данных.
Мы видели, что компании придерживаются существующих решений, которые, кажется, работают. Важно признать, что сами данные по своей природе динамичны. Они постоянно эволюционируют, представляя новые проблемы и возможности. Существующие решения могут не быть оснащены для адаптации к этим изменениям. Поэтому, чтобы использовать весь потенциал своих данных, компании должны принять концепцию модернизации своего стека данных. Это не о том, чтобы разрушить то, что работает; это о том, чтобы оставаться гибкими и реагировать на эволюционирующую природу данных. Постоянно оценивая и интегрируя достижения в технологии данных, бизнес может оставаться конкурентоспособным и принимать обоснованные решения в все более данными мире.
Какие некоторые из текущих проблем управления данными, которые мы видим в отрасли?
1. Скорость и интеграция данных
Одной из больших проблем, с которыми мы сталкиваемся сегодня, является огромный объем данных, поступающих из различных приложений. Если вы возьмете типичную ИТ-организацию, они имеют дело с новыми приложениями, которые появляются все время – десятки, иногда даже сотни каждый год, особенно в средних организациях.
Теперь все эти приложения генерируют данные, и эти данные содержат ценные идеи. Основная проблема здесь заключается в способности быстро интегрировать эти новые источники данных в существующие конвейеры данных и объединить их в единую точку зрения. Скорость, с которой организации могут адаптироваться и включить эти новые потоки данных, является самой большой проблемой, которую мы видим.
2. Различные форматы данных
Другой критической проблемой является характер данных самих по себе, особенно растущее распространение неструктурированных данных. С неструктурированными данными существуют, конечно, разные школы мысли о том, как с ними работать.
Организации должны решить, хранить ли эти данные напрямую в озерах данных для последующего использования или извлекать и преобразовывать их в более структурированный формат для немедленного потребления. Проблема того, как обрабатывать неструктурированные данные, остается, и мы видим, что даже средние компании или небольшие компании пострадали от этого. Итак, разработка эффективных стратегий для обработки неструктурированных данных является необходимой.
3. Публикация и обмен данными
Хотя интеграция и консолидация данных являются важными, способность эффективно делиться данными также важна. Организации нуждаются в механизмах для публикации и распространения данных среди внутренних отделов, третьих сторон, партнеров и других заинтересованных сторон. Эта проблема выходит за рамки простого обеспечения доступа к данным; она включает в себя обеспечение безопасности данных, конфиденциальности и соблюдения правил. Поскольку обмен данными становится необходимостью для бизнеса всех размеров, технологии и продукты в этой области быстро эволюционируют, чтобы удовлетворить спрос.
Как Astera интегрировала ИИ в рабочий процесс клиентов?
Мы рассматриваем ИИ, пересекающийся с управлением данными, двумя различными способами.
1. Улучшение удобства использования с помощью генеративного ИИ
Наша глубокая приверженность удобству использования является краеугольным камнем нашей философии разработки продукта. За последние 12-13 лет мы построили прочную репутацию за проектирование продуктов с коротким периодом обучения, делая их доступными даже для непрофессиональных пользователей. С помощью генеративного ИИ Astera подняла удобство использования на новый уровень. Мы использовали генеративный ИИ для создания пользовательского интерфейса, который позволяет клиентам взаимодействовать с продуктом с помощью команд естественного языка. Этот ИИ-интерфейс упрощает задачи конфигурации, делая его более интуитивным и эффективным для пользователей.
Кроме того, Astera интегрировала автоматизацию, основанную на ИИ, для обработки задач, которые ранее требовали нескольких часов ручной работы, особенно при конфигурации продуктов управления данными. Самым большим фактором стоимости построения решения управления данными не было просто покупка продукта, а время и усилия, потраченные на его конфигурацию. Мы попытались решить эту проблему с помощью ИИ. Этот подход значительно сокращает время и ресурсы, традиционно тратящиеся на конфигурацию продукта.
Как пример, продукт Astera, ReportMiner, упрощает извлечение данных из неструктурированных документов, позволяя пользователям создавать шаблоны извлечения на основе правил. ИИ может теперь сгенерировать первоначальный шаблон за считанные секунды, задачу, которая ранее занимала два-три часа для типичного пользователя. Первый вариант ИИ-генерированного шаблона может быть не идеальным, но он выполняет примерно 90% работы, позволяя пользователям быстро вносить коррективы и завершать задачу за несколько минут вместо часов. Этот подход является лишь одним примером того, как Astera использует ИИ для улучшения удобства использования во всех своих продуктах.
Мы делаем подобные вещи на протяжении всего нашего стека данных, где мы получаем значительный прирост удобства использования с помощью искусственного интеллекта.
2. Функциональность ИИ в качестве инструментария
Astera предлагает унифицированный стек данных, который охватывает различные аспекты управления данными, включая ингест, преобразование, качество данных, хранилища данных, API и публикацию данных. Компания признает важность предоставления функциональности ИИ в качестве универсального инструментария для своих пользователей. В этом инструментарии клиенты Astera могут получить доступ к ИИ по всему спектру науки о данных, от построения и развертывания моделей машинного обучения до обработки ML Ops (Операции машинного обучения). Astera также поддерживает использование моделей на основе открытого исходного кода, включая большие языковые модели (LLM), и облегчает их тонкую настройку для конкретных случаев использования.
Эта более широкая функциональность ИИ позволяет пользователям Astera использовать ИИ для различных задач, связанных с данными, включая развертывание моделей машинного обучения, реализацию ML Ops и тонкую настройку моделей на основе открытого исходного кода. Кроме того, Astera постоянно работает над расширением своей поддержки ИИ, охватывая области, такие как векторные базы данных, поиск подобия, вложения и многое другое.
Какие некоторые из лучших практик использования ИИ и моделей машинного обучения в управлении данными для крупных компаний?
1. Оставаться на переднем крае разработок ИИ и ML
Область больших языковых моделей развивается быстро. Чтобы получить конкурентное преимущество, крупные компании должны оставаться информированными о последних достижениях. Astera, например, была одним из первых, кто принял генеративный ИИ, используя модели, такие как OpenAI и LAMA. Постоянный мониторинг возникающих технологий гарантирует, что вы хорошо подготовлены к их эффективному использованию.
2. Экспериментировать с несколькими моделями и конфигурациями
Используя тонкую настройку LLM, мы смогли развернуть небольшие размеры, такие как модели на 8-13 миллиардов параметров, и развернуть их локально. Это сработало действительно хорошо для нас, и то, что мы рекомендуем, – это попробовать разные базовые модели и конфигурации, и посмотреть, какая из них работает для вас.
Большие языковые модели бывают разных вкусов, каждая со своими уникальными возможностями. Создайте конфигурацию, которая позволяет вам выбирать из широкого спектра вариантов, отражающего то, что делают разработчики и ученые в области науки о данных на своих данных.
Чтобы расширить возможности пользователей, мы создали систему конфигурации, которая предлагает широкий спектр вариантов, подобный тому, с чем сталкиваются разработчики и ученые в области науки о данных при работе с библиотеками на основе открытого исходного кода в своих данных. Наша цель заключалась в том, чтобы без проблем интегрировать эти варианты в наш продукт, обеспечивая динамичный и адаптивный опыт для пользователей.
3. Приоритизировать локальное развертывание над API
При работе с данными сокращение задержек имеет первостепенное значение. Полагаться исключительно на API для доступа к моделям ИИ и ML может ввести неприемлемые задержки, особенно при обработке больших объемов данных. Рекомендуется отдавать приоритет развертыванию тонко настроенных моделей локально, посвященных вашей конкретной ситуации. Этот подход может значительно улучшить время ответа и общую производительность.
Почему Astera является лучшим решением, чем конкурирующие платформы?
- Решения Astera имеют кодовый, интуитивный, визуальный интерфейс, а также улучшенную удобность использования, обеспеченную ИИ, что делает его легко выполнить сложные процессы работы с данными для всех пользователей, независимо от их технических способностей.
- Автоматические функции нашего стека данных сокращают повторяющиеся ручные задачи и экономят время и ресурсы разработки.
- Наша унифицированная платформа может помочь пользователям выполнять процессы работы с данными от начала до конца без переключения решений. Это исключает расходы на обучение и управление несколькими, изолированными системами.
Спасибо за отличное интервью, читателям, которые хотят узнать больше, следует посетить Astera Software.












