Лидеры мнений

Команды данных умерли, да здравствуют команды данных

mm
Добавьте Unite.AI в избранные источники в Google

Да, заголовок кликбейтный и провокационный, но как технический директор с многолетним опытом в области данных, я стал свидетелем трансформации, которая оправдывает драму. Традиционная «команда данных» – бэк-офисная команда, которая занимается отчетами и панелями управления, – фактически умерла. На ее месте появляется новый вид команды данных: команда, ориентированная на ИИ и продукты, с прямым влиянием на доход. Они больше не являются центром затрат, а генерируют прибыль.

Путь от бизнес-интеллекта к машинному обучению

Не так давно команды данных были синонимом бизнес-интеллекта (BI). Мы были историками компании, живущими в SQL и электронных таблицах, задачей которых было ответить на вопрос «Что произошло в прошлом квартале?» Когда появились технологии больших данных, такие как Hadoop, и термин «ученый-дата» стал новой модной работой, команды данных эволюционировали. К середине 2010-х годов мы делали больше, чем просто отчеты; мы занимались визуализацией данных и интерактивными аналитиками, производя динамические панели управления для каждого отдела. Работа заключалась в обработке данных, смешивании наборов данных из разных источников и форм, и попытках понять знания домена.

Затем в конце 2010-х годов наступила эра машинного обучения. Команды данных начали нанимать ученых-дата, чтобы построить прогностические модели и открыть идеи в огромных наборах данных. Мы перешли от описания прошлого к прогнозированию будущего: модели churn, рекомендационные двигатели, прогнозы спроса – вы назовите. Но даже тогда наши выходные данные были слайд-шоу и идеями, а не живыми продуктами. Мы функционировали как внутренний сервисный бюро, консультируя бизнес через анализ. Другими словами, мы были центрами затрат – ценными, да, но на шаг удаленными от основного продукта и дохода.

В лучших случаях команды машинного обучения были распределены по отдельным подразделениям или встроены в производственные группы, так что их модели и выводы могли быть полностью интегрированы в платформы. Великий раздел привел к многочисленным провальным проектам, затопленным инвестициям и потерянным возможностям.

GenAI: от функции поддержки к центру прибыли

Затем появился GenAI, и все изменилось. Выпуск мощных больших языковых моделей, таких как семейство GPT и открытые варианты, такие как Llama, перевернул ландшафт практически за одну ночь. Внезапно команды данных не только анализировали бизнес, но и стали неотъемлемой частью построения продуктов и опыта ИИ. Когда вы успешно интегрируете ИИ в приложение или рабочий процесс, вы не просто информируете бизнес; вы управляете им. Хорошо реализованная система GenAI может автоматизировать поддержку клиентов, генерировать маркетинговый контент, персонализировать пользовательский опыт или даже предоставить данные, необходимые для информирования и обучения возникающих агентских ИИ-систем. Эти возможности напрямую влияют на потоки доходов. По сути, продукт команды данных сместился от слайд-шоу PowerPoint к живым приложениям, работающим на ИИ.

Команды GenAI начали с групп инноваций, доставляющих доказательства концепции, которые генерировали «фактор удивления». И вскоре каждый стал инженером ИИ, распространяя тень ИТ по организациям.

Команды данных вскоре обнаружили, что они сталкиваются с новым вопросом: «Когда вы станете центром прибыли?» Когда инженеры ИИ начали создавать удивительные инструменты, стало ясно, что время пришло, чтобы объединить две команды: те, кто контролировал данные, и те, кто строил приложения.

Рассмотрим розничную компанию, которая развертывает чат-бот GenAI для обработки запросов продаж, или банк, который запускает ИИ-ориентированного, персонализированного инвестиционного советника. Это не традиционные проекты ИТ – это цифровые продукты, которые создают ценность для клиентов и генерируют доход. Однако, чтобы создать эти системы в масштабе, команды инженеров ИИ должны иметь возможность получить доступ и операционализировать данные, которые подготовили традиционные команды.

Руководители заметили. Ожидания от команд данных теперь за облаками, с советами директоров и генеральными директорами, которые смотрят на нас, чтобы доставить следующий вектор роста, движимый ИИ. Мы перешли от того, чтобы быть аналитиками за кулисами, к инноваторам на передовой линии. Это захватывающее положение, но оно приходит с интенсивным давлением, чтобы доставить результаты в масштабе.

От исследования к продукту – односторонняя дверь

Сдвиг от аналитического исследования к ориентированному на продукт ИИ глубокий и необратимый. Почему необратимый? Потому что влияние GenAI на бизнес оказывается слишком великим, чтобы отнести его обратно к игрушке R&D. Согласно недавнему глобальному опросу, 96% лидеров ИТ уже интегрировали ИИ в свои основные процессы – по сравнению с 88% всего год назад. Другими словами, почти каждое предприятие перешло от экспериментов с ИИ к внедрению его в критически важные рабочие процессы. Как только вы пересекаете этот порог, где ИИ доставляет ценность в производстве, нет возврата.

Этот новый фокус ИИ меняет темп и мышление команд данных. В прошлом у нас была роскошь долгих проектов по открытию и открытого анализа. Сегодня, если мы строим функцию ИИ, она должна быть готова к производству, соответствовать требованиям и быть надежной – как любой продукт, ориентированный на клиента. Мы вошли в то, что некоторые называют «Автономной эпохой» науки о данных. Вопрос, который руководит нашей работой, больше не «какие идеи мы можем открыть?», а «какую интеллектуальную систему мы можем построить, которая действует на идеях в режиме реального времени?»

Системы GenAI не просто отвечают на вопросы; они начинают принимать решения. Это односторонняя дверь: после того, как вы испытаете этот вид автономии и влияния, компании не согласятся на статические отчеты и ручное принятие решений. Более чем когда-либо команды данных должны быть ориентированы на заинтересованные стороны и продукты.

Трудная правда: почему большинство инициатив GenAI терпят неудачу

Среди всего волнения есть трезвая реальность: большинство инициатив GenAI терпят неудачу. Оказывается, что успешное развертывание GenAI чрезвычайно сложно. Недавнее исследование MIT показало, что поражающие 95% пилотных проектов ИИ в предприятиях никогда не доставляют измеримой отдачи от инвестиций. Только около 5% пилотных проектов ИИ на самом деле достигают быстрых доходов или значимого бизнес-влияния. Это не из-за отсутствия потенциала – это из-за сложности правильного выполнения ИИ.

Изучая причины неудач, исследование MIT рисует четкую картину. Многие проекты спотыкаются из-за «гипа над тяжелой работой» – команды преследуют эффектные демонстрационные случаи использования вместо инвестиций в скучные основы интеграции, проверки и мониторинга. Другие терпят неудачу из-за классического синдрома «мусор на входе, мусор на выходе» – плохое качество данных и изолированные трубопроводы данных обрекают проект на провал еще до того, как ИИ сможет сделать свою работу. Часто это не модель ИИ, которая ошибочна, а окружающая среда. Как исследователи выразились, GenAI не терпит неудачу в лаборатории; она терпит неудачу в предприятии, когда сталкивается с неясными целями, плохими данными и организационной инерцией. На практике большинство пилотных проектов ИИ застревают на стадии доказательства концепции и никогда не переходят к полной производственной развертыванию.

Этот реальность-чек является ценным уроком. Он говорит нам, что, хотя команды данных теперь находятся в центре внимания, большинство из них борются за удовлетворение возросших ожиданий. Чтобы GenAI преуспел в масштабе, мы должны преодолеть значительно более высокую планку, чем мы делали в старые дни BI.

За пределами умных промптов: данные, управление и инфраструктура имеют значение

Что отличает 5% проектов ИИ, которые процветают, от 95%, которые спотыкаются? На мой опыт (и как подтверждает исследование), победители фокусируются на основных возможностях – данных, управлении и инфраструктуре. GenAI не является магией; это построено на данных. Без высококачественных, хорошо управляемых трубопроводов данных, которые питают ваши модели, даже лучший ИИ будет производить неравномерные результаты. Summit Partners выразили это хорошо в недавнем анализе: «успех любой системы или процесса, использующего ИИ, зависит от качества, структуры и доступности данных, которые его питают».

В практическом смысле это означает, что организации должны удвоить усилия по архитектуре данных и управлению при принятии GenAI. У вас есть унифицированные, доступные хранилища данных, из которых ваш ИИ может черпать (и я имею в виду все хранилища данных, включая центры данных, гипермасштабные системы, системы SaaS третьих сторон и т. д.)? Эти данные очищены, курированы и соответствуют правилам? Есть ли четкая генеалогия данных и аудитность (чтобы вы могли доверять выходным данным ИИ и знать, как они были получены)? Эти вопросы теперь находятся на переднем плане.

GenAI заставляет компании наконец привести свой дом данных в порядок

Управление также приобрело новое значение. Когда модель ИИ может потенциально сгенерировать неправильный ответ (или оскорбительный), прочное управление не является необязательным – оно обязательно. Контроли, такие как версионность, проверки предвзятости, обзор человека в цикле и строгие меры безопасности вокруг чувствительных входных данных, являются необходимыми. Без надлежащего управления, обучения и четко определенных целей даже сильный инструмент ИИ будет бороться за то, чтобы получить оборот в бизнесе.

И не забудем про инфраструктуру. Развертывание GenAI в масштабе требует значительной вычислительной мощности и тщательной инженерии. Модели должны быть обслужены в режиме реального времени, на миллионы запросов с низкой задержкой. Они часто требуют GPU или специального оборудования, а также постоянного мониторинга, хранения и управления жизненным циклом. Короче говоря, вам нужна инфраструктура ИИ промышленного класса, которая является безопасной, масштабируемой и устойчивой. Это то место, где концепция Private AI появляется как框, который объединяет инфраструктуру с данными и управлением. Private AI относится к разработке ИИ в контролируемой и безопасной среде, обеспечивая безопасность и соответствие данных.

Дно линии заключается в том, что успех GenAI зависит от гармонии трех столпов: данных, управления и инфраструктуры. Без одного из них вы рискуете присоединиться к 95% проектов, которые никогда не масштабируются за пределы демонстрационной стадии.

Почему инженеры ИИ не могут сделать это в одиночку

Учитывая эти требования, ясно, что просто нанять несколько талантливых инженеров ИИ не является серебряной пулей. Мы выучили этот урок за последние несколько лет в отрасли данных. В начале бума науки о данных компании пытались найти «единорогов»-ученых-дата, которые могли бы сделать все – построить модели, написать код, обработать данные и развертывание. Этот миф с тех пор был разрушен. Как один ветеран-ученый-дата пошутил, «модель, сидящая в блокноте, на самом деле ничего не делает для бизнеса». Вам нужно встроить эту модель в приложение или процесс, чтобы она создавала ценность. И сделать это требует командных усилий, которые охватывают несколько навыков.

В конце 2010-х годов мы увидели, что команды данных диверсифицировались в различные роли: инженеры-дата начали строить прочные трубопроводы, инженеры-машинного обучения фокусировались на производстве моделей, инженеры-аналитики управляли аналитическим слоем и т. д.

Сегодня GenAI поднимает планку еще выше. Да, вам нужны специалисты ИИ (инженеры-пrompt, тонкие настройщики LLM и т. д.), но эти специалисты столкнутся со стеной, если у них нет зрелых трубопроводов данных, рамок управления и безопасных платформ для работы. Инженер ИИ может прототипировать отличную языковую модель в песочнице, но превращение ее в продукт, используемый тысячами или миллионами, требует сотрудничества с командами безопасности, офицерами соответствия, архитекторами данных, инженерами надежности сайта и многими другими.

ИИ – это командный спорт. Это заманчиво думать, что вы можете бросить модель государственного уровня в свой бизнес и внезапно получить предприятие, движимое ИИ. Компании, которые преуспевают в ИИ, – это те, которые построили межфункциональные команды или «фабрики ИИ», которые объединяют все эти части. Их команды данных эволюционировали в команды полного стека ИИ-продуктов, сочетая данные, моделирование, инженерию и эксплуатацию. Они строят и развертывают свои инструменты в данных, ориентированных на продукт, с генерацией ценности, встроенной в каждый KPI.

Следующее поколение команд данных

Итак, что ждет будущее для новой «команды данных»? Вот взгляд на то, что ждет этих команд в ближайшие несколько лет:

  • Меньше ручного ETL/ELT: Скучная работа по обработке данных уменьшится. С более автоматизированными трубопроводами данных и ИИ, помогающим интеграции, команды не будут тратить половину своего времени на очистку и перемещение данных. Работа по подготовке данных будет все больше обрабатываться интеллектуальными системами, позволяя людям сосредоточиться на более высоком уровне дизайна и контроля качества.
  • Меньше панелей: Эра бесконечного настройки фильтров панелей угасает. ИИ позволит более естественным языковым запросам и динамической доставке идей. Вместо предварительно построенных панелей для каждого вопроса пользователи получат разговорные ответы от ИИ (с исходными данными, прикрепленными). Команды данных будут тратить меньше времени на разработку статических отчетов и больше времени на обучение ИИ, чтобы генерировать идеи на лету.
  • Больше разработки продукта, родного для ИИ: Команды данных будут в центре инноваций продукта. Будь то разработка нового продукта, ориентированного на клиента, или внутреннего инструмента ИИ, который оптимизирует операции, эти команды будут действовать как команды продукта. Они будут использовать практики разработки программного обеспечения, быстрое прототипирование, тестирование A/B и проектирование пользовательского опыта – не только анализ данных. Каждая команда данных, по сути, станет командой продукта ИИ, доставляющей прямую бизнес-ценность.
  • Автономные агенты на подъеме: В не слишком далеком будущем команды данных будут развертывать автономные агенты ИИ, чтобы обработать рутинные решения и задачи. Вместо того, чтобы просто прогнозировать результаты, эти агенты будут уполномочены принимать определенные действия (с надзором). Представьте себе агента ИИ-операций, который может обнаружить аномалию и автоматически открыть билет на устранение неполадок, или агента ИИ-продаж, который настраивает цены электронной коммерции в режиме реального времени. Команды данных будут отвечать за построение и управление этими агентами, продвигая границы того, что может достичь автоматизация.

В свете этих изменений можно действительно сказать, что «команды данных, как мы знали их, умерли». Джокки электронных таблиц и сантехники панелей уступили место чему-то новому: командам, ориентированным на ИИ, которые свободно говорят на языках данных, кода и бизнес-стратегии. Но далеко от того, чтобы быть некрологом, это празднование. Новое поколение команд данных только начинается, и они более ценны, чем когда-либо

Итак, помните, инженер данных умер, да здравствуют инженеры данных! Команды данных, как мы знали их, ушли, но да здравствуют новые команды данных – пусть они царствуют в этом мире, движимом ИИ, с идеями, ответственностью и дерзостью.

Серхио Гаго является техническим директором Cloudera, имея более 20 лет опыта в области ИИ/МЛ, квантовых вычислений и данных, основанных на архитектуре. Ранее он занимал должность управляющего директора ИИ/МЛ и квантовых вычислений в Moody’s Analytics, а также был техническим директором в Rakuten, Qapacity и Zinio. Серхио является сильным сторонником доверенной инфраструктуры данных, считая, что ИИ будет развиваться в операционную систему предприятия к 2030 году.