Лидеры мнений

Почему качество данных решает, удастся ли корпоративному ИИ или нет

mm
Добавьте Unite.AI в избранные источники в Google

С момента выхода ChatGPT от OpenAI в конце 2022 года каждая компания пытается ускорить процесс внедрения ИИ. Большой игроки на рынке оборудования, такие как Nvidia, продают больше графических процессоров, чем когда-либо, в то время как крупные разработчики моделей, такие как OpenAI и Anthropic, продолжают создавать все более крупные модели.

Однако даже с самыми передовыми моделями и самыми большими бюджетами многие проекты ИИ все равно терпят неудачу. Мы видели это во всех отраслях – от здравоохранения до транспорта и финансов. Причина не слишком сложна: ИИ так же хорош, как и данные, на которых он обучен, и данные, которые он получает в режиме реального времени. Когда эти данные плохо помечены, устарели или неполны, ни одна модель не может обеспечить последовательные или достоверные результаты.

И это большая проблема, с которой сталкиваются многие компании сегодня. Они вкладывают большие средства в инструменты ИИ, в то время как их системы данных остаются разрозненными и ненадежными. В результате получается иллюзия прогресса. Хотя модели производят впечатляющие ответы, идеи часто основаны на слабых основаниях. Реальная преграда на пути к успеху ИИ не заключается в производительности модели. Это качество данных.

Что такое хорошие данные

Высококачественные данные – это не только точность. Это информация, которая является актуальной, полной и релевантной для решения задачи. Представьте себе клиента, который пытается отменить заказ на сайте электронной коммерции. Система должна проверить детали заказа, статус доставки и запись оплаты. Если какие-либо из этих данных находятся в разных системах, которые не общаются друг с другом, помощник ИИ не сможет дать полезный ответ.

Хорошие данные соединяют эти точки мгновенно. Они позволяют ИИ видеть полную картину, а не фрагменты ее. Плохие данные, с другой стороны, заставляют модель угадывать. И когда ИИ начинает угадывать, он совершает ошибки, которые стоят денег и наносят ущерб доверию. Недавние примеры показывают, насколько опасны такие предположения.

Чат-бот бизнеса Нью-Йорка давал незаконные советы, потому что он черпал из устаревшей или неполной юридической информации. Чат-бот службы поддержки клиентов Air Canada делал ложные заявления о возврате средств, потому что он не имел контекста из политики компании. Даже крупные системы найма неправильно фильтровали кандидатов из-за предвзятых или неправильно помеченных данных, как видно из первого урегулирования ИИ, связанного с ЕEOC. Эти неудачи не только технические. Они носят репутационный и финансовый характер и возникают из-за систем ИИ, которые были обучены на ненадежных данных.

Исследования отрасли подтверждают масштаб этой проблемы. Gartner сообщает, что 80 процентов проектов ИИ терпят неудачу в масштабировании из-за плохого качества данных и управления. Аналогично, опрос MIT Sloan Management Review показал, что проблемы с данными, а не алгоритмами, являются основной причиной неудачи проектов ИИ в корпоративном секторе.

Культура так же важна, как и код

Улучшение качества данных не является чем-то, что можно исправить с помощью одного инструмента или команды. Для этого требуется культурный сдвиг. Поэтому бизнес-лидеры должны относиться к данным как к живой системе, которая требует ухода и подотчетности. Это не только заявление о том, что вы хотите “улучшить данные” – этого недостаточно. Каждая часть организации должна понимать, как информация перемещается, кто за нее отвечает, и что происходит, когда она меняется.

Мы видели, как это происходит в реальных системах. Многие приложения ИИ полагаются на ночные обновления данных. Если ваша база данных обновляется один раз в день, знания вашей модели всегда будут отставать от реальности. В быстро меняющихся средах эта задержка может означать устаревшие идеи и плохие решения. Компаниям необходимо пересмотреть весь поток данных – от того, как собирается информация, до того, как она доставляется модели.

Хорошо сделав это, можно сэкономить огромное количество времени и средств. Когда данные спроектированы с ясностью и целью, системы ИИ могут учиться и действовать на основе наиболее recent и релевантной информации. Когда они не спроектированы, команды тратят больше времени на очистку данных, чем на их использование.

Эксперты в управлении данными часто указывают на то, что ключом к сильному качеству данных является обратная связь между людьми, процессами и платформами. Без этой обратной связи информация становится устаревшей, а модели теряют связь с реальными условиями – проблема, иногда называемая “дрейфом данных”.

Баланс между скоростью и целостностью

Часто существует напряжение между быстрым движением и сохранением точности. Многие организации хотят получить мгновенные результаты от своих инвестиций в ИИ, но спешка может привести к более крупным проблемам позже. Цель должна заключаться в гибкости данных с целостностью. Другими словами, построение систем, которые могут двигаться быстро без потери точности.

Для этого каждая компания должна определить четкие пути для потока данных из источника в модель в режиме реального времени. Также помогает определить, какой тип информации разрешен, а какой должен остаться вне. Чувствительные или конфиденциальные данные никогда не должны достигать модели, даже если пользователь технически имеет к ним доступ. Защита этой границы строит доверие и не позволяет системам ИИ утечь или неправильно использовать информацию.

Когда ИИ становится более автономным, человеческий надзор останется критически важным. Модель не должна иметь полный контроль над деловыми действиями. Она определенно не должна принимать решения. Вместо этого она должна делать запросы. Более того, люди всегда должны проверять и утверждать ее действия, чтобы убедиться, что они соответствуют политике компании и регулированиям.

Построение качества с нуля

Поддержание качества данных в масштабе не только вопрос очистки ошибок. Это начинается с архитектуры. Вам нужно определить, где живут ваши наиболее надежные данные, а затем спроектировать систему, которая объединяет их в одном доверенном месте. Оттуда вы можете отслеживать, какие данные использует модель, и откуда они берутся.

Этот подход предотвращает путаницу и сохраняет систему прозрачной. Он также помогает командам быстрее устранять неполадки, когда что-то идет не так. Когда вы точно знаете, какие данные привели к ответу модели, вы можете проверить и исправить проблемы, прежде чем они распространятся.

Будущее корпоративного ИИ будет принадлежать компаниям, которые встраивают качество в свою инфраструктуру по умолчанию. Мы ожидаем увидеть больше готовых систем ИИ, которые обрабатывают как рассуждения, так и интеграцию данных в одном пакете. Эти “приборы ИИ” могут сделать его проще для организаций развертывать умные системы без потери контроля над своими данными.

Аналитики предсказывают, что организации, способные объединить и управлять своими данными эффективно, увидят более быструю адопцию и более высокую отдачу от инвестиций в проекты ИИ. Недавний отчет о готовности данных объясняет, что эта способность отделяет компании, которые постоянно инновируют, от тех, которые застревают после ранних пилотов. Разница часто заключается в том, построены ли их системы ИИ на последовательной, хорошо структурированной информации.

Итог

Качество данных может показаться не таким интересным по сравнению с прорывами в проектировании моделей, но это тихая сила, которая решает, удастся ли ИИ или нет. Без чистых, актуальных и последовательных данных даже самые умные системы споткнутся. С ними даже скромные проекты ИИ могут создать прочную ценность.

Каждый лидер, инвестирующий в ИИ, должен задать простой вопрос: доверяем ли мы данным, которые управляют нашими решениями? Из того, что мы видели, компании, которые могут с уверенностью ответить “да”, уже лидируют в гонке ИИ.

Орен Эйни является основателем и генеральным директором RavenDB, много-модельной базы данных NoSQL-документов, которой доверяют разработчики и предприятия по всему миру. Помимо того, что он является движущей силой роста и расширения базы данных RavenDB, Орен является активным блогером и регулярно выступает на отраслевых мероприятиях по всему миру.