Лидеры мнений

Важность качества данных в реализации ИИ

mm
Добавьте Unite.AI в избранные источники в Google

Технологии искусственного интеллекта и машинного обучения могут существенно выгодно повлиять на отрасли всех размеров. Согласно отчету McKinsey, компании, которые используют технологии искусственного интеллекта, удвоят свой денежный поток к 2030 году. Напротив, компании, которые не развертывают ИИ, будут свидетелями снижения своего денежного потока на 20%. Однако такие выгоды выходят за рамки финансов. ИИ может помочь компаниям бороться с нехваткой рабочей силы. ИИ также существенно улучшает опыт клиентов и бизнес-результаты, делая бизнес более надежным.

Поскольку ИИ имеет так много преимуществ, почему все не принимают ИИ? В 2019 году PwC провела опрос, который показал, что 76% компаний планируют использовать ИИ для улучшения своей бизнес-ценности. Однако только 15% имеют доступ к высококачественным данным для достижения своих бизнес-целей. Другое исследование от Refinitiv показало, что 66% респондентов сказали, что плохое качество данных препятствует их способности эффективно развертывать и использовать ИИ.

Опрос показал, что три основных проблемы при работе с машинным обучением и технологиями ИИ связаны с – «точной информацией о покрытии, истории и населении данных», «идентификацией неполных или поврежденных записей» и «очисткой и нормализацией данных». Это демонстрирует, что плохое качество данных является основным препятствием для бизнеса в получении высококачественной аналитики, основанной на ИИ.

Почему качество данных так важно?

Существует много причин, почему качество данных имеет решающее значение в реализации ИИ. Вот некоторые из наиболее важных:

1. Мусор на входе, мусор на выходе

Очень просто понять, что выход зависит сильно от входа. В данном случае, если наборы данных полны ошибок или искажены, результат также будет неверным. Большинство проблем, связанных с данными, не обязательно связаны с количеством данных, а с качеством данных, которые вы подаете в модель ИИ. Если у вас плохое качество данных, ваши модели ИИ не будут работать правильно, как бы хороши они ни были.

2. Не все системы ИИ равны

Когда мы думаем о наборах данных, мы обычно думаем в терминах количественных данных. Но также существуют качественные данные в виде видео, личных интервью, мнений, изображений и т. д. В системах ИИ количественные наборы данных структурированы, а качественные наборы данных неструктурированы. Не все модели ИИ могут обрабатывать оба типа наборов данных. Поэтому выбор правильного типа данных для подходящей модели имеет решающее значение для получения ожидаемого выхода.

3. Качество против количества

Считается, что системы ИИ должны потреблять много данных, чтобы учиться на них. В споре о качестве против количества последнее обычно предпочитается компаниями. Однако, если наборы данных высокого качества, но короче по объему, это даст вам некоторую гарантию, что выход будет актуальным и устойчивым.

4. Характеристики хорошего набора данных

Характеристики хорошего набора данных могут быть субъективными и в основном зависят от применения, которое обслуживает ИИ. Однако существуют некоторые общие черты, на которые следует обратить внимание при анализе наборов данных.

  • Полнота: Набор данных должен быть полным, без пустых ячеек или пробелов в наборах данных. Каждая ячейка должна содержать часть данных.
  • Полное описание: Наборы данных должны быть как можно более полными. Например, если вы ищете вектор киберугрозы, то у вас должно быть все профили сигнатур и вся необходимая информация.
  • Последовательность: Наборы данных должны соответствовать определенным переменным, которым они были назначены. Например, если вы моделируете коробки для пакетов, ваши выбранные переменные (пластик, бумага, картон и т. д.) должны иметь соответствующие данные о цене, чтобы попасть в эти определенные категории.
  • Точность: Точность является ключом к хорошему набору данных. Все информация, которую вы подаете в модель ИИ, должна быть достоверной и полностью точной. Если большие части ваших наборов данных неверны, ваш выход также будет неточным.
  • Уникальность: Эта точка аналогична последовательности. Каждая точка данных должна быть уникальной для переменной, которой она служит. Например, вы не хотите, чтобы цена пластиковой обертки попала в любую другую категорию упаковки.

Обеспечение качества данных

Существует много способов обеспечить высокое качество данных, например, обеспечение того, что источник данных является достоверным. Вот некоторые из лучших методов, чтобы гарантировать получение лучшего качества данных для ваших моделей ИИ:

1. Профилирование данных

Профилирование данных имеет решающее значение для понимания данных до их использования. Профилирование данных дает представление о распределении значений, максимальных, минимальных, средних значениях и аномалиях. Кроме того, оно помогает в форматировании несоответствий в данных. Профилирование данных помогает понять, является ли набор данных пригодным для использования или нет.

2. Оценка качества данных

Используя центральную библиотеку предварительно построенных правил качества данных, вы можете проверить любой набор данных с помощью центральной библиотеки. Если у вас есть каталог данных с встроенными инструментами данных, вы можете просто повторно использовать эти правила, чтобы проверить имена клиентов, электронные адреса и коды продуктов. Кроме того, вы также можете обогатить и стандартизировать некоторые данные.

3. Мониторинг и оценка качества данных

Ученые имеют предварительно рассчитанное качество данных для большинства наборов данных, которые они хотят использовать. Они могут сузить круг, чтобы увидеть, какая конкретная проблема имеет атрибут, и затем решить, использовать ли этот атрибут или нет.

4. Подготовка данных

Исследователи и ученые обычно должны немного изменить данные, чтобы подготовить их для моделирования ИИ. Эти исследователи нуждаются в простых в использовании инструментах, чтобы парсить атрибуты, транспонировать столбцы и вычислять значения из данных.

Мир искусственного интеллекта постоянно меняется. Хотя каждая компания использует данные по-разному, качество данных остается важным для любого проекта реализации ИИ. Если у вас есть надежные, высококачественные данные, вы исключаете необходимость в огромных наборах данных и увеличиваете свои шансы на успех. Как и все другие организации, если ваша организация переходит к реализации ИИ, проверьте, есть ли у вас высококачественные данные. Обеспечьте, чтобы ваши источники были достоверными, и выполните тщательную проверку, чтобы убедиться, что они соответствуют вашим требованиям к данным.

Эми Гроден-Моррисон более 15 лет занимает руководящие должности в области маркетинговых коммуникаций в компаниях such as TIBCO Software, RSA Security и Ziff-Davis. Ее прошлые достижения включают создание первого совместного технологического программы с CNN, запуск компании по организации мероприятий на NYSE, ребрендинг компании, входящей в список NASDAQ, во время кризиса, и позиционирование и маркетинг стартапа в районе Бостона для успешного приобретения. В настоящее время она является вице-президентом по маркетингу и операциям продаж в Alpha Software.