Лідери думок
Важливість якості даних у реалізації штучного інтелекту

Технології штучного інтелекту та машинного навчання можуть суттєво вигідливо вплинути на підприємства будь-якого розміру. За даними дослідження компанії McKinsey, підприємства, які використовують технології штучного інтелекту, подвоїть свій грошовий потік до 2030 року. Навпаки, компанії, які не впроваджують штучний інтелект, будуть свідками скорочення грошового потоку на 20%. Однак такі вигоди виходять за рамки фінансів. Штучний інтелект може допомогти компаніям боротися з нестачею робочої сили. Штучний інтелект також суттєво покращує досвід клієнтів і результати діяльності підприємств, роблячи підприємства більш надійними.
Якщо штучний інтелект має так багато переваг, чому не всі його впроваджують? У 2019 році дослідження компанії PwC показало, що 76% компаній планують використовувати штучний інтелект для покращення своєї діяльності. Однак лише 15% мають доступ до високоякісних даних для досягнення своїх цілей. Інше дослідження компанії Refinitiv свідчить, що 66% респондентів заявили, що низька якість даних перешкоджає їм впроваджувати та використовувати штучний інтелект ефективно.
Дослідження показало, що три основні проблеми роботи з технологіями машинного навчання та штучного інтелекту пов’язані з “точною інформацією про охоплення, історію та населення даних”, “визначенням неповних або пошкоджених записів” та “очищенням та нормалізацією даних”. Це свідчить про те, що низька якість даних є основною перешкодою для підприємств у досягненні високоякісної аналітики, заснованої на штучному інтелекті.
Чому дані такі важливі?
Є багато причин, чому якість даних важлива у реалізації штучного інтелекту. Ось деякі з найважливіших:
1. Сміття у вході, сміття на виході
Дуже просто зрозуміти, що вихід залежить сильно від входу. У цьому випадку, якщо набори даних повні помилок або викривлені, результат також буде невірним. Більшість проблем, пов’язаних з даними, не полягають у кількості даних, а у їхній якості. Якщо у вас низькоякісні дані, ваші моделі штучного інтелекту не працюватимуть правильно, незалежно від того, наскільки вони хороші.
2. Не всі системи штучного інтелекту рівні
Коли ми думаємо про набори даних, ми зазвичай думаємо у термінах кількісних даних. Однак існують також якісні дані у вигляді відео, особистих інтерв’ю, думок, зображень тощо. У системах штучного інтелекту кількісні набори даних структуровані, а якісні набори даних неструктуровані. Не всі моделі штучного інтелекту можуть обробляти обидва типи даних. Тому вибір правильного типу даних для відповідної моделі важливий для отримання очікуваного результату.
3. Якість проти кількості
Вважається, що системи штучного інтелекту повинні споживати велику кількість даних, щоб навчатися. У дискусії про якість проти кількості остання зазвичай віддається перевагу компаніями. Однак, якщо набори даних високої якості, хоча і коротші за розміром, вони дають певну гарантію того, що результат буде актуальним і надійним.
4. Характеристики хорошого набору даних
Характеристики хорошого набору даних можуть бути суб’єктивними та залежати в основному від застосування штучного інтелекту. Однак існують деякі загальні ознаки, які потрібно шукати при аналізі даних.
- Повнота: Набір даних повинен бути повним, без порожніх комірок чи пробілів у даних. Кожна комірка повинна містити певний шматок даних.
- Всебічність: Набори даних повинні бути якомога більш повними. Наприклад, якщо ви шукаєте вектор кіберзагрози, то вам потрібно мати всі профільні підписи та всю необхідну інформацію.
- Однозначність: Набори даних повинні відповідати певним змінним, яким вони призначені. Наприклад, якщо ви моделюєте коробки з пакетами, ваші вибрані змінні (пластик, папір, картон тощо) повинні мати відповідні ціни, щоб входити у ці певні категорії.
- Точність: Точність є ключем до хорошого набору даних. Вся інформація, яку ви надаєте моделі штучного інтелекту, повинна бути достовірною та абсолютно точною. Якщо великі частини ваших наборів даних неправильні, ваш результат також буде неточним.
- Унікальність: Ця точка подібна до однозначності. Кожна точка даних повинна бути унікальною для змінної, яку вона обслуговує. Наприклад, ви не хочете, щоб ціна пластикової обгортки потрапила під будь-яку іншу категорію пакування.
Забезпечення якості даних
Є багато способів забезпечити високу якість даних, наприклад, забезпечення того, що джерело даних є достовірним. Ось деякі з найкращих технік, щоб забезпечити отримання найкращих даних для ваших моделей штучного інтелекту:
1. Профайлінг даних
Профайлінг даних важливий для розуміння даних перед їхнім використанням. Профайлінг даних надає уявлення про розподіл значень, максимальні, мінімальні, середні значення та аутлієри. Крім того, він допомагає у виявленні форматних несумісностей у даних. Профайлінг даних допомагає зрозуміти, чи є набір даних придатним для використання.
2. Оцінка якості даних
Використовуючи центральну бібліотеку попередньо створених правил якості даних, ви можете перевірити будь-який набір даних за допомогою центральної бібліотеки. Якщо у вас є каталог даних з вбудованими інструментами даних, ви можете просто повторно використовувати ці правила для перевірки імен клієнтів, електронних адрес та кодів продуктів. Крім того, ви також можете збагатити та стандартизувати деякі дані.
3. Мониторинг та оцінка якості даних
Вчені мають попередньо обчислену якість даних для більшості наборів даних, які вони хочуть використовувати. Вони можуть звузити це до конкретної проблеми атрибута та вирішити, чи використовувати цей атрибут чи ні.
4. Підготовка даних
Дослідники та вчені зазвичай повинні трохи змінити дані, щоб підготувати їх для моделей штучного інтелекту. Цим дослідникам потрібні прості у використанні інструменти для розбору атрибутів, транспонування стовпців та розрахунку значень з даних.
Світ штучного інтелекту постійно змінюється. Хоча кожна компанія використовує дані по-різному, якість даних залишається важливою для будь-якого проекту реалізації штучного інтелекту. Якщо у вас є надійні, високоякісні дані, ви усуваєте потребу у величезних наборах даних і збільшуєте свої шанси на успіх. Як і всі інші організації, якщо ваша організація переходить до реалізації штучного інтелекту, перевірте, чи маєте ви хороші дані. Забезпечте, щоб ваші джерела були достовірними, та виконайте належну перевірку, щоб переконатися, що вони відповідають вашим вимогам до даних.












