Лідери думок

Висока ціна брудних даних у розробці штучного інтелекту

mm
Додайте Unite.AI до бажаних джерел у Google

Не секрет, що зараз відбувається сучасна золотая лихорадка в розробці штучного інтелекту. За даними 2024 Work Trend Index компанії Microsoft (MSFT ) і Linkedin, понад 40% керівників підприємств очікують повної переробки своїх бізнес-процесів з використанням штучного інтелекту (AI) в найближчі кілька років. Це не просто технологічний апгрейд; це фундаментальна трансформація того, як підприємства працюють, приймають рішення та взаємодіють з клієнтами. Ця швидка розробка сприяє зростанню попиту на дані та інструменти управління першими даними. За даними Forrester, щонайменше 92% керівників технологічних підприємств планують збільшити свої бюджети на управління даними та штучний інтелект у 2024 році.

У найновішому McKinsey Global Survey on AI, 65% респондентів вказали, що їхні організації регулярно використовують технології генерації штучного інтелекту. Хоча це впровадження свідчить про значний стрибок вперед, воно також підкреслює критичну проблему: якість даних, що живлять ці системи штучного інтелекту. У галузі, де ефективний штучний інтелект є лише настільки добрим, наскільки добрими є дані, на яких він тренується, надійні та точні дані стають дедалі важчими для отримання.

Висока ціна брудних даних

Брудні дані не є новою проблемою, але їхній вплив посилюється в епоху штучного інтелекту. У 2017 році дослідження Масачусетського технологічного інституту (MIT) оцінило, що брудні дані коштують компаніям від 15% до 25% їхнього доходу. У 2021 році Gartner оцінив, що погані дані коштують організаціям у середньому 12,9 мільйона доларів на рік.

Брудні дані – дані, які є неповними, неточними або несумісними – можуть мати каскадний ефект на системи штучного інтелекту. Коли моделі штучного інтелекту тренуються на низькоякісних даних, отримані висновки та прогнози є фундаментально хибними. Це не тільки підкреслює недоліки застосувань штучного інтелекту, але також створює значні ризики для підприємств, які покладаються на ці технології для критичних рішень.

Це створює великі проблеми для корпоративних команд даних, які мали все більше зосереджуватися свої обмежені ресурси на очищенні та організації даних. У недавньому звіті про стан інженерії аналітики, проведеному DBT, 57% фахівців з даних вказали низьку якість даних як основну проблему в своїй роботі.

Наслідки для моделей штучного інтелекту

Вплив брудних даних на розробку штучного інтелекту проявляється трьома основними способами:

  1. Зменшення точності та надійності: Моделі штучного інтелекту процвітають на закономірностях та кореляціях, отриманих з даних. Коли вхідні дані є забрудненими, моделі видають ненадійні виходи; широко відомі як “галюцинації штучного інтелекту”. Це може привести до помилкових стратегій, провальних продуктів та втрати довіри клієнтів.
  2. Посилення упереджень: Брудні дані часто містять упередження, які, якщо їх не контролювати, вбудовуються в алгоритми штучного інтелекту. Це може привести до дискримінаційних практик, особливо в чутливих сферах, таких як прийняття на роботу, кредитування та правоохоронна діяльність. Наприклад, якщо інструмент штучного інтелекту для підбору персоналу тренується на упередженому історичному даних про прийняття на роботу, він може несправедливо віддавати перевагу певним демографічним групам над іншими.
  3. Збільшення операційних витрат: Хибні системи штучного інтелекту потребують постійної корекції та повторної тренування, що споживає додатковий час та ресурси. Компанії можуть опинитися в безперервному циклі виправлення помилок замість інновацій та покращення.

Наступна датапокаліпсис

“Ми швидко наближаємося до “точки неповернення” – де некорпоративний згенерований контент значно перевищить кількість людського згенерованого контенту. Розробки штучного інтелекту самі по собі забезпечують нові інструменти для очищення та верифікації даних. Однак, величезна кількість згенерованого штучним інтелектом контенту в інтернеті зростає експоненційно.

Якщо все більше згенерованого штучним інтелектом контенту буде розміщено в інтернеті, і цей контент генерується великими мовними моделями, тренованими на згенерованому штучним інтелектом контенті, ми дивимося в майбутнє, де перші дані та довірені дані стануть загрозованими та цінними товарами.

Виклики розбавлення даних

Поширення згенерованого штучним інтелектом контенту створює кілька великих промислових викликів:

  • Контроль якості: Відмінність між людським згенерованим та згенерованим штучним інтелектом контентом стає дедалі складнішою, що робить складніше забезпечити якість та надійність даних, використовуваних для тренування моделей штучного інтелекту.
  • Проблеми інтелектуальної власності: Коли моделі штучного інтелекту випадково витягують та вчаться з згенерованого штучним інтелектом контенту, виникають питання про володіння та права, пов’язані з цими даними, що потенційно може привести до юридичних ускладнень.
  • Етичні наслідки: Недостатня прозорість щодо походження даних може привести до етичних проблем, таких як поширення дезінформації або посилення упереджень.

Дані як послуга стають фундаментальними

Дедалі більше послуг з надання даних (DaaS) шукаються для доповнення та поліпшення перших даних для цілей тренування. Справжня цінність DaaS полягає в самих даних, які були нормалізовані, очищені та оцінені за різними показниками довіри та комерційного використання, а також стандартизації процесів для відповідності системі, що приймає дані. Коли ця галузь дозріває, я передбачаю, що ми почнемо бачити цю стандартизацію по всій галузі даних. Ми вже бачимо цей пошук уніфікації в роздрібній медійній сфері.

Якщо штучний інтелект продовжує проникати в різні галузі, значення якості даних буде тільки зростати. Компанії, які пріоритезують чисті дані, здобудуть конкурентну перевагу, тоді як ті, хто знехтує цим, швидко відстануть.

Висока ціна брудних даних у розробці штучного інтелекту є гострою проблемою, яку не можна ігнорувати. Погана якість даних підкреслює саму основу систем штучного інтелекту, що призводить до хибних висновків, збільшення витрат та потенційних етичних ризиків. Приймаючи комплексні стратегії управління даними та розвиваючи культуру, яка цінує цілісність даних, організації можуть пом’якшити ці ризики.

У епоху, коли дані є новою нафтою, забезпечення їхньої чистоти не тільки технічна необхідність, але й стратегічна імператива. Бізнеси, які інвестують у чисті дані сьогодні, будуть тими, хто очолить інноваційний фронт завтра.

Елі Ґудман є генеральним директором та співзасновником Datos, компанії Semrush. З більш ніж 25-річним досвідом у сфері цифрових технологій та даних, Елі обіймав керівні посади в різних альтернативних компаніях з даних, включаючи 9-річну роботу в ComScore.