Лидеры мнений
Высокая цена грязных данных в разработке ИИ
Не секрет, что в разработке ИИ происходит современная золотая лихорадка. Согласно Индексу тенденций работы 2024 года от Microsoft (MSFT ) и Linkedin, более 40% лидеров бизнеса ожидают полного переработки своих бизнес-процессов с помощью искусственного интеллекта (ИИ) в течение ближайших нескольких лет. Этот сейсмический сдвиг не только технологическое обновление, но и фундаментальная трансформация того, как работают бизнесы, принимают решения и взаимодействуют с клиентами. Этот быстрый рост создает спрос на данные и инструменты управления первичными данными. Согласно Forrester, удивительные 92% лидеров технологий планируют увеличить свои бюджеты на управление данными и ИИ в 2024 году.
В последнем Глобальном опросе McKinsey об ИИ, 65% респондентов указали, что их организации регулярно используют технологии генеративного ИИ. Хотя это внедрение означает значительный скачок вперед, оно также подчеркивает критическую проблему: качество данных, которые кормят эти системы ИИ. В отрасли, где эффективный ИИ такой же хороший, как данные, на которых он обучен, надежные и точные данные становятся все более трудными для получения.
Высокая цена плохих данных
Плохие данные не являются новой проблемой, но их влияние усиливается в эпоху ИИ. В 2017 году исследование Массачусетского технологического института (MIT) оценило, что плохие данные обходятся компаниям в удивительные 15% до 25% их дохода. В 2021 году Gartner оценил, что плохие данные обходятся организациям в среднем 12,9 миллиона долларов в год.
Грязные данные – данные, которые являются неполными, неточными или несоответствующими – могут иметь каскадный эффект на системы ИИ. Когда модели ИИ обучаются на данных плохого качества, полученные идеи и прогнозы фундаментально ошибочны. Это не только подрывает эффективность приложений ИИ, но и представляет значительные риски для бизнеса, который полагается на эти технологии для принятия критически важных решений.
Это создает большую головную боль для корпоративных команд по науке о данных, которые были вынуждены все больше сосредотачивать свои ограниченные ресурсы на очистке и организации данных. В недавнем отчете о состоянии инженерии аналитики, проведенном DBT, 57% профессионалов в области науки о данных назвали плохое качество данных основной проблемой в своей работе.
Последствия для моделей ИИ
Влияние плохих данных на разработку ИИ проявляется в трех основных аспектах:
- Снижение точности и надежности: Модели ИИ процветают на закономерностях и корреляциях, полученных из данных. Когда входные данные испорчены, модели производят ненадежные выходные данные; широко известные как “зрительные обманы ИИ”. Это может привести к ошибочным стратегиям, неудачам продукта и потере доверия клиентов.
- Усиление предвзятости: Грязные данные часто содержат предвзятости, которые, если их не контролировать, внедряются в алгоритмы ИИ. Это может привести к дискриминационной практике, особенно в чувствительных областях, таких как прием на работу, кредитование и правоохранительные органы. Например, если инструмент ИИ по набору персонала обучен на предвзятых исторических данных о приеме на работу, он может несправедливо отдавать предпочтение определенным демографическим группам над другими.
- Увеличение операционных затрат: Неисправные системы ИИ требуют постоянной настройки и повторного обучения, что потребляет дополнительное время и ресурсы. Компании могут оказаться в бесконечном цикле исправления ошибок вместо того, чтобы инновировать и совершенствоваться.
Наступающая Датапокалипсис
“Мы быстро приближаемся к “точке бифуркации” – где не генерируемый человек контент будет намного превышать количество генерируемого человеком контента. Улучшения в самом ИИ предоставляют новые инструменты для очистки и проверки данных. Однако огромное количество контента, генерируемого ИИ, в Интернете растет экспоненциально.
По мере того, как все больше контента, генерируемого ИИ, публикуется в Интернете, и этот контент генерируется ИИ, обученным на контенте, генерируемом ИИ, мы смотрим в будущее, где первичные и доверенные данные становятся исчезающими и ценными товарами.
Проблемы разбавления данных
Распространение контента, генерируемого ИИ, создает несколько основных проблем отрасли:
- Контроль качества: Различие между человеко-генерируемыми и ИИ-генерируемыми данными становится все более трудным, что делает более трудным обеспечение качества и надежности данных, используемых для обучения моделей ИИ.
- Проблемы интеллектуальной собственности: Поскольку модели ИИ непреднамеренно соскабливают и учатся на контенте, генерируемом ИИ, возникают вопросы о владении и правах, связанных с данными, что потенциально может привести к юридическим осложнениям.
- Этические последствия: Отсутствие прозрачности об источниках данных может привести к этическим проблемам, таким как распространение дезинформации или укрепление предвзятости.
Данные как услуга становятся фундаментальными
Все чаще ищутся решения “Данные как услуга” (DaaS), чтобы дополнить и улучшить первичные данные для целей обучения. Настоящая ценность DaaS заключается в самих данных, которые нормализованы, очищены и оценены для различных случаев использования и коммерческого применения, а также стандартизации процессов для того, чтобы система могла переварить данные. По мере того, как эта отрасль созревает, я предсказываю, что мы начнем видеть эту стандартизацию во всей отрасли данных. Мы уже видим это стремление к унификации в секторе розничных медиа.
По мере того, как ИИ продолжает проникать в различные отрасли, значение качества данных будет только усиливаться. Компании, которые отдают приоритет чистым данным, получат конкурентное преимущество, в то время как те, кто пренебрегает этим, быстро отстанут.
Высокая цена грязных данных в разработке ИИ является насущной проблемой, которую нельзя игнорировать. Плохое качество данных подрывает саму основу систем ИИ, что приводит к ошибочным идеям, увеличению затрат и потенциальным этическим ловушкам. Принимая комплексные стратегии управления данными и культивируя культуру, которая ценит целостность данных, организации могут смягчить эти риски.
В эпоху, когда данные являются новой нефтью, обеспечение их чистоты не только техническая необходимость, но и стратегическая императива. Бизнесы, которые инвестируют в чистые данные сегодня, будут теми, кто будет лидировать на фронтире инноваций завтра.












