Модели и платформы ИИ
Как синтетические данные влияют на галлюцинации ИИ?
Хотя синтетические данные являются мощным инструментом, они могут уменьшить галлюцинации искусственного интеллекта только в определенных обстоятельствах.几乎 во всех остальных случаях они будут усиливать их. Почему это так? Что это означает для тех, кто вложил в них средства?
В чем разница между синтетическими данными и реальными данными?
Синтетические данные – это информация, генерируемая ИИ. Вместо того, чтобы собираться из реальных событий или наблюдений, она производится искусственно. Однако она достаточно похожа на оригинал, чтобы производить точный и актуальный вывод.
Чтобы создать искусственную базу данных, инженеры ИИ обучают алгоритм генерации на реальной реляционной базе данных. Когда его просят, он производит вторую базу данных, которая достаточно точно отражает первую, но не содержит никакой реальной информации.
Искусственная база данных идет дальше, чем деидентификация, реплицируя основную логику отношений между полями, вместо того, чтобы просто заменять поля на эквивалентные альтернативы. Поскольку она не содержит никаких идентифицирующих деталей, компании могут использовать ее, чтобы обойти правила конфиденциальности и авторских прав.
Однако фальшивая информация чаще используется для дополнения. Бизнес может использовать ее, чтобы обогатить или расширить размеры выборки, которые слишком малы, сделав их достаточно большими, чтобы эффективно обучать системы ИИ.
Уменьшают ли синтетические данные галлюцинации ИИ?
Иногда алгоритмы ссылаются на несуществующие события или делают логически невозможные предложения. Эти галлюцинации часто бессмысленны, вводят в заблуждение или неверны.
Если искусственные данные правильно отобраны, они могут смягчить эти инциденты. Аутентичная база данных – это основа для любой модели, поэтому логично, что чем больше информации у кого-то есть, тем более точным будет вывод модели.
Дебиасирование – это еще один способ, которым синтетическая база данных может уменьшить галлюцинации ИИ. Согласно MIT Sloan School of Management, она может помочь решить проблему предвзятости, поскольку она не ограничена исходным размером выборки.
Как искусственные данные ухудшают галлюцинации
Поскольку интеллектуальные алгоритмы не могут рассуждать или контекстуализировать информацию, они склонны к галлюцинациям. Генеративные модели, особенно предобученные большие языковые модели, особенно уязвимы.
Усиление предвзятости
Как и люди, ИИ может учиться и воспроизводить предвзятости. Если искусственная база данных переоценивает некоторые группы, а недооценивает другие, ее логика принятия решений будет искажена, что негативно повлияет на точность вывода.
Аналогичная проблема может возникнуть, когда компании используют фальшивые данные, чтобы исключить реальные предвзятости, поскольку они могут больше не отражать реальность.
Пересечение галлюцинаций
Пересечение – это социологическая основа, которая описывает, как демографические данные, такие как возраст, пол, раса, профессия и класс, пересекаются.
Когда генеративная модель запрашивает производство искусственных деталей на основе того, на чем она была обучена, она может генерировать комбинации, которые не существовали в оригинале или логически невозможны.
Эрика Джонсон, профессор гендера и общества в Университете Линкёпинга, работала с ученым в области машинного обучения, чтобы продемонстрировать это явление.
Они использовали генеративную сеть для создания синтетических версий данных переписи населения США 1990 года.
Сразу же они заметили проблему. Искусственная версия имела категории, озаглавленные “жена и одинокая” и “никогда не женатые мужья”, которые были пересекающимися галлюцинациями.
Без надлежащей обработки реплицированная база данных всегда будет переоценивать доминирующие субпопуляции в наборах данных, а недооценивать – или даже исключать – недопредставленные группы.
Коллапс модели
Чрезмерная зависимость от искусственных закономерностей и тенденций приводит к коллапсу модели, когда производительность алгоритма резко ухудшается, поскольку он становится менее адаптируемым к реальным наблюдениям и событиям.
Это явление особенно заметно в следующих поколениях генеративных моделей ИИ.
Переобучение
Переобучение – это чрезмерная зависимость от обучающих данных. Алгоритм работает хорошо изначально, но будет галлюцинировать, когда ему будут представлены новые точки данных.
Последствия продолженного использования синтетических данных
Рынок синтетических данных расцветает. Компании в этой нишевой отрасли привлекли около 328 миллионов долларов в 2022 году, по сравнению с 53 миллионами долларов в 2020 году – это увеличение на 518% за всего 18 месяцев.
Если компании продолжат использовать искусственную базу данных без надлежащей обработки и дебиасирования, производительность их модели будет прогрессивно ухудшаться, что приведет к ухудшению их инвестиций в ИИ.
Решение не будет включать возвращение к реальным данным
Системы ИИ требуют миллионов, если не миллиардов, изображений, текста и видео для обучения, большая часть которых скрапится с публичных веб-сайтов и компилируется в огромные, открытые наборы данных.
Бизнес-лидеры обеспокоены тем, что они столкнутся со “стеной данных” – точкой, в которой вся публичная информация в интернете будет исчерпана.
Хотя количество простого текста на средней веб-странице и количество пользователей интернета растут на 2-4% в год, алгоритмы заканчивают высококачественные данные.
Вероятно, что сектор ИИ столкнется со “стеной данных” еще раньше.
Бум генеративных моделей ИИ в последние годы усилил напряженность вокруг владения информацией и авторских прав.
Если компании будут уважать эти ограничения, свежесть, актуальность и точность реальных публичных фактов будет снижаться, что заставит их полагаться на искусственные базы данных.
Будущее синтетических данных и галлюцинаций ИИ
По мере того, как законы об авторских правах будут совершенствоваться и больше владельцев веб-сайтов будут скрывать свой контент от веб-краулеров, генерация искусственных баз данных станет все более популярной.












