Моделі та платформи ШІ
Як Синтетичні Дані Впливають На Галюцинації Штучного Інтелекту?
Хоча синтетичні дані є потужним інструментом, вони можуть зменшити галюцинації штучного інтелекту лише у певних обставинах. У майже всіх інших випадках вони будуть посилювати їх. Чому це так? Що це означає для тих, хто інвестував у них?
Як Синтетичні Дані Відмінні Від Реальних Даних?
Синтетичні дані – це інформація, яка генерується штучним інтелектом. Замість того, щоб зібрати її з реальних подій або спостережень, вона виробляється штучно. Однак вона достатньо нагадує оригінал, щоб продукувати точний, актуальний вивід. Це ідея, принаймні.
Щоб створити штучну базу даних, інженери штучного інтелекту тренують генеративний алгоритм на реальній реляційній базі даних. Коли його просять, він генерує другу базу даних, яка досить точно відображає першу, але містить жодної справжньої інформації. Хоча загальні тенденції та математичні властивості залишаються цілими, є достатньо шуму, щоб маскувати оригінальні взаємозв’язки.
Штучна база даних виходить за рамки деідентифікації, реплікуючи основну логіку взаємозв’язків між полями, а не просто заміняючи поля еквівалентними альтернативами. Оскільки вона не містить жодної ідентифікуючої інформації, компанії можуть використовувати її, щоб обійти правила конфіденційності та авторського права. Що ще важливіше, вони можуть вільно ділитися або поширювати її без страху порушення.
Однак, фальшиві дані частіше використовуються для доповнення. Бізнеси можуть використовувати їх, щоб збагатити або розширити вибірки, які занадто малі, роблячи їх достатньо великими, щоб тренувати системи штучного інтелекту ефективно.
Чи Зменшуємо Синтетичні Дані Галюцинації Штучного Інтелекту?
Іноді алгоритми посилаються на несуществуючі події або роблять логічно неможливі пропозиції. Ці галюцинації часто є безглуздими, вводять в оману або неправильними. Наприклад, велика мова модель може написати статтю про те, як приручити левів або стати лікарем у віці 6 років. Однак вони не всі такі екстремальні, що може зробити їх виявлення складним.
Якщо штучні дані належним чином куратори, вони можуть пом’якшити ці випадки. Реальна, автентична база даних є основою для будь-якої моделі, тому логічно припустити, що чим більше деталей має хтось, тим точніше буде вивід моделі. Доповнююча база даних дозволяє масштабувати, навіть для нішевих застосунків з обмеженою публічною інформацією.
Дебіасування – це ще один спосіб, яким штучна база даних може зменшити галюцинації штучного інтелекту. За даними MIT Sloan School of Management, це може допомогти адресувати упередженість, оскільки вона не обмежується оригінальним розміром вибірки. Професіонали можуть використовувати реалістичні деталі, щоб заповнити пробіли, де вибрані субпопуляції недо- або надрепрезентовані.
Як Штучні Дані Погіршують Галюцинації
Оскільки інтелектуальні алгоритми не можуть розуміти чи контекстуалізувати інформацію, вони схильні до галюцинацій. Генеративні моделі – особливо великі мови моделі – особливо вразливі. У деяких аспектах штучні факти посилюють проблему.
Посилення Упередженості
Як і люди, штучний інтелект може вивчати та відтворювати упередженість. Якщо штучна база даних перевищує деякі групи, а недо- чи надрепрезентує інші – що є занепокоєнням легко зробити випадково – логіка прийняття рішень буде викривлена, негативно впливаючи на точність виводу.
Аналогічна проблема може виникнути, коли компанії використовують фальшиві дані, щоб усунути реальні упередженості, оскільки вони можуть більше не відображати реальність. Наприклад, оскільки більше 99% випадків раку молочної залози трапляються у жінок, використання додаткової інформації для балансування представництва може викривити діагнози.
Перетинні Галюцинації
Перетинність – це соціологічна основа, яка описує, як демографи, такі як вік, стать, раса, зайнятість і клас, перетинаються. Вона аналізує, як групи соціальної ідентичності результатують унікальні комбінації дискримінації та привілеїв.
Коли генеративна модель запитується про створення штучних деталей на основі того, на чому вона тренувалася, вона може генерувати комбінації, які не існували в оригіналі або логічно неможливі.
Еріка Джонсон, професор гендеру та суспільства в університеті Лінкьопінга, працювала з науковцем штучного інтелекту, щоб продемонструвати це явище. Вони використали генеративну мережу для створення синтетичних версій даних перепису населення США з 1990 року.
Відразу ж вони помітили проблему. Штучна версія мала категорії з назвами “дружина і одиночна” і “ніколи-одружені чоловіки”, обидві з яких були перетинними галюцинаціями.
Без належної кураторії репліка бази даних завжди буде надрепрезентувати домінантні субпопуляції в базах даних, а недо- чи виключати недо- чи виключені групи. Випадки та аутлієри можуть бути повністю проігноровані на користь домінантних тенденцій.
Колапс Моделі
Надмірна залежність від штучних закономірностей та тенденцій призводить до колапсу моделі – де продуктивність алгоритму суттєво погіршується, оскільки він стає менш адаптованим до реальних спостережень та подій.
Це явище особливо очевидне в наступних генераціях генеративного штучного інтелекту. Повторне використання штучної версії для тренування призводить до самозаснованого циклу. Одне дослідження показало, що їх якість та відкликання поступово знижуються без достатньої кількості недавніх, фактичних даних у кожній генерації.
Перефітування
Перефітування – це надмірна залежність від тренувальних даних. Алгоритм спочатку працює добре, але буде галюцинувати, коли йому будуть представлені нові дані. Штучна інформація може посилити цю проблему, якщо вона не точно відображає реальність.
Вплив Продовження Використання Синтетичних Даних
Ринок синтетичних даних бурхливо розвивається. Компанії в цій нішевій галузі зібрали близько 328 мільйонів доларів у 2022 році, у порівнянні з 53 мільйонами доларів у 2020 році – це зростання на 518% за лише 18 місяців. Варто зазначити, що це виключно публічно відоме фінансування, що означає, що фактична цифра може бути ще вищою. Безумовно, компанії вкрай зацікавлені в цьому рішенні.
Якщо компанії продовжують використовувати штучну базу даних без належної кураторії та дебіасування, продуктивність їхньої моделі буде поступово погіршуватися, що призведе до погіршення інвестицій у штучний інтелект. Результати можуть бути більш серйозними, залежно від застосування. Наприклад, у сфері охорони здоров’я зростання галюцинацій може привести до неправильних діагнозів або неправильного лікування, що призведе до погіршення результатів лікування пацієнтів.
Рішення Не Звучить Про Повернення До Реальних Даних
Системи штучного інтелекту потребують мільйонів, якщо не мільярдів, зображень, тексту та відео для тренування, більша частина яких збирається з публічних веб-сайтів та компілюється у величезні відкриті бази даних. Нажаль, алгоритми споживають цю інформацію швидше, ніж люди можуть її генерувати. Що відбувається, коли вони вивчають все?
Бізнес-лідери стурбовані тим, що вони досягнуть стіни даних – точки, на якій вся публічна інформація в інтернеті буде вичерпана. Це може відбутися швидше, ніж вони думають.
Хоча кількість простого тексту на середньому веб-сайті та кількість користувачів інтернету зростають на 2-4% щорічно, алгоритми вичерпують високоякісні дані. Лише 10-40% можна використовувати для тренування без компрометації продуктивності. Якщо тенденції продовжаться, запас людської публічної інформації може вичерпатися до 2026 року.
В усіх імовірностях сектор штучного інтелекту може досягти стіни даних ще раніше. Бум генеративного штучного інтелекту за останні кілька років посилив напруженість щодо власності інформації та порушення авторських прав. Більше власників веб-сайтів використовують протокол виключення роботів – стандарт, який використовує файл robots.txt для блокування веб-кравлерів – або роблять ясно, що їхній сайт закритий.
Дослідження 2024 року, опубліковане групою дослідників під керівництвом Массачусетського технологічного інституту, показало, що великомасштабна веб-кравлінг-корпус Colossal Cleaned Common Crawl (C4) обмеження зростають. Більше 28% найбільш активних, критичних джерел у C4 були повністю заблоковані. Крім того, 45% C4 зараз позначено як закрито умовами використання.
Якщо компанії поважатимуть ці обмеження, свіжість, актуальність та точність реальних публічних фактів будуть знижуватися, що змусить їх покладатися на штучні бази даних. Вони можуть не мати багато вибору, якщо суди вирішать, що будь-яка альтернатива є порушенням авторських прав.
Майбутнє Синтетичних Даних І Галюцинацій Штучного Інтелекту
Як авторські права модернізуються та більше власників веб-сайтів ховають свій контент від веб-кравлерів, генерація штучних баз даних стане дедалі популярнішою. Організації повинні бути готові до загрози галюцинацій.












