Лідери думок

Дилема даних штучного інтелекту: конфіденційність, регулювання та майбутнє етичного ШІ

mm
Додайте Unite.AI до бажаних джерел у Google

Рішення на основі штучного інтелекту швидко приймаються в різних галузях, послугах та продуктах щодня. Однак їх ефективність залежить повністю від якості даних, на яких вони тренуються – аспект, часто недооцінюваний або непомічений у процесі створення набору даних.

Оскільки органи захисту даних посилюють контроль над тим, як технології штучного інтелекту відповідають законам про захист конфіденційності та дані, компанії стикаються з зростаючим тиском щодо пошуку, анотації та доопрацювання наборів даних у відповідності з вимогами законодавства та етики.

Чи існує真正ний етичний підхід до створення наборів даних штучного інтелекту? Які найбільші етичні виклики стоять перед компаніями, і як вони їх вирішують? Як зміни в законодавчих рамках впливають на доступність та використання тренувальних даних? Давайте розглянемо ці питання.

Конфіденційність даних та штучний інтелект

За своєю суттю, штучний інтелект потребує великої кількості персональних даних, щоб виконувати завдання. Це викликало занепокоєння щодо збору, зберігання та використання цих даних. Багато законів у світі регулюють та обмежують використання персональних даних, від GDPR та нового Закону про штучний інтелект в Європі до HIPAA у США, який регулює доступ до даних пацієнтів у медичній галузі.

Посилання на те, як суворі закони про захист даних у світі / DLA Piper

Наприклад, чотирнадцять штатів США зараз мають комплексні закони про захист конфіденційності даних, а ще шість повинні вступити в силу у 2025 та на початку 2026 років. Нова адміністрація сигналізує про зміну підходу до виконання законів про захист конфіденційності даних на федеральному рівні. Головний акцент робиться на регулюванні штучного інтелекту, підкреслюючи розвиток інновацій, а не введення обмежень. Ця зміна включає в себе скасування попередніх виконавчих наказів щодо штучного інтелекту та введення нових директив для керівництва його розробкою та застосуванням.

Законодавство про захист даних розвивається в різних країнах: у Європі закони суворіші, тоді як в Азії або Африці вони менш суворі.

Однак персональні дані, що ідентифікують особу (PII) – наприклад, зображення обличчя, офіційні документи, такі як паспорти, або інші чутливі персональні дані – загалом обмежені в більшості країн до певної міри. За даними УНКТАД, збір, використання та передача персональної інформації третім особам без повідомлення або згоди споживачів є великою проблемою для більшості світу. 137 з 194 країн мають регуляторні акти, які забезпечують захист даних та конфіденційності. Як наслідок, більшість глобальних компаній приймають широкі заходи для уникнення використання PII для тренування моделей, оскільки законодавство, наприклад, в ЄС, суворо забороняє такі практики, за рідкісними винятками в сильно регульованих галузях, таких як правоохоронна діяльність.

З часом законодавство про захист даних стає все більш повним і глобально застосовується. Компанії адаптують свої практики, щоб уникнути юридичних викликів та відповідати новим законодавчим та етичним вимогам.

Які методи компанії використовують для отримання даних?

Отже, коли ми вивчаєємо питання захисту даних для тренування моделей, важливо спочатку зрозуміти, де компанії отримують ці дані. Існують три основних джерела даних.

  • Збір даних

Цей метод дозволяє збирати дані з платформ краудсорсингу, медіа-активів та відкритих наборів даних.

Важливо пам’ятати, що публічні медіа-активи підлягають різним ліцензійним угодам. Навіть ліцензія на комерційне використання часто явно зазначає, що вміст не може бути використаний для тренування моделей. Ці очікування відрізняються платформою за платформою та вимагають від бізнесу підтвердження можливості використання вмісту в тих спосіб, який їм потрібно.

Навіть коли компанії штучного інтелекту отримують вміст законно, вони все одно можуть зіткнутися з деякими проблемами. Швидкий розвиток тренування моделей штучного інтелекту значно випередив законодавчі рамки, що означає, що правила та регуляції, пов’язані з даними для тренування штучного інтелекту, все ще розвиваються. Як наслідок, компанії повинні бути поінформовані про юридичні розробки та ретельно переглянути ліцензійні угоди перед використанням вмісту зі(stock) для тренування штучного інтелекту.

  • Створення даних

Одним з найбезпечніших методів підготовки наборів даних є створення унікального вмісту, наприклад, зйомка людей у контрольованих середовищах, таких як студії або зовнішні місця. Перед участю люди підписують згоду на використання їхніх персональних даних, вказуючи, які дані збираються, як і де вони будуть використані, та хто матиме доступ до них. Це забезпечує повний юридичний захист і дає компаніям впевненість, що вони не зіткнуться з претензіями щодо незаконного використання даних.

Основний недолік цього методу полягає в його вартості, особливо при створенні даних для крайніх випадків або великомасштабних проектів. Однак великі компанії та підприємства все частіше продовжують використовувати цей підхід принаймні з двох причин. По-перше, це забезпечує повну відповідність усім стандартам та законодавчим вимогам. По-друге, це надає компаніям дані, повністю адаптовані до їхніх конкретних сценаріїв та потреб, гарантуючи найвищу точність у тренуванні моделей.

  • Генерація синтетичних даних

Використання програмних інструментів для створення зображень, тексту або відео на основі заданого сценарію. Однак синтетичні дані мають обмеження: вони генеруються на основі попередньо визначених параметрів і не мають природної мінливості реальних даних.

Ця відсутність може негативно вплинути на моделі штучного інтелекту. Хоча це не стосується всіх випадків і не завжди відбувається, все ж важливо пам’ятати про “колапс моделі” – момент, у якому надмірна залежність від синтетичних даних призводить до погіршення моделі, що призводить до низькоякісних виходів.

Синтетичні дані все ж можуть бути дуже ефективними для базових завдань, таких як розпізнавання загальних закономірностей, ідентифікація об’єктів або розпізнавання фундаментальних візуальних елементів, таких як обличчя.

Однак це не найкращий варіант, коли компанії потрібно тренувати модель з нуля або мати справу з рідкісними чи дуже специфічними сценаріями.

Найбільш показові ситуації відбуваються в середовищі кабіни, наприклад, водій, відволікнутий дитиною, хтось, хто виглядає втомленим за кермом, або навіть випадки безроздумного водіння. Ці дані не часто зустрічаються в публічних наборах даних – і не повинні бути – оскільки вони включають реальних людей у приватних умовах. Оскільки моделі штучного інтелекту покладаються на тренувальні дані для генерації синтетичних виходів, вони мають труднощі з точним представленням сценаріїв, з якими вони ніколи не зустрічалися.

Коли синтетичні дані не справляються, створені дані – зібрані через контрольовані середовища з реальними акторами – стають розв’язанням.

Постачальники рішень щодо даних, такі як Keymakr, встановлюють камери в автомобілях, наймають акторів і записують дії, такі як догляд за дитиною, пиття з пляшки або прояв ознак втоми. Актори підписують контракти, які явно погоджуються на використання їхніх даних для тренування штучного інтелекту, забезпечуючи відповідність законодавству про конфіденційність.

Відповідальності у процесі створення набору даних

Кожен учасник процесу, від клієнта до компанії-анотатора, має певні обов’язки, визначені в їхньому угоді. Перший крок – укладення контракту, який деталізує природу відносин, включаючи пункти про нерозголошення та інтелектуальну власність.

Розглянемо перший варіант роботи з даними, тобто коли вони створюються з нуля. Права інтелектуальної власності вказують, що будь-які дані, створені постачальником, належать компанії-замовнику, тобто створюються на їхньому behalf. Це також означає, що постачальник повинен забезпечити, щоб дані були отримані законно та правильно.

Як компанія з рішень щодо даних, Keymakr забезпечує відповідність вимогам законодавства про захист даних, спочатку перевіряючи юрисдикцію, в якій створюються дані, отримуючи належну згоду від усіх учасників, та гарантуючи, що дані можуть бути законно використані для тренування штучного інтелекту.

Важливо також пам’ятати, що після використання даних для тренування моделей штучного інтелекту стає майже неможливо визначити, які конкретні дані внесли свій внесок у модель, оскільки штучний інтелект поєднує все це. Тому конкретний вихід не схильний бути його виходом, особливо коли мова йде про мільйони зображень.

Через свою швидку розробку, ця область все ще встановлює чіткі керівні принципи щодо розподілу відповідальності. Це схоже на складності, пов’язані з самоходними автомобілями, де питання про відповідальність – чи це водій, виробник чи компанія-програміст – все ще потребують чіткого розподілу.

В інших випадках, коли постачальник анотації отримує набір даних для анотації, він припускає, що клієнт отримав дані законно. Якщо є явні ознаки того, що дані були отримані незаконно, постачальник повинен повідомити про це. Однак такі явні випадки дуже рідкісні.

Важливо також пам’ятати, що великі компанії, корпорації та бренди, які цінують свою репутацію, дуже обережно ставляться до джерел своїх даних, навіть якщо вони не були створені з нуля, а взяті з інших законних джерел.

У підсумку, відповідальність кожного учасника процесу роботи з даними залежить від угоди. Це можна вважати частиною більшої “ланцюга сталості”, де кожен учасник має важливу роль у підтриманні законодавчих та етичних стандартів.

Які забобони існують щодо задньої частини розробки штучного інтелекту?

Одним з великих забобонів щодо розробки штучного інтелекту є те, що моделі штучного інтелекту працюють подібно до пошукових систем, збираючи та агрегуючи інформацію для презентації користувачам на основі знань, отриманих під час навчання. Однак моделі штучного інтелекту, особливо мовні моделі, часто функціонують на основі ймовірностей, а не справжнього розуміння. Вони передбачають слова або терміни на основі статистичної ймовірності, використовуючи закономірності, побачені в попередніх даних. Штучний інтелект нічого не “знає”; він екстраполює, здогадується та коригує ймовірності.

Крім того, багато людей припускають, що тренування штучного інтелекту вимагає величезних наборів даних, але більшість того, що штучний інтелект повинен розпізнавати – наприклад, собак, котів або людей – вже добре встановлено. Тепер увага зосереджена на поліпшенні точності та вдосконаленні моделей, а не на повторному винаході можливостей розпізнавання. Більша частина розробки штучного інтелекту сьогодні полягає в закритті останніх малих прогалин у точності, а не в початку з нуля.

Етичні виклики та вплив Закону Європейського Союзу про штучний інтелект та пом’якшення американських регуляцій на глобальний ринок штучного інтелекту

Когда ми обговорюємо етику та законодавство щодо роботи з даними, важливо чітко зрозуміти, що визначає “етичний” штучний інтелект.

Найбільший етичний виклик, з яким компанії стикаються сьогодні в сфері штучного інтелекту, полягає в тому, щоб визначити, що є недопустимим для штучного інтелекту робити або чого його можна навчити. Існує широкий консенсус щодо того, що етичний штучний інтелект повинен допомагати, а не шкодити людям, і уникати обману. Однак системи штучного інтелекту можуть робити помилки або “галюцинувати”, що викликає питання щодо визначення цих помилок як дезінформації чи шкоди.

Етика штучного інтелекту – це велика дискусія, в яку включаються організації, такі як ЮНЕСКО, – з ключевими принципами, пов’язаними з авдитованістю та слідовимістю виходів.

Законодавчі рамки, пов’язані з доступом до даних та тренуванням штучного інтелекту, відіграють значну роль у формуванні етичного ландшафту штучного інтелекту. Країни з менш обмежувальними правилами щодо використання даних дозволяють більш доступні дані для тренування, тоді як країни зі суворішими законами про дані обмежують доступність даних для тренування штучного інтелекту.

Наприклад, Європа, яка прийняла Закон про штучний інтелект, та США, які скасували багато регуляцій щодо штучного інтелекту, пропонують контрастні підходи, які вказують на поточний глобальний ландшафт.

Закон Європейського Союзу про штучний інтелект суттєво впливає на компанії, які працюють в Європі. Він вводить суворий регуляторний каркас, що робить для бізнесу складним використовувати або розробляти певні моделі штучного інтелекту. Компаніям потрібно отримувати спеціальні ліцензії для роботи з певними технологіями, а в багатьох випадках регуляції фактично роблять для малих підприємств складним відповідати цим вимогам.

Як наслідок, деякі стартапи можуть вирішити покинути Європу або уникають діяльності там зовсім, подібно до впливу, який спостерігається у криптовалютних регуляціях. Більші компанії, які можуть собі дозволити інвестиції, необхідні для відповідності вимогам, можуть адаптуватися. Однак Закон може змусити інновації штучного інтелекту покинути Європу на користь ринків, таких як США або Ізраїль, де регуляції менш суворі.

Рішення США про інвестування великих ресурсів у розвиток штучного інтелекту з менш обмежувальними правилами також може мати недоліки, але запрошує більшу різноманітність на ринку. Хоча Європейський Союз зосереджується на безпеці та регуляторній відповідності, США, ймовірно, будуть сприяють більш ризикованому та інноваційному експериментуванню.

Міхаель Абрамов є засновником та генеральним директором Introspector, який має понад 15 років досвіду у сфері програмної інженерії та комп'ютерного зору AI систем, які використовуються для створення інструментів маркування підприємства.

Міхаель розпочав свою кар'єру як програмний інженер та менеджер з досліджень і розробок, будуючи масштабовані системи даних та керуючи міжфункціональними інженерними командами. До 2025 року він обіймав посаду генерального директора Keymakr, компанії з послуг маркування даних, де він впровадив людські цикли роботи, просунуті системи контролю якості та індивідуальне інструментування для підтримки великомасштабних потреб комп'ютерного зору та автономності.

Він має ступінь бакалавра комп'ютерних наук та освіту в галузі інженерії та творчих мистецтв, що надає йому міжгалузевий погляд на вирішення складних проблем. Міхаель живе на перетині технологічних інновацій, стратегічного лідерства продукту та реального впливу, рухаючи вперед наступний рубіж автономних систем та інтелектуальної автоматизації.