Лидеры мнений

Шаблон общего назначения Европейской комиссии для искусственного интеллекта – что это значит для обучения ИИ?

mm
Добавьте Unite.AI в избранные источники в Google

В июле Европейская комиссия (ЕК) представила новый шаблон общего назначения для искусственного интеллекта (ИИ). Это означает, что поставщики ИИ должны раскрыть содержание, вводимое в модели для их обучения. Это произошло после месяцев и месяцев заголовков о создателях утверждающих, что контент был использован без согласия для обучения ИИ.

С этим новым шаблоном ЕС сделал свою позицию ясной: прозрачность теперь не обсуждается. Обучение в “черном ящике”, когда что-то создается без раскрытия его внутренней работы, не будет вариантом для разработчиков ИИ. Это означает значительный сдвиг, поскольку работа в Европе теперь требует полной прозрачности модели и происхождения обучающих данных, заставляя переоценить сбор и использование данных.

Многие отметили резкую разницу между этим и недавно представленным планом действий США по ИИ, который фокусируется на дерегуляции. Как и с любым новым законом или правилом, бизнес теперь должен оценить, как шаблон ИИ повлияет на операции.

Если они работают в разных регионах, они будут делать то же самое с планом действий США по ИИ, что еще больше запутывает ситуацию. Из-за сложной природы этих правил и того, что регулирование разработки ИИ таким образом является незаслуженной территорией, выходы разработчиков, скорее всего, будут сильно различаться.

Анализ шаблона общего назначения для искусственного интеллекта

В июле этого года Европейская комиссия опубликовала обязательный шаблон для поставщиков ИИ, чтобы они могли опубликовать публичный обзор данных, использованных для обучения их моделей. В рамках закона ЕС об ИИ поставщики должны раскрыть категории данных, такие как публично доступные наборы данных, частные лицензированные данные, веб-контент, пользовательские данные и синтетические данные. Цель – позволить правообладателям, пользователям и разработчикам вниз по цепочке осуществлять свои законные права в соответствии с законодательством ЕС.

GPT обучается с помощью больших количеств данных; однако на текущем рынке существует ограниченная информация о происхождении этих данных. Публичный обзор, который этот шаблон устанавливает, предоставит всесторонний обзор данных, использованных для обучения модели, перечислит основные коллекции данных и объяснит другие источники, использованные.

Сравнение и контраст, план действий США по ИИ

В сравнении США твердо намерены выиграть гонку ИИ и сохранить свое конкурентное преимущество над Китаем, поскольку администрация Трампа объявила о своем плане действий по ИИ ранее этим летом. Этот новый каркас ИИ направлен на ускорение строительства энергозатратных центров обработки данных, которые обеспечивают работу систем ИИ, путем смягчения экологических правил. В то же время он стремится увеличить глобальный экспорт американских технологий ИИ. Включая 90 рекомендаций, план отражает растущие усилия США по сохранению своего лидерства над глобальными конкурентами.

План построен вокруг трех основных столпов – ускорения инноваций, строительства инфраструктуры ИИ Америки и содействия лидерству в международной дипломатии и безопасности ИИ.

В рамках этого ключевым выводом из плана является “открытый” толчок США для стимулирования инноваций и доступности. Аналогично, план подчеркивает, как правительство США будет “вести примером” в отношении роста ИИ – через обучение, обмен талантами и расширение принятия во всех отраслях.

С этим планом США направлены на упрощение всех своих текущих технологических правил, особенно экологических, чтобы обеспечить, что законодательство не замедляет рост, а также поощряют более широкое международное распространение программного и аппаратного обеспечения ИИ США. Этот “антирегуляторный” подход означает четкий сдвиг от более ранних каркасов, ориентированных на этику, прозрачность и ответственные инновации – вместо этого смещаясь в сторону более агрессивного плана действий “инновации прежде всего”.

Недостающий кусок

Стоит сделать шаг назад на этом этапе и рассмотреть, могут ли эти акты, хотя и разные, страдать от одних и тех же недостатков, которые заставят разработчиков увидеть отсутствие ценности в соблюдении их. Подходы ЕС и США оставляют критический пробел вокруг интеллектуальной собственности в наборах данных для обучения ИИ. Закон ЕС об ИИ требует обзора обучающих данных и политики соблюдения авторских прав, но он не устанавливает масштабируемый каркас для выявления или лицензирования объектов авторского права.

В США не существуют конкретных правил – оставляя компании ИИ ориентироваться в развивающемся правовом каркасе, формируемом судебными решениями и продолжающимися спорами с правообладателями. За пределами юридического текста то, что отсутствует, – это практическая сторона; ни один из подходов не определяет работоспособные, отраслевые методы для обнаружения защищенного контента в масштабе, проверки законного использования или упрощения лицензирования. До тех пор, пока такие решения не будут определены, неопределенность вокруг авторских прав в обучении ИИ останется значительной проблемой для отрасли.

Скрытая стоимость для бизнеса, пропускающего отслеживаемость ИИ

Несмотря на некоторые недостатки в этих правилах, будет предполагаться, что они заставят разработчиков ИИ сосредоточиться на том, как остаться на плаву с юридической точки зрения – но это не всегда так. На самом деле, реальная пропасть в ИИ сейчас не между правилами ЕС и США, а между компаниями, которые инвестируют в отслеживаемость сегодня, и теми, кто рассчитывает на то, что не придется. Это повторение того, что мы видели годы назад с реализацией Общего регламента по защите данных (GDPR) – компании, которые построили защиту данных с самого начала, не только избежали штрафов, но и получили доверие потребителей и более гладкий доступ к другим рынкам, которые позже скопировали стандарты GDPR.

Та же закономерность может возникать с ИИ. Отслеживаемость обучающих данных и решений модели, скорее всего, станет глобальным базовым уровнем, и компании, которые задерживают, будут должны переработать свои системы в будущем. Возвращаться, чтобы добавить документацию, отслеживание происхождения и функции аудита в существующую систему, намного дороже и сложнее, чем строить их с самого начала, отвлекая внимание от более ориентированных на ROI построений, которые компания хочет выполнить.

Иными словами, отслеживаемость и прозрачность не являются необязательными дополнениями; они должны быть встроены в системы ИИ с первого дня. Бизнес, который рассматривает их как после мысли, рискует застрять в инновациях, столкнуться с регуляторным ответом и проиграть гонку бесконечно.

Этический ИИ требует глобального единства

С макроперспективы эти поляризованные подходы создают реальную проблему для глобального бизнеса. Компании в рынках с более мягким регулированием, таких как США, могут масштабироваться быстрее в краткосрочной перспективе, но когда они решают войти в ЕС, они сталкиваются со стеной соблюдения: правила отслеживаемости и документации Закона об ИИ требуют возможностей, которые они никогда не строили.

Ретрофит отслеживаемости происхождения, документации и функций аудита в существующую систему является дорогим, медленным и разрушительным, особенно потому, что отслеживаемость является одной из наиболее ресурсоемких частей соблюдения. Это та же закономерность, которую мы видели с GDPR, где поздние приходящие к защите данных боролись с дорогими переделками и задержками доступа к рынку, а ранние новаторы получили долгосрочное преимущество.

Виктория Лапените является руководителем юридического отдела Oxylabs. С более чем десятилетним опытом работы в юридической сфере IT, Виктория Лапените приобрела глубокие знания в навигации по сложным бизнес- и регулирующим проблемам как внутренний юрисконсульт. Сегодня Виктория является руководителем юридического отдела Oxylabs, ведущей платформы для сбора веб-интеллекта. Команда Виктории специализируется на юридических сложностях новых технологий данных, от соблюдения нормативных требований и управления регуляторными рисками до защиты данных и отраслевых дискуссий о ответственной сборе данных.