Взгляд Anderson

Методы стирания IP-адресов в ИИ

mm
Добавьте Unite.AI в избранные источники в Google
An AI-generated image of Lady Justice surrounded by 'laundered' data. GPT-1.5.

Если есть юридический расчет, который может произойти над использованием интеллектуальной собственности в обучении ИИ, то также существуют несколько методов сокрытия такого использования.

 

Мнение Текущая, быстро развивающаяся революция в генеративном ИИ происходит в наиболее юридически опасной среде, которая сопровождала любое трансформационное технологическое развитие с девятнадцатого века.

До 3-4 лет назад сообщество исследователей машинного обучения пользовалось негласным (часто явным) разрешением на использование материалов, защищенных авторским правом, в процессе разработки новых систем; поскольку эти системы еще не были успешными, в плане зрелости или коммерческой жизнеспособности, результаты были, во всех смыслах, академическими.

В этот период внезапный успех нового поколения моделей крупного языка на основе диффузии (LLM, таких как ChatGPT и Claude) и моделей языка-видения (VLM, таких как Sora) сигнализировал о том, что эти абстрактные и ранее «безобидные» направления исследований превратились в коммерчески жизнеспособные, и переросли свою «бесплатную пропуску», в плане использования чужой интеллектуальной собственности.

С этого момента правообладатели будут добиваться доли в плодах систем ИИ, обученных в основном или частично на их защищенных авторским правом или иным образом защищенных данных, что приведет к продолжающемуся лавине судебных дел, которые требуют некоторых усилий, чтобы даже отслеживать их.

Ограниченный только делами, возбужденными в США, новые дела появляются с бешеной скоростью в США и за рубежом. Источник - https://copyrightalliance.org/artificial-intelligence-copyright/court-cases/

Здесь ограниченный только делами, возбужденными в США, новые дела появляются с бешеной скоростью в США и за рубежом. Источник

Принуждение к «бесплатному обеду»

Финансовые обязательства текущие в отношении инфраструктуры ИИ были высказаны некоторыми голосами как попытка закрепить «опасный для авторского права» ИИ так глубоко в экономике общества, что он станет не только «слишком большим, чтобы потерпеть неудачу», но и «слишком мощным, чтобы судить» – или, по крайней мере, слишком мощным, чтобы успешные судебные дела могли быть допущены к срыву революции.

В направлении этого общего настроения, текущий президент США вводит в политику свое мнение, что «Вы не можете ожидать, что у вас будет успешная программа ИИ, когда каждая статья, книга или все, что вы прочитали или изучали, вы должны заплатить за это».

Действительно? Ничто подобное не произошло в западной промышленной эпохе, и это представляет собой движение, которое сильно конфликтует с традиционной американской культурой судебных разбирательств и возмещения ущерба; возможно, наиболее близкие подобные позиции – обязательное истечение патентов на лекарства после 20 лет (которое само по себе часто подвергается нападкам), и ограничение ожиданий конфиденциальности в общественных местах.

Однако времена меняются; в отсутствие гарантии, что текущая тенденция к «высшей власти» против защиты интеллектуальной собственности не ослабнет или не будет обращена вспять позже, существуют несколько второстепенных подходов, которые становятся стандартной практикой в разработке систем ИИ и обращении с спорной обучающей данными, которая питает его.

Наборы данных по прокси

Один из этих подходов принимает замечательно похожий подход на (не всегда успешную) защиту торрент-сайтов, которые утверждают, что они не хранят никаких спорных материалов – или любых материалов вообще.

Помимо устранения необходимости хранить и обслуживать большие объемы слабо сжимаемых изображений или видеоданных, такие коллекции позволяют быстро обновлять – например, удаление материалов по запросам правообладателей – и версионировать.

Как и торренты являются только указателями на то, где можно найти материалы, защищенные авторским правом, несколько влиятельных наборов данных являются сами по себе только «указателями»-стилем списками существующих данных; если конечный пользователь хочет использовать эти списки как список загрузки для своей собственной базы данных, это зависит от него, поскольку ответственность кураторов, кажется, ограничена.

Среди них есть набор данных Conceptual 12M от Google Research, который предоставляет подписи для изображений, но только указывает на места в сети, где эти изображения существуют (или существовали на момент создания):

Два примера из набора данных Conceptual 12M. Источник - https://github.com/google-research-datasets/conceptual-12m/blob/main/images/cc12m_1.jpg

Два примера из набора данных Conceptual 12M. Источник

Другой известный пример, и тот, который теперь имеет законное право на почитание в истории ИИ, является набор данных LAION, который облегчил появление генеративной системы Stable Diffusion в 2022 году – первой такой платформы, которая предлагала мощные открытые генеративные изображения конечным пользователям, как раз когда проприетарные системы, казалось, были готовы установить такие услуги как чисто ограниченную, коммерческую область:

Одна из многих вариаций проекта LAION, в котором представлены современные и защищенные авторским правом произведения искусства. Источник - https://huggingface.co/datasets/laion/relaion-pop/viewer/default/train

Одна из многих вариаций проекта LAION, в котором представлены современные и защищенные авторским правом произведения искусства. Источник

В многих случаях большие размеры файлов некоторых из этих «указателей»-коллекций указывают на включение изображений в загружаемый и размещаемый файл; однако, не тривиальные размеры загрузки часто обусловлены большим объемом текстового контента и иногда включением извлеченных вложений или функций – полученных резюме или узлов ранее применимого контента, извлеченного из исходных данных во время процесса обучения.

Премиум для видео

Наборы видеоданных представляют еще более сильный случай для подхода «набор данных по прокси» или указателя, поскольку большой объем хранилищ, необходимый для агрегации значимого и полезного количества видео в одну загружаемую коллекцию, запрещен, и «распределенный» метод желателен.

Однако, в обоих случаях – но особенно с видео – загружаемые исходные URL-адреса представляют данные, которые потребуют значительного дальнейшего внимания перед использованием в процессах обучения. И изображения, и видео потребуют изменения размера или принятия решений о обрезке, чтобы создать образцы, которые можно разместить в доступном пространстве GPU. Даже сильно уменьшенные видео также потребуют обрезки до очень коротких длины, таких как 3-5 секунд, обычно.

Заметные видеонаборы, которые используют ссылки на онлайн-видео (а не курирование и прямую упаковку видео), включают набор данных Kinetics Human Action Video от Google, и коллекцию YouTube-8M, которая использует сегментную аннотацию, чтобы указать, как обращаться с каждым видео после загрузки – но которая снова оставляет конечного пользователя получать видео из предоставленных URL-адресов.

Закрыто и открыто

Наконец, в этой категории, «открытые» данные VFX могут быть сгенерированы с закрытыми платформами, которые затем публикуют и делают доступным результирующий набор данных. Это разумно задуматься, почему это происходит, и рассмотреть, не является ли это тем, что компания-источник хочет санитарно очистить IP-неблагоприятную модель, для своего собственного использования; или же что «очищенный» набор был запрошен извне.

Одним из таких случаев «генерационной стирки» является, возможно, набор данных Omni-VFX, который включает многие данные из набора данных Open-VFX (который сам по себе ссылается на многие закрытые и полузакрытые платформы, такие как Pika и PixVerse).

Честно говоря, Omni-VFX даже не пытается:

В открытом наборе данных Omni-VFX знакомое лицо. Источник - https://huggingface.co/datasets/GD-ML/Omni-VFX/blob/main/Harley/pixverse%252Fmp4%252Fmedia%252Fweb%252F15e45744-64b1-4a41-84de-626225cf017b_seed734716767.mp4

В открытом наборе данных Omni-VFX знакомое лицо. Источник

Родовая ответственность

Второй основной подход к стиранию IP-адресов заключается в использовании защищенных авторским правом материалов на одном или нескольких уровнях удаления. Одним из методов в этой категории является использование синтетических данных, которые были обучены в какой-то момент выше на защищенных авторским правом данных. В таких случаях, особенно когда синтетические данные могут получить аутентичные результаты, защищенные авторским правом работы поставляют преобразования, которые не могли бы разумно быть угаданы или приближены общими моделями мира или неспециализированными моделями.

Это особенно верно в случае генеративных видеосистем, которые должны генерировать «невозможные» события, и события, которые в целом попадают в категорию «визуальных эффектов» (VFX).

На самом деле, то, что привело эту тему к моему вниманию, было последним в серии исследовательских работ, предлагающих возможность «абстрагировать» различные типы визуальных эффектов, такие как производство лазерных лучей из неправдоподобных частей тела, либо путем обучения на заказанных или «открытых» клипах VFX (а не на более очевидном источнике, таком как очень дорогие клипы VFX, найденные в выходе из кинематографической вселенной Marvel):

Примеры с веб-сайта EffectMaker, где «действие» в исходном клипе (слева) применяется к исходному изображению (центр). Источник

Вышеуказанные примеры взяты из проектной страницы для проекта EffectMaker. EffectMaker не является первым предложением этого года, которое стремится извлечь динамику VFX из одного видеоклипа и транспонировать ее в новый клип, и на самом деле это становится отдельной подзадачей в исследованиях ИИ VFX*.

Осознав, что медиагиганты, такие как Marvel, имеют выше среднего шанс выиграть судебные дела по интеллектуальной собственности (даже в упомянутой атмосфере «принудительной терпимости»), компании по визуальным эффектам и стартапы сейчас идут на заметные длины, чтобы обеспечить, чтобы их генеративные платформы VFX были свободны от чужой корпоративной интеллектуальной собственности.

Прежде всего, это Meta, которая, как сообщалось, на subreddit r/vfx, устроила хорошо оплачиваемую зимнюю кампанию по набору сотрудников в 2026 году, предлагая художникам VFX работу по обучению моделей ИИ для вывода эффектов уровня Голливуда. Хотя оплата не была указана в различных постах, один описал ее как «денег на пенсию».

Следуйте за деньгами

Однако, нужно задуматься, сколько денег даже такие, как Meta, готовы заплатить за真正е разнообразие и изобилие ад хок эффектов VFX, учитывая, что средний отдельный эффект VFX для блокбастера стоит около 42 000 долларов США – и многие стоят намного дороже.

Кроме того, разумно предположить, что платформы VFX-генерации будут удовлетворять популярному спросу, включая различные стандартные эффекты-тропы из наиболее популярных и дорогих категорий фильмов.

Помимо того, что «остаточные» профессионалы VFX могут в конечном итоге воссоздать эффекты, над которыми они работали для существующей фильмографии – что само по себе контекстуализирует «пользовательскую» работу по набору данных как имитационную – нет гарантии, что эти дорогие новые образцы будут обучены «с нуля» в совершенно новой архитектуре.

На самом деле, если такие рекреации будут перенаправлены в дополнительные модули, такие как LoRAs, которые полагаются на базовую модель, то процесс является только таким же обоснованным, как и базовая модель «чистая от интеллектуальной собственности» – и не многие из них.

Аналогично, если «новый» процесс использует другие «гибридные» методы, такие как тонкая настройка, где ценность визуального эффекта зависит от моделей, априорных или вложений из более старых коллекций или моделей неопределенной целостности, оригинальность работы является, по сути, косметической и подлежит оспариванию.

Невозможные миссии

Область выхода VFX представляет собой особенно интересный случай в отношении потенциального стирания IP-адресов в наборах данных ИИ, поскольку визуальные эффекты часто изображают «невозможные» вещи, для которых не будет открытых альтернатив.

Например, хотя разрушение здания можно обучить в генеративную модель из различных публичных или иным образом доступных клипов, если вы хотите обучить модель для производства человеческих лазерных лучей, вам придется обучать на клипах VFX, украденных или заказанных; такие вещи не происходят нигде больше.

Даже в случае других типов стихийных бедствий, таких как драматическое наводнение, доступный реальный исходный материал вряд ли сможет воспроизвести драматические точки зрения на катастрофические события, потому что (с некоторыми исключениями) люди обычно не живутранслируют из катастрофических мест. Следовательно, «крутые виды» на катастрофы редки в реальных наборах данных, и любая модель ИИ, которая может генерировать их, вероятно, получила информацию откуда-то еще.

Большинство желаемых потоков задач ИИ не имеют такого же уровня конкретики, и в таких случаях сокрытие преимуществ защищенных авторским правом данных может не потребовать столько усилий.

Вывод: Запутанный веб

Только те, кто использовал генеративный ИИ обширно и в течение длительного периода, интуитивно поймут, что такие системы борются с объединением нескольких концепций, когда нет сравнимых примеров в их обучающих данных.

Это ограничение известно как запутывание, при котором различные аспекты обученных концепций склонны кластеризоваться вместе с связанными элементами, а не разлагаться на удобные, лего-стильные строительные блоки, которые можно расположить в любую новую конфигурацию, которую пользователь может пожелать.

Запутывание – это архитектурная гравитационная яма, которую практически невозможно избежать, по крайней мере для подходов на основе диффузии, которые характеризуют все основные текущие генеративные платформы ИИ. Однако возможно, что новые подходы появятся в течение следующих нескольких лет, которые будут лучше разбивать обученные концепции так, чтобы они могли быть более ловко склеены, и предлагать меньше указаний на их происхождение.

 

* Я не делаю обвинений против EffectMaker, но комментирую здесь на общность возникающей практики в исследованиях видео ИИ.

Потому что эти кадры, в таких типах фильмов, генерировали и продолжают генерировать деньги.

Опубликовано впервые в понедельник, 16 марта 2026 года

Писатель о машинном обучении, специалист в области синтеза человеческих изображений. Бывший руководитель контента исследований в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио сайт: martinanderson.ai
Контакт: [email protected]