Лидеры мнений

Переосмысление открытого исходного кода в эпоху генеративного ИИ

mm
Добавьте Unite.AI в избранные источники в Google

Модель открытого исходного кода – это этика разработки программного обеспечения, в которой исходный код делается свободно доступным для общего использования или изменения – уже давно является катализатором инноваций. Эта идея родилась в 1983 году, когда Ричард Столлман, разработчик программного обеспечения, разочаровался в закрытой природе своей неисправной принтера.

Его видение вызвало движение за свободное программное обеспечение, проложив путь для экосистемы открытого исходного кода, которая питает большую часть современного интернета и инноваций в области программного обеспечения.

Но это было более 40 лет назад.

Сегодня генеративный ИИ, с его уникальными техническими и этическими проблемами, меняет значение “открытости”, требуя от нас пересмотреть и адаптировать парадигму открытого исходного кода – не для отказа от нее, а для ее развития.

ИИ и свободы открытого исходного кода

Четыре основных свободы программного обеспечения с открытым исходным кодом – возможность исполнить, изучить, изменить и распространить любой программный код – противоречат природе генеративного ИИ несколькими способами:

  • Исполнить: модели ИИ часто требуют очень высоких затрат на инфраструктуру и вычислительные ресурсы, что ограничивает доступ из-за ограничений ресурсов.
  • Изучить и изменить: модели ИИ невероятно сложны, поэтому понимание и изменение их без доступа к коду и данным, которые их информируют, является значительной проблемой.
  • Распространить: многие модели ИИ ограничивают распространение по設計, особенно те, у которых есть обученные веса и проприетарные наборы данных, принадлежащие провайдеру платформы.

Эрозия этих основных принципов не является результатом злого умысла, а скорее огромной сложности и стоимости современных систем ИИ. Действительно, финансовые требования к обучению моделей ИИ последнего поколения возросли значительно в последние годы – обучение модели GPT-4 от OpenAI, как сообщается, обошлось до 78 миллионов долларов, исключая зарплаты сотрудников, с общими расходами превышающими 100 миллионов долларов. ​

Сложность “открытого исходного кода” ИИ

Истинная модель ИИ с открытым исходным кодом требует полной прозрачности кода источника вывода, кода источника обучения, весов модели и данных обучения. Однако многие модели, помеченные как “открытые”, выпускают только код вывода или частичные веса, в то время как другие предлагают ограниченную лицензию или ограничивают коммерческое использование вообще.

Эта беспристрастная открытость создает иллюзию принципов открытого исходного кода, но на практике она не оправдывает ожиданий.

Рассмотрим, что анализ инициативы по открытому исходному коду (OSI) показал, что несколько популярных больших языковых моделей, утверждающих, что они открыты – включая Llama2 и Llama 3.x (разработанные Meta), Grok (X), Phi-2 (Microsoft) и Mixtral (Mistral AI) – структурно несовместимы с принципами открытого исходного кода.

Проблемы устойчивости и стимулирования

Большинство программного обеспечения с открытым исходным кодом было построено на основе добровольных или грантовых усилий, а не вычислительных, высокозатратных инфраструктур. Модели ИИ, с другой стороны, дороги в обучении и обслуживании, и затраты, как ожидается, будут только расти. Генеральный директор Anthropic, Дарио Амодей, предсказывает, что в конечном итоге может потребоваться до 100 миллиардов долларов, чтобы обучить модель последнего поколения.

Без устойчивой модели финансирования или структуры стимулирования разработчики сталкиваются с выбором между ограничением доступа через закрытый исходный код или некоммерческие лицензии или риском финансового краха.

Недоразумения вокруг “открытых весов” и лицензирования

Доступность моделей ИИ стала все более запутанной, и многие платформы представляют себя как “открытые”, в то время как вводят ограничения, которые фундаментально противоречат истинным принципам открытого исходного кода. Этот “обман” проявляется несколькими способами:

  • Модели, помеченные как “открытые веса”, могут запрещать коммерческое использование вообще, сохраняя их более как академические любопытства, чем практические бизнес-инструменты для общества, чтобы изучить и разработать.
  • Некоторые провайдеры предлагают доступ к предварительно обученным моделям, но ревностно охраняют свои обучающие наборы данных и методологии, что делает невозможным воспроизвести или проверить их результаты осмысленно.
  • Многие платформы вводят ограничения на распространение, которые предотвращают разработку моделей для их сообществ, даже если они могут полностью “доступ” к коду.

В этих случаях “открыто для исследования” – это просто двусмысленность для “закрыто для бизнеса”. Результатом является неискренний вид привязки поставщика, когда организации инвестируют время и ресурсы в платформы, которые кажутся открыто доступными, только чтобы обнаружить критические ограничения при попытке масштабировать или коммерциализировать приложения.

Результативная путаница не только раздражает разработчиков. Она активно подрывает доверие к экосистеме ИИ. Она создает нереалистичные ожидания среди заинтересованных сторон, которые разумно полагают, что “открытый” ИИ аналогичен сообществам программного обеспечения с открытым исходным кодом, где прозрачность, права на изменение и коммерческая свобода соблюдаются.

Юридическая отсталость

Быстрый прогресс GenAI уже опережает разработку соответствующих правовых рамок, создавая сложную сеть интеллектуальных проблем, которые усугубляют уже существующие проблемы.

Первое крупное юридическое поле битвы центрируется вокруг использования обучающих данных. Глубокие модели обучения получают большие наборы данных из Интернета, такие как публично доступные изображения и текст веб-страниц. Этот огромный сбор данных вызвал ожесточенные дебаты об интеллектуальных правах. Технологические компании утверждают, что их системы ИИ изучают и учатся на защищенных авторским правом материалах, чтобы создать новые, трансформационные содержания. Владельцы авторских прав, однако, утверждают, что эти компании ИИ незаконно копируют их работы, генерируя конкурирующее содержание, которое угрожает их средствам к существованию.

Владение производными работами, сгенерированными ИИ, представляет еще одну юридическую неопределенность. Никто не совсем уверен, как классифицировать содержание, сгенерированное ИИ, кроме Управления по авторским правам США, которое заявляет, что “если ИИ полностью генерирует содержание, оно не может быть защищено авторским правом”.

Юридическая неопределенность вокруг GenAI – особенно в отношении нарушения авторских прав, владения работами, сгенерированными ИИ, и нелицензионного содержания в обучающих данных – становится еще более сложной, когда фундаментальные модели ИИ появляются как инструменты геополитической важности: Нации, стремящиеся разработать превосходные возможности ИИ, могут быть менее склонны ограничивать доступ к данным, что ставит страны с более строгими защитами интеллектуальной собственности в невыгодное положение.

Что должно стать открытым исходным кодом в эпоху ИИ

Поезд GenAI уже ушел со станции и не показывает признаков замедления. Мы надеемся построить будущее, где ИИ стимулирует, а не подавляет инновации. В этом случае лидерам технологий нужна основа, которая обеспечивает безопасное и прозрачное коммерческое использование, способствует ответственной инновации, решает проблемы владения данными и лицензирования и различает “открытое” и “бесплатное”.

Появляющаяся концепция, лицензия Открытого коммерческого источника, может предложить путь вперед, предлагая бесплатный доступ для некоммерческого использования, лицензированный доступ для коммерческого использования и признание и уважение к происхождению и владению данными.​​

Чтобы адаптироваться к этой новой реальности, сообщество открытого исходного кода должно разработать модели лицензирования ИИ, сформировать государственно-частные партнерства для финансирования этих моделей и установить надежные стандарты для прозрачности, безопасности и этики.

Открытый исходный код изменил мир один раз. Генеративный ИИ меняет его снова. Чтобы сохранить дух открытости, мы должны развить букву ее закона, признавая уникальные требования ИИ и решая проблемы напрямую, чтобы создать инклюзивную и устойчивую экосистему.

Доктор Яир Адато является основателем и генеральным директором Bria, компании, созданной для разработки открытой платформы генеративного ИИ без риска. Его целью было создание платформы генеративного ИИ, которая следует принципам ответственного ИИ и переопределяет понятия авторского права и интеллектуальной собственности, чтобы данные и генеративный ИИ могли сосуществовать.

Как видение в своей области, доктор Адато имеет степень PhD в области компьютерных наук в области компьютерного зрения Университета Бен-Гуриона в сотрудничестве с Гарвардским университетом. С более чем 50 патентами, которые соединяют ИИ и коммерческое использование, доктор Адато имеет замечательный послужной список в продвижении инноваций в области ИИ. До того, как возглавить Bria, доктор Адато служил техническим директором в Trax Retail, обеспечивая быстрый рост Trax с ранней стадии стартапа с 20 сотрудниками до единорога с штатом почти 1000 человек. Он служит или служил членом консультативного совета нескольких компаний, включая Sparx, Vicomi, Tasq, DataGen и Anima.