Взгляд Anderson

Сколько ещё ждать реального пресечения снятия цензуры с AI‑моделями?

mm
Добавьте Unite.AI в избранные источники в Google
Screen capture from The Matrix (1999), featuring 'warez' on optical media, hidden inside a book, about to be sold to a willing buyer. © Warner Bros. Used for commentary and illustrative purposes.

Если вам достаточно лет, чтобы помнить сцену warez примерно 1995–2010 годов, когда огромные коллекции взломанного программного обеспечения и скопированных фильмов (купленные оптом на улицах или собранные случайными пиратами, когда широкополосный интернет позволил осуществлять огромные и массовые загрузки) накапливались в многочисленных, уже изношенных DVD‑коллекциях, то появляющаяся сцена «децензурированных» открытых AI‑моделей может показаться знакомой.

From the 'golden age' of casual street trade in software and movies. Credit – Shankar.s. 'Pirated DVDs at PP street market' - https://www.flickr.com/photos/shankaronline/9163248097/in/photostream/ License - https://creativecommons.org/licenses/by/2.0/deed.en

Из «золотого века» случайной уличной торговли программным обеспечением и фильмами. Автор – Shankar.s. «Пиратские DVD на рынке PP»Источник / Лицензия

Тогда, до того как аренда программного обеспечения стала обычной моделью для потребителей, небольшая, но элитная группа энтузиастов «сцены» начала взламывать приложения, которые затем распространялись в диких новостных группах «warez», а позже — в торрент‑сообществах. Эти ограничения могли быть обременительными или тривиальными для обхода, но нарушения обычно оставались неизгладимыми после их выхода в свет.

То же происходит сейчас с открытыми крупными языковыми моделями (LLM), которые регулярно и в больших масштабах лишаются встроенных фильтров безопасности, после чего эти децензурированные модели распространяются в столь многих местах, что даже закрытие исходного источника «взлома» не влияет на их доступность.

Благодетель или злодей

Вопрос: под каким углом вы хотите рассматривать эти действия? В отличие от сцены warez, никого явно не лишают доходов, как, по мнению многих, происходило с небольшими производителями программного обеспечения 20–30 лет назад.

Безусловно, оригинальные лицензионные условия часто нарушаются в подобных случаях*; однако, в отличие от частичных выпусков весов от производителей генеративных AI‑моделей, таких как Black Forest Labs, оригинальные дистрибьюторы не рассматривают версии «низкого качества» как способ продать более мощные модели только через API; они выпускают полные модели сразу.

В большинстве случаев почти никто не может запустить эти первоначальные версии локально, поскольку они слишком «тяжёлые» по количеству параметров даже для хорошо оснащённых видеокарт с 16–24 ГБ видеопамяти.

Поэтому первоначальные релизы быстро преобразуются в облегчённые версии, способные работать на потребительском оборудовании, с помощью квантизации моделей и преобразования весов в более лёгкие форматы, такие как GGUF, AWQ, PTQ, EXL2 или ориентированный на Apple MLX.

Хотя они не так производительны, как оригинальные полноразмерные модели (которые обычно обслуживаются коммерчески на различных фермах GPU), они, по крайней мере, находятся под контролем пользователя и могут быть настроены под конкретного пользователя так, как «лучшие» модели не могут.

Настраивайте по‑своему

Некоторые из этих способов явно легитимны и обычно находятся в рамках исходной лицензии, например дообучение, при котором веса модели специально настраиваются под целевую задачу или область, которую пользователь задаёт. При достаточном объёме дискового пространства можно даже дообучить несколько экземпляров открытой модели для разнообразных задач, как набор специализированных традиционных инструментов — вместо «швейцарского ножа» исходной полной модели.

Кроме того, модели с совместимыми настройками, но разными данными обучения, можно объединять; либо дополнительные возможности можно наложить на модель с помощью лёгких фильтров LoRA, не рискуя подорвать исходные возможности базовой модели через дообучение.

Однако модификация, которая интересует большинство пользователей и стала проще любого из перечисленных методов, — это удаление упомянутых выше фильтров безопасности или ограничений.

Хотя это, безусловно, позволяет моделям генерировать порнографический контент и создавать вредоносное ПО, это также устраняет то, что многие пользователи считают чрезмерно ограничивающим (и часто подверженным ошибкам) набором ограничений.

One of many hilarious examples of Llama-2-7b-chat refusing reasonable requests on safety grounds, available at the source URL. Source - https://www.lesswrong.com/posts/pYcEhoAoPfHhgJ8YC/refusal-mechanisms-initial-experiments-with-llama-2-7b-chat

Один из множества забавных примеров того, как Llama-2-7b-chat отклоняет разумные запросы по соображениям безопасности, доступный по исходному URL. Источник

Heretic

В случае с Heretic, программой, недавно революционизировавшей децензурирование моделей, даже возможно снизить уровень «цветистого» и многословного прозы, к которой склонны модели.

Heretic gets to work on decensoring gpt-oss, though admittedly on a very well-specced machine that's unlikely to grace the average consumer's home – though it could be rented cheaply online, for the necessary duration of the process. Source - https://github.com/p-e-w/heretic

Heretic приступает к децензурированию gpt-oss, хотя, признаться, на очень мощной машине, которая вряд ли будет находиться в среднем домашнем хозяйстве — её можно арендовать недорого онлайн на необходимый срок процесса. Источник

Более того, Heretic — автоматически ищущий абляцию, подавляющую отказы, при этом минимизирующую ущерб исходному поведению модели — сводит относительно сложную задачу децензурирования к одной единственной команде с точки зрения конечного пользователя.

Как видно из скриншота выше, Heretic лучше работает на более мощном GPU, чем обычно есть в домашнем компьютере; однако пользователям не требуется запускать его на домашнем оборудовании, так же как им не пришлось лично взламывать программное обеспечение в 2002 году; как и в эпоху warez, поставщики «сцены» (неформальные, обычно некоммерческие энтузиасты) с доступом к такому оборудованию или готовые потратить ресурсы на решение проблемы, проводят джейлбрейк и выпускают децензурированную модель в сообщество.

Под прицелом

Когда «сомнительное» цифровое действие перестаёт быть сложным, обычно происходит ночной скачок возможностей (вспомните Napster или PopCornTime), который резко масштабирует как само действие, так и уровень «официального» интереса к его ограничению.

В сочетании с растущей популярностью и простотой использования платформ, таких как Ollama, Heretic начинает делать доступ к децензурированным моделям доступным для нетехнических пользователей, даже если полностью «защищённый от ошибок» метод пока недоступен.

И это возвращает меня к моему предыдущему вопросу: является ли эта деятельность «проблемой». Вчера в Arxiv появилась статья, которая, исходя из недавних тенденций к ограничению и репрессиям в отношении свобод потребителей технологий, указывает, что децензурирование, вероятно, привлечёт всё больше внимания, что приведёт к росту количества прескриптивных законов по всему миру.

Новая статья, доклад от 10a Labs, представляет движение децензурирования в негативном свете и приводит типичный небольшой процент злоупотреблений, которые, как показывает история и предсказывают текущие тенденции, приведут к ограничениям.

Исследование отслеживает, что происходит после выпуска и распространения децензурированных моделей, и выявило 1 643 приложения на GitHub, которые интегрируют, рекомендуют или используют по умолчанию неконтролируемые модели.

Эти модели варьируются от чат‑ботов общего назначения и инструментов обработки документов до NSFW‑ролевых игр и повествования; сервисов с откровенным контентом; инструментов взлома и атакующей безопасности; а также приложений для мошенничества и генераторов вредоносного ПО, при этом 25 % выпусков, по классификации исследования, отмечены как «явно злонамеренные»:

Breakdown of how uncensored AI models are being used after release. The study traced 1,643 GitHub applications that integrate, recommend or default to models whose safety restrictions have been removed, finding that 37% were general-purpose uncensored chatbots, while cybersecurity and document-processing tools each accounted for 16%, alongside smaller categories spanning voice assistants, NSFW roleplay, creative writing, coding and other uses. The paper found that around 25% of the applications identified could be classified as 'explicitly malicious'.

Разбивка того, как используются неконтролируемые AI‑модели после их выпуска. Исследование отследило 1 643 приложения на GitHub, которые интегрируют, рекомендуют или используют модели без ограничений безопасности, обнаружив, что 37 % составляют общие неконтролируемые чат‑боты, в то время как инструменты кибербезопасности и обработки документов по 16 %, наряду с более мелкими категориями, включающими голосовых помощников, NSFW‑ролевые игры, творческое письмо, программирование и другие применения. В статье отмечено, что около 25 % выявленных приложений можно классифицировать как «явно злонамеренные». Источник

В свете недавно введённых в Великобритании ограничений доступа к вебу (и их сейчас приостановленного намерения также ограничивать VPN‑доступ, обходящий эти ограничения); требования Калифорнии к 2027 году, согласно которым большинство операционных систем должны собирать возрастные диапазоны пользователей и передавать их приложениям; схемы ЕС по проверке возраста для доступа к взрослому онлайн‑контенту; а также запрета в Австралии на аккаунты в социальных сетях для лиц младше шестнадцати лет, новое исследование вписывается в шаблон, когда повышенное внимание в конечном итоге приводит к усиленному надзору, регулированию и, возможно, к выборочным или полным запретам.

Это не могло произойти здесь

Нет, это определённо может произойти здесь, отчасти из‑за высокого процента злонамеренного использования, как оценивают авторы нового исследования; и, возможно, потому что контроль наложит дополнительные ограничения на растущую тенденцию к локальному запуску ИИ, которую правительства и институты могут воспринимать как угрозу — тем более, когда модели освобождены от ограничений.

Если представить децензурирование как «способствующее» созданию NSFW‑контента и злонамеренному взлому, его можно представить как ложную бинарную позицию: поскольку оно может использоваться во зло, его необходимо регулировать. На практике не кажется реального способа регулировать такую функцию, кроме как полностью запретить её, учитывая огромное количество возможных сценариев применения.

Кроме того, в случаях, когда децензурирование LLM может позволить модели генерировать (например) вымышленный CSAM, ограничительное регулирование выглядит очевидным, поскольку любого, кто против него, можно замалчивая представить как «поддерживающего» злонамеренные применения децензурированных моделей, а не их разумные применения.

Это игнорирует тот факт, что дообученная или модифицированная LoRA модель может гораздо эффективнее генерировать любой конкретный домен, который пользователь желает задать, поскольку базовые веса модели настолько искажаются в сторону задачи, что любые встроенные защиты полностью теряют силу.

Всё о простоте

Простота использования — то, что стимулирует массовое внедрение, а массовое внедрение, в свою очередь, создаёт давление на правительства с целью регулирования (будь то со стороны общественных групп, отраслевых лоббистов или межправительственного давления).

Хотя дообучение и LoRA почти наверняка дают более целевые результаты, чем простое разблокирование FOSS‑базовой модели, эти методы требуют определённой дисциплины и усилий для реализации.

Как только запуск локальной децензурированной/квантованной модели действительно станет делом нескольких кликов (поскольку пользователь почти наверняка будет скачивать «предварительно освобождённую» модель, а не взламывать её самостоятельно с помощью Heretic), деятельность выходит из тени гиков и попадает в публичную сферу, где её злоупотребления, вероятно, превратятся в политический мяч.

Этим летом NVIDIA совместно с группой крупных технологических партнёров предприняла превентивные действия против правительственных ограничений открытых моделей, опубликовав открытое письмо, в котором вновь утверждалось, что злоупотребления технологией со стороны меньшинства не должны ставить под угрозу её потенциальную общую пользу. Однако эта позиция оказалась непопулярной в последние годы.

* Сомнения часто вызываются тем, действительно ли создатели моделей искренни в своём заявленном желании ограничивать действия пользователей, при этом защиты‑ограничения часто отвергаются как «театральные».

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai