Лидеры мнений
Решение текущих проблем в моделях крупномасштабного языкового моделирования и взгляд в будущее
Сегодня существует десятки публично доступных крупномасштабных языковых моделей (LLM), таких как GPT-3, GPT-4, LaMDA или Bard, и их число постоянно растет с выходом новых моделей. LLM революционизировали искусственный интеллект, полностью изменив то, как мы взаимодействуем с технологиями в различных отраслях. Эти модели позволяют нам учиться на многих наборах данных человеческого языка и открыли новые пути для инноваций, творчества и эффективности.
Однако с большой мощью приходит большая сложность. Существуют внутренние проблемы и этические вопросы, связанные с LLM, которые необходимо решить, прежде чем мы сможем использовать их в полной мере. Например, недавнее исследование Стэнфордского университета обнаружило расовую и гендерную предвзятость при наблюдении за ChatGPT-4, когда он обрабатывал определенные запросы, содержащие имена, предполагающие расу или пол. В этом исследовании программа была попрошена о совете, сколько стоит заплатить за использованную велосипед, продаваемую человеком по имени Джамал Вашингтон, что дало гораздо более низкую сумму по сравнению с тем, когда продавцом был Логан Бекер. Когда такие открытия продолжают появляться, необходимость решения проблем LLM только увеличивается.
Как смягчить общие проблемы LLM
Предвзятость
Одной из наиболее часто обсуждаемых проблем среди LLM является предвзятость и справедливость. В недавнем исследовании эксперты протестировали четыре недавно опубликованные LLM и обнаружили, что все они выражают предвзятые предположения о мужчинах и женщинах, в частности, те, которые соответствуют представлениям людей, а не основаны на фактах. В этом контексте предвзятость относится к неравному обращению или результатам среди разных социальных групп, наиболее вероятно из-за исторических или структурных дисбалансов власти.
В LLM предвзятость вызвана выбором данных, демографическими характеристиками создателей и языковым или культурным уклоном. Предвзятость выбора данных возникает, когда тексты, выбранные для обучения LLM, не представляют полного разнообразия языка, используемого в Интернете. LLM, обученные на обширных, но ограниченных наборах данных, могут унаследовать предвзятости, уже присутствующие в этих текстах. С демографическими характеристиками создателей определенные демографические группы подчеркиваются чаще, чем другие, что демонстрирует необходимость большего разнообразия и инклюзивности в создании контента для снижения предвзятости. Например, Википедия, обычный источник обучающих данных, демонстрирует заметный демографический дисбаланс среди своих редакторов, с преобладанием мужчин (84%). Это похоже на дисбаланс, найденный для языка и культуры. Многие источники, на которых обучаются LLM, имеют уклон в сторону английского языка, который иногда переводится точно на другие языки и культуры.
Необходимо, чтобы LLM были обучены на фильтрованных данных, и чтобы были установлены ограничения, чтобы подавить темы, которые не являются последовательными представлениями данных. Одним из способов сделать это является использование методов, основанных на дополнении данных. Можно добавить примеры из недопредставленных групп в обучающие данные, тем самым расширяя разнообразие набора данных. Другой метод смягчения – фильтрация и переоценка данных, которая в первую очередь фокусируется на точном нацеливании на конкретные, недопредставленные примеры внутри существующего набора данных.
Галлюцинации
В контексте LLM галлюцинации – это явление, характеризующееся производством текста, который, хотя и грамматически правильный и кажущийся связным, отклоняется от фактической точности или намерения исходного материала. На самом деле, недавние отчеты обнаружили, что иск о законе Миннесоты напрямую затронут галлюцинациями LLM. Афидевит, представленный в поддержку закона, был найден с включением несуществующих источников, которые могли быть галлюцинированы ChatGPT или другой LLM. Эти галлюцинации могут легко снизить надежность LLM.
Существует три основных вида галлюцинаций:
- Галлюцинация, противоречащая вводу: это происходит, когда вывод LLM отклоняется от ввода пользователя, который обычно включает инструкции по задаче и фактический контент, требующий обработки.
- Галлюцинация, противоречащая контексту: LLM могут генерировать внутренне несогласованные ответы в сценариях, включающих длительный диалог или несколько обменов. Это предполагает потенциальную недостаточность способности модели отслеживать контекст или поддерживать связность на протяжении различных взаимодействий.
- Галлюцинация, противоречащая фактам: этот вид галлюцинации возникает, когда LLM производит контент, противоречащий установленным фактам. Происхождение таких ошибок разнообразно и может возникать на различных этапах жизненного цикла LLM.
Многие факторы способствовали этому явлению, такие как дефицит знаний, который объясняет, как LLM могут не иметь знаний или способности к правильному усвоению информации во время предварительного обучения. Кроме того, предвзятость в обучающих данных или последовательная стратегия генерации LLM, прозванная “снежным комом галлюцинаций”, может создавать галлюцинации.
Существуют способы смягчить галлюцинации, хотя они всегда будут характеризовать LLM. Полезные стратегии смягчения галлюцинаций включают смягчение во время предварительного обучения (ручное уточнение данных с помощью методов фильтрации) или тонкое настройка (курирование обучающих данных). Однако смягчение во время вывода является лучшим решением из-за его экономической эффективности и контролируемости.
Приватность
С ростом Интернета возросла доступность личной информации и других конфиденциальных данных, что стало широко признанной проблемой. Исследование показало, что 80% американских потребителей обеспокоены тем, что их данные используются для обучения моделей ИИ. Поскольку наиболее заметные LLM получены из веб-сайтов, мы должны учитывать, как это создает риски для приватности и остается в значительной степени нерешенной проблемой для LLM.
Самый простой способ предотвратить распространение личной информации LLM – удалить ее из обучающих данных. Однако, учитывая огромное количество данных, участвующих в LLM, практически невозможно гарантировать, что вся конфиденциальная информация будет уничтожена. Другой распространенный альтернативой для организаций, которые полагаются на внешние модели, является выбор открытой LLM вместо сервиса, такого как ChatGPT.
С этим подходом копия модели может быть развернута внутри организации. Промпты пользователей остаются в безопасности внутри сети организации, а не подвергаются воздействию третьих сторон. Хотя это значительно снижает риск утечки конфиденциальных данных, это также добавляет значительную сложность. Учитывая трудности полной гарантии защиты конфиденциальных данных, все равно важно, чтобы разработчики приложений учитывали, как эти модели могут поставить их пользователей под угрозу.
Следующая граница для LLM
Когда мы продолжаем расти и формировать последующие эволюции LLM, смягчая текущие риски, мы должны ожидать появления агентных моделей LLM, что мы уже видим в компаниях, таких как H с Runner H, начиная выпускать. Переход от чистых языковых моделей к агентным архитектурам представляет собой изменение в проектировании систем ИИ; отрасль будет двигаться за пределы внутренних ограничений интерфейсов чата и простой генерации с поддержкой извлечения. Эти новые агентные рамки будут иметь сложные модули планирования, которые разбивают сложные цели на атомарные подзадачи, поддерживают эпизодическую память для контекстного рассуждения и используют специализированные инструменты через хорошо определенные API. Это создает более прочный подход к автоматизации задач. Архитектурный прогресс помогает смягчить общие проблемы вокруг задач и рассуждений, интеграции инструментов и мониторинга выполнения в традиционных реализациях LLM.
В дополнение к LLM будет больше фокусировки на обучении более мелких языковых моделей из-за их экономической эффективности, доступности и легкости развертывания. Например, языковые модели, специфичные для определенной области, специализируются на конкретных отраслях или областях. Эти модели тонко настроены с помощью данных и терминологии, специфичных для области, что делает их идеальными для сложных и регулируемых сред, таких как медицина или право, где точность имеет решающее значение. Этот целевой подход снижает вероятность ошибок и галлюцинаций, которые могут произвести общие модели, когда они сталкиваются со специализированным контентом.
Когда мы продолжаем исследовать новые границы в LLM, важно расширять границы инноваций и решать и смягчать потенциальные риски, связанные с их разработкой и развертыванием. Только выявив и активно решив проблемы, связанные с предвзятостью, галлюцинациями и приватностью, мы можем создать более прочную основу для LLM, чтобы они могли процветать в различных областях.












