Модели и платформы ИИ
Первый юбилей ChatGPT: формирование будущего взаимодействия с ИИ
Вспоминая первый год ChatGPT, становится ясно, что этот инструмент существенно изменил сцену ИИ. Запущенный в конце 2022 года, ChatGPT выделился благодаря своему удобному, разговорному стилю, который сделал взаимодействие с ИИ похожим на разговор с человеком, а не с машиной. Этот новый подход быстро привлёк внимание общественности. В течение пяти дней после выпуска ChatGPT уже привлёк миллион пользователей. К началу 2023 года это число возросло до примерно 100 миллионов пользователей в месяц, а к октябрю платформа привлекала около 1,7 миллиарда посетителей по всему миру. Эти цифры говорят о его популярности и полезности.
За прошлый год пользователи нашли множество творческих способов использовать ChatGPT, от простых задач, таких как написание писем и обновление резюме, до создания успешных бизнесов. Но это не только о том, как люди используют его; сама технология выросла и улучшилась. Первоначально ChatGPT был бесплатной службой, предлагавшей подробные текстовые ответы. Теперь есть ChatGPT Plus, который включает ChatGPT-4. Эта обновлённая версия обучена на большем количестве данных, даёт меньше неправильных ответов и лучше понимает сложные инструкции.
Одним из самых больших обновлений является то, что ChatGPT теперь может взаимодействовать несколькими способами – он может слушать, говорить и даже обрабатывать изображения. Это означает, что вы можете разговаривать с ним через его мобильное приложение и показывать ему картинки, чтобы получить ответы. Эти изменения открыли новые возможности для ИИ и изменили то, как люди воспринимают и думают о роли ИИ в нашей жизни.
От своих начал как технологической демонстрации до своего нынешнего статуса крупного игрока в мире технологий путь ChatGPT довольно впечатляющий. Первоначально он рассматривался как способ протестировать и улучшить технологию, получая обратную связь от общественности. Но он быстро стал важной частью ландшафта ИИ. Этот успех показывает, насколько эффективно донастроить крупные языковые модели (LLM) с помощью как надзорного обучения, так и обратной связи от людей. В результате ChatGPT может справиться с широким спектром вопросов и задач.
Гонка за разработку наиболее способных и универсальных систем ИИ привела к распространению как открытых, так и проприетарных моделей, подобных ChatGPT. Понимание их общих возможностей требует всесторонних тестов по широкому спектру задач. Этот раздел исследует эти тесты, проливая свет на то, как различные модели, включая ChatGPT, сравниваются друг с другом.
Оценка LLM: Тесты
- MT-Bench: Этот тест проверяет способность к многоповоротным разговорам и выполнению инструкций в восьми областях: написании, ролевых играх, извлечении информации, рассуждениях, математике, программировании, знаниях STEM и гуманитарных/социальных науках. Более сильные LLM, такие как GPT-4, используются в качестве оценщиков.
- AlpacaEval: Основанный на наборе оценки AlpacaFarm, этот автоматический оценщик LLM тестирует модели на основе ответов от передовых LLM, таких как GPT-4 и Claude, рассчитывая процент побед кандидатских моделей.
- Открытая таблица лидеров LLM: Используя каркас оценки языковых моделей, эта таблица лидеров оценивает LLM на семи ключевых тестах, включая задачи рассуждений и тесты общих знаний, в условиях нулевого и нескольких выстрелов.
- BIG-bench: Этот совместный тест охватывает более 200 новых языковых задач, охватывающих широкий спектр тем и языков. Он направлен на изучение LLM и предсказание их будущих возможностей.
- ChatEval: Многоагентная дебатная структура, которая позволяет командам автономно обсуждать и оценивать качество ответов от разных моделей на открытые вопросы и традиционные задачи генерации естественного языка.
Сравнительная производительность
В плане общих тестов открытые LLM продемонстрировали замечательный прогресс. Llama-2-70B, например, достигла впечатляющих результатов, особенно после донастройки с инструкционными данными. Её вариант, Llama-2-chat-70B, преуспел в AlpacaEval с процентом побед 92,66%, превзойдя GPT-3.5-turbo. Однако GPT-4 остаётся лидером с процентом побед 95,28%.
Zephyr-7B, более небольшая модель, продемонстрировала возможности, сравнимые с более крупными 70B LLM, особенно в AlpacaEval и MT-Bench. Тем временем WizardLM-70B, донастроенная с разнообразными инструкционными данными, набрала высший балл среди открытых LLM на MT-Bench. Однако она всё ещё отставала от GPT-3.5-turbo и GPT-4.
Интересным входом является GodziLLa2-70B, который достиг конкурентного балла на открытой таблице лидеров LLM, демонстрируя потенциал экспериментальных моделей, объединяющих разнообразные наборы данных. Аналогично, Yi-34B, разработанная с нуля, выделилась с баллами, сравнимыми с GPT-3.5-turbo, и лишь немного отставала от GPT-4.
UltraLlama, с её донастройкой на разнообразных и высококачественных данных, сравнялась с GPT-3.5-turbo в предложенных тестах и даже превзошла его в областях мировых и профессиональных знаний.
Масштабирование: Рост гигантских LLM
Заметной тенденцией в разработке LLM является масштабирование параметров моделей. Модели, такие как Gopher, GLaM, LaMDA, MT-NLG и PaLM, расширили границы, в результате чего появились модели с до 540 миллиардов параметров. Эти модели продемонстрировали исключительные возможности, но их закрытый характер ограничил их более широкое применение. Это ограничение вызвало интерес к разработке открытых LLM, тенденция, которая набирает обороты.
В параллели с масштабированием размеров моделей исследователи исследовали альтернативные стратегии. Вместо того, чтобы просто делать модели больше, они сосредоточились на улучшении предварительной подготовки меньших моделей. Примерами являются Chinchilla и UL2, которые показали, что больше не всегда лучше; более умные стратегии могут дать эффективные результаты. Кроме того, было значительное внимание, уделённое настройке языковых моделей, с проектами, такими как FLAN, T0 и Flan-T5, которые внесли значительный вклад в эту область.
Катализатор ChatGPT
Введение OpenAI ChatGPT стало поворотным моментом в исследованиях NLP. Чтобы конкурировать с OpenAI, компании, такие как Google (GOOGL ) и Anthropic, запустили свои собственные модели, Bard и Claude соответственно. Хотя эти модели демонстрируют сравнимую производительность с ChatGPT во многих задачах, они всё ещё отстают от последней модели OpenAI, GPT-4. Успех этих моделей в основном обусловлен обучением с помощью обратной связи от людей (RLHF), техникой, которая получает всё больше исследовательского внимания для дальнейшего совершенствования.
Слухи и спекуляции вокруг Q* (Q-Star) OpenAI
Недавние сообщения предполагают, что исследователи в OpenAI, возможно, достигли значительного прогресса в ИИ с разработкой новой модели под названием Q* (произносится как Q-звезда). Как утверждается, Q* имеет возможность выполнять математические задачи на уровне начальной школы, что вызвало дискуссии среди экспертов о её потенциале как этапа на пути к искусственному общему интеллекту (AGI). Хотя OpenAI не прокомментировала эти сообщения, предполагаемые возможности Q* вызвали значительный интерес и спекуляции в социальных сетях и среди энтузиастов ИИ.
Разработка Q* примечательна потому, что существующие языковые модели, такие как ChatGPT и GPT-4, хотя и способны выполнять некоторые математические задачи, не особенно хорошо справляются с ними надёжно. Вызов заключается в необходимости для моделей ИИ не только распознавать закономерности, как они делают сейчас с помощью глубокого обучения и трансформеров, но и рассуждать и понимать абстрактные концепции. Математика, будучи эталоном для рассуждений, требует от ИИ планировать и выполнять несколько шагов, демонстрируя глубокое понимание абстрактных концепций. Эта способность будет означать значительный скачок в возможностях ИИ, потенциально выходящий за рамки математики в другие сложные задачи.
Однако эксперты предостерегают от чрезмерного энтузиазма по поводу этого развития. Хотя система ИИ, которая надёжно решает математические задачи, будет впечатляющим достижением, она не обязательно сигнализирует о начале сверхинтеллектуального ИИ или AGI. Текущие исследования ИИ, включая усилия OpenAI, были сосредоточены на элементарных проблемах, с различными степенями успеха в более сложных задачах.
Потенциальные применения таких достижений, как Q*, огромны, варьируются от персонализированного обучения до помощи в научных исследованиях и инженерии. Однако также важно управлять ожиданиями и признавать ограничения и проблемы безопасности, связанные с такими достижениями. Заботы об ИИ, представляющем существенные риски, фундаментальной заботы OpenAI, остаются актуальными, особенно когда системы ИИ начинают взаимодействовать более с реальным миром.
Движение открытых LLM
Чтобы стимулировать исследования открытых LLM, Meta выпустила серию моделей Llama, что спровоцировало волну новых разработок на основе Llama. Это включает модели, донастроенные с инструкционными данными, такими как Alpaca, Vicuna, Lima и WizardLM. Исследования также ветвятся в сторону улучшения возможностей агентов, логических рассуждений и моделирования длинного контекста в рамках Llama.
Кроме того, есть растущая тенденция к разработке мощных LLM с нуля, с проектами, такими как MPT, Falcon, XGen, Phi, Baichuan, Mistral, Grok и Yi. Эти усилия отражают приверженность демократизации возможностей закрытых LLM, делая передовые инструменты ИИ более доступными и эффективными.
Влияние ChatGPT и открытых моделей на здравоохранение
Мы смотрим в будущее, где LLM будут помогать в ведении клинических заметок, заполнении форм для возмещения средств и поддержке врачей в диагностике и планировании лечения. Это привлекло внимание как технологических гигантов, так и учреждений здравоохранения.
Переговоры Microsoft с Epic (MSFT ), ведущим поставщиком программного обеспечения для электронных медицинских записей, сигнализируют о интеграции LLM в здравоохранение. Инициативы уже реализуются в UC San Diego Health и Stanford University Medical Center. Аналогично, партнёрства Google с Mayo Clinic и запуск Amazon Web Services (AMZN ) HealthScribe, службы документации клинических данных ИИ, отмечают значительные шаги в этом направлении.
Однако эти быстрые развертывания вызывают обеспокоенность по поводу передачи контроля над медициной корпоративным интересам. Проприетарный характер этих LLM делает их трудными для оценки. Их возможная модификация или прекращение из-за соображений прибыли может поставить под угрозу уход за пациентами, конфиденциальность и безопасность.
Срочная необходимость заключается в открытом и инклюзивном подходе к разработке LLM для здравоохранения. Учреждения здравоохранения, исследователи, клиницисты и пациенты должны сотрудничать глобально, чтобы создавать открытые LLM для здравоохранения. Этот подход, подобный консорциуму Trillion Parameter, позволит объединить вычислительные, финансовые ресурсы и экспертизу.













