AGI и будущее ИИ

Инфлексия-2.5: Мощная модель LLM, конкурирующая с GPT-4 и Gemini

mm
Добавьте Unite.AI в избранные источники в Google

Inflection AI сделала значительный вклад в области больших языковых моделей (LLM) с недавним представлением Inflection-2.5, модели, которая конкурирует с ведущими LLM в мире, включая GPT-4 и Google’s Gemini.

Быстрый рост Inflection AI еще больше ускорился благодаря массивному раунду финансирования в размере $1,3 млрд, возглавляемому такими гигантами отрасли, как Microsoft (MSFT ), NVIDIA (NVDA ), и известными инвесторами, включая Рида Хоффмана, Билла Гейтса и Эрика Шмидта. Этот значительный инвестиционный раунд увеличивает общую сумму финансирования компании до $1,525 млрд.

В сотрудничестве с партнерами CoreWeave (CRWV ) и NVIDIA, Inflection AI строит самый большой кластер ИИ в мире, состоящий из беспрецедентных 22 000 процессоров NVIDIA H100 Tensor Core. Эта колоссальная вычислительная мощность будет поддерживать обучение и развертывание нового поколения крупномасштабных моделей ИИ, позволяя Inflection AI расширить границы того, что возможно в области личного ИИ.

Гroundbreaking работа компании уже принесла замечательные результаты, с кластером Inflection AI, в настоящее время состоящим из более 3 500 процессоров NVIDIA H100 Tensor Core, демонстрирующим результаты на уровне состояния искусства на открытой бенчмарке MLPerf. В совместной заявке с CoreWeave и NVIDIA кластер завершил эталонную задачу обучения для крупных языковых моделей всего за 11 минут, закрепив свое положение как самый быстрый кластер на этом бенчмарке.

Это достижение следует за представлением Inflection-1, внутренней крупной языковой модели (LLM) Inflection AI, которая была признана лучшей моделью в своем классе вычислений. Обгоняя гигантов отрасли, такие как GPT-3.5, LLaMA, Chinchilla и PaLM-540B, на широком спектре бенчмарков, обычно используемых для сравнения LLM, Inflection-1 позволяет пользователям взаимодействовать с Pi, личным ИИ Inflection AI, простым и естественным образом, получая быструю, релевантную и полезную информацию и советы.

Компания Inflection AI привержена прозрачности и воспроизводимости, что очевидно в выпуске технической заметки, в которой подробно описаны оценка и производительность Inflection-1 на различных бенчмарках. Заметка показывает, что Inflection-1 превосходит модели в том же классе вычислений, определенные как модели, обученные с использованием не более операций с плавающей запятой (FLOPs) PaLM-540B.

Успех Inflection-1 и быстрое масштабирование вычислительной инфраструктуры компании, обусловленное значительным раундом финансирования, подчеркивают непоколебимую приверженность Inflection AI своей миссии по созданию личного ИИ для всех. С интеграцией Inflection-1 в Pi пользователи могут теперь испытать силу личного ИИ, пользуясь его эмпатичной личностью, полезностью и стандартами безопасности.

Инфлексия-2.5

Инфлексия-2.5 теперь доступна всем пользователям Pi, личного ИИ-ассистента Inflection AI, на нескольких платформах, включая веб (pi.ai), iOS, Android и новое приложение для настольных компьютеров. Эта интеграция представляет собой значительный этап в миссии Inflection AI по созданию личного ИИ для всех, сочетая сырую мощность с эмпатичной личностью и стандартами безопасности.

Квантовый скачок в производительности Предыдущая модель Inflection AI, Inflection-1, использовала примерно 4% операций с плавающей запятой (FLOPs) GPT-4 и демонстрировала среднюю производительность около 72% по сравнению с GPT-4 на различных задачах, ориентированных на интеллект. С Inflection-2.5 Inflection AI достигла значительного увеличения интеллектуальных возможностей Pi, с упором на программирование и математику.

Производительность модели на ключевых отраслевых бенчмарках демонстрирует ее возможности, демонстрируя более 94% средней производительности GPT-4 на различных задачах, с особым акцентом на превосходстве в STEM-областях. Это замечательное достижение является свидетельством приверженности Inflection AI технологическому прогрессу, сохраняя при этом фокус на пользовательском опыте и безопасности.

Программирование и математические возможности Inflection-2.5 сияют в программировании и математике, демонстрируя более чем 10% улучшение по сравнению с Inflection-1 на BIG-Bench-Hard, подмножестве сложных задач для крупных языковых моделей. Два бенчмарка программирования, MBPP+ и HumanEval+, показывают значительные улучшения по сравнению с Inflection-1, закрепляя позицию Inflection-2.5 как силы, с которой необходимо считаться в области программирования.

На бенчмарке MBPP+ Inflection-2.5 превосходит своего предшественника значительным образом, демонстрируя уровень производительности, сопоставимый с GPT-4, как сообщает DeepSeek Coder. Аналогично, на бенчмарке HumanEval+ Inflection-2.5 демонстрирует замечательный прогресс, превосходя производительность Inflection-1 и приближаясь к уровню GPT-4, как сообщает на доске лидеров EvalPlus.

Доминирование в отраслевых бенчмарках

Inflection-2.5 выделяется на отраслевых бенчмарках, демонстрируя значительные улучшения по сравнению с Inflection-1 на бенчмарке MMLU и бенчмарке GPQA Diamond, известном своей экспертной сложностью. Производительность модели на этих бенчмарках подчеркивает ее способность справляться с широким спектром задач, от задач уровня средней школы до профессиональных задач.

Превосходство в STEM-экзаменах Способности модели распространяются на STEM-экзамены, с выдающейся производительностью на венгерском математическом экзамене и физическом GRE. На венгерском математическом экзамене Inflection-2.5 демонстрирует свою математическую одаренность, используя предоставленный few-shot-промпт и форматирование, что позволяет легко воспроизводить результаты.

В физическом GRE, вступительном экзамене в физике, Inflection-2.5 достигает 85-го процентиля человеческих тестируемых в maj@8 (большинство голосов при 8), закрепляя свое положение как грозного конкурента в области решения физических задач. Кроме того, модель приближается к высшему баллу в maj@32, демонстрируя свою способность решать сложные физические задачи с замечательной точностью.

Улучшение пользовательского опыта Inflection-2.5 не только поддерживает эмпатичную личность и стандарты безопасности Pi, но и повышает свой статус как универсального и бесценного личного ИИ по различным темам. От обсуждения текущих событий до поиска местных рекомендаций, изучения для экзаменов, программирования и даже случайных разговоров, Pi, оснащенный Inflection-2.5, обещает обогащенный пользовательский опыт.

С мощными возможностями Inflection-2.5 пользователи взаимодействуют с Pi на более широком спектре тем, чем когда-либо прежде. Способность модели справляться с сложными задачами, в сочетании с ее эмпатичной личностью и возможностями поиска в реальном времени, гарантирует, что пользователи получают высококачественную, актуальную информацию и руководство.

Принятие и вовлеченность пользователей Влияние интеграции Inflection-2.5 в Pi уже очевидно в показателях настроений пользователей, вовлеченности и удержания. Inflection AI стала свидетелем значительного ускорения органического роста пользователей, с одним миллионом активных пользователей в день и шестью миллионами активных пользователей в месяц, обменивающихся более четырьмя миллиардами сообщений с Pi.

В среднем разговоры с Pi длятся 33 минуты, с одним из десяти продолжительностью более часа каждый день. Кроме того, примерно 60% людей, которые взаимодействуют с Pi в течение недели, возвращаются на следующей неделе, демонстрируя более высокую месячную липкость, чем ведущие конкуренты в отрасли.

Технические детали и прозрачность бенчмарков

В соответствии с приверженностью Inflection AI прозрачности и воспроизводимости компания предоставила всесторонние технические результаты и подробную информацию о производительности Inflection-2.5 на различных отраслевых бенчмарках.

Например, на исправленной версии набора данных MT-Bench, который устраняет проблемы с неправильными эталонными решениями и ошибочными посылами в исходном наборе данных, Inflection-2.5 демонстрирует производительность, соответствующую ожиданиям на основе других бенчмарков.

Inflection AI также оценила Inflection-2.5 на HellaSwag и ARC-C, бенчмарках общего смысла и науки, сообщаемых широким спектром моделей, и результаты демонстрируют сильную производительность на этих бенчмарках.

Важно отметить, что хотя предоставленные оценки представляют модель, обеспечивающую Pi, пользовательский опыт может слегка различаться из-за факторов, таких как влияние веб-поиска (не используемого в бенчмарках), структуры few-shot-промпта и других различий на стороне производства.

Заключение

Inflection-2.5 представляет собой значительный шаг вперед в области крупных языковых моделей, конкурируя с возможностями лидеров отрасли, таких как GPT-4 и Gemini, при этом используя только часть вычислительных ресурсов. С впечатляющей производительностью на широком спектре бенчмарков, особенно в STEM-областях, программировании и математике, Inflection-2.5 закрепила свое положение как грозного конкурента в ландшафте ИИ.

Интеграция Inflection-2.5 в Pi, личного ИИ-ассистента Inflection AI, обещает обогащенный пользовательский опыт, сочетая сырую мощность с эмпатичной личностью и стандартами безопасности. Поскольку Inflection AI продолжает расширять границы того, что возможно с LLM, сообщество ИИ с нетерпением ждет следующей волны инноваций и прорывов от этой пионерской компании.

Я провел последние пять лет, погружаясь в увлекательный мир машинного обучения и глубокого обучения. Моя страсть и экспертиза привели меня к участию в более чем 50 различных проектах программной инженерии, с особым акцентом на ИИ/МО. Мое непрекращающееся любопытство также привело меня к обработке естественного языка, области, которую я с нетерпением жду возможности изучить дальше.