Лидеры мнений
Как хорошо могут LLMs действительно рассуждать через запутанные проблемы?
Введение и эволюция генеративного ИИ были настолько внезапными и интенсивными, что довольно сложно полностью оценить, насколько эта технология изменила нашу жизнь.
Отодвинемся назад на три года. Да, ИИ становился все более распространенным, хотя бы в теории. Больше людей знали некоторые вещи, которые он мог делать, хотя даже с этим были огромные заблуждения о возможностях ИИ. Каким-то образом технология одновременно получила недостаточно и слишком много кредитов за то, что она могла на самом деле достичь. Тем не менее, обычный человек мог указать на хотя бы одну или две области, где ИИ работал, выполняя высокоспециализированные задачи довольно хорошо, в высококонтролируемых средах. Все, что было за пределами этого, было либо еще в исследовательской лаборатории, либо просто не существовало.
Сравните это с сегодняшним днем. С нулевыми навыками, кроме способности написать предложение или задать вопрос, мир находится у наших ног. Мы можем генерировать изображения, музыку и даже фильмы, которые действительно уникальны и удивительны, и имеют возможность нарушить целые отрасли. Мы можем ускорить наш процесс поиска, задав простой вопрос, который, если сформулировать правильно, может сгенерировать страницы настраиваемого контента, достаточно хорошего, чтобы выдать себя за университетского ученого … или среднего ученика третьего класса, если мы укажем точку зрения. Хотя они стали почти обычными за год или два, эти возможности считались абсолютно невозможными всего несколько лет назад. Область генеративного ИИ существовала, но еще не взлетела ни в коем случае.
Сегодня многие люди экспериментировали с генеративным ИИ, таким как ChatGPT, Midjourney или другие инструменты. Другие уже включили их в свою повседневную жизнь. Скорость, с которой они эволюционировали, просто ошеломляющая, и, учитывая достижения последних шести месяцев, мы, безусловно, будем поражены, снова и снова, в ближайшие несколько лет.
Одним из конкретных инструментов, задействованных в генеративном ИИ, является работа систем Retrieval-Augmented Generation (RAG) и их способность мыслить через особенно сложные запросы. Введение набора данных FRAMES, объясненного в подробности в статье о том, как работает набор данных для оценки, показывает, где сейчас находится состояние искусства, и куда оно направлено. Даже с момента введения FRAMES в конце 2024 года, несколько платформ уже побили новые рекорды по своей способности рассуждать через сложные и трудные запросы.
Давайте погрузимся в то, что FRAMES призван оценить, и как хорошо разные модели генеративного ИИ выполняют свои задачи. Мы можем увидеть, как и децентрализация, и открытые платформы не только держат свою позицию (заметно Sentient Chat), но и позволяют пользователям получить четкое представление о удивительном рассуждении, которое некоторые модели ИИ способны достигать.
FRAMES как окно в мозг GenAI
Набор данных FRAMES и его процесс оценки фокусируется на 824 “мульти-хоп” вопросах, предназначенных для того, чтобы требовать вывод, логическое соединение точек, использование нескольких разных источников для извлечения ключевой информации и способность логически соединить все вместе, чтобы ответить на вопрос. Вопросы требуют от 2 до 15 документов, чтобы ответить на них правильно, и также намеренно включают ограничения, математические расчеты и выводы, а также способность обрабатывать логические операции, основанные на времени. Другими словами, эти вопросы чрезвычайно сложны и на самом деле представляют очень реальные задачи исследования, которые человек может выполнить в Интернете. Мы сталкиваемся с этими проблемами все время и должны искать разбросанные ключевые кусочки информации в море интернет-источников, соединяя информацию на основе разных сайтов, создавая новую информацию, рассчитывая и выводя, и понимая, как консолидировать эти факты в правильный ответ на вопрос.
То, что исследователи обнаружили, когда набор данных был впервые выпущен и протестирован, заключалось в том, что лучшие модели GenAI были в состоянии быть примерно точными (около 40%), когда им приходилось отвечать, используя односторонние методы, но могли достичь точности 73%, если им разрешалось собрать все необходимые документы, чтобы ответить на вопрос. Да, 73% могут не показаться революцией. Но если вы понимаете точно, что должно быть ответено, число становится гораздо более впечатляющим.
Например, один конкретный вопрос: “В каком году родился лидер группы, которая первоначально исполнила песню, семплированную в песне Канье Уэста ‘Power’?” Как человек подойдет к решению этой проблемы? Человек может увидеть, что ему нужно собрать различные элементы информации, такие как текст песни Канье Уэста “Power”, и затем быть в состоянии просмотреть текст и определить точку в песне, где на самом деле семплируется другая песня. Мы, как люди, могли бы, вероятно, послушать песню (даже если незнакомы с ней) и быть в состоянии сказать, когда другая песня семплируется.
Но подумайте об этом: что должно сделать GenAI, чтобы обнаружить другую песню, кроме оригинала, “слушая” ее? Это то место, где базовый вопрос становится отличным тестом на真正щий интеллект ИИ. И если мы смогли найти песню, послушать ее и определить текст, который семплируется, это только шаг 1. Нам все еще нужно узнать, какая песня, как называется группа, кто лидер этой группы, и затем, в каком году этот человек родился.
FRAMES показывает, что для ответа на реалистичные вопросы требуется огромное количество мыслительных процессов. Два вещи приходят на ум здесь.
Во-первых, способность децентрализованных моделей GenAI не только конкурировать, но и потенциально доминировать в результатах, является невероятной. Растущее число компаний использует децентрализованный метод для масштабирования своих возможностей обработки, обеспечивая, что большое сообщество владеет программным обеспечением, а не централизованная черная коробка, которая не будет делиться своими достижениями. Компании, такие как Perplexity и Sentient, ведут эту тенденцию, каждая из которых имеет мощные модели, выполняющие выше первых показателей точности, когда FRAMES был выпущен.
Второй элемент заключается в том, что меньшее количество этих моделей ИИ не только децентрализованы, но и открыты. Например, Sentient Chat является обоими, и ранние тесты показывают, насколько сложным может быть его рассуждение, благодаря бесценному открытому доступу. Вопрос FRAMES выше ответывается, используя практически тот же мыслительный процесс, что и человек, с деталями рассуждения, доступными для просмотра. Может быть, даже более интересно, их платформа структурирована как ряд моделей, которые могут тонко настроить данную точку зрения и производительность, даже если процесс тонкой настройки в некоторых моделях GenAI приводит к снижению точности. В случае с Sentient Chat было разработано множество моделей. Например, недавняя модель под названием “Dobby 8B” способна не только превзойти эталон FRAMES, но и развить особый про-криптовалютный и про-свободный настрой, который влияет на точку зрения модели, когда она обрабатывает кусочки информации и разрабатывает ответ.
На горизонте
Ключ ко всем этим удивительным инновациям заключается в быстрой скорости, которая привела нас сюда. Мы должны признать, что, учитывая, насколько быстро эволюционировала эта технология, она будет эволюционировать еще быстрее в ближайшем будущем. Мы сможем увидеть, особенно с децентрализованными и открытыми моделями GenAI, тот критический порог, где интеллект системы начинает превосходить все больше и больше наш собственный, и что это значит для будущего.












