Лідери думок
Як добре можуть LLMи справлятися з заплутаними проблемами?
Введення та еволюція генеративного ІІ було настільки раптовим і інтенсивним, що досить складно повністю оцінити, наскільки ця технологія змінила нашу життя.
Відступимо назад до трьох років тому. Так, ІІ ставав дедалі більш поширеним, принаймні в теорії. Більше людей знали деякі речі, які воно могло робити, хоча навіть з цим були масові непорозуміння щодо можливостей ІІ. Якось ця технологія одночасно отримала недостатньо та надміру кредит за те, що воно могло насправді досягти. Все ж таки, звичайна людина могла вказати принаймні на одну чи дві області, де ІІ працювало, виконуючи високо спеціалізовані завдання достатньо добре, у високо контрольованих середовищах. Все, що було поза цим, було або ще в дослідницькій лабораторії, або просто не існувало.
Порівняйте це з сьогодні. З нульовими навичками, крім здатності написати речення або поставити питання, весь світ знаходиться у наших руках. Ми можемо генерувати зображення, музику та навіть фільми, які є真正ньо унікальними та чудовими, і мають можливість порушити цілі галузі. Ми можемо розширювати наш процес пошуку, ставлячи просте питання, яке, якщо сформульовано правильно, може згенерувати сторінкиCustomAttributes контенту, достатньо доброго, щоб видатися як університетський вчений … або середній учень третього класу, якщо ми вказуємо точку зору. Хоча вони якимось чином за рік чи два стали звичайними, ці можливості вважалися абсолютно неможливими кілька років тому. Область генеративного ІІ існувала, але ще не злетіла.
Сьогодні багато людей експериментували з генеративним ІІ, chẳng hạn як ChatGPT, Midjourney чи інші інструменти. Інші вже включили їх у свій щоденний життєвий цикл. Швидкість, з якою вони еволюціонували, є блискучою до точки майже тривожної. І враховуючи досягнення останніх шести місяців, ми, безумовно, будемо вражені знову і знову в найближчі кілька років.
Одним із конкретних інструментів, які використовуються в генеративному ІІ, є робота систем генерації з підтримкою пошуку (RAG) та їхня здатність думати через особливо складні запити. Введення FRAMES набору даних, описаного в статті про те, як працює набір даних для оцінки, показує, де зараз знаходиться стан мистецтва, і куди він рухається. Навіть після введення FRAMES у кінці 2024 року кілька платформ вже побили нові рекорди щодо їхньої здатності думати через складні та складні запити.
Давайте глибше розглянемо, що FRAMES призначено для оцінки, і як добре різні моделі генерації ІІ працюють. Ми можемо побачити, як децентралізація та відкриті платформи не тільки тримають свою позицію (зокрема Sentient Chat), але також дозволяють користувачам побачити ясний погляд на того неймовірного розуміння, якого деякі моделі ІІ здатні досягти.
FRAMES як вікно у мозок генерації ІІ
Набір даних FRAMES та процес оцінки зосереджується на 824 «багатоступеневих» питаннях, які вимагають висновку, логічного «з’єднання точок», використання кількох різних джерел для отримання ключової інформації та здатності логічно поєднати все це, щоб відповісти на питання. На питання потрібно від двох до 15 документів, щоб відповісти правильно, і також свідомо включають обмеження, математичні розрахунки та висновки, а також здатність обробляти часову логіку. Інакше кажучи, ці питання дуже складні і фактично представляють дуже реальні завдання дослідження, які людина могла б виконати в Інтернеті. Ми стикаємося з цими викликами постійно, і повинні шукати розсипані ключові шматки інформації в морі інтернет-джерел, поєднуючи інформацію на основі різних сайтів, створюючи нову інформацію шляхом розрахунків і висновків, і розуміючи, як консолідувати ці факти в правильну відповідь на питання.
Те, що дослідники виявили, коли набір даних був вперше випущений і протестований, полягає в тому, що найкращі моделі генерації ІІ були здатні бути досить точними (приблизно 40%), коли їм доводилося відповідати, використовуючи одноступеневі методи, але могли досягти точності 73%, якщо їм дозволили зібрати всі необхідні документи для відповіді на питання. Так, 73% можуть не здаватися революцією. Але якщо ви розумієте точно, що потрібно відповісти, цифра стає набагато вражаючою.
Наприклад, одне конкретне питання таке: «В якому році народився лідер групи, яка вперше виконала пісню, семпл якої використаний у пісні Каньє Веста «Power»?» Як людина підходила б до вирішення цієї проблеми? Людина могла б побачити, що їй потрібно зібрати різні інформаційні елементи, такі як тексти пісні Каньє Веста «Power», і потім бути здатною прослухати пісню (навіть якщо незнайома з нею) і визначити момент, коли насправді семплується інша пісня. Ми, люди, могли б, мабуть, прослухати пісню і визначити, коли інша пісня семплується.
Але подумайте про це: що повинно зробити генерація ІІ, щоб виявити пісню, іншу ніж оригінальну, «слухаючи» її? Це місце, де базове питання стає чудовим тестом真正ньо інтелектуального ІІ. І якщо ми змогли знайти пісню, прослухати її і визначити тексти, які семплуються, це лише крок 1. Ми все ще повинні дізнатися, яка назва пісні, яка група, хто лідер цієї групи, і потім, в якому році народився ця людина.
FRAMES показує, що для відповіді на реалістичні питання потрібно величезна кількість обробки думок. Два речі приходять на думку тут.
По-перше, здатність децентралізованих моделей генерації ІІ не тільки конкурувати, але потенційно домінувати в результатах, є неймовірною. Дедалі більше компаній використовують децентралізований метод для масштабування своїх можливостей обробки, забезпечуючи, що велика спільнота володіє програмним забезпеченням, а не централізована «чорна скринька», яка не поділиться своїми досягненнями. Компанії, такі як Perplexity і Sentient, очолюють цей тренд, кожна з яких має потужні моделі, які виконують вище перших рекордів точності, коли FRAMES був випущений.
Другим елементом є те, що менша кількість цих моделей ІІ не тільки децентралізовані, але й відкриті. Наприклад, Sentient Chat є обома, і ранні тести показують, наскільки складним може бути його розуміння, завдяки невід’ємній відкритій доступності. Питання FRAMES вище відповідається тим же самим процесом думок, який би використала людина, з деталями розуміння, доступними для огляду. Можливо, навіть більш цікаво, їхня платформа структурована як ряд моделей, які можуть тонко налаштувати дану перспективу та продуктивність, навіть якщо процес тонкого налаштування в деяких моделях генерації ІІ призводить до зменшення точності. У випадку з Sentient Chat було розроблено багато різних моделей. Наприклад, недавня модель під назвою «Dobby 8B» здатна не тільки побити стандарт FRAMES, але й розвинути відмінну про-криптовалютну та про-свободу позицію, яка впливає на перспективу моделі під час обробки шматків інформації та розробки відповіді.
На горизонті
Ключем до всіх цих неймовірних інновацій є швидкість, з якою ми прийшли сюди. Ми повинні визнати, що так само швидко, як ця технологія еволюціонувала, вона тільки буде еволюціонувати ще швидше в найближчому майбутньому. Ми зможемо побачити, особливо з децентралізованими та відкритими моделями генерації ІІ, той критичний поріг, де інтелект системи починає перевершувати все більше і більше наш власний, і що це означає для майбутнього.












