AGI та майбутній ШІ
Зв’язуючи точки: розгадка проекту Q-Star від OpenAI
Нещодавно в спільноті штучного інтелекту виникло чимало спекуляцій щодо проекту Q-Star від OpenAI. Незважаючи на обмежену інформацію про цю загадкову ініціативу, вона, як кажуть, є суттєвим кроком на шляху до досягнення штучного загального інтелекту – рівня інтелекту, який дорівнює або перевищує людські можливості. Хоча більшість обговорень зосереджувалася на потенційних негативних наслідках цього розвитку для людства, було відносно мало зусиль, спрямованих на розкриття суті Q-Star та потенційних технологічних переваг, які він може принести. У цій статті я спробую розгадати цей проект, головним чином з його назви, яку, на мою думку, достатньо, щоб отримати уявлення про нього.
Фон загадки
Все почалося, коли рада директорів OpenAI раптово усунула Сема Альтмана, генерального директора та співзасновника. Хоча Альтман пізніше був відновлений на посаді, питання про ці події залишаються. Деякі вважають це боротьбою за владу, тоді як інші приписують це його увагі до інших проектів, таких як Worldcoin. Однак ситуація ускладнюється, коли Reuters повідомляє, що секретний проект під назвою Q-Star може бути основною причиною цього драми. За даними Reuters, Q-Star є суттєвим кроком на шляху до досягнення мети OpenAI щодо штучного загального інтелекту, питання, яке було висунуто працівниками OpenAI до ради директорів. Поява цієї новини викликала хвилю спекуляцій та занепокоєння.
Будівельні блоки пазла
У цьому розділі я представив деякі будівельні блоки, які допоможуть нам розгадати цю загадку.
- Q-навчання: Навчання з підкріпленням – це тип машинного навчання, при якому комп’ютери вчаться, взаємодіючи зі своєю середовищем, отримуючи відгуки у вигляді нагород або штрафів. Q-навчання – це спеціальний метод навчання з підкріпленням, який допомагає комп’ютерам приймати рішення, вивчаючи якість (Q-значення) різних дій у різних ситуаціях. Це широко використовується в сценаріях, таких як гра та робототехніка, що дозволяє комп’ютерам вивчати оптимальне прийняття рішень через процес проб і помилок.
- A-шукання: A-шукання – це алгоритм пошуку, який допомагає комп’ютерам досліджувати можливості та знаходити найкраще рішення задачі. Алгоритм особливо відомий своєю ефективністю у знаходженні найкоротшого шляху від початкової точки до мети у графі або сітці. Його основна сила полягає в розумному зважуванні витрат на досягнення вузла проти оцінки витрат на досягнення загальної мети. Таким чином, A-шукання широко використовується для вирішення завдань, пов’язаних з пошуком шляху та оптимізацією.
- AlphaZero: AlphaZero, розширений системою штучного інтелекту від DeepMind, поєднує Q-навчання та пошук (тобто, пошук дерева Монте-Карло) для стратегічного планування у настільних іграх, таких як шахи та Го. Він вивчає оптимальні стратегії через самоігру, керовану нейронною мережею для рухів та оцінки позицій. Алгоритм пошуку дерева Монте-Карло (MCTS) балансує дослідження та експлуатацію при дослідженні можливостей гри. Ітеративна самоігра, навчання та пошук AlphaZero ведуть до безперервного покращення, дозволяючи досягти надлюдських результатів та перемог над людськими чемпіонами, демонструючи його ефективність у стратегічному плануванні та вирішенні проблем.
- Моделі мови: Моделі великої мови (LLM), такі як GPT-3, – це тип штучного інтелекту, призначений для розуміння та генерації тексту, подібного до людського. Вони проходять навчання на великих та різноманітних інтернет-даних, що охоплюють широкий спектр тем та стилів письма. Визначальною особливістю LLM є їхня здатність передбачати наступне слово у послідовності, відоме як моделювання мови. Метою є наділення моделі розумінням того, як слова та фрази взаємопов’язані, що дозволяє моделі генерувати текст, який є узгодженим та контекстно-релевантним. Розширені навчання роблять LLM здатними розуміти граматику, семантику та навіть нюансировані аспекти використання мови. Після навчання ці моделі мови можуть бути донастроєні для конкретних завдань або застосунків, роблячи їх універсальними інструментами для обробки природної мови, чат-ботів, генерації контенту та іншого.
- Штучний загальний інтелект: Штучний загальний інтелект (AGI) – це тип штучного інтелекту, який має здатність розуміти, вивчати та виконувати завдання у різних галузях на рівні, який дорівнює або перевищує людські когнітивні можливості. На відміну від вузького або спеціалізованого штучного інтелекту, AGI володіє здатністю автономно адаптуватися, розуміти та вивчати без обмеження конкретними завданнями. AGI дозволяє системам штучного інтелекту демонструвати незалежне прийняття рішень, вирішення проблем та творче мислення, віддзеркалюючи людський інтелект. По суті, AGI втілює ідею машини, здатної виконувати будь-яке інтелектуальне завдання, виконуване людьми, підкреслюючи універсальність та адаптивність у різних галузях.
Ключові обмеження LLM у досягненні AGI
Моделі великої мови (LLM) мають обмеження у досягненні штучного загального інтелекту (AGI). Хоча вони вміють обробляти та генерувати текст на основі вивчених закономірностей з великих даних, вони мають труднощі з розумінням реального світу, що перешкоджає ефективному використанню знань. AGI вимагає розуміння та планування повсякденних ситуацій, з чим LLM мають труднощі. Навіть якщо вони видають здавалося б правильні відповіді, вони не можуть систематично вирішувати складні проблеми, такі як математичні.
Нові дослідження показують, що LLM можуть імітувати будь-які обчислення, як універсальний комп’ютер, але обмежені необхідністю великої зовнішньої пам’яті. Збільшення даних є важливим для покращення LLM, але це вимагає значних обчислювальних ресурсів та енергії, на відміну від енергоефективного людського мозку. Це створює проблеми для широкого застосування та масштабування LLM для AGI. Останні дослідження свідчать, що просте додавання даних не завжди покращує результати, що викликає питання про те, на чому ще потрібно зосередитися на шляху до AGI.
Зв’язування точок
Багато експертів штучного інтелекту вважають, що труднощі з моделями великої мови походять від їхньої основної уваги до передбачення наступного слова. Це обмежує їхнє розуміння нюансів мови, розуміння та планування. Для вирішення цієї проблеми дослідники, такі як Ян Лекун, пропонують спробувати різні методи навчання. Вони пропонують, щоб LLM активно планували передбачення слів, а не просто передбачали наступний токен.
Ідея “Q-Star”, подібна до стратегії AlphaZero, може полягати у тому, щоб інструктувати LLM активно планувати передбачення токенів, а не просто передбачати наступне слово. Це вводить структуроване розуміння та планування у мовну модель, виходячи за рамки звичайної уваги до передбачення наступного токену. Використовуючи стратегії планування, надихнуті AlphaZero, LLM можуть краще розуміти нюанси мови, покращувати розуміння та планування, вирішуючи обмеження звичайних методів навчання LLM.
Така інтеграція створює гнучку основу для представлення та маніпулювання знаннями, допомагаючи системі адаптуватися до нової інформації та завдань. Ця адаптивність може бути критичною для штучного загального інтелекту (AGI), який потребує обробки різних завдань та галузей з різними вимогами.
AGI потребує звичайного розуміння, і навчання LLM розуміти може наділити їх повним розумінням світу. Навчання LLM, подібне до AlphaZero, також може допомогти їм вивчити абстрактні знання, покращуючи переносимість та узагальнення у різних ситуаціях, що сприяє сильній роботі AGI.
Крім назви проекту, підтримку цієї ідеї надає звіт Reuters, який підкреслює здатність Q-Star успішно вирішувати певні математичні та розумові завдання.
Основний висновок
Q-Star, секретний проект OpenAI, викликає хвилю у сфері штучного інтелекту, спрямовану на досягнення інтелекту, який перевершує людський. Серед обговорень про потенційні ризики цього проекту, ця стаття розгадує пазл, зв’язуючи точки від Q-навчання до AlphaZero та моделей великої мови (LLM).
Ми вважаємо, що “Q-Star” означає розумне поєднання навчання та пошуку, наділяючи LLM можливістю планування та розуміння. Згідно з заявою Reuters про те, що він може вирішувати складні математичні та розумові завдання, це свідчить про суттєвий прогрес. Це вимагає ближчого погляду на те, куди може рухатися навчання штучного інтелекту в майбутньому.












