Моделі та платформи ШІ

Ілюзія розумових здібностей штучного інтелекту: дослідження Apple та дебати про можливість думання штучного інтелекту

mm
Додайте Unite.AI до бажаних джерел у Google
The Illusion of AI Reasoning: Apple’s Study and the Debate Over AI’s Thinking Abilities

Штучний інтелект (AI) тепер є частиною нашого повсякденного життя. Він керує голосовими асистентами, керує чат-ботами та допомагає приймати важливі рішення в галузях, таких як охорона здоров’я, банківська справа та бізнес. Розширені системи, такі як GPT-4 від OpenAI та Gemini від Google (GOOGL ), часто вважаються здатними надавати розумні, схожі на людські відповіді. Багато людей вважають, що ці моделі можуть мислити та розуміти як люди.

Однак дослідження Apple 2025 року (AAPL ) поставило під сумнів цю віру. Їхнє дослідження питання, чи ці Больші моделі rozumіння (LRM) дійсно здатні мислити. Дослідження показало, що ці AI можуть не використовувати справжнє розуміння, а натомість покладатися на визнання закономірностей. Моделі ідентифікують та повторюють закономірності з їхніх навчальних даних, а не створюють нову логіку чи розуміння.

Apple протестувала кілька провідних моделей AI за допомогою класичних логічних головоломок. Результати були несподіваними. На простих завданнях стандартні моделі іноді виконувалися краще, ніж більш просунуті моделі rozumіння. На завданням середньої складності LRM, призначені для надання структурованого розуміння з кроками, показали деяку перевагу. Але коли головоломки стали більш складними, обидва типи моделей повністю провалилися. Навіть коли їм давали правильне крок за кроком рішення, моделі не могли слідувати йому надійно.

Дослідження Apple викликало дебати в спільноті штучного інтелекту. Деякі експерти погоджуються з Apple, кажучи, що ці моделі надають лише ілюзію розуміння. Інші стверджують, що тести можуть не повністю відображати можливості AI, і що потрібні більш ефективні методи. Головне питання тепер таке: Чи може штучний інтелект дійсно мислити, або це просто просунуте визнання закономірностей?

Це питання важливо для всіх. З тим, як штучний інтелект стає все більш поширеним, важливо зрозуміти, що ці системи можуть і чого не можуть зробити.

Що таке Больші моделі rozumіння (LRM)?

LRM – це системи штучного інтелекту, призначені для розв’язання проблем шляхом крок за кроком розуміння. На відміну від стандартних мовних моделей, які генерують відповіді на основі передбачення наступного слова, LRM мають на меті надавати логічні пояснення. Це робить їх корисними для завдань, які потребують кількох кроків розуміння та абстрактного мислення.

LRM тренуються на великих наборах даних, які включають книги, статті, веб-сайти та інші тексти. Це дозволяє моделям зрозуміти закономірності мови та логічні структури, які зазвичай зустрічаються в людському розумінні. Надавши крок за кроком пояснення, LRM мають на меті надати більш чіткі та надійні результати.

Ці моделі перспективні, оскільки вони можуть виконувати складні завдання в різних галузях. Метою є підвищення прозорості у процесі прийняття рішень, особливо в критичних галузях, які залежать від точних та логічних висновків.

Однак є побоювання щодо того, чи дійсно LRM здатні мислити. Деякі вважають, що замість людського мислення вони можуть використовувати визнання закономірностей. Це викликає питання про справжні обмеження систем штучного інтелекту та чи вони просто імітують розуміння.

Дослідження Apple: тестування розуміння штучного інтелекту та ілюзія мислення

Щоб відповісти на питання, чи LRM можуть дійсно мислити, чи просто імітують розуміння, команда дослідників Apple розробила серію експериментів за допомогою класичних логічних головоломок. Це включало в себе головоломки “Вежа Ханой”, “Перехрестя річки” та “Світ блоків”, які давно використовуються для тестування людського логічного мислення. Команда вибрала ці головоломки, оскільки їхню складність можна було регулювати. Це дозволило їм оцінити як стандартні мовні моделі, так і LRM під різним рівнем складності.

Підхід Apple до тестування розуміння штучного інтелекту відрізнявся від традиційних бенчмарків, які часто фокусуються на математичних або кодових завданнях. Ці тести можуть бути під впливом даних, на яких були треновані моделі. Замість цього команда Apple використала головоломки, які дозволяли їм контролювати складність, зберігаючи при цьому логічні структури. Це дозволило їм спостерігати не тільки за кінцевими відповідями, але й за кроками розуміння, які приймали моделі.

Дослідження показало три різні рівні виконання:

Прості завдання

На фундаментальних завданнях стандартні мовні моделі іноді виконувалися краще, ніж більш просунуті LRM. Ці завдання були достатньо простими, щоб простіші моделі могли генерувати правильні відповіді більш ефективно.

Завдання середньої складності

З підвищенням складності головоломок LRM, призначені для надання структурованого розуміння з кроками, показали певну перевагу. Ці моделі могли слідувати процесу розуміння та надавати більш точні рішення, ніж стандартні моделі.

Складні завдання

При столкненні з більш складними завданнями обидва типи моделей повністю провалилися. Хоча моделям були достатні обчислювальні ресурси, вони не могли розв’язати завдання. Їхня точність впала до нуля, вказуючи на те, що вони не могли впоратися з рівнем складності, необхідним для цих завдань.

Визнання закономірностей чи справжнє розуміння?

При подальшому аналізі дослідники виявили більше проблем з розумінням моделей. Відповіді, надані моделями, залежали сильно від того, як були представлені завдання. Незначні зміни, такі як зміна чисел або назв змінних, могли привести до зовсім різних відповідей. Ця несумісність вказує на те, що моделі покладаються на вивчені закономірності з їхніх навчальних даних, а не застосовують логічне розуміння.

Дослідження показало, що навіть коли явні алгоритми або крок за кроком інструкції були надані, моделі часто не могли використовувати їх правильно, коли складність головоломок підвищувалася. Їхні сліди розуміння показали, що моделі не послідовно слідували правилам чи логіці. Замість цього їхні рішення змінювалися на основі поверхневих змін у вході, а не фактичної структури завдання.

Команда Apple дійшла висновку, що те, що здавалося розумінням, часто було просто просунутим визнанням закономірностей. Хоча ці моделі можуть імітувати розуміння, визнаючи знайомі закономірності, вони не дійсно розуміють завдання чи застосовують логіку в людському стилі.

Тривалий дебат: чи може штучний інтелект дійсно мислити, чи просто імітувати мислення?

Дослідження Apple викликало дебат у спільноті штучного інтелекту щодо того, чи LRM можуть дійсно мислити. Багато експертів тепер підтримують висновки Apple, стверджуючи, що ці моделі створюють ілюзію розуміння. Вони вважають, що при столкненні з складними або новими завданнями обидва типи моделей мають труднощі, навіть коли їм надають правильні інструкції або алгоритми. Це вказує на те, що розуміння часто є просто здатністю визнавати та повторювати закономірності з навчальних даних, а не справжнім розумінням.

З іншого боку, компанії, такі як OpenAI, та деякі дослідники вважають, що їхні моделі можуть мислити. Вони вказують на високі результати на стандартизованих тестах, таких як LSAT, та складних математичних іспитах. Наприклад, GPT-4 від OpenAI набрав 88-й процентиль серед тестируваних на LSAT. Деякі інтерпретують цю високу продуктивність як доказ здатності до розуміння. Прихильники цього погляду стверджують, що такі результати показують, що моделі штучного інтелекту можуть мислити, принаймні в деяких ситуаціях.

Однак дослідження Apple поставило під сумнів цей погляд. Дослідники стверджують, що високі результати на стандартизованих тестах не обов’язково вказують на справжнє розуміння чи розуміння. Поточні бенчмарки можуть не повністю відображати можливості розуміння та можуть бути під впливом даних, на яких були треновані моделі. У багатьох випадках моделі можуть просто повторювати закономірності з їхніх навчальних даних, а не дійсно мислити над новими завданнями.

Цей дебат має практичні наслідки. Якщо моделі штучного інтелекту не можуть дійсно мислити, вони можуть не бути надійними для завдань, які потребують логічного прийняття рішень. Це особливо важливо в галузях, таких як охорона здоров’я, фінанси та право, де помилки можуть мати серйозні наслідки. Наприклад, якщо модель штучного інтелекту не може застосувати логіку до нових або складних медичних випадків, помилки більш ймовірні. Аналогічно, системи штучного інтелекту у фінансах, які не мають здатності мислити, можуть приймати погані інвестиційні рішення або неправильно оцінювати ризики.

Висновки Apple також попереджають, що хоча моделі штучного інтелекту корисні для завдань, таких як генерація контенту та аналіз даних, вони повинні бути застосовані з обережністю в галузях, які потребують глибокого розуміння чи критичного мислення. Деякі експерти вважають відсутність справжнього розуміння значною обмеженням, тоді як інші вважають, що визнання закономірностей само по собі може бути корисним для багатьох практичних застосувань.

Що далі для розуміння штучного інтелекту?

Майбутнє розуміння штучного інтелекту залишається невизначеним. Деякі дослідники вважають, що з більшою кількістю даних, кращими моделями та покращеними архітектурами штучний інтелект продовжить розвивати справжню здатність до розуміння. Інші є більш скептичними та вважають, що поточні моделі штучного інтелекту можуть завжди бути обмежені визнанням закономірностей, ніколи не займаючись людським мисленням.

Дослідники зараз розробляють нові методи оцінки, щоб оцінити здатність моделей штучного інтелекту обробляти завдання, з якими вони ніколи не зустрічалися раніше. Ці тести мають на меті оцінити, чи може штучний інтелект критично мислити та пояснювати своє розуміння в спосіб, який має сенс для людей. Якщо успішні, ці тести можуть надати більш точне розуміння того, як добре штучний інтелект може мислити, та допомогти дослідникам розробити кращі моделі.

Є також зростаючий інтерес до розробки гібридних моделей, які поєднують сильні сторони визнання закономірностей та розуміння. Ці моделі будуть використовувати нейронні мережі для визнання закономірностей та символьні системи розуміння для більш складних завдань. Apple та NVIDIA (NVDA ), як повідомляється, досліджують ці гібридні підходи, які можуть привести до систем штучного інтелекту, здатних до справжнього розуміння.

Висновок

Дослідження Apple 2025 року підняло важливі питання щодо справжньої природи здатності штучного інтелекту до розуміння. Хоча моделі штучного інтелекту, такі як LRM, показують великі перспективи в різних галузях, дослідження попереджає, що вони можуть не володіти справжнім розумінням чи людським мисленням. Замість цього вони покладаються на визнання закономірностей, що обмежує їхню ефективність у завданнях, які потребують більш складних когнітивних процесів. Штучний інтелект продовжує формувати майбутнє, роблячи важливим визнання як його сильних сторін, так і обмежень. Покращуючи методи тестування та керуючи нашими очікуваннями, ми можи використовувати штучний інтелект відповідально. Це забезпечить, що він доповнюватиме людське прийняття рішень, а не замінюватиме його.

Доктор Ассад Аббас, доцент COMSATS University Islamabad, Пакистан, отримав ступінь доктора філософії в Північному державному університеті Дакоти, США. Його дослідження зосереджені на передових технологіях, включаючи хмарні, туманні та краєві обчислення, великі дані та аналіз штучного інтелекту. Доктор Аббас зробив суттєві внески з публікаціями в авторитетних наукових журналах та конференціях. Він також є засновником MyFastingBuddy.