Моделі та платформи ШІ
Від срібла до золота: Як штучний інтелект DeepMind переміг на математичній олімпіаді

Штучний інтелект DeepMind зробив видатний прогрес у математичних доводах за рік. Після здобуття срібної медалі на Міжнародній математичній олімпіаді (IMO) у 2024 році, їхня система штучного інтелекту здобула золоту медаль у 2025 році. Цей швидкий прогрес підкреслює зростаючі можливості штучного інтелекту у вирішенні складних, абстрактних проблем, які вимагають людської креативності та інсайту. Ця стаття розповість про те, як DeepMind досягла цього перетворення, технічні та стратегічні рішення, що стоять за цим, та ширші наслідки цих досягнень.
Значення IMO
Міжнародна математична олімпіада, заснована у 1959 році, визнана у світі як головний математичний конкурс для учнів шкіл. Кожного року найкращі учні з усього світу стикаються з шістьма складними завданнями з алгебри, геометрії, теорії чисел та комбінаторики. Рішення цих завдань вимагає не тільки обчислень, але й справжньої математичної креативності, суворого логічного мислення та здатності будувати елегантні доводи.
Для штучного інтелекту IMO представляє унікальний виклик. Хоча штучний інтелект освоїв розпізнавання закономірностей, аналіз даних та навіть складні ігри, такі як Го та шахи, математика олімпіади вимагає творчого, абстрактного мислення та синтезу нових ідей, навичок, які традиційно вважаються ознаками людського інтелекту. Як наслідок, IMO стала природним полігоном для оцінки того, наскільки штучний інтелект наблизився до досягнення真正ного людського мислення.
Прорив срібної медалі 2024 року
У 2024 році DeepMind представила дві системи штучного інтелекту для вирішення завдань рівня IMO: AlphaProof та AlphaGeometry 2. Обидві системи є прикладами “нейро-символічного” штучного інтелекту, який поєднує сильні сторони великих мовних моделей (LLM) з суворістю символічної логіки.
AlphaProof був розроблений для доведення математичних тверджень за допомогою Lean, формальної математичної мови. Він поєднував Gemini, велику мовну модель DeepMind, з AlphaZero, який є двигуном навчання з підкріпленням, відомим своєю успішністю у настільних іграх. У цьому контексті роль Gemini полягала у перекладі природної мови завдань у Lean та спробі доведення шляхом генерації логічних кроків. AlphaProof був навчений на мільйонах зразків завдань різних математичних дисциплін та складностей. Система покращувалася шляхом спроб доведення все більш складних тверджень, подібно до того, як AlphaZero навчався, граючи у ігри проти себе.
AlphaGeometry 2 був розроблений для вирішення завдань геометрії. Тут мовне розуміння Gemini дозволило штучному інтелекту передбачити корисні допоміжні конструкції, тоді як символічний двигун логічних висновків керував логічними висновками. Цей гібридний підхід дозволив AlphaGeometry вирішувати геометричні завдання далеко за межами традиційного машинного мислення.
Разом ці системи вирішили чотири з шести завдань IMO: два з алгебри, одне з теорії чисел та одне з геометрії, досягнувши результату 28 з 42. Цей виступ був значним етапом, оскільки це був перший випадок, коли штучний інтелект достіг рівня срібної медалі на IMO. Однак цей успіх сильно залежав від людських експертів, які перекладали завдання у формальні математичні мови. Вони також потребували величезних обчислювальних ресурсів, які займали дні обробки часу для кожного завдання.
Технічні інновації позаду золотої медалі
Перехід DeepMind від срібної до золотої медалі був обумовлений кількома значними технічними поліпшеннями.
1. Природна мова як засіб доведення
Найбільш суттєвою зміною було перейняття від систем, які вимагали експертного перекладу у формальні мови, до використання природної мови як засобу доведення. Це досягнуто завдяки покращеній версії Gemini з можливостями Deep Think. Замість перекладу завдань у Lean, модель обробляє текст безпосередньо, генерує неформальні нариси, внутрішньо формалізує критичні кроки та створює розвинене англійське доведення. Навчання з підкріпленням від людської обратної зв’язки (RLHF) використовувалося для винагороди рішень, які були логічно послідовними, лаконічними та представленими.
Gemini Deep Think відрізняється від публічної версії Gemini двома основними способами. По-перше, він виділяє більші вікна контексту та більше обчислювальних токенів на запит, що дозволяє моделі підтримувати багатосторінкові ланцюги мислення. По-друге, він використовує паралельне мислення, де сотні спекулятивних ниток генеруються для різних потенційних рішень. Легкий наглядач потім ранжує та просуває найбільш перспективні шляхи, запозичуючи концепції з Monte Carlo tree search, але застосованих до тексту. Цей підхід імітує те, як людські команди мозгового штурму, відкидають непродуктивні ідеї та сходяться на елегантні рішення.
2. Навчання та навчання з підкріпленням
Навчання Gemini Deep Think включало дофінування моделі для передбачення наступних кроків, а не остаточних відповідей. Для цього було зібрано корпус з 100 000 високоякісних рішень олімпіад та університетських конкурсів. Корпус був здебільшого зібраний з публічних математичних форумів, arXiv preprints та коледжських задач. Людські наставники переглянули навчальні приклади, щоб фільтрувати нелогічні або незавершені доведення. Навчання з підкріпленням допомогло розвинути модель, штовхаючи її до створення лаконічних та точних доведень. Ранні версії створювали надто розгорнуті доведення, але штрафи за зайві фрази допомогли скоротити вивід.
На відміну від звичайного дофінування, яке часто бореться зі спорадичними винагородами, де зворотня зв’язка є бінарною, тобто доведення або правильне, або ні. DeepMind реалізував систему винагород за кроки, де кожна підтверджена підлема внесла свій внесок у загальний рахунок. Ця система винагородження направляє Gemini навіть тоді, коли повне доведення рідке. Процес навчання тривав три місяці та використовував приблизно 25 мільйонів TPU-годин.
3. Масове паралельне оброблення
Паралельне оброблення також відіграло критичну роль у прогресі DeepMind від срібної до золотої медалі. Кожне завдання генерувало декілька гілок міркування паралельно, з ресурсами, які динамічно змінювалися до більш перспективних напрямків, коли інші застрягали. Ця динамічна планування була особливо корисною для завдань комбінаторики, які мають великі простори рішень. Підхід подібний до того, як люди тестують допоміжні нерівності, перш ніж повністю займатися індукцією. Хоча цей метод був обчислювально дорогим, він був керований за допомогою кластерів TPU v5 від DeepMind.
DeepMind на IMO 2025
Для підтримання цілісності змагання DeepMind заморозила ваги моделі за три тижні до початку IMO, щоб запобігти витоку офіційних завдань у навчальний набір. Вони також фільтрували дані, які містили рішення попередньо неопублікованих олімпіадних питань.
Під час змагання Gemini Deep Think отримала шість офіційних завдань у форматі простого тексту, без доступу до інтернету. Система працювала на кластері, сконфігурованому для симуляції обчислювальної потужності стандартного ноутбука на процес. Уесь процес вирішення завдань був завершений менш ніж за три години, що було у межах часу, виділеного на виконання завдань. Генеровані доведення були подані організаторам IMO без змін.
Gemini Deep Think здобула ідеальні бали на перших п’яти завданнях. Останнє питання, яке було складним завданням комбінаторики, проте, зупинило як штучний інтелект, так і 94% людських учасників. Незважаючи на це, штучний інтелект завершив змагання з результатом 35/42, що забезпечило золоту медаль. Цей результат був на сім балів вищий, ніж попередній рік, коли було здобуто срібну медаль. Спостерігачі пізніше описали доведення штучного інтелекту як “дбайливі” та “повні”, відзначивши, що вони відповідали суворим обґрунтуванням, очікуваним від людських учасників.
Наслідки для штучного інтелекту та математики
Досягнення DeepMind є значним етапом як для штучного інтелекту, так і для математики. Для штучного інтелекту освоєння IMO є кроком до штучного загального інтелекту (AGI), де системи можуть виконувати будь-яке інтелектуальне завдання, яке може виконати людина. Рішення складних математичних завдань вимагає розуміння та міркування, які є фундаментальними компонентами загального інтелекту. Це досягнення вказує на те, що штучний інтелект робить кроки до більш людських когнітивних можливостей.
Для математики системи штучного інтелекту, такі як Gemini Deep Think, можуть стати невід’ємними інструментами для математиків. Вони можуть допомогти у вивченні нових областей, перевірці гіпотез та навіть відкритті нових теорем. Автоматизуючи більш рутинні аспекти побудови доведень, штучний інтелект звільняє людських математиків, щоб вони могли зосередитися на вищому рівні концептуальної роботи. Крім того, техніки, розроблені для цих систем штучного інтелекту, можуть надихнути нові методи математичних досліджень, які можуть бути неможливими лише за допомогою людських зусиль.
Однак прогрес штучного інтелекту в математиці також піднімає питання про роль штучного інтелекту в освітніх середовищах та змаганнях. По мірі зростання можливостей штучного інтелекту будуть тривати дискусії про те, як його участь може змінити природу математичної освіти та змагань.
Перспектива
Перемога на IMO – це значний етап, але багато математичних завдань ще залишаються поза межами можливостей сучасних систем штучного інтелекту. Однак швидкий прогрес від срібної до золотої медалі за рік підкреслює прискорений темп інновацій та розробок штучного інтелекту. Якщо цей темп продовжиться, системи штучного інтелекту можуть скоро вирішити деякі з найвідоміших нерозв’язаних математичних завдань. Хоча питання про те, чи штучний інтелект замінить або покращить людську креативність, залишається невирішеним, IMO 2025 є явним свідченням того, що штучний інтелект зробив значні кроки у логічному міркуванні. мents. Якщо цей темп продовжиться, системи штучного інтелекту можуть скоро вирішити деякі з найвідоміших нерозв’язаних математичних завдань. Хоча питання про те, чи штучний інтелект замінить або покращить людську креативність, залишається невирішеним, IMO 2025 є явним свідченням того, що штучний інтелект зробив значні кроки у логічному міркуванні.












