Моделі та платформи ШІ

DeepSeek-Prover-V2: Переповнення прогалини між неформальною та формальною математичною логікою

mm
Додайте Unite.AI до бажаних джерел у Google

Хоча DeepSeek-R1 суттєво розширив можливості штучного інтелекту в неформальній логіці, формальна математична логіка залишається складною задачею для штучного інтелекту. Це головним чином тому, що створення верифікованих математичних доказів вимагає як глибокого концептуального розуміння, так і здатності будувати точні, крок за кроком логічні аргументи. Нещодавно, однак, було досягнуто суттєвого прогресу в цьому напрямку, оскільки дослідники з DeepSeek-AI представили DeepSeek-Prover-V2, відкритий штучний інтелект, здатний перетворювати математичну інтуїцію у суворі, верифіковані докази. Ця стаття детально розгляне особливості DeepSeek-Prover-V2 та його потенційний вплив на майбутні наукові відкриття.

Виклик формальної математичної логіки

Математики часто розв’язують задачі, використовуючи інтуїцію, евристику та високорівневе мислення. Цій підхід дозволяє їм пропускати кроки, які здаються очевидними, або покладатися на апроксимації, достатні для їхніх потреб. Однак формальне доведення теорем вимагає іншого підходу. Воно вимагає повної точності, з кожним кроком явно зазначеним і логічно виправданим без будь-якої двозначності.

Недавні досягнення в галузі великих мовних моделей (LLM) показали, що вони можуть розв’язувати складні математичні задачі рівня змагань, використовуючи природно-мовне мислення. Незважаючи на ці досягнення, LLM все ще мають труднощі з перетворенням інтуїтивного мислення у формальні докази, які можуть бути верифіковані машинами. Це головним чином тому, що неформальне мислення часто включає в себе скорочення та пропущені кроки, які формальні системи не можуть верифікувати.

DeepSeek-Prover-V2 вирішує цю проблему, поєднуючи сильні сторони неформального та формального мислення. Воно розбиває складні задачі на менші, керувані частини, зберігаючи при цьому точність, необхідну для формальної верифікації. Цей підхід полегшує міст між людською інтуїцією та машинно-верифікованими доказами.

Новий підхід до доведення теорем

По суті, DeepSeek-Prover-V2 використовує унікальний потік обробки даних, який включає як неформальне, так і формальне мислення. Потік починається з DeepSeek-V3, загального мовного моделі, який аналізує математичні задачі природною мовою, розбиває їх на менші кроки та перекладає ці кроки на формальну мову, яку можуть зрозуміти машини.

Натомість ніж намагатися розв’язати всю задачу одразу, система розбиває її на серію “підзадач” – проміжних лем, які служать сходинками до кінцевого доказу. Цей підхід повторює той, яким люди-математики розв’язують складні задачі, працюючи над керованими частинами, а не намагаючись розв’язати все одразу.

Що робить цей підхід особливо інноваційним, так це те, як він синтезує навчальні дані. Коли всі підзадачі складної задачі успішно розв’язані, система поєднує ці рішення у повний формальний доказ. Цей доказ потім поєднується з ланцюжком мислення DeepSeek-V3, щоб створити високоякісні “холодні” навчальні дані для навчання моделі.

Зміцнювальне навчання для математичної логіки

Після початкового навчання на синтетичних даних DeepSeek-Prover-V2 використовує зміцнювальне навчання, щоб ще більше підвищити свої можливості. Модель отримує зворотний зв’язок про те, чи її рішення правильні чи ні, і вона використовує цей зворотний зв’язок, щоб вивчити, які підходи працюють найкраще.

Одна з проблем тут полягає в тому, що структура згенерованих доказів не завжди збігається з розкладом лем, запропонованим ланцюжком мислення. Щоб виправити це, дослідники включили винагороду за узгодженість на етапах навчання, щоб зменшити структуру місалайнменту та забезпечити включення всіх розкладених лем у кінцеві докази. Цей підхід до узгодженості виявився особливо ефективним для складних теорем, які вимагають багатокрокового мислення.

Продуктивність та реальні можливості

Продуктивність DeepSeek-Prover-V2 на встановлених бенчмарках демонструє його виняткові можливості. Модель досягає вражаючих результатів на бенчмарку MiniF2F-test та успішно розв’язує 49 із 658 задач з PutnamBench – колекції задач з престижної математичної олімпіади імені Вільяма Лоуелла Путнама.

Можливо, ще більш вражаюче те, що при оцінці 15 вибраних задач з недавніх Американських інвітаційних математичних іспитів (AIME) модель успішно розв’язала 6 задач. Також цікаво відзначити, що порівняно з DeepSeek-Prover-V2, DeepSeek-V3 розв’язала 8 цих задач, використовуючи голосування більшості. Це свідчить про те, що розрив між формальною та неформальною математичною логікою швидко звужується в LLM. Однак продуктивність моделі на комбінаторних задачах все ще потребує покращення, що підкреслює область, де майбутні дослідження могли б зосередитися.

ProverBench: Новий бенчмарк для штучного інтелекту в математиці

Дослідники з DeepSeek також представили новий бенчмарк-датасет для оцінки математичної здатності розв’язувати задачі LLM. Цей бенчмарк, названий ProverBench, складається з 325 формалізованих математичних задач, включаючи 15 задач з недавніх змагань AIME, а також задачі з підручників та освітніх турторіалів. Ці задачі охоплюють галузі, такі як теорія чисел, алгебра, аналіз, дійсний аналіз та ін. Введення задач AIME особливо важливе, оскільки воно оцінює модель на задачах, які вимагають не тільки відтворення знань, але й творчого розв’язання задач.

Відкритий доступ та майбутні наслідки

DeepSeek-Prover-V2 пропонує цікаву можливість завдяки своїй відкритості. Розміщений на платформах, таких як Hugging Face, модель доступна широкому колу користувачів, включаючи дослідників, педагогів та розробників. З обома більш легкою 7-мільярдною версією параметрів та потужною 671-мільярдною версією параметрів дослідники DeepSeek забезпечують, щоб користувачі з різними обчислювальними ресурсами все одно могли користуватися нею. Цей відкритий доступ заохочує експерименти та дозволяє розробникам створювати просунуті інструменти штучного інтелекту для математичного розв’язування задач. Як результат, ця модель має потенціал стимулювати інновації в математичних дослідженнях, наділяючи дослідників можливістю розв’язувати складні задачі та відкривати нові знання в галузі.

Наслідки для штучного інтелекту та математичних досліджень

Розробка DeepSeek-Prover-V2 має суттєві наслідки не тільки для математичних досліджень, але й для штучного інтелекту. Спроможність моделі генерувати формальні докази може допомогти математикам у розв’язанні складних теорем, автоматизації процесів верифікації та навіть запропонуванні нових гіпотез. Крім того, техніки, використані для створення DeepSeek-Prover-V2, можуть вплинути на розвиток майбутніх моделей штучного інтелекту в інших галузях, які залежать від суворої логічної логіки, таких як розробка програмного та апаратного забезпечення.

Дослідники планують розширити модель, щоб вона могла розв’язувати ще більш складні задачі, такі як ті, що представлені на Міжнародній математичній олімпіаді (IMO). Це може ще більше підвищити можливості штучного інтелекту щодо доведення математичних теорем. Коли моделі, подібні до DeepSeek-Prover-V2, продовжують розвиватися, вони можуть переінакшити майбутнє як математики, так і штучного інтелекту, стимулюючи прогрес у галузі теоретичних досліджень та практичних застосувань у технологіях.

Висновок

DeepSeek-Prover-V2 є суттєвим кроком у розвитку штучного інтелекту для математичної логіки. Він поєднує неформальну інтуїцію з формальною логікою, розбиваючи складні задачі на менші частини та генеруючи верифіковані докази. Його вражаюча продуктивність на бенчмарках демонструє його потенціал для підтримки математиків, автоматизації верифікації доказів та навіть відкриття нових знань у галузі. Як відкрита модель, вона широко доступна, пропонуючи цікаві можливості для інновацій та нових застосувань у галузі штучного інтелекту та математики.

Доктор Техсін Зія є доцентом COMSATS University Islamabad, який має ступінь PhD з штучного інтелекту у Віденському технічному університеті, Австрія. Спеціалізується на штучному інтелекті, машинному навчанні, науці про дані та комп'ютерному баченні, він зробив значний внесок з публікаціями в авторитетних наукових журналах. Доктор Техсін також очолював різні промислові проекти як головний дослідник і служив консультантом з штучного інтелекту.