AGI та майбутній ШІ

Дослідження Gemini 1.5: Як остання багатопараметрова модель штучного інтелекту Google підвищує рівень штучного інтелекту за межі попередника

mm
Додайте Unite.AI до бажаних джерел у Google

У швидкозмінному ландшафті штучного інтелекту Google (GOOGL ) продовжує лідерство своїми новаторськими розробками у сфері багатопараметрових технологій штучного інтелекту. Незабаром після дебюту Gemini 1.0, їхньої передової багатопараметрової великомасштабної моделі мови, Google тепер представила Gemini 1.5. Ця ітерація не тільки посилює потенціал, закладений Gemini 1.0, але також приносить суттєві поліпшення у методах обробки та інтеграції багатопараметрових даних. Ця стаття пропонує дослідження Gemini 1.5, проливаючи світло на її інноваційний підхід та особливі характеристики.

Gemini 1.0: Закладення основи

Запущена Google DeepMind та Google Research 6 грудня 2023 року, Gemini 1.0 представила нове покоління багатопараметрових моделей штучного інтелекту, здатних розуміти та генерувати контент у різних форматах, таких як текст, аудіо, зображення та відео. Це стало суттєвим кроком у розвитку штучного інтелекту, розширивши можливості для обробки різноманітних типів інформації.

Видатною особливістю Gemini є її здатність безшовно поєднувати різні типи даних. На відміну від традиційних моделей штучного інтелекту, які можуть спеціалізуватися на одному типі даних, Gemini інтегрує текст, візуальні дані та аудіо. Ця інтеграція дозволяє їй виконувати завдання, такі як аналіз рукописних нотаток або розшифровка складних діаграм, тим самим розв’язуючи широкий спектр складних проблем.

Сімейство Gemini пропонує моделі для різних застосунків: модель Ultra для складних завдань, модель Pro для швидкості та масштабованості на основних платформах, таких як Google Bard, та моделі Nano (Nano-1 і Nano-2) з 1,8 мільярдами та 3,25 мільярдами параметрів, відповідно, призначені для інтеграції у пристрої, такі як смартфон Google Pixel 8 Pro.

Стрибок до Gemini 1.5

Останнє випущення Google, Gemini 1.5, підвищує функціональність та операційну ефективність свого попередника, Gemini 1.0. Ця версія采用є нову архітектуру «Суміш експертів» (Mixture-of-Experts, MoE), яка відходить від єдиного великомасштабного підходу, спостережуваного у попереднику. Ця архітектура включає колекцію менших, спеціалізованих моделей трансформерів, кожна з яких здатна обробляти конкретні сегменти даних або окремі завдання. Ця конструкція дозволяє Gemini 1.5 динамічно залучати найбільш підходящого експерта на основі вхідних даних, оптимізуючи здатність моделі до навчання та обробки інформації.

Цей інноваційний підхід суттєво підвищує ефективність навчання та розгортання моделі, активуючи лише необхідних експертів для завдань. Як наслідок, Gemini 1.5 здатна швидко опанувати складні завдання та надавати високоякісні результати більш ефективно, ніж традиційні моделі. Такі досягнення дозволяють командам досліджень Google прискорити розвиток та вдосконалення моделі Gemini, розширюючи можливості у сфері штучного інтелекту.

Розширення можливостей

Помітним досягненням у Gemini 1.5 є розширення її можливостей обробки інформації. Віконце контексту моделі, яке являє собою кількість даних користувача, яку вона може аналізувати для генерації відповідей, тепер розширюється до 1 мільйона токенів — суттєве збільшення порівняно з 32 000 токенів у Gemini 1.0. Це означає, що Gemini 1.5 Pro може одночасно обробляти великі об’єми даних, такі як година відеоконтенту, одинадцять годин аудіо або великі кодові бази та текстові документи. Її також успішно протестували з до 10 мільйонів токенів, демонструючи її виняткову здатність до розуміння та інтерпретації величезних наборів даних.

Огляд можливостей Gemini 1.5

Архітектурні поліпшення та розширення віконця контексту надають Gemini 1.5 можливості для виконання складного аналізу над великими наборами інформації. Чи то це дослідження інтригуючих деталей транскриптів місії «Аполлон-11» чи інтерпретація німіого фільму, Gemini 1.5 демонструє неперевершені можливості до розв’язання проблем, особливо з довгими блоками коду.

Розроблена на передових прискорювачах TPUv4 компанії Google, Gemini 1.5 Pro була навчена на різноманітному наборі даних, який охоплює різні галузі та включає багатопараметровий та багатомовний контент. Ця широкомасштабна база навчання, поєднана з тонкою настройкою на основі даних людських уподобань, забезпечує, що виходи Gemini 1.5 Pro добре резонують з людськими сприйняттями.

Через суворе тестування на різних завданнях Gemini 1.5 Pro не тільки перевершує свого попередника у більшості оцінок, але також конкурує з більшістю моделей Gemini 1.0 Ultra. Gemini 1.5 Pro демонструє сильні можливості «навчання у контексті», ефективно набуваючи нові знання з детальних підказок без необхідності подальших корекцій. Це було особливо очевидно у її виконанні на бенчмарку «Машинний переклад з однієї книги» (MTOB), де вона перекладала з англійської на Каламанг — мову, якою говорить невелика кількість людей — з майстерністю, порівнянною з людським навчанням, підкреслюючи її адаптивність та ефективність навчання.

Обмежений попередній перегляд

Gemini 1.5 Pro тепер доступна у обмеженому попередньому перегляді для розробників та корпоративних клієнтів через AI Studio та Vertex AI, з планами на ширше випущення та налаштовувані опції на горизонті. Цей етап попереднього перегляду пропонує унікальну можливість дослідити її розширене вікно контексту, з очікуваним поліпшенням швидкості обробки. Розробники та корпоративні клієнти, зацікавлені у Gemini 1.5 Pro, можуть зареєструватися через AI Studio або зв’язатися зі своїми командами Vertex AI для отримання додаткової інформації.

Резюме

Gemini 1.5 представляє суттєвий крок вперед у розвитку багатопараметрового штучного інтелекту. Будучи заснованою на фундаменті, закладеному Gemini 1.0, ця нова версія приносить поліпшені методи обробки та інтеграції різних типів даних. Введення нової архітектурної конструкції та розширення можливостей обробки даних підкреслюють тривалу спробу Google вдосконалити технологію штучного інтелекту. З її потенціалом для більш ефективного виконання завдань та вдосконалення навчання, Gemini 1.5 демонструє постійну еволюцію штучного інтелекту. Наразі доступна для обмеженої групи розробників та корпоративних клієнтів, вона сигналізує про цікаві можливості для майбутнього штучного інтелекту, з ширшим випущенням та подальшими вдосконаленнями на горизонті.

Доктор Техсін Зія є доцентом COMSATS University Islamabad, який має ступінь PhD з штучного інтелекту у Віденському технічному університеті, Австрія. Спеціалізується на штучному інтелекті, машинному навчанні, науці про дані та комп'ютерному баченні, він зробив значний внесок з публікаціями в авторитетних наукових журналах. Доктор Техсін також очолював різні промислові проекти як головний дослідник і служив консультантом з штучного інтелекту.