Моделі та платформи ШІ
Meta’s Llama 3.2: Перевизначення відкритого джерельного генераційного штучного інтелекту з можливостями на пристрої та багатомодальними можливостями
Нещодавнє запуск Meta’s Llama 3.2, остання ітерація в серії Llama великих мовних моделей, є значним кроком в еволюції відкритого джерельного генераційного штучного інтелекту. Ця оновлена версія розширює можливості Llama в двох напрямках. З одного боку, Llama 3.2 дозволяє обробляти багатомодальні дані – інтегруючи зображення, текст та інше, роблячи передові можливості штучного інтелекту більш доступними для широкої аудиторії. З іншого боку, вона розширює свої можливості розгортання на пристроях, створюючи цікаві можливості для застосунків штучного інтелекту в режимі реального часу на пристрої. У цій статті ми розглянемо цей розвиток та його наслідки для майбутнього розгортання штучного інтелекту.
Еволюція Llama
Подорож Meta з Llama почалася на початку 2023 року, і за цей час серія пережила експоненційний ріст та прийняття. Починаючи з Llama 1, який був обмежений некомерційним використанням і був доступний лише для вибраних дослідницьких інститутів, серія перейшла в відкритий джерельний світ з випуском Llama 2 у 2023 році. Запуск Llama 3.1 на початку цього року був значним кроком вперед в еволюції, оскільки він представив найбільшу відкриту модель з 405 мільярдами параметрів, яка є або на рівні, або перевершує своїх пропріетарних конкурентів. Останній випуск, Llama 3.2, робить ще один крок вперед, представляючи нові легкі та орієнтовані на бачення моделі, роблячи можливості штучного інтелекту на пристрої та багатомодальні функції більш доступними. Пристрасть Meta до відкритості та модифікованості дозволила Llama стати лідером у відкритому джерельному співтоваристві. Компанія вважає, що залишаючись вірною прозорості та доступності, ми можемо більш ефективно рухати інновації штучного інтелекту вперед – не тільки для розробників та бізнесу, але й для всіх людей у світі.
Познайомтеся з Llama 3.2
Llama 3.2 – це остання версія серії Llama, яка включає в себе різноманітні мовні моделі, розроблені для задоволення різних вимог. Найбільші та середні моделі, включаючи 90 та 11 мільярдів параметрів, призначені для обробки багатомодальних даних, включаючи текст та зображення. Ці моделі можуть ефективно інтерпретувати графіки, діаграми та інші форми візуальних даних, роблячи їх придатними для будівництва застосунків у таких областях, як комп’ютерне бачення, аналіз документів та інструменти доповненої реальності. Легкі моделі, що мають 1 мільярд та 3 мільярди параметрів, прийняті спеціально для мобільних пристроїв. Ці моделі лише для тексту відрізняються багатоязычним текстовим поколінням та можливостями виклику інструментів, роблячи їх високоефективними для завдань, таких як генерація з підтримкою пошуку, підсумовування та створення персоналізованих агентських застосунків на пристроях.
Значення Llama 3.2
Цей випуск Llama 3.2 можна визначити двома ключовими областями.
Нова ера багатомодального штучного інтелекту
Llama 3.2 – це перша відкрита модель Meta, яка володіє можливостями обробки тексту та зображень. Це значний розвиток у еволюції відкритого джерельного генераційного штучного інтелекту, оскільки він дозволяє моделі аналізувати та реагувати на візуальні входи поряд з текстовими даними. Наприклад, користувачі тепер можуть завантажувати зображення та отримувати детальний аналіз або модифікації на основі природних мовних підказок, таких як визначення об’єктів або генерація підписів. Марк Цукерберг підкреслив цю можливість під час запуску, заявивши, що Llama 3.2 призначена для “забезпечення багатьох цікавих застосунків, які вимагають візуального розуміння” . Ця інтеграція розширює сферу застосування Llama для галузей, що залежать від багатомодальної інформації, включаючи роздрібну торгівлю, охорону здоров’я, освіту та розваги.
Функціональність на пристрої для доступності
Однією з видатних особливостей Llama 3.2 є її оптимізація для розгортання на пристроях, особливо в мобільних середовищах. Легкі версії моделі з 1 мільярдом та 3 мільярдами параметрів спеціально розроблені для роботи на смартфонах та інших пристроях, що працюють на апаратному забезпеченні Qualcomm (QCOM ) та MediaTek. Ця утиліта дозволяє розробникам створювати застосунки без потреби у великих обчислювальних ресурсах. Крім того, ці версії моделі відрізняються багатоязычним текстовим обробленням та підтримують довшу довжину контексту 128К токенів, що дозволяє користувачам розробляти застосунки обробки природної мови у своїх рідних мовах. Крім того, ці моделі мають можливості виклику інструментів, що дозволяють користувачам займатися агентськими застосунками, такими як управління запрошеннями на календар та планування поїздок безпосередньо на своїх пристроях.
Спроможність розгортання моделей штучного інтелекту локально дозволяє відкритому джерельному штучному інтелекту подолати виклики, пов’язані з хмарними обчисленнями, включаючи проблеми затримки, ризики безпеки, високі операційні витрати та залежність від підключення до Інтернету. Цей розвиток має потенціал трансформувати галузі, такі як охорона здоров’я, освіта та логістика, дозволяючи їм використовувати штучний інтелект без обмежень хмарної інфраструктури або проблем з конфіденційністю, а також у реальних ситуаціях. Це також відкриває двері для штучного інтелекту, щоб досягти регіонів з обмеженою підключеністю, демократизуючи доступ до передових технологій.
Конкурентна перевага
Meta повідомляє, що Llama 3.2 показала конкурентоспроможність проти лідируючих моделей від OpenAI та Anthropic за показниками продуктивності. Вони стверджують, що Llama 3.2 перевершує конкурентів, таких як Claude 3-Haiku та GPT-4o-mini, у різних бенчмарках, включаючи завдання виконання інструкцій та підсумовування контенту. Ця конкурентна перевага є важливою для Meta, оскільки вона спрямована на забезпечення того, щоб відкритий джерельний штучний інтелект залишався на рівні з пропріетарними моделями в швидкозмінному полі генераційного штучного інтелекту.
Llama Stack: Спрощення розгортання штучного інтелекту
Одним з ключових аспектів випуску Llama 3.2 є введення Llama Stack. Цей набір інструментів робить його легшим для розробників працювати з моделями Llama у різних середовищах, включаючиSingleNode, локальні, хмарні та на пристрої. Llama Stack включає підтримку RAG та застосунків, що підтримуються інструментами, забезпечуючи гнучку та повну основу для розгортання моделей генераційного штучного інтелекту. Спрощуючи процес розгортання, Meta дозволяє розробникам без зусиль інтегрувати моделі Llama у свої застосунки, незалежно від того, чи це хмарні, мобільні чи настільні середовища.
Основне
Meta’s Llama 3.2 – це важливий момент в еволюції відкритого джерельного генераційного штучного інтелекту, встановлюючи нові стандарти для доступності, функціональності та універсальності. З її можливостями на пристрої та багатомодальними можливостями ця модель відкриває трансформаційні можливості у галузях, від охорони здоров’я до освіти, одночасно вирішуючи критичні проблеми, такі як конфіденційність, затримка та обмеження інфраструктури. Наділяючи розробників можливістю розгортання передових моделей штучного інтелекту локально та ефективно, Llama 3.2 не тільки розширює сферу застосування застосунків штучного інтелекту, але й демократизує доступ до передових технологій у глобальному масштабі.










