Моделі та платформи ШІ
Повний посібник з тонкої настройки великих мовних моделей

By
Aayush Mittal Міттал
Великі мовні моделі (LLM) типу GPT-4, LaMDA, PaLM та інші захопили світ своєю здатністю розуміти та генерувати текст, подібний до людського, на величезному спектрі тем. Ці моделі попередньо тренуються на величезних наборах даних, що складаються з мільярдів слів з інтернету, книг та інших джерел.
Ця фаза попереднього тренування наділяє моделі широкими знаннями про мову, теми, здатність до висновків та навіть певними упередженнями, присутніми в тренувальних даних. Однак, попри їхню неймовірну широту, ці попередньо треновані LLM позбавлені спеціалізованої експертизи для конкретних галузей або завдань.
Саме тут вступає в дію тонка настройка – процес адаптації попередньо тренованої LLM для виконання конкретної задачі або застосування. Надалі тренуючи модель на меншому, завдань-специфічному наборі даних, ми можемо налаштувати її можливості для відповідності нюансам і вимогам цієї галузі.
Тонка настройка аналогічна передачі широких знань високої освіти загального спеціаліста для створення спеціаліста у певній галузі. У цьому посібнику ми розберемся у тому, що таке тонка настройка LLM, чому вона потрібна та як її здійснювати.
Що таке тонка настройка?
У своїй основі тонка настройка полягає у тому, що береться велика попередньо тренована модель і оновлюються її параметри під час другої фази тренування на наборі даних, створеному для вашої цільової задачі або галузі. Це дозволяє моделі вивчити і внутрішньо засвоїти нюанси, закономірності та цілі, специфічні для цієї вузької галузі.
Хоча попереднє тренування захоплює широке мовне розуміння з величезного і різноманітного текстового корпусу, тонка настройка спеціалізує цю загальну компетентність. Це схоже на те, що з Ренесансної людини роблять спеціаліста в певній галузі.
Ваги попередньо тренованої моделі, які кодують її загальні знання, використовуються як початкова точка або ініціалізація для процесу тонкої настройки. Модель потім тренується далі, але цього разу на прикладах, безпосередньо актуальних для кінцевого застосування.
Відкриваючи модель цьому спеціалізованому розподілу даних і налаштовуючи параметри моделі відповідно, ми робимо LLM більш точною і ефективною для цільової задачі, зберігаючи при цьому широкі попередньо треновані можливості як основу.
Чому тонко налаштовувати LLM?
Є кілька ключових причин, чому ви можете бажати тонко налаштувати велику мовну модель:
- Кастомізація галузі: Кожна галузь, від юридичної до медичної та інженерної, має свої нюансовані мовні конвенції, жаргон і контексти. Тонка настройка дозволяє вам пристосувати загальну модель для розуміння і генерації тексту, адаптованого до конкретної галузі.
- Спеціалізація задач: LLM можуть бути тонко налаштовані для різних завдань обробки природної мови, таких як підсумовування тексту, машинний переклад, питання-відповідь тощо. Ця спеціалізація підвищує продуктивність на цільовій задачі.
- Збереження даних: Високо регульовані галузі, такі як охорона здоров’я та фінанси, мають суворі вимоги щодо конфіденційності даних. Тонка настройка дозволяє тренувати LLM на пропрієтарних організаційних даних, захищаючи при цьому конфіденційну інформацію.
- Обмежені dánні: Отримання великих dánних наборів для тренування моделей з нуля може бути складним. Тонка настройка дозволяє досягти високої продуктивності на обмежених dánних прикладах, використовуючи можливості попередньо тренованої моделі.
- Оновлення моделі: Коли з’являються нові дані в галузі з часом, ви можете тонко налаштувати моделі далі, щоб включити останні знання і можливості.
- Мітігування упереджень: LLM можуть поглинати суспільні упередження з широких попередніх тренувальних даних. Тонка настройка на кураторських наборах даних може допомогти зменшити і виправити ці небажані упередження.
По суті, тонка настройка містить пробіл між загальною, широкою моделлю і зосередженими вимогами спеціалізованого застосування. Вона підвищує точність, безпеку і актуальність виводів моделі для цільових застосунків.
Наданий діаграма описує процес реалізації та використання великих мовних моделей (LLM) для корпоративних застосунків. Спочатку попередньо тренована модель типу T5 подається структурованим і неструктурованим компанійським даними, які можуть бути у різних форматах, таких як CSV чи JSON. Ці дані проходять супервізовану, несупервізовану або трансфер-тонку настройку, підвищуючи актуальність моделі для конкретних потреб компанії.
Після того, як модель тонко налаштована за допомогою компанійських даних, її ваги оновлюються відповідно. Навчена модель потім проходить подальші цикли тренування, постійно покращуючи свої відповіді з часом за допомогою нових компанійських даних. Процес ітеративний і динамічний, з моделлю, яка вчиться і переучиться адаптуватися до еволюції даних.
Вивід цієї навченої моделі – токени і ембеддинги, що представляють слова, – потім розгортається для різних корпоративних застосунків. Ці застосування можуть варіюватися від чат-ботів до охорони здоров’я, кожне з яких вимагає від моделі розуміння і відповіді на галузь-специфічні запити. У фінансах застосування включають виявлення шахрайства і аналіз загроз; в охороні здоров’я моделі можуть допомогти з пацієнтськими запитами і діагностикою.
Спроможність навченої моделі обробляти і реагувати на нові компанійські дані з часом забезпечує її корисність і зростання. В результаті користувачі можуть взаємодіяти з моделлю через застосування, ставлячи питання і отримуючи інформовані відповіді, які відображають тренування і тонку настройку моделі на галузь-специфічних даних.
Ця інфраструктура підтримує широкий діапазон корпоративних застосунків, демонструючи гнучкість і адаптивність LLM при правильній реалізації і підтримці в бізнес-контексті.
Підходи до тонкої настройки
Існують два основні стратегії, коли мова йде про тонку настройку великих мовних моделей:
1) Повна тонка настройка моделі
У підході повної тонкої настройки всі параметри (ваги і упередження) попередньо тренованої моделі оновлюються під час другої фази тренування. Модель подається задачі-специфічному dánному набору, і стандартний процес тренування оптимізує всю модель для цього dánного розподілу.
Це дозволяє моделі зробити більш комплексні корекції і адаптуватися цілісно до цільової задачі або галузі. Однак повна тонка настройка має деякі недоліки:
- Вимагає суттєвих обчислювальних ресурсів і часу для тренування, подібно до попередньої фази тренування.
- Вимоги до зберігання високі, оскільки вам потрібно підтримувати окрему тонко налаштовану копію моделі для кожної задачі.
- Є ризик “катастрофічного забуття”, коли тонка настройка спричиняє втрату моделлю деяких загальних можливостей, вивчених під час попереднього тренування.
Незважаючи на ці обмеження, повна тонка настройка залишається потужною і широко використовуваною технікою, коли дозволяють ресурси і цільова задача суттєво відрізняється від загальної мови.
2) Ефективні методи тонкої настройки
Щоб подолати обчислювальні виклики повної тонкої настройки, дослідники розробили ефективні стратегії, які оновлюють лише малий підмножину параметрів моделі під час тонкої настройки. Ці параметрично-ефективні техніки балансують спеціалізацію і зниження вимог до ресурсів.
Деякі популярні ефективні методи тонкої настройки включають:
Prefix-тонка настройка: Тут вводяться і тренуються завдання-специфічні вектори або “префікси”, які умовляють увагу попередньо тренованої моделі для цільової задачі. Лише ці префікси оновлюються під час тонкої настройки.
LoRA (Низькорангове адаптування): LoRA вводить тренувальні низькорангові матриці в кожному шарі попередньо тренованої моделі під час тонкої настройки. Ці малих рангів корекції допомагають спеціалізувати модель з набагато меншою кількістю тренуваних параметрів, ніж повна тонка настройка.
Так, я можу надати детальне пояснення LoRA (Низькорангове адаптування) разом з математичною формулюванням і прикладами коду. LoRA – популярна техніка параметрично-ефективної тонкої настройки (PEFT), яка набула суттєвого поширення в галузі адаптації великих мовних моделей (LLM).
Що таке LoRA?
LoRA – це метод тонкої настройки, який вводить малий набір тренуваних параметрів у попередньо треновану LLM, дозволяючи ефективно адаптуватися до задач нижнього рівня, зберігаючи при цьому більшу частину знань оригінальної моделі. Замість тонкої настройки всіх параметрів LLM, LoRA вводить завдання-специфічні низькорангові матриці в шари моделі, що дозволяє суттєво зменшити кількість тренуваних параметрів під час процесу тонкої настройки.
Математичне формулювання
LoRA (Низькорангове адаптування) – це метод тонкої настройки для великих мовних моделей (LLM), який вводить низькорангову корекцію до матриць ваг. Для матриці ваг 0∈W0∈Rd×k, LoRA додає низькорангову матрицю BA, з A∈Rr×k і B∈Rd×r, де r – ранг. Цей підхід суттєво зменшує кількість тренуваних параметрів, дозволяючи ефективно адаптуватися до задач нижнього рівня з мінімальними обчислювальними ресурсами. Оновлена матриця ваг визначається як W=W0+B⋅A.
Ця низькоранкова корекція може бути інтерпретована як модифікація оригінальної матриці ваг W=W0+B⋅A. Ключова перевага цього формулювання полягає в тому, що замість оновлення всіх d×k параметрів у W0, LoRA потребує оптимізації лише r×d параметрів у B і r×k параметрів у A, суттєво зменшуючи кількість тренуваних параметрів.
Ось приклад на Python, який використовує бібліотеку peft, щоб застосувати LoRA до попередньо тренованої LLM для класифікації тексту:
</div>
<div>
<div class="code-block__code !my-0 !rounded-t-lg !text-sm !leading-relaxed" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""><code class="language-python" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""><span class="token" data-darkreader-inline-color="">from</span> transformers <span class="token" data-darkreader-inline-color="">import</span> AutoModelForSequenceClassification
</code></div>
<div class="code-block__code !my-0 !rounded-t-lg !text-sm !leading-relaxed" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""><code class="language-python" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""><span class="token" data-darkreader-inline-color="">from</span> peft <span class="token" data-darkreader-inline-color="">import</span> get_peft_model<span class="token" data-darkreader-inline-color="">,</span> LoraConfig<span class="token" data-darkreader-inline-color="">,</span> TaskType
</code></div>
<div data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""></div>
<div class="code-block__code !my-0 !rounded-t-lg !text-sm !leading-relaxed" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""><code class="language-python" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""><span class="token" data-darkreader-inline-color=""># Завантаження попередньо тренованої моделі</span>
</code></div>
<div class="code-block__code !my-0 !rounded-t-lg !text-sm !leading-relaxed" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""><code class="language-python" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color="">model <span class="token" data-darkreader-inline-color="">=</span> AutoModelForSequenceClassification<span class="token" data-darkreader-inline-color="">.</span>from_pretrained<span class="token" data-darkreader-inline-color="">(</span><span class="token" data-darkreader-inline-color="">"bert-base-uncased"</span><span class="token" data-darkreader-inline-color="">,</span> num_labels<span class="token" data-darkreader-inline-color="">=</span><span class="token" data-darkreader-inline-color="">2</span><span class="token" data-darkreader-inline-color="">)</span>
</code></div>
<div data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""></div>
<div class="code-block__code !my-0 !rounded-t-lg !text-sm !leading-relaxed" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""><code class="language-python" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""><span class="token" data-darkreader-inline-color=""># Визначення конфігурації LoRA</span>
</code></div>
<div class="code-block__code !my-0 !rounded-t-lg !text-sm !leading-relaxed" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""><code class="language-python" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color="">peft_config <span class="token" data-darkreader-inline-color="">=</span> LoraConfig<span class="token" data-darkreader-inline-color="">(</span>task_type<span class="token" data-darkreader-inline-color="">=</span>TaskType<span class="token" data-darkreader-inline-color="">.</span>SEQ_CLS<span class="token" data-darkreader-inline-color="">, </span>r<span class="token" data-darkreader-inline-color="">=</span><span class="token" data-darkreader-inline-color="">8</span><span class="token" data-darkreader-inline-color="">,</span> <span class="token" data-darkreader-inline-color=""># Ранг низькорангової корекції</span>
lora_alpha<span class="token" data-darkreader-inline-color="">=</span><span class="token" data-darkreader-inline-color="">16</span><span class="token" data-darkreader-inline-color="">,</span></code><code class="language-python" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""><span class="token" data-darkreader-inline-color=""># Коефіцієнт масштабування для низькорангової корекції</span>
</code></div>
<div class="code-block__code !my-0 !rounded-t-lg !text-sm !leading-relaxed" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""><code class="language-python" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""><span class="token" data-darkreader-inline-color=""> target_modules</span><span class="token" data-darkreader-inline-color="">=</span><span class="token" data-darkreader-inline-color="">[</span><span class="token" data-darkreader-inline-color="">"q_lin"</span><span class="token" data-darkreader-inline-color="">,</span> <span class="token" data-darkreader-inline-color="">"v_lin"</span><span class="token" data-darkreader-inline-color="">]</span><span class="token" data-darkreader-inline-color="">,</span> <span class="token" data-darkreader-inline-color=""># Застосування LoRA до запитувальних і значень шарів</span>
</code></div>
<div class="code-block__code !my-0 !rounded-t-lg !text-sm !leading-relaxed" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""><code class="language-python" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""><span class="token" data-darkreader-inline-color="">)</span>
</code></div>
<div data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""></div>
<div class="code-block__code !my-0 !rounded-t-lg !text-sm !leading-relaxed" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""><code class="language-python" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""><span class="token" data-darkreader-inline-color=""># Створення моделі з LoRA</span>
</code></div>
<div class="code-block__code !my-0 !rounded-t-lg !text-sm !leading-relaxed" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""><code class="language-python" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color="">model <span class="token" data-darkreader-inline-color="">=</span> get_peft_model<span class="token" data-darkreader-inline-color="">(</span>model<span class="token" data-darkreader-inline-color="">,</span> peft_config<span class="token" data-darkreader-inline-color="">)</span>
</code></div>
<div class="code-block__code !my-0 !rounded-t-lg !text-sm !leading-relaxed" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""><code class="language-python" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""><span class="token" data-darkreader-inline-color=""># Тонка настройка моделі з LoRA</span>
</code></div>
<div data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""></div>
<div class="code-block__code !my-0 !rounded-t-lg !text-sm !leading-relaxed" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""><code class="language-python" data-darkreader-inline-bgimage="" data-darkreader-inline-bgcolor="" data-darkreader-inline-color=""><span class="token" data-darkreader-inline-color=""># ... (код тренування опущений для лаконічності)</span></code></div>
</div>
У цьому прикладі ми завантажуємо попередньо треновану модель BERT для класифікації послідовностей і визначаємо конфігурацію LoRA. Параметр r вказує ранг низькорангової корекції, а lora_alpha – коефіцієнт масштабування для корекції. Параметр target_modules вказує, які шари моделі повинні отримувати низькорангові корекції. Після створення моделі з LoRA ми можемо продовжити процес тонкої настройки за допомогою стандартної процедури тренування.
Шари-адаптери: Подібно до LoRA, але замість низькорангових корекцій, тонкі "адаптерні" шари вставляються всередині кожного трансформерного блоку попередньо тренованої моделі. Тренуються лише параметри цих декількох нових компактних шарів.
Тонка настройка за допомогою промптів: Цей підхід тримає попередньо треновану модель повністю замороженою. Замість цього вводяться тренувані "промпт"-ембеддинги як вхід для активації попередньо тренованого знання моделі для цільової задачі.
Ці ефективні методи можуть забезпечити до 100-кратне зниження обчислень порівняно з повною тонкою настройкою, зберігаючи при цьому конкурентоспроможну продуктивність на багатьох задачах. Вони також знижують потреби в зберіганні, уникając повної дублікації моделі.
Однак їхня продуктивність може відставати від повної тонкої настройки для задач, які суттєво відрізняються від загальної мови або вимагають більш цілісної спеціалізації.
Процес тонкої настройки
Незалежно від стратегії тонкої настройки, загальний процес спеціалізації LLM слідує загальномуramework:
- Підготовка набору даних: Вам потрібно отримати або створити dánний набір, який відображає входи (промпти) до бажаних виводів для вашої цільової задачі. Для завдань генерації тексту, таких як підсумовування, це будуть пари вхідного тексту і підсумованого виводу.
- Розбиття набору даних: Слідуючи найкращим практикам, розділіть ваш dánний набір на тренувальний, валідний і тестовий набори. Це розділяє дані для тренування моделі, налаштування гіперпараметрів і остаточної оцінки.
- Налаштування гіперпараметрів: Параметри, такі як швидкість навчання, розмір партії і графік тренування, потрібно налаштувати для найбільш ефективної тонкої настройки на ваших даних. Це зазвичай включає малий валідний набір.
- Тренування моделі: Використовуючи налаштовані гіперпараметри, виконайте процес оптимізації тонкої настройки на повному тренувальному наборі, поки продуктивність моделі на валідному наборі не перестане покращуватися (раннє зупинення).
- Оцінка: Оцініть продуктивність тонко налаштованої моделі на відокремленому тестовому наборі, ідеально складаючи реальні приклади для цільового застосування, щоб оцінити реальну ефективність.
- Розгортання і моніторинг: Як тільки буде досягнута задовільна продуктивність, тонко налаштовану модель можна розгорнути для висновку на нових входах. важливо моніторити її продуктивність і точність з часом для концептуального зсуву.
Хоча це описує загальний процес, багато нюансів можуть вплинути на успіх тонкої настройки для конкретної LLM або задачі. Стратегії, такі як навчання за допомогою навчальної програми, багатократна тонка настройка і промптінг з декількома прикладами, можуть ще більше підвищити продуктивність.
Крім того, ефективні методи тонкої настройки включають додаткові розгляди. Наприклад, LoRA потребує технік, таких як умовляння виводів попередньо тренованої моделі через комбінуючий шар. Тонка настройка за допомогою промптів потребує ретельно спроектованих промптів для активації правильних поведінок.
Розширена тонка настройка: Включення людської обратної зв'язки
Хоча стандартна супервізована тонка настройка за допомогою dánних наборів ефективна, цікавим фронтиром є тренування LLM безпосередньо за допомогою людських уподобань і обратної зв'язки. Цей людський-у-циклі підхід використовує техніки з підкріплювального навчання:
PPO (Проксимальна оптимізація політики): Тут LLM розглядається як агент підкріплювального навчання, з його виводами як "дії". Модель винагороди тренується для передбачення людських рейтингів або оцінок якості для цих виводів. PPO потім оптимізує LLM для генерації виводів, які максимізують оцінки моделі винагороди.
RLHF (Підкріплювальне навчання з людської обратної зв'язки): Це розширює PPO, безпосередньо включаючи людську обратну зв'язку в процес навчання. Замість фіксованої моделі винагороди, винагороди походять з ітеративних людських оцінок виводів LLM під час тонкої настройки.
Хоча обчислювально інтенсивно, ці методи дозволяють формувати поведінку LLM більш точно на основі бажаних характеристик, оцінюваних людьми, за межами того, що можна захопити в статичному наборі даних.
Компанії, такі як Anthropic, використали RLHF для надання своїм мовним моделям, таким як Claude, покращеної правдивості, етики і безпеки, що перевершує просто компетентність задач.
Потенційні ризики і обмеження
Хоча неймовірно потужні, тонка настройка LLM не позбавлена ризиків, які потрібно ретельно керувати:
Посилення упереджень: Якщо dánний набір для тонкої настройки містить суспільні упередження щодо статі, раси, віку чи інших атрибутів, модель може посилити ці небажані упередження. Кураторство представницьких і де-біазованих наборів даних є важливим.
Фактичний зсув: Навіть після тонкої настройки на високоякісних даних, мовні моделі можуть "галюцинувати" неправильні факти або виводи, несумісні з тренувальними прикладами, протягом довгих розмов чи промптів. Методи отримання фактів можуть бути потрібні.
Виїмки масштабованості: Повна тонка настройка величезних моделей, таких як GPT-3, вимагає величезних обчислювальних ресурсів, які можуть бути недосяжними для багатьох організацій. Ефективні методи тонкої настройки частково пом'якшують це, але мають компроміси.
Катастрофічне забуття: Під час повної тонкої настройки моделі можуть переживати катастрофічне забуття, де вони втрачають деякі загальні можливості, вивчені під час попереднього тренування. Багатократне навчання може бути потрібним.
Ризики IP і конфіденційності: Пропрієтарні дані, використані для тонкої настройки, можуть просочитися в публічно випущені виводи мовної моделі, створюючи ризики. Техніки диференціальної приватності і мінімізації інформації є активними областями дослідження.
У цілому, хоча винятково корисна, тонка настройка – це нюансований процес, який вимагає уваги до якості даних, ідентичності, мінімізації ризиків і балансування компромісів продуктивності-еффективності на основі вимог застосування.
Майбутнє: Настройка мовних моделей у масштабі
Оглядаючи вперед, вдосконалення тонкої настройки і технік адаптації моделей будуть важливими для розблокування повного потенціалу великих мовних моделей у різних застосунках і галузях.
Більш ефективні методи, що дозволяють тонко налаштовувати навіть більші моделі, такі як PaLM, з обмеженими ресурсами, могли б демократизувати доступ. Автоматизація процесів створення наборів даних і промпт-інженерії могла б спрощувати спеціалізацію.
Самостійні техніки тонкої настройки з сирими, не dánними даними можуть відкрити нові фронтири. І композиційні підходи до поєднання тонко налаштованих суб-моделей, тренованих на різних задачах або даних, могли б дозволити конструювати високозадані моделі на вимогу.
У кінцевому підсумку, оскільки LLM стають більш універсальними, здатність налаштовувати і спеціалізувати їх безшовно для кожного можливого застосування буде критичною. Тонка настройка і пов'язані зі стратегіями адаптації моделей є важливими кроками у реалізації бачення великих мовних моделей як гнучких, безпечних і потужних інструментів штучного інтелекту, що підсилюють людські можливості у кожній галузі і починанні.
Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.
Дізнайтеся більше


Лабораторії довели, що пісочниця вашого агента – це лише порада


Нью-Йорк тільки що зробив справжню瓶頸 штучного інтелекту боротьбою за використання землі


Чому агенти штучної інтелекту проходять перевірку якості, але все одно не справляються у виробництві


Найкраща модель OpenAI тепер доступна лише за урядовим парканом


Відхилення штучного інтелекту через перенавчання, а не тонке налаштування, виявили дослідження


Лабораторія Thinking Machines Відправляє Першу Модель З Реальною Часовою Інтеракцією 200ms

