Погляд Anderson
Створення мови GPT-Style для одного питання

Дослідники з Китаю розробили економічний метод створення систем обробки природної мови типу GPT-3, уникнувши все більш обмежуючих витрат часу та грошей на навчання великих обсягів даних – тенденцію, яка загрожує поступово обмежити цю галузь штучного інтелекту лише великими компаніями та інвесторами.
Предложена структура називається Task-Driven Language Modeling (TLM). Замість навчання великої та складної моделі на величезному корпусі із мільярдами слів та тисячами міток і класів, TLM навчає значно меншу модель, яка фактично включає запит безпосередньо в модель.

Ліворуч, типовий гіпермасштабний підхід до високовольтних мовних моделей; праворуч, тонкий метод TLM для дослідження великого мовного корпусу на основі теми чи питання. Джерело: https://arxiv.org/pdf/2111.04130.pdf
Ефективно, створюється унікальний алгоритм обробки природної мови або модель для відповіді на одне питання, замість створення величезної та незручного загального мовного моделі, яка може відповідати на ширший спектр питань.
Під час тестування TLM дослідники виявили, що новий підхід досягає результатів, подібних чи кращих за попередньо натреновані мовні моделі, такі як RoBERTa-Large, та гіпермасштабні системи обробки природної мови, такі як GPT-3 від OpenAI, TRILLION Parameter Switch Transformer Модель від Google, HyperClover від Korea, Jurassic 1 від AI21 Labs, та Megatron-Turing NLG 530B від Microsoft.
У випробуваннях TLM на восьми класифікаційних завданнях у чотирьох галузях – біомедичній науці, новинах, оглядах та комп’ютерних науках – автори додатково виявили, що система знижує витрати на навчання FLOPs (операції з рухомою комою в секунду) приблизно на два порядки. Дослідники сподіваються, що TLM зможе “демократизувати” галузь, яка стає все більш елітною, з моделями обробки природної мови такої величини, що їх реально неможливо встановити локально, а замість цього вони знаходяться, у випадку GPT-3, за дорогими та обмеженими API від OpenAI та Microsoft Azure.
Автори зазначають, що скорочення часу навчання на два порядки знижує витрати на навчання на 1 000 GPU за один день до всього лише 8 GPU за 48 годин.
Нова звіт називається NLP з нуля без великомасштабного попереднього навчання: Проста та ефективна структура і походить від трьох дослідників з Університету Цінхуа в Пекіні та дослідника з китайської компанії з розвитку штучного інтелекту Recurrent AI, Inc.
Недоступні відповіді
Витрати на навчання ефективних, універсальних мовних моделей все частіше характеризуються як потенційний “термічний ліміт” на ступінь, на якому продуктивна та точна обробка природної мови може по-справжньому поширитися в культурі.

Статистика зростання аспектів архітектури мовних моделей, з rapportу 2020 року від A121 Labs. Джерело: https://arxiv.org/pdf/2004.08900.pdf
У 2019 році дослідник обчислив, що витрати на навчання моделі XLNet (на той час повідомлялося, що вона перевершує BERT у завданнях обробки природної мови) становлять 61 440 доларів США за 2,5 доби на 512 ядрах по 64 пристроям, тоді як GPT-3, як передбачається, вартувала 12 мільйонів доларів на навчання – у 200 разів більше, ніж витрати на навчання її попередника, GPT-2 (хоча недавні переоцінки стверджують, що її можна було б натренувати тепер за мільйон доларів на найдешевших GPU-хмарах).
Підмножини даних на основі запитів
Натомість запропонована архітектура намагається отримати точні класифікації, мітки та узагальнення, використовуючи запит як фільтр для визначення підмножини інформації з великого мовного корпусу, яка буде натренована разом із запитом для надання відповідей на обмежену тему.
Автори зазначають:
‘TLM мотивована двома ключовими ідеями. По-перше, люди оволодівають завданням, використовуючи лише невелику частину світових знань (наприклад, студенти повинні переглянути лише кілька розділів серед усіх книг світу, щоб підготуватися до іспиту).
‘Ми припускаємо, що існує багато надмірності у великому корпусі для конкретного завдання. По-друге, навчання на позначених даних є набагато більш ефективним для результатів, ніж оптимізація мови моделі на неозначених даних. На основі цих мотивів TLM використовує дані завдання як запити для отримання маленької підмножини загального корпусу. Це супроводжується спільною оптимізацією завдання та мови моделі з використанням отриманих даних та даних завдання.’
Крім того, що робить ефективне навчання мовної моделі доступним, автори бачать низку переваг у використанні завдань, керованих моделями обробки природної мови. По-перше, дослідники можуть користуватися більшим гнучкістю, з настраїваними стратегіями для довжини послідовності, токенізації, налаштування гіперпараметрів та представлення даних.
Дослідники також передбачають розвиток гібридних майбутніх систем, які віддають перевагу обмеженому попередньому навчанню PLM (що не очікується в поточній реалізації) проти більшої універсальності та узагальнення проти часу навчання. Вони вважають систему кроком вперед для розвитку методів нульової узагальнення в межах області.
Тестування та результати
TLM була протестована на класифікаційних завданнях у восьми завданнях за чотири галузі – біомедичній науці, новинах, оглядах та комп’ютерних науках. Завдання були розділені на категорії з великими ресурсами та малими ресурсами. Завдання з великими ресурсами включали понад 5 000 завдань даних, таких як AGNews та RCT, серед інших; завдання з малими ресурсами включали ChemProt та ACL-ARC, а також HyperPartisan виявлення новин.
Дослідники створили два навчальні набори під назвою Corpus-BERT та Corpus-RoBERTa, останній у десять разів більший за перший. Експерименти порівнювали загальні попередньо натреновані мовні моделі BERT (від Google) та RoBERTA (від Facebook ) з новою архітектурою.
У статті зазначається, що хоча TLM є загальним методом, і повинна бути менш обмеженою за обсягом та застосовністю, ніж ширші та більш об’ємні моделі останнього покоління, вона здатна виконувати завдання близькі до методів тонкої настройки в межах області.

Результати порівняння продуктивності TLM з наборами BERT та RoBERTa. Результати містять середній бал F1 за три різні масштаби навчання, кількість параметрів, загальний обчислювальний ресурс (FLOPs) та розмір навчального корпусу.
Автори висновують, що TLM здатна досягати результатів, порівнянних чи кращих за PLM, з суттєвим зниженням необхідних FLOPs, і вимагає лише 1/16 частину навчального корпусу. На середніх та великих масштабах TLM, як видається, може покращити продуктивність на 0,59 та 0,24 бали в середньому, одночасно знижуючи розмір навчальних даних на два порядки.
‘Ці результати підтверджують, що TLM є високоточною та набагато більш ефективною, ніж PLM. Крім того, TLM здобуває більше переваг у ефективності на більших масштабах. Це вказує на те, що більші PLM могли бути натреновані для зберігання більш загальних знань, які не є корисними для конкретного завдання.’












