Моделі та платформи ШІ
GLM-130B: Відкрита двомовна попередньо тренована модель

Фреймворк GLM-130B – це двомовна попередньо тренована велика мова модель з понад 130 мільярдами параметрів, здатна генерувати тексти на англійській та китайській мовах. Фреймворк GLM-130B – це спроба відкриття мови моделі у масштабі понад 100 мільярдів параметрів та обговорення того, як фреймворки такого великого масштабу можуть бути попередньо треновані, оскільки зараз тренування моделі такого великого масштабу часто супроводжується проблемами, такими як розбіжність та сплески втрат.
У цій статті ми будемо говорити про фреймворк GLM-130B, який намагається розробити метод ефективної попередньої тренування великих мовних моделей з сотнями мільярдів параметрів. Ми глибше погрузимо у роботу та архітектуру фреймворку GLM-130B, а також процес тренування та дизайнерські рішення, які не тільки підвищують ефективність, але й стабільність. Перші експерименти, проведені для перевірки роботи фреймворку GLM-130B на широкому спектрі англійських бенчмарків, показали, що модель GLM-130B значно перевершує поточний стан мистецтва фреймворку GPT-3.
Введення у фреймворк GLM-130B
Великі мовні моделі, здатні працювати у режимах few-shot та zero-shot, особливо ті, у яких понад 100 мільярдів параметрів, мають привабливі закони масштабування, з яких фреймворк GPT-3 – один з найкращих, що забезпечує суттєві покращення продуктивності порівняно з його попередником, фреймворком BERT. Однак, незважаючи на популярність фреймворку GPT-3 та його широке застосування, процес тренування та, в деякій мірі, сам фреймворк GPT-3 були не прозорі для громадськості.
Фреймворк GLM-130B – це спроба попередньо тренувати точну та відкриту мовну модель з понад 100 мільярдами параметрів. Під час своєї спроби команда розробників фреймворку GLM-130B спостерігала, що попереднє тренування великомасштабної мовної моделі часто супроводжується широким спектром інженерних та технічних проблем, пов’язаних з стабільністю та ефективністю тренування.
Фреймворк GLM-130B – це двонаправлена, двомовна щільна модель, що складається з понад 130 мільярдів параметрів, попередньо тренована на кластері з 96 вузлів GPU NVIDIA DGX-A100 протягом майже двох місяців. Крім того, замість використання архітектури GPT, фреймворк GLM-130B використовує алгоритм GLM або загальної мови моделі, який намагається використати автoregresивне заповнення пробілів як ціль тренування.

Інженерні та технічні концепції, залучені до фреймворку GLM-130B, перевершують майже всі великомасштабні мовні моделі, включаючи GPT-3 та PaLM 540B з понад 500 мільярдами параметрів, у багатьох випадках та на широкому спектрі бенчмарків.

Нарешті, фреймворк GLM-130B був розроблений так, щоб дозволити якомога більше розробникам проводити дослідження фреймворків з понад 100 мільярдами параметрів, і існує два способи, за допомогою яких фреймворк GLM-130B досягає цього.
GLM-130B: Архітектура
Індуктивне упередження моделі машинного навчання описується її архітектурою, і не дивно, коли розробники не можуть досліджувати різні архітектурні рішення для великих мовних моделей, враховуючи обчислювальну доступність та життєздатність.
Фреймворк GLM-130B досліджує можливість використання двонаправленої моделі GLM як основи, яка намагається використати автoregresивне заповнення пробілів як ціль тренування.
- [MASK]: [MASK] – це стратегія корупції, яка використовує короткі пробіли у реченнях, довжина яких складає певний відсоток від входу.
- [gMASK]: [gMASK] – це стратегія корупції, яка використовує випадкові довжини пробілів у кінці речення з префіксним контекстом.
Нормалізація шарів
Однією з основних проблем, з якими стикаються розробники під час тренування мовної моделі, є нестабільність тренування, і використання відповідної нормалізації шарів може допомогти у тренуванні мовних моделей.
FFNs і позиційне кодування
Нейронні мережі з кормовим вперед і позиційне кодування – це два підходи, прийняті фреймворком GLM-130B для введення висококласної продуктивності та тренувальної стабільності.
Самостійне заповнення пробілів
Фреймворк GLM-130B використовує дві стратегії корупції, а саме [MASK] і [gMASK], і одна з цих стратегій застосовується незалежно до кожного окремого тренувального рядка, один за одним.
Багатозадачне навчання з інструкціями
Було показано, що використання багаторазового навчання для попередньої тренування моделей може забезпечити кращі результати, ніж тонке налаштування, для покращення передачі завдань у режимі zero-shot.
3D паралельна стратегія
Існують два фактичні практики для тренування великомасштабних моделей з мільярдами параметрів, а саме паралелізм моделі тензора та паралелізм даних.
GLM-130B: Стабільність тренування
Стабільність тренування – це важливий фактор при визначенні якості мовної моделі, і стабільність тренування сильно залежить від кількості токенів, які вона проходить.
Змішана точність
Для підвищення точності тренування та зменшення використання пам’яті фреймворк GLM-130B використовує змішану точність, тобто FP16 для прямого та зворотного проходу, і FP32 для мастер-важелів та стану оптимізатора.
Зменшення градієнта шару вкладення
Розробники фреймворку GLM-130B виявили, що норма градієнта може служити інформативним індикатором для тренувальних колапсів, і тренувальний колапс зазвичай відстає від сплеску норми градієнта.
GLM-130B: Результати та продуктивність
Для оцінки продуктивності фреймворку GLM-130B для англійських завдань він реалізує ті ж самі налаштування, що й спільні фреймворки мовних моделей, включаючи PaLM і GPT-3.
Моделювання мови
Тест моделювання мови на фреймворку GLM-130B проводиться на двох наборах даних: LAMBADA та Pile.
MMLU або Масове багаторазове розуміння мови
MMLU – це різноманітний бенчмарк, який складається з понад 50 завдань з вибором відповіді, що стосуються людської інтелекту та знань, починаючи від шкільного рівня до експертного.
BIG-Bench або Бенчмарк за межами імітаційної гри
BIG-Bench – це бенчмарк, який перевіряє здатність моделі на знання, розуміння та здоровий глузд.
CLUE або Оцінка розуміння китайської мови
Фреймворк GLM-130B постійно перевершує фреймворк 260B ERNIE Titan 3.0 на 12 різних завданнях.
Висновок
У цій статті ми говорили про фреймворк GLM-130B, двомовну попередньо треновану велику мовну модель, яка має на меті сприяти інклюзивним дослідженням мовних моделей.












