Огляди книг

Огляд книги: Large Language Models Стівена Рааймейкерса

mm
Додайте Unite.AI до бажаних джерел у Google

Як людина, яка володіє понад п’ятнадцятьма томами серії «MIT Press Essential Knowledge», я підходжу до кожного нового випуску з інтересом і обережністю: серія часто пропонує роздуми, доступні для сприйняття, — але не завжди у стилі чи глибині, яку я очікую.

У випадку з книгою Large Language Models Стівена Рааймейкерса автор досягнув чогось рідкісного: книжка є кристальною, багатою на інформацію та критично збалансованою, і займає місце серед моїх найбільш рекомендованих книжок про штучний інтелект.

*]:pointer-events-auto scroll-mt-[calc(var(–header-height)+min(200px,max(70px,20svh)))]” dir=”auto” tabindex=”-1″ data-turn-id=”request-WEB:5be4fe75-da35-44b9-9e57-a44c1f4d527a-5″ data-testid=”conversation-turn-10″ data-scroll-anchor=”true” data-turn=”assistant”>

Мова переосмислена: від людського мистецтва до обчислень

Однією з найбільш вражаючих сильних сторін книжки «Large Language Models» є те, як вона переосмислює «мову». Натомість того, щоб займатися чисто філософськими чи літературними перспективами, книжка розглядає мову як обчислювальне явище — систему структури, статистичних закономірностей та генеративного потенціалу, який сучасні нейронні архітектури можуть використати. Ця переосмислення не є марною: Рааймейкерс веде читачів через те, як великомасштабні нейронні мережі кодують, розбирають та генерують текст на основі статистичних закономірностей у величезних текстових даних — тонкий, але потужний зсув у тому, як читачі розуміють ці системи. Книжка робить це легко зрозумілим, що мова, розглянута через цю обчислювальну лінзу, стає чимось, що машина може змоделювати, а не чимось містичним чи не透альним.

Ця рамка демістифікує те, що роблять LLM. Натомість того, щоб зображувати їх як містичні «розумники» значення, Рааймейкерс показує, як вони наближаються до мови: передбачаючи наступні токени, моделюючи синтаксис і семантику статистично, та відтворюючи правдоподібні мовні виходи на основі вивчених розподілів. Інакше кажучи — вони не «думають» у людських термінах; вони обчислюють, статистично. Для багатьох читачів — особливо тих, хто не має глибокого математичного чи когнітивного наукового походження — це є роз’яснюючою та здоровою точкою зору. Книжка перетворює поширений ореол навколо LLM у щось більш ґрунтовне, більш зрозуміле.

Від даних до поведінки: як LLM вивчають — і як вони вирівнюються

Після встановлення того, що таке мова (обчислювально), книжка переходить до того, як моделі вивчають. Рааймейкерс пояснює у доступних термінах, як сучасні LLM побудовані (глибокі нейронні мережі, механізми уваги, архітектури типу трансформера) та як вони еволюціонують від простих машин для підбору закономірностей до більш вирівняних та корисних інструментів.

Критичною частиною цієї еволюції є використання людської обратної зв’язі за допомогою вивчення з підкріпленням від людської обратної зв’язі (RLHF) — техніки, за допомогою якої виходи LLM оцінюються або ранжуються людьми, а модель дофінується, щоб віддавати перевагу виходам, визнаним більш корисними, безпечними чи вирівняними з людськими цінностями. Книжка проводить розрізнення (імPLICITно та явно) між базовою фазою — попереднім навчанням на величезних обсягах тексту для вивчення статистичних закономірностей — та фазою вирівнювання, де людські судження формують поведінку моделі. Це розрізнення має величезне значення: попереднє навчання надає LLM їхню плавність та загальні знання; RLHF (або дофінування на основі обратної зв’язі) спрямовує її до бажаної поведінки.

У цьому Рааймейкерс не приховує складність чи ризик. Він визнає, що людська обратна зв’язь та вирівнювання на основі винагороди є неідеальними: упередження у обратній зв’язі, нерівномірні людські судження, перефітування до моделі винагороди, та непередбачувана поведінка у нових контекстах — усі ці обмеження є легітимними. Відмовляючись ідеалізувати RLHF, книжка зберігає свою авторитетність.

Що можуть і чого не можуть робити LLM

Рааймейкерс чудово викладає як сильні сторони, так і обмеження LLM. З позитивної сторони: сучасні LLM є дивовижними універсальними інструментами. Вони можуть перекладати мови, підсумовувати текст, генерувати код, створювати творчі тексти, писати есе, відповідати на питання та допомагати у багатьох галузях — фактично будь-яке завдання, яке можна звести до «вхід тексту → вихід тексту». При достатньому масштабі та даних їхня генеративна плавність часто вражаюча, іноді дивовижна.

Одночасно книжка не уникає їхніх фундаментальних обмежень. LLM залишаються статистичними підборами закономірностей, а не справжніми мислителями: вони можуть галюцинувати, впевнено виводити правдоподібну, але хибну інформацію, відтворювати упередження та стереотипи, присутні у їхніх навчальних даних, та не вдаватися у контекстах, які вимагають реального розуміння світу, звичайного розуму чи довгострокової узгодженості. Рааймейкерсова обробка цих недоліків є стриманою — не алармуючою, а реалістичною — підкреслюючи, що хоча LLM є потужними, вони не є магією.

Цей баланс є цінним — він уникає двох пасток: гіпери та песимізму. Читачі виходять із ясним уявленням про те, що можуть робити LLM, а чого не можуть.

Можливості та відповідальність: соціальні обіцянки та небезпеки

Де багато технічних посібників зупиняються на архітектурі чи випадках використання, книжка «Large Language Models» йде далі — у соціальні, політичні та етичні наслідки цієї технології. У розділах, таких як «Практичні можливості» та «Соціальні ризики та проблеми», Рааймейкерс запрошує читачів розглянути, як LLM можуть змінити творчість, продуктивність, людську комунікацію, ЗМІ та інститути.

З боку можливостей: потенціал є величезним. LLM можуть демократизувати доступ до письма, перекладу, програмування. Вони можуть прискорити дослідження, освіту та творчу експресію. Вони можуть допомогти тим, хто бореться з мовою чи письмом. Вони можуть змінити те, як виробляються та споживаються ЗМІ. У світі, який стикається з суттєвою інформаційною перевантаженістю, LLM можуть допомогти звузити прогалини — якщо їх використовувати вдумливо.

Але Рааймейкерс не уникає темної сторони. Він піднімає попередження: про дезінформацію та «галюциновані істини», про вкорінені упередження, про ерозію людського судження, про надмірну залежність від недосконалих моделей — усі ці ризики вже задокументовані у ширшій етичних дискусіях щодо штучного інтелекту.

Відповідальність цього соціального погляду робить книжку цінною не тільки для інженерів та дослідників, але й для політиків, педагогів та будь-якої роздумуючої людини. Вона коренить LLM у реальних контекстах, а не у абстрактній гіпері.

Що далі — і заклик до пильності

Останній розділ, «Що далі?», не претендує на те, що сучасні LLM є останнім словом. Натомість Рааймейкерс заохочує перспективу, спрямовану вперед: як можуть еволюціонувати LLM? Як можна покращити вирівнювання, прозорість, справедливість? Які принципи управління, регулювання та дизайну будуть захищати суспільство, коли ці моделі поширюються?

Для мене — як людини, глибоко інвестованої у каталог «Essential Knowledge», яка знає, як деякі томи розчаровують — ця книжка заслуговує на те, щоб бути оціненою серед найкращих. Її ясність, баланс, технічне підґрунтя та соціальна усвідомленість роблять її видатною. Вона знаходить рідкісний баланс між доступним поясненням та серйозною критикою.

Тому я закликаю всіх, хто будує, розгортає або взаємодіє з LLM — розробників, організації, політиків та звичайних користувачів — тримати пильний, критичний та інформований погляд. Вимагайте прозорості. Пушіть за різноманітними, представницькими навчальними даними. Настійно вимагайте суворої оцінки. Питайте виходи. Не ставте LLM у положення оракулів, а радше потужних інструментів — інструментів, чиї можливості повинні бути збалансовані турботою, відповідальністю та людським судженням.

Фінальний вердикт

«Large Language Models» — це не просто ще один технічний посібник — це своєчасний, гострий та глибоко продуманий керівник до однієї з найбільш CONSEQUENTIAL технологій нашого часу. Вона поєднує доступне пояснення з триманим рефлексом; ясний технічний деталь з широкою соціальною усвідомленістю; захоплення потенціалом із обережним реалізмом щодо ризиків.

Для будь-кого — інженера, дослідника, студента, політика, роздумуючої людини — хто шукає зрозуміти, що таке LLM, що вони можуть і чого не можуть робити, і що вони можуть означати для нашого майбутнього — книжка «Large Language Models» Стівена Рааймейкерса є суттєвою для читання.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.