Погляд Anderson

Що може розповісти нам штучний інтелект про приховані програми в новинах

mm
Додайте Unite.AI до бажаних джерел у Google
ChatGPT-4o and Firefly.

Моделі типу ChatGPT навчаються виявляти, про що насправді думає стаття в новинах дійсно, навіть якщо ця позиція прихована під цитатами, фреймінгом або (іноді нечесною) «нейтральністю». Розбиваючи статті на сегменти, такі як заголовки, ліди та цитати, нова система вчиться виявляти упередженість навіть у довгих професійних журналістських матеріалах.

 

Спроможність зрозуміти справжню точку зору автора або оратора — це питання, відоме в літературі як виявлення позиції, — адресує одну з найважчих інтерпретаційних проблем мови: розуміння наміру з вмісту, який може бути розроблений для приховування або запутання його.

Від «Скромної пропозиції» Джонатана Свіфта до недавніх виступів політичних акторів за позиченими полемічними засобами їхніх ідеологічних опонентів, поверхня заяви вже не є надійним показником її наміру; зростання іронії, тролінгу, дезінформації та стратегічної двозначності зробило ще важче визначити, на якій стороні перебуває текст, або чи перебуває він взагалі.

Часто те, що залишається невказаним, має таку ж вагу, як і те, що вказано, і просто вибір теми для висвітлення може сигналізувати про позицію автора.

Це робить завдання автоматичного виявлення позиції незвичайно складним, оскільки ефективна система виявлення повинна робити більше, ніж позначати окремі речення як «підтримуючі» або «опозиційні»: замість цього вона повинна проходити через шари значення, зважуючи дрібні підказки проти форми та напрямку всієї статті; і це важче в довгих журналістських матеріалах, де тон може змінюватися, а думка рідко висловлюється явно.

Агенти змін

Щоб звернутися до деяких із цих питань, дослідники в Південній Кореї розробили нову систему під назвою JOA-ICL (Журналістсько-орієнтоване агентське навчання в контексті) для виявлення позиції довгих новинних статей.

Основна ідея JOA-ICL полягає в тому, що позиція статті виводиться шляхом агрегації сегментних прогнозів, створених окремим мовним моделлю-агентом.. Джерело: https://arxiv.org/pdf/2507.11049

Основна ідея JOA-ICL полягає в тому, що позиція статті виводиться шляхом агрегації сегментних прогнозів, створених окремим мовним моделлю-агентом. Джерело: https://arxiv.org/pdf/2507.11049

Натомість ніж судити статтю в цілому, JOA-ICL розбиває її на структурні частини (заголовок, лід, цитати та висновок) і призначає меншу модель для позначення кожної частини. Ці локальні прогнози потім передаються великій моделі, яка використовує їх для визначення загальної позиції статті.

Метод був протестований на новому зібраному корейському наборі даних, що містить 2000 новинних статей, анотованих як для рівня статті, так і для рівня сегмента. Кожна стаття була позначена з вхідними даними від журналістського експерта, що відображає, як позиція розподілена по структурі професійної журналістики.

За словами статті, JOA-ICL перевершує як базові, так і тонко налаштовані моделі, демонструючи особливу силу у виявленні підтримуючих позицій (які моделі з подібним потенціалом часто пропускають). Метод також виявився ефективним, коли його застосували до німецького набору даних за аналогічних умов, що свідчить про те, що його принципи потенційно стійкі до мовних форм.

Автори заявляють:

‘Експерименти показують, що JOA-ICL перевершує існуючі методи виявлення позиції, підкреслюючи переваги сегментного агентства у захопленні загальної позиції довгих новинних статей.”

Нова стаття називається Журналістсько-орієнтоване агентське навчання в контексті для виявлення позиції новин, і походить від різних факультетів Університету Сонґсіль у Сеулі, а також аспірантури KAIST з майбутньої стратегії.

Метод

Частина виклику штучного інтелекту з посиленням виявлення позиції полягає в логістичних питаннях, пов’язаних із тим, скільки сигналу система машинного навчання може зберегти та об’єднати одночасно, на сучасному рівні розвитку.

Новинні статті схильні уникати прямих заяв про думку, спираючись натомість на імпліцитну або прийняту позицію, сигналізовану через вибір джерел для цитування, як розповідь структурована, і які деталі залишаються невказаними, серед багатьох інших факторів.

Навіть коли стаття займає чітку позицію, сигнал часто розсіюється по тексту, з різними сегментами, що вказують у різні напрямки. Оскільки мовні моделі (LM) все ще борються з обмеженими вікнами контексту, це може зробити складним для моделей оцінити позицію так, як вони роблять це з коротким вмістом (таким як твіти та інші короткі форми соціальних медіа), де відношення між текстом та ціллю більш явне.

Отже стандартні підходи часто не дають результату, коли застосовуються до повноформатної журналістики; випадок, коли двозначність є особливістю, а не дефектом.

Стаття заявляє:

‘Щоб звернутися до цих викликів, ми пропонуємо ієрархічний підхід моделювання, який спочатку виводить позицію на рівні менших одиниць дискурсу (наприклад, абзаців чи секцій), а потім інтегрує ці місцеві прогнози для визначення загальної позиції статті.

‘Цей каркас розроблений для збереження локального контексту та захоплення розсіяних сигналів позиції при оцінці того, як різні частини новинної історії внесли свій внесок у її загальну позицію щодо питання.’

Для цього автори скомпілювали новий набір даних під назвою K-NEWS-STANCE, складений із корейського висвітлення новин між червнем 2022 року та червнем 2024 року. Статті були спочатку ідентифіковані через BigKinds, урядову метадані службу, що експлуатується Корейським фондом преси, а повні тексти були отримані за допомогою API агрегатора новин Naver. Фінальний набір даних складався з 2000 статей з 31 видання, що охоплюють 47 національно-важливих питань.

Кожна стаття була анотована двічі: один раз для її загальної позиції щодо даного питання, і знову для окремих сегментів; зокрема заголовку, ліду, висновку та прямих цитат.

Анотацію очолила журналістка Джі Йон Хан, також третій автор статті, яка керувала процесом за допомогою встановлених сигналів з медійних студій, таких як вибір джерел, лексичний фреймінг та шаблони цитування. За допомогою цих засобів було отримано загалом 19 650 сегментних позначок позиції.

Щоб забезпечити, щоб статті містили значимі сигнали точки зору, кожна стаття була спочатку класифікована за жанром, і використовувалися тільки ті, які були позначені як аналіз або думка (де суб’єктивне фреймінг більш ймовірно знайдене).

Два підготовлених анотатори позначили всі статті, і були інструктовані консультуватися з пов’язаними статтями у разі, якщо позиція була неясною, із розбіжностями, які були вирішені через обговорення та додатковий огляд.

Зразкові записи з набору даних K-NEWS-STANCE, перекладені англійською. Показані тільки заголовок, лід та цитати; повний текст тіла опущено. Виділення вказує на позначки позиції для цитат, з синім для підтримуючих і червоним для опозиційних. Будь ласка, зверніться до джерела PDF для яснішої версії.

Зразкові записи з набору даних K-NEWS-STANCE, перекладені англійською. Показані тільки заголовок, лід та цитати; повний текст тіла опущено. Виділення вказує на позначки позиції для цитат, з синім для підтримуючих і червоним для опозиційних. Будь ласка, зверніться до джерела PDF для яснішої версії.

JoA-ICL

Натомість ніж розглядати статтю як єдиний блок тексту, запропоновану авторами систему розділяє її на ключові структурні частини: заголовок, лід, цитати та висновок, призначуючи кожну з них мовній моделі-агенту, який позначає сегмент як підтримуючий, опозиційний або нейтральний.

Ці місцеві прогнози передаються другому агенту, який визначає загальну позицію статті, з двома агентами, координованими контролером, який підготував промпти та зібрав результати.

Таким чином JOA-ICL адаптує навчання в контексті (де модель вчиться з прикладів у промпті) до того, як написані професійні новинні історії, використовуючи сегментно-чутливі промпти замість одного загального вводу.

(Будь ласка, зверніться до оригінального джерела PDF, оскільки більшість прикладів та ілюстрацій у статті довгі та важко відтворювати чітко в онлайн-статті)

Дані та тести

У тестах дослідники використовували макро F1 та точність для оцінки продуктивності, усереднюючи результати за десять запусків з випадковими насіннями від 42 до 51 та повідомляючи стандартну похибку. Тренувальні дані використовувалися для тонкої настройки базових моделей та сегментних агентів, з малою кількістю зразків, вибраних через пошук подібності за допомогою KLUE-RoBERTa-large.

Тести проводилися над трьома графічними процесорами RTX A6000 (кожний з 48 ГБ відеопам’яті), використовуючи Python 3.9.19, PyTorch 2.5.1, Transformers 4.52.0 та vLLM 0.8.5.

GPT-4o-mini, Claude 3 Haiku та Gemini 2 Flash були використані через API, при температурі 1,0 та з максимальною кількістю токенів, встановленою на 1000 для промптів ланцюга думок, і 100 для інших.

Для повної тонкої настройки Exaone-3.5-2.4B був використаний оптимізатор AdamW при швидкості навчання 5e-5, з ваговим затуханням 0,01, 100 шагів нагрівання та з даними, навченими протягом 10 епох при вузлі розміру 6.

Для базових моделей автори використовували RoBERTa, тонко налаштовану для виявлення позиції на рівні статті; вбудовування ланцюга думок, альтернативну настройку RoBERTa для призначеної задачі; LKI-BART, модель кодувача-генератора, яка додає контекстну інформацію з великої мовної моделі, промптуючи її як вхідним текстом, так і позначкою позиції; і PT-HCL, метод, який використовує контрастне навчання для розділення загальних ознак від тих, які є специфічними для цільової проблеми:

Продуктивність кожної моделі на тестовому наборі даних K-NEWS-STANCE для загальної позиції передбачення. Результати показані як макро F1 та точність, з найвищим балом в кожній групі виділено жирним шрифтом.

Продуктивність кожної моделі на тестовому наборі даних K-NEWS-STANCE для загальної позиції передбачення. Результати показані як макро F1 та точність, з найвищим балом в кожній групі виділено жирним шрифтом.

JOA-ICL досяг найкращої загальної продуктивності як за точністю, так і за макро F1, перевага, очевидна у всіх трьох випробовуваних моделей: GPT-4o-mini, Claude 3 Haiku та Gemini 2 Flash.

Сегментний метод послідовно перевершував усі інші підходи, з, як зазначають автори, помітною перевагою у виявленні підтримуючих позицій, загальним слабким місцем подібних моделей.

Базові моделі показали гіршу загальну продуктивність. RoBERTa та варіанти ланцюга думок боролися з нюансами, тоді як PT-HCL та LKI-BART показали кращі результати, хоча все ще відставали від JOA-ICL у більшості категорій. Найточніший окремий результат був отриманий JOA-ICL (Claude), з 64,8% макро F1 та 66,1% точності.

Наступна картина показує, скільки разів моделі правильно чи неправильно позначили кожну мітку:

Матриці плутанини, що порівнюють базову лінію та JOA-ICL, показуючи, що обидва методи найбільше борються з виявленням «підтримуючих» позицій.

Матриці плутанини, що порівнюють базову лінію та JOA-ICL, показуючи, що обидва методи найбільше борються з виявленням «підтримуючих» позицій.

JOA-ICL показав кращу загальну продуктивність, ніж базова лінія, правильно позначивши більше міток у кожній категорії. Однак обидві моделі найбільше боролися з підтримуючими статтями, а базова лінія неправильно класифікувала майже половину, часто приймаючи їх за нейтральні.

JOA-ICL зробив менше помилок, але показав той же шаблон, підтверджуючи, що «позитивні» позиції складніше для моделей виявити.

Щоб перевірити, чи працює JOA-ICL за межами корейської мови, автори запустили його на CheeSE, німецький набір даних для виявлення позиції на рівні статті. Оскільки CheeSE не містить сегментних міток, дослідники використовували дистанційне наглядання, при якому кожний сегмент отримував ту ж мітку позиції, що й вся стаття.

Результати виявлення позиції на німецькомовному наборі даних CheeSE. JOA-ICL послідовно покращує нульове промптування через усі три випробовувані великі мовні моделі та перевершує тонко налаштовані базові моделі, з Gemini-2.0-flash, який дає найкращу загальну продуктивність.

Результати виявлення позиції на німецькомовному наборі даних CheeSE. JOA-ICL послідовно покращує нульове промптування через усі три випробовувані великі мовні моделі та перевершує тонко налаштовані базові моделі, з Gemini-2.0-flash, який дає найкращу загальну продуктивність.


Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai