Погляд Anderson
Система машинного навчання для переписування статті під час її читання

Нові дослідження з Канади пропонують метод автоматичного переписування статті під час її читання на основі типу “swiping” (перелистування) у стилі Tinder або пасивного спостереження за взаємодією читача з різними видами вмісту статті.
Система, названа Hone As You Read (HARE), представлена в статті Західного університету в Онтаріо, Канада, з відповідним Python-кодом на GitHub.
Центральна ідея проекту полягає в тому, що стаття може містити різні види вмісту, які розвиваються (як і ця стаття) від заголовку до подальших деталей. Пізні частини статті можуть містити різні види супровідного матеріалу, випадки використання, гіпотези або припущення щодо наслідків новини.
Під HARE, якщо вам не подобається такий матеріал, ви можете проголосувати проти нього на рівні абзацу, поки система вчиться вашим уподобанням, так що до моменту прокрутки вміст, подібний до матеріалу, який ви “проголосували проти”, вже був видалений або переписаний. Якщо ви не хочете активно брати участь у навчанні системи, HARE може здогадатися про ваші вибори, спостерігаючи за вашими пасивними взаємодіями з документом.
Голосування у стилі Tinder для незадовільних речень
На зображенні нижче ми бачимо три можливих типи висновків для HARE, заснованих на явній або неявній поведінці користувача. У першому випадку (зліва) користувач активно “перелистує вліво” (або вправо) у стилі Tinder, виражаючи схвалення або незадоволення вмістом абзацу або речення, або його стилем, складністю чи тоном.
У другому випадку (в центрі) система використовує час зупинки як міру інтересу користувача, засновану на позиції та тривалості паузи прокрутки.
У третьому випадку (справа) HARE використовує камеру смартфона для оцінки шляху та часу зупинки положення погляду користувача по абзацям видимих документів.
Дослідники стверджують, що збільшення часу зупинки на будь-якому абзаці може вказувати на підвищений інтерес користувача, хоча логічно це може не бути справедливим у випадках, коли читач намагається засвоїти текст, який може бути складним або просто погано написаним.

Відгук користувача ефективно редагує, переписує або повністю видалить ще не бачені частини статті.
Передбачне оброблення вмісту відповідно до уподобань користувача
Стаття розглядає досвід користувача HARE на рівні окремої статті, але rõчно, що історична взаємодія користувача з документами дозволяє налаштувати майбутній досвід читання, постійно розпізнавши типи вмісту та застосувавши шаблонні уподобання користувача до нових статей, так що потреба у взаємодії зменшується, оскільки користувач бачить менше та менше “небажаного” вмісту.
HARE характеризується як алгоритм підсумовування, який дозволяє невидимий вміст нижче сторінки бути переписаним у стилі або лаконічності до того, як користувач дійде до нього; але стаття робить rõчно, що він також може попередньо видалити вміст на основі відгуку користувача.
Для тестових цілей система використовувала корпус з 11 222 статтями з британської газети Daily Mail та була оцінена через тестове розгортання на чаті Telegram. Статті з менше десяти абзаців були відкинуті для випробувань.

Телеграм-аплікація HARE на етапі тестування з користувачами.
Методологія дослідників використовує K-Means кластеризацію на SBERT вкладеннях речень у статтях, з початково випадковими вагами для концепцій.
Серед широкої групи алгоритмів та підходів HARE включає три порівняльні моделі, перша з яких (ORACLEGREEDY) має доступ до попередніх уподобань користувача, вказуючи на те, що алгоритм міг би попередньо обробляти статті під час завантаження, а не інтерактивно.
Інші моделі, ORACLESORTED і ORACLEUNIFORM, вибирають речення на основі рівня інтересу або випадково по всій статті, відповідно.
Видалення та переписування вмісту
Незвично, ORACLEUNIFORM перевершив контрольну групу, хоча він не має доступу до попередніх інтересів користувача. Дослідники стверджують, що це тому, що він обробляє всю статтю одним рухом, “вибираючи лише найцікавіші речення”. Дослідники визнають, що це може обмежити доступний вміст лише реченнями, які займаються найбільш важливою концепцією, логічно видаляючи інші тексти, які можуть займатися наслідками або оцінкою концепції.
Екстрактивні підсумовувачі, використані в HARE, це LexRank, SumBasic та TextRank.
HARE була протестована на 13 добровольцях протягом 70 випробувань та різних алгоритмічних підходів, і змогла оновлювати підсумки (переписані/видалені тексти) за час від 1,3 мілісекунди до 100 мілісекунд на споживчому ноутбуці, залежно від моделі, яка проходила випробування. Результати показали, що моделі, які видалили найбільше тексту, не показали хорошої результативності, головним чином тому, що це може вплинути на узгодженість залишеного тексту.
Етичні наслідки динамічного переписування статей
Дослідники визнають етичні проблеми навколо технологій цього типу:
‘Завдання HARE призначене для розробки майбутніх застосунків, орієнтованих на користувача. За своєю суттю ці застосунки мають можливість контролювати те, що користувач читає з даної статті. Можливо, що ці інструменти можуть посилити “ефект ехо-камери”, який уже створюється автоматизованими новинними лентами, результатами пошуку та онлайн-спільнотами, якщо вони будуть розгорнуті без належної уваги.’
Однак вони також зазначають, що така система могла б бути використана в майбутніх застосунках для пом’якшення ефекту ехо-камери шляхом введення тексту, який пропонує альтернативні точки зору, які можуть не бути присутніми в статті спочатку. Вони спостерігають: ‘Вага цього чинника могла б бути налаштована для забезпечення як цікавого досвіду читання, так і доступу до різноманітних ідей.’
Ті, хто найімовірніше вигодується від такої системи, на думку дослідників, це читачі, які хочуть заощадити час на отримання інформації, та видавці вмісту.













