Взгляд Anderson

Выражение эмоций через типографику с помощью ИИ

mm
Добавьте Unite.AI в избранные источники в Google

Текущие тенденции и инновации в текстовой коммуникации (включая электронную почту, сообщения и системы подписей) должны ориентироваться в аффективном разрыве между письменной и устной речью грубыми и приближенными способами.

Например, последние несколько лет привели к популяризации чередующихся заглавных букв как провокационной мемы в социальных медиа-спорах, в то время как очень нелюбимое использование заглавных букв (а также жирных и резких типографических эффектов, допускаемых некоторыми платформами комментариев) продолжает вызывать вмешательство модераторов. Это монотонные и только примерно представляющие методы для уточнения намерения письменного слова.

В то же время, рост популярности эмодзи и смайликов, как гибридного текстового/визуального средства передачи настроений, активно вовлек сектор исследований обработки естественного языка (NLP) в последние годы, вместе с интересом к значению анимированных GIF-изображений, которые пользователи публикуют в комментариях.

С течением времени письменный язык эволюционировал в инновационный фонд этих “добавочных” лингвистических методов, которые пытаются либо заменить эмоции, либо вызвать их в отсутствие тональной информации в устной речи.

Обычно, однако, нам нужно извлечь эмоцию так хорошо, как мы можем из контекста письменного слова. Рассмотрим, например, восклицание ‘О, о, о!’, в конце ночного монолога леди Макбет, который можно рассматривать как пример степени, в которой интонация может влиять на смысл.

В большинстве адаптаций это болезненное скорбь длится 2-6 секунд; в постановке Тревора Нанна 1976 года Макбет Королевской шекспировской компании, Джуди Денч прочитала эту строку в, возможно, непревзойденном рекордном 24,45 секунды, в знаковой интерпретации роли.

(Система автоматического подписывания YouTube для этого клипа описывает улюлюканье Денч как [МУЗЫКА])

Перевод просодии в типографику

Недавняя статья из Бразилии предлагает систему рече-модулированной типографики, которая потенциально может включать такую просодию и другие паралингвистические компоненты, непосредственно в подписанные речи, добавляя измерение эмоций, которое плохо захватывается предшествующим добавлением прилагательных, таких как [Крик], или других “плоских” трюков, доступных конвенциям закрытых субтитров.

‘Мы предлагаем новую модель рече-модулированной типографики, где акустические особенности речи используются для модуляции визуального вида текста. Это может позволить транскрипции данного высказывания не только представлять слова, которые говорятся, но и то, как они говорятся.’

‘С этим мы надеемся раскрыть типографические параметры, которые могут быть общепризнаны как визуальные замены просодических особенностей амплитуды, высоты и продолжительности.’

Поток обработки, который транслитерирует просодию в типографическое оформление. Стремясь создать наиболее универсальную и широко применимую систему, авторы ограничили себя базовым сдвигом, кернингом и жирностью, последняя из которых обеспечивается универсальностью шрифта с открытым типом. Источник: https://arxiv.org/pdf/2202.10631.pdf

Поток обработки, который транслитерирует просодию в типографическое оформление. Стремясь создать наиболее универсальную и широко применимую систему, авторы ограничили себя базовым сдвигом, кернингом и жирностью, последняя из которых обеспечивается универсальностью шрифта с открытым типом. Источник: https://arxiv.org/pdf/2202.10631.pdf

Статья называется Скрытые крики, шепоты и лай: можно ли сделать текст звучащим больше, чем просто его слова?, и исходит от Калвы де Ласерда Патаки и Паулы Дорнхофер Паро Косты, двух исследователей из Университета штата Кампинас в Бразилии.

Жирные слова

Хотя более широкая цель проекта – разработать системы, которые могут передавать просодию и другие параметрические языковые особенности в субтитрах, авторы также считают, что система такого типа могла бы в конечном итоге получить более широкую аудиторию в мире слышащих.

Существует много предыдущих инициатив в этом пространстве, включая проект 1983 года, который предложил систему субтитров, которая могла бы включать ‘спецэффекты, цвет и заглавные буквы [для представления] богатой тональной информации, лишенной глухих детей[.]’.

Напротив, бразильский проект может воспользоваться как автоматической транскрипцией, так и новыми разработками в области распознавания эмоций, которые в совокупности позволяют создать рабочий процесс, который может импортировать и характеризовать компоненты в звуковой дорожке речи.

После того, как просодические особенности извлечены и обработаны, они сопоставляются с временными метками слов в речи, в результате чего получаются токены, которые можно использовать для применения правил модуляции типографики субтитров (см. изображение выше).

Это может визуально представить степень, в которой конкретная слог может быть продлен, прошептан, подчеркнут или иным образом содержать контекстную информацию, которая будет потеряна в сырой транскрипции.

Из тестовой фазы проекта, обратите внимание на то, как кернинг (промежуток между буквами в слове) был расширен для отражения продленного произношения.

Из тестовой фазы проекта, обратите внимание на то, как кернинг (промежуток между буквами в слове) был расширен для отражения продленного произношения.

Авторы подчеркивают, что их работа не предназначена для прямого вклада в исследования распознавания эмоций и аффективных состояний, а скорее направлена на классификацию особенностей речи и представление их простым и ограниченным набором новых визуальных конвенций.

По крайней мере, дополнительный акцент, который обеспечивает система, разъясняет предложения, где объект действия может не быть ясен для зрителей, которые не могут услышать звук (либо из-за инвалидности, либо из-за обстоятельств воспроизведения, таких как шумовые среды).

Чтобы воспользоваться моим собственным примером из 2017 года, который рассмотрел, как системы машинного обучения также могут иметь трудности в понимании, где объект и действие лежат в предложении, легко увидеть, насколько акцент может радикально изменить смысл даже простого предложения:

Я не украл это. (Кто-то другой украл его)
Я не украл это, (Я отрицаю обвинение, что я украл его)
Я не украл это. (Я владею им, кража не применима)
Я не украл это. (Но я украл что-то другое)

Потенциально, механистический рабочий процесс просодии>типографики, такой как бразильские авторы предлагают, также может быть полезен в качестве дополнения при разработке наборов данных для исследований аффективных вычислений, поскольку он облегчает обработку чисто текстовых данных, которые тем не менее включают некоторые предварительно выведенные паралингвистические измерения.

Кроме того, исследователи отмечают, что дополнительная лингвистическая нагрузка просодически-осведомленного текста может быть полезна в ряде задач, основанных на NLP, включая оценку удовлетворенности клиентов и для вывода депрессии из текстового содержания.

Эластичная типография

Разработанная исследователями структура предлагает вариацию базового сдвига, где буква может быть выше или ниже относительно “базовой линии”, на которой отдыхает предложение; кернинг, где промежуток между буквами слова может быть сокращен или расширен; и жирность шрифта (жирность).

Эти три стили сопоставляются с извлеченными особенностями речи, на которые проект ограничил себя: соответственно, высота, продолжительность и амплитуда.

Прогресс стиля на предложении. На #1 мы видим границы слогов, которые были определены в процессе извлечения. На #2 мы видим представление каждого из трех модуляций (амплитуда|жирность, кернинг|продолжительность и высота|базовый сдвиг), примененных по отдельности. На #3 мы видим объединенные типографические модуляции в окончательном выводе, представленном 117 участникам испытания системы.

Прогресс стиля на предложении. На #1 мы видим границы слогов, которые были определены в процессе извлечения. На #2 мы видим представление каждого из трех модуляций (амплитуда|жирность, кернинг|продолжительность и высота|базовый сдвиг), примененных по отдельности. На #3 мы видим объединенные типографические модуляции в окончательном выводе, представленном 117 участникам испытания системы.

Поскольку один шрифт может требовать дополнительного и отдельного шрифта для вариаций, таких как жирный и курсив, исследователи использовали реализацию Google Inter, которая интегрирует гранулярный диапазон весов в один шрифт.

Из статьи, диаграмма, детализирующая степень, в которой глиф OpenType из шрифта Inter может выразить ряд жирных акцентов вдоль скелета минимальной базовой сплайны.

Из статьи, диаграмма, детализирующая степень, в которой глиф OpenType из шрифта Inter может выразить ряд жирных акцентов вдоль скелета минимальной базовой сплайны.

Тестирование

Выражение кернинга и базового сдвига было включено в браузерный плагин, который позволил провести испытания на 117 участниках с возможностью слышать.

Датасет для испытаний был создан специально для проекта, наняв актера, который прочитал выборку стихов несколько раз с разным акцентом на каждом дубле, соответствующим трем особенностям, которые проект изучает. Поэзия была выбрана потому, что она позволяет диапазон акцентов (даже за пределами намерения поэта) без звучания искусственно.

Участники были разделены на две группы. Первая группа получила 15 раундов чтения актером строфы, сопровождаемого синхронизированным, анимированным и модулированным текстом, который разворачивался во времени с аудиоклипом.

Вторая группа получила точно те же задания, но была представлена статическими изображениями модулированного текста, который не менялся во время воспроизведения аудиозаписи актера.

Средний процент правильных ответов составил 67% для группы статических изображений и 63% для группы анимированного текста. Комментарии участников, собранные исследователями после испытаний, подтвердили их теорию, что когнитивная нагрузка динамической интерпретации могла способствовать более низким результатам для нестатических испытаний. Однако, тип системы субтитров и сообщений, для которых предназначена такая структура, обычно предоставляет предварительно выполненный текст по умолчанию.

Комментарии участников также указали на то, что существуют жесткие ограничения на использование кернинга для указания продолжительности, с одним комментатором, отметившим, что когда буквы расположены слишком далеко друг от друга, становится трудно индивидуализировать слово.

Исследователи также отмечают:

‘[Некоторые] участники чувствовали, что модель должна быть в состоянии воплотить более тонкие и сложные представления речи, которые она должна сделать с более разнообразной и выразительной визуальной лексикой. Хотя это не простая задача, это, тем не менее, обнадеживает представить, как разные применения рече-модулированной типографики могли бы разветвиться, когда это новое поле развивается.’

 

 

Опубликовано впервые 24 февраля 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai