Anderson의 관점

감정 표현을 위한 타이포그래피와 AI

mm
Unite.AI를 Google의 선호 소스에 추가

현재의 텍스트 통신 트렌드와 혁신, 즉 이메일, 메시징, 캡션 시스템 등은 서면과 구어 간의 감정적 차이를 粗略하게 처리해야 한다.

예를 들어, 최근 몇 년 동안 대문자로 작성된 텍스트가 소셜 미디어의 논쟁에서 유쾌한 멤으로 사용되면서 인기를 끌었으며, 일부 댓글 플랫폼에서 볼드하고 충격적인 타이포그래픽 효과를 허용하는 동안 대문자 사용은 모더레이터의 개입을 유발한다. 이러한 방법은 서면의 의도를 명확히 하는 데에는 단조롭고 광범위하게 대표적인 방법이다.

同時に, 감정과 의견을 전달하는 하이브리드 텍스트/비주얼 감정 전달자로서의 이모티콘과 이모지의 인기는 최근 몇 년 동안 자연어 처리(NLP) 연구 분야에서 활발하게 참여하고 있다. 또한, 사용자가 댓글 스레드에 게시하는 애니메이션 GIF의 의미에 대한 관심도 증가하고 있다.

시간이 지남에 따라, 서면 언어는 감정을 대리하거나 부족한 말투 정보를 대신하여 애매한 언어적 방법을 발전시켜 왔다.

일반적으로, 우리는 서면 언어의 맥락에서 감정을 최선을 다해 표현해야 한다. 예를 들어, 레이디 맥베스의 광기 어린 밤의 독백에서 “오, 오, 오!”라는 감정 표현은 말투가 의미에 미치는 영향의 정도를 보여주는 사례이다.

대부분의 각색에서, 이 고통의 한탄은 2-6초 동안 지속되지만, 1976년 트레버 넌의 로열 셰익스피어 컴퍼니의 맥베스 공연에서 주디 덴치는 이 줄을 읽는 데 24.45초를 기록했다.

(유튜브의 자체 자막 시스템은 이 클립에서 덴치의 울음을 [음악]으로 설명한다.)

말투를 타이포그래피로 번역하기

브라질의 한 논문은 말투를 직접 자막으로 번역하여 감정의 차원을 추가할 수 있는 음성-조정 타이포그래피 시스템을 제안한다. 이 시스템은 ‘[소리 지르는]’과 같은 형용사를 붙이는 것보다 더 나은 방법이다.

‘우리는 음성의 음향 특징을 사용하여 텍스트의 시각적 모양을 조정하는 새로운 음성-조정 타이포그래피 모델을 제안한다. 이는 특정 발언의 전사에서 단순히 말하는 단어를 나타내는 것뿐만 아니라 어떻게 말하는지 나타낼 수 있다.’

‘이것으로 우리는 음성의 음조, 길이, 크기와 같은 특징을 시각적으로 대리할 수 있는 타이포그래픽 매개변수를 발견하기를หว한다.’

말투를 타이포그래피로 번역하는 워크플로우. 가능한 한 유연하고广泛하게 배포할 수 있는 시스템을 제작하기 위해, 저자들은 베이스 라인 이동, 커닝, 볼드함으로 제한했다. 볼드함은 오픈 타입 폰트의 유연성으로 제공된다. 출처: https://arxiv.org/pdf/2202.10631.pdf

말투를 타이포그래피로 번역하는 워크플로우. 가능한 한 유연하고广泛하게 배포할 수 있는 시스템을 제작하기 위해, 저자들은 베이스 라인 이동, 커닝, 볼드함으로 제한했다. 볼드함은 오픈 타입 폰트의 유연성으로 제공된다. 출처: https://arxiv.org/pdf/2202.10631.pdf

이 논문은 숨겨진 울음, 속삭임, 그리고 외침: 텍스트가 단순한 단어 이상의 것을 전달할 수 있을까?라는 제목으로, 브라질의 Universidade Estadual de Campinas의 두 연구자 Calua de Lacerda Pataca와 Paula Dornhofer Paro Costa가 작성했다.

볼드한 단어

이 프로젝트의 더广泛한 목표는 자막에서 말투와 다른 매개 변수 언어 특징을 전달할 수 있는 시스템을 개발하는 것이다. 저자들은 이러한 시스템이 궁극적으로 청각 세계에서 더广泛한 청중을 확보할 수 있을 것이라고 믿는다.

이 분야에는 이전에 여러 시도가 있었는데, 1983년에 제안된 자막 시스템은 ‘[특수 효과, 색상, 대문자]를 사용하여 청각 정보를 제공할 수 있다’고 설명했다.

ブラジルの 프로젝트는 자동 자막과 감정 인식의 새로운 개발을 활용할 수 있다. 이러한 워크플로우는 오디오 클립에서 구성 요소를 가져와 특징화할 수 있다.

말투 특징을 추출하고 처리한 후, 시간戳와 함께 단어를 매핑하여 규칙 기반의 자막 타이포그래피를 조정할 수 있는 토큰을 생성한다(위의 이미지 참조).

이 결과는 특정 음절이 얼마나 kéo dài되거나 강조되었는지, 또는 문맥 정보가 원래 자막에서丢失된 경우를 시각적으로 나타낼 수 있다.

프로젝트의 테스트 단계에서, 커닝(단어 안의 글자 사이의 간격)이 kéo dài된 발음으로 반영되도록 넓혀진 것을 볼 수 있다.

프로젝트의 테스트 단계에서, 커닝(단어 안의 글자 사이의 간격)이 kéo dài된 발음으로 반영되도록 넓혀진 것을 볼 수 있다.

저자들은 자신의 연구가 감정 인식과 감정 인식 연구에 직접 기여하는 것이 아니라, 음성의 특징을 분류하고 단순하고 제한된 새로운 시각적 규칙으로 나타내는 것을 목표로 한다.

至少, 시스템이 제공하는 추가 강조는 청각 정보를 청취할 수 없는 사람들에게 문장의 의미를 명확히 할 수 있다.

예를 들어, 2017년에ผม이 작성한 기사에서, 기계 학습 시스템이 문장에서 동작과 객체의 위치를 이해하는 데 어려움을 겪을 수 있다는 것을 보여주었다. 강조가 단순한 문장의 의미를 어떻게 크게 변경할 수 있는지 쉽게 이해할 수 있다:

나는 그것을 훔치지 않았다. (누군가 다른 사람이 그것을 훔쳤다)
나는 훔치지 않았다, (나는 내가 그것을 훔쳤다는 혐의를 부정한다)
나는 훔치지 않았다. (나는 그것을 소유하고 있으므로 도둑질은 적용되지 않는다)
나는 훔치지 않았다. (하지만 나는 다른 것을 훔쳤다)

потен적으로, 브라질 연구자들이 제안한 것과 같은 기계적인 말투-타이포그래피 워크플로우는 감정 컴퓨팅 연구를 위한 데이터셋 개발의 보조 도구로도 유용할 수 있다. 이는 순수한 텍스트 기반 데이터를 처리할 수 있기 때문이다.

탄력적인 타이포그래피

연구자들이 개발한 프레임워크는 베이스 라인 이동, 커닝, 폰트 가중치(볼드함)의 변화를 제공한다.

이 세 가지 스타일은 음성의 특징과 매핑된다: 각각 음조, 길이, 크기이다.

문장의 스타일링 진행. #1에서, 우리는 추출 과정에서 정의된 음절 경계를 볼 수 있다. #2에서, 우리는 각각의 세 가지 조정을 적용한 것을 볼 수 있다. #3에서, 우리는 시스템을 테스트한 117명의 참가자에게 제시된 최종 출력을 볼 수 있다.

문장의 스타일링 진행. #1에서, 우리는 추출 과정에서 정의된 음절 경계를 볼 수 있다. #2에서, 우리는 각각의 세 가지 조정을 적용한 것을 볼 수 있다. #3에서, 우리는 시스템을 테스트한 117명의 참가자에게 제시된 최종 출력을 볼 수 있다.

단일 폰트가 볼드와 이탤릭과 같은 변형에 대한 추가 폰트를 요구할 수 있으므로, 연구자들은 오픈 타입 폰트인 Inter를 사용했다. 이 폰트는 하나의 폰트에 다양한 가중치를 통합한다.

논문에서, Inter 폰트의 오픈 타입 글리프가 최소한의 베이스 스플라인을 따라 다양한 볼드 강조를 표현할 수 있는 범위를 보여주는 차트.

논문에서, Inter 폰트의 오픈 타입 글리프가 최소한의 베이스 스플라인을 따라 다양한 볼드 강조를 표현할 수 있는 범위를 보여주는 차트.

테스트

커닝과 베이스 라인 이동의 표현은 브라우저 플러그인에 통합되어 117명의 청력 능력이 있는 참가자에게 테스트되었다.

테스트를 위한 데이터셋은 프로젝트를 위해 특별히 제작되었으며, 배우가 여러 번 시를 읽었고 각 테이크마다 다른 강조를 두었다. 시는 다양한 강조를 허용하기 때문에 선택되었다.

참가자들은 두 그룹으로 나뉘었다. 첫 번째 그룹은 동기화된 애니메이션과 조정된 텍스트가 있는 배우의 시 낭송 15라운드를 받았다.

두 번째 그룹은 동일한 작업을 받았지만, 텍스트는 정적 이미지로 표시되었으며 오디오 클립 재생 중에 변경되지 않았다.

정적 이미지 그룹의 평균 정답률은 67%였으며, 애니메이션 텍스트 그룹의 평균 정답률은 63%였다. 연구자들이 테스트 후 참가자로부터 받은 의견은 동적 해석의 인지 부담이 낮은 점수를 초래한 것으로 나타났다. 그러나, 이러한 프레임워크가 의도된 자막 및 메시지 시스템은 일반적으로 기본적으로 완성된 텍스트를 제공한다.

참가자 의견은 또한 커닝을 사용하여 길이를 나타내는 데 한계가 있음을 나타냈다. 한 참가자는 글자가 너무 멀리 떨어져 있으면 단어를 구별하기 어려워진다고 말했다.

연구자들은 또한 다음과 같이 말했다:

‘일부 참가자는 모델이 더 복잡하고 다양한 음성 표현을 포함해야 한다고 느꼈다. 이는 더 다양한 시각적 어휘를 사용하여 음성의 특징을 나타낼 수 있는 더广泛한 응용 프로그램을 개발하는 데 도움이 될 것이다.’

 

 

最初에 2022년 2월 24일에 게시되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai