Andersonの視点

感情をタイポグラフィーで表現する – AIを用いた新しいアプローチ

mm
Unite.AI を Google の優先ソースに追加

テキストコミュニケーション(メール、メッセージング、キャプションシステムなど)の最新のトレンドと革新は、書き言葉と話し言葉の間の感情的な隔たりを、粗くて近似的な方法で乗り越えなければなりません。

例えば、最近の数年間で、大文字と小文字を交互に使用するスタイルが、ソーシャルメディアの炎上での挑発的なメームとして流行しています。一方で、嫌われ者のキャップロック(および一部のコメントプラットフォームで許可される大胆で刺激的なタイポグラフィ効果)の使用は、モデレーターからの介入を引き起こしています。これらは、書き言葉の意図を明確にするための単調で広範な方法です。

同時に、絵文字や絵文字の普及は、テキストと視覚的な感情伝達手段のハイブリッドとして、自然言語処理(NLP)研究分野を活発化させてきました。さらに、アニメーションGIFの意味についても興味が高まっています。

書き言葉は、感情を代理するか、話し言葉のトーン情報が欠如する状況で感情を呼び起こすために、革新的な方法を発展させてきました。

通常、書き言葉から感情を推測する必要があります。例えば、感嘆「Oh, Oh, Oh!」を考えてみましょう。これは、レディ・マクベスの狂気の夜の独白の最後の部分であり、イントネーションが意味に与える影響の範囲を示すことができます。

ほとんどの演出では、この痛みに満ちた嘆きは2〜6秒間続きますが、トレバー・ナンの1976年のロイヤル・シェイクスピア・カンパニーの『マクベス』公演では、ジュディ・デンチがこの行を24.45秒間にわたって演じました。

(YouTubeの自動キャプションシステムでは、このクリップのデンチの叫びを[MUSIC]と表記しています)

Prosodyをタイポグラフィーに翻訳する

ブラジルからの最近の論文では、Prosodyや他のパラリンガル成分を、キャプション付きスピーチに直接組み込むことができる、スピーチモジュレートタイポグラフィーのシステムを提案しています。キャプション付き字幕付け規約で使用される「[叫んでいる]」などの形容詞を付加するという「平坦な」トリックでは、感情をあまり捉えられないことがあります。

「私たちは、音響特性からテキストの視覚的な外見を変化させる、スピーチモジュレートタイポグラフィーの新しいモデルを提案します。これにより、特定の発話の書き起こしが、単に言及された単語を表すだけでなく、どのように言及されたかも表すことができます。」

「これにより、Prosodyの特徴である大きさ、ピッチ、継続時間を視覚的に代理することができるタイポグラフィーパラメータを発見することを目指しています。」

Prosodyをタイポグラフィーに翻訳するワークフロー。最も汎用性の高いシステムを生み出すことを目指して、著者らはベースラインシフト、カーニング、ボールドネスに限定しています。後者は、オープンタイプフォントの汎用性によって提供されます。ソース: https://arxiv.org/pdf/2202.10631.pdf

Prosodyをタイポグラフィーに翻訳するワークフロー。最も汎用性の高いシステムを生み出すことを目指して、著者らはベースラインシフト、カーニング、ボールドネスに限定しています。後者は、オープンタイプフォントの汎用性によって提供されます。ソース: https://arxiv.org/pdf/2202.10631.pdf

論文は、「隠された叫び、ささやき、ヤップ:テキストを単なる単語以上のものにすることができるか」というタイトルで、ブラジルのUniversidade Estadual de Campinasの研究者、Calua de Lacerda PatacaとPaula Dornhofer Paro Costaによって書かれています。

太字の言葉

このプロジェクトのより広範な目的は、キャプションにProsodyや他のパラメトリック言語特性を伝えるシステムを開発することですが、著者らはこのようなシステムが、聴覚障害者のみならず、健聴者にも広く受け入れられる可能性があると考えています。

この分野には、1983年のプロジェクトのような以前の取り組みがあり、キャプションシステムに「特殊効果、色、太字」を含めることが提案されていました。

一方、ブラジルのプロジェクトは、自動トランスクリプションと新しい感情認識の進歩を活用でき、音声サウンドトラックのコンポーネントをインポートして特性付けることができるワークフローを実現しています。

Prosody特性を抽出して処理した後、それらはスピーチの単語のタイムスタンプにマッピングされ、ルールベースのキャプションタイポグラフィー変調を適用するためのトークンが生成されます。

これにより、特定のシラブルが引き伸ばされたり、ささやかれたり、強調されたり、またはコンテキスト情報が失われる生のトランスクリプションでは失われるコンテキスト情報を視覚的に表現することができます。

プロジェクトのテスト段階から。シラブルの境界が定義されていることに注意してください。ここでは、1つずつ適用された3つの変調(大きさ/重さ、カーニング/継続時間、ピッチ/ベースラインシフト)が表されています。

プロジェクトのテスト段階から。シラブルの境界が定義されていることに注意してください。ここでは、1つずつ適用された3つの変調(大きさ/重さ、カーニング/継続時間、ピッチ/ベースラインシフト)が表されています。

著者らは、感情認識と感情認識の研究に直接貢献することを目的とせず、むしろスピーチの特性を分類して、シンプルで限定された新しい視覚的規約のセットで表現することを目指しています。

少なくとも、このシステムが提供する追加の強調は、視聴者が音を聞くことができない状況(障害や再生環境のため)で、行動の対象が明確でない文を明確にします。

私自身の2017年の例を借りてみましょう。機械学習システムが困難に直面する方法を調べてみましょう。文で主語と動詞がどこにあるかを理解することの重要性がわかります。

私はそれを盗みませんでした。(誰か別の人がそれを盗みました)
私は盗みませんでした。(私は自分が盗んだという非難を否定します)
私は盗みませんでしたそれ。(私はそれを所有しています。盗みは適用されません)
私はそれを盗みませんでしたそれ。(しかし、別のものを盗みました)

ブラジル人の著者が提案するProsodyからタイポグラフィーへのメカニストワークフローは、感情計算研究のデータセット開発における補助ツールとしても役立つ可能性があります。なぜなら、事前に推論されたパラリンガル次元を含む、純粋なテキストベースのデータを処理できるからです。

さらに、研究者らは、Prosodyを認識したテキストの追加の言語情報が、顧客満足度評価やテキストコンテンツからのうつ病の推論など、NLPベースのタスクで役立つ可能性があると指摘しています。

エラスティックタイポグラフィー

研究者が開発したフレームワークでは、ベースラインシフト(文字がベースラインより上または下にある)、カーニング(単語内の文字間のスペース)、フォントの重さ(ボールドネス)が変化します。

これらの3つのスタイリングは、プロジェクトが制限したスピーチの抽出特性にマップされます。具体的には、ピッチ継続時間大きさです。

文のスタイリングの進行。#1では、抽出プロセスで定義されたシラブルの境界が見られます。#2では、magnitude|weight、kerning|duration、pitch|baseline shiftの3つの変調がそれぞれ適用されています。#3では、117人の参加者に提示された最終出力の組み合わせたタイポグラフィー変調が見られます。

文のスタイリングの進行。#1では、抽出プロセスで定義されたシラブルの境界が見られます。#2では、magnitude|weight、kerning|duration、pitch|baseline shiftの3つの変調がそれぞれ適用されています。#3では、117人の参加者に提示された最終出力の組み合わせたタイポグラフィー変調が見られます。

単一のフォントファミリーで、太字やイタリックなどのバリエーションを別々のフォントファイルで提供する必要がある場合、研究者らは、Googleの実装であるオープンタイプフォント「Inter」を使用しました。このフォントは、単一のフォントファイルに細かい重さの範囲を統合しています。

論文からの図。Interフォントのオープンタイプグリフが、最小ベーススプラインのスケルトンに沿って、幅広いボールドな強調を表現する範囲を示しています。

論文からの図。Interフォントのオープンタイプグリフが、最小ベーススプラインのスケルトンに沿って、幅広いボールドな強調を表現する範囲を示しています。

テスト

カーニングとベースラインシフトの表現は、ブラウザプラグインに組み込まれて、117人の健聴者を対象としたテストが実施されました。

テスト用のデータセットは、プロジェクト専用に作成され、俳優がさまざまな強調で詩を何度も朗読しました。詩は、自然に聞こえる範囲を超えない強調の幅があるため、選択されました。

参加者は2つのグループに分けられました。最初のグループは、15ラウンドの俳優による詩の朗読に同期して、アニメーション化されたモデュレートテキストが提示されました。

2番目のグループは、同じタスクセットを受け取りましたが、テキストは静的なイメージで提示され、オーディオクリップの再生中は変化しません。

正解率の平均は、静的なイメージグループで67%、アニメーションテキストグループで63%でした。参加者のコメントは、研究者が動的な解釈の認知負荷が低いスコアに寄与したと示唆しています。しかし、キャプションやメッセージシステムでは、通常、デフォルトで完了したテキストが提供されます。

参加者のコメントはまた、継続時間を示すためにカーニングを使用することの限界があることを示唆しています。1人のコメント者は、文字があまりにも離れていると、単語を識別するのが難しくなることを指摘しています。

研究者らはさらに次のように述べています:

「一部の参加者は、モデルがより繊細で複雑なスピーチの表現を体現できるべきだと感じていました。より多様で表現力のある視覚的な語彙でそれを行うことは、簡単なタスクではありません。しかし、スピーチモジュレートタイポグラフィーのさまざまな応用が、発展するにつれてどのように分岐するかを想像することは、励みになります。」

 

 

最初に公開されたのは2022年2月24日です。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:[email protected]