AIモデルとプラットフォーム
ヘイトスピーチ検出アルゴリズムの改善を目指した新しい研究
ソーシャルメディア企業、特にツイッターは、スピーチをフラグ付けし、どのアカウントを禁止するかを決定する方法について長年にわたって批判されてきました。根本的な問題はほぼ常に、オンライン投稿を監視するために使用するアルゴリズムに関係しています。人工知能システムは、このタスクにおいて完璧ではありませんが、改善するための作業が不断に行われています。
その作業の中には、新しい研究が含まれており、南カリフォルニア大学から発表され、人種的偏見につながる可能性のある特定のエラーを減らすことを目指しています。
コンテキストを認識できないこと
注目されていない問題の1つは、憎悪スピーチを広めるのではなく、実際には人種的偏見を増幅させるアルゴリズムです。これは、アルゴリズムがコンテキストを認識できず、少数派グループからのツイートをフラグ付けまたはブロックしてしまうためです。
コンテキストに関してアルゴリズムの最大の問題は、特定のグループ識別子である「黒人」、「ゲイ」、「トランスジェンダー」などの用語に対して過敏であることです。アルゴリズムはこれらの用語を憎悪スピーチの分類子と見なしますが、実際にはこれらのグループのメンバーによって使用されることが多く、状況は重要です。
このコンテキスト盲点の問題を解決するために、研究者はよりコンテキストに敏感な憎悪スピーチ分類器を作成しました。新しいアルゴリズムは、投稿を憎悪スピーチとして誤ってラベル付けする可能性が低くなっています。
アルゴリズム
研究者は、2つの新しい要素を考慮して新しいアルゴリズムを開発しました。1つは、グループ識別子に関してコンテキスト、もう1つは、投稿に憎悪スピーチの他の特徴、たとえば非人間化された言語が存在するかどうかです。
ブレンダン・ケネディは、コンピューターサイエンスの博士課程の学生であり、研究の共同著者であり、研究は2020年7月6日にACL 2020で発表されました。
「私たちは、憎悪スピーチ検出を現実世界での応用に近づけることを望んでいます」とケネディは述べました。
「憎悪スピーチ検出モデルは、ソーシャルメディアやその他のオンラインテキストデータなどの現実世界のデータに導入されると、しばしば『壊れる』、または悪い予測を生成します。これは、モデルが訓練データによって社会的識別子が憎悪スピーチと関連付けられるように偏っているためです。」
アルゴリズムが不正確である理由は、憎悪スピーチの割合が非常に高い不均衡なデータセットで訓練されているためです。そのため、アルゴリズムは、実際のソーシャルメディアの外見を学習することができません。
レンネン教授は、自然言語処理の専門家です。
「モデルは識別子を無視しないことが重要ですが、コンテキストと一致させる必要があります」とレンネンは述べました。
「不均衡なデータセットからモデルを訓練すると、モデルは奇妙なパターンを学習し、ユーザーを不適切にブロックします。」
アルゴリズムをテストするために、研究者は、憎悪スピーチの発生率が高い2つのソーシャルメディアサイトからのテキストのランダムなサンプルを使用しました。テキストは、人間によって偏見的または非人間化されたものとしてフラグ付けされました。最新のモデルは、研究者のモデルと比較して、不適切に憎悪スピーチではないものをフラグ付けする能力をテストしました。ニューヨークタイムズの12,500の記事に憎悪スピーチがないことを使用して、最新のモデルは憎悪スピーチと非憎悪スピーチを識別するための77%の精度を達成しましたが、研究者のモデルは90%の精度を達成しました。
「この研究は単独で憎悪スピーチ検出を完全には改善しませんが、段階的な進歩を遂げています」とケネディは述べました。
「保護されたグループのメンバーによるソーシャルメディア投稿が不適切に検閲されないようにすることに加えて、私たちの研究が憎悪スピーチ検出によって不必要な損害を与えずに、社会的グループとの偏見や非人間化の関連付けを強化しないことを保証するのに役立つことを希望しています。」












