Andersonの視点
記事を読みながら自動で書き直すマシンラーニングシステム

カナダの新しい研究では、Tinderスタイルの「スワイプ」または記事内のさまざまな種類のコンテンツとの読者の相互作用の受動的な観察に基づいて、記事を自動的に書き直す方法を提案しています。
このシステムは、Hone As You Read (HARE) と呼ばれ、カナダのオンタリオ州にあるウェスタン大学の 論文 に記載されています。対応する Python コードは GitHub にあります。
このプロジェクトの中心的な考え方は、記事にはさまざまな種類のコンテンツが含まれており、見出しから詳細まで進化する (この記事と同様) ということです。記事の後半部分には、さまざまな種類のサポート資料、ユースケース、またはニュースの影響に関する仮説や推測が含まれている場合があります。
HARE では、読者がそのような資料を気に入らない場合、段落ごとにそれを投票で除外することができ、システムは読者の好みを学習し、読者がスクロールダウンするときに、投票で除外された資料と同様のコンテンツがすでに除外または書き直されていることを保証します。読者がシステムをトレーニングするために積極的に参加しない場合、HARE は読者の受動的なドキュメントとの相互作用を観察することで読者の選択を推測できます。
不快な文章のTinderスタイル投票
以下の画像では、ユーザーの明示的または暗示的な動作に基づく HARE の 3 つの可能な推定カテゴリ化タイプを示しています。最初のケース (左) では、ユーザーは Tinder スタイルの投票ジェスチャーで段落または文章のコンテンツ、スタイル、複雑さ、またはトーンに賛成または反対の意見を表します。
2 番目のケース (中央) では、システムはスクロールの一時停止の位置と期間を使用してユーザーの関心度を測定します。
3 番目のケース (右) では、HARE はスマートフォンのカメラを使用して、表示されているドキュメントの段落全体にわたるビューアーの視線の経路と一時停止時間を推定します。
研究者は、段落ごとの滞在時間の増加はユーザーの関心度の増加を示す可能性があると主張していますが、論理的には、ビューアーが複雑または悪く書かれたテキストを吸収しようとしている場合、それが当てはまらない可能性があります。

ユーザーのフィードバックは、まだ見えていない記事の部分を編集、書き直し、または完全に削除することになります。
ユーザーの好みに基づくコンテンツの事前処理
この論文では、HARE のユーザー体験について、記事ごとに説明していますが、明らかに、ユーザーのドキュメントとの過去の相互作用は、将来の読み込み体験のカスタマイズを可能にし、テンプレート化されたユーザーの好みを新しい記事に適用することで、ユーザーの関与の必要性を減らすことができます。
HARE は要約アルゴリズムとして特徴付けられ、まだ表示されていないコンテンツを、ユーザーが到達する前にスタイルまたは簡潔さで書き直すことができますが、論文では、ユーザーのフィードバックに基づいてコンテンツを事前に削除することもできることも明記しています。
テスト目的で、システムはイギリスの デイリー メール 新聞の 11,222 の記事からなる コーパス を使用し、Telegram チャット アプリでのテスト デプロイを介して評価されました。10 段落未満の記事は、試行のために破棄されました。

テスト段階での Telegram HARE アプリ
研究者の方法論では、K-Means クラスタリング を SBERT 文書の埋め込みに適用し、初期のランダムな重みを概念に割り当てます。
幅広いアルゴリズムとアプローチの中で、HARE には 3 つの比較モデルがあります。最初のモデル (ORACLEGREEDY) には、事前のユーザーの好みにアクセスする機能があり、アルゴリズムが読み込み時に記事を事前に処理できることを示しています。
他のモデル、ORACLESORTED と ORACLEUNIFORM は、関心度または記事全体でランダムに文章を選択します。
コンテンツの削除と書き直し
驚くことに、ORACLEUNIFORM はコントロール セットを上回りましたが、事前のユーザーの関心にはアクセスできません。研究者は、これは、ORACLEUNIFORM が記事全体を 1 つのスイープで処理し、「最も興味深い文章のみ」を選択するためであると主張しています。研究者は、これにより、最も重要な概念のみを扱う文章にコンテンツが制限される可能性があり、概念の影響や評価を扱う他のテキストが削除される可能性があると述べています。
HARE で使用される抽出要約器は、LexRank、SumBasic、および TextRank です。
HARE は 13 人のボランティアを対象に 70 回の試行とさまざまなアルゴリズム アプローチでテストされ、さまざまなモデルで 1.3 ミリ秒から 100 ミリ秒の間で要約 (書き直された/除去されたテキスト) を更新できました。結果は、最も多くのテキストを除去するモデルはうまく機能しなかったことを示しており、これは残りのテキストの連続性に影響を及ぼす可能性があるためです。
ダイナミック記事書き直しの倫理的影響
研究者は、このような技術に関する倫理的な懸念を認めています。
‘HARE タスクは、将来のユーザー向けアプリケーションの設計のために意図されています。設計上、これらのアプリケーションは、ユーザーが特定の記事から読むことができるコンテンツを制御する機能を備えています。十分な注意が払われていない場合、これらのツールは、自動化されたニュース フィード、検索結果、およびオンライン コミュニティによって既に生成される「エコーチェンバー」効果を悪化させる可能性があります。’
しかし、彼らは、このようなシステムは、記事に初期に存在しなかった代替的な視点を提示するテキストを注入することで、エコーチェンバー効果を緩和するために将来のアプリケーションで使用できることも述べています。彼らは、次のように述べています。 ‘この要因の重み付けは、魅力的で多様なアイデアへの露出を提供する読み込み体験を提供するように調整できます。’
このようなシステムから利益を得る可能性のある読者は、情報を効率的に取得したい読者とコンテンツ パブリッシャーであると研究者は述べています。
その記事では、読者は、記事を読みながら自動的に書き直すマシンラーニング システムについて説明しています。システムは、Tinder スタイルの投票や受動的な観察に基づいて、読者の好みに基づいて記事を書き直すことができます。このシステムは、読者が記事を読みながら、不快な文章を投票で除外できるように設計されており、システムは読者の好みを学習し、読者がスクロールダウンするときに、投票で除外された文章と同様のコンテンツがすでに除外または書き直されていることを保証します。













