Andersonの視点
ニュースサイトにおけるスポンサー付きコンテンツの機械学習による識別

オランダの研究者は、機械学習方法を開発し、ニュースプラットフォーム内のスポンサー付きコンテンツまたはその他の有料コンテンツを、90%以上の精度で識別できるようにしました。これは、広告主が「ネイティブ」広告形式に興味を持ち始めたため、広告主が「ネイティブ」広告形式に興味を持ち始めたためです。
新しい論文は、レーヴェン大学の研究者によって書かれました。

商業(赤)と編集(青)のサブグラフは、データの分析から生じます。ソース:https://arxiv.org/pdf/2111.03916.pdf
著者は、より真剣な出版物は、広告主に条件を課すことができ、パートナー コンテンツと一般的なニュースや分析を区別するための合理的な努力をするだろうと観察しています。しかし、標準は、出版物の編集と商業チームの統合の増加に向かって、ゆっくりですが確実に変化しています。
‘コンテンツを意図的にまたは無意識に偽装する能力と、広告が適切にラベル付けされていても認識されない可能性は大きい。マーケターはそれを「ネイティブ」広告と呼ぶ理由がある.’

パートナー コンテンツ、ブランド コンテンツなど、さまざまな名称で呼ばれるネイティブ広告の現在の例
この研究は、アムステルダムにある ACED Reverb Channel で行われた、ネットワーク化されたニュース文化に関するより広範な調査の一環として実施されました。
データの取得
プロジェクトのソース データを開発するために、著者は 4 つのオランダのニュース アウトレットから 1,000 の記事と 1,000 の広告を使用し、テキストの特徴に基づいてそれらを分類しました。データセットのサイズが比較的小さかったため、著者は BERT などの大規模なアプローチを避け、代わりに Support Vector Machine (SVM)、LinearSVC、Decision Tree、Random Forest、K-Nearest Neighbor (K-NN)、Stochastic Gradient Descent (SGD)、Naïve Bayes などのより古典的な機械学習フレームワークの有効性を評価しました。
Reverb チャンネルのコーパスは、1,000 の「まっすぐな」記事を提供することができましたが、著者は 4 つのオランダの Web サイトから直接広告をスクラップする必要がありました。取得したデータは、GitHub で限定形式 (著作権に関する懸念により) で利用可能です。そこでは、データを取得して評価するために使用された Python コードの一部も利用可能です。
調査対象となった 4 つの出版物は、保守的な Nu.nl、より進歩的な Telegraaf、NRC、およびビジネス ジャーナル De Ondernemer でした。各出版物はデータで同等に表されました。
結果
テストされた識別方法の中で、SVM、linearSVC、Random Forest、SGD が最も優れた結果を示しました。したがって、研究者はさらに分析するために SVM を使用しました。

コーパス全体で分類を抽出するための最善のモデル アプローチは、90% を超える精度を達成しました。ただし、研究者は、B2B 向けの出版物を扱う場合、レキシカル オーバーラップが過剰であるため、明確な分類を取得することが困難になる可能性があると指摘しています。つまり、ビジネス言語のネイティブ スタイルは、一般的なレポートと分析の規範よりも主観的であり、より簡単にアジェンダを隠すことができる可能性があるためです。

4 つの出版物全体で、実際のコンテンツとスポンサー コンテンツを分離するための t-分布スタッフ ネスト ネイバー エンベッディング (t-SNE) プロット
スポンサー コンテンツは「フェイク ニュース」?
著者の研究は、ニュース コンテンツ分析の分野における新しい取り組みであることを示唆しています。スポンサー コンテンツを識別できるフレームワークは、客観的なジャーナリズムと「ネイティブ広告」の増加するトレンドのバランスを年間で監視する道を切り開く可能性があります。
ある意味では、スポンサー コンテンツの明確なコンテキストが欠如していることは、「フェイク ニュース」の研究のサブ分野として浮かび上がってきています。ほとんどの出版社は、「教会と国家」を分離する必要性と、読者に有料コンテンツと有機的生成コンテンツの明確な区別を提供する必要性を認識しています。しかし、印刷後のジャーナリズムの現実と、広告主への依存の増加は、スポンサー コンテンツのインジケーターを低下させることを UI 心理学の美術に変えました。時には、スポンサー コンテンツを実行するメリットは、大きな光学的な災害を冒す価値があります。
2015 年、Quintly は、Facebook の投稿がスポンサー付きであるかどうかを判断するための AI ベースの検出方法を提供しました。精度率は 96% でした。翌年、ジョージア大学の研究は、出版社がスポンサー コンテンツの宣言を処理する方法は、「欺瞞」に加担している可能性があると主張しました。
2017 年、MediaShift は、ニューヨーク タイムズが T ブランド スタジオというブランド コンテンツ スタジオを通じて運営を金銭化していることを観察しました。スポンサー コンテンツの透明性が低下していることを主張しました。読者はコンテンツが有機的生成されたかどうかを簡単に判断できないためです。
2020 年、オランダの別の研究プロジェクトでは、マシン ラーニング クラスファイアを開発して、セルビアのニュース プラットフォームに表示されるロシア国営ニュースを自動的に識別しました。さらに、2019 年には、Forbes の「メディア コンテンツ ソリューション」が、2010 年に出版社が立ち上げたコンテンツ スタジオ BrandVoice を通じて、40% の総収益を占めていると推定されました。












