Anderson의 관점
뉴스 사이트에서 머신 러닝으로 스폰서 콘텐츠 식별

네덜란드의 연구자들은 뉴스 플랫폼 내에서 스폰서 또는 유료 콘텐츠를 구별할 수 있는 새로운 머신 러닝 방법을 개발했으며, 이는 90% 이상의 정확도로 수행됩니다. 이는 광고주들이 뉴스 기사와 구별하기 어려운 네이티브 광고 형식을 선호하는 趨勢에 대응하여 개발되었습니다.
새로운 연구 논문은 라이덴 대학교의 연구자들에 의해 작성되었습니다. 이 논문은 뉴스 사이트에서 상업 콘텐츠와 편집 콘텐츠를 구별하는 방법에 관한 것입니다.

상업 콘텐츠(빨간색)와 편집 콘텐츠(파란색)의 서브 그래프
연구자들은 대부분의 출판물이 스폰서 콘텐츠를 구별하기 위해 노력하지만, 편집과 상업 팀之间의 구분이 점점 모호해지고 있음을 관찰했습니다. 이는 부정적인 趨勢로 간주됩니다.
‘콘텐츠를 위장할 수 있는 능력과 광고를 인식하지 못하는 확률은 상당합니다. 마케터들은 이를 네이티브 광고라고 부릅니다.’

현재 네이티브 광고의 예시
이 연구는 암스테르담에 있는 ACED Reverb Channel에서 수행되었습니다. 이 채널은 데이터 기반의 저널리즘 趨勢 분석에 중점을 둡니다.
데이터 수집
이 프로젝트를 위해, 연구자들은 네덜란드의 4개 뉴스 사이트에서 1,000개의 기사와 1,000개의 광고 콘텐츠를 수집했습니다. 데이터셋이 상대적으로 작기 때문에, 연구자들은 BERT와 같은 대규모 접근 방식을 피하고, 대신에 Support Vector Machine(SVM), LinearSVC, Decision Tree, Random Forest, K-Nearest Neighbor(K-NN), Stochastic Gradient Descent(SGD), Naïve Bayes와 같은 기존의 머신 러닝 프레임워크를 평가했습니다.
Reverb 채널 코퍼스는 1,000개의 일반 기사를 제공할 수 있지만, 연구자들은 네덜란드 웹사이트에서 직접 광고 콘텐츠를 수집해야 했습니다. 수집된 데이터는 GitHub에서 제한된 형식으로 제공됩니다.
연구에 사용된 출판물은 Nu.nl, Telegraaf, NRC, De Ondernemer였습니다. 각 출판물은 데이터에 동등하게 표현되었습니다.
결과
테스트된 방법 중에서, SVM, LinearSVC, Random Forest, SGD가 가장 좋은 결과를 보여주었습니다. 따라서 연구자들은 추가 분석에서 SVM을 사용했습니다.

최상의 모델 접근 방식은 90% 이상의 정확도로 구분을 수행했습니다. 그러나 연구자들은 B2B 지향 출판물에서 명확한 구분을 얻는 것이 더 어려울 수 있음을 관찰했습니다.

4개 출판물에서 실제와 스폰서 콘텐츠를 구별하는 t-SNE 플롯
스폰서 콘텐츠는 ‘가짜 뉴스’인가?
연구자들의 연구는 스폰서 콘텐츠를 식별할 수 있는 프레임워크를 개발하는 것이 뉴스 콘텐츠 분석 분야에서 새로운 접근 방식임을 시사합니다. 이러한 프레임워크는 객관적인 저널리즘과 네이티브 광고 간의 균형을 년간 모니터링하는 데 기여할 수 있습니다.
某种 의미에서, 스폰서 콘텐츠의 명확한 구분이 없는 현상은 ‘가짜 뉴스’ 연구의 하위 분야로 등장하고 있습니다. 대부분의 출판물은 스폰서 콘텐츠를 구별하기 위해 노력하지만, 광고주에 대한 의존도가 증가하고 있습니다.
2015년 Quintly는 페이스북에서 스폰서 콘텐츠를 식별하는 방법을 제공했습니다. 2016년 조지아 대학교의 연구는 스폰서 콘텐츠를 선언하는 방법이欺瞞에 동의하는 것일 수 있음을 시사했습니다.
2017년 MediaShift는 뉴욕 타임즈가 브랜드 콘텐츠 스튜디오를 통해 수익을 창출하는 방식을 관찰했습니다. 2020년 네덜란드의 또 다른 연구는 러시아 정부가 후원하는 뉴스를 세르비아 뉴스 플랫폼에서 자동으로 식별하는 방법을 개발했습니다. 또한 2019년 포브스의 콘텐츠 스튜디오가 총 수익의 40%를 차지하는 것으로 추정되었습니다.












