มุมมองของ Anderson

การระบุเนื้อหาที่ได้รับการสนับสนุนในเว็บไซต์ข่าวด้วยเครื่องมือการเรียนรู้ของเครื่อง

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

นักวิจัยจากเนเธอร์แลนด์ได้พัฒนาเครื่องมือการเรียนรู้ของเครื่องแบบใหม่ที่สามารถแยกเนื้อหาที่ได้รับการสนับสนุนหรือจ่ายเงินภายในแพลตฟอร์มข่าวได้ โดยมีความแม่นยำมากกว่า 90% ในการตอบสนองต่อความสนใจที่เพิ่มขึ้นของผู้ลงโฆษณาในรูปแบบโฆษณา “เนทีฟ” ที่ยากต่อการแยกแยะจากผลลัพธ์ของการรายงานข่าวจริง

บทความใหม่ บทความ ที่มีชื่อว่า การแยกเนื้อหาเชิงพาณิชย์จากเนื้อหาเชิงบรรณาธิการในข่าว มาจากนักวิจัยที่มหาวิทยาลัยไลเดน

Commercial (red) and editorial (blue) sub-graphs emerging from analysis of the data. Source: https://arxiv.org/pdf/2111.03916.pdf

Commercial (red) and editorial (blue) sub-graphs emerging from analysis of the data. Source: https://arxiv.org/pdf/2111.03916.pdf

ผู้เขียนสังเกตว่าแม้ว่าสำนักข่าวที่มีชื่อเสียงมากขึ้นซึ่งสามารถกำหนดเงื่อนไขให้กับผู้ลงโฆษณาได้จะพยายามแยก “เนื้อหาพันธมิตร” จากเนื้อหาข่าวและวิเคราะห์ทั่วไป แต่มาตรฐานกำลังเปลี่ยนแปลงอย่างช้าๆ แต่แน่นอนไปสู่การผสมผสานระหว่างทีมบรรณาธิการและเชิงพาณิชย์บนแพลตฟอร์ม ซึ่งพวกเขาถือว่าเป็นแนวโน้มที่น่ากลัวและเป็นลบ

‘ความสามารถในการพรางเนื้อหา โดยสมัครใจหรือไม่สมัครใจ และความน่าจะเป็นที่โฆษณาไม่ได้รับการยอมรับว่าเป็นโฆษณาแม้ว่าจะมีการระบุไว้อย่างถูกต้องก็ตามเป็นเรื่องที่สำคัญ นักการตลาดเรียกมันว่าโฆษณา “เนทีฟ” โดยเหตุผล’

Some current examples of native advertising, variously called 'partner content', 'brand content', and many other appellations designed to subtly obscure the distinction between native and commercially-placed content in journalistic platforms.

Some current examples of native advertising, variously called ‘partner content’, ‘brand content’, and many other appellations designed to subtly obscure the distinction between native and commercially-placed content in journalistic platforms.

งานนี้ได้รับการดำเนินการเป็นส่วนหนึ่งของการวิจัยที่กว้างขึ้นเกี่ยวกับวัฒนธรรมข่าวที่เชื่อมโยงเครือข่ายที่ช่อง ACED Reverb ซึ่งตั้งอยู่ที่อัมสเตอร์ดัม ซึ่งมุ่งเน้นไปที่การวิเคราะห์ข้อมูลข่าวที่เปลี่ยนแปลงไป

การรวบรวมข้อมูล

เพื่อพัฒนาแหล่งข้อมูลสำหรับโครงการ ผู้เขียนใช้บทความ 1,000 เรื่องและโฆษณา 1,000 รายการจากสำนักข่าวดัตช์ 4 แห่ง และจัดประเภทตามคุณลักษณะข้อความ เนื่องจากขนาดของชุดข้อมูลค่อนข้างเล็ก ผู้เขียนจึงหลีกเลี่ยงแนวทางขนาดใหญ่ เช่น BERT และประเมินประสิทธิผลของเฟรมเวิร์กการเรียนรู้ของเครื่องแบบคลาสสิก รวมถึง Support Vector Machine (SVM), LinearSVC, Decision Tree, Random Forest, K-Nearest Neighbor (K-NN), Stochastic Gradient Descent (SGD) และ Naïve Bayes

ช่อง Reverb สามารถจัดหาบทความ “ตรง” 1,000 เรื่องได้ แต่ผู้เขียนต้องขุดคุ้ยโฆษณาโดยตรงจากเว็บไซต์ดัตช์ 4 แห่งที่มี ข้อมูลที่ได้รับสามารถเข้าถึงได้ในรูปแบบจำกัด (เนื่องจากข้อกังวลด้านลิขสิทธิ์) ที่ GitHub พร้อมกับโค้ด Python บางส่วนที่ใช้ในการรับและประเมินข้อมูล

สื่อที่ศึกษา ได้แก่ Nu.nl ที่มีแนวคิดอนุรักษ์นิยม Telegraaf ที่มีแนวคิดก้าวหน้า NRC และนิตยสารธุรกิจ De Ondernemer แต่ละสื่อมีการแสดงอย่างเท่าเทียมกันในข้อมูล

จำเป็นต้องระบุและยกเว้น “leakers” ที่เป็นไปได้ในพจนานุกรมที่เกิดจากงานวิจัย – คำที่อาจปรากฏในเนื้อหาทั้งสองประเภทพร้อมกับความถี่และการใช้งานที่แตกต่างกันเล็กน้อย เพื่อกำหนดรูปแบบที่ชัดเจนสำหรับเนื้อหาที่ได้รับการสนับสนุนและไม่ได้รับการสนับสนุนอย่างแท้จริง

ผลลัพธ์

ข้ามวิธีการทดสอบที่ใช้ในการระบุผลลัพธ์ที่ดีที่สุดได้รับจาก SVM, linearSVC, Random Forest และ SGD ดังนั้นผู้วิจัยจึงใช้ SVM ในการวิเคราะห์เพิ่มเติม

แนวทางแบบจำลองที่ดีที่สุดสำหรับการดึงข้อมูลการจำแนกประเภทข้ามคอร์ปัสเกินความแม่นยำ 90% แม้ว่าผู้วิจัยจะสังเกตว่าการได้รับการจำแนกประเภทที่ชัดเจนจะยากขึ้นเมื่อจัดการกับสื่อที่มุ่งเน้น B2B ซึ่งการซ้อนทับทางเล็กซิ콘ระหว่างเนื้อหาที่ “แท้จริง” และ “ได้รับการสนับสนุน” มากเกินไป – อาจเป็นเพราะว่าภาษาธุรกิจที่เป็นเนทีฟมีลักษณะ主觀มากกว่าแนวปฏิบัติในการรายงานและวิเคราะห์ทั่วไป และสามารถซ่อนวาระได้ง่ายขึ้น

t-Distributed Stochastic Neighbor Embedding (t-SNE) plots for separation of real and sponsored content across the four publications.

t-Distributed Stochastic Neighbor Embedding (t-SNE) plots for separation of real and sponsored content across the four publications.

เนื้อหาที่ได้รับการสนับสนุนคือ ‘ข่าวปลอม’ หรือไม่?

การวิจัยของผู้เขียนชี้ให้เห็นว่าโครงการของพวกเขานั้นเป็นเรื่องใหม่ในด้านการวิเคราะห์เนื้อหาข่าว แฟรมเวิร์กที่สามารถระบุเนื้อหาที่ได้รับการสนับสนุนได้สามารถเปิดทางสู่การตรวจสอบการเปลี่ยนแปลงของความสมดุลระหว่างการรายงานข่าวที่เป็นกลางและโฆษณา “เนทีฟ” ที่เติบโตขึ้นซึ่งวางอยู่ในบริบทเดียวกันกับเนื้อหาทั่วไปในหลายสื่อ โดยใช้สัญญาณภาพ (CSS stylesheets และการกำหนดรูปแบบอื่นๆ) เหมือนกับเนื้อหาทั่วไป

ใน某种意义แล้ว การขาดบริบทที่ชัดเจนสำหรับเนื้อหาที่ได้รับการสนับสนุนกำลังเกิดขึ้นเป็นสาขาย่อยของการศึกษาข่าวปลอม แม้ว่าผู้จัดพิมพ์ส่วนใหญ่ยอมรับถึงความจำเป็นในการแยก “คริสตจักรและรัฐ” และให้ผู้อ่านมีเครื่องหมายที่ชัดเจนระหว่างเนื้อหาที่จ่ายเงินและเนื้อหาที่สร้างขึ้นเอง แต่ความเป็นจริงของสถานการณ์หลังการพิมพ์และการขึ้นอยู่กับผู้ลงโฆษณาที่เพิ่มขึ้นได้เปลี่ยนการลดความสำคัญของสัญญาณที่ได้รับการสนับสนุนให้เป็นศิลปะในจิตวิทยาของ UI บางครั้งผลตอบแทนจากการวิ่งเนื้อหาที่ได้รับการสนับสนุนมีมากพอที่จะเสี่ยงต่อ อุบัติเหตุทางด้านภาพลักษณ์ที่สำคัญ

ในปี 2015 แพลตฟอร์มโซเชียลมีเดียและจัดอันดับการbenchmarking Quintly ได้เสนอ วิธีการตรวจจับ ที่ใช้ AI เพื่อกำหนดว่าโพสต์บน Facebook ได้รับการสนับสนุนหรือไม่ โดยอ้างว่ามีอัตราความแม่นยำ 96% ในปีต่อมา การศึกษา จากมหาวิทยาลัยจอร์เจียโต้แย้งว่าวิธีที่ผู้จัดพิมพ์จัดการการประกาศเนื้อหาที่ได้รับการสนับสนุนอาจ ‘สมรู้ร่วมคิดกับการหลอกลวง’

ในปี 2017 MediaShift ซึ่งเป็นองค์กรที่ตรวจสอบจุดตัดกันระหว่างสื่อและเทคโนโลยี สังเกตเห็น ถึงระดับที่เพิ่มขึ้นของ The New York Times ที่สร้างรายได้จากการดำเนินงานผ่านสตูดิโอเนื้อหาที่ได้รับการสนับสนุน T Brand Studio โดยอ้างว่ามีการลดความโปร่งใสรอบเนื้อหาที่ได้รับการสนับสนุน โดยมีผลลัพธ์ที่ไม่ได้ตั้งใจที่ผู้อ่านไม่สามารถบอกได้ง่ายว่าเนื้อหานั้นสร้างขึ้นเองหรือไม่

ในปี 2020 โครงการวิจัยอีกโครงการหนึ่งจากเนเธอร์แลนด์ได้พัฒนาเครื่องมือการเรียนรู้ของเครื่องแบบอัตโนมัติเพื่อ ระบุ ข่าวของรัฐรัสเซียที่ปรากฏในแพลตฟอร์มข่าวเซอร์เบีย นอกจากนี้ยัง ประมาณการ ในปี 2019 ว่า “วิธีแก้ปัญหาข้อมูลสื่อ” ของ Forbes คิดเป็น 40% ของรายได้รวมผ่าน BrandVoice สตูดิโอเนื้อหาที่ผู้จัดพิมพ์เปิดตัวในปี 2010

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai