มุมมองของ Anderson

นอกเหนือจาก ‘โหมดผู้อ่าน’ ด้วย Machine Learning

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

นักวิจัยจากเกาหลีใต้ได้ใช้แมชชีนเลิร์นนิงพัฒนาแนวทางที่ดีขึ้นในการดึงเนื้อหาจริงจากเว็บเพจ โดยที่ ‘เฟอร์นิเจอร์’ ของเว็บเพจ เช่น สайдบาร์, ฟุตเตอร์ และเฮดเดอร์นำทาง รวมถึงบล็อกโฆษณา จะหายไปสำหรับผู้อ่าน

แม้ว่าฟังก์ชันการทำงานดังกล่าวจะถูกสร้างเข้าไปในเว็บเบราว์เซอร์ที่ได้รับความนิยมส่วนใหญ่ หรือสามารถเข้าถึงได้ง่ายผ่านส่วนขยายและปลั๊กอิน เทคโนโลยีเหล่านี้พึ่งพารูปแบบการเขียนที่มีความหมายซึ่งอาจไม่มีอยู่ในเว็บเพจ หรืออาจถูกบุกรุกโดยเจ้าของเว็บเพจโดยเจตนาเพื่อป้องกันไม่ให้ผู้อ่านซ่อน ‘ประสบการณ์เต็มรูปแบบ’ ของเว็บเพจ

หนึ่งในเว็บเพจของเราที่ 'ลดขนาด' ด้วยฟังก์ชัน Reader View ที่มีอยู่ใน Firefox

หนึ่งในเว็บเพจของเราที่ ‘ลดขนาด’ ด้วยฟังก์ชัน Reader View ที่มีอยู่ใน Firefox

แทน 들어, วิธีการใหม่นี้ใช้ระบบที่อาศัยกริดซึ่งวนซ้ำผ่านเว็บเพจ โดยประเมินว่าเนื้อหามีความเกี่ยวข้องกับเป้าหมายหลักของเว็บเพจมากน้อยเพียงใด

กระบวนการดึงเนื้อหาที่แบ่งเว็บเพจออกเป็นกริด (แถวบน) ก่อนประเมินความสัมพันธ์ของเซลล์ที่พบว่ามีความเกี่ยวข้อง (กลาง) และสุดท้ายรวมเซลล์ที่ได้รับการอนุมัติ (ล่าง)

กระบวนการดึงเนื้อหาที่แบ่งเว็บเพจออกเป็นกริด (แถวบน) ก่อนประเมินความสัมพันธ์ของเซลล์ที่พบว่ามีความเกี่ยวข้อง (กลาง) และสุดท้ายรวมเซลล์ที่ได้รับการอนุมัติ (ล่าง) Source: https://arxiv.org/ftp/arxiv/papers/2110/2110.14164.pdf

เมื่อเซลล์ที่เกี่ยวข้องถูกกำหนดแล้ว ความสัมพันธ์ของเซลล์นั้นกับเซลล์ใกล้เคียงจะถูกประเมินก่อนที่จะรวมเข้ากับ ‘เนื้อหาสำคัญ’ ที่ตีความ

แนวคิดหลักของแนวทางนี้คือการละทิ้งการทำเครื่องหมายด้วยโค้ดเป็นดัชนีของความเกี่ยวข้อง (เช่น แท็ก HTML ที่ปกติจะแสดงถึงจุดเริ่มต้นของย่อหน้า) และอนุมานเนื้อหาตามลักษณะการแสดงภาพเพียงอย่างเดียว

แนวทางนี้ซึ่งเรียกว่า Grid-Center-Expand (GCE) ได้ถูกขยายโดยนักวิจัยไปสู่โมเดล Deep Neural Network (DNN) ที่ใช้ประโยชน์จาก TabNet ของ Google ซึ่งเป็นสถาปัตยกรรมการเรียนรู้แบบตารางที่สามารถตีความได้

ไปที่ประเด็นหลัก

เอกสาร มีชื่อเรื่องว่า ไม่ต้องอ่าน เพียงแค่มอง: การดึงเนื้อหาสำคัญจากเว็บเพจโดยใช้คุณลักษณะที่เห็นได้ชัด และมาจากนักวิจัยสามคนจากมหาวิทยาลัยฮันยัง และหนึ่งคนจากสถาบันเทคโนโลยีการผสมผสาน ทั้งหมดตั้งอยู่ในโซล

การดึงเนื้อหาสำคัญที่ดีขึ้นอาจมีคุณค่าไม่เพียงแต่สำหรับผู้ใช้ส่วนปลายเท่านั้น แต่ยังรวมถึงระบบเครื่องจักรที่ได้รับมอบหมายให้ดูดหรือดัชนีเนื้อหาด้านโดเมนเพื่อวัตถุประสงค์ของการประมวลผลภาษาธรรมชาติ (NLP) และสาขาอื่น ๆ ใน AI

ในขณะนี้ หากเนื้อหาที่ไม่เกี่ยวข้องถูกรวมเข้ากับการดึงเนื้อหาดังกล่าว อาจต้องได้รับการกรองหรือทำเครื่องหมายด้วยตนเอง (ซึ่งอาจมีค่าใช้จ่ายสูง) และหากเนื้อหาที่ไม่พึงประสงค์ถูกรวมเข้ากับเนื้อหาสำคัญ อาจส่งผลต่อวิธีการตีความเนื้อหาสำคัญ และผลลัพธ์ของระบบทรานส์ฟอร์เมอร์และระบบคอดเดอร์/ดีคอดเดอร์ที่พึ่งพาเนื้อหาที่สะอาด

นักวิจัยแย้งว่าวิธีการที่ดีขึ้นเป็นสิ่งจำเป็นอย่างยิ่ง เนื่องจากวิธีการที่มีอยู่มักล้มเหลวในเว็บเพจที่ไม่ใช่ภาษาอังกฤษ

เว็บเพจภาษาฝรั่งเศส ญี่ปุ่น และรัสเซียได้รับการบันทึกว่ามีอัตราความสำเร็จต่ำที่สุดสำหรับวิธีการ 'มุมมองผู้อ่าน' สี่วิธีที่พบบ่อยที่สุด: Readability.js ของ Mozilla; DOM Distiller ของ Google; Web2Text; และ Boilernet

เว็บเพจภาษาฝรั่งเศส ญี่ปุ่น และรัสเซียได้รับการบันทึกว่ามีอัตราความสำเร็จต่ำที่สุดสำหรับวิธีการ ‘มุมมองผู้อ่าน’ สี่วิธีที่พบบ่อยที่สุด: Readability.js ของ Mozilla; DOM Distiller ของ Google; Web2Text; และ Boilernet

ชุดข้อมูลและการฝึกอบรม

นักวิจัยได้รวบรวมข้อมูลชุดจากคำค้นภาษาอังกฤษใน GoogleTrends-2017 และ GoogleTrends-2020 แม้ว่าพวกเขาจะสังเกตเห็นว่าในแง่ของผลลัพธ์ ไม่มีความแตกต่างที่เป็นไปได้ระหว่างสองชุดข้อมูล

นอกจากนี้ ผู้เขียนได้รวบรวมคำค้นภาษาที่ไม่ใช่ภาษาอังกฤษจากเกาหลีใต้ ฝรั่งเศส ญี่ปุ่น รัสเซีย อินโดนีเซีย และซาอุดีอาระเบีย คำค้นภาษาจีนได้รับการเพิ่มจาก ชุดข้อมูล Baidu เนื่องจาก Google Trends ไม่สามารถให้ข้อมูลภาษาจีนได้

การทดสอบและผลลัพธ์

ในการทดสอบระบบ ผู้เขียนพบว่าระบบมีประสิทธิภาพเท่ากับโมเดล DNN ที่เพิ่งมา และให้การรองรับที่ดีกว่าสำหรับภาษาที่หลากหลาย

ตัวอย่างเช่น สถาปัตยกรรม Boilernet แม้ว่าจะรักษาความสามารถในการดึงเนื้อหาที่เกี่ยวข้อง แต่ก็ปรับตัวได้ไม่ดีกับชุดข้อมูลภาษาจีนและญี่ปุ่น ในขณะที่ Web2Text ผู้เขียนพบว่ามี ‘ประสิทธิภาพที่ค่อนข้างไม่ดี’ โดยรวม โดยมีลักษณะทางภาษาที่ไม่ใช่หลายภาษา และไม่เหมาะสมสำหรับการดึงเนื้อหาสำคัญจากเว็บเพจ

Mozilla’s Readbility.js ถูกพบว่ามีประสิทธิภาพที่ยอมรับได้บนหลายภาษา รวมถึงภาษาอังกฤษ ในฐานะวิธีการที่อาศัยกฎ แต่ผู้วิจัยพบว่าประสิทธิภาพลดลงอย่างเห็นได้ชัดบนชุดข้อมูลภาษาญี่ปุ่นและฝรั่งเศส ซึ่งเน้นถึงข้อจำกัดของการพยายามวิเคราะห์ลักษณะของภูมิภาคโดยอาศัยวิธีการที่อิงกฎ

ในขณะเดียวกัน Google’s DOM Distiller ซึ่งผสมผสานฮิวริสติกและการเรียนรู้ของเครื่องจักร ถูกพบว่ามีประสิทธิภาพที่ดีโดยรวม

8'] ตารางผลลัพธ์สำหรับวิธีการที่ทดสอบระหว่างโครงการ รวมถึงโมดูล GCE ของนักวิจัยเอง ค่าที่สูงกว่าคือค่าที่ดีกว่า

8′] ตารางผลลัพธ์สำหรับวิธีการที่ทดสอบระหว่างโครงการ รวมถึงโมดูล GCE ของนักวิจัยเอง ค่าที่สูงกว่าคือค่าที่ดีกว่า

นักวิจัยสรุปว่า ‘GCE ไม่ต้องตามทันสภาพแวดล้อมเว็บที่เปลี่ยนแปลงอย่างรวดเร็ว เนื่องจากพึ่งพาในธรรมชาติมนุษย์—คุณลักษณะที่แท้จริงทั่วโลกและหลายภาษา’

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai