มุมมองของ Anderson
สิ่งที่ AI สามารถบอกเราเกี่ยวกับวาระลับในข่าว

โมเดลสไตล์ ChatGPT กำลังถูกฝึกให้ตรวจจับว่าอะไรในบทความข่าว จริงๆคิดอย่างไรเกี่ยวกับประเด็นหนึ่ง – แม้ว่าแนวคิดนั้นจะถูกฝังอยู่ใต้คำอ้างอิง การจัดกรอบ หรือ (บางครั้งก็ไม่ซื่อสัตย์) ‘ความเป็นกลาง’ ก็ตาม การแบ่งบทความเป็นส่วนต่างๆ เช่น พาดหัว, บทนำ, และคำอ้างอิง ทำให้ระบบใหม่เรียนรู้การจับจุดอคติแม้ในข่าวสารระดับมืออาชีพแบบยาว
ความสามารถในการเข้าใจมุมมองที่แท้จริงของผู้เขียนหรือผู้พูด – ซึ่งในวรรณกรรมเรียกว่า การตรวจจับแนวคิด – เป็นการแก้ปัญหาการตีความที่ยากที่สุดหนึ่งในภาษา: การสกัดเจตนาจากเนื้อหาที่อาจถูกออกแบบให้ซ่อนหรือบิดเบือน
ตั้งแต่ A Modest Proposal ของ Jonathan Swift ไปจนถึงการแสดงล่าสุดของนักการเมืองที่ ยืมการโต้แย้ง ของฝ่ายตรงข้ามทางอุดมการณ์ พื้นผิวของคำพูดจึงไม่ใช่ตัวบ่งชี้ที่เชื่อถือได้อีกต่อไป; การเพิ่มขึ้นของการเสียดสี การล้อเลียน การเผยแพร่ข้อมูลเท็จและ ความคลุมเครือเชิงกลยุทธ์ ทำให้ยากกว่าที่เคยในการระบุว่าข้อความนั้นอยู่ฝ่ายใด หรือ ว่าจะอยู่ฝ่ายใดเลยหรือไม่.
บ่อยครั้ง สิ่งที่ไม่ได้พูดออกมามีน้ำหนักเท่ากับสิ่งที่กล่าวไว้, และการเลือกที่จะครอบคลุมหัวข้อใดหัวข้อหนึ่งก็สามารถบ่งบอกตำแหน่งของผู้เขียนได้
สิ่งนี้ทำให้การตรวจจับแนวคิดอัตโนมัติมีความท้าทายเป็นพิเศษ, เนื่องจากระบบตรวจจับที่มีประสิทธิภาพต้องทำมากกว่าการติดป้ายประโยคแยกเป็น ‘สนับสนุน’ หรือ ‘คัดค้าน’: แทนที่จะเป็นเช่นนั้น ระบบต้องวนผ่านชั้นความหมายหลายชั้น, ประเมินสัญญาณเล็กๆ เทียบกับรูปแบบและการเปลี่ยนแปลงของบทความทั้งหมด; และสิ่งนี้ยิ่งยากในข่าวสารแบบยาว, ที่โทนอาจเปลี่ยนแปลงและความคิดเห็นอาจไม่ถูกกล่าวออกมาโดยตรงบ่อยนัก
ตัวแทนเพื่อการเปลี่ยนแปลง
เพื่อแก้ไขบางประเด็นเหล่านี้, นักวิจัยในเกาหลีใต้ได้พัฒนาระบบใหม่ชื่อ JOA-ICL (การเรียนรู้ในบริบทที่ขับเคลื่อนโดยการสื่อสารของนักข่าว) สำหรับการตรวจจับแนวคิดของบทความข่าวแบบยาว

แนวคิดหลักของ JoA-ICL คือการสรุปแนวคิดระดับบทความโดยการรวมการทำนายระดับส่วนที่สร้างโดยเอเจนต์โมเดลภาษาแยกต่างหาก. Source: https://arxiv.org/pdf/2507.11049
แทนที่จะประเมินบทความทั้งหมดเป็นหนึ่งเดียว, JOA-ICL จะแบ่งมันเป็นส่วนโครงสร้าง (พาดหัว, บทนำ, คำอ้างอิง, และสรุป) และมอบหมายโมเดลขนาดเล็กให้ทำการติดป้ายแต่ละส่วน การทำนายในระดับท้องถิ่นเหล่านี้จะถูกส่งต่อไปยังโมเดลขนาดใหญ่ซึ่งใช้ข้อมูลเหล่านั้นเพื่อกำหนดแนวคิดโดยรวมของบทความ
วิธีการนี้ถูกทดสอบบนชุดข้อมูลเกาหลีใหม่ที่รวบรวม 2,000 บทความข่าวพร้อมการทำเครื่องหมายทั้งระดับบทความและระดับส่วน แต่ละบทความได้รับการติดป้ายโดยผู้เชี่ยวชาญด้านการสื่อสารข่าว, สะท้อนการกระจายแนวคิดตามโครงสร้างของการเขียนข่าวระดับมืออาชีพ
ตามที่กระดาษระบุ, JOA-ICL มีประสิทธิภาพเหนือฐานการทำ prompting และการฝึกแบบละเอียด, โดยแสดงความแข็งแกร่งเป็นพิเศษในการตรวจจับแนวคิดเชิงสนับสนุน (ซึ่งโมเดลที่มีขอบเขตคล้ายกันมักพลาด). วิธีการนี้ยังพิสูจน์ว่ามีประสิทธิภาพเมื่อนำไปใช้กับชุดข้อมูลเยอรมันภายใต้เงื่อนไขที่เทียบเท่า, แสดงให้เห็นว่าหลักการของมันอาจทนต่อรูปแบบภาษาต่างๆ
ผู้เขียนระบุว่า:
‘การทดลองแสดงให้เห็นว่า JOA-ICL มีประสิทธิภาพเหนือวิธีการตรวจจับแนวคิดที่มีอยู่, เน้นประโยชน์ของการให้เอเจนต์ระดับส่วนในการจับตำแหน่งโดยรวมของบทความข่าวแบบยาว.’
เอกสาร new paper มีชื่อว่า Journalism-Guided Agentic In-Context Learning for News Stance Detection และมาจากคณะต่างๆ ของมหาวิทยาลัย Soongsil ในกรุงโซล รวมถึงบัณฑิตวิทยาลัยยุทธศาสตร์อนาคตของ KAIST.
วิธีการ
ส่วนหนึ่งของความท้าทายของการตรวจจับแนวคิดที่เสริมด้วย AI คือเรื่องด้านโลจิสติกส์, และเกี่ยวข้องกับปริมาณสัญญาณที่ระบบการเรียนรู้ของเครื่องสามารถเก็บและรวบรวมได้ในครั้งเดียว, ณ สถานะศิลปะปัจจุบัน
บทความข่าวมักหลีกเลี่ยงการแสดงความเห็นโดยตรง, แทนที่จะใช้ โดยนัย หรือ ที่สันนิษฐาน ซึ่งสื่อผ่านการเลือกแหล่งอ้างอิง, วิธีการจัดกรอบเรื่องราว, และรายละเอียดที่ถูกละเว้น, รวมถึงปัจจัยอื่นๆ อีกมากมาย
แม้บทความจะมีตำแหน่งชัดเจน, สัญญาณมักกระจายทั่วทั้งข้อความ, โดยส่วนต่างๆ ชี้ไปในทิศทางที่แตกต่างกัน เนื่องจากโมเดลภาษา (LMs) ยังประสบปัญหา หน้าต่างบริบทที่จำกัด, สิ่งนี้ทำให้โมเดลยากต่อการประเมินแนวคิดในลักษณะที่ทำได้กับเนื้อหาสั้น (เช่นทวีต และสื่อสังคมรูปแบบสั้นอื่นๆ), ที่ความสัมพันธ์ระหว่างข้อความและเป้าหมายชัดเจนยิ่งขึ้น
ดังนั้นวิธีมาตรฐานมักไม่เพียงพอเมื่อใช้กับข่าวสารเต็มรูปแบบ; กรณีที่ความคลุมเครือเป็นลักษณะเด่นไม่ใช่ข้อบกพร่อง
กระดาษระบุว่า:
‘เพื่อแก้ไขความท้าทายเหล่านี้ เราเสนอวิธีการสร้างโมเดลแบบลำดับชั้นที่แรกจะสรุปแนวโน้มในระดับหน่วยการสนทนาขนาดเล็กกว่า (เช่น ย่อหน้าหรือส่วน) และต่อมาจะรวมการทำนายในระดับท้องถิ่นเหล่านี้เพื่อกำหนดแนวโน้มโดยรวมของบทความ.’
‘กรอบงานนี้ออกแบบมาเพื่อรักษาบริบทท้องถิ่นและจับสัญญาณแนวโน้มที่กระจายอยู่ในการประเมินว่าต่างส่วนของข่าวเรื่องหนึ่งมีส่วนสนับสนุนตำแหน่งโดยรวมต่อประเด็นอย่างไร.’
เพื่อจุดประสงค์นี้ ผู้เขียนได้รวบรวมชุดข้อมูลใหม่ชื่อ K-NEWS-STANCE ซึ่งดึงมาจากการครอบคลุมข่าวเกาหลีระหว่างมิถุนายน 2022 ถึงมิถุนายน 2024 บทความถูกระบุครั้งแรกผ่าน BigKinds ซึ่งเป็นบริการเมตาดาต้ารัฐบาลที่ดำเนินการโดยมูลนิธิสื่อมวลชนเกาหลี และข้อความเต็มถูกดึงโดยใช้ API ของ Naver News aggregator. ชุดข้อมูลสุดท้ายประกอบด้วย 2,000 บทความจาก 31 แหล่งข่าว ครอบคลุม 47 ประเด็นที่มีความสำคัญระดับชาติ.
แต่ละบทความได้รับการทำเครื่องหมายสองครั้ง: ครั้งหนึ่งสำหรับแนวโน้มโดยรวมต่อประเด็นที่กำหนด, และอีกครั้งสำหรับส่วนย่อย; เฉพาะ หัวเรื่อง, บทนำ, บทสรุป, และ คำพูดโดยตรง.
การทำเครื่องหมายนี้นำโดยผู้เชี่ยวชาญด้านการสื่อสาร Jiyoung Han, ผู้เขียนคนที่สามของบทความ, ซึ่งได้ชี้นำกระบวนการโดยใช้สัญญาณที่ตั้งมั่นจากการศึกษาสื่อ, เช่น การเลือกแหล่งข้อมูล, การกำหนดกรอบเชิงคำศัพท์, และรูปแบบการอ้างอิง. ด้วยวิธีนี้ได้รวบรวมป้ายกำกับแนวโน้มระดับส่วนย่อยทั้งหมด 19,650 รายการ.
เพื่อให้แน่ใจว่าบทความมีสัญญาณมุมมองที่มีความหมาย, แต่ละบทความถูกจัดประเภทตามประเภทก่อน, และเฉพาะบทความที่ระบุเป็นการวิเคราะห์หรือความคิดเห็น (ซึ่งการกำหนดกรอบเชิงอัตวิสัยมีแนวโน้มสูงกว่า) เท่านั้นที่ถูกใช้สำหรับการทำเครื่องหมายแนวโน้ม.
นักทำเครื่องหมายสองคนที่ผ่านการฝึกฝนทำเครื่องหมายทุกบทความ, และได้รับคำสั่งให้ปรึกษาบทความที่เกี่ยวข้องในกรณีที่แนวโน้มไม่ชัดเจน, โดยความขัดแย้งจะถูกแก้ไขผ่านการอภิปรายและการตรวจสอบเพิ่มเติม.

ตัวอย่างรายการจากชุดข้อมูล K-NEWS-STANCE, แปลเป็นภาษาอังกฤษ. แสดงเฉพาะหัวเรื่อง, บทนำ, และคำพูด; ข้อความเต็มถูกละเว้น. การไฮไลต์แสดงป้ายกำกับแนวโน้มสำหรับคำพูด, โดยสีฟ้าสำหรับสนับสนุนและสีแดงสำหรับคัดค้าน. โปรดอ้างอิง PDF แหล่งที่อ้างอิงเพื่อดูการแสดงผลที่ชัดเจนยิ่งขึ้น.
JoA-ICL
แทนที่จะพิจารณาบทความเป็นบล็อกข้อความเดียว, ระบบที่ผู้เขียนเสนอจะแบ่งบทความเป็นส่วนโครงสร้างสำคัญ: หัวเรื่อง, บทนำ, คำพูด, และบทสรุป, โดยมอบหมายแต่ละส่วนให้กับเอเจนต์โมเดลภาษา, ซึ่งทำการติดป้ายให้ส่วนนั้นเป็น สนับสนุน, คัดค้าน, หรือ เป็นกลาง.
การทำนายในระดับท้องถิ่นเหล่านี้จะถูกส่งต่อไปยังเอเจนต์ที่สองซึ่งตัดสินแนวโน้มโดยรวมของบทความ, โดยเอเจนต์ทั้งสองประสานงานผ่านคอนโทรลเลอร์ที่เตรียมพรอมต์และรวบรวมผลลัพธ์.
ดังนั้น JoA-ICL จึงปรับการเรียนรู้ในบริบท (ที่โมเดลเรียนจากตัวอย่างในพรอมต์) ให้สอดคล้องกับวิธีการเขียนข่าวมืออาชีพ, โดยใช้พรอมต์ที่รับรู้ส่วนย่อยแทนการป้อนข้อมูลทั่วไปเดียว.
(โปรดทราบว่าตัวอย่างและภาพประกอบส่วนใหญ่ในบทความมีความยาวและยากต่อการทำซ้ำอย่างชัดเจนในบทความออนไลน์ ดังนั้นเราขอแนะนำให้ผู้อ่านตรวจสอบ PDF แหล่งที่มาต้นฉบับ)
ข้อมูลและการทดสอบ
ในการทดสอบ, นักวิจัยใช้ macro F1 และความแม่นยำเพื่อประเมินประสิทธิภาพ, โดยเฉลี่ยผลลัพธ์จากการรันสิบครั้งด้วยค่า seed สุ่มตั้งแต่ 42 ถึง 51 และรายงานค่า standard error. ข้อมูลการฝึกถูกใช้เพื่อ ปรับจูน โมเดลฐานและเอเจนต์ระดับส่วน, โดยเลือกตัวอย่าง few-shot ผ่านการค้นหาความคล้ายคลึงโดยใช้ KLUE-RoBERTa-large.
การทดสอบดำเนินการบน GPU RTX A6000 สามตัว (แต่ละตัวมี VRAM 48GB), โดยใช้ Python 3.9.19, PyTorch 2.5.1, Transformers 4.52.0, และ vLLM 0.8.5.
GPT-4o-mini, Claude 3 Haiku, และ Gemini 2 Flash ถูกใช้ผ่าน API, ที่ temperature 1.0 และตั้งค่า max tokens ที่ 1000 สำหรับ chain-of-thought prompts, และ 100 สำหรับอื่น ๆ.
สำหรับการปรับจูนเต็มรูปแบบของ Exaone-3.5-2.4B, ตัวปรับแต่ง AdamW ถูกใช้ที่อัตรา learning rate 5e-5, พร้อม weight decay 0.01, warmup steps 100, และฝึกข้อมูลเป็น epochs 10 ที่ batch size 6.
สำหรับฐานเปรียบเทียบ, ผู้เขียนใช้ RoBERTa, ปรับจูนสำหรับการตรวจจับแนวโน้มระดับบทความ; Chain-of-Thought (CoT) Embeddings, การปรับจูนทางเลือกของ RoBERTa สำหรับงานที่กำหนด; LKI-BART, โมเดล encoder-decoder ที่เพิ่มความรู้บริบทจากโมเดลภาษาใหญ่โดยการพรอมต์ทั้งข้อความอินพุตและป้ายแนวโน้มที่ต้องการ; และ PT-HCL, วิธีที่ใช้ contrastive learning เพื่อแยกคุณลักษณะทั่วไปออกจากคุณลักษณะที่เฉพาะเจาะจงต่อประเด็นเป้าหมาย:

ประสิทธิภาพของแต่ละโมเดลบนชุดทดสอบ K-NEWS-STANCE สำหรับการทำนายท่าทีโดยรวม ผลลัพธ์แสดงเป็นค่า macro F1 และความแม่นยำ โดยคะแนนสูงสุดในแต่ละกลุ่มจะทำตัวหนา
JOA-ICL บรรลุผลการทำงานโดยรวมที่ดีที่สุดทั้งในด้านความแม่นยำและ macro F1 ซึ่งเป็นข้อได้เปรียบที่เห็นได้ชัดในโมเดลฐานทั้งสามที่ทดสอบ: GPT-4o-mini, Claude 3 Haiku และ Gemini 2 Flash
วิธีการแบบแบ่งส่วน consistently outperformed วิธีการอื่นทั้งหมด โดยผู้เขียนสังเกตว่ามีความได้เปรียบอย่างชัดเจนในการตรวจจับท่าทีเชิงสนับสนุน ซึ่งเป็นจุดอ่อนทั่วไปของโมเดลที่คล้ายกัน
โมเดลพื้นฐานทำผลงานได้แย่ลงโดยรวม RoBERTa และรุ่น Chain-of-Thought มีปัญหาในกรณีที่ละเอียดอ่อน ในขณะที่ PT-HCL และ LKI‑BART ทำได้ดีกว่า แต่ยังคงตามหลัง JOA‑ICL ในหลายหมวดหมู่ ผลลัพธ์ที่แม่นยำที่สุดมาจาก JOA‑ICL (Claude) ด้วย macro F1 64.8% และความแม่นยำ 66.1%
ภาพด้านล่างแสดงความถี่ที่โมเดลทายป้ายกำกับแต่ละประเภทได้ถูกหรือผิด:

เมทริกซ์ความสับสนเปรียบเทียบระหว่างฐานและ JoA‑ICL แสดงให้เห็นว่าทั้งสองวิธีมีปัญหามากที่สุดในการตรวจจับท่าทีเชิงสนับสนุน
JoA‑ICL ทำได้ดีกว่าฐานโดยรวม โดยได้ป้ายกำกับที่ถูกต้องในทุกหมวดหมู่มากขึ้น อย่างไรก็ตาม ทั้งสองโมเดลมีปัญหามากที่สุดกับบทความเชิงสนับสนุน และฐานทำการจัดประเภทผิดเกือบครึ่งหนึ่งโดยมักสับสนเป็นกลาง
JoA‑ICL ทำผิดน้อยลงแต่แสดงรูปแบบเดียวกัน ยืนยันว่าท่าทีเชิงบวกยากต่อการตรวจจับของโมเดล
เพื่อทดสอบว่า JoA‑ICL ทำงานได้ดีนอกเหนือจากภาษาเกาหลีหรือไม่ ผู้เขียนได้ทดลองบน CheeSE ซึ่งเป็นชุดข้อมูลภาษาเยอรมันสำหรับการตรวจจับท่าทีระดับบทความ เนื่องจาก CheeSE ไม่มีป้ายกำกับระดับส่วนย่อย นักวิจัยจึงใช้ การกำกับดูแลแบบระยะไกล ซึ่งแต่ละส่วนจะได้รับป้ายกำกับท่าทีเดียวกันกับบทความเต็ม

ผลการตรวจจับท่าทีบนชุดข้อมูล CheeSE ภาษาเยอรมัน JoA‑ICL ปรับปรุงอย่างต่อเนื่องเหนือการ prompting แบบ zero‑shot ในทุก LLM ทั้งสามและเหนือฐานที่ฝึกโดยละเอียด โดย Gemini‑2.0‑flash ให้ผลการทำงานโดยรวมที่แข็งแกร่งที่สุด
แม้ในสภาวะ ‘รบกวน’ เหล่านี้ JoA‑ICL ยังคงเหนือโมเดลที่ฝึกโดยละเอียดและการ prompting แบบ zero‑shot ทั้งสอง โดยในสามฐานที่ทดสอบ Gemini‑2.0‑flash ให้ผลลัพธ์ที่ดีที่สุด
สรุป
งานทำนายท่าทีเป็นหนึ่งในงานแมชชีนเลิร์นนิงที่มีการเมืองเข้ามาเกี่ยวข้องมากที่สุด แต่บ่อยครั้งถูกจัดการด้วยวิธีที่เย็นชาและกลไก ในขณะที่ความสนใจส่วนใหญ่ถูกให้กับประเด็นที่ซับซ้อนน้อยกว่าใน AI สร้างสรรค์ เช่น การสร้างวิดีโอและภาพ ซึ่งมักทำให้ข่าวหัวข้อดังขึ้นอย่างมาก
ความก้าวหน้าที่ให้กำลังใจมากที่สุดในงานเกาหลีใหม่คือการที่มันมีส่วนสำคัญต่อการวิเคราะห์เนื้อหา เต็มความยาว แทนที่จะเป็นทวีตและสื่อสังคมรูปแบบสั้น ซึ่งผลกระทบที่รุนแรงมักถูกลืมเร็วกว่าเมื่อเทียบกับบทความหรืองานสำคัญอื่น ๆ
หนึ่งในข้อบกพร่องที่สังเกตได้ในงานใหม่และ (ตามที่ผมทราบ) ในคอร์ปัสการทำนายท่าทีโดยทั่วไปคือการขาดการพิจารณา ไฮเปอร์ลิงก์ ซึ่งมักทำหน้าที่เป็นการอ้างอิงเสริมให้ผู้อ่านได้เรียนรู้เพิ่มเติมเกี่ยวกับหัวข้อ อย่างไรก็ตาม ต้องชัดเจนว่าการเลือก URL เหล่านี้อาจเป็นเรื่องส่วนบุคคลและแม้กระทั่งมีการเมืองเข้ามาเกี่ยวข้อง
อย่างไรก็ตาม ยิ่งสำนักพิมพ์มีชื่อเสียงสูงเท่าไหร่ น่าจะน้อยกว่า ที่จะรวม ลิงก์ใดๆเลย ที่นำผู้อ่านออกจากโดเมนโฮสต์ สิ่งนี้ร่วมกับการใช้และการละเมิด SEO ของไฮเปอร์ลิงก์ในรูปแบบที่หลากหลาย ทำให้การวัดค่าพวกมันยากกว่าการอ้างอิงโดยตรง ชื่อเรื่อง หรือส่วนอื่น ๆ ของบทความที่อาจพยายามโดยเจตนาหรือไม่เจตนาให้ผู้อ่านมีความคิดเห็นที่ต้องการ
เผยแพร่ครั้งแรกวันพุธที่ 16 กรกฎาคม 2025












