Góc nhìn Anderson
Những gì Trí tuệ nhân tạo có thể cho chúng ta biết về chương trình nghị sự ẩn trong tin tức

Các mô hình kiểu ChatGPT đang được đào tạo để phát hiện những gì một bài báo tin tức thực sự nghĩ về một vấn đề – ngay cả khi quan điểm đó bị chôn vùi dưới các trích dẫn, khuôn khổ hoặc (thỉnh thoảng) ‘trung lập’. Bằng cách chia các bài viết thành các đoạn như tiêu đề, dẫn, trích dẫn và kết luận, một hệ thống mới học cách phát hiện thiên vị ngay cả trong báo chí chuyên nghiệp dài.
Khả năng hiểu quan điểm thực sự của một nhà văn hoặc người nói – một nhiệm vụ được biết đến trong văn học như phát hiện quan điểm – giải quyết một trong những vấn đề giải thích khó khăn nhất trong ngôn ngữ: thu thập ý định từ nội dung có thể được thiết kế để che giấu hoặc che khuất nó.
Từ Đề xuất khiêm tốn của Jonathan Swift, đến các buổi biểu diễn gần đây của các diễn viên chính trị mượn lời lẽ của những người đối lập ý thức hệ của họ, bề mặt của một tuyên bố không còn là chỉ số đáng tin cậy của ý định của nó; sự trỗi dậy của sự mỉa mai, trolling, thông tin sai lệch và sự mơ hồ chiến lược đã khiến nó khó hơn bao giờ hết để xác định bên nào một văn bản thực sự đứng, hoặc liệu nó có đứng hay không.
Thường, những gì không được nói có thể mang lại trọng lượng tương tự như những gì được nói, và việc lựa chọn để bao gồm một chủ đề có thể là tín hiệu cho vị trí của tác giả.
Điều đó làm cho nhiệm vụ phát hiện quan điểm tự động trở nên đặc biệt thách thức, vì một hệ thống phát hiện hiệu quả cần làm hơn là gắn thẻ các câu riêng lẻ là ‘hỗ trợ’ hoặc ‘phản đối’; thay vào đó, nó phải lặp qua các lớp ý nghĩa, cân nhắc các tín hiệu nhỏ chống lại hình dạng và hướng của toàn bộ bài viết; và điều này khó hơn trong báo chí chuyên nghiệp dài, nơi giọng điệu có thể thay đổi và quan điểm có thể hiếm khi được thể hiện rõ ràng.
Đại diện thay đổi
Để giải quyết một số vấn đề này, các nhà nghiên cứu ở Hàn Quốc đã phát triển một hệ thống mới gọi là JOA-ICL (Học tập ngữ cảnh được hướng dẫn bởi báo chí) để phát hiện quan điểm của các bài báo tin tức dài.

Ý tưởng cốt lõi đằng sau JoA-ICL là rằng quan điểm của bài viết được suy luận bằng cách tổng hợp các dự đoán cấp đoạn được tạo ra bởi một đại lý mô hình ngôn ngữ riêng biệt. Nguồn: https://arxiv.org/pdf/2507.11049
Thay vì đánh giá một bài viết như một khối văn bản duy nhất, JOA-ICL chia nó thành các phần cấu trúc (tiêu đề, dẫn, trích dẫn và kết luận) và gán một mô hình ngôn ngữ nhỏ hơn cho mỗi phần. Những dự đoán cục bộ này sau đó được chuyển đến một mô hình lớn hơn, sử dụng chúng để xác định quan điểm chung của bài viết.
Phương pháp này đã được thử nghiệm trên một tập dữ liệu mới được biên soạn chứa 2.000 bài báo tin tức được chú thích cho cả quan điểm cấp bài viết và cấp đoạn. Mỗi bài viết đã được gắn nhãn với sự đầu vào từ một chuyên gia báo chí, phản ánh cách quan điểm được phân phối trên cấu trúc của viết báo chuyên nghiệp.
Theo bài báo, JOA-ICL vượt trội so với cả các phương pháp dựa trên lời nhắc và các phương pháp tinh chỉnh, thể hiện sự mạnh mẽ đặc biệt trong việc phát hiện các quan điểm hỗ trợ (mà các mô hình có phạm vi tương tự thường bỏ lỡ). Phương pháp này cũng chứng minh hiệu quả khi được áp dụng cho một tập dữ liệu tiếng Đức trong điều kiện phù hợp, cho thấy rằng các nguyên tắc của nó có thể có khả năng chống lại các hình thức ngôn ngữ.
Các tác giả tuyên bố:
‘Thử nghiệm cho thấy JOA-ICL vượt trội so với các phương pháp phát hiện quan điểm hiện có, nhấn mạnh lợi ích của việc đại lý cấp đoạn trong việc nắm bắt vị trí chung của các bài báo tin tức dài.’
Bài báo mới có tiêu đề Học tập ngữ cảnh được hướng dẫn bởi báo chí cho phát hiện quan điểm tin tức, và đến từ các khoa khác nhau tại Đại học Soongsil ở Seoul, cũng như Trường Cao học Chiến lược Tương lai của KAIST.
Phương pháp
Một phần của thách thức phát hiện quan điểm tăng cường bởi AI là hậu cần, và liên quan đến lượng tín hiệu mà một hệ thống học máy có thể giữ lại và tổng hợp tại một thời điểm, tại trạng thái hiện tại của nghệ thuật.
Các bài báo tin tức thường tránh các tuyên bố trực tiếp về quan điểm, dựa vào ngầm hoặc giả định quan điểm, được tín hiệu thông qua các lựa chọn về nguồn trích dẫn, cách định khung câu chuyện và những chi tiết được bỏ qua, trong số nhiều yếu tố khác.
Thậm chí khi một bài viết thực sự có một quan điểm rõ ràng, tín hiệu thường bị phân tán trên toàn bộ văn bản, với các đoạn khác nhau chỉ đến các hướng khác nhau. Vì các mô hình ngôn ngữ (LM) vẫn còn khó khăn với cửa sổ ngữ cảnh hạn chế, điều này có thể khiến các mô hình khó đánh giá quan điểm theo cách chúng làm với nội dung ngắn hơn (như tweet và các phương tiện truyền thông xã hội ngắn khác), nơi mối quan hệ giữa văn bản và mục tiêu là rõ ràng hơn.
Do đó, các phương pháp tiêu chuẩn thường không đạt được kết quả mong muốn khi áp dụng cho báo chí chuyên nghiệp đầy đủ; một trường hợp mà sự mơ hồ là một tính năng chứ không phải một khiếm khuyết.
Bài báo tuyên bố:
‘Để giải quyết những thách thức này, chúng tôi đề xuất một phương pháp mô hình hóa phân cấp, trước tiên suy luận quan điểm ở cấp độ các đơn vị diễn ngôn nhỏ hơn (ví dụ, đoạn hoặc phần), và sau đó tích hợp các dự đoán cục bộ này để xác định quan điểm chung của bài viết. ‘
‘Khung này được thiết kế để giữ lại ngữ cảnh cục bộ và nắm bắt các tín hiệu quan điểm phân tán trong việc đánh giá cách các phần khác nhau của một câu chuyện tin tức đóng góp vào vị trí chung của nó về một vấn đề.’
Để đạt được điều này, các tác giả đã biên soạn một tập dữ liệu mới có tên K-NEWS-STANCE, được rút ra từ các bài báo tin tức Hàn Quốc giữa tháng 6 năm 2022 và tháng 6 năm 2024. Các bài viết đã được xác định thông qua BigKinds, một dịch vụ siêu dữ liệu do Quỹ Báo chí Hàn Quốc hỗ trợ, và các văn bản đầy đủ được thu hồi bằng cách sử dụng API tổng hợp tin tức Naver. Tập dữ liệu cuối cùng bao gồm 2.000 bài viết từ 31 kênh, bao gồm 47 vấn đề có liên quan đến quốc gia.
Mỗi bài viết đã được chú thích hai lần: một lần cho quan điểm chung của nó đối với một vấn đề nhất định, và một lần cho các đoạn riêng lẻ; cụ thể là tiêu đề, dẫn, kết luận, và trích dẫn trực tiếp.
Chú thích được dẫn dắt bởi chuyên gia báo chí Jiyoung Han, cũng là tác giả thứ ba của bài báo, người đã hướng dẫn quá trình thông qua việc sử dụng các tín hiệu đã thiết lập từ các nghiên cứu truyền thông, chẳng hạn như lựa chọn nguồn, khung từ vựng, và các mẫu trích dẫn. Bằng cách này, tổng cộng 19.650 nhãn quan điểm cấp đoạn đã được thu được.
Để đảm bảo các bài viết chứa tín hiệu quan điểm có ý nghĩa, mỗi bài viết đã được phân loại theo thể loại, và chỉ những bài viết được dán nhãn là phân tích hoặc ý kiến (nơi định khung chủ quan có nhiều khả năng được tìm thấy) mới được sử dụng cho chú thích quan điểm.
Hai người chú thích được đào tạo đã dán nhãn tất cả các bài viết, và được hướng dẫn tham khảo các bài viết liên quan trong trường hợp quan điểm không rõ ràng, với các bất đồng được giải quyết thông qua thảo luận và xem xét thêm.

Các mục nhập mẫu từ tập dữ liệu K-NEWS-STANCE, dịch sang tiếng Anh. Chỉ hiển thị tiêu đề, dẫn và trích dẫn; văn bản chính được bỏ qua. Tô sáng chỉ ra các nhãn quan điểm cho trích dẫn, với màu xanh cho hỗ trợ và màu đỏ cho đối lập. Vui lòng tham khảo nguồn PDF được trích dẫn để có bản trình bày rõ ràng hơn.
JoA-ICL
Thay vì xử lý một bài viết như một khối văn bản duy nhất, hệ thống được đề xuất của các tác giả chia nó thành các phần cấu trúc chính: tiêu đề, dẫn, trích dẫn và kết luận, gán mỗi phần cho một mô hình ngôn ngữ, mô hình này dán nhãn cho đoạn là hỗ trợ, đối lập, hoặc trung lập.
Các dự đoán cục bộ này sau đó được chuyển đến một mô hình lớn hơn, quyết định quan điểm chung của bài viết, với hai mô hình được điều phối bởi một bộ điều khiển chuẩn bị các lời nhắc và thu thập kết quả.
Vậy JoA-ICL thích nghi với học tập ngữ cảnh (trong đó mô hình học từ các ví dụ trong lời nhắc) để phù hợp với cách các câu chuyện tin tức chuyên nghiệp được viết, sử dụng các lời nhắc nhận thức cấp đoạn thay vì một lời nhắc chung duy nhất.
(Vui lòng lưu ý rằng hầu hết các ví dụ và hình minh họa trong bài báo là dài và khó tái tạo một cách hợp lý trong một bài viết trực tuyến. Chúng tôi do đó yêu cầu người đọc xem xét nguồn PDF gốc)
Dữ liệu và Kiểm tra
Trong các thử nghiệm, các nhà nghiên cứu đã sử dụng macro F1 và độ chính xác để đánh giá hiệu suất, trung bình kết quả trên mười lần chạy với các hạt ngẫu nhiên từ 42 đến 51 và báo cáo lỗi chuẩn. Dữ liệu đào tạo được sử dụng để tinh chỉnh các mô hình cơ sở và các mô hình cấp đoạn, với một số mẫu được chọn thông qua tìm kiếm tương tự bằng KLUE-RoBERTa-large.
Thử nghiệm được chạy trên ba GPU RTX A6000 (mỗi GPU có 48GB VRAM), sử dụng Python 3.9.19, PyTorch 2.5.1, Transformers 4.52.0, và vLLM 0.8.5.
GPT-4o-mini, Claude 3 Haiku, và Gemini 2 Flash đã được sử dụng thông qua API, ở nhiệt độ 1,0 và với số lượng token tối đa được đặt thành 1000 cho lời nhắc chuỗi suy nghĩ, và 100 cho các loại khác.
Để tinh chỉnh hoàn toàn Exaone-3.5-2.4B, bộ tối ưu hóa AdamW đã được sử dụng ở tốc độ học 5e-5, với độ giảm trọng lượng 0,01, 100 bước khởi động, và với dữ liệu được đào tạo trong 10 kỳ với kích thước lô 6.
Đối với các mô hình cơ sở, các tác giả đã sử dụng RoBERTa, được tinh chỉnh cho phát hiện quan điểm cấp bài viết; Chain-of-Thought (CoT) Embeddings, một phương pháp tinh chỉnh thay thế của RoBERTa cho nhiệm vụ được giao; LKI-BART, một mô hình mã hóa-decode thêm kiến thức ngữ cảnh từ một mô hình ngôn ngữ lớn bằng cách nhắc nó với cả văn bản đầu vào và nhãn quan điểm dự kiến; và PT-HCL, một phương pháp sử dụng học tương phản để tách các tính năng chung khỏi các tính năng cụ thể cho vấn đề mục tiêu:

Hiệu suất của mỗi mô hình trên tập dữ liệu kiểm tra K-NEWS-STANCE cho dự đoán quan điểm chung. Kết quả được hiển thị dưới dạng macro F1 và độ chính xác, với điểm số cao nhất trong mỗi nhóm được in đậm.
JOA-ICL đã đạt được hiệu suất chung tốt nhất trên cả độ chính xác và macro F1, một lợi thế rõ ràng trên tất cả ba xương sống mô hình được thử nghiệm: GPT-4o-mini, Claude 3 Haiku và Gemini 2 Flash.
Phương pháp dựa trên đoạn nhất quán vượt trội so với tất cả các phương pháp khác, với, như các tác giả quan sát, một lợi thế đáng chú ý trong việc phát hiện các quan điểm hỗ trợ, một điểm yếu phổ biến trong các mô hình tương tự.
Các mô hình cơ sở đã thực hiện kém hơn tổng thể. RoBERTa và các biến thể Chain-of-Thought đã gặp khó khăn với các trường hợp tinh vi, trong khi PT-HCL và LKI-BART đã hoạt động tốt hơn, nhưng vẫn kém hơn JOA-ICL trên hầu hết các loại.
Kết quả chính xác nhất đến từ JOA-ICL (Claude), với 64,8% macro F1 và 66,1% độ chính xác.
Hình ảnh dưới đây cho thấy tần suất các mô hình nhận đúng hoặc sai mỗi nhãn:

Ma trận nhầm lẫn so sánh mô hình cơ sở và JoA-ICL, cho thấy cả hai phương pháp đều gặp khó khăn nhất trong việc phát hiện các quan điểm hỗ trợ.
JOA-ICL đã hoạt động tốt hơn tổng thể so với mô hình cơ sở, nhận đúng nhiều nhãn hơn trong mọi loại. Tuy nhiên, cả hai mô hình đều gặp khó khăn nhất với các bài viết hỗ trợ, và mô hình cơ sở đã nhầm gần một nửa, thường nhầm chúng với trung lập.
JOA-ICL đã thực hiện ít sai lầm hơn nhưng đã thể hiện cùng một mô hình, củng cố rằng ‘quan điểm tích cực’ khó hơn cho các mô hình để phát hiện.
Để kiểm tra xem JOA-ICL có hoạt động ngoài phạm vi ngôn ngữ Hàn Quốc hay không, các tác giả đã chạy nó trên CheeSE, một tập dữ liệu tiếng Đức cho phát hiện quan điểm cấp bài viết. Vì CheeSE thiếu nhãn cấp đoạn, các nhà nghiên cứu đã sử dụng giám sát từ xa, trong đó mỗi đoạn được gán cùng một nhãn quan điểm với toàn bộ bài viết.

Kết quả phát hiện quan điểm trên tập dữ liệu tiếng Đức CheeSE. JOA-ICL nhất quán cải thiện so với lời nhắc zero-shot trên tất cả ba LLM và vượt trội so với các mô hình cơ sở tinh chỉnh, với Gemini-2.0-flash mang lại hiệu suất tổng thể mạnh nhất.
Thậm chí trong điều kiện ‘nhiễu’ này, JOA-ICL đã vượt trội so với cả mô hình tinh chỉnh và lời nhắc zero-shot. Trong số ba xương sống được thử nghiệm, Gemini-2.0-flash đã mang lại kết quả tốt nhất.
Kết luận
Ít nhiệm vụ trong học máy được chính trị hóa hơn dự đoán quan điểm; tuy nhiên, nó thường được xử lý bằng các thuật ngữ lạnh lùng và cơ học, trong khi sự chú ý được dành cho các vấn đề ít phức tạp hơn trong AI tạo sinh, chẳng hạn như tạo video và hình ảnh, những thứ kích hoạt các tiêu đề lớn hơn.
Phát triển mới đầy hứa hẹn trong công việc Hàn Quốc mới là nó cung cấp một đóng góp đáng kể cho phân tích toàn bộ nội dung, thay vì các tweet và phương tiện truyền thông xã hội ngắn, tác động gây sốc của chúng thường bị lãng quên nhanh hơn một luận văn, bài viết hoặc các tác phẩm quan trọng khác.
Một sự thiếu sót đáng chú ý trong công việc mới và (theo tôi có thể thấy) trong tập dữ liệu dự đoán quan điểm chung là sự thiếu xem xét các liên kết, thường đứng thay cho trích dẫn như các tài nguyên tùy chọn cho người đọc để tìm hiểu thêm về một chủ đề; tuy nhiên, phải rõ ràng rằng việc lựa chọn các URL như vậy có thể chủ quan và thậm chí là chính trị.
Điều đó nói lên, các ấn phẩm có uy tín hơn, ít có khả năng bao gồm bất kỳ liên kết nào hướng người xem rời khỏi miền chủ; điều này, cùng với các ứng dụng và lạm dụng SEO khác của liên kết, khiến chúng khó lượng hóa hơn các trích dẫn, tiêu đề hoặc các phần khác của một bài viết có thể tìm cách, có chủ ý hoặc không, ảnh hưởng đến quan điểm của người đọc.
Được xuất bản lần đầu vào thứ Tư, ngày 16 tháng 7 năm 2025












