Anderson의 관점
AI, 뉴스를 개발할 수 있을까?

AI는 뉴스 기사를 작성하는 데 점점 더 능숙해지고 있지만 뉴스 기사를 식별하는 데는 여전히 많이 부족합니다.
의견 5년 전 AI가 뉴스 기사를 찾는 능력에 대해 마지막으로 살펴본 이후로 상황은 상당히 많이 변했습니다. AI 주도 자동화 수준이 증가하고 그에 따른 문제도 함께 증가했습니다.
최근 WSJ의 보고서에 따르면 AI를 사용하는 기자는 번역과 같은 단순한 작업에서 해방되어 더 큰 출판사에서만 가능한 특집 기사 작성과 조사에 집중할 수 있습니다.
하지만 우리는 AI가 뉴스 기사를 식별하는 능력에 대해 거의 듣지 못합니다.
소음 감소
2021년의 기사에서 저는 연구 분야를 다루는 작가들에 집중했는데, 그 이유는 저도 그 분야에서 대부분의 시간을 보내기 때문입니다. 새로운 AI 혁명이 그 분야에 미친 가장 큰 영향은 AI를 사용한 연구 논문 제출의 폭발적인 증가로, 이는 인간이 다루기 힘든 수준으로 신호널 대 노이즈 비율을 높였습니다.
확실히 이것은 AI가 뛰어난 분야입니다. AI는 인간이 해결할 수 없는 방대한 데이터를 처리하여 몇 초 안에 아웃라이어를 찾을 수 있습니다.
그러나 AI는 여전히 왜 뉴스 기사를 식별하는 데 그렇게 나쁠까요?
과거를 바라보는 AI
이러한 AI 생성 콘텐츠의 대규모 증가는 학술 분야를 넘어서서 전 세계적으로 발생하고 있습니다. 지난해에는 인터넷의 모든 새로운 글의 절반이 이미 AI에 의해 작성되고 있다고 추정되며, 이 추세는 더욱 가속화될 것으로 예상됩니다. 따라서 노이즈는 학술 분야뿐만 아니라 모든 곳에서 엄청난 수준에 달하고 있습니다.
과거 몇 년 동안 AI/알고리즘을 사용한 뉴스 기사 식별 시스템은 어느 정도의 진전을 보였습니다. 그러나 이러한 시스템은 주로 계층화된 데이터 피드나 예측 가능한 데이터 구조에 집중합니다.
스탠퍼드 대학교의 박사 후 연구원인 알렉산더 스팡허는 기계 학습 프로세스와 통계 분석에 적용할 수 있는 뉴스 가치의 정의를 여러 번 시도했습니다. 그는 법원 서류, 국가 법안, 시의회 회의록 등에서 자동화된 리드 생성에 대한 증거를 제시했습니다.

공개 문서에서 얻은 단어 분포의 ‘열기’. 이 경우 ‘권한 부여’는 높은 점수를 가지고 있으므로 결정, 변화, 그리고비전그리고그리고를 나타낼 수 있습니다. 출처
그러나 이러한 접근 방식의 문제는 관찰된 데이터 경향에 집중한다는 것입니다. 즉, 이전에 좋은 뉴스로 판명된 것과 같은 것을 찾습니다.
실제 세계에서 예상치 못한 출처는 거의 항상 ‘원 히트 원더’로 판명되며, 한 번 유용한 결과를 내놓은 후에는 다시 유용한 결과를 내놓지 못합니다.
시대적 징조
따라서 이러한 종류의 일회성 뉴스 출처를 모니터링하는 것은 일반적으로 더 많은 노이즈를 추가할 뿐입니다. AI는 대신 뉴스 가치가 있는 출처의 징조를 식별할 수 있을까요? 출처의 특성을 찾는 것보다 출처 자체를 찾는 것이 더 중요할 수 있습니다.
이 논리에 따르면 에드워드 스노든의 폭로에서 볼 수 있듯이 CIA나 유사한 조직을 최근에 떠난 사람은 미래의 뉴스 출처가 될 가능성이 있습니다.
그러나 이러한 종류의 모니터링을 자동화하는 데는 RSS 피드나 API가 없으며, 심지어 있더라도빈도정도가 문제가 됩니다. 또한 이러한 출처의 공개 데이터에 대한 접근이 제한되고 있습니다.
또한 이러한 종류의 폭로에는 인간적인 차원이 있습니다. 이는 자동화하기 어렵습니다.

개인적인 접촉으로 뉴스를 수집하는 것: 1976년 앨런 J. 파쿨라의 영화 ‘올 더 프레지던트 맨’의 디스크 릴리스에서 인포머가 그림자에서 나오는 것을 보는 장면. 출처
또한 미래의 뉴스 출처를 식별하는 데는 인간의 직관이 필요합니다.
실제 세계에서 뉴스 출처의 정의를 찾는 것은 매우 어렵습니다. 이는 프로토콜이나 특정 언어에 의해 정의되지 않습니다.
좁은 길
현재의 AI 기반 뉴스 가치 식별 시스템은 공식적인 데이터 구조나 AI가 파싱할 수 있는 비공식적인 데이터 구조에 의존합니다.
이러한 접근 방식은 프로그램 출력에 적합합니다. 예를 들어 기상, 주식, 스포츠 점수 보고 등은 모두 정형화된 데이터 구조를 가지고 있습니다.
그러나 인간의 주의가 필요합니다. 예를 들어 정부 발표는 인간의 주의가 필요합니다.
엘리트 작가의 귀환?
최근 몇 년 동안 데이터 주도 저널리즘은 뉴스 보도에서 중요한 역할을 차지했습니다. 편집부는 더 이상 특별한 보고서나 백서를 받는 것에만 의존하지 않고, 직접 데이터를 분석할 수 있습니다.
그러나 이 방법은 문제를 가지고 있습니다. 데이터를 분석하는 데 필요한 작업이 많아지고, 출판사와 도메인은 데이터에 대한 접근을 제한하고 있습니다.
이로 인해 뉴스 생산의 민주화가 역행하는 현상이 나타납니다. 즉, 뉴스 생산의 수단이 다시 엘리트에게 집중되는 것입니다.
공통의 본능
이러한 제한은 우리를 다시 뉴스 가치 평가에서 본능으로 돌아가게 합니다.
자연스럽게 이것은 전문적으로 이 분야에 종사하는 사람들에게는 안심할 수 있는 일이지만, 자만에 빠져서는 안 됩니다. 본능은 어느 정도 일반화할 수 있습니다.
2022년의 한 연구에서 북서부 대학교의 연구자들은 잠재적으로 뉴스 가치가 있는 이야기에 대한 크라우드소싱 평가를 사용하여 예측 모델을 훈련했습니다.

연구 참여자에게 제공된 설문조사 질문으로 뉴스 가치 예측 AI 모델을 위한 훈련 데이터를 얻는 과정. 출처
이 시스템은 후보자들을 bastante 잘 평가합니다. 그러나 전문가와의 일치는 중간 정도입니다.
이 시스템은 2020년의 논문에 제시된 원리에 기반합니다.
그러나 과학 저널리즘은 과학 문헌의 템플릿화된 출력을 파싱할 수 있는 데이터 포인트로 변환할 수 있습니다.
연구 과학자들은 연구 논문 제출의 관례를 남용하여 부진한 결과나 실패를 숨기거나 축소합니다.
또한 AI 시스템은 과학 논문의 그림과 표를 해석하는 데 어려움을 겪습니다.

과학적 그림을 AI가 생성한 검출 벤치마크. 출처
그래프나 표에는 본문에서 생략하거나 편향된 결과가 포함될 수 있습니다.
다시 혼자, 자연스럽게
크라우드소싱 방법은 전문가와의 일치가 중간 정도임을 보여줍니다.
AI의 강점은 아웃라이어를 식별하는 것입니다. 이는 데이터셋에서 의미 있는 값과 비정상적인 값을 식별하는 데 사용됩니다.

산점도의 아웃라이어(빨간색). 출처
대부분의 히트 뉴스 기사는 아웃라이어입니다. 이러한 도메인은 주의 깊게 모니터링할 수 있지만, 공통의 주의는 이러한 도메인에 집중되어 있습니다.
신뢰 문제
기자들은 여러 제약을 균형있게 조절해야 합니다. 2022년 리뷰에 따르면 기자들은 여러 가지 문제를 고려해야 합니다.
이러한 신뢰 문제는 AI 기반 뉴스 가치 식별 시스템의 개발에서 장애물이 됩니다.
알고리즘이 삭제한 기사들이 정말로 시간을 낭비할 가치가 없는지에 대한 신뢰가 필요합니다.
대규모 베타 테스트와 재훈련 또는 미세 조정이 필요할 수 있습니다.
그러나 이러한 시스템은 문화적 또는 정치적 상황의 변화에 의해 쉽게 무너질 수 있습니다.
처음에 2026년 4월 20일 게시되었습니다. 2026년 4월 23일 14:13:25에 ‘The Narrow Path’의 2번째 단락에서 ‘WSJ’를 ‘Fortune’으로 교체했습니다.












