Ãngulo de Anderson
O que a IA pode nos dizer sobre agendas ocultas nas notÃcias

Modelos do tipo ChatGPT estÃĢo sendo treinados para detectar o que um artigo de notÃcias realmente pensa sobre um assunto â mesmo quando essa posiçÃĢo ÃĐ enterrada sob citaçÃĩes, enquadramento ou (à s vezes desonesto) âneutralidadeâ. Ao dividir os artigos em segmentos, como manchetes, leads e citaçÃĩes, um novo sistema aprende a identificar viÃĐs, mesmo em jornalismo profissional de longa forma.
Â
A capacidade de entender a visÃĢo real de um escritor ou falante â uma busca conhecida na literatura como detecçÃĢo de posiçÃĢo â aborda um dos problemas interpretativos mais difÃceis em linguagem: extrair a intençÃĢo de conteÚdo que pode ser projetado para esconder ou obscurecer.
Desde a Proposta Modesta de Jonathan Swift atÃĐ as performances recentes de atores polÃticos emprestando a polÊmica de seus oponentes ideolÃģgicos, a superfÃcie de uma declaraçÃĢo nÃĢo ÃĐ mais um indicador confiÃĄvel de sua intençÃĢo; o surgimento de ironia, trolagem, desinformaçÃĢo e ambiguidade estratÃĐgica tornou mais difÃcil do que nunca identificar qual lado um texto realmente defende, ou se ele defende algum lado.
Muitas vezes, o que nÃĢo ÃĐ dito tem tanto peso quanto o que ÃĐ declarado, e simplesmente escolher cobrir um tÃģpico pode sinalizar a posiçÃĢo do autor.
Isso torna a tarefa de detecçÃĢo automÃĄtica de posiçÃĢo excepcionalmente desafiadora, pois um sistema de detecçÃĢo eficaz precisa fazer mais do que rotular frases isoladas como âapoioâ ou âoposiçÃĢoâ: em vez disso, ele deve iterar por camadas de significado, pesando pequenos sinais contra a forma e a deriva do artigo inteiro; e isso ÃĐ mais difÃcil no jornalismo de longa forma, onde o tom pode mudar e a opiniÃĢo pode raramente ser expressa explicitamente.
Agentes de Mudança
Para abordar alguns desses problemas, pesquisadores na Coreia do Sul desenvolveram um novo sistema chamado JOA-ICL (Aprendizado de Contexto Guiado por Jornalismo com Aprendizado In-Context) para detectar a posiçÃĢo de artigos de notÃcias de longa forma.

A ideia central por trÃĄs do JoA-ICL ÃĐ que a posiçÃĢo do artigo ÃĐ inferida pela agregaçÃĢo de previsÃĩes de nÃvel de segmento produzidas por um agente de modelo de linguagem separado. Fonte: https://arxiv.org/pdf/2507.11049
Em vez de julgar um artigo como um todo, o JOA-ICL o divide em partes estruturais (manchete, lead, citaçÃĩes e conclusÃĢo) e atribui a cada uma delas um modelo menor para rotulÃĄ-la. Essas previsÃĩes locais sÃĢo entÃĢo passadas para um modelo maior, que as usa para determinar a posiçÃĢo geral do artigo.
O mÃĐtodo foi testado em um conjunto de dados coreano recÃĐm-compilado contendo 2.000 artigos de notÃcias anotados para posiçÃĢo de nÃvel de artigo e de segmento. Cada artigo foi rotulado com entrada de um especialista em jornalismo, refletindo como a posiçÃĢo ÃĐ distribuÃda pela estrutura da redaçÃĢo profissional.
De acordo com o artigo, o JOA-ICL supera tanto as abordagens baseadas em prompts quanto as linhas de base ajustadas, demonstrando força particular na detecçÃĢo de posiçÃĩes de apoio (que os modelos com um objetivo semelhante tendem a perder). O mÃĐtodo tambÃĐm se provou eficaz quando aplicado a um conjunto de dados alemÃĢo sob condiçÃĩes correspondentes, indicando que seus princÃpios sÃĢo potencialmente resilientes a formas de linguagem.
Os autores afirmam:
âExperimentos mostram que o JOA-ICL supera os mÃĐtodos existentes de detecçÃĢo de posiçÃĢo, destacando os benefÃcios da agÊncia de nÃvel de segmento na captura da posiçÃĢo geral de artigos de notÃcias de longa forma.â
O novo artigo ÃĐ intitulado Aprendizado de Contexto Guiado por Jornalismo com Aprendizado In-Context para DetecçÃĢo de PosiçÃĢo de NotÃcias, e vem de vÃĄrias faculdades da Universidade Soongsil, em Seul, bem como da Escola de PÃģs-GraduaçÃĢo em EstratÃĐgia Futura da KAIST.
MÃĐtodo
Parte do desafio da detecçÃĢo de posiçÃĢo com IA ÃĐ logÃstico e relacionado à quantidade de sinal que um sistema de aprendizado de mÃĄquina pode reter e combinar ao mesmo tempo, no estado atual da arte.
Os artigos de notÃcias tendem a evitar declaraçÃĩes diretas de opiniÃĢo, confiando em vez disso em uma implÃcita ou pressuposta posiçÃĢo, sinalizada por meio de escolhas sobre quais fontes citar, como a narrativa ÃĐ enquadrada e quais detalhes sÃĢo omitidos, entre muitas outras consideraçÃĩes.
Even quando um artigo assume uma posiçÃĢo clara, o sinal ÃĐ frequentemente disperso pelo texto, com diferentes segmentos apontando em direçÃĩes diferentes. Como os modelos de linguagem (LMs) ainda lutam com janelas de contexto limitadas, isso pode tornar difÃcil para os modelos avaliar a posiçÃĢo da maneira que eles fazem com conteÚdo mais curto (como tweets e outras mÃdias sociais de curta forma), onde a relaçÃĢo entre o texto e o alvo ÃĐ mais explÃcita.
Portanto, as abordagens padrÃĢo frequentemente falham quando aplicadas a jornalismo de longa forma; um caso em que a ambiguidade ÃĐ uma caracterÃstica e nÃĢo um defeito.
O artigo afirma:
âPara abordar esses desafios, propomos uma abordagem de modelagem hierÃĄrquica que primeiro infere a posiçÃĢo no nÃvel de unidades de discurso menores (por exemplo, parÃĄgrafos ou seçÃĩes) e subsequentemente integra essas previsÃĩes locais para determinar a posiçÃĢo geral do artigo.
âEssa estrutura ÃĐ projetada para reter o contexto local e capturar sinais de posiçÃĢo dispersos ao avaliar como diferentes partes de uma histÃģria de notÃcias contribuem para sua posiçÃĢo geral sobre um assunto.â
Para esse fim, os autores compilaram um conjunto de dados novo intitulado K-NEWS-STANCE, extraÃdo da cobertura de notÃcias coreanas entre junho de 2022 e junho de 2024. Os artigos foram identificados primeiro por meio do BigKinds, um serviço de metadados apoiado pelo governo operado pela FundaçÃĢo da Imprensa da Coreia, e os textos completos foram recuperados usando a API do agregador de notÃcias Naver. O conjunto de dados final compreendia 2.000 artigos de 31 veÃculos, cobrindo 47 questÃĩes de relevÃĒncia nacional.
Cada artigo foi anotado duas vezes: uma vez para sua posiçÃĢo geral em relaçÃĢo a um determinado assunto e novamente para segmentos individuais; especificamente a manchete, lead, conclusÃĢo e citaçÃĩes diretas.
A anotaçÃĢo foi liderada pelo especialista em jornalismo Jiyoung Han, tambÃĐm o terceiro autor do artigo, que orientou o processo por meio do uso de sinais estabelecidos de estudos de mÃdia, como seleçÃĢo de fontes, enquadramento lexical e padrÃĩes de citaçÃĢo. Por esses meios, um total de 19.650 rÃģtulos de posiçÃĢo de nÃvel de segmento foram obtidos.
Para garantir que os artigos contenham sinais de posiçÃĢo significativos, cada um foi classificado por gÊnero, e apenas aqueles rotulados como anÃĄlise ou opiniÃĢo (onde o enquadramento subjetivo ÃĐ mais provÃĄvel de ser encontrado) foram usados para anotaçÃĢo de posiçÃĢo.
Dois annotadores treinados rotularam todos os artigos e foram instruÃdos a consultar artigos relacionados caso a posiçÃĢo nÃĢo estivesse clara, com desacordos resolvidos por meio de discussÃĢo e revisÃĢo adicional.

Entradas de amostra do conjunto de dados K-NEWS-STANCE, traduzidas para o inglÊs. Apenas a manchete, lead e citaçÃĩes sÃĢo mostradas; o texto do corpo ÃĐ omitido. Destaque indica rÃģtulos de posiçÃĢo para citaçÃĩes, com azul para apoio e vermelho para oposiçÃĢo. Por favor, consulte o PDF da fonte citada para uma representaçÃĢo mais clara.
JoA-ICL
Em vez de tratar um artigo como um bloco de texto Único, o sistema proposto pelos autores divide-o em partes estruturais-chave: manchete, lead, citaçÃĩes e conclusÃĢo, atribuindo cada uma delas a um agente de modelo de linguagem, que rotula o segmento como apoio, oposiçÃĢo ou neutro.
Essas previsÃĩes locais sÃĢo passadas para um segundo agente que decide a posiçÃĢo geral do artigo, com os dois agentes coordenados por um controlador que prepara os prompts e reÚne os resultados.
Assim, o JoA-ICL adapta o aprendizado de contexto (onde o modelo aprende com exemplos no prompt) para corresponder à maneira como as histÃģrias de notÃcias profissionais sÃĢo escritas, usando prompts de segmento cientes em vez de uma entrada genÃĐrica Única.
(Por favor, note que a maioria dos exemplos e ilustraçÃĩes no artigo sÃĢo longos e difÃceis de reproduzir de forma legÃvel em um artigo online. Portanto, pedimos ao leitor que examine o PDF original da fonte)
Dados e Testes
Nos testes, os pesquisadores usaram macro F1 e precisÃĢo para avaliar o desempenho, mÃĐdia dos resultados sobre dez execuçÃĩes com sementes aleatÃģrias de 42 a 51 e relatando erro padrÃĢo. Os dados de treinamento foram usados para ajustar os modelos de base e os agentes de nÃvel de segmento, com amostras de poucos disparos selecionadas por meio de busca de similaridade usando KLUE-RoBERTa-large.
Os testes foram executados em trÊs GPUs RTX A6000 (cada uma com 48GB de VRAM), usando Python 3.9.19, PyTorch 2.5.1, Transformers 4.52.0 e vLLM 0.8.5.
GPT-4o-mini, Claude 3 Haiku e Gemini 2 Flash foram utilizados por meio de API, a uma temperatura de 1,0 e com tokens mÃĄximo definidos para 1000 para prompts de cadeia de pensamento, e 100 para os demais.
Para o ajuste completo do Exaone-3.5-2.4B, o otimizador AdamW foi usado a uma taxa de aprendizado de 5e-5, com decaimento de peso de 0,01, 100 passos de aquecimento e com os dados treinados por 10 ÃĐpocas a um tamanho de lote de 6.
Para as linhas de base, os autores usaram RoBERTa, ajustado para detecçÃĢo de posiçÃĢo de nÃvel de artigo; Embeddings de Cadeia de Pensamento (CoT), um ajuste alternativo do RoBERTa para a tarefa atribuÃda; LKI-BART, um modelo codificador-decodificador que adiciona conhecimento contextual de um grande modelo de linguagem por meio de prompts com o texto de entrada e o rÃģtulo de posiçÃĢo pretendido; e PT-HCL, um mÃĐtodo que usa aprendizado contrastivo para separar recursos gerais daqueles especÃficos do assunto-alvo:

Desempenho de cada modelo no conjunto de teste K-NEWS-STANCE para previsÃĢo de posiçÃĢo geral. Os resultados sÃĢo mostrados como macro F1 e precisÃĢo, com a pontuaçÃĢo mais alta em cada grupo em negrito.
O JoA-ICL alcançou o melhor desempenho geral em ambas as precisÃĩes e macro F1, uma vantagem evidente em todos os trÊs modelos de backbone testados: GPT-4o-mini, Claude 3 Haiku e Gemini 2 Flash.
O mÃĐtodo baseado em segmentos consistentemente superou todas as outras abordagens, com, observam os autores, uma vantagem notÃĄvel na detecçÃĢo de posiçÃĩes de apoio, uma fraqueza comum em modelos semelhantes.
Os modelos de base apresentaram um desempenho pior em geral. RoBERTa e variantes de Cadeia de Pensamento lutaram com casos nuances, enquanto PT-HCL e LKI-BART se saÃram melhor, embora ainda atrÃĄs do JoA-ICL em muitas categorias. O resultado mais preciso individual veio do JoA-ICL (Claude), com 64,8% de macro F1 e 66,1% de precisÃĢo.
A imagem abaixo mostra com que frequÊncia os modelos acertaram cada rÃģtulo certo ou errado:

Matrizes de confusÃĢo comparando a linha de base e o JoA-ICL, mostrando que ambos os mÃĐtodos lutam mais com a detecçÃĢo de posiçÃĩes de apoio.
O JoA-ICL se saiu melhor em geral do que a linha de base, acertando mais rÃģtulos corretos em cada categoria. No entanto, ambos os modelos lutaram mais com artigos de apoio, e a linha de base os classificou erroneamente como neutros quase na metade das vezes.
O JoA-ICL cometeu menos erros, mas mostrou o mesmo padrÃĢo, reforçando que as âposiçÃĩes positivasâ sÃĢo mais difÃceis para os modelos detectar.
Para testar se o JoA-ICL funciona alÃĐm dos limites da lÃngua coreana, os autores o executaram no CheeSE, um conjunto de dados alemÃĢo para detecçÃĢo de posiçÃĢo de nÃvel de artigo. Como o CheeSE nÃĢo possui rÃģtulos de nÃvel de segmento, os pesquisadores usaram supervisÃĢo distante, onde cada segmento foi atribuÃdo ao mesmo rÃģtulo de posiçÃĢo que o artigo completo.

Resultados de detecçÃĢo de posiçÃĢo no conjunto de dados CheeSE em alemÃĢo. O JoA-ICL melhora consistentemente sobre a prompting zero-shot em todos os trÊs LLMs e supera as linhas de base ajustadas, com o Gemini-2.0-flash produzindo o desempenho geral mais forte.
Mesmo sob essas condiçÃĩes âbarulhentasâ, o JoA-ICL superou tanto os modelos ajustados quanto a prompting zero-shot. Dos trÊs backbones testados, o Gemini-2.0-flash deu os melhores resultados.
ConclusÃĢo
Poucas tarefas em aprendizado de mÃĄquina sÃĢo mais carregadas politicamente do que a previsÃĢo de posiçÃĢo; no entanto, ÃĐ frequentemente tratada em termos frios e mecÃĒnicos, enquanto mais atençÃĢo ÃĐ dada a questÃĩes menos complexas em IA geradora, como criaçÃĢo de vÃdeo e imagem, que desencadeiam manchetes mais altas.
A desenvolvimento mais encorajador no novo trabalho coreano ÃĐ que ele oferece uma contribuiçÃĢo significativa para a anÃĄlise de conteÚdo de longa forma, em vez de tweets e mÃdias sociais de curta forma, cujos efeitos incendiÃĄrios sÃĢo mais rapidamente esquecidos do que um tratado, ensaio ou outra obra significativa.
Uma omissÃĢo notÃĄvel no novo trabalho e (atÃĐ onde posso perceber) no corpus de previsÃĢo de posiçÃĢo em geral ÃĐ a falta de consideraçÃĢo dada aos hiperlinks, que frequentemente se substituem por citaçÃĩes como recursos opcionais para os leitores aprenderem mais sobre um assunto; no entanto, deve ser claro que a escolha de tais URLs ÃĐ potencialmente muito subjetiva e atÃĐ polÃtica.
Isso posto, quanto mais prestigioso a publicaçÃĢo, menos provÃĄvel que ela incluirÃĄ qualquer link que oriente o visualizador para longe do domÃnio hospedeiro; isso, juntamente com outros usos e abusos de SEO de hiperlinks, os torna mais difÃceis de quantificar do que citaçÃĩes explÃcitas, tÃtulos ou outras partes de um artigo que podem buscar, consciente ou inconscientemente, influenciar a opiniÃĢo do leitor.
Â
Publicado pela primeira vez na quarta-feira, 16 de julho de 2025












