Ãngulo de Anderson
Mesmo o AI BÃĄsico Agora Pode Escrever NotÃcias que Passam por Humanas

Pesquisas recentes indicam que atÃĐ mesmo pequenos modelos de AI locais podem escrever notÃcias que as pessoas nÃĢo conseguem distinguir do jornalismo real, igualando os principais sistemas e deixando os leitores incapazes de determinar quem escreveu o que.
Â
De acordo com uma nova colaboraçÃĢo de pesquisa entre a Alemanha e a França, os humanos nÃĢo conseguem determinar se um artigo de notÃcias foi escrito por um AI ou por um humano â mesmo quando foi escrito por modelos de cÃģdigo aberto que podem ser baixados e executados em computadores de mesa de nÃvel de consumidor relativamente mÃĐdio.
Em outro indicativo de que o pequeno AI estÃĄ em ascensÃĢo, uma pesquisa de 2.318 julgamentos coletados de 1.054 participantes em um portal de estudo acadÊmico dedicado encontrou que os leitores humanos nÃĢo puderam identificar a proveniÊncia de um artigo em um nÃvel superior ao acaso, mesmo quando foi produzido por modelos relativamente modestos com apenas sete bilhÃĩes de parÃĒmetros, incluindo Mistral e Llama variantes:

MÃĐdias e pontuaçÃĩes de autenticidade para LLMs testados. Os 200 bilhÃĩes de parÃĒmetros do GPT-4o nÃĢo excedem massivamente os 7B parÃĒmetros dos modelos menores. Os testados para o estudo foram Gemma 7B, Phi-3 Mini, LLaMA-2 13B, Mistral 7B, GPT-4o e GPT-3.5. Fonte
Os autores estÃĢo retornando a um assunto que eles examinaram pela primeira vez na liberaçÃĢo de 2024 BÊnçÃĢo ou maldiçÃĢo? Uma pesquisa sobre o Impacto da InteligÊncia Geradora Artificial em NotÃcias Falsas. Os resultados em si sÃĢo novos, resultados liberados de um projeto maior inicialmente anunciado em janeiro, e fazem uso do prÃģprio framework de participaçÃĢo online JudgeGPT dos autores.
Poder Leve
Intitulado Os Humanos Podem Dizer? Um Estudo de Dois Eixos da PercepçÃĢo Humana de NotÃcias Geradas por LLM, e vindo de trÊs pesquisadores da Universidade de CiÊncias Aplicadas de Frankfurt e da unidade de pesquisa IRISA em Nantes, a nova pesquisa faz uma distinçÃĢo importante entre ânotÃcias falsasâ e ânotÃcias escritas por AIâ (jÃĄ que notÃcias falsas podem ser escritas por pessoas ou por AI, e os dois aspectos nÃĢo sÃĢo necessariamente sinÃīnimos).
No entanto, talvez o aspecto mais interessante seja a conclusÃĢo do artigo de que modelos menores, incluindo Mistral 7B e Gemma 7B, podem, com apenas sete bilhÃĩes de parÃĒmetros, rivalizar com os modelos como o ChatGPT (4o) com 200 bilhÃĩes de parÃĒmetros:
âOs modelos de peso aberto com tÃĢo poucos quanto 7B parÃĒmetros produzem texto avaliado de forma diferente do output do GPT-4o, indicando que a capacidade de gerar texto indistinguÃvel de humano nÃĢo estÃĄ mais restrita a modelos de fronteira.â
No entanto, ânotÃcias geradas por AIâ podem representar muitos tipos diferentes de colaboraçÃĢo humano/AI, desde verificaçÃĢo ortogrÃĄfica atÃĐ deferral completo de esforço, e o estudo nÃĢo deixa claro exatamente que tipo de conteÚdo de AI foi produzido para os testes (embora ele esboce a metodologia para produzi-lo â veja abaixo).
MÃĐtodo
Para os participantes engajados com a plataforma JudgeGPT, cada fragmento de notÃcias foi avaliado usando um framework de dois eixos no qual eles forneceram trÊs classificaçÃĩes independentes em contÃnuos sliders de 0-100:

O portal GUI do JudgeGPT, onde os avaliadores avaliam o material em atribuiçÃĢo de fonte; autenticidade; e familiaridade com o tÃģpico. Por favor, consulte o papel da fonte para melhor resoluçÃĢo.
Julgamento de fonte capturou se uma passagem parecia escrita por mÃĄquina ou por humano; Julgamento de autenticidade, se era percebido como falso ou legÃtimo; e Familiaridade com o tÃģpico, como bem o leitor conhecia o assunto.
Escala contÃnua foi usada em vez de uma Escala Likert, para capturar graus de certeza mais precisamente, e para apoiar a anÃĄlise estatÃstica, incluindo CorrelaçÃĢo de Pearson e Agrupamento.
Fragmentos de texto gerados por mÃĄquina foram produzidos pelo prÃģprio framework RogueGPT dos autores, a arquitetura de alimentaçÃĢo para o JudgeGPT. O RogueGPT orquestra contribuiçÃĩes de seis Large Language Models (LLMs): ChatGPT-4; ChatGPT-3.5; ChatGPT-4o; LLaMA-2 13B; Gemma 7B; e Mistral 7B.
Comandos baseados em persona foram usados para gerar os textos, e as geraçÃĩes de AI foram fundamentadas em tÃģpicos de notÃcias reais e verificadas por humanos.
Inversamente, fragmentos escritos por humanos foram amostrados de âveÃculos de notÃcias estabelecidosâ e âbases de dados de informaçÃĩesâ nÃĢo especificadas.
Os autores observam:
âO conjunto de estÃmulo ÃĐ intencionalmente inclinado em direçÃĢo a fragmentos de origem de mÃĄquina (âž98%), com itens de origem humana servindo como ÃĒncoras de calibraçÃĢo.
âEssa escolha de design reflete o foco do estudo na variaçÃĢo dentro da AI (across models) em vez de comparaçÃĢo humano-AI; os participantes nÃĢo sÃĢo informados da taxa de base, e os resultados de detecçÃĢo quase aleatÃģria [resultados] seguram quando analisados no subconjunto de origem humana apenas.â
Os participantes primeiro deram consentimento informado e completaram um questionÃĄrio demogrÃĄfico que cobria idade, educaçÃĢo, orientaçÃĢo polÃtica e familiaridade com a IA, apÃģs o que avaliaram a sequÊncia de fragmentos de notÃcias.
Cada pessoa revisou entre 5-87 itens, com uma mediana de 12, enquanto a ordem de apresentaçÃĢo foi randomizada, e a atribuiçÃĢo do modelo foi equilibrada entre os participantes, para reduzir o viÃĐs. A plataforma registrou as trÊs classificaçÃĩes de slider ao lado do tempo de resposta e um identificador anÃīnimo, permitindo que os julgamentos individuais fossem vinculados a fatores de segundo plano.
Os autores tomam cuidado para apontar que a amostra foi inclinada em direçÃĢo a participantes europeus educados, com 68% com educaçÃĢo universitÃĄria, e 74% baseados na Europa â um viÃĐs que o artigo nota como uma limitaçÃĢo para uma generalizaçÃĢo mais ampla.
Testes
Os testes sÃĢo divididos em cinco tipos de descobertas: distinguir texto gerado por mÃĄquina de texto escrito por humanos; comparar a detecçÃĢo entre diferentes LLMs; examinar o efeito da expertise de domÃnio versus orientaçÃĢo polÃtica na precisÃĢo; identificar estratÃĐgias de resposta distintas entre os participantes; e rastrear como a precisÃĢo muda ao longo de avaliaçÃĩes repetidas, devido à fadiga:

Resumo das cinco principais descobertas de 2.318 julgamentos em 1.054 participantes, mostrando que a detecçÃĢo humana de texto escrito por AI permaneceu em nÃveis de acaso em todos os modelos, que a precisÃĢo foi vinculada à expertise de domÃnio e nÃĢo à orientaçÃĢo polÃtica, que os participantes se agruparam em perfis de confiança distintos, e que o desempenho declinou apÃģs cerca de 30 avaliaçÃĩes, devido à fadiga cognitiva.
O teste mostrou nenhuma diferença significativa acima do acaso no escore de fonte entre as condiçÃĩes, aparentemente indicando que os participantes nÃĢo conseguem distinguir texto gerado por AI de saÃda humana:

DistribuiçÃĩes de escore de fonte e autenticidade para fragmentos de origem de mÃĄquina e humana mostram uma sobreposiçÃĢo substancial, sem separaçÃĢo significativa entre as duas condiçÃĩes, e testes estatÃsticos â indicando que os participantes nÃĢo puderam distinguir confiavelmente texto gerado por AI de conteÚdo escrito por humanos.
Para o segundo aspecto, como mostrado no grÃĄfico no inÃcio do artigo, a falha de detecçÃĢo nÃĢo variou por modelo, pois as saÃdas de todos os LLMs se agruparam em torno de julgamentos de nÃvel de acaso, sem diferenças significativas entre eles. Mesmo os sistemas de peso aberto menores, como Mistral 7B e Gemma 7B, foram avaliados de forma diferente do GPT-4o, indicando que o texto indistinguÃvel de humano pode nÃĢo estar mais limitado aos maiores modelos.
Para o terceiro aspecto, a precisÃĢo foi mais fortemente vinculada à expertise de domÃnio do que à orientaçÃĢo polÃtica, pois a familiaridade com notÃcias falsas se correlacionou com melhores julgamentos, enquanto as visÃĩes polÃticas nÃĢo mostraram efeito significativo, sugerindo que habilidades analÃticas aprendidas podem ser mais importantes do que ideologia:

Resultados para a terceira linha de investigaçÃĢo mostraram que a orientaçÃĢo polÃtica nÃĢo teve efeito significativo na atribuiçÃĢo de fonte ou pontuaçÃĢo de autenticidade, com apenas tendÊncias fracas e nÃĢo significativas, enquanto a familiaridade autodeclarada com notÃcias falsas foi associada a maior precisÃĢo em ambos os eixos. Isso sugere que a habilidade analÃtica baseada na experiÊncia foi um preditor mais forte de desempenho do que a posiçÃĢo ideolÃģgica. Por favor, consulte o papel da fonte para melhor resoluçÃĢo.
O quarto achado mostrou que os participantes se agruparam em dois estilos de resposta distintos identificados como âCÃĐticosâ â que atribuÃram confiança baixa em todo o conteÚdo, independentemente da origem â e âCrentesâ â que mantiveram uma base de confiança mais alta.
Finalmente, com relaçÃĢo ao quinto objetivo, uma anÃĄlise de julgamentos sequenciais mostrou que os participantes inicialmente se tornaram melhores na tarefa, com a precisÃĢo melhorando ao longo das primeiras 15-20 avaliaçÃĩes, à medida que se adaptavam ao formato:

MÃĐdias mÃģveis de escore de atribuiçÃĢo de fonte e autenticidade ao longo da sequÊncia de avaliaçÃĩes dos participantes mostram uma curta fase de melhoria inicial, à medida que os usuÃĄrios parecem se adaptar à tarefa durante as primeiras 15â20 itens, seguida de um declÃnio constante em ambas as medidas apÃģs cerca de 30 avaliaçÃĩes. Por favor, consulte o papel da fonte para melhor resoluçÃĢo.
No entanto, esse efeito foi de curta duraçÃĢo, pois o desempenho começou a declinar apÃģs cerca de 30 itens, com os participantes cada vez mais defaultando para rotular o conteÚdo como falso â uma mudança interpretada como fadiga cognitiva, e sugerindo limites claros sobre o quanto as abordagens baseadas em detecçÃĢo podem permanecer eficazes na prÃĄtica.
Isso pode representar alguma evidÊncia empÃrica de que, exaustos pela perspectiva de distinguir notÃcias falsas de reais, notÃcias de AI de humanas, podemos tender a defaultar para supor que as notÃcias sÃĢo de AI e/ou falsas (nÃĢo necessariamente a mesma coisa), para estar âno lado seguroâ. Aqueles que consideram isso âpreguiçosoâ, e consideram que as pessoas devem fazer sua prÃģpria pesquisa para verificar uma possÃvel histÃģria de notÃcias falsas, podem estar interessados em aprender que um estudo de 2024 indicou que isso sÃģ piora os problemas.
Os autores sugerem que a falha do julgamento humano evidenciada nos resultados indica que podemos precisar delegar essas questÃĩes a tecnologias de proveniÊncia criptogrÃĄfica, como a iniciativa C2PA liderada pela Adobe. Outras soluçÃĩes possÃveis mencionadas sÃĢo o prÃģprio framework OriginLens dos autores, e outro projeto chamado CRED-1.
Os autores concluem:
âOs humanos podem dizer? Nosso estudo de dois eixos de 2.318 julgamentos em seis famÃlias de LLM fornece uma resposta empÃrica clara: eles nÃĢo podem.
âO texto gerado por mÃĄquina ÃĐ indistinguÃvel do texto escrito por humanos, independentemente do tamanho do modelo ou da famÃlia, a expertise de domÃnio prevÊ a precisÃĢo de detecçÃĢo mais fortemente do que a orientaçÃĢo polÃtica, os participantes adotam estratÃĐgias de confiança distintas, e a fadiga cognitiva limita a detecçÃĢo sustentada.
âEssas descobertas apoiam uma mudança de detecçÃĢo de nÃvel de usuÃĄrio para contramedidas de nÃvel de sistema, incluindo proveniÊncia de conteÚdo, indicadores de confiança adaptÃĄveis e intervençÃĩes de imunizaçÃĢo limitadas.â
ConclusÃĢo
O aspecto preocupante deste artigo ÃĐ a rede de apoio de projetos e artigos que os autores â ou alguns dos autores, dependendo do trabalho â originaram ou tÊm uma mÃĢo; e certamente teria sido esclarecedor se pudÃĐssemos ter estudado amostras de texto de AI e humano que produziram esses resultados, para entender melhor o tipo de saÃda que a metodologia de geraçÃĢo descrita produz.
No entanto, ÃĐ intrigante ouvir que modelos de cÃģdigo aberto e de peso aberto podem comparar-se a gigantes impulsionados por API, como a sÃĐrie ChatGPT â serÃĄ que a tarefa em questÃĢo nÃĢo ÃĐ tÃĢo difÃcil, e que um modelo de 200 bilhÃĩes de parÃĒmetros ÃĐ excessivo para essas tarefas? PrecisarÃamos saber um pouco mais sobre as amostras de fonte de AI e humanas submetidas para responder a essa pergunta.
Enquanto isso, de acordo com o site canirun.ai, o Mistral 7B (que estava mais ou menos empatado com o ChatGPT-4o nos testes) âexecuta bemâ em uma NVIDIA RTX 3080 com 16GB de VRAM, e executa âdecenteâ em uma 3060 com 6GB de VRAM â dificilmente os cartÃĩes grÃĄficos mais recentes ou melhores em jogo*. Portanto, qualquer um que queira criar sua prÃģpria metodologia para submissÃĢo de amostras pode aparentemente participar desses experimentos tambÃĐm.
Â
* O Gemma 7B nÃĢo estÃĄ listado no site.
Publicado pela primeira vez na quinta-feira, 9 de abril de 2026












