Ângulo de Anderson

Saída ‘Criativa’ dos Modelos de IA Está se Tornando Similar entre os Provedores

mm
Adicione Unite.AI às suas fontes preferidas no Google
AI-Generated article illustration (GPT Image 2): three overlapping white envelopes carry Shakespeare stamps labeled 'CLAUDE', 'CHATGPT' and 'GEMINI' in pink, green and blue, resting on a wooden surface. A yellow-and-black warning-style border surrounds the scene, reading 'AI FANTASY INSIDE' and 'REALITY OUTSIDE', with black arrows and striped corner markings.

Novas pesquisas sugerem que os modelos de IA de empresas concorrentes estão se tornando mais semelhantes em suas respostas criativas, potencialmente reduzindo a variedade de ideias que os usuários encontram.

 

Novas pesquisas dos EUA descobriram que a produção ‘criativa’ em uma ampla gama de principais modelos de IA está se tornando mais semelhante ao longo do tempo.

Os autores, da Duke University, testaram 69 modelos de 12 famílias de provedores, abrangendo lançamentos de 2023 a 2026, e encontraram uma queda estatisticamente significativa na diversidade de saídas tanto em perguntas abertas do mundo real quanto em um teste padrão de criatividade – sugerindo que ideias semelhantes podem ser oferecidas em resposta a solicitações ‘criativas’, cada vez mais, entre todos os principais provedores de LLM.

As famílias de provedores testadas foram Anthropic; Cohere; DeepSeek; Google; Meta; MiniMax; Mistral AI; Moonshot AI; OpenAI; Qwen; xAI; e Z.ai*:

From the new paper - model releases used in the study, from março de 2023 to julho de 2026. The chart covers 68 mode versions across 12 AI providers, demonstrating how the models tested were distributed across the three-year period, and showing increasingly frequent release schedules for some providers, which has to be accounted for in the authors' reckonings. Source - https://arxiv.org/pdf/2608.19437

Do novo artigo – lançamentos de modelos usados no estudo, de março de 2023 a julho de 2026. O gráfico abrange 69 versões de modelo em 12 provedores de IA, demonstrando como os modelos testados foram distribuídos ao longo do período de três anos, e mostrando cronogramas de lançamentos cada vez mais frequentes para alguns provedores, o que deve ser considerado nos cálculos dos autores. Source

Os autores do novo artigo afirmam**:

‘Concluímos que as respostas dos LLM aos prompts abertos que testamos tornaram-se cada vez mais semelhantes ao longo do tempo.’

‘Isso sugere que os LLMs estão se tornando menos criativos em tarefas que envolvem gerar respostas abertas, exigindo uma análise cuidadosa de sua utilidade a longo prazo como assistentes criativos.’

Embora a ‘monocultura algorítmica‘ tenha se tornado uma linha de estudo estabelecida, um exame das tendências de homogeneidade nas saídas criativas geradas por IA ainda não havia sido realizado, afirmam os autores.

Entretanto, incidentes isolados apontam para essa convergência há algum tempo, incluindo o caso estranho descrito no estudo de maio de 20026 da Universidade Cornell, onde uma variedade de provedores de LLM demonstraram obsessões estranhas e colididas sobre ‘guardas de farol’, e um conjunto particular de nomes anacrônicos, incluindo ‘Mara’ e ‘Elias’:

In May, Cornell University's new paper found strange similarities across LLM providers when given 'open prompts' – though no clues as to why have yet become apparent in the diverse training data fueling these models.

Em maio, o novo artigo da Universidade Cornell encontrou semelhanças estranhas entre provedores de LLM quando recebiam ‘prompts abertos’ – embora ainda não haja pistas sobre o motivo nas diversas bases de treinamento que alimentam esses modelos.

O novo estudo é mais sistemático: os autores testaram três anos de modelos tanto com prompts criativos do mundo real quanto com um teste clássico de psicologia que solicita usos incomuns para objetos cotidianos. Em seguida, mediram o quão diferentes eram as respostas dos modelos em termos de significado, acompanhando se essas distâncias diminuíam ao longo das gerações sucessivas.

Os autores do novo trabalho, intitulado Os LLMs estão se tornando igualmente criativos? Evidências de três anos de modelos, afirmam:

‘Nossas descobertas, embora preliminares, levantam preocupações sobre a utilidade a longo prazo dos LLMs como parceiros criativos. Mesmo que os modelos se desempenhem bem em tarefas criativas, saídas convergentes podem limitar o leque de possibilidades ao qual os usuários de LLM são expostos e, com isso, a amplitude de seu próprio pensamento.’

‘Se usar um LLM para tarefas criativas como redação de ensaios diminui a atividade cerebral, será que usar LLMs cada vez menos criativos – a tendência sugerida por nosso estudo – pode piorar ainda mais os efeitos dos LLMs na criatividade humana, como observado neste e em outros estudos?’

Já as diversas características da saída de texto dos LLMs tornaram-se material para memes; e, como relatamos em maio deste ano, pelo menos um autor já auto-publicou um livro aparentemente apresentando a fixação de ‘farol’ mencionada, comum aos principais modelos.

Portanto, em um cenário em que editoras estão retirando cada vez mais livros que suspeitam ser escritos por IA ou com auxílio de IA, a nova pesquisa parece indicar que podemos esperar um aumento de ‘coincidências de enredo’ surgindo de obras aparentemente escritas por humanos, incluindo trabalhos acadêmicos submetidos por estudantes.

Quanto à origem dessa convergência, os autores hipotetizam que dados de treinamento sobrepostos e objetivos de otimização cada vez mais semelhantes podem estar empurrando os modelos em direção a representações internas comparáveis de conceitos e relações semânticas – produzindo, em última análise, respostas mais semelhantes:

‘[Isso] continua incerto se essa homogeneidade é um subproduto temporário de uma tecnologia ainda em desenvolvimento ou uma característica inevitável – potencialmente acumulativa – dos modelos de linguagem estatísticos.’

‘Forças plausíveis apontam em ambas as direções. Um crescente conjunto de trabalhos acadêmicos sugere que modelos generativos treinados em dados sobrepostos e otimizados para objetivos semelhantes organizarão conceitos e relações semânticas de forma cada vez mais semelhante, resultando em saídas semelhantes.’

Entretanto, os autores também citam trabalho indicando que, à medida que os modelos evoluem, eles podem divergir novamente em seu próprio conjunto isolado de características, no que se refere à produção criativa.

Método

Para acompanhar se os modelos de IA estão se tornando mais semelhantes, os pesquisadores começaram com perguntas abertas, coletando respostas de gerações sucessivas de modelos. Cada resposta foi convertida em uma representação numérica de seu significado, possibilitando medir o quão semelhantes ou diferentes as respostas eram.

Regressão foi então usada para determinar se essas diferenças estavam diminuindo à medida que novos modelos eram lançados:

The authors' schema for measuring whether AI outputs become more similar over time. Open-ended creative prompts are run across different model families, their answers mapped by meaning to measure the distance between them, with regression analysis tracking how those distances change across successive model generations.

O esquema dos autores para medir se as saídas de IA se tornam mais semelhantes ao longo do tempo. Prompts criativos abertos foram executados em diferentes famílias de modelos, suas respostas mapeadas por significado para medir a distância entre elas, com análise de regressão acompanhando como essas distâncias mudam ao longo de gerações sucessivas de modelos.

Dois conjuntos de prompts foram selecionados para testar a criatividade sob diferentes ângulos. Primeiro, a Tarefa de Usos Alternativos (AUT), um teste padrão de psicologia de pensamento divergente, solicita usos não convencionais para objetos comuns, com o estudo usando objetos como um livro, sapato e martelo. Seu formato fixo forneceu um método controlado para comparar as ideias produzidas por diferentes modelos.

Mais 100 prompts foram extraídos de Infinity-Chat100, uma coleção derivada de conversas reais com modelos de linguagem. Estes abrangeram tarefas criativas menos restritas envolvendo geração de conteúdo, resolução de problemas, brainstorming e ideação; tarefas que permitiriam maior liberdade quanto às respostas produzidas e às abordagens adotadas.

Os conjuntos completos de prompts AUT e Infinity-Chat100 foram então enviados a modelos lançados entre março de 2023 e julho de 2026, abrangendo 12 provedores e sistemas da Anthropic, Google, Meta, OpenAI, DeepSeek e Mistral AI. Todas as respostas foram coletadas através da API da OpenRouter sob as mesmas configurações de amostragem, com temperatura (liberdade para responder criativamente) e top-p ambos definidos como um.

Os modelos foram organizados por mês de lançamento para examinar se gerações mais recentes estavam produzindo respostas mais semelhantes.

Como as datas de lançamento não capturam realmente mudanças nos dados de treinamento, arquitetura ou pós-treinamento, os autores trataram a tendência resultante como uma associação com o desenvolvimento do modelo, em vez de evidência de que a passagem do tempo por si só causa convergência.

As respostas dos modelos foram então convertidas em embeddings usando o transformador de sentenças all-MiniLM-L6-v2. Cada resposta foi representada como um vetor numérico, permitindo que respostas com significados semelhantes fossem posicionadas em direções semelhantes e que sua distância semântica fosse medida.

Para o AUT, todos os usos sugeridos para cada objeto foram tratados como uma única resposta, produzindo dez embeddings por modelo. Para o Infinity-Chat100, cada resposta foi embutida separadamente, produzindo 100 embeddings por modelo.

Os 27 meses de lançamento foram agrupados em nove períodos de tempo, e apenas modelos de diferentes provedores foram comparados. As distâncias semânticas entre suas respostas foram medidas dentro de cada período, com distâncias menores indicando maior semelhança.

Para impedir que provedores com mais modelos dominassem os resultados, a análise foi repetida 1.000 vezes, usando amostras balanceadas de cada provedor.

Resultados

A regressão linear foi então usada para acompanhar essas distâncias ao longo do tempo, com uma inclinação negativa consistente indicando que os modelos de diferentes provedores estavam se tornando mais semelhantes:

Initial test results, showing whether creative responses from different AI providers became more similar over time. Semantic distances declined for both the Alternate Uses Task and Infinity-Chat100 prompts, while repeated balanced sampling produced consistently negative trends, indicating increasing similarity across model generations.

Resultados iniciais dos testes, mostrando se as respostas criativas de diferentes provedores de IA tornaram-se mais semelhantes ao longo do tempo. As distâncias semânticas diminuíram tanto para os prompts da Tarefa de Usos Alternativos quanto para os do Infinity-Chat100, enquanto a amostragem balanceada repetida produziu tendências consistentemente negativas, indicando aumento de similaridade entre gerações de modelos.

Desses resultados, os autores enfatizam:

‘Para ambos os conjuntos de respostas do AUT e do Infinity-Chat, observamos uma diminuição nas distâncias de saída entre provedores ao longo do período de observação.’

‘Isso sugere uma diminuição da diversidade – ou aumento da homogeneidade – das saídas criativas dos LLM ao longo do tempo.’

A diferença entre modelos antigos e novos foi mais clara na Tarefa de Usos Alternativos. A distância média entre respostas de diferentes provedores caiu de cerca de 0,50 nos modelos mais antigos para abaixo de 0,40 nos mais recentes, significando que suas respostas se tornaram substancialmente mais semelhantes. O mesmo padrão foi encontrado com o Infinity-Chat100, embora a mudança fosse menor, com a distância média caindo de cerca de 0,34 para pouco acima de 0,32.

Test results measuring how quickly answers from the different AI providers became more similar over time. The 'Alternate Uses' Task showed a much stronger decline in differences between models than Infinity-Chat, with both results remaining consistent across the researchers’ repeated sampling tests.

Resultados dos testes medindo a rapidez com que as respostas dos diferentes provedores de IA se tornaram mais semelhantes ao longo do tempo. A Tarefa de ‘Usos Alternativos’ mostrou uma queda muito mais forte nas diferenças entre modelos do que o Infinity-Chat, com ambos os resultados permanecendo consistentes nas repetições de amostragem dos pesquisadores.

A constatação também resistiu a todas as 1.000 rodadas de reamostragem balanceada. Em todos os casos, modelos mais recentes produziram respostas mais próximas entre si do que as de modelos mais antigos. O tamanho dessas quedas, juntamente com os intervalos de confiança de 95% dos pesquisadores, são mostrados acima.

Sobre isso, o artigo afirma:

‘A magnitude da queda no AUT é particularmente notável dado o propósito da tarefa. O AUT testa explicitamente o pensamento divergente ao instruir os modelos a produzir usos tão originais e inesperados quanto possível, sendo precisamente o cenário em que se esperaria que as saídas fossem diferentes.’

Os resultados do Infinity-Chat mostram que a mesma tendência também apareceu em uma gama muito mais ampla de tarefas criativas. Seus 100 prompts pediram aos modelos que produzissem muitos tipos diferentes de respostas abertas, e essas respostas tornaram-se mais semelhantes ao longo do tempo.

A mudança foi menor do que na Tarefa de Usos Alternativos, mas ficou mais clara entre os modelos lançados a partir de 2025. Os autores sugerem que isso pode ser um sinal precoce de que as saídas criativas de diferentes provedores de IA estão se tornando mais semelhantes em geral, e não apenas em um tipo particular de teste.

Conclusão

Questões relacionadas à convergência de LLM e VLM são uma fonte de preocupação contínua e crescente na comunidade de pesquisa e entre os consumidores dos modelos subsequentes que deles derivam. Estamos chegando ao fim da primeira e única geração ‘pura’ de dados que a cena de pesquisa terá acesso; e a determinação dos provedores de modelos em extrair os dados dos concorrentes inevitavelmente gera risco de convergência, já que os dados estão se tornando idênticos e os princípios de treinamento de modelos são semelhantes, se não idênticos, entre os provedores.

Portanto, nada tão simples como substituir travessões provavelmente surgirá para combater a crescente semelhança das saídas criativas entre as famílias de modelos, e casos de duplicação, em vez disso, provavelmente virão à tona de maneiras bastante públicas e embaraçosas.

 

* A lista completa de modelos é Claude-3-Haiku; Claude-Fable-5; Claude-Opus-4; Claude-Opus-4.1; Claude-Opus-4.5; Claude-Opus-4.6; Claude-Opus-4.7; Claude-Opus-4.8; Command-A; Command-R-08-2024; DeepSeek-Chat; DeepSeek-V3.1-Terminus; DeepSeek-V3.2; DeepSeek-V4-Pro; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3.1-Pro-Preview; Gemini-3.5-Flash; Llama-3.1-70B-Instruct; Llama-3.2-3B-Instruct; Llama-3.3-70B-Instruct; Llama-4-Maverick; MiniMax-01; MiniMax-M1; MiniMax-M2; MiniMax-M2.1; MiniMax-M2.5; MiniMax-M2.7; MiniMax-M3; Mistral-Large; Mistral-Large-2407; Mistral-Large-2512; Mistral-Medium-3; Mistral-Medium-3.5; Mistral-Medium-3.1; Mistral-Small-24B-Instruct-2501; Mistral-Small-2603; Mistral-Small-3.1-24B-Instruct; Mistral-Small-3.2-24B-Instruct; Mixtral-8x22B-Instruct; Kimi-K2; Kimi-K2-0905; Kimi-K2.5; Kimi-K2.6; GPT-3.5-Turbo; GPT-4; GPT-4.1; GPT-4o; GPT-5; GPT-5.1; GPT-5.2; GPT-5.3-Chat; GPT-5.4; GPT-5.5; GPT-5.6-Sol; Qwen-2.5-72B-Instruct; Qwen3-Max; Qwen3.5-Plus-20260420; Qwen3.6-Max-Preview; Qwen3.7-Max; Grok-4.20; Grok-4.3; Grok-4.5; GLM-4.5; GLM-4.6; GLM-4.7; GLM-5; GLM-5.1; e GLM-5.2

** Ênfases dos autores, não minhas.

Minha conversão das citações inline dos autores para hyperlinks.

Primeira publicação sexta‑feira, 21 de agosto de 2026

Escritor em aprendizado de máquina, especialista em síntese de imagem humana. Antigo chefe de conteúdo de pesquisa da Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: martin@martinanderson.ai