Ângulo de Anderson
Saída ‘Criativa’ dos Modelos de IA Está se Tornando Similar entre os Provedores

Novas pesquisas sugerem que os modelos de IA de empresas concorrentes estão se tornando mais semelhantes em suas respostas criativas, potencialmente reduzindo a variedade de ideias que os usuários encontram.
Novas pesquisas dos EUA descobriram que a produção ‘criativa’ em uma ampla gama de principais modelos de IA está se tornando mais semelhante ao longo do tempo.
Os autores, da Duke University, testaram 69 modelos de 12 famílias de provedores, abrangendo lançamentos de 2023 a 2026, e encontraram uma queda estatisticamente significativa na diversidade de saídas tanto em perguntas abertas do mundo real quanto em um teste padrão de criatividade – sugerindo que ideias semelhantes podem ser oferecidas em resposta a solicitações ‘criativas’, cada vez mais, entre todos os principais provedores de LLM.
As famílias de provedores testadas foram Anthropic; Cohere; DeepSeek; Google; Meta; MiniMax; Mistral AI; Moonshot AI; OpenAI; Qwen; xAI; e Z.ai*:

Do novo artigo – lançamentos de modelos usados no estudo, de março de 2023 a julho de 2026. O gráfico abrange 69 versões de modelo em 12 provedores de IA, demonstrando como os modelos testados foram distribuídos ao longo do período de três anos, e mostrando cronogramas de lançamentos cada vez mais frequentes para alguns provedores, o que deve ser considerado nos cálculos dos autores. Source
Os autores do novo artigo afirmam**:
‘Concluímos que as respostas dos LLM aos prompts abertos que testamos tornaram-se cada vez mais semelhantes ao longo do tempo.’
‘Isso sugere que os LLMs estão se tornando menos criativos em tarefas que envolvem gerar respostas abertas, exigindo uma análise cuidadosa de sua utilidade a longo prazo como assistentes criativos.’
Embora a ‘monocultura algorítmica‘ tenha se tornado uma linha de estudo estabelecida, um exame das tendências de homogeneidade nas saídas criativas geradas por IA ainda não havia sido realizado, afirmam os autores.
Entretanto, incidentes isolados apontam para essa convergência há algum tempo, incluindo o caso estranho descrito no estudo de maio de 20026 da Universidade Cornell, onde uma variedade de provedores de LLM demonstraram obsessões estranhas e colididas sobre ‘guardas de farol’, e um conjunto particular de nomes anacrônicos, incluindo ‘Mara’ e ‘Elias’:
Em maio, o novo artigo da Universidade Cornell encontrou semelhanças estranhas entre provedores de LLM quando recebiam ‘prompts abertos’ – embora ainda não haja pistas sobre o motivo nas diversas bases de treinamento que alimentam esses modelos.
O novo estudo é mais sistemático: os autores testaram três anos de modelos tanto com prompts criativos do mundo real quanto com um teste clássico de psicologia que solicita usos incomuns para objetos cotidianos. Em seguida, mediram o quão diferentes eram as respostas dos modelos em termos de significado, acompanhando se essas distâncias diminuíam ao longo das gerações sucessivas.
Os autores do novo trabalho, intitulado Os LLMs estão se tornando igualmente criativos? Evidências de três anos de modelos, afirmam†:
‘Nossas descobertas, embora preliminares, levantam preocupações sobre a utilidade a longo prazo dos LLMs como parceiros criativos. Mesmo que os modelos se desempenhem bem em tarefas criativas, saídas convergentes podem limitar o leque de possibilidades ao qual os usuários de LLM são expostos e, com isso, a amplitude de seu próprio pensamento.’
‘Se usar um LLM para tarefas criativas como redação de ensaios diminui a atividade cerebral, será que usar LLMs cada vez menos criativos – a tendência sugerida por nosso estudo – pode piorar ainda mais os efeitos dos LLMs na criatividade humana, como observado neste e em outros estudos?’
Já as diversas características da saída de texto dos LLMs tornaram-se material para memes; e, como relatamos em maio deste ano, pelo menos um autor já auto-publicou um livro aparentemente apresentando a fixação de ‘farol’ mencionada, comum aos principais modelos.
Portanto, em um cenário em que editoras estão retirando cada vez mais livros que suspeitam ser escritos por IA ou com auxílio de IA, a nova pesquisa parece indicar que podemos esperar um aumento de ‘coincidências de enredo’ surgindo de obras aparentemente escritas por humanos, incluindo trabalhos acadêmicos submetidos por estudantes.
Quanto à origem dessa convergência, os autores hipotetizam que dados de treinamento sobrepostos e objetivos de otimização cada vez mais semelhantes podem estar empurrando os modelos em direção a representações internas comparáveis de conceitos e relações semânticas – produzindo, em última análise, respostas mais semelhantes†:
‘[Isso] continua incerto se essa homogeneidade é um subproduto temporário de uma tecnologia ainda em desenvolvimento ou uma característica inevitável – potencialmente acumulativa – dos modelos de linguagem estatísticos.’
‘Forças plausíveis apontam em ambas as direções. Um crescente conjunto de trabalhos acadêmicos sugere que modelos generativos treinados em dados sobrepostos e otimizados para objetivos semelhantes organizarão conceitos e relações semânticas de forma cada vez mais semelhante, resultando em saídas semelhantes.’
Entretanto, os autores também citam trabalho indicando que, à medida que os modelos evoluem, eles podem divergir novamente em seu próprio conjunto isolado de características, no que se refere à produção criativa.
Método
Para acompanhar se os modelos de IA estão se tornando mais semelhantes, os pesquisadores começaram com perguntas abertas, coletando respostas de gerações sucessivas de modelos. Cada resposta foi convertida em uma representação numérica de seu significado, possibilitando medir o quão semelhantes ou diferentes as respostas eram.
Regressão foi então usada para determinar se essas diferenças estavam diminuindo à medida que novos modelos eram lançados:
O esquema dos autores para medir se as saídas de IA se tornam mais semelhantes ao longo do tempo. Prompts criativos abertos foram executados em diferentes famílias de modelos, suas respostas mapeadas por significado para medir a distância entre elas, com análise de regressão acompanhando como essas distâncias mudam ao longo de gerações sucessivas de modelos.
Dois conjuntos de prompts foram selecionados para testar a criatividade sob diferentes ângulos. Primeiro, a Tarefa de Usos Alternativos (AUT), um teste padrão de psicologia de pensamento divergente, solicita usos não convencionais para objetos comuns, com o estudo usando objetos como um livro, sapato e martelo. Seu formato fixo forneceu um método controlado para comparar as ideias produzidas por diferentes modelos.
Mais 100 prompts foram extraídos de Infinity-Chat100, uma coleção derivada de conversas reais com modelos de linguagem. Estes abrangeram tarefas criativas menos restritas envolvendo geração de conteúdo, resolução de problemas, brainstorming e ideação; tarefas que permitiriam maior liberdade quanto às respostas produzidas e às abordagens adotadas.
Os conjuntos completos de prompts AUT e Infinity-Chat100 foram então enviados a modelos lançados entre março de 2023 e julho de 2026, abrangendo 12 provedores e sistemas da Anthropic, Google, Meta, OpenAI, DeepSeek e Mistral AI. Todas as respostas foram coletadas através da API da OpenRouter sob as mesmas configurações de amostragem, com temperatura (liberdade para responder criativamente) e top-p ambos definidos como um.
Os modelos foram organizados por mês de lançamento para examinar se gerações mais recentes estavam produzindo respostas mais semelhantes.
Como as datas de lançamento não capturam realmente mudanças nos dados de treinamento, arquitetura ou pós-treinamento, os autores trataram a tendência resultante como uma associação com o desenvolvimento do modelo, em vez de evidência de que a passagem do tempo por si só causa convergência.
As respostas dos modelos foram então convertidas em embeddings usando o transformador de sentenças all-MiniLM-L6-v2. Cada resposta foi representada como um vetor numérico, permitindo que respostas com significados semelhantes fossem posicionadas em direções semelhantes e que sua distância semântica fosse medida.
Para o AUT, todos os usos sugeridos para cada objeto foram tratados como uma única resposta, produzindo dez embeddings por modelo. Para o Infinity-Chat100, cada resposta foi embutida separadamente, produzindo 100 embeddings por modelo.
Os 27 meses de lançamento foram agrupados em nove períodos de tempo, e apenas modelos de diferentes provedores foram comparados. As distâncias semânticas entre suas respostas foram medidas dentro de cada período, com distâncias menores indicando maior semelhança.
Para impedir que provedores com mais modelos dominassem os resultados, a análise foi repetida 1.000 vezes, usando amostras balanceadas de cada provedor.
Resultados
A regressão linear foi então usada para acompanhar essas distâncias ao longo do tempo, com uma inclinação negativa consistente indicando que os modelos de diferentes provedores estavam se tornando mais semelhantes:
Resultados iniciais dos testes, mostrando se as respostas criativas de diferentes provedores de IA tornaram-se mais semelhantes ao longo do tempo. As distâncias semânticas diminuíram tanto para os prompts da Tarefa de Usos Alternativos quanto para os do Infinity-Chat100, enquanto a amostragem balanceada repetida produziu tendências consistentemente negativas, indicando aumento de similaridade entre gerações de modelos.
Desses resultados, os autores enfatizam:
‘Para ambos os conjuntos de respostas do AUT e do Infinity-Chat, observamos uma diminuição nas distâncias de saída entre provedores ao longo do período de observação.’
‘Isso sugere uma diminuição da diversidade – ou aumento da homogeneidade – das saídas criativas dos LLM ao longo do tempo.’
A diferença entre modelos antigos e novos foi mais clara na Tarefa de Usos Alternativos. A distância média entre respostas de diferentes provedores caiu de cerca de 0,50 nos modelos mais antigos para abaixo de 0,40 nos mais recentes, significando que suas respostas se tornaram substancialmente mais semelhantes. O mesmo padrão foi encontrado com o Infinity-Chat100, embora a mudança fosse menor, com a distância média caindo de cerca de 0,34 para pouco acima de 0,32.

Resultados dos testes medindo a rapidez com que as respostas dos diferentes provedores de IA se tornaram mais semelhantes ao longo do tempo. A Tarefa de ‘Usos Alternativos’ mostrou uma queda muito mais forte nas diferenças entre modelos do que o Infinity-Chat, com ambos os resultados permanecendo consistentes nas repetições de amostragem dos pesquisadores.
A constatação também resistiu a todas as 1.000 rodadas de reamostragem balanceada. Em todos os casos, modelos mais recentes produziram respostas mais próximas entre si do que as de modelos mais antigos. O tamanho dessas quedas, juntamente com os intervalos de confiança de 95% dos pesquisadores, são mostrados acima.
Sobre isso, o artigo afirma:
‘A magnitude da queda no AUT é particularmente notável dado o propósito da tarefa. O AUT testa explicitamente o pensamento divergente ao instruir os modelos a produzir usos tão originais e inesperados quanto possível, sendo precisamente o cenário em que se esperaria que as saídas fossem diferentes.’
Os resultados do Infinity-Chat mostram que a mesma tendência também apareceu em uma gama muito mais ampla de tarefas criativas. Seus 100 prompts pediram aos modelos que produzissem muitos tipos diferentes de respostas abertas, e essas respostas tornaram-se mais semelhantes ao longo do tempo.
A mudança foi menor do que na Tarefa de Usos Alternativos, mas ficou mais clara entre os modelos lançados a partir de 2025. Os autores sugerem que isso pode ser um sinal precoce de que as saídas criativas de diferentes provedores de IA estão se tornando mais semelhantes em geral, e não apenas em um tipo particular de teste.
Conclusão
Questões relacionadas à convergência de LLM e VLM são uma fonte de preocupação contínua e crescente na comunidade de pesquisa e entre os consumidores dos modelos subsequentes que deles derivam. Estamos chegando ao fim da primeira e única geração ‘pura’ de dados que a cena de pesquisa terá acesso; e a determinação dos provedores de modelos em extrair os dados dos concorrentes inevitavelmente gera risco de convergência, já que os dados estão se tornando idênticos e os princípios de treinamento de modelos são semelhantes, se não idênticos, entre os provedores.
Portanto, nada tão simples como substituir travessões provavelmente surgirá para combater a crescente semelhança das saídas criativas entre as famílias de modelos, e casos de duplicação, em vez disso, provavelmente virão à tona de maneiras bastante públicas e embaraçosas.
* A lista completa de modelos é Claude-3-Haiku; Claude-Fable-5; Claude-Opus-4; Claude-Opus-4.1; Claude-Opus-4.5; Claude-Opus-4.6; Claude-Opus-4.7; Claude-Opus-4.8; Command-A; Command-R-08-2024; DeepSeek-Chat; DeepSeek-V3.1-Terminus; DeepSeek-V3.2; DeepSeek-V4-Pro; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3.1-Pro-Preview; Gemini-3.5-Flash; Llama-3.1-70B-Instruct; Llama-3.2-3B-Instruct; Llama-3.3-70B-Instruct; Llama-4-Maverick; MiniMax-01; MiniMax-M1; MiniMax-M2; MiniMax-M2.1; MiniMax-M2.5; MiniMax-M2.7; MiniMax-M3; Mistral-Large; Mistral-Large-2407; Mistral-Large-2512; Mistral-Medium-3; Mistral-Medium-3.5; Mistral-Medium-3.1; Mistral-Small-24B-Instruct-2501; Mistral-Small-2603; Mistral-Small-3.1-24B-Instruct; Mistral-Small-3.2-24B-Instruct; Mixtral-8x22B-Instruct; Kimi-K2; Kimi-K2-0905; Kimi-K2.5; Kimi-K2.6; GPT-3.5-Turbo; GPT-4; GPT-4.1; GPT-4o; GPT-5; GPT-5.1; GPT-5.2; GPT-5.3-Chat; GPT-5.4; GPT-5.5; GPT-5.6-Sol; Qwen-2.5-72B-Instruct; Qwen3-Max; Qwen3.5-Plus-20260420; Qwen3.6-Max-Preview; Qwen3.7-Max; Grok-4.20; Grok-4.3; Grok-4.5; GLM-4.5; GLM-4.6; GLM-4.7; GLM-5; GLM-5.1; e GLM-5.2
** Ênfases dos autores, não minhas.
† Minha conversão das citações inline dos autores para hyperlinks.
Primeira publicação sexta‑feira, 21 de agosto de 2026












