Ângulo de Anderson

A Censura de Modelos de IA NÃĢo Funciona Bem, Revela Estudo

mm
Adicione Unite.AI às suas fontes preferidas no Google
ChatGPT-4o, Krita (Flux/Flux Koncept Dev), Firefly.

As tentativas de censurar os geradores de imagens de IA, apagando conteÚdo proibido (como pornografia, violÊncia ou estilos protegidos por direitos autorais) dos modelos treinados, estÃĢo falhando: um novo estudo descobriu que os mÃĐtodos atuais de eliminaçÃĢo de conceitos permitem que atributos “proibidos” se espalhem por imagens nÃĢo relacionadas e tambÃĐm nÃĢo conseguem impedir que versÃĩes intimamente relacionadas do conteÚdo supostamente “eliminado” apareçam.

 

Se as empresas que produzem modelos de IA de base nÃĢo conseguirem evitar que eles sejam usados para produzir material objetÃĄvel ou ilegal, elas correm o risco de ser processadas e/ou fechadas. Por outro lado, os fornecedores que sÃģ disponibilizam seus modelos por meio de uma API, como a Adobe com seu mecanismo de geraçÃĢo Firefly, estÃĢo em uma posiçÃĢo em que nÃĢo precisam se preocupar com o que seus modelos podem criar, pois tanto o prompt do usuÃĄrio quanto a saída resultante sÃĢo inspecionados e sanitizados:

O sistema Firefly da Adobe, usado em ferramentas como o Photoshop, às vezes recusa um pedido de geraçÃĢo logo de início, bloqueando o prompt antes que algo seja criado. Outras vezes, gera a imagem, mas entÃĢo bloqueia o resultado apÃģs revisÃĢo. Esse tipo de recusa no meio do processo tambÃĐm pode ocorrer no ChatGPT, quando o modelo começa uma resposta, mas a interrompe apÃģs reconhecer uma violaçÃĢo de política.

O sistema Firefly da Adobe, usado em ferramentas como o Photoshop, às vezes recusa um pedido de geraçÃĢo logo de início, bloqueando o prompt antes que algo seja criado. Outras vezes, gera a imagem, mas entÃĢo bloqueia o resultado apÃģs revisÃĢo. Esse tipo de recusa no meio do processo tambÃĐm pode ocorrer no ChatGPT, quando o modelo começa uma resposta, mas a interrompe apÃģs reconhecer uma violaçÃĢo de política – e ocasionalmente, ÃĐ possível ver a imagem abortada por um breve momento durante esse processo.

No entanto, filtros de API desse tipo geralmente podem ser neutralizados por usuÃĄrios em modelos instalados localmente, incluindo modelos de linguagem e visÃĢo (VLMs) que o usuÃĄrio possa desejar personalizar por meio de treinamento local em dados personalizados.

Na maioria dos casos, desabilitar essas operaçÃĩes ÃĐ trivial, envolvendo comentar uma chamada de funçÃĢo em Python (embora hacks desse tipo geralmente precisem ser repetidos ou reinventados apÃģs atualizaçÃĩes de framework).

Do ponto de vista dos negÃģcios, ÃĐ difícil entender como isso poderia ser um problema, pois a abordagem de API maximiza o controle corporativo sobre o fluxo de trabalho do usuÃĄrio. No entanto, do ponto de vista do usuÃĄrio, tanto o custo dos modelos apenas de API quanto o risco de censura equivocada ou excessiva provavelmente os levarÃĄ a baixar e personalizar instalaçÃĩes locais de alternativas de cÃģdigo aberto – pelo menos onde a licença FOSS ÃĐ favorÃĄvel.

O Último modelo significativo a ser lançado sem nenhuma tentativa de incorporar autocensura foi o Stable Diffusion V1.5, quase trÊs anos atrÃĄs. Mais tarde, a revelaçÃĢo de que seus conjuntos de treinamento incluíam dados de abuso infantil levou a um aumento nas chamadas para banir sua disponibilidade, e sua remoçÃĢo do repositÃģrio Hugging Face em 2024.

Corte!

CÃĐticos argumentam que o interesse de uma empresa em censurar modelos de IA geradores locais ÃĐ baseado apenas em preocupaçÃĩes sobre exposiçÃĢo legal, caso seus frameworks se tornem conhecidos por facilitar conteÚdo ilegal ou objetÃĄvel.

De fato, alguns modelos de cÃģdigo aberto “amigÃĄveis ao local” nÃĢo sÃĢo difíceis de descensurar (como Stable Diffusion 1.5 e DeepSeek R1).

Em contraste, o lançamento recente da sÃĐrie de modelos Kontext da Black Forest Lab foi marcado pelo compromisso notÃĄvel da empresa em expurgar toda a gama Kontext, tanto por meio de curadoria de dados cuidadosa quanto por meio de ajustes finos direcionados apÃģs o treinamento, projetados para remover qualquer tendÊncia residual em direçÃĢo a conteÚdo NSFW ou proibido.

Este ÃĐ o foco da cena de pesquisa nos Últimos 2-3 anos: com Ênfase na correçÃĢo pÃģs-fato de modelos com dados subcurados. Ofertas desse tipo incluem EdiçÃĢo de Conceito Unificada em Modelos de DifusÃĢo (UCE); EliminaçÃĢo de Conceito Confível e Eficiente de Modelos de DifusÃĢo de Texto para Imagem (RECE); EliminaçÃĢo de Conceito em Massa em Modelos de DifusÃĢo (MACE); e estrutura Semi-PermeÃĄvel de Conceito ÃĐ Injetada como uma Membrana (SPM):

O artigo de 2024 'EdiçÃĢo de Conceito Unificada em Modelos de DifusÃĢo' ofereceu ediçÃĩes de forma fechada para pesos de atençÃĢo, permitindo ediçÃĢo eficiente de mÚltiplos conceitos em modelos de texto para imagem. Mas o mÃĐtodo resiste à escrutínio? Fonte: https://arxiv.org/pdf/2308.14761

O artigo de 2024 ‘EdiçÃĢo de Conceito Unificada em Modelos de DifusÃĢo’ ofereceu ediçÃĩes de forma fechada para pesos de atençÃĢo, permitindo ediçÃĢo eficiente de mÚltiplos conceitos em modelos de texto para imagem. Mas o mÃĐtodo resiste à escrutínio? Fonte: https://arxiv.org/pdf/2308.14761

Embora essa seja uma abordagem eficiente (coleçÃĩes em larga escala, como LAION, sÃĢo muito grandes para serem curadas manualmente), ela nÃĢo ÃĐ necessariamente eficaz: de acordo com um novo estudo nos EUA, nenhum dos procedimentos de ediçÃĢo mencionados – que representam o estado da arte na modificaçÃĢo pÃģs-treinamento de modelos de IA – funciona muito bem.

Os autores descobriram que essas TÃĐcnicas de EliminaçÃĢo de Conceito (CETs) geralmente podem ser facilmente contornadas, e que, mesmo quando sÃĢo eficazes, elas tÊm efeitos colaterais considerÃĄveis:

Efeitos da eliminaçÃĢo de conceito em modelos de texto para imagem. Cada coluna mostra um prompt e o conceito marcado para eliminaçÃĢo, juntamente com saídas geradas antes e apÃģs a ediçÃĢo. Hierarquias indicam relaçÃĩes pai-filho entre conceitos. Os exemplos destacam efeitos colaterais comuns, incluindo falha na eliminaçÃĢo de conceitos filhos, supressÃĢo de conceitos vizinhos, evasÃĢo por meio de reescrita e transferÊncia de atributos eliminados para objetos nÃĢo relacionados.. Fonte: https://arxiv.org/pdf/2508.15124

Efeitos da eliminaçÃĢo de conceito em modelos de texto para imagem. Cada coluna mostra um prompt e o conceito marcado para eliminaçÃĢo, juntamente com saídas geradas antes e apÃģs a ediçÃĢo. Hierarquias indicam relaçÃĩes pai-filho entre conceitos. Os exemplos destacam efeitos colaterais comuns, incluindo falha na eliminaçÃĢo de conceitos filhos, supressÃĢo de conceitos vizinhos, evasÃĢo por meio de reescrita e transferÊncia de atributos eliminados para objetos nÃĢo relacionados. Fonte: https://arxiv.org/pdf/2508.15124

Os autores encontraram que as principais tÃĐcnicas atuais de eliminaçÃĢo de conceito falham em bloquear prompts compostos (por exemplo, carro vermelho ou cadeira de madeira pequena); frequentemente permitem que sub-classes escapem mesmo apÃģs a eliminaçÃĢo de uma categoria pai (como carro ou Ãīnibus continuando a aparecer apÃģs a remoçÃĢo de veículo); e introduzem novos problemas, como vazamento de atributos (onde, por exemplo, excluir sofÃĄ azul poderia causar que o modelo gere objetos nÃĢo relacionados, como cadeira azul).

Em mais de 80% dos casos de teste, a eliminaçÃĢo de um conceito amplo, como veículo, nÃĢo impediu que o modelo gerasse instÃĒncias mais específicas de veículo, como carros ou Ãīnibus.

A ediçÃĢo, observa o artigo, tambÃĐm causa mapas de atençÃĢo (as partes do modelo que decidem onde se concentrar na imagem) a se espalharem, enfraquecendo a qualidade da saída.

Interessantemente, o artigo descobre que eliminar conceitos relacionados um a um funciona melhor do que tentar removÊ-los todos de uma vez – embora isso nÃĢo remova todas as limitaçÃĩes dos mÃĐtodos de ediçÃĢo estudados:

ComparaçÃĢo de estratÃĐgias de eliminaçÃĢo progressiva e de uma vez. Quando todas as variantes de 'ursinho de pelÚcia' sÃĢo eliminadas simultaneamente, o modelo continua a gerar objetos semelhantes a ursinhos. Eliminar as variantes passo a passo ÃĐ mais eficaz, levando o modelo a suprimir o conceito alvo de forma mais confiÃĄvel.

ComparaçÃĢo de estratÃĐgias de eliminaçÃĢo progressiva e de uma vez. Quando todas as variantes de ‘ursinho de pelÚcia’ sÃĢo eliminadas simultaneamente, o modelo continua a gerar objetos semelhantes a ursinhos. Eliminar as variantes passo a passo ÃĐ mais eficaz, levando o modelo a suprimir o conceito alvo de forma mais confiÃĄvel.

Embora os pesquisadores atualmente nÃĢo possam oferecer soluçÃĢo para os problemas que o artigo destaca, eles desenvolveram um novo conjunto de dados e uma referÊncia que podem ajudar projetos de pesquisa posteriores a entender se seus prÃģprios modelos “censurados” estÃĢo funcionando como esperado.

O artigo afirma:

‘AvaliaçÃĩes anteriores confiaram apenas em um pequeno conjunto de classes de destino e preservaçÃĢo; por exemplo, quando se elimina “carro”, apenas a capacidade do modelo de gerar carros ÃĐ testada. Demonstramos que essa abordagem ÃĐ fundamentalmente inadequada e que a avaliaçÃĢo da eliminaçÃĢo de conceito deve ser mais abrangente para abranger todos os sub-conceitos relacionados, como “carro vermelho”.

‘Ao introduzir um conjunto de dados diverso com variaçÃĩes compostas e analisar sistematicamente efeitos como impacto em conceitos vizinhos, evasÃĢo de conceito e vazamento de atributos, descobrimos limitaçÃĩes e efeitos colaterais significativos das CETs existentes.

‘Nossa referÊncia ÃĐ agnÃģstica em relaçÃĢo ao modelo e facilmente integrÃĄvel e ÃĐ idealmente adequada para ajudar no desenvolvimento de novas TÃĐcnicas de EliminaçÃĢo de Conceito (CETs).’

Embora as CETs eliminem o conceito alvo 'pÃĄssaro', elas falham na variante composta 'pÃĄssaro vermelho' (topo). ApÃģs eliminar 'sofÃĄ azul', todos os mÃĐtodos tambÃĐm perdem a capacidade de gerar uma cadeira azul (fundo). Resultados bem-sucedidos sÃĢo marcados com um símbolo de tick verde, e falhas com um 'X' vermelho.

Embora as CETs eliminem o conceito alvo ‘pÃĄssaro’, elas falham na variante composta ‘pÃĄssaro vermelho’ (topo). ApÃģs eliminar ‘sofÃĄ azul’, todos os mÃĐtodos tambÃĐm perdem a capacidade de gerar uma cadeira azul (fundo). Resultados bem-sucedidos sÃĢo marcados com um símbolo de tick verde, e falhas com um ‘X’ vermelho.

O estudo oferece uma visÃĢo interessante sobre a extensÃĢo da interconexÃĢo de conceitos treinados no espaço latente de um modelo e a extensÃĢo em que entrelaçamento nÃĢo permitirÃĄ facilmente qualquer tipo de eliminaçÃĢo de conceito definitiva e verdadeiramente discreta.

O novo artigo ÃĐ intitulado Efeitos Colaterais da EliminaçÃĢo de Conceitos de Modelos de DifusÃĢo e vem de quatro pesquisadores da Universidade de Maryland.

MÃĐtodo e Dados

Os autores opinam que trabalhos anteriores que alegam eliminar conceitos de modelos de difusÃĢo nÃĢo comprovam a alegaçÃĢo de forma adequada, afirmando*:

‘As alegaçÃĩes de eliminaçÃĢo precisam de uma avaliaçÃĢo mais robusta e abrangente. Por exemplo, se o conceito a ser eliminado for “veículo”, sub-conceitos como “carro” e conceitos compostos como “carro vermelho” ou “carro pequeno” tambÃĐm devem ser eliminados.

‘No entanto, esse aspecto da hierarquia de conceitos e composicionalidade nÃĢo ÃĐ considerado nos protocolos de avaliaçÃĢo existentes, pois eles se concentram apenas na precisÃĢo do Único conceito eliminado. [Os autores de EraseBench] avaliam como as CETs afetam conceitos visualmente semelhantes e parafraseados (como “gato” e “filhote”)[;] no entanto, eles nÃĢo exploram exaustivamente a hierarquia e a composicionalidade dos conceitos.’

Para fornecer dados de referÊncia para projetos futuros, os autores criaram o conjunto de dados AvaliaçÃĢo de Efeitos Colaterais (SEE) – uma grande coleçÃĢo de prompts de texto projetados para testar como bem os mÃĐtodos de eliminaçÃĢo de conceito funcionam.

Os prompts seguem um modelo simples no qual um objeto ÃĐ descrito com atributos de tamanho, cor e material – por exemplo, uma imagem de um carro vermelho pequeno de madeira.

Os objetos foram tirados do conjunto de dados MS-COCO e organizados em uma hierarquia de superclasses, como veículo, e subclasses, como carro ou Ãīnibus, com suas combinaçÃĩes de atributos formando os nodos folha (o nível mais específico da hierarquia). Essa estrutura permite testar a eliminaçÃĢo em diferentes níveis semÃĒnticos, desde categorias amplas atÃĐ variantes específicas.

Para apoiar a avaliaçÃĢo automatizada, cada prompt foi emparelhado com uma pergunta sim/nÃĢo, como HÃĄ um carro na imagem?, e tambÃĐm usado como um rÃģtulo de classe para modelos de classificaçÃĢo de imagens:

CombinaçÃĩes de prompts no conjunto de dados SEE geradas variando atributos de tamanho, cor e material.

CombinaçÃĩes de prompts no conjunto de dados SEE geradas variando atributos de tamanho, cor e material.

Para medir como bem cada mÃĐtodo de eliminaçÃĢo de conceito se saiu, os autores desenvolveram dois mÃĐtodos de pontuaçÃĢo: precisÃĢo de alvo, que rastreia quÃĢo frequentemente conceitos eliminados ainda aparecem nas imagens geradas; e precisÃĢo de preservaçÃĢo, que rastreia se o modelo continua a gerar material que nÃĢo deveria ser eliminado.

O equilíbrio entre as duas pontuaçÃĩes visa revelar se o mÃĐtodo elimina com sucesso o conceito proibido sem danificar a saída mais ampla do modelo.

Os autores avaliaram a eliminaçÃĢo de conceito em trÊs modos de falha: primeiro, uma medida de se a remoçÃĢo de um conceito como carro interfere em conceitos prÃģximos ou nÃĢo relacionados, com base em semelhança semÃĒntica e de atributos; segundo, um teste para ver se a eliminaçÃĢo pode ser contornada por meio de sub-conceitos como carro vermelho apÃģs a eliminaçÃĢo de veículo.

Finalmente, foi realizada uma verificaçÃĢo para vazamento de atributos, onde características ligadas a conceitos eliminados aparecem em objetos nÃĢo relacionados (por exemplo, eliminar sofÃĄ pode causar que outro objeto, como planta em vasos, herde sua cor ou material). O conjunto de dados final contÃĐm 5056 prompts compostos

Testes

Os frameworks testados anteriormente foram aqueles listados anteriormente – UCE, RECE, MACE e SPM. Os pesquisadores adotaram configuraçÃĩes padrÃĢo dos projetos originais e ajustaram finamente todos os modelos em um GPU NVIDIA RTX 6000 com 48GB de VRAM.

O Stable Diffusion 1.4, um dos modelos mais perenes na literatura, foi usado para todos os testes – talvez nÃĢo menos porque os primeiros modelos SD tiveram pouca ou nenhuma restriçÃĢo conceitual, e, como tal, oferecem uma folha em branco nesse contexto de pesquisa específico.

Cada um dos 5056 prompts do conjunto de dados SEE foi executado nas versÃĩes editadas e nÃĢo editadas do modelo, gerando quatro imagens por prompt usando sementes aleatÃģrias fixas, permitindo testar se os efeitos de eliminaçÃĢo permaneciam consistentes em mÚltiplas saídas. Cada modelo editado produziu um total de 20.224 imagens.

A presença de conceitos preservados foi avaliada de acordo com mÃĐtodos anteriores para procedimentos de eliminaçÃĢo de texto para imagem, usando os modelos VQA BLIP, QWEN 2.5 VL e Florence-2base.

Impacto em Conceitos Vizinhos

O primeiro teste mediu se a eliminaçÃĢo de um conceito afetava involuntariamente conceitos vizinhos. Por exemplo, apÃģs remover carro, o modelo deveria parar de gerar carro vermelho ou carro grande, mas ainda ser capaz de gerar conceitos relacionados, como Ãīnibus ou caminhÃĢo, e conceitos nÃĢo relacionados, como garfo.

A anÃĄlise usou semelhança de incorporaçÃĢo CLIP e distÃĒncia de ediçÃĢo baseada em atributos para estimar quÃĢo prÃģximo cada conceito estava do alvo eliminado, permitindo que o estudo quantificasse quÃĢo longe a perturbaçÃĢo se espalhou:

Resultados combinados para precisÃĢo de alvo (esquerda) e precisÃĢo de preservaçÃĢo (direita) plotados contra semelhança semÃĒntica (topo) e distÃĒncia composicional (fundo). Um mÃĐtodo de eliminaçÃĢo de conceito ideal mostraria baixa precisÃĢo de alvo e alta precisÃĢo de preservaçÃĢo em todas as distÃĒncias, mas os resultados mostram que as tÃĐcnicas atuais falham em generalizar limpa e claramente, com conceitos mais prÃģximos sendo insuficientemente eliminados ou desproporcionalmente perturbados.

Resultados combinados para precisÃĢo de alvo (esquerda) e precisÃĢo de preservaçÃĢo (direita) plotados contra semelhança semÃĒntica (topo) e distÃĒncia composicional (fundo). Um mÃĐtodo de eliminaçÃĢo de conceito ideal mostraria baixa precisÃĢo de alvo e alta precisÃĢo de preservaçÃĢo em todas as distÃĒncias; mas os resultados mostram que as tÃĐcnicas atuais falham em generalizar limpa e claramente, com conceitos mais prÃģximos sendo insuficientemente eliminados ou desproporcionalmente perturbados.

Desses resultados, os autores comentam:

‘Todos os CETs continuam a gerar variantes compostas ou semanticamente distantes do alvo, apesar da eliminaçÃĢo, o que idealmente nÃĢo deveria ocorrer. É evidente que a UCE consistentemente alcança uma precisÃĢo mais alta do que os outros mÃĐtodos CET na [conjunto de preservaçÃĢo], indicando um impacto mínimo nÃĢo intencional em conceitos semanticamente relacionados.

‘Em contraste, a SPM alcança a menor precisÃĢo, sugerindo que sua estratÃĐgia de ediçÃĢo ÃĐ mais suscetível à semelhança de conceito.’

Entre os quatro mÃĐtodos testados, a RECE foi a mais eficaz em bloquear o conceito alvo. No entanto, como mostrado no lado esquerdo da imagem acima, todos os mÃĐtodos falharam em suprimir variantes compostas. ApÃģs a eliminaçÃĢo de pÃĄssaro, o modelo ainda produziu imagens de um pÃĄssaro vermelho, sugerindo que o conceito permaneceu parcialmente intacto.

Remover sofÃĄ azul tambÃĐm impediu que o modelo gerasse uma cadeira azul, indicando dano a conceitos vizinhos.

A RECE lidou melhor com as variantes compostas do que os outros, enquanto a UCE fez um melhor trabalho na preservaçÃĢo de conceitos relacionados.

InvasÃĢo de EliminaçÃĢo

O teste de evasÃĢo de eliminaçÃĢo avaliou se os modelos ainda podiam gerar conceitos de sub-classes apÃģs a eliminaçÃĢo de sua superclasse. Por exemplo, se veículo foi removido, o teste verificou se o modelo ainda podia produzir saídas como bicicleta ou carro vermelho.

Prompts foram direcionados tanto para sub-classes diretas quanto para variantes compostas para determinar se a operaçÃĢo de eliminaçÃĢo de conceito havia realmente removido a hierarquia completa ou podia ser contornada por meio de descriçÃĩes mais específicas:

Contorno de superclasses eliminadas por meio de suas sub-classes e variantes compostas, com precisÃĢo mais alta indicando maior evasÃĢo.

Contorno de superclasses eliminadas por meio de suas sub-classes e variantes compostas, com precisÃĢo mais alta indicando maior evasÃĢo.

O modelo nÃĢo editado reteve alta precisÃĢo em todas as superclasses, confirmando que ele nÃĢo havia removido nenhum conceito alvo. Entre as CETs, a MACE mostrou a menor evasÃĢo, alcançando a menor precisÃĢo de sub-classes em mais da metade das categorias testadas. A RECE tambÃĐm se saiu bem, particularmente nos grupos acessÃģrio, esportes e eletrÃīnicos.

Em contraste, a UCE e a SPM mostraram precisÃĢo de sub-classes mais alta, indicando que conceitos eliminados eram mais facilmente contornados por meio de prompts relacionados ou aninhados.

Os autores observam:

‘[Todas] as CETs suprimem com sucesso o conceito de superclasse alvo (“comida”). No entanto, quando solicitados com filhos baseados em atributos da hierarquia de comida (por exemplo, “uma pizza grande”), todos os mÃĐtodos geram itens de comida.

‘Da mesma forma, na categoria “veículo”, todos os modelos geram bicicletas, apesar de terem eliminado “veículo”.’

Vazamento de Atributos

O terceiro teste, vazamento de atributos, verificou se características ligadas a um conceito eliminado apareciam em outras partes da imagem.

Por exemplo, apÃģs a eliminaçÃĢo de sofÃĄ, o modelo nÃĢo deveria gerar um sofÃĄ nem aplicar seus atributos típicos (como cor ou material) a objetos nÃĢo relacionados na mesma solicitaçÃĢo. Isso foi medido solicitando o modelo com objetos emparelhados e examinando se os atributos eliminados apareciam por engano em conceitos preservados:

Mapas de atençÃĢo para tokens de atributos apÃģs a eliminaçÃĢo de conceito. Esquerda: Quando 'banco' ÃĐ eliminado, o token 'de madeira' se desloca para o pÃĄssaro, resultando em pÃĄssaros de madeira. Direita: Eliminar 'sofÃĄ' falha em suprimir a geraçÃĢo de sofÃĄ, enquanto o token 'grande' ÃĐ erroneamente atribuído ao donut.

Mapas de atençÃĢo para tokens de atributos apÃģs a eliminaçÃĢo de conceito. Esquerda: Quando ‘banco’ ÃĐ eliminado, o token ‘de madeira’ se desloca para o pÃĄssaro, resultando em pÃĄssaros de madeira. Direita: Eliminar ‘sofÃĄâ€™ falha em suprimir a geraçÃĢo de sofÃĄ, enquanto o token ‘grande’ ÃĐ erroneamente atribuído ao donut.

A RECE foi a mais eficaz na eliminaçÃĢo de atributos alvo, mas tambÃĐm introduziu o maior vazamento de atributos em prompts preservados, superando atÃĐ mesmo o modelo nÃĢo editado. A UCE vazou menos do que os outros mÃĐtodos.

Os resultados, sugerem os autores, indicam a necessidade de um trade-off inerente, com uma eliminaçÃĢo mais forte aumentando o risco de transferÊncia de atributos mal direcionada.

ConclusÃĢo

O espaço latente de um modelo nÃĢo se preenche de forma ordenada durante o treinamento, com conceitos derivados depositados neatamente em prateleiras ou pastas; mas as incorporaçÃĩes treinadas sÃĢo tanto o conteÚdo quanto os recipientes: nÃĢo separados por fronteiras claras, mas se misturando uns nos outros de uma maneira que torna a remoçÃĢo problemÃĄtica – como tentar extrair uma libra de carne sem perda de sangue.

Em sistemas inteligentes e evolutivos, eventos fundamentais – como queimar os dedos e, em seguida, tratar o fogo com respeito – estÃĢo ligados aos comportamentos e associaçÃĩes que eles formam posteriormente, tornando desafiador produzir um modelo que possa ter sido deixado com as conseqÞÊncias de um conceito central, potencialmente ‘proibido’, mas que careça desse conceito em si.

 

* Minha conversÃĢo das citaçÃĩes em linha dos autores para links.

Publicado pela primeira vez na sexta-feira, 22 de agosto de 2025

Escritor sobre aprendizado de mÃĄquina, especialista em síntese de imagem humana. Anteriormente, chefe de conteÚdo de pesquisa da Metaphysic.ai, atÃĐ sua dissoluçÃĢo na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: [email protected]