Ângulo de Anderson

Treinamento de Modelos de VisÃĢo Computacional com Ruído AleatÃģrio em vez de Imagens Reais

mm
Adicione Unite.AI às suas fontes preferidas no Google

Pesquisadores do LaboratÃģrio de CiÊncia e InteligÊncia Artificial do MIT (CSAIL) experimentaram o uso de imagens de ruído aleatÃģrio em conjuntos de dados de visÃĢo computacional para treinar modelos de visÃĢo computacional e descobriram que, em vez de produzir lixo, o mÃĐtodo ÃĐ surpreendentemente eficaz:

Modelos gerativos do experimento, classificados por desempenho. Fonte: https://openreview.net/pdf?id=RQUl8gZnN7O

Modelos gerativos do experimento, classificados por desempenho. Fonte: https://openreview.net/pdf?id=RQUl8gZnN7O

Alimentar aparente ‘lixo visual’ em arquiteturas de visÃĢo computacional populares nÃĢo deve resultar nesse tipo de desempenho. À direita da imagem acima, as colunas pretas representam pontuaçÃĩes de precisÃĢo (no Imagenet-100) para quatro conjuntos de dados ‘reais’. Embora os conjuntos de dados de ‘ruído aleatÃģrio’ anteriores (ilustrados em vÃĄrias cores, veja índice no canto superior esquerdo) nÃĢo possam igualar isso, eles estÃĢo quase todos dentro de limites respeitÃĄveis de precisÃĢo (linhas tracejadas vermelhas).

Nesse sentido, ‘precisÃĢo’ nÃĢo significa que um resultado necessariamente se pareça com um rosto, uma igreja, uma pizza ou qualquer outro domínio particular para o qual vocÊ possa estar interessado em criar um sistema de síntese de imagens, como uma Rede AdversÃĄria Gerativa ou um quadro de codificador/decodificador.

Em vez disso, significa que os modelos do CSAIL derivaram ‘verdades’ centrais amplamente aplicÃĄveis a partir de dados de imagem aparentemente nÃĢo estruturados, de modo que nÃĢo deveriam ser capazes de fornecÊ-los.

Diversidade vs. Naturalismo

Nem esses resultados podem ser atribuídos a sobreajuste: uma discussÃĢo animada entre os autores e revisores no Open Review revela que misturar diferentes conteÚdos de conjuntos de dados visualmente diversos (como ‘folhas mortas’, ‘fractais’ e ‘ruído procedural’ – veja imagem abaixo) em um conjunto de dados de treinamento melhora a precisÃĢo nesses experimentos.

Isso sugere (e ÃĐ um pouco uma noçÃĢo revolucionÃĄria) um novo tipo de ‘subajuste’, onde ‘diversidade’ supera ‘naturalismo’.

A pÃĄgina do projeto permite visualizar interativamente os diferentes tipos de conjuntos de dados de ruído aleatÃģrio usados no experimento. Fonte: https://mbaradad.github.io/learning_with_noise/

A pÃĄgina do projeto permite visualizar interativamente os diferentes tipos de conjuntos de dados de ruído aleatÃģrio usados no experimento. Fonte: https://mbaradad.github.io/learning_with_noise/

Os resultados obtidos pelos pesquisadores questionam a relaçÃĢo fundamental entre redes neurais baseadas em imagens e as ‘imagens do mundo real’ que sÃĢo lançadas nelas em volumes cada vez maiores a cada ano, e implicam que a necessidade de obter, curar e lidar com conjuntos de dados de imagem em escala hiperscale pode eventualmente se tornar redundante. Os autores afirmam:

‘Os atuais sistemas de visÃĢo sÃĢo treinados em conjuntos de dados enormes, e esses conjuntos de dados vÊm com custos: a curaçÃĢo ÃĐ cara, eles herdam vieses humanos e hÃĄ preocupaçÃĩes sobre privacidade e direitos de uso. Para contrariar esses custos, o interesse surgiu em aprender com fontes de dados mais baratas, como imagens nÃĢo rotuladas.’

‘Neste artigo, vamos um passo alÃĐm e perguntamos se podemos nos livrar completamente de conjuntos de dados de imagens reais, aprendendo com processos de ruído procedural.’

Os pesquisadores sugerem que a atual geraçÃĢo de arquiteturas de aprendizado de mÃĄquina pode estar inferindo algo muito mais fundamental (ou, pelo menos, inesperado) a partir de imagens do que se pensava anteriormente, e que ‘imagens sem sentido’ podem potencialmente impartir uma grande quantidade desse conhecimento de forma muito mais barata, mesmo com o possível uso de dados sintÃĐticos ad hoc, por meio de arquiteturas de geraçÃĢo de conjuntos de dados que geram imagens aleatÃģrias durante o treinamento:

‘NÃģs identificamos duas propriedades principais que tornam os dados sintÃĐticos bons para treinar sistemas de visÃĢo: 1) naturalismo, 2) diversidade. Interessantemente, os dados mais naturalistas nÃĢo sÃĢo sempre os melhores, pois o naturalismo pode vir com o custo da diversidade.

‘O fato de que os dados naturalistas ajudam pode nÃĢo ser surpreendente, e sugere que, de fato, os dados reais em grande escala tÊm valor. No entanto, descobrimos que o que ÃĐ crucial nÃĢo ÃĐ que os dados sejam reais, mas que sejam naturalistas, ou seja, eles devem capturar certas propriedades estruturais dos dados reais.

‘Muitas dessas propriedades podem ser capturadas em modelos de ruído simples.’

VisualizaçÃĩes de recursos resultantes de um codificador derivado de AlexNet em alguns dos vÃĄrios 'conjuntos de dados de imagem aleatÃģria' usados pelos autores, cobrindo a 3Š e 5Š (final) camada de convoluçÃĢo. A metodologia usada aqui segue a estabelecida na pesquisa do Google AI em 2017.

VisualizaçÃĩes de recursos resultantes de um codificador derivado de AlexNet em alguns dos vÃĄrios ‘conjuntos de dados de imagem aleatÃģria’ usados pelos autores, cobrindo a 3Š e 5Š (final) camada de convoluçÃĢo. A metodologia usada aqui segue a estabelecida na pesquisa do Google AI em 2017.

O artigo, apresentado na 35Š ConferÊncia sobre Processamento de InformaçÃĩes Neurais (NeurIPS 2021) em Sydney, ÃĐ intitulado Aprendendo a Ver Olhando para o Ruído e vem de seis pesquisadores do CSAIL, com contribuiçÃĢo igual.

O trabalho foi recomendado por consenso para uma seleçÃĢo de destaque no NeurIPS 2021, com comentÃĄrios de pares caracterizando o artigo como ‘uma quebra científica’ que abre uma ‘grande ÃĄrea de estudo’, mesmo que levante tantas perguntas quanto respostas.

Nos artigo, os autores concluem:

‘NÃģs mostramos que, quando projetados usando resultados de pesquisas anteriores sobre estatísticas de imagens naturais, esses conjuntos de dados podem treinar com sucesso representaçÃĩes visuais. Esperamos que este artigo motive o estudo de novos modelos gerativos capazes de produzir ruído estruturado que alcance um desempenho ainda maior quando usado em uma variedade de tarefas visuais.

‘SerÃĄ que ÃĐ possível igualar o desempenho obtido com o prÃĐ-treinamento do ImageNet? Talvez, na ausÊncia de um grande conjunto de dados de treinamento específico para uma tarefa particular, o melhor prÃĐ-treinamento nÃĢo seja usar um conjunto de dados reais padrÃĢo, como o ImageNet.’

Escritor sobre aprendizado de mÃĄquina, especialista em síntese de imagem humana. Anteriormente, chefe de conteÚdo de pesquisa da Metaphysic.ai, atÃĐ sua dissoluçÃĢo na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: [email protected]