Modelos e plataformas de IA
Nova Biblioteca Neural Tangent do Google Fornece a Cientistas de Dados “Insight Sem Precedentes” em Modelos
O Google (GOOGL ) projetou uma nova biblioteca de código aberto destinada a desvendar a caixa preta do aprendizado de máquina e fornecer aos engenheiros mais insights sobre como seus sistemas de aprendizado de máquina operam. Conforme relatado pelo VentureBeat, a equipe de pesquisa do Google afirma que a biblioteca pode conceder “insight sem precedentes” sobre como os modelos de aprendizado de máquina operam.
Redes neurais operam por meio de neurônios que contêm funções matemáticas que transformam os dados de várias maneiras. Os neurônios na rede são unidos em camadas, e as redes neurais têm profundidade e largura. A profundidade de uma rede neural é controlada pelo número de camadas que ela tem, e as diferentes camadas das redes ajustam as conexões entre os neurônios, impactando como os dados são tratados à medida que se movem entre as camadas. O número de neurônios em uma camada é a largura da camada. De acordo com o engenheiro de pesquisa do Google, Roman Novak, e o cientista sênior de pesquisa do Google, Samuel S. Schoenholz, a largura dos modelos está fortemente correlacionada com comportamento regular e repetível. Em um post de blog, os dois pesquisadores explicaram que tornar as redes neurais mais largas torna seu comportamento mais regular e fácil de interpretar.
Existe um tipo diferente de modelo de aprendizado de máquina chamado de processo gaussiano. Um processo gaussiano é um processo estocástico que pode ser representado como uma distribuição normal multivariada. Com um processo gaussiano, todos os conjuntos/combinações lineares finitas de variáveis serão normalmente distribuídos. Isso significa que é possível representar interações complexas entre variáveis como equações de álgebra linear interpretáveis, e, portanto, é possível estudar o comportamento de uma IA por meio dessa lente. Como exatamente os modelos de aprendizado de máquina estão relacionados aos processos gaussianos? Os modelos de aprendizado de máquina que são infinitamente largos em largura convergem para um processo gaussiano.
No entanto, embora seja possível interpretar os modelos de aprendizado de máquina por meio da lente de um processo gaussiano, isso requer derivar o limite de largura infinita de um modelo. Isso é uma série complexa de cálculos que devem ser feitos para cada arquitetura separada. Para tornar esses cálculos mais fáceis e rápidos, a equipe de pesquisa do Google projetou a Neural Tangents. A Neural Tangents permite que um cientista de dados use apenas algumas linhas de código e treine várias redes neurais de largura infinita ao mesmo tempo. Múltiplas redes neurais são frequentemente treinadas nos mesmos conjuntos de dados e suas previsões são averageadas, a fim de obter uma previsão mais robusta imune aos problemas que podem ocorrer em qualquer modelo individual. Essa técnica é chamada de aprendizado de ensemble. Uma das desvantagens do aprendizado de ensemble é que ele é frequentemente computacionalmente caro. No entanto, quando uma rede que é infinitamente larga é treinada, o ensemble é descrito por um processo gaussiano e a variância e a média podem ser calculadas.
Três diferentes arquiteturas de redes neurais de largura infinita foram comparadas como um teste, e os resultados da comparação foram publicados no post de blog. Em geral, os resultados das redes de ensemble impulsionadas por processos gaussianos são semelhantes ao desempenho de redes neurais finitas regulares:
Conforme explica a equipe de pesquisa em um post de blog:
“Vemos que, imitando redes neurais finitas, as redes neurais de largura infinita seguem uma hierarquia semelhante de desempenho, com redes totalmente conectadas apresentando um desempenho pior do que as redes convolucionais, que, por sua vez, apresentam um desempenho pior do que as redes residuais largas. No entanto, ao contrário do treinamento regular, a dinâmica de aprendizado desses modelos é completamente rastreável em forma fechada, o que permite [novo] insight em seu comportamento.”
O lançamento da Neural Tangents parece ter sido planejado para coincidir com o TensorFlow Dev Summit. O dev summit reúne engenheiros de aprendizado de máquina que utilizam a plataforma TensorFlow do Google. O anúncio da Neural Tangents também vem logo após o anúncio do TensorFlow Quantum.
A Neural Tangents foi disponibilizada via GitHub e há um notebook e tutorial do Google Colaboratory que os interessados podem acessar.










