Ângulo de Anderson

Como Manter os Smartphones Frescos ao Executar Modelos de Aprendizado de Máquina

mm
Adicione Unite.AI às suas fontes preferidas no Google
Source image: 'Young man holding the new Samsung Galaxy S20 Ultra', by Jonas Leupe, Unsplash - https://unsplash.com/photos/wK-elt11pF0

Pesquisadores da Universidade de Austin e Carnegie Mellon propuseram uma nova forma de executar modelos de aprendizado de máquina computacionalmente caros em dispositivos móveis, como smartphones, e em dispositivos de borda de baixa potência, sem acionar o controle térmico – um mecanismo de proteção comum em dispositivos profissionais e de consumo, projetado para reduzir a temperatura do dispositivo hospedeiro, desacelerando seu desempenho, até que temperaturas de operação aceitáveis sejam obtidas novamente.

A nova abordagem pode ajudar a executar modelos de ML mais complexos para inferência e vários outros tipos de tarefas sem ameaçar a estabilidade do dispositivo hospedeiro, como um smartphone.

A ideia central é usar redes dinâmicas, onde os pesos de um modelo podem ser acessados por uma versão de “baixa pressão” e “intensidade total” do modelo de aprendizado de máquina local.

Nos casos em que a operação do modelo de aprendizado de máquina local deve causar a temperatura do dispositivo a subir criticamente, o modelo mudaria dinamicamente para um modelo menos exigente até que a temperatura seja estabilizada, e então mudaria de volta para a versão completa.

As tarefas de teste consistiram em um trabalho de classificação de imagens e uma tarefa de inferência de linguagem natural de resposta a perguntas (QNLI) – ambos os tipos de operação prováveis de envolver aplicações de IA móvel. Fonte: https://arxiv.org/pdf/2206.10849.pdf

As tarefas de teste consistiram em um trabalho de classificação de imagens e uma tarefa de inferência de linguagem natural de resposta a perguntas (QNLI) – ambos os tipos de operação prováveis de envolver aplicações de IA móvel. Fonte: https://arxiv.org/pdf/2206.10849.pdf

Os pesquisadores realizaram testes de conceito para modelos de visão computacional e processamento de linguagem natural (NLP) em um smartphone Honor V30 Pro de 2019 e um Raspberry Pi 4B 4GB.

A partir dos resultados (para o smartphone), podemos ver na imagem abaixo a temperatura do dispositivo hospedeiro subindo e descendo com o uso. As linhas vermelhas representam um modelo executado sem Comutação Dinâmica.

Embora os resultados possam parecer bastante semelhantes, não são: o que está causando a temperatura a ondular para as linhas azuis (ou seja, usando o método do novo artigo) é a mudança entre versões mais simples e mais complexas do modelo. Em nenhum momento da operação, o controle térmico é acionado.

O que está causando a temperatura a subir e descer no caso das linhas vermelhas é o engajamento automático do controle térmico no dispositivo, que desacelera a operação do modelo e aumenta sua latência.

Em termos de quão útil o modelo é, podemos ver na imagem abaixo que a latência para o modelo não auxiliado é significativamente maior enquanto está sendo controlado termicamente:

Ao mesmo tempo, a imagem acima mostra quase nenhuma variação na latência para o modelo gerenciado pela Comutação Dinâmica, que permanece responsivo ao longo do tempo.

Para o usuário final, uma alta latência pode significar um aumento no tempo de espera, o que pode causar a abandonar uma tarefa e insatisfação com o aplicativo que hospeda.

No caso de sistemas NLP (em vez de visão computacional), tempos de resposta altos podem ser ainda mais perturbadores, pois as tarefas podem depender de respostas rápidas (como tradução automática ou utilitários para ajudar usuários com deficiência).

Para aplicações verdadeiramente críticas em termos de tempo – como renderização de tempo real de VR/AR – uma alta latência efetivamente mataria a utilidade do modelo.

Os pesquisadores afirmam:

‘Argumentamos que o controle térmico representa uma ameaça séria às aplicações de ML móvel que são críticas em termos de latência. Por exemplo, durante a renderização de vídeo em tempo real ou jogos, um aumento súbito de latência por quadro teria um efeito negativo substancial na experiência do usuário. Além disso, os sistemas operacionais móveis modernos frequentemente fornecem serviços e aplicativos especiais para indivíduos com deficiência visual, como o VoiceOver no iOS e o TalkBack no Android. ‘

‘O usuário normalmente interage com os telefones celulares confiando completamente na fala, então a qualidade desses serviços é altamente dependente da responsividade ou da latência do aplicativo.’

Gráficos demonstrando o desempenho de BERT w50 d50 não auxiliado e ajudado pela Comutação Dinâmica. Observe a uniformidade da latência na Comutação Dinâmica (azul).

Gráficos demonstrando o desempenho de BERT w50 d50 não auxiliado (vermelho) e ajudado pela Comutação Dinâmica (azul). Observe a uniformidade da latência na Comutação Dinâmica (azul).

O artigo é intitulado Manter a Calma: Comutação Dinâmica Previne Controle Térmico, e é uma colaboração entre dois pesquisadores da UoA; um da Carnegie Mellon; e um representando ambas as instituições.

IA Móvel Baseada em CPU

Embora a Comutação Dinâmica e as arquiteturas de multi-escala sejam uma área de estudo estabelecida e ativa, a maioria das iniciativas se concentrou em conjuntos de dispositivos computacionais de alta gama, e o foco de esforço no momento está dividido entre a otimização intensa de redes neurais locais (ou seja, baseadas no dispositivo) para fins de inferência, e a melhoria de hardware móvel dedicado.

Os testes realizados pelos pesquisadores foram conduzidos em chips CPU em vez de GPU. Apesar do crescente interesse em aproveitar os recursos de GPU locais em aplicações de ML móvel (e até treinamento direto em dispositivos móveis, o que pode melhorar a qualidade do modelo final), as GPUs normalmente consomem mais energia, um fator crítico nos esforços da IA para ser independente (dos serviços de nuvem) e útil em um dispositivo com recursos limitados.

Testando Compartilhamento de Pesos

As redes testadas para o projeto foram redes finas e DynaBERT, representando, respectivamente, uma tarefa de visão computacional e uma tarefa de NLP.

Embora tenham havido várias iniciativas para criar iterações de BERT que possam ser executadas de forma eficiente e econômica em dispositivos móveis, algumas das tentativas foram criticadas como soluções tortuosas, e os pesquisadores do novo artigo observam que usar BERT no espaço móvel é um desafio, e que ‘os modelos BERT em geral são muito intensivos computacionalmente para telefones celulares’.

DynaBERT é uma iniciativa chinesa para otimizar o poderoso quadro de NLP/NLU da Google no contexto de um ambiente com recursos escassos; mas mesmo essa implementação de BERT, os pesquisadores descobriram, era muito exigente.

No entanto, em ambos o smartphone e o dispositivo Raspberry PI, os autores executaram dois experimentos. No experimento de visão computacional, uma imagem única, escolhida aleatoriamente, foi processada continuamente e repetidamente em ResNet50 como uma tarefa de classificação, e foi capaz de executar de forma estável e sem invocar o controle térmico por toda a hora de tempo de execução do experimento.

O artigo afirma:

‘Embora possa sacrificar some precisão, a Comutação Dinâmica proposta tem uma velocidade de inferência mais rápida. O mais importante é que nossa abordagem de Comutação Dinâmica desfruta de uma inferência consistente.’

Executando ResNet50 não auxiliado e com Comutação Dinâmica entre Slimmable ResNet50 x1.0 e a versão x0.25 em uma tarefa de classificação de imagens contínua, por sessenta minutos.

Executando ResNet50 não auxiliado e com Comutação Dinâmica entre Slimmable ResNet50 x1.0 e a versão x0.25 em uma tarefa de classificação de imagens contínua, por sessenta minutos.

Para os testes de NLP, os autores definiram o experimento para mudar entre os dois menores modelos na suíte DynaBERT, mas descobriram que, em 1,4X de latência, BERT trava a cerca de 70°. Portanto, definiram a mudança para baixo para ocorrer quando a temperatura de operação atingisse 65°.

O experimento de BERT envolveu deixar a instalação executar inferência continuamente em um par de pergunta e resposta do conjunto de dados ONLI do GLUE.

A troca entre latência e precisão foi mais severa com a tarefa ambiciosa de BERT do que para a implementação de visão computacional, e a precisão veio com o custo de uma necessidade mais severa de controlar a temperatura do dispositivo, para evitar o controle térmico:

Latência vs precisão para os experimentos dos pesquisadores em ambas as tarefas de setor.

Latência vs precisão para os experimentos dos pesquisadores em ambas as tarefas de setor.

Os autores observam:

‘A Comutação Dinâmica, em geral, não pode prevenir que os modelos BERT sofram com o controle térmico devido à intensidade computacional do modelo. No entanto, sob certas limitações, a comutação dinâmica ainda pode ser útil ao implantar modelos BERT em telefones celulares.’

Os autores descobriram que os modelos BERT fazem a temperatura do CPU do telefone Honor V30 subir a 80° em menos de 32 segundos e invocam o controle térmico em menos de seis minutos de atividade. Portanto, os autores usaram apenas modelos BERT de meia largura.

Os experimentos foram repetidos no conjunto Raspberry PI, e a técnica também foi capaz de prevenir a ativação do controle térmico nesse ambiente. No entanto, os autores observam que o Raspberry PI não opera sob as mesmas restrições térmicas extremas de um smartphone compacto, e parecem ter adicionado essa série de experimentos como uma demonstração adicional da eficácia do método em ambientes de processamento modestamente equipados.

 

Publicado pela primeira vez em 23 de junho de 2022.

Escritor em aprendizado de máquina, especialista em síntese de imagem humana. Antigo chefe de conteúdo de pesquisa da Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: martin@martinanderson.ai