Ángulo de Anderson
Cómo mantener frescos los smartphones cuando ejecutan modelos de aprendizaje automático

Investigadores de la Universidad de Austin y Carnegie Mellon han propuesto una nueva forma de ejecutar modelos de aprendizaje automático computacionalmente costosos en dispositivos móviles como smartphones y en dispositivos de borde de menor potencia, sin activar el limitación térmica – un mecanismo de protección común en dispositivos profesionales y de consumo, diseñado para reducir la temperatura del dispositivo host al ralentizar su rendimiento, hasta que se obtengan nuevamente temperaturas de funcionamiento aceptables.
El nuevo enfoque podría ayudar a que modelos de aprendizaje automático más complejos ejecuten inferencia y varios otros tipos de tareas sin amenazar la estabilidad del host smartphone, por ejemplo.
La idea central es utilizar redes dinámicas, donde los pesos de un modelo pueden ser accedidos por una versión de ‘baja presión’ y ‘alta intensidad’ del modelo de aprendizaje automático local.
En casos donde la operación del modelo de aprendizaje automático local debiera hacer que la temperatura del dispositivo aumente críticamente, el modelo cambiaría dinámicamente a un modelo menos exigente hasta que la temperatura se estabilice, y luego cambiaría de regreso a la versión completa.

Las tareas de prueba consistieron en un trabajo de clasificación de imágenes y una tarea de inferencia de lenguaje natural de respuesta a preguntas (QNLI) – ambas son operaciones del tipo que probablemente involucrarían aplicaciones de inteligencia artificial móvil. Fuente: https://arxiv.org/pdf/2206.10849.pdf
Los investigadores realizaron pruebas de concepto para modelos de visión por computadora y procesamiento de lenguaje natural (NLP) en un smartphone Honor V30 Pro de 2019 y un Raspberry Pi 4B de 4GB.
Desde los resultados (para el smartphone), podemos ver en la imagen a continuación la temperatura del dispositivo host aumentando y disminuyendo con el uso. Las líneas rojas representan un modelo que se ejecuta sin cambio dinámico.

Aunque los resultados pueden parecer bastante similares, no lo son: lo que causa que la temperatura fluctúe para las líneas azules (es decir, utilizando el método del nuevo documento) es el cambio entre versiones más simples y más complejas del modelo. En ningún momento de la operación se activa la limitación térmica.
Lo que causa que la temperatura aumente y disminuya en el caso de las líneas rojas es la activación automática de la limitación térmica en el dispositivo, que ralentiza la operación del modelo y aumenta su latencia.
En términos de cuán usable es el modelo, podemos ver en la imagen a continuación que la latencia para el modelo no asistido es significativamente mayor mientras se está sometiendo a limitación térmica:

Al mismo tiempo, la imagen anterior muestra casi ninguna variación en la latencia para el modelo que se gestiona con cambio dinámico, que permanece respondiendo en todo momento.
Para el usuario final, una alta latencia puede significar un aumento en el tiempo de espera, lo que puede causar el abandono de una tarea y la insatisfacción con la aplicación que la hospeda.
En el caso de los sistemas NLP (en lugar de visión por computadora), los tiempos de respuesta altos pueden ser aún más inquietantes, ya que las tareas pueden depender de una respuesta rápida (como la auto-traducción o las utilidades para ayudar a los usuarios discapacitados).
Para aplicaciones verdaderamente críticas en términos de tiempo – como la renderización en tiempo real de VR/AR – una alta latencia efectivamente mataría la utilidad principal del modelo.
Los investigadores afirman:
‘Sostenemos que la limitación térmica supone una amenaza grave para las aplicaciones de aprendizaje automático móvil que son críticas en términos de latencia. Por ejemplo, durante la renderización visual en tiempo real para la transmisión de video o los juegos, un aumento repentino de la latencia de procesamiento por cuadro tendría un efecto negativo sustancial en la experiencia del usuario. Además, los sistemas operativos móviles modernos a menudo proporcionan servicios y aplicaciones especiales para personas con discapacidad visual, como VoiceOver en iOS y TalkBack en Android.
‘El usuario generalmente interactúa con los teléfonos móviles confiando completamente en el habla, por lo que la calidad de estos servicios depende en gran medida de la respuesta o la latencia de la aplicación.’

Gráficos que demuestran el rendimiento de BERT w50 d50 sin ayuda (rojo) y con cambio dinámico (azul). Observe la uniformidad de la latencia en el cambio dinámico (azul).
El documento se titula Juega con frescura: el cambio dinámico evita la limitación térmica, y es una colaboración entre dos investigadores de UoA; uno de Carnegie Mellon; y uno que representa ambas instituciones.
Inteligencia artificial móvil basada en CPU
Aunque el cambio dinámico y las arquitecturas multi-escala son un área de estudio establecida y activa, la mayoría de las iniciativas se han centrado en matrices de dispositivos computacionales de alta gama, y el foco de esfuerzo en este momento se divide entre la optimización intensa de las redes neuronales locales (es decir, basadas en el dispositivo) para fines de inferencia en lugar de entrenamiento, y la mejora del hardware móvil dedicado.
Las pruebas realizadas por los investigadores se llevaron a cabo en chips CPU en lugar de GPU. A pesar del creciente interés en aprovechar los recursos de GPU locales en aplicaciones de aprendizaje automático móvil (e incluso entrenar directamente en dispositivos móviles, lo que podría mejorar la calidad del modelo final), las GPU suelen consumir más energía, un factor crítico en el esfuerzo de la inteligencia artificial por ser independiente (de los servicios en la nube) y útil en un dispositivo con recursos limitados.
Pruebas de intercambio de pesos
Las redes probadas para el proyecto fueron redes delgadas y DynaBERT, que representan, respectivamente, una tarea de visión por computadora y una tarea de NLP.
Aunque ha habido varias iniciativas para crear iteraciones de BERT que puedan ejecutarse de manera eficiente y económica en dispositivos móviles, algunos de los intentos han sido criticados como soluciones tortuosas, y los investigadores del nuevo documento observan que utilizar BERT en el espacio móvil es un desafío, y que ‘los modelos BERT en general son demasiado intensivos computacionalmente para los teléfonos móviles’.
DynaBERT es una iniciativa china para optimizar el poderoso marco de NLP/NLU de Google en el contexto de un entorno con recursos limitados; pero incluso esta implementación de BERT, los investigadores encontraron, era muy exigente.
No obstante, en ambos el smartphone y el dispositivo Raspberry PI, los autores realizaron dos experimentos. En el experimento de visión por computadora, se procesó una imagen única, elegida al azar, de manera continua y repetitiva en ResNet50 como una tarea de clasificación, y pudo ejecutarse de manera estable y sin invocar la limitación térmica durante toda la hora de tiempo de ejecución del experimento.
El documento establece:
‘Aunque puede sacrificar algo de precisión, el cambio dinámico propuesto tiene una velocidad de inferencia más rápida. Lo más importante es que nuestro enfoque de cambio dinámico disfruta de una inferencia consistente.’

Ejecutando ResNet50 sin ayuda y con cambio dinámico entre Slimmable ResNet50 x1.0 y la versión x0.25 en una tarea de clasificación de imágenes continua, durante sesenta minutos.
Para las pruebas de NLP, los autores configuraron el experimento para cambiar entre los dos modelos más pequeños en la suite DynaBERT, pero encontraron que a 1,4 veces la latencia, BERT se limita a unos 70°. Por lo tanto, configuraron el cambio hacia abajo para que ocurriera cuando la temperatura de funcionamiento alcanzara 65°.
El experimento de BERT implicó dejar que la instalación se ejecutara de manera continua en un par de pregunta y respuesta de conjunto de datos ONLI de GLUE.
Los intercambios de latencia y precisión fueron más severos con la tarea de BERT ambiciosa que para la implementación de visión por computadora, y la precisión se produjo a expensas de una necesidad más severa de controlar la temperatura del dispositivo, para evitar la limitación:

Latencia vs precisión para los experimentos de los investigadores en las dos tareas.
Los autores observan:
‘El cambio dinámico, en general, no puede prevenir que los modelos BERT se limiten térmicamente debido a la intensidad computacional enorme del modelo. Sin embargo, bajo ciertas limitaciones, el cambio dinámico aún puede ser útil al implementar modelos BERT en teléfonos móviles.’
Los autores encontraron que los modelos BERT hacen que la temperatura del procesador del teléfono Honor V30 aumente a 80° en menos de 32 segundos, y activarán la limitación térmica en menos de seis minutos de actividad. Por lo tanto, los autores utilizaron solo modelos BERT de media anchura.
Los experimentos se repitieron en la configuración de Raspberry PI, y la técnica también pudo prevenir la activación de la limitación térmica en ese entorno. Sin embargo, los autores observan que el Raspberry PI no opera bajo las mismas restricciones térmicas extremas que un smartphone apretado, y parecen haber agregado esta serie de experimentos como una demostración adicional de la efectividad del método en entornos de procesamiento modestamente equipados.
Publicado por primera vez el 23 de junio de 2022.












