Ángulo de Anderson

10 Mejores Algoritmos de Aprendizaje Automático

mm
Añade Unite.AI a tus fuentes preferidas en Google

Aunque estamos viviendo una época de innovación extraordinaria en el aprendizaje automático acelerado por GPU, los últimos artículos de investigación frecuentemente presentan algoritmos que tienen décadas, en algunos casos 70 años de antigüedad.

Algunos podrían argumentar que muchos de estos métodos más antiguos caen en la categoría de ‘análisis estadístico’ en lugar de aprendizaje automático, y prefieren fechar el comienzo del sector hacia 1957, con la invención del Perceptrón.

Dado el grado en que estos algoritmos más antiguos apoyan y están entrelazados con las últimas tendencias y desarrollos en aprendizaje automático, es una postura discutible. Así que veamos algunos de los ‘bloques clásicos’ que subyacen a las últimas innovaciones, así como algunas nuevas entradas que están haciendo una oferta temprana para el salón de la fama de la IA.

1: Transformadores

En 2017, Google Research lideró una colaboración de investigación que culminó en el artículo La atención es todo lo que necesitas. El trabajo describió una arquitectura novedosa que promovió mecanismos de atención desde ‘tuberías’ en modelos de red neuronal codificador/decodificador y recurrente a una tecnología transformacional central en su propio derecho.

El enfoque se denominó Transformador, y desde entonces se ha convertido en una metodología revolucionaria en Procesamiento de Lenguaje Natural (NLP), impulsando, entre muchos otros ejemplos, el modelo de lenguaje autoregresivo y el ícono de la IA GPT-3.

Los transformadores resolvieron elegantemente el problema de transducción de secuencia, también llamado ‘transformación’, que se ocupa del procesamiento de secuencias de entrada en secuencias de salida. Un transformador también recibe y gestiona datos de manera continua, en lugar de en lotes secuenciales, lo que permite una ‘persistencia de memoria’ que las arquitecturas RNN no están diseñadas para obtener. Para una visión general más detallada de los transformadores, consulte nuestro artículo de referencia.

En contraste con las Redes Neuronales Recurrentes (RNN) que habían comenzado a dominar la investigación de ML en la era CUDA, la arquitectura del Transformador también podía ser fácilmente paralelizada, abriendo el camino para abordar productivamente un corpus de datos mucho más grande que las RNN.

Uso popular

Los transformadores capturaron la imaginación del público en 2020 con el lanzamiento de GPT-3 de OpenAI, que presumía de un récord de 175 mil millones de parámetros. Este logro aparentemente asombroso eventualmente fue eclipsado por proyectos posteriores, como el lanzamiento de Microsoft de Megatron-Turing NLG 530B en 2021, que (como sugiere el nombre) cuenta con más de 530 mil millones de parámetros.

Una línea de tiempo de proyectos de NLP de Transformador de hipercala. Fuente: Microsoft

Una línea de tiempo de proyectos de NLP de Transformador de hipercala. Fuente: Microsoft

La arquitectura del Transformador también ha cruzado de NLP a visión por computadora, impulsando una nueva generación de marcos de síntesis de imágenes como CLIP y DALL-E de OpenAI, que utilizan el mapeo de dominio de texto a imagen para completar imágenes incompletas y sintetizar imágenes nuevas a partir de dominios entrenados, entre una creciente cantidad de aplicaciones relacionadas.

DALL-E intenta completar una imagen parcial de un busto de Platón. Fuente: https://openai.com/blog/dall-e/

DALL-E intenta completar una imagen parcial de un busto de Platón. Fuente: https://openai.com/blog/dall-e/

2: Redes Adversarias Generativas (GANs)

Aunque los transformadores han ganado una cobertura mediática extraordinaria con el lanzamiento y la adopción de GPT-3, la Red Adversaria Generativa (GAN) se ha convertido en una marca reconocida por derecho propio, y puede eventualmente unirse a deepfake como un verbo.

Propuesta por primera vez en 2014 y utilizada principalmente para la síntesis de imágenes, una arquitectura de Red Adversaria Generativa está compuesta por un Generador y un Discriminador. El Generador recorre miles de imágenes en un conjunto de datos, intentando reconstruirlos iterativamente. Para cada intento, el Discriminador califica el trabajo del Generador y lo envía de regreso para que lo haga mejor, pero sin ninguna idea de cómo se equivocó la reconstrucción anterior.

Fuente: https://developers.google.com/machine-learning/gan/gan_structure

Fuente: https://developers.google.com/machine-learning/gan/gan_structure

Esto fuerza al Generador a explorar una multiplicidad de caminos, en lugar de seguir los posibles callejones sin salida que habrían resultado si el Discriminador le hubiera dicho dónde se equivocó (ver #8 a continuación). Al final del entrenamiento, el Generador tiene un mapa detallado y completo de las relaciones entre puntos en el conjunto de datos.

Un extracto del video de los investigadores (ver incrustación al final del artículo). Note que el usuario está manipulando las transformaciones con un cursor 'agarrar' (arriba a la izquierda). Fuente: https://www.youtube.com/watch?v=k7sG4XY5rIc

Desde el artículo Mejorar el equilibrio de GAN mediante el aumento de la conciencia espacial: un marco novedoso recorre el espacio latente a veces misterioso de una GAN, proporcionando instrumentación receptiva para una arquitectura de síntesis de imágenes. Fuente: https://genforce.github.io/eqgan/

Por analogía, esta es la diferencia entre aprender un solo viaje aburrido al centro de Londres o adquirir El Conocimiento.

El resultado es una colección de alto nivel de características en el espacio latente del modelo entrenado. El indicador semántico para una característica de alto nivel podría ser ‘persona’, mientras que un descenso a través de la especificidad relacionada con la característica puede descubrir otras características aprendidas, como ‘hombre’ y ‘mujer’. En niveles más bajos, las subcaracterísticas pueden descomponerse en ‘rubio’, ‘caucásico’, etc.

La entrelazamiento es un problema notable en el espacio latente de las GAN y los marcos codificador/decodificador: ¿es la sonrisa en una cara generada por GAN una característica entrelazada de su ‘identidad’ en el espacio latente, o es una rama paralela?

Caras generadas por GAN de thispersondoesnotexist. Fuente: https://this-person-does-not-exist.com/en

Caras generadas por GAN de thispersondoesnotexist. Fuente: https://this-person-does-not-exist.com/en

Los últimos años han traído una creciente cantidad de nuevas iniciativas de investigación en este respecto, quizás allanando el camino para una edición de nivel de característica, al estilo de Photoshop, para el espacio latente de una GAN, pero por ahora, muchas transformaciones son efectivamente paquetes ‘todo o nada’. Notablemente, la versión EditGAN de NVIDIA de finales de 2021 logra un alto nivel de interpretabilidad en el espacio latente utilizando máscaras de segmentación semántica.

Uso popular

Además de su (realmente bastante limitada) participación en videos de deepfake populares, las GAN centradas en imágenes y videos se han proliferado en los últimos cuatro años, fascinando a investigadores y al público por igual. Mantenerse al día con el ritmo vertiginoso y la frecuencia de nuevos lanzamientos es un desafío, aunque el repositorio de GitHub Aplicaciones increíbles de GAN pretende proporcionar una lista exhaustiva.

Las Redes Adversarias Generativas pueden, en teoría, derivar características de cualquier dominio bien enmarcado, incluyendo texto.

3: Máquina de Soporte Vectorial (SVM)

Originada en 1963, la Máquina de Soporte Vectorial (SVM) es un algoritmo básico que aparece con frecuencia en nuevas investigaciones. Bajo SVM, los vectores cartografían la disposición relativa de los puntos de datos en un conjunto de datos, mientras que los soporte vectores delinean los límites entre diferentes grupos, características o rasgos.

Los vectores de soporte definen los límites entre grupos. Fuente: https://www.kdnuggets.com/2016/07/support-vector-machines-simple-explanation.html

Los vectores de soporte definen los límites entre grupos. Fuente: https://www.kdnuggets.com/2016/07/support-vector-machines-simple-explanation.html

El límite derivado se llama hiperplano.

En niveles de características bajos, el SVM es bidimensional (imagen de arriba), pero donde hay un número más alto de grupos o tipos reconocidos, se convierte en tridimensional.

Un conjunto de puntos y grupos más profundo requiere un SVM tridimensional. Fuente: https://cml.rhul.ac.uk/svm.html

Un conjunto de puntos y grupos más profundo requiere un SVM tridimensional. Fuente: https://cml.rhul.ac.uk/svm.html

Uso popular

Dado que las Máquinas de Soporte Vectorial pueden abordar de manera efectiva y agnóstica datos de alta dimensionalidad de muchos tipos, aparecen ampliamente en una variedad de sectores de aprendizaje automático, incluyendo detección de deepfake, clasificación de imágenes, clasificación de discurso de odio, análisis de ADN y predicción de estructura de población, entre muchos otros.

4: Clustering K-Medias

El Clustering en general es un enfoque de aprendizaje no supervisado que busca categorizar puntos de datos a través de estimación de densidad, creando un mapa de la distribución de los datos que se estudian.

El Clustering K-Medias divina segmentos, grupos y comunidades en los datos. Fuente: https://aws.amazon.com/blogs/machine-learning/k-means-clustering-with-amazon-sagemaker/

El Clustering K-Medias divina segmentos, grupos y comunidades en los datos. Fuente: https://aws.amazon.com/blogs/machine-learning/k-means-clustering-with-amazon-sagemaker/

El Clustering K-Medias se ha convertido en la implementación más popular de este enfoque, guiando los puntos de datos hacia ‘K Grupos’ distintivos, que pueden indicar sectores demográficos, comunidades en línea o cualquier otra posible agregación secreta esperando ser descubierta en datos estadísticos brutos.

Los clusters se forman en el análisis K-Medias. Fuente: https://www.geeksforgeeks.org/ml-determine-the-optimal-value-of-k-in-k-means-clustering/

Los clusters se forman en el análisis K-Medias. Fuente: https://www.geeksforgeeks.org/ml-determine-the-optimal-value-of-k-in-k-means-clustering/

El valor K en sí es el factor determinante en la utilidad del proceso, y en el establecimiento de un valor óptimo para un cluster. Inicialmente, el valor K se asigna aleatoriamente, y sus características y características vectoriales se comparan con sus vecinos. Esos vecinos que más se asemejan al punto de datos con el valor K asignado aleatoriamente se asignan a su cluster iterativamente hasta que los datos han producido todos los agrupamientos que el proceso permite.

La trama para el error al cuadrado, o ‘costo’ de los valores diferentes entre los clusters, revelará un punto de codo para los datos:

El punto de codo en una gráfica de cluster. Fuente: https://www.scikit-yb.org/en/latest/api/cluster/elbow.html

El punto de codo en una gráfica de cluster. Fuente: https://www.scikit-yb.org/en/latest/api/cluster/elbow.html

El punto de codo es similar en concepto a la forma en que la pérdida se aplana hacia rendimientos decrecientes al final de una sesión de entrenamiento para un conjunto de datos. Representa el punto en el que no se van a hacer más distinciones entre grupos, indicando el momento de pasar a fases posteriores en la tubería de datos o informar los hallazgos.

Uso popular

El Clustering K-Medias, por razones obvias, es una tecnología principal en el análisis de clientes, ya que ofrece una metodología clara y explicativa para traducir grandes cantidades de registros comerciales en conocimientos demográficos y ‘leads’.

Fuera de esta aplicación, el Clustering K-Medias también se utiliza para predicción de deslizamientos de tierra, segmentación de imágenes médicas, síntesis de imágenes con GAN, clasificación de documentos y planificación urbana, entre muchos otros usos potenciales y reales.

5: Bosque Aleatorio

El Bosque Aleatorio es un método de aprendizaje ensemble que promedia el resultado de una matriz de árboles de decisión para establecer una predicción general para el resultado.

Fuente: https://www.tutorialandexample.com/wp-content/uploads/2019/10/Decision-Trees-Root-Node.png

Fuente: https://www.tutorialandexample.com/wp-content/uploads/2019/10/Decision-Trees-Root-Node.png

Si ha investigado incluso un poco, como ver la trilogía Volver al futuro, un árbol de decisión en sí es bastante fácil de conceptualizar: un número de caminos se encuentran ante usted, y cada camino se ramifica hacia un nuevo resultado que a su vez contiene caminos posibles adicionales.

En aprendizaje por refuerzo, podría retroceder de un camino y comenzar de nuevo desde una postura anterior, mientras que los árboles de decisión se comprometen con sus viajes.

Así, el algoritmo del Bosque Aleatorio es básicamente una apuesta en las decisiones. El algoritmo se llama ‘aleatorio’ porque hace selecciones ad hoc y observaciones para comprender la media suma de los resultados de la matriz del árbol de decisión.

Dado que tiene en cuenta una multiplicidad de factores, un enfoque de Bosque Aleatorio puede ser más difícil de convertir en gráficos significativos que un árbol de decisión, pero es probable que sea mucho más productivo.

Los árboles de decisión están sujetos a sobreajuste, donde los resultados obtenidos son específicos de los datos y no es probable que se generalicen. La selección aleatoria de datos del Bosque Aleatorio combate esta tendencia, perforando hacia tendencias representativas y útiles en los datos.

Regresión del árbol de decisión. Fuente: https://scikit-learn.org/stable/auto_examples/tree/plot_tree_regression.html

Regresión del árbol de decisión. Fuente: https://scikit-learn.org/stable/auto_examples/tree/plot_tree_regression.html

Uso popular

Como muchos de los algoritmos de esta lista, el Bosque Aleatorio generalmente opera como un ‘primer’ clasificador y filtro de datos, y como tal, aparece consistentemente en nuevos artículos de investigación. Algunos ejemplos de uso del Bosque Aleatorio incluyen síntesis de imágenes de resonancia magnética, predicción de precios de Bitcoin, segmentación de censo, clasificación de texto y detección de fraude de tarjeta de crédito.

Dado que el Bosque Aleatorio es un algoritmo de bajo nivel en las arquitecturas de aprendizaje automático, también puede contribuir al rendimiento de otros métodos de bajo nivel, así como a algoritmos de visualización, incluyendo Clustering inductivo, Transformaciones de características, clasificación de documentos de texto utilizando características dispersas, y visualización de tuberías.

6: Naive Bayes

Acoplado con la estimación de densidad (ver 4 anterior), un clasificador Naive Bayes es un algoritmo poderoso pero relativamente ligero capaz de estimar probabilidades basadas en las características calculadas de los datos.

Relaciones de características en un clasificador Naive Bayes. Fuente: https://www.sciencedirect.com/topics/computer-science/naive-bayes-model

Relaciones de características en un clasificador Naive Bayes. Fuente: https://www.sciencedirect.com/topics/computer-science/naive-bayes-model

El término ‘naïve’ se refiere a la suposición en teorema de Bayes de que las características son no relacionadas, conocidas como independencia condicional. Si se adopta este punto de vista, caminar y hablar como un pato no son suficientes para establecer que estamos tratando con un pato, y no se adoptan suposiciones ‘obvias’ de antemano.

Este nivel de rigor académico e investigador sería excesivo donde esté disponible el ‘sentido común’, pero es un estándar valioso cuando se navega por las muchas ambigüedades y posibles correlaciones no relacionadas que pueden existir en un conjunto de datos de aprendizaje automático.

En una red bayesiana original, las características están sujetas a funciones de puntuación, incluyendo longitud de descripción mínima y puntuación bayesiana, que pueden imponer restricciones en los datos en términos de las conexiones estimadas encontradas entre los puntos de datos y la dirección en la que fluyen estas conexiones.

Un clasificador Naive Bayes, por el contrario, opera asumiendo que las características de un objeto determinado son independientes, utilizando luego el teorema de Bayes para calcular la probabilidad de un objeto determinado, basándose en sus características.

Uso popular

Los filtros Naive Bayes están bien representados en predicción de enfermedades y categorización de documentos, filtro de spam, clasificación de sentimiento, sistemas de recomendación y detección de fraude, entre otras aplicaciones.

7: K-Vecinos más Cercanos (KNN)

Propuesto por primera vez por la Escuela de Medicina de Aviación de la Fuerza Aérea de los Estados Unidos en 1951, y teniendo que adaptarse al estado de la técnica de la informática de mediados del siglo XX, K-Vecinos más Cercanos (KNN) es un algoritmo delgado que todavía figura prominentemente en artículos de investigación académicos y privados.

KNN ha sido llamado ‘el aprendiz perezoso’, ya que escanea exhaustivamente un conjunto de datos para evaluar las relaciones entre los puntos de datos, en lugar de requerir el entrenamiento de un modelo de aprendizaje automático completo.

Un grupo KNN. Fuente: https://scikit-learn.org/stable/modules/neighbors.html

Un grupo KNN. Fuente: https://scikit-learn.org/stable/modules/neighbors.html

Aunque KNN es arquitectónicamente delgado, su enfoque sistemático coloca una demanda notable en las operaciones de lectura/escritura, y su uso en conjuntos de datos muy grandes puede ser problemático sin tecnologías auxiliares como el Análisis de Componentes Principales (PCA), que puede transformar conjuntos de datos complejos y de alto volumen en agrupaciones representativas que KNN puede atravesar con menos esfuerzo.

Un estudio reciente evaluó la efectividad y la economía de una serie de algoritmos encargados de predecir si un empleado abandonará una empresa, encontrando que el KNN de 70 años seguía siendo superior a contendientes más modernos en términos de precisión y eficacia predictiva.

Uso popular

Por su simplicidad de concepto y ejecución, KNN no está atascado en la década de 1950: se ha adaptado a un enfoque más enfocado en DNN en una propuesta de 2018 por la Universidad Estatal de Pensilvania, y sigue siendo un proceso de etapa temprana (o herramienta de análisis de post-procesamiento) en muchos marcos de aprendizaje automático más complejos.

En varias configuraciones, KNN se ha utilizado o para verificación de firma en línea, clasificación de imágenes, minería de texto, predicción de cultivos y reconocimiento facial, entre otras aplicaciones y incorporaciones.

Un sistema de reconocimiento facial basado en KNN en entrenamiento. Fuente: https://pdfs.semanticscholar.org/6f3d/d4c5ffeb3ce74bf57342861686944490f513.pdf

Un sistema de reconocimiento facial basado en KNN en entrenamiento. Fuente: https://pdfs.semanticscholar.org/6f3d/d4c5ffeb3ce74bf57342861686944490f513.pdf

8: Proceso de Decisión de Markov

Un marco matemático introducido por el matemático estadounidense Richard Bellman en 1957, el Proceso de Decisión de Markov (MDP) es uno de los bloques básicos de las arquitecturas de aprendizaje por refuerzo. Un algoritmo conceptual en su propio derecho, se ha adaptado a una gran cantidad de otros algoritmos y se repite con frecuencia en la actual cosecha de artículos de investigación de IA/ML.

MDP explora un entorno de datos utilizando su evaluación de su estado actual (es decir, ‘dónde’ está en los datos) para decidir qué nodo de los datos explorar a continuación.

Fuente: https://www.sciencedirect.com/science/article/abs/pii/S0888613X18304420

Fuente: https://www.sciencedirect.com/science/article/abs/pii/S0888613X18304420

Un Proceso de Decisión de Markov básico priorizará la ventaja a corto plazo sobre los objetivos más deseables a largo plazo. Por esta razón, generalmente se incrusta en el contexto de una arquitectura de política más completa en el aprendizaje por refuerzo, y a menudo está sujeto a factores limitantes como la recompensa con descuento y otras variables ambientales que lo impedirán apresurarse hacia un objetivo inmediato sin considerar el resultado más amplio deseado.

Uso popular

El concepto de bajo nivel de MDP es ampliamente utilizado en la investigación y las implementaciones activas de aprendizaje automático. Se ha propuesto para sistemas de defensa de seguridad de IoT, pesca y pronóstico de mercado.

Además de su aplicabilidad obvia al ajedrez y otros juegos secuenciales estrictos, MDP es un contendiente natural para el entrenamiento procedural de sistemas robóticos, como podemos ver en el video a continuación.

 

9: Frecuencia de Término-Inversa de Frecuencia de Documento

La Frecuencia de Término (TF) divide la cantidad de veces que una palabra aparece en un documento por la cantidad total de palabras en ese documento. Así, la palabra sello que aparece una vez en un artículo de mil palabras tiene una frecuencia de término de 0,001. Por sí solo, TF es en gran medida inútil como indicador de importancia de término, debido al hecho de que las palabras sin sentido (como un, y, el y lo) predominan.

Para obtener un valor significativo para un término, la Frecuencia de Documento Inversa (IDF) calcula la TF de una palabra en múltiples documentos en un conjunto de datos, asignando una calificación baja a las palabras de parada de alta frecuencia, como los artículos. Los vectores de características resultantes se normalizan a valores enteros, con cada palabra asignada a un peso apropiado.

TF-IDF pondera la relevancia de los términos según la frecuencia en una serie de documentos, con una ocurrencia menos frecuente como indicador de importancia. Fuente: https://moz.com/blog/inverse-document-frequency-and-the-importance-of-uniqueness

TF-IDF pondera la relevancia de los términos según la frecuencia en una serie de documentos, con una ocurrencia menos frecuente como indicador de importancia. Fuente: https://moz.com/blog/inverse-document-frequency-and-the-importance-of-uniqueness

Aunque este enfoque evita que las palabras semánticamente importantes se pierdan como valores atípicos, invertir el peso de la frecuencia no significa automáticamente que un término de baja frecuencia no sea un valor atípico, porque algunas cosas son raras y sin valor. Por lo tanto, un término de baja frecuencia necesitará demostrar su valor en el contexto arquitectónico más amplio al aparecer (incluso a una baja frecuencia por documento) en una serie de documentos en el conjunto de datos.

A pesar de su edad, TF-IDF es un método poderoso y popular para pases de filtrado iniciales en marcos de Procesamiento de Lenguaje Natural.

Uso popular

Debido a que TF-IDF ha desempeñado al menos algún papel en el desarrollo del algoritmo PageRank de Google en los últimos veinte años, se ha convertido en muy ampliamente adoptado como una táctica de SEO manipulativa, a pesar de la desaprobación de John Mueller en 2019 de su importancia para los resultados de búsqueda.

Debido a la secrecía alrededor de PageRank, no hay evidencia clara de que TF-IDF no sea actualmente una táctica efectiva para aumentar en los rankings de Google. La discusión incendiaria entre profesionales de TI recientemente indica una comprensión popular, correcta o no, de que el abuso de términos puede seguir generando un mejor posicionamiento en SEO (aunque las acusaciones adicionales de abuso de monopolio y publicidad excesiva borran los límites de esta teoría).

10: Descenso de Gradiente Estocástico

El Descenso de Gradiente Estocástico (SGD) es un método cada vez más popular para optimizar el entrenamiento de modelos de aprendizaje automático.

El Descenso de Gradiente en sí es un método de optimización y cuantificación del progreso que un modelo está haciendo durante el entrenamiento.

En este sentido, ‘gradiente’ indica una pendiente hacia abajo (en lugar de una gradación basada en color, ver imagen a continuación), donde el punto más alto de la ‘colina’, a la izquierda, representa el comienzo del proceso de entrenamiento. En esta etapa, el modelo no ha visto aún la totalidad de los datos ni una sola vez, y no ha aprendido lo suficiente sobre las relaciones entre los datos para producir transformaciones efectivas.

Un descenso de gradiente en una sesión de entrenamiento de FaceSwap. Podemos ver que el entrenamiento se ha estancado durante algún tiempo en la segunda mitad, pero eventualmente ha recuperado su camino hacia abajo en la gradiente hacia una convergencia aceptable.

Un descenso de gradiente en una sesión de entrenamiento de FaceSwap. Podemos ver que el entrenamiento se ha estancado durante algún tiempo en la segunda mitad, pero eventualmente ha recuperado su camino hacia abajo en la gradiente hacia una convergencia aceptable.

El punto más bajo, a la derecha, representa la convergencia (el punto en el que el modelo es tan efectivo como va a ser bajo las restricciones y configuraciones impuestas).

La gradiente actúa como un registro y predictor del progreso que un modelo está haciendo durante el entrenamiento.

Esta grabación del progreso se puede utilizar para informar un programa de tasa de aprendizaje, un proceso automático que le dice a la arquitectura que se vuelva más granular y precisa a medida que los detalles vagos iniciales se transforman en relaciones y asignaciones claras. En efecto, la pérdida de gradiente proporciona un mapa justo a tiempo de hacia dónde debe ir el entrenamiento a continuación y cómo debe proceder.

La innovación del Descenso de Gradiente Estocástico es que actualiza los parámetros del modelo en cada ejemplo de entrenamiento por iteración, lo que generalmente acelera el viaje hacia la convergencia. Debido al surgimiento de conjuntos de datos de hipercala en los últimos años, SGD ha crecido en popularidad como un método posible para abordar los problemas logísticos resultantes.

Por otro lado, SGD tiene implicaciones negativas para la escalabilidad de características, y puede requerir más iteraciones para lograr el mismo resultado, lo que requiere una planificación y parámetros adicionales, en comparación con el Descenso de Gradiente regular.

Uso popular

Debido a su configurabilidad, y a pesar de sus limitaciones, SGD se ha convertido en el algoritmo de optimización más popular para ajustar redes neuronales. Una configuración de SGD que se está convirtiendo en dominante en nuevos artículos de investigación de IA/ML es la elección del optimizador Estimación de Momento Adaptativa (ADAM) (introducido en 2015).

ADAM adapta la tasa de aprendizaje para cada parámetro de manera dinámica (‘tasa de aprendizaje adaptativa’), así como incorpora los resultados de las actualizaciones anteriores en la configuración posterior (‘momento’). Además, se puede configurar para utilizar innovaciones posteriores, como Momentum de Nesterov.

Sin embargo, algunos mantienen que el uso de momentum también puede impulsar a ADAM (y algoritmos similares) a una conclusión subóptima. Como con la mayoría de la vanguardia del sector de investigación de aprendizaje automático, SGD es un trabajo en progreso.

 

Publicado por primera vez el 10 de febrero de 2022. Modificado el 10 de febrero de 2022 a las 20:05 EET – formato.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]