Fundamentos de la IA

Aprendizaje Supervisado contra Aprendizaje No Supervisado

mm
AÃąade Unite.AI a tus fuentes preferidas en Google

En aprendizaje automÃĄtico, la mayoría de las tareas se pueden categorizar fÃĄcilmente en una de dos clases diferentes: problemas de aprendizaje supervisado o problemas de aprendizaje no supervisado. En el aprendizaje supervisado, los datos tienen etiquetas o clases asignadas, mientras que en el caso del aprendizaje no supervisado, los datos no estÃĄn etiquetados. Veamos por quÃĐ esta distinciÃģn es importante y exploremos algunos de los algoritmos asociados con cada tipo de aprendizaje.

Aprendizaje Supervisado vs Aprendizaje No Supervisado

La mayoría de las tareas de aprendizaje automÃĄtico se encuentran en el dominio del aprendizaje supervisado. En los algoritmos de aprendizaje supervisado, las instancias/puntos de datos individuales en el conjunto de datos tienen una clase o etiqueta asignada. Esto significa que el modelo de aprendizaje automÃĄtico puede aprender a distinguir quÃĐ características estÃĄn correlacionadas con una clase determinada y que el ingeniero de aprendizaje automÃĄtico puede verificar el rendimiento del modelo viendo cuÃĄntas instancias se clasificaron correctamente. Los algoritmos de clasificaciÃģn se pueden utilizar para discernir muchos patrones complejos, siempre y cuando los datos estÃĐn etiquetados con las clases adecuadas. Por ejemplo, un algoritmo de aprendizaje automÃĄtico puede aprender a distinguir diferentes animales entre sí en funciÃģn de características como “bigotes”, “cola”, “garras”, etc.

En contraste con el aprendizaje supervisado, el aprendizaje no supervisado implica crear un modelo que pueda extraer patrones de datos no etiquetados. En otras palabras, la computadora analiza las características de entrada y determina por sí misma quÃĐ características y patrones son los mÃĄs importantes. El aprendizaje no supervisado intenta encontrar las similitudes inherentes entre diferentes instancias. Si un algoritmo de aprendizaje supervisado tiene como objetivo colocar los puntos de datos en clases conocidas, los algoritmos de aprendizaje no supervisado examinarÃĄn las características comunes a las instancias de objetos y las colocarÃĄn en grupos en funciÃģn de estas características, esencialmente creando sus propias clases.

Ejemplos de algoritmos de aprendizaje supervisado son RegresiÃģn Lineal, RegresiÃģn Logística, K-vecinos mÃĄs cercanos, Árboles de DecisiÃģn y MÃĄquinas de Soporte Vectorial.

Mientras que algunos ejemplos de algoritmos de aprendizaje no supervisado son AnÃĄlisis de Componentes Principales y Clustering K-Medias.

Algoritmo de Aprendizaje Supervisado

RegresiÃģn Lineal es un algoritmo que toma dos características y traza la relaciÃģn entre ellas. La RegresiÃģn Lineal se utiliza para predecir valores numÃĐricos en relaciÃģn con otras variables numÃĐricas. La RegresiÃģn Lineal tiene la ecuaciÃģn de Y = a + bX, donde b es la pendiente de la línea y a es donde y cruza el eje X.

La RegresiÃģn Logística es un algoritmo de clasificaciÃģn binaria. El algoritmo examina la relaciÃģn entre las características numÃĐricas y encuentra la probabilidad de que la instancia se pueda clasificar en una de dos clases diferentes. Los valores de probabilidad se “aprietan” hacia 0 o 1. En otras palabras, las probabilidades fuertes se acercarÃĄn a 0,99, mientras que las probabilidades dÃĐbiles se acercarÃĄn a 0.

K-vecinos mÃĄs cercanos asigna una clase a los nuevos puntos de datos en funciÃģn de las clases asignadas de algunos vecinos elegidos en el conjunto de entrenamiento. La cantidad de vecinos considerados por el algoritmo es importante, y demasiados o demasiados pocos vecinos pueden mal clasificar los puntos.

Árboles de DecisiÃģn son un tipo de algoritmo de clasificaciÃģn y regresiÃģn. Un ÃĄrbol de decisiÃģn opera dividiendo un conjunto de datos en porciones cada vez mÃĄs pequeÃąas hasta que los subconjuntos no se pueden dividir mÃĄs y lo que resulta es un ÃĄrbol con nodos y hojas. Los nodos son donde se toman decisiones sobre los puntos de datos utilizando diferentes criterios de filtrado, mientras que las hojas son las instancias que han sido asignadas a alguna etiqueta (un punto de datos que ha sido clasificado). Los algoritmos de ÃĄrbol de decisiÃģn pueden manejar tanto datos numÃĐricos como categÃģricos. Las divisiones en el ÃĄrbol se realizan en variables/características específicas.

MÃĄquinas de Soporte Vectorial son un algoritmo de clasificaciÃģn que opera dibujando hiperplanos, o líneas de separaciÃģn, entre los puntos de datos. Los puntos de datos se separan en clases en funciÃģn de quÃĐ lado del hiperplano se encuentran. Se pueden dibujar mÚltiples hiperplanos en un plano, dividiendo un conjunto de datos en mÚltiples clases. El clasificador intentarÃĄ maximizar la distancia entre el hiperplano divisor y los puntos en cada lado del plano, y cuanto mayor sea la distancia entre la línea y los puntos, mÃĄs confiado estarÃĄ el clasificador.

Algoritmos de Aprendizaje No Supervisado

AnÃĄlisis de Componentes Principales es una tÃĐcnica utilizada para la reducciÃģn de dimensionalidad, lo que significa que la dimensionalidad o complejidad de los datos se representa de una manera mÃĄs simple. El algoritmo de AnÃĄlisis de Componentes Principales encuentra nuevas dimensiones para los datos que son ortogonales. Mientras que la dimensionalidad de los datos se reduce, la varianza entre los datos debe conservarse tanto como sea posible. Lo que esto significa en tÃĐrminos prÃĄcticos es que toma las características del conjunto de datos y las destila en menos características que representan la mayoría de los datos.

El Clustering K-Medias es un algoritmo que agrupa automÃĄticamente los puntos de datos en clusters en funciÃģn de características similares. Los patrones dentro del conjunto de datos se analizan y los puntos de datos se dividen en grupos en funciÃģn de estos patrones. Esencialmente, K-Medias crea sus propias clases a partir de datos no etiquetados. El algoritmo K-Medias opera asignando centros a los clusters, o centroides, y moviendo los centroides hasta que se encuentra la posiciÃģn Ãģptima para los centroides. La posiciÃģn Ãģptima serÃĄ aquella en la que la distancia entre los centroides y los puntos de datos circundantes dentro de la clase se minimice. La “K” en Clustering K-Medias se refiere a la cantidad de centroides elegidos.

Resumen

Para concluir, veamos rÃĄpidamente las diferencias clave entre aprendizaje supervisado y no supervisado.

Como discutimos anteriormente, en las tareas de aprendizaje supervisado, los datos de entrada estÃĄn etiquetados y se conocen el nÚmero de clases. Mientras que en los casos de aprendizaje no supervisado, los datos de entrada no estÃĄn etiquetados y no se conocen el nÚmero de clases. El aprendizaje no supervisado tiende a ser menos complejo computacionalmente, mientras que el aprendizaje supervisado tiende a ser mÃĄs complejo computacionalmente. Mientras que los resultados del aprendizaje supervisado tienden a ser muy precisos, los resultados del aprendizaje no supervisado tienden a ser menos precisos/moderadamente precisos.

Bloguero y programador con especialidades en Machine Learning y Deep Learning temas. Daniel espera ayudar a otros a utilizar el poder de la IA para el bien social.