Fundamentos de la IA

Soluciones de aprendizaje automático personalizadas contra modelos de aprendizaje automático estándar

mm
Añade Unite.AI a tus fuentes preferidas en Google

¿Cuándo es mejor construir una solución que comprar una solución estándar?

Las empresas pueden adoptar diferentes enfoques para el desarrollo de modelos. Desde servicios de aprendizaje automático completamente administrados hasta modelos personalizados. Dependiendo de los requisitos comerciales, la experiencia disponible y las limitaciones de planificación, deben tomar una decisión: ¿deben desarrollar soluciones personalizadas desde cero? ¿O deben elegir un servicio estándar?

En todas las etapas de los trabajos de aprendizaje automático, se debe tomar una decisión sobre cómo encajan las diferentes piezas del rompecabezas. Desde la recopilación de datos, la preparación y la visualización, hasta la ingeniería de características, el entrenamiento de modelos y la evaluación, los ingenieros de aprendizaje automático se preguntan una y otra vez la misma pregunta: ¿será una solución implementada personalizada, escrita y desarrollada desde cero? ¿O será un servicio estándar?

Pero, ¿cuándo es mejor construir que comprar una solución estándar? Los principales factores diferenciadores entre los dos enfoques son: los esfuerzos de preprocesamiento, la velocidad de desarrollo y la experiencia requerida.

¿Qué debes considerar al determinar si usar modelos de aprendizaje automático estándar o personalizados?

Esfuerzos de preprocesamiento

Los proyectos de aprendizaje automático enfrentan todo tipo de desafíos, pero quizás el mayor desafío es la disponibilidad de datos de entrenamiento. La falta de datos de entrenamiento puede detener un proyecto antes de que incluso comience. Antes de que un proyecto comience, puede enfrentar costos de preprocesamiento significativos al recopilar datos, etiquetar datos, limpiar y preprocesar. Esto es la trampa bien conocida en la que muchos proyectos de aprendizaje automático fallan: el preprocesamiento acaba tomando el 80% de los recursos asignados, mientras que pocos recursos quedan para el entrenamiento y evaluación real del modelo.

Las soluciones estándar alivian las tensiones y dolores de los esfuerzos de preprocesamiento. Están diseñadas para realizar las operaciones más comunes con solo una pequeña configuración requerida. Lo mejor de ellas es: las soluciones estándar existen para todas las etapas de los trabajos de aprendizaje automático.

Por otro lado, las implementaciones personalizadas generalmente requieren más esfuerzos de preprocesamiento. Eso no significa que deban ser descartadas por completo: todavía son necesarias para afinar una determinada etapa de aprendizaje automático a las especificaciones del problema que se está resolviendo. Un conjunto de datos especialmente sucio puede requerir algunas reglas de limpieza especiales. Al mismo tiempo, un conjunto de características específico puede requerir ingeniería de características personalizada, al igual que las arquitecturas neuronales pueden requerir ajustes ligeras. En este caso, las soluciones personalizadas construidas desde cero probablemente cubran todas las necesidades.

Velocidad de desarrollo

Las soluciones estándar se centran en la configuración en lugar de la implementación. En lugar de asignar recursos para averiguar qué se debe hacer, los equipos de aprendizaje automático se centrarán en cómo encajan las diferentes piezas del rompecabezas. Este enfoque permite a las empresas, investigadores y ingenieros implementar rápidamente prototipos y pruebas de concepto. En lugar de reinventar la rueda, las soluciones estándar permiten aprovechar el conocimiento existente, lo que ahorra tiempo de desarrollo.

Las soluciones personalizadas implementadas desde cero son conocidas por ser mucho más lentas en términos de velocidad de desarrollo. Esto se debe a sus necesidades de mantenimiento aumentadas: los ingenieros deben averiguar tanto el qué como el cómo de la solución. De la misma manera, cuanto más compleja sea la solución, más tiempo y recursos se requieren para asegurar su escalabilidad y disponibilidad mientras está en producción. Desde esta perspectiva, las soluciones personalizadas y los esfuerzos de tiempo son directamente proporcionales: cuanto más compleja sea la solución, más tiempo requerirá.

Por lo general, sin embargo, la verdad está en algún lugar intermedio: una base de código existente se refactorizará y adaptará a las necesidades del proyecto actual. Tal es el caso del bien conocido enfoque de transferencia de aprendizaje para el entrenamiento de modelos.

Experiencia

Al igual que hay múltiples capas en las que se realiza el aprendizaje automático, hay múltiples niveles de experiencia en los que se pueden desarrollar los modelos de aprendizaje automático, que van desde interfaces sin código hasta la construcción de modelos desde cero.

Las soluciones estándar existen para las que se requiere muy poca experiencia en aprendizaje automático. Al utilizar interfaces intuitivas e incluso enfoques de arrastrar y soltar, se ha vuelto extremadamente simple para cualquier persona (desde analistas comerciales hasta ingenieros de software) construir y implementar algún tipo de modelo de aprendizaje automático. Si bien este enfoque simple de desarrollo de modelos puede funcionar para fines de prototipado, es poco probable que cumpla con los requisitos de los sistemas de producción.

La experiencia aún es necesaria para configurar, configurar y mantener las soluciones estándar en producción. Los trabajos, los parches de código, la conexión a diferentes interfaces de API y el manejo de problemas de implementación son tareas comunes necesarias para garantizar el rendimiento de los modelos en entornos de producción.

Las soluciones personalizadas generalmente se implementan a nivel de infraestructura y no hay forma de evitarlo: la experiencia es definitivamente necesaria. Dependiendo del tamaño de la empresa y los objetivos del proyecto, pueden ser necesarios equipos multidisciplinarios para mantener los sistemas de producción. Los científicos de datos, los ingenieros de aprendizaje automático y los analistas comerciales se unen para dar sentido a los resultados de inferencia y mantener los modelos de producción.

¿Qué debes usar: un modelo de aprendizaje automático estándar o personalizado?

Una solución de aprendizaje automático se construirá con muchos componentes y servicios individuales que necesitan unirse como una solución cohesiva. Nunca se trata de ir al 100% personalizado o al 100% estándar, ya que diferentes problemas comerciales requieren diferentes soluciones. Más a menudo de lo que no, las soluciones basadas en aprendizaje automático se construyen con una mezcla de los dos: servicios estándar para extraer conocimientos generales, combinados con modelos personalizados para aumentar la precisión y modelar el conocimiento específico del dominio.

El truco es saber cuándo implementar soluciones personalizadas desde cero y qué partes del proyecto pueden aprovechar los beneficios de los servicios estándar. Esto depende en gran medida del tipo de problema que se está abordando, los requisitos comerciales, los datos disponibles y las limitaciones generales del entorno de desarrollo.

Para más información sobre tendencias de IA y tecnología, consulte Josh Miramant, CEO de Blue Orange Digital, cuyas soluciones de datos impulsan la cadena de suministro, la automatización de documentos de atención médica y más.

También podría gustarte:

Usar NLP para clasificar comentarios en las redes sociales

Cómo el procesamiento del lenguaje se está mejorando a través del modelo BERT de código abierto de Google (GOOGL )

Josh Miramant es el CEO y fundador de Blue Orange Digital, una agencia de ciencia de datos y aprendizaje automático de alto rango con oficinas en la ciudad de Nueva York y Washington DC. Miramant es un orador popular, futurista y asesor estratégico de negocios y tecnología para empresas y startups. Ayuda a las organizaciones a optimizar y automatizar sus negocios, implementar técnicas analíticas basadas en datos y comprender las implicaciones de nuevas tecnologías como la inteligencia artificial, los grandes datos y el Internet de las cosas.