Líderes de opiniÃģn

Habilitar implementaciones de IA en el mundo real a gran escala

mm
AÃąade Unite.AI a tus fuentes preferidas en Google

Por Brad King, field CTO, Scality

Las herramientas de AI/ML y grandes datos tienen un hilo comÚn – necesitan datos, y necesitan muchos. La sabiduría convencional dice que cuanto mÃĄs, mejor. Los analistas predicen que la creaciÃģn de datos a nivel mundial crecerÃĄ a mÃĄs de 180 zettabytes para 2025 – y en 2020, la cantidad de datos creados y replicados alcanzÃģ un nuevo mÃĄximo de 64,2 zettabytes.

Esos datos son extremadamente valiosos – a menudo irremplazables y sometimes representando eventos de una sola vez o de una vez en la vida. Estos datos necesitan ser almacenados de manera segura; y aunque se estima que solo un pequeÃąo porcentaje de estos nuevos datos creados se conserva, la demanda de capacidad de almacenamiento sigue creciendo. De hecho, la base instalada de capacidad de almacenamiento se prevÃĐ que crezca a una tasa de crecimiento anual compuesta del 19,2% entre 2020 y 2025, segÚn investigadores de Statista.

Con mÃĄs datos siendo creados – particularmente por estas cargas de trabajo de AI/ML – las organizaciones necesitan mÃĄs almacenamiento, pero no todas las soluciones de almacenamiento pueden manejar estas cargas de trabajo intensivas y masivas. Lo que se necesita es un nuevo enfoque para el almacenamiento. Veamos cÃģmo las organizaciones estÃĄn superando estos desafíos a travÃĐs de la lente de tres casos de uso.

La industria del viaje

Mientras que muchos de nosotros estamos acostumbrÃĄndonos a viajar de nuevo despuÃĐs de mÃĄs de un aÃąo de bloqueos, la industria del viaje estÃĄ tratando de regresar a los tiempos pre-pandÃĐmicos de una manera importante. Y esto estÃĄ haciendo que la importancia de los datos – específicamente, la aplicaciÃģn y el uso relevantes de esos datos – sea aÚn mÃĄs importante.

Imagínese lo que podría hacer con el conocimiento de dÃģnde la mayoría de los viajeros aÃĐreos del mundo van a viajar maÃąana o dÃģnde van a viajar. Para una agencia de viajes, por ejemplo, eso sería enorme.

Pero estas organizaciones de viajes estÃĄn tratando con tantos datos que ordenarlos para determinar quÃĐ es significativo es una perspectiva abrumadora. Se genera aproximadamente un petabyte de datos cada día, y algunos de los datos son duplicados por sitios como Kayak. Estos datos son sensibles al tiempo, y las empresas de viajes necesitan descubrir rÃĄpidamente quÃĐ datos son significativos. Necesitan una herramienta para poder gestionar este nivel de escala de manera mÃĄs efectiva.

La industria del automÃģvil

Otro ejemplo proviene de la industria del automÃģvil, que es sin duda uno de los casos de uso mÃĄs hablados. La industria ha estado trabajando durante mucho tiempo en herramientas de asistencia como los indicadores de carril, la evitaciÃģn de colisiones y similares. Todos estos sensores estÃĄn generando grandes cantidades de datos. Y, por supuesto, estÃĄn desarrollando, probando y verificando algoritmos de conducciÃģn autÃģnoma.

Lo que la industria necesita es una mejor manera de dar sentido a estos datos almacenados para que puedan utilizarlos para analizar incidentes en los que algo saliÃģ mal, curar salidas de sensores como un caso de prueba, probar algoritmos contra datos de sensores y mÃĄs. Necesitan pruebas de QA para evitar regresiones, y necesitan documentar casos que fallen.

Patología digital

Otro caso de uso interesante para AI/ML que tambiÃĐn estÃĄ tratando con el diluvio de datos y la necesidad de hacer un mejor uso de los datos es la patología digital. Al igual que los otros ejemplos, lo que realmente necesitan es la capacidad de hacer un mejor uso de estos datos para que puedan hacer cosas como detectar automÃĄticamente patologías en muestras de tejido, realizar diagnÃģsticos remotos y así sucesivamente.

Pero el almacenamiento actual es limitante. Las imÃĄgenes con resoluciÃģn Útil son demasiado grandes para almacenarlas econÃģmicamente. Sin embargo, el almacenamiento de objetos rÃĄpido permitirÃĄ nuevas capacidades – como bancos de imÃĄgenes que se pueden utilizar como un recurso de entrenamiento clave y el uso de curvas de relleno de espacio para nombrar y recuperar imÃĄgenes multiresoluciÃģn en un almacÃĐn de objetos. TambiÃĐn permite una etiqueta de metadatos extensible y flexible, lo que facilita la bÚsqueda y la comprensiÃģn de esta informaciÃģn.

Las cargas de trabajo de IA requieren un nuevo enfoque

Como hemos visto en los tres casos anteriores, es fundamental poder agregar y orquestar vastas cantidades de datos relacionados con las cargas de trabajo de AI/ML. Los conjuntos de datos a menudo alcanzan una escala de varios petabytes, con demandas de rendimiento que podrían saturar toda la infraestructura. Al tratar con conjuntos de datos de entrenamiento y prueba de gran escala, superar los cuellos de botella de almacenamiento (problemas de latencia y/o rendimiento) y las limitaciones de capacidad son elementos clave para el ÃĐxito.

Las cargas de trabajo de AI/ML/DL requieren una arquitectura de almacenamiento que pueda mantener los datos fluyendo a travÃĐs de la tubería, con un excelente rendimiento bruto y capacidad de escalado. La infraestructura de almacenamiento debe mantener el ritmo de las demandas cada vez mÃĄs exigentes en todas las etapas de la tubería de AI/ML/DL. La soluciÃģn es una infraestructura de almacenamiento específicamente diseÃąada para la velocidad y la escalabilidad ilimitada.

Extraer valor

No pasa una semana sin historias sobre el potencial de la IA y el ML para cambiar los procesos empresariales y la vida cotidiana. Hay muchos casos de uso que claramente demuestran los beneficios de utilizar estas tecnologías. La realidad de la IA en la empresa hoy en día es una de conjuntos de datos abrumadoramente grandes y soluciones de almacenamiento que no pueden gestionar estas cargas de trabajo masivas. Las innovaciones en automÃģviles, atenciÃģn mÃĐdica y muchas otras industrias no pueden avanzar hasta que se resuelva el problema de almacenamiento. El almacenamiento de objetos rÃĄpido supera el desafío de retener grandes datos para que las organizaciones puedan extraer el valor de estos datos y avanzar en sus negocios.

Como CTO de campo, Brad King es responsable del diseÃąo de los sistemas mÃĄs grandes que Scality despliega en todo el mundo. Estos incluyen sistemas multi-petabyte, multi-sitio con cientos de servidores. Brad es uno de los co-fundadores de Scality. ComenzÃģ su carrera multifacÃĐtica como arquitecto naval con la marina francesa, realizando simulaciones numÃĐricas de vuelco de barcos y olas alrededor de grandes barcos. Luego se uniÃģ a un laboratorio de investigaciÃģn de Schlumberger en París durante varios aÃąos, donde trabajÃģ en dinÃĄmica de fluidos turbulentos, automatizaciÃģn de laboratorio, simulaciones numÃĐricas paralelas a gran escala y nuevas tecnologías de internet, incluyendo el monitoreo de proyectos de NCSA (como Mosaic) financiados por Schlumberger.