Entrevistas

Fredrik Nilsson, Vicepresidente, Américas, Axis Communications – Serie de entrevistas

mm
Añade Unite.AI a tus fuentes preferidas en Google

Fredrik Nilsson, Vicepresidente, Américas, Axis Communications, supervisa las operaciones de la empresa en Norte y Sudamérica, liderando equipos centrados en desarrollar y ofrecer soluciones de seguridad basadas en red para socios y usuarios finales. Un ejecutivo de Axis de larga trayectoria, Nilsson ha desempeñado un papel importante en la transición de la industria de la seguridad del video cerrado analógico a la videovigilancia basada en IP. Desde que asumió la responsabilidad de las Américas en 2003, ha ayudado a incrementar los ingresos regionales de aproximadamente $20 millones a más de $1 mil millones y ha apoyado la expansión de más de 20 Centros de Experiencia Axis en las Américas. Se incorporó a Axis en 1996, habiendo ocupado previamente los cargos de Gerente de Producto y Gerente de División en Suecia y, más tarde, Director de Desarrollo de Negocios, donde contribuyó a establecer alianzas durante el desarrollo inicial del video IP. Al comienzo de su carrera, fue Gerente de Producto en ABB, y actualmente forma parte de los consejos de administración de MSAB y de la Cámara de Comercio Sueco‑Estadounidense en Washington, D.C.

Axis Communications es una empresa tecnológica con sede en Suecia especializada en seguridad física inteligente y soluciones de red, que incluyen cámaras de red, sistemas de videovigilancia, control de acceso, intercomunicadores, audio en red, radar y análisis. Fundada en 1984 y con sede central en Lund, Suecia, Axis emplea aproximadamente a 5 000 personas en más de 50 países y forma parte del Grupo Canon desde 2015. La compañía presentó lo que describe como la primera cámara de red del mundo en 1996 y, desde entonces, ha ampliado su oferta del video en red a un portafolio más amplio de tecnologías de seguridad conectadas. Sus productos actuales incorporan cada vez más análisis basados en el borde y inteligencia artificial para transformar video, audio y datos de sensores en conocimientos procesables para la seguridad, la protección, la eficiencia operativa y la inteligencia empresarial.

Su carrera ha abarcado la monitorización remota en ABB, el desarrollo temprano de almacenamiento conectado a la red y tecnologías de Internet de las Cosas, y la transición de la vigilancia analógica al video en red en Axis Communications. ¿Cómo ha influido ese historial en la forma en que usted percibe el actual cambio hacia cámaras impulsadas por IA y la infraestructura física inteligente?

Veo el paso hacia cámaras impulsadas por IA como el siguiente paso en una evolución en la que he participado a lo largo de mi carrera, desde la tecnología conectada y la convergencia IP hasta el borde inteligente actual. Un hilo conductor a lo largo de mi trayectoria ha sido ayudar a los clientes a comprender lo que la tecnología conectada puede hacer por ellos. ABB fue una gran escuela para mí. Era una gran empresa global, por lo que tuve la oportunidad de viajar por el mundo, incluida una estancia de un año en Canadá, y trabajar con grandes clientes empresariales, especialmente compañías eléctricas, en proyectos complejos. Mi función era gerente de producto para un nuevo sistema de monitorización y control remoto conectado por IP. En Axis, más tarde trabajé en una nueva categoría de dispositivos de almacenamiento conectados por IP y ayudé a difundir globalmente los beneficios de la tecnología conectada. Luego, en los primeros días de la convergencia IP, me basé en esos mismos principios, ayudando a los clientes empresariales a entender el valor del video conectado a la red y las oportunidades creadas por la tecnología IP. Así que, cuando observo las cámaras impulsadas por IA hoy, veo otro paso en esa misma evolución. La tecnología sigue siendo más capaz, pero la verdadera oportunidad sigue siendo conectar dispositivos, generar datos útiles y ayudar a los clientes a hacer más con ellos.

¿Qué tipos de cargas de trabajo de visión por computadora son más adecuadas para ejecutarse directamente en una cámara, y qué aplicaciones aún se benefician de procesarse en un centro de datos local o en la nube?

Las cargas de trabajo más adecuadas para ejecutarse directamente en una cámara son aquellas que requieren decisiones en tiempo real, baja latencia y uso eficiente del ancho de banda. Por ejemplo, la detección y clasificación de personas u objetos, el recuento, el seguimiento de movimientos o la identificación de eventos específicos. Con tecnologías como Axis Object Analytics, las cámaras pueden detectar con precisión personas, vehículos, colores, dirección de desplazamiento y otras características. También podemos entrenar una cámara para objetos o escenarios muy específicos mediante Axis Custom Analytics. A medida que los análisis mejoran, más de esa inteligencia puede ocurrir en el borde. Para muchos casos de uso, ejecutar los análisis en la cámara y enviar solo los datos o metadatos resultantes a un servidor o a la nube es importante para la escalabilidad y el costo. La nube y los servidores siguen teniendo un papel importante, particularmente para la gestión centralizada, el almacenamiento a largo plazo y el análisis de metadatos en un gran número de dispositivos. No lo veo como una decisión de todo o nada. El borde y la nube pueden complementarse, cada uno haciendo lo que mejor le corresponde.

Implementar IA en el borde requiere equilibrar la precisión del modelo con limitaciones de potencia de procesamiento, memoria, consumo energético y calor. ¿Cómo están cambiando los avances en chips especializados lo que se puede lograr de manera realista dentro de una cámara?

Realmente hay dos tendencias que impulsan esto. Primero, la capacidad de IA del procesador en el edge está mejorando muy rápidamente. ARTPEC-9, nuestro sistema en chip desarrollado internamente, tiene tres veces la capacidad de procesamiento de IA de ARTPEC-8, lo que nos brinda mucho más espacio para ejecutar modelos sofisticados directamente en la cámara. Las generaciones futuras seguirán aumentando esa capacidad. Segundo, el tamaño y la efectividad de los modelos están mejorando. Ahí es donde hemos visto mucho progreso durante el último año. Nuestro equipo de I+D ha hecho un trabajo increíble al lograr que más del modelo se ejecute directamente en el edge, de modo que en muchos escenarios solo se necesite usar los datos de la cámara en lugar de enviar el video a otro lugar para su procesamiento. Hace un año hablábamos de que aproximadamente el 50 % de las necesidades se atendían en la cámara. Hoy está más cerca del 90 % y esperamos que llegue al 95 % o más. El verdadero avance no es solo que tengamos chips más potentes, sino que estamos combinando hardware más capaz con modelos de IA más eficientes, lo que permite que una cantidad creciente de inteligencia ocurra directamente donde se generan los datos. Eso hace que los sistemas de vigilancia dependan mucho menos de servidores y de la nube para la IA.

Las cámaras se están posicionando cada vez más como sensores operacionales en lugar de únicamente como dispositivos de seguridad. ¿Qué aplicaciones en el comercio minorista, transporte, salud, fabricación o logística están proporcionando actualmente el valor empresarial más claro?

La fabricación es un ejemplo muy bueno porque el valor puede vincularse directamente a la operación. BMW Group, por ejemplo, está utilizando cámaras de red como parte de su sistema de inspección de calidad impulsado por IA para capturar imágenes detalladas de los vehículos en tiempo real e identificar defectos. Ese es un papel muy diferente para una cámara que simplemente registrar un incidente. También estamos viendo un uso creciente del video para la eficiencia operativa y la inteligencia empresarial en general. En transporte y logística, las cámaras pueden ayudar a las organizaciones a comprender cómo se mueven las personas, los vehículos y la mercancía dentro de una instalación. En el comercio minorista, el video puede proporcionar información sobre el comportamiento de los clientes, la utilización del espacio y la dotación de personal. El tema común es que la cámara está generando información que puede usarse para mejorar un proceso, no solo para registrar lo que ocurrió.

¿Cómo la combinación de video con análisis de audio, radar, sistemas de control de acceso y sensores ambientales crea conocimientos que no serían posibles solo con datos visuales?

Cuanto más contexto se pueda reunir, mejor podrá el sistema entender lo que está sucediendo. Cuando se combinan diferentes entradas, se pueden obtener conocimientos que serían difíciles, y a veces imposibles, de derivar solo del video. Por ejemplo, se puede combinar la apariencia de un objeto con su movimiento, o usar información térmica y visual conjuntamente cuando la iluminación o la visibilidad son desafiantes. El radar puede añadir información sobre el movimiento y la velocidad de un objeto, el audio puede identificar sonidos o proporcionar comunicación bidireccional, y los sensores ambientales pueden aportar contexto adicional sobre lo que ocurre en el entorno circundante. Múltiples sensores también pueden aumentar la confianza en lo que el sistema o el usuario está detectando. La combinación de tecnologías es increíblemente importante para proteger áreas clave de la vida, como la infraestructura crítica.

Ya nos estamos moviendo en esa dirección. En GSX, por ejemplo, introdujimos soluciones que combinan visión, térmica, radar, audio y detección ambiental. El objetivo es reunir los datos correctos para que las organizaciones puedan tomar decisiones más rápidas y mejor informadas. Esto es particularmente importante para aplicaciones como la protección de infraestructura crítica, donde contar con múltiples fuentes de información puede proporcionar una imagen más completa de lo que está sucediendo.

El procesamiento en el edge puede reducir la cantidad de video sin procesar que necesita transmitirse o almacenarse, pero las cámaras habilitadas con IA siguen planteando importantes preguntas de privacidad y gobernanza. ¿Qué principios deben seguir las organizaciones al diseñar sistemas que sean útiles sin recopilar más datos personales de los necesarios?

El punto de partida debe ser preguntar qué necesita lograr realmente el sistema y recopilar solo la información necesaria para ese propósito. La privacidad y la transparencia también son importantes. Las personas quieren entender por qué se está usando el video y cómo se maneja su información. Nuestra investigación reciente muestra que la gente se siente cada vez más cómoda con la videovigilancia, pero esa aceptación no puede darse por sentada. Las mayores preocupaciones respecto a la vigilancia habilitada con IA son los falsos positivos o la información inexacta y el posible uso indebido o mal manejo de los datos. Eso impone una responsabilidad real a las organizaciones y a los proveedores de tecnología para incorporar la privacidad y la seguridad en los sistemas desde el principio. El procesamiento en el edge puede ayudar aquí porque permite analizar la información localmente y enviar solo los datos necesarios, en lugar de mover video continuo sin procesar por la red.

La infraestructura física puede permanecer desplegada durante muchos años, mientras que los modelos de IA y las amenazas de ciberseguridad evolucionan rápidamente. ¿Cómo deben diseñarse las cámaras y otros dispositivos de edge para que sus análisis sigan siendo seguros, mantenibles y adaptables a lo largo de su vida operativa?

Esta es una de las razones por las que considero la cámara como parte de la infraestructura de TI y operativa más amplia, en lugar de un dispositivo de seguridad independiente. La ciberseguridad debe incorporarse al dispositivo desde el principio, con software seguro, actualizaciones regulares y fuertes protecciones de ciberseguridad a lo largo de su ciclo de vida. En Axis, por ejemplo, Edge Vault proporciona una base basada en hardware para proteger la integridad del dispositivo, asegurar las claves criptográficas y establecer una cadena de confianza. También admite capacidades como arranque seguro y software firmado, ayudando a garantizar que solo se ejecute software de confianza en el dispositivo.

El dispositivo también necesita una arquitectura que pueda adaptarse a medida que cambian los análisis y los requisitos del cliente. Las plataformas abiertas son importantes aquí porque permiten a las organizaciones integrar nuevas aplicaciones y tecnologías en lugar de tener que reemplazar todo el sistema cada vez que algo evoluciona. Al mismo tiempo, las organizaciones necesitan una buena gobernanza de sus dispositivos conectados. A medida que más video, sensores y sistemas empresariales se integran, la ciberseguridad y la protección de datos deben tratarse como parte del diseño general del sistema, no como algo añadido después.

Axis admite un ecosistema de aplicaciones abierto que permite a desarrolladores externos crear y desplegar análisis especializados en sus dispositivos. ¿Qué tan importantes serán las plataformas abiertas y la interoperabilidad a medida que las organizaciones buscan ejecutar sus propios modelos en grandes flotas de cámaras?

Creo que será extremadamente importante. Los clientes no quieren estar atados a una única tecnología o a una única forma de hacer las cosas, especialmente cuando la IA y los análisis continúan evolucionando tan rápidamente. Una plataforma abierta facilita la integración de cámaras con otros sistemas, la incorporación de aplicaciones especializadas y la ampliación a gran escala. También brinda a los clientes mayor flexibilidad a medida que sus necesidades cambian. Al eliminar el bloqueo de proveedores y simplificar la integración, los ecosistemas abiertos e interoperables facilitan escalar soluciones de borde inteligente mientras se adaptan a las cambiantes demandas empresariales. En última instancia, el valor no reside solo en la propia cámara. Reside en cómo la cámara, los sensores, los análisis y las aplicaciones empresariales trabajan juntos.

¿Cómo deben las organizaciones evaluar el rendimiento de los sistemas de visión por computadora después de su despliegue, particularmente cuando la iluminación, la posición de la cámara, el comportamiento humano o las condiciones operativas pueden cambiar y potencialmente afectar la precisión?

Todo depende del caso de uso, pero lo más importante es probar las cámaras y los modelos de IA en el entorno real donde se van a utilizar. Puedes tener un modelo que funciona muy bien en un entorno controlado, pero la verdadera prueba es lo que ocurre con la iluminación real, la posición de la cámara, el clima, el fondo y el comportamiento que se observan en el sitio. Por eso animamos a los clientes a evaluar análisis como Axis Object Analytics o Axis Custom Analytics en el entorno real y asegurarse de que la precisión sea lo suficientemente alta para la aplicación. La fábrica de BMW es un buen ejemplo de este enfoque. Las cámaras se están utilizando en un entorno de producción real, donde la calidad de las imágenes y los análisis resultantes deben respaldar un proceso de fabricación real.

A medida que la IA en el borde se vuelve más capaz, ¿cómo esperas que evolucione el papel de la cámara de red en la próxima década y qué nuevas capacidades podrían surgir a medida que las cámaras se convierten en componentes activos de entornos inteligentes y responsivos?

La cámara de red está adquiriendo un papel mucho más central en el sistema. Ya no es solo una cámara que genera video. Es un sensor que genera datos que pueden ser analizados y compartidos entre diferentes sistemas. A medida que la potencia de procesamiento sigue aumentando, espero que las cámaras sean aún mejores para comprender lo que ocurre en su entorno y proporcionar información útil en tiempo real. Esa es la idea detrás de Scene Intelligence, donde la cámara puede usar una comprensión más profunda de la escena para ofrecer información más significativa sobre los objetos, sus características y lo que está sucediendo a su alrededor.

Eso podría significar detección de objetos y comportamientos más avanzada, mayor integración con otros sensores y sistemas empresariales, y más automatización en la forma en que las organizaciones responden a los eventos. El cambio más grande es que el video se convierte en una parte de una capa más amplia de datos e inteligencia. La cámara sigue capturando lo que ocurre, pero cada vez más también puede ayudar a explicar lo que ocurre y lo que una organización podría querer hacer a continuación.

Gracias por la excelente entrevista, los lectores que deseen obtener más información deberían visitar Axis Communications.

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma y promover el futuro de la IA y la robótica. Como empresario serial, cree que la IA será tan disruptiva para la sociedad como la electricidad, y a menudo se le escucha hablando con entusiasmo sobre el potencial de las tecnologías disruptivas y la AGI.

Como futurista, está dedicado a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma enfocada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y remodelando sectores enteros.