Financement
Conntour lève 7 millions de dollars pour transformer les caméras de sécurité en moteurs de recherche

Conntour émerge de la discrétion avec un tour de table de 7 millions de dollars soutenu par des investisseurs tels que General Catalyst, Y Combinator, SV Angel, et Liquid 2 Ventures. La société se positionne autour d’une idée simple mais ambitieuse : les équipes de sécurité devraient être en mesure de rechercher des vidéos aussi facilement qu’elles recherchent sur le web.
La plateforme introduit des requêtes en langage naturel à travers les réseaux de caméras, permettant aux utilisateurs de décrire ce qu’ils recherchent plutôt que de s’appuyer sur des filtres ou des catégories prédéfinis.
Des caméras passives à l’intelligence recherchable
Les systèmes de surveillance vidéo traditionnels sont construits sur des règles rigides. Les opérateurs doivent définir à l’avance ce qu’ils doivent détecter – des objets, des mouvements ou des comportements spécifiques. Cette approche conduit souvent à des incidents manqués et à des heures de révision manuelle lorsque quelque chose d’inattendu se produit.
Conntour remplace ce modèle par une interface plus flexible. Au lieu de configurer des alertes à l’avance, les utilisateurs peuvent saisir des requêtes telles que « une personne laissant un sac sans surveillance » ou « un van près du dock de chargement hier », et le système récupère les vidéos pertinentes.
Ceci marque un passage de la surveillance à la requête. La vidéo n’est plus quelque chose à regarder – elle devient quelque chose qui peut être exploré et interrogé à la demande.
Conçu pour la complexité du monde réel
L’un des défis principaux de la surveillance est que les situations du monde réel ne correspondent rarement à des catégories nettes. Un comportement suspect est souvent contextuel, impliquant des séquences d’actions plutôt qu’un objet détectable unique.
Le système de Conntour est conçu pour gérer cette ambiguïté. Il fonctionne à la fois sur les flux en direct et les archives vidéo, permettant des alertes en temps réel ainsi qu’une investigation rapide après un incident. La plateforme fonctionne également avec les infrastructures de caméras existantes et peut être déployée entièrement sur site, ce qui est essentiel pour les environnements où les données ne peuvent pas quitter les réseaux sécurisés.
L’interface est conçue pour l’utilisabilité, permettant aux opérateurs non techniques d’interagir avec des systèmes complexes sans avoir besoin de configurer des règles de détection ou de comprendre les modèles sous-jacents.
Adoption précoce dans des environnements à enjeux élevés
La société est déjà déployée dans des opérations de sécurité nationale à Singapour, ce qui suggère une adoption précoce dans des environnements où la précision et la rapidité sont critiques.
Le passé de l’équipe fondatrice dans le renseignement et les systèmes haute technologie semble influencer la conception du produit, en particulier son accent sur l’efficacité opérationnelle. La plateforme prétend permettre à un seul opérateur de surveiller des milliers de caméras tout en réduisant considérablement le temps nécessaire pour enquêter sur les incidents.
Par rapport aux systèmes traditionnels d’analyse vidéo, la plateforme rapporte des améliorations opérationnelles significatives :
- Jusqu’à 90 % de réduction du temps de révision vidéo manuel
- Jusqu’à 80 % d’incidents manqués en moins
- Jusqu’à 70 % de réduction des fausses alarmes
- La capacité pour un opérateur de superviser des milliers de caméras
Ces gains proviennent du remplacement de flux de travail basés sur des règles par des systèmes qui interprètent le contexte et l’intention de manière plus dynamique.
Vers où cette technologie pourrait mener
Ce que Conntour construit pointe vers un changement plus large dans la façon dont les données vidéo sont interprétées – pas seulement une analyse plus rapide, mais un modèle d’interaction fondamentalement différent. Au lieu de concevoir des systèmes autour de règles de détection prédéfinies, la charge se déplace vers la compréhension de l’intention exprimée en langage naturel.
Ce changement a des implications au-delà de la sécurité. Si les systèmes peuvent interpréter de manière fiable des requêtes ouvertes comme « quelqu’un laissant un objet derrière » ou « mouvement inhabituel près d’une entrée », cela suggère un déplacement vers une compréhension sémantique de la vidéo – où le contexte, les relations et les séquences sont aussi importants que les objets individuels.
À grande échelle, cela pourrait restructurer la façon dont les organisations utilisent les archives vidéo. Les vidéos deviennent un ensemble de données indexées qui peuvent être interrogées dynamiquement plutôt que stockées passivement. Dans des environnements tels que les hubs de transport, les réseaux logistiques ou les infrastructures publiques, cela pourrait changer la façon dont les incidents sont reconstruits, audité et potentiellement anticipés.
Sous le capot : de la détection à la compréhension
Les systèmes traditionnels s’appuient sur des modèles de détection d’objets formés pour reconnaître des catégories spécifiques telles que les personnes ou les véhicules. Bien que ces modèles soient efficaces dans des scénarios contrôlés, ils luttent lorsque les requêtes tombent en dehors des étiquettes prédéfinies.
L’approche de Conntour implique probablement la construction de représentations visuelles plus riches – souvent appelées embeddings – qui capturent non seulement les objets, mais également les attributs, les relations et les changements au fil du temps. Les requêtes en langage naturel peuvent alors être mappées dans le même espace de représentation, permettant au système de faire correspondre l’intention avec les données visuelles.
Un autre défi clé est le raisonnement temporel. De nombreuses requêtes du monde réel impliquent des séquences d’événements plutôt que des cadres uniques. Le support de cela nécessite de suivre les entités dans le temps et de comprendre les interactions, et non seulement d’identifier les objets en isolement.
Contraintes et compromis
Malgré son potentiel, ce type de système introduit de nouveaux défis. Le traitement de grands volumes de vidéo avec des modèles avancés est gourmand en calcul, en particulier dans les déploiements sur site où les ressources sont limitées.
La précision est une autre considération. Les requêtes ouvertes introduisent de l’ambiguïté, et les systèmes doivent équilibrer la flexibilité avec la précision pour éviter les faux positifs ou les détections manquées. Contrairement aux systèmes basés sur des règles, les systèmes basés sur le langage naturel dépendent fortement de la façon dont les modèles généralisent les cas limites.
Il y a également des implications en termes de gouvernance. La capacité de rechercher des attributs ou des comportements très spécifiques soulève des questions sur la surveillance, le contrôle d’accès et l’utilisation appropriée – en particulier dans des environnements sensibles ou publics.
Le lancement de Conntour met en évidence un déplacement loin des systèmes de surveillance rigides et basés sur des règles vers des systèmes qui peuvent interpréter l’intention et le contexte en temps réel.
Si ce modèle se révèle fiable, il pourrait redefinir la façon dont les organisations interagissent avec les données vidéo – en passant d’une surveillance passive à une intelligence dynamique et basée sur les requêtes.












