Modèles et plateformes d’IA

Technique de vision par ordinateur pour prédire le comportement humain à partir de vidéos

mm
Ajouter Unite.AI à vos sources préférées sur Google

Une nouvelle technique de vision par ordinateur développée par les chercheurs de Columbia Engineering peut prédire le comportement humain à partir de vidéos. La nouvelle technique donne aux machines un sens intuitif leur permettant de prédire ce qui se passera ensuite en utilisant des associations de niveau supérieur entre les personnes, les animaux et les objets.

Carl Vondrick est professeur agrégé de sciences informatiques à Columbia. Vondrick a dirigé l’étude, qui a été présentée le 24 juin à la Conférence internationale sur la vision par ordinateur et la reconnaissance de formes. 

“Notre algorithme est un pas vers la capacité des machines à faire de meilleures prédictions sur le comportement humain, et ainsi à mieux coordonner leurs actions avec les nôtres,” a déclaré Vondrick. “Nos résultats ouvrent un certain nombre de possibilités pour la collaboration humaine-robot, les véhicules autonomes et les technologies d’assistance.”

La nouvelle méthode est la plus précise de son genre à ce jour pour la prédiction d’événements d’action de vidéo plusieurs minutes à l’avance. Le système a d’abord analysé des milliers d’heures de films, de matchs de sport et d’émissions avant de prédire des centaines d’activités, telles que les poignées de main et les tapes dans le dos. 

Si le système ne peut pas prédire une action spécifique, il trouve un concept de niveau supérieur qui les relie, tel que le mot « salutation ». 

Tentatives antérieures

Les tentatives antérieures de prévision par apprentissage automatique se sont généralement concentrées sur la prédiction d’une action à la fois, les algorithmes décidant de classifier l’action, par exemple, comme une étreinte, une poignée de main, un high-five ou une non-action. Cependant, une grande incertitude signifie que la plupart des modèles d’apprentissage automatique ne sont pas en mesure de trouver des similitudes entre les options possibles. 

L’équipe comprenait les étudiants de troisième cycle de Columbia Engineering, Didac Suris et Ruoshi Liu, et le duo a abordé le problème de prédiction à long terme d’une manière légèrement différente. 

Suris est co-auteur principal de l’article.

“Pas tout dans le futur est prévisible,” a déclaré Suris. “Lorsqu’une personne ne peut pas prévoir exactement ce qui se passera, elle joue la sécurité et prédit à un niveau d’abstraction plus élevé. Notre algorithme est le premier à apprendre cette capacité à raisonner de manière abstraite sur les événements futurs.”

https://www.youtube.com/watch?v=b1riFCPiqN4

Développement du nouveau système

Suris et Liu ont utilisé des géométries inhabituelles pour développer des modèles d’IA qui organisent des concepts de niveau supérieur et prédissent le comportement humain dans le futur. 

Aude Oliva, qui n’a pas participé à l’étude, est chercheuse principale au Massachusetts Institute of Technology et co-directrice du laboratoire d’IA Watson MIT-IBM. 

“La prédiction est la base de l’intelligence humaine,” a déclaré Oliva. “Les machines font des erreurs que les humains ne feraient jamais parce qu’elles leur manquent la capacité de raisonner de manière abstraite. Ce travail est un pas crucial vers le comblement de ce fossé technologique.”

Les chercheurs ont développé un cadre mathématique qui permet aux machines d’organiser les événements en fonction de leur prévisibilité dans le futur. Par exemple, le nouveau système apprend à catégoriser des activités comme la natation et la course comme des catégories distinctes, plutôt que simplement comme de l’exercice. Le système est également capable de tenir compte de l’incertitude, ce qui conduit à des actions plus spécifiques.

Selon Liu, co-auteur principal de l’article, la technique nouvellement développée pourrait aider les ordinateurs à prendre des décisions nuancées plutôt que des actions préprogrammées, et elle est cruciale pour établir la confiance entre les humains et les ordinateurs. 

“La confiance vient du sentiment que le robot comprend vraiment les gens,” explique-t-il. “Si les machines peuvent comprendre et anticiper nos comportements, les ordinateurs seront en mesure d’assister les gens de manière transparente dans leur vie quotidienne.”

L’équipe va maintenant vérifier si la technique fonctionne dans le monde réel, et elle pourrait être déployée pour la sécurité, la santé et la sécurité.  

“Le comportement humain est souvent surprenant,” déclare Vondrick. “Nos algorithmes permettent aux machines de mieux anticiper ce qu’ils vont faire ensuite.”

Alex McFarland est un journaliste et écrivain en intelligence artificielle qui explore les derniers développements en intelligence artificielle. Il a collaboré avec de nombreuses startups et publications en intelligence artificielle dans le monde entier.