Modèles et plateformes d’IA

Ce que vous devez savoir sur l’Operator d’OpenAI

mm
Ajouter Unite.AI à vos sources préférées sur Google

Au cours des dernières semaines, OpenAI a posé les fondations. Alors que la plupart des utilisateurs commençaient à explorer sérieusement les tâches planifiées de ChatGPT – une nouvelle fonctionnalité qui permet aux utilisateurs de planifier et de déclencher des tâches – l’entreprise se préparait à quelque chose de beaucoup plus important.

La sortie d’hier de l’Operator est un autre signal clair de la direction que prend l’intelligence artificielle : des modèles qui traitent simplement des informations à des agents qui peuvent travailler activement à nos côtés.

Chaque jour, nous passons des heures infinies à naviguer sur des sites Web, à remplir des formulaires, à réserver des services et à gérer des tâches numériques. L’IA a principalement regardé depuis les côtés, limitée à donner des conseils ou à traiter du texte. L’Operator, ainsi que certaines des autres annonces d’agents récents comme l’utilisation de l’ordinateur d’Anthropic et le projet Mariner de Google (GOOGL ), changent entièrement cette dynamique.

La réalisation technique est importante. OpenAI a créé une IA qui peut voir et interagir avec des interfaces Web comme le fait un humain. Elle capture des captures d’écran, comprend les dispositions visuelles et prend des décisions sur où cliquer, ce que taper et comment naviguer.

Voici ce que vous devez savoir sur l’agent Operator: Alors que de nombreux outils d’IA sont essentiellement piégés derrière des API et des intégrations spécialisées, l’Operator fonctionne avec le Web exactement comme vous le faites. Il voit l’écran, comprend le contexte et prend des mesures directes.

Un regard plus approfondi sur les performances réelles de l’Operator

Lorsque les entreprises d’IA publient des benchmarks, il est important d’examiner attentivement ce que les chiffres signifient réellement. Les performances de l’Operator racontent une histoire différente dans différents environnements de test.

La métrique la plus impressionnante est le taux de réussite de 87 % de l’Operator sur le benchmark WebVoyager. Cela compte car WebVoyager teste des sites Web réels – les plateformes que nous utilisons quotidiennement comme Amazon (AMZN ) et Google Maps. Ce n’est pas un test de laboratoire contrôlé. C’est une performance dans la nature.

Mais lorsque nous regardons d’autres benchmarks, nous voyons un tableau plus nuancé:

  • WebArena Benchmark: 58,1 % de taux de réussite. Test des sites Web simulés pour des tâches comme le shopping et la gestion de contenu. Les performances plus faibles ici révèlent en fait quelque chose d’important sur la façon dont les agents IA gèrent les environnements structurés par rapport aux environnements non structurés.
  • OSWorld Benchmark: 38,1 % de taux de réussite. Cela teste des tâches complexes et multétapes comme la combinaison de PDF à partir de courriels. La baisse significative des performances nous montre les limites actuelles des agents IA lorsqu’il s’agit de tâches nécessitant de multiples commutations de contexte.

Ce qui m’intéresse dans ces chiffres, c’est la façon dont ils reflètent les modèles d’apprentissage humain. Nous performons généralement mieux dans des environnements familiers et réels que dans des scénarios de test artificiels. Le fait que l’Operator excelle sur des sites Web réels tandis que ses performances sont plus faibles sur des sites simulés suggère que sa formation donne la priorité à l’utilité pratique plutôt qu’à la performance théorique.

Ces benchmarks établissent de nouveaux records en matière d’automatisation de navigateur, mais les taux de réussite variables à travers les différents tests nous disent quelque chose de crucial sur la stratégie d’OpenAI.

Pensez à votre propre navigation Web. La plupart des tâches sont simples : remplir des formulaires, effectuer des achats, réserver des rendez-vous. C’est là que le taux de réussite de 87 % de l’Operator brille. Les tâches plus complexes – où les performances sont plus faibles – sont généralement celles où la supervision humaine est précieuse.

Ces données suggèrent qu’OpenAI fait un choix délibéré : perfectionner les tâches communes en premier, puis élargir progressivement à des opérations plus complexes. C’est une approche pratique qui donne la priorité à l’utilité immédiate plutôt qu’aux capacités théoriques.

Benchmarks d’agent IA (OpenAI)

La stratégie d’OpenAI derrière l’Operator

L’approche d’OpenAI avec l’Operator révèle une stratégie soigneusement orchestrée.

Tout d’abord, considérez le moment. Le déploiement récent de fonctionnalités comme les tâches planifiées de ChatGPT n’était pas seulement une question d’ajout de fonctionnalités – c’était pour préparer les utilisateurs à des agents autonomes.

Mais voici ce qui est vraiment intéressant : OpenAI prévoit d’exposer le modèle CUA via une API. Cela signifie que les développeurs pourront créer leurs propres agents utilisant l’ordinateur.

Les implications sont importantes:

  1. Potentiel d’intégration
  • Incorporation directe dans les flux de travail existants
  • Agents personnalisés pour des besoins commerciaux spécifiques
  • Solutions d’automatisation spécifiques à l’industrie
  1. Parcours de développement futur
  • Expansion aux utilisateurs Pro, Plus, Équipe et Entreprise
  • Intégration directe à ChatGPT
  • Expansion géographique (bien que l’Europe prenne plus de temps en raison des exigences réglementaires)

Les partenariats stratégiques sont également révélateurs. OpenAI tente de créer un écosystème entier. Ils travaillent avec des entreprises comme DoorDash (DASH ), Instacart et OpenTable, mais également avec des organisations du secteur public comme la ville de Stockton.

Cela indique un avenir où les agents IA ne sont pas seulement des assistants, mais des parties intégrantes de la façon dont nous interagissons avec les systèmes numériques.

Ce que cela signifie réellement pour vous

Nous entrons dans une phase où l’IA ne répond pas seulement à des questions – elle devient un participant actif dans notre vie numérique.

Pensez à vos tâches numériques quotidiennes. Pas les tâches complexes et stratégiques qui nécessitent votre expertise, mais les tâches répétitives. Je parle de la recherche d’options de voyage sur plusieurs sites, de la saisie de formulaires standardisés, de la collecte de données à partir de diverses sources Web et de la gestion de réservations régulières. C’est là que l’Operator élimine initialement le travail numérique fastidieux. Mais ce n’est pas là que cela s’arrêtera. Avec le temps, les agents IA seront capables de compléter des flux de travail de plus en plus complexes.

Les données de performance préliminaires nous disent également quelque chose de crucial : l’Operator excelle dans les tâches Web répétitives avec un taux de réussite de 87 %. Les premiers utilisateurs qui apprennent à l’intégrer efficacement auront un avantage significatif en termes de productivité.

Le calendrier d’intégration révèle l’approche soigneuse d’OpenAI. Ils commencent par les utilisateurs Pro aux États-Unis, puis élargissent aux utilisateurs Plus, Équipe et Entreprise, avant de finalement intégrer directement à ChatGPT.

Nous assistons à un changement fondamental dans la façon dont les outils d’IA fonctionnent. La vraie question que vous devriez vous poser n’est pas de savoir si vous devez vous adapter à ce changement, mais comment le faire de manière stratégique. La technologie évoluera, mais le principe reste : l’IA passe de la réponse à des questions à l’action. Ceux qui comprennent ce changement tôt auront un avantage significatif dans la façon dont ces outils s’intègrent dans leurs flux de travail.

Alex McFarland est un journaliste et écrivain en intelligence artificielle qui explore les derniers développements en intelligence artificielle. Il a collaboré avec de nombreuses startups et publications en intelligence artificielle dans le monde entier.