Leaders d’opinion

Pourquoi l’intelligence artificielle d’entreprise ÃĐchoue à la ligne d’arrivÃĐe — et comment y remÃĐdier

mm
Ajouter Unite.AI à vos sources prÃĐfÃĐrÃĐes sur Google

MalgrÃĐ le buzz autour de l’intelligence artificielle, la plupart des projets d’intelligence artificielle d’entreprise ne dÃĐpassent pas le stade expÃĐrimental. Selon une ÃĐtude rÃĐcente d’IDC, 88 % des projets de preuve de concept (POC) d’intelligence artificielle ÃĐchouent à passer à la production complÃĻte. C’est un dÃĐclin massif, et un signe clair que quelque chose ne fonctionne pas. Beaucoup de ces projets s’approchent de la ligne d’arrivÃĐe, avec un modÃĻle formÃĐ qui rÃĐpond aux benchmarks ÃĐtablis par l’ÃĐquipe, puis finissent par ne pas Être lancÃĐs ou adoptÃĐs par les utilisateurs finals.

Qu’est-ce qui ne va pas ? Dans de nombreux cas, cela se rÃĐsume à trois grands problÃĻmes :

  1. Les ÃĐquipes d’intelligence artificielle d’entreprise s’appuient sur des outils de diagnostic de surface et des benchmarks qui ne dÃĐtectent pas les lacunes de performance clÃĐs
  2. Les modÃĻles sont formÃĐs pour rÃĐpondre à des benchmarks standard au lieu de rÃĐsoudre des problÃĻmes du monde rÃĐel
  3. Le coÃŧt de la mise à l’ÃĐchelle de l’utilisation du modÃĻle se rÃĐvÃĻle trop ÃĐlevÃĐ pour une adoption à l’ÃĐchelle de l’entreprise

Dans cet article, nous allons examiner chacun de ces piÃĻges — et ce qu’il faut pour faire passer les projets d’intelligence artificielle au-delà de la ligne d’arrivÃĐe et les mettre entre les mains des utilisateurs à grande ÃĐchelle.

ProblÃĻme #1 : Les diagnostics standard qui manquent des problÃĻmes de performance clÃĐs

Une des principales raisons pour lesquelles les projets d’intelligence artificielle trÃĐbuchent aprÃĻs la phase de preuve de concept est que les benchmarks et les diagnostics internes ne creusent souvent pas suffisamment profondÃĐment dans les performances du modÃĻle et tendent à manquer les problÃĻmes qui nuisent à l’utilisabilitÃĐ, à la confiance et à l’adoption. Les ÃĐquipes peuvent cocher toutes les cases sur le papier, mais ces vÃĐrifications ne reflÃĻtent pas toujours la façon dont le modÃĻle se comportera dans le monde rÃĐel.

Prenons cet exemple : Une ÃĐquipe d’intelligence artificielle avait un modÃĻle qui passait tous les tests internes avec succÃĻs. Il rÃĐpondait à toutes les mÃĐtriques d’exactitude et aux seuils de sÃĐcuritÃĐ, et ils se prÃĐparaient à le lancer. Mais lorsque qu’ils ont fait ÃĐvaluer le modÃĻle par un tiers pour leur cas d’utilisation prÃĐvu, afin de simuler la façon dont les utilisateurs rÃĐels interagiraient avec le systÃĻme, ils ont dÃĐcouvert un point aveugle majeur. Le modÃĻle ÃĐtait neuf fois plus susceptible de donner des rÃĐponses ÃĐvasives lorsqu’on lui posait des questions d’une certaine maniÃĻre. Par exemple, il rÃĐpondait correctement à ÂŦ Qui est le prÃĐsident des États-Unis ? Âŧ mais traitait ÂŦ Pouvez-vous me parler du prÃĐsident ? Âŧ comme un risque pour la sÃĐcuritÃĐ et refusait de rÃĐpondre.

Le problÃĻme n’ÃĐtait pas avec les connaissances fondamentales du modÃĻle — mais avec la façon dont il interprÃĐtait l’intention en fonction de la formulation. L’ÃĐquipe avait optimisÃĐ la sÃĐcuritÃĐ Ã  tel point qu’elle avait accidentellement bloquÃĐ des questions normales et raisonnables.

ProblÃĻme #2 : Les modÃĻles sont affinÃĐs pour rÃĐpondre à des benchmarks qui ne reflÃĻtent pas le monde rÃĐel

Un autre obstacle courant pour l’intelligence artificielle d’entreprise est que les ÃĐquipes d’intelligence artificielle forment des modÃĻles pour rÃĐpondre à des benchmarks standard de l’industrie plutÃīt qu’aux besoins du monde rÃĐel. Sur le papier, un modÃĻle peut sembler de premier ordre, obtenant de hauts scores aux ÃĐvaluations standard pour l’exactitude, la pertinence ou la sÃĐcuritÃĐ. Mais dans la pratique, il peut avoir du mal à fournir des rÃĐsultats utiles et cohÃĐrents sans une intervention importante de l’utilisateur.

Ceci se produit lorsque les ÃĐquipes optimisent les modÃĻles pour performer bien sur des tÃĒches ÃĐtroites et spÃĐcifiques aux benchmarks. Le modÃĻle finit par exceller dans ces cas de test, mais il vacille lorsqu’il rencontre des entrÃĐes du monde rÃĐel moins structurÃĐes et plus variÃĐes. En consÃĐquence, les utilisateurs doivent ÂŦ parler le langage du modÃĻle Âŧ grÃĒce à l’ingÃĐnierie de prompt pour obtenir les bonnes rÃĐponses. Si votre produit d’intelligence artificielle dÃĐpend de la capacitÃĐ des utilisateurs finals à crÃĐer des invites prÃĐcises, vous avez introduit une friction qui ralentit l’adoption et sape son utilitÃĐ.

Ce type de formation axÃĐe sur les benchmarks peut ÃĐgalement conduire à un surajustement. Le modÃĻle devient tellement affinÃĐ pour performer bien sur les jeux de donnÃĐes d’ÃĐvaluation qu’il perd sa gÃĐnÃĐralisabilitÃĐ. Il peut passer tous les tests internes, mais encore ÃĐchouer lorsqu’il est dÃĐployÃĐ dans la nature, surtout si les cas d’utilisation rÃĐels diffÃĻrent ne serait-ce que lÃĐgÃĻrement de ceux pour lesquels il a ÃĐtÃĐ formÃĐ.

Si vous voulez une solution d’intelligence artificielle d’entreprise qui rÃĐussit, votre modÃĻle doit fonctionner dans le monde rÃĐel — et pas seulement dans le laboratoire.

ProblÃĻme #3 : La mise à l’ÃĐchelle de l’adoption de l’intelligence artificielle signifie la mise à l’ÃĐchelle des coÃŧts de calcul

La troisiÃĻme raison pour laquelle de nombreux projets de preuve de concept d’intelligence artificielle ÃĐchouent à passer à l’ÃĐchelle est financiÃĻre : les ÃĐquipes sous-estiment souvent le coÃŧt de l’exÃĐcution et de la maintenance du modÃĻle en production. Lors du dÃĐveloppement, il est facile de nÃĐgliger les exigences de calcul d’un grand modÃĻle, en particulier lors des tests sur de petits jeux de donnÃĐes ou dans des environnements à usage limitÃĐ. Mais une fois dÃĐployÃĐ, ces coÃŧts peuvent exploser.

L’intelligence artificielle d’entreprise de niveau requiert des ressources computationnelles importantes, non seulement pour servir les rÃĐponses en temps rÃĐel, mais ÃĐgalement pour le rÃĐglage, la surveillance, la journalisation et la rÃĐformation continues. Si ces coÃŧts ne sont pas pris en compte tÃīt, le cas d’affaires pour la solution peut s’effondrer une fois que l’utilisation rÃĐelle commence. Ce qui semblait Être un modÃĻle prometteur dans un environnement contrÃīlÃĐ peut rapidement devenir insoutenable lorsque des milliers d’utilisateurs commencent à solliciter le systÃĻme quotidiennement.

Surmonter les obstacles de derniÃĻre ligne pour une intelligence artificielle d’entreprise rÃĐussie

Pour ÃĐviter les piÃĻges courants qui font dÃĐrailler tant de projets d’intelligence artificielle d’entreprise, les ÃĐquipes doivent aller au-delà du livre de jeu habituel. Voici comment votre ÃĐquipe d’intelligence artificielle peut construire quelque chose qui fonctionne vraiment — et qui peut Être mis à l’ÃĐchelle.

Tout d’abord, faites ÃĐvaluer votre modÃĻle par un tiers. Les tests internes sont importants, mais ils sont souvent trop larges. Un regard frais, associÃĐ Ã  un cadre d’ÃĐvaluation personnalisÃĐ adaptÃĐ Ã  votre cas d’utilisation, peut mettre en ÃĐvidence des problÃĻmes que votre ÃĐquipe pourrait manquer, en particulier lorsqu’il s’agit de la façon dont les utilisateurs rÃĐels interagiront avec le systÃĻme.

Ensuite, assurez-vous de tester avec des invites du monde rÃĐel. La plupart des benchmarks testent sur des ÂŦ donnÃĐes propres Âŧ qui ne reflÃĻtent pas le monde rÃĐel, et encore moins la façon dont vos utilisateurs finals interagiront avec votre modÃĻle. Tester votre modÃĻle sur des entrÃĐes peu claires, vagues ou ÃĐtrangement formulÃĐes vous aidera à voir comment votre modÃĻle se comportera rÃĐellement aprÃĻs le dÃĐploiement et à dÃĐtecter les problÃĻmes qui pourraient autrement passer inaperçus et affecter l’adoption.

Enfin, rÃĐexaminez vos protocoles de sÃĐcuritÃĐ. Il est facile d’en faire trop avec les garde-fous, et mÊme si la sÃĐcuritÃĐ est importante, elle ne devrait pas rendre votre modÃĻle frustrant à utiliser. Si le modÃĻle se ferme sur des questions simples et inoffensives, vous ÃĐchangez l’utilisabilitÃĐ contre une fausse sensation de sÃĐcuritÃĐ.

Enfin, surveillez vos coÃŧts de calcul. Si vos objectifs d’adoption incluent des milliers d’utilisateurs et des millions de requÊtes, ces dÃĐpenses peuvent augmenter rapidement. Une solution consiste à envisager des modÃĻles plus petits. Boosted.ai l’a fait — ils sont passÃĐs à un modÃĻle de langage personnalisÃĐ plus petit et ont rÃĐduit leurs coÃŧts de calcul de 90 % tout en amÃĐliorant la vitesse et les performances. RÃĐsultats en temps rÃĐel, meilleure expÃĐrience utilisateur, et pas besoin de matÃĐriel coÃŧteux.

En abordant l’ÃĐvaluation, l’utilisabilitÃĐ et la scalabilitÃĐ dÃĻs le dÃĐpart, les ÃĐquipes peuvent donner à leur projet d’intelligence artificielle une vÃĐritable chance de rÃĐussir à long terme. Il ne s’agit pas seulement de faire fonctionner les choses dans un laboratoire — mais de les faire fonctionner dans le monde.

Matt Fitzpatrick est le PDG d'Invisible Technologies, un fournisseur de plate-forme de logiciels d'IA qui a formÃĐ 80 % des principaux fournisseurs de modÃĻles d'IA dans le monde. Invisible fournit l'expertise pour faire fonctionner l'IA dans le monde rÃĐel pour n'importe quelle industrie, fonction ou cas d'utilisation. Avant de rejoindre l'entreprise, Matt ÃĐtait un associÃĐ principal et leader mondial de QuantumBlack Labs chez McKinsey, oÃđ il supervisait 1 000 ingÃĐnieurs et supervisait le dÃĐveloppement logiciel de l'entreprise dans GenAI et tous les secteurs. Il est diplÃīmÃĐ de Princeton et de Wharton.