Leaders dâopinion
Pourquoi l’intelligence artificielle d’entreprise ÃĐchoue à la ligne d’arrivÃĐe â et comment y remÃĐdier

MalgrÃĐ le buzz autour de lâintelligence artificielle, la plupart des projets dâintelligence artificielle dâentreprise ne dÃĐpassent pas le stade expÃĐrimental. Selon une ÃĐtude rÃĐcente dâIDC, 88 % des projets de preuve de concept (POC) dâintelligence artificielle ÃĐchouent à passer à la production complÃĻte. Câest un dÃĐclin massif, et un signe clair que quelque chose ne fonctionne pas. Beaucoup de ces projets sâapprochent de la ligne dâarrivÃĐe, avec un modÃĻle formÃĐ qui rÃĐpond aux benchmarks ÃĐtablis par lâÃĐquipe, puis finissent par ne pas Être lancÃĐs ou adoptÃĐs par les utilisateurs finals.
Quâest-ce qui ne va pas ? Dans de nombreux cas, cela se rÃĐsume à trois grands problÃĻmes :
- Les ÃĐquipes dâintelligence artificielle dâentreprise sâappuient sur des outils de diagnostic de surface et des benchmarks qui ne dÃĐtectent pas les lacunes de performance clÃĐs
- Les modÃĻles sont formÃĐs pour rÃĐpondre à des benchmarks standard au lieu de rÃĐsoudre des problÃĻmes du monde rÃĐel
- Le coÃŧt de la mise à lâÃĐchelle de lâutilisation du modÃĻle se rÃĐvÃĻle trop ÃĐlevÃĐ pour une adoption à lâÃĐchelle de lâentreprise
Dans cet article, nous allons examiner chacun de ces piÃĻges â et ce quâil faut pour faire passer les projets dâintelligence artificielle au-delà de la ligne dâarrivÃĐe et les mettre entre les mains des utilisateurs à grande ÃĐchelle.
ProblÃĻme #1 : Les diagnostics standard qui manquent des problÃĻmes de performance clÃĐs
Une des principales raisons pour lesquelles les projets dâintelligence artificielle trÃĐbuchent aprÃĻs la phase de preuve de concept est que les benchmarks et les diagnostics internes ne creusent souvent pas suffisamment profondÃĐment dans les performances du modÃĻle et tendent à manquer les problÃĻmes qui nuisent à lâutilisabilitÃĐ, à la confiance et à lâadoption. Les ÃĐquipes peuvent cocher toutes les cases sur le papier, mais ces vÃĐrifications ne reflÃĻtent pas toujours la façon dont le modÃĻle se comportera dans le monde rÃĐel.
Prenons cet exemple : Une ÃĐquipe dâintelligence artificielle avait un modÃĻle qui passait tous les tests internes avec succÃĻs. Il rÃĐpondait à toutes les mÃĐtriques dâexactitude et aux seuils de sÃĐcuritÃĐ, et ils se prÃĐparaient à le lancer. Mais lorsque quâils ont fait ÃĐvaluer le modÃĻle par un tiers pour leur cas dâutilisation prÃĐvu, afin de simuler la façon dont les utilisateurs rÃĐels interagiraient avec le systÃĻme, ils ont dÃĐcouvert un point aveugle majeur. Le modÃĻle ÃĐtait neuf fois plus susceptible de donner des rÃĐponses ÃĐvasives lorsquâon lui posait des questions dâune certaine maniÃĻre. Par exemple, il rÃĐpondait correctement à ÂŦ Qui est le prÃĐsident des Ãtats-Unis ? Âŧ mais traitait ÂŦ Pouvez-vous me parler du prÃĐsident ? Âŧ comme un risque pour la sÃĐcuritÃĐ et refusait de rÃĐpondre.
Le problÃĻme nâÃĐtait pas avec les connaissances fondamentales du modÃĻle â mais avec la façon dont il interprÃĐtait lâintention en fonction de la formulation. LâÃĐquipe avait optimisÃĐ la sÃĐcuritÃĐ Ã tel point quâelle avait accidentellement bloquÃĐ des questions normales et raisonnables.
ProblÃĻme #2 : Les modÃĻles sont affinÃĐs pour rÃĐpondre à des benchmarks qui ne reflÃĻtent pas le monde rÃĐel
Un autre obstacle courant pour lâintelligence artificielle dâentreprise est que les ÃĐquipes dâintelligence artificielle forment des modÃĻles pour rÃĐpondre à des benchmarks standard de lâindustrie plutÃīt quâaux besoins du monde rÃĐel. Sur le papier, un modÃĻle peut sembler de premier ordre, obtenant de hauts scores aux ÃĐvaluations standard pour lâexactitude, la pertinence ou la sÃĐcuritÃĐ. Mais dans la pratique, il peut avoir du mal à fournir des rÃĐsultats utiles et cohÃĐrents sans une intervention importante de lâutilisateur.
Ceci se produit lorsque les ÃĐquipes optimisent les modÃĻles pour performer bien sur des tÃĒches ÃĐtroites et spÃĐcifiques aux benchmarks. Le modÃĻle finit par exceller dans ces cas de test, mais il vacille lorsquâil rencontre des entrÃĐes du monde rÃĐel moins structurÃĐes et plus variÃĐes. En consÃĐquence, les utilisateurs doivent ÂŦ parler le langage du modÃĻle Âŧ grÃĒce à lâingÃĐnierie de prompt pour obtenir les bonnes rÃĐponses. Si votre produit dâintelligence artificielle dÃĐpend de la capacitÃĐ des utilisateurs finals à crÃĐer des invites prÃĐcises, vous avez introduit une friction qui ralentit lâadoption et sape son utilitÃĐ.
Ce type de formation axÃĐe sur les benchmarks peut ÃĐgalement conduire à un surajustement. Le modÃĻle devient tellement affinÃĐ pour performer bien sur les jeux de donnÃĐes dâÃĐvaluation quâil perd sa gÃĐnÃĐralisabilitÃĐ. Il peut passer tous les tests internes, mais encore ÃĐchouer lorsquâil est dÃĐployÃĐ dans la nature, surtout si les cas dâutilisation rÃĐels diffÃĻrent ne serait-ce que lÃĐgÃĻrement de ceux pour lesquels il a ÃĐtÃĐ formÃĐ.
Si vous voulez une solution dâintelligence artificielle dâentreprise qui rÃĐussit, votre modÃĻle doit fonctionner dans le monde rÃĐel â et pas seulement dans le laboratoire.
ProblÃĻme #3 : La mise à lâÃĐchelle de lâadoption de lâintelligence artificielle signifie la mise à lâÃĐchelle des coÃŧts de calcul
La troisiÃĻme raison pour laquelle de nombreux projets de preuve de concept dâintelligence artificielle ÃĐchouent à passer à lâÃĐchelle est financiÃĻre : les ÃĐquipes sous-estiment souvent le coÃŧt de lâexÃĐcution et de la maintenance du modÃĻle en production. Lors du dÃĐveloppement, il est facile de nÃĐgliger les exigences de calcul dâun grand modÃĻle, en particulier lors des tests sur de petits jeux de donnÃĐes ou dans des environnements à usage limitÃĐ. Mais une fois dÃĐployÃĐ, ces coÃŧts peuvent exploser.
Lâintelligence artificielle dâentreprise de niveau requiert des ressources computationnelles importantes, non seulement pour servir les rÃĐponses en temps rÃĐel, mais ÃĐgalement pour le rÃĐglage, la surveillance, la journalisation et la rÃĐformation continues. Si ces coÃŧts ne sont pas pris en compte tÃīt, le cas dâaffaires pour la solution peut sâeffondrer une fois que lâutilisation rÃĐelle commence. Ce qui semblait Être un modÃĻle prometteur dans un environnement contrÃīlÃĐ peut rapidement devenir insoutenable lorsque des milliers dâutilisateurs commencent à solliciter le systÃĻme quotidiennement.
Surmonter les obstacles de derniÃĻre ligne pour une intelligence artificielle dâentreprise rÃĐussie
Pour ÃĐviter les piÃĻges courants qui font dÃĐrailler tant de projets dâintelligence artificielle dâentreprise, les ÃĐquipes doivent aller au-delà du livre de jeu habituel. Voici comment votre ÃĐquipe dâintelligence artificielle peut construire quelque chose qui fonctionne vraiment â et qui peut Être mis à lâÃĐchelle.
Tout dâabord, faites ÃĐvaluer votre modÃĻle par un tiers. Les tests internes sont importants, mais ils sont souvent trop larges. Un regard frais, associÃĐ Ã un cadre dâÃĐvaluation personnalisÃĐ adaptÃĐ Ã votre cas dâutilisation, peut mettre en ÃĐvidence des problÃĻmes que votre ÃĐquipe pourrait manquer, en particulier lorsquâil sâagit de la façon dont les utilisateurs rÃĐels interagiront avec le systÃĻme.
Ensuite, assurez-vous de tester avec des invites du monde rÃĐel. La plupart des benchmarks testent sur des ÂŦ donnÃĐes propres Âŧ qui ne reflÃĻtent pas le monde rÃĐel, et encore moins la façon dont vos utilisateurs finals interagiront avec votre modÃĻle. Tester votre modÃĻle sur des entrÃĐes peu claires, vagues ou ÃĐtrangement formulÃĐes vous aidera à voir comment votre modÃĻle se comportera rÃĐellement aprÃĻs le dÃĐploiement et à dÃĐtecter les problÃĻmes qui pourraient autrement passer inaperçus et affecter lâadoption.
Enfin, rÃĐexaminez vos protocoles de sÃĐcuritÃĐ. Il est facile dâen faire trop avec les garde-fous, et mÊme si la sÃĐcuritÃĐ est importante, elle ne devrait pas rendre votre modÃĻle frustrant à utiliser. Si le modÃĻle se ferme sur des questions simples et inoffensives, vous ÃĐchangez lâutilisabilitÃĐ contre une fausse sensation de sÃĐcuritÃĐ.
Enfin, surveillez vos coÃŧts de calcul. Si vos objectifs dâadoption incluent des milliers dâutilisateurs et des millions de requÊtes, ces dÃĐpenses peuvent augmenter rapidement. Une solution consiste à envisager des modÃĻles plus petits. Boosted.ai lâa fait â ils sont passÃĐs à un modÃĻle de langage personnalisÃĐ plus petit et ont rÃĐduit leurs coÃŧts de calcul de 90 % tout en amÃĐliorant la vitesse et les performances. RÃĐsultats en temps rÃĐel, meilleure expÃĐrience utilisateur, et pas besoin de matÃĐriel coÃŧteux.
En abordant lâÃĐvaluation, lâutilisabilitÃĐ et la scalabilitÃĐ dÃĻs le dÃĐpart, les ÃĐquipes peuvent donner à leur projet dâintelligence artificielle une vÃĐritable chance de rÃĐussir à long terme. Il ne sâagit pas seulement de faire fonctionner les choses dans un laboratoire â mais de les faire fonctionner dans le monde.












