Leaders d’opinion
Des modèles de langage personnalisés pour chaque entreprise ? DeepSeek nous montre la voie

Il était une fois, l’appel à l’action technologique était « téléphones mobiles pour tous » – et en effet, les communications mobiles ont révolutionné les entreprises (et le monde). Aujourd’hui, l’équivalent de cet appel est de donner à tous l’accès aux applications d’intelligence artificielle. Mais le véritable pouvoir de l’intelligence artificielle réside dans son utilisation pour répondre aux besoins spécifiques des entreprises et des organisations. Le chemin tracé par la startup chinoise DeepSeek démontre comment l’intelligence artificielle peut effectivement être utilisée par tous, en particulier ceux qui ont des budgets limités, pour répondre à leurs besoins spécifiques. En effet, l’avènement de l’intelligence artificielle à moindre coût promet de changer le modèle profondément ancré selon lequel les solutions d’intelligence artificielle sont souvent hors de portée de nombreuses petites entreprises et organisations en raison des exigences de coût.
Les modèles de langage de grande échelle sont – ou étaient – une entreprise coûteuse, nécessitant l’accès à d’énormes quantités de données, à un grand nombre d’ordinateurs puissants pour traiter les données, et à du temps et des ressources investis dans la formation du modèle. Mais ces règles sont en train de changer. En fonctionnant avec un budget limité, DeepSeek a développé son propre modèle de langage de grande échelle, ainsi qu’une application de type ChatGPT pour les requêtes – avec un investissement nettement inférieur à celui des systèmes similaires construits par les entreprises américaines et européennes. L’approche de DeepSeek ouvre une fenêtre sur le développement de modèles de langage de grande échelle pour les petites organisations qui n’ont pas des milliards à dépenser. En fait, le jour où la plupart des petites organisations pourront développer leurs propres modèles de langage de grande échelle pour répondre à leurs besoins spécifiques n’est peut-être pas si loin, ce qui offrirait généralement une solution plus efficace que les modèles de langage de grande échelle généraux comme ChatGPT.
Alors que le débat persiste sur le véritable coût de DeepSeek, ce n’est pas simplement le coût qui le distingue, ainsi que les modèles similaires : c’est le fait qu’il a reposé sur des puces moins avancées et une approche plus ciblée de la formation. En tant qu’entreprise chinoise soumise aux restrictions à l’exportation américaines, DeepSeek n’a pas pu accéder aux puces Nvidia avancées généralement utilisées pour les calculs lourds nécessaires au développement de modèles de langage de grande échelle, et a donc dû utiliser des puces Nvidia H-800 moins puissantes (NVDA ), qui ne peuvent traiter les données aussi rapidement ou efficacement.
Pour compenser ce manque de puissance, DeepSeek a adopté une approche différente, plus ciblée et directe, pour le développement de son modèle de langage de grande échelle. Au lieu de jeter des montagnes de données à un modèle et de compter sur la force de calcul pour étiqueter et appliquer les données, DeepSeek a réduit la formation, en utilisant une petite quantité de données de haute qualité “cold-start” et en appliquant l’apprentissage par renforcement itératif (IRL, avec l’algorithme appliquant les données à différents scénarios et en apprenant à partir de ceux-ci). Cette approche ciblée permet au modèle d’apprendre plus rapidement, avec moins d’erreurs et moins de puissance de calcul gaspillée.
De même que les parents peuvent guider les mouvements spécifiques d’un bébé, l’aidant à rouler pour la première fois – plutôt que de laisser le bébé découvrir seul ou d’enseigner au bébé une variété de mouvements qui pourraient théoriquement l’aider à rouler – les scientifiques des données formant ces modèles d’intelligence artificielle plus ciblés se concentrent sur ce qui est le plus nécessaire pour certaines tâches et résultats. De tels modèles n’ont probablement pas une application fiable aussi large que les modèles de langage de grande échelle plus importants comme ChatGPT, mais ils peuvent être fiables pour des applications spécifiques et les exécuter avec précision et efficacité. Même les critiques de DeepSeek admettent que son approche rationalisée de développement a considérablement augmenté l’efficacité, lui permettant de faire plus avec beaucoup moins.
Cette approche consiste à donner à l’intelligence artificielle les meilleures entrées pour qu’elle puisse atteindre ses objectifs de la manière la plus intelligente et la plus efficace possible, et peut être précieuse pour toute organisation qui souhaite développer un modèle de langage de grande échelle pour répondre à ses besoins et tâches spécifiques. Une telle approche est de plus en plus précieuse pour les petites entreprises et les organisations. La première étape consiste à commencer avec les bonnes données. Par exemple, une entreprise qui souhaite utiliser l’intelligence artificielle pour aider ses équipes de ventes et de marketing devrait former son modèle sur un ensemble de données soigneusement sélectionné qui se concentre sur les conversations de ventes, les stratégies et les métriques. Cela empêche le modèle de gaspiller du temps et de la puissance de calcul sur des informations non pertinentes. De plus, la formation doit être structurée par étapes, en veillant à ce que le modèle maîtrise chaque tâche ou concept avant de passer au suivant.
Ceci a également des parallèles avec l’éducation d’un bébé, comme je l’ai moi-même appris depuis que je suis devenue mère il y a quelques mois. Dans les deux scénarios, une approche guidée et progressive évite de gaspiller des ressources et réduit les frictions. Enfin, une telle approche, avec les bébés humains et les modèles d’intelligence artificielle, conduit à une amélioration itérative. À mesure que le bébé grandit, ou que le modèle apprend plus, ses capacités s’améliorent. Cela signifie que les modèles peuvent être affinés et améliorés pour mieux gérer les situations du monde réel.
Cette approche maintient les coûts bas, empêchant les projets d’intelligence artificielle de devenir une drain de ressources, les rendant ainsi plus accessibles aux petites équipes et organisations. Elle conduit également à de meilleures performances des modèles d’intelligence artificielle plus rapidement ; et, parce que les modèles ne sont pas surchargés de données superflues, ils peuvent également être ajustés pour s’adapter à de nouvelles informations et à des besoins commerciaux changeants – clés dans les marchés compétitifs.
L’arrivée de DeepSeek et du monde de l’intelligence artificielle à moindre coût et plus efficace – bien qu’elle ait initialement semé la panique dans le monde de l’intelligence artificielle et les marchés boursiers – est dans l’ensemble un développement positif pour le secteur de l’intelligence artificielle. L’efficacité accrue et les coûts réduits de l’intelligence artificielle, au moins pour certaines applications ciblées, entraîneront finalement une utilisation plus importante de l’intelligence artificielle en général, ce qui stimule la croissance pour tous, des développeurs aux fabricants de puces jusqu’aux utilisateurs finals. En fait, DeepSeek illustre le paradoxe de Jevons – où une efficacité accrue entraînera probablement une utilisation plus importante d’une ressource, et non une diminution. Alors que cette tendance semble se poursuivre, les petites entreprises qui se concentrent sur l’utilisation de l’intelligence artificielle pour répondre à leurs besoins spécifiques seront également mieux à même de connaître la croissance et le succès.












