Leaders d’opinion

L’évolution de la formation de modèles d’IA : au-delà de la taille, vers l’efficacité

mm
Ajouter Unite.AI à vos sources préférées sur Google

Dans le paysage en constante évolution de l’intelligence artificielle, l’approche traditionnelle pour améliorer les modèles de langage en augmentant simplement leur taille est en train de subir une transformation cruciale. Ce changement met en évidence une approche plus stratégique et centrée sur les données, comme le montrent les développements récents dans des modèles tels que Llama3.

Les données sont tout ce dont vous avez besoin

Historiquement, la croyance dominante pour améliorer les capacités de l’IA a été que plus c’est grand, mieux c’est.

Dans le passé, nous avons été témoins d’une augmentation spectaculaire des capacités de l’apprentissage profond simplement en ajoutant plus de couches aux réseaux de neurones. Des algorithmes et des applications comme la reconnaissance d’images, qui n’étaient possibles que théoriquement avant l’avènement de l’apprentissage profond, sont rapidement devenues largement acceptées. Le développement des cartes graphiques a encore amplifié cette tendance, permettant à des modèles plus grands de fonctionner avec une efficacité croissante. Cette tendance s’est poursuivie avec l’actuel engouement pour les grands modèles de langage.

Périodiquement, nous sommes confrontés à des annonces de grandes entreprises d’IA qui publient des modèles avec des dizaines ou même des centaines de milliards de paramètres. Il est facile de comprendre la logique : plus un modèle possède de paramètres, plus il devient performant. Cependant, cette méthode de mise à l’échelle par la force brute a atteint un point de rendement décroissant, en particulier lorsqu’on considère la rentabilité de tels modèles dans les applications pratiques. L’annonce récente de Meta concernant l’approche Llama3, qui utilise 8 milliards de paramètres mais est enrichie de 6 à 7 fois la quantité de données de formation de haute qualité, égale – et dans certains scénarios, dépasse – l’efficacité des modèles précédents comme GPT3.5, qui disposent de plus de 100 milliards de paramètres. Cela marque un changement significatif dans la loi de mise à l’échelle pour les modèles de langage, où la qualité et la quantité des données commencent à prendre le pas sur la taille pure.

Coût vs. Performance : Un équilibre délicat

Alors que les modèles d’IA passent du développement à l’utilisation pratique, leur impact économique, en particulier les coûts opérationnels élevés des modèles à grande échelle, devient de plus en plus important. Ces coûts dépassent souvent les dépenses initiales de formation, soulignant la nécessité d’une approche de développement durable qui privilégie l’utilisation efficace des données par rapport à l’expansion de la taille du modèle. Des stratégies comme l’augmentation de données et l’apprentissage par transfert peuvent améliorer les ensembles de données et réduire le besoin d’une rééducation extensive. La rationalisation des modèles par sélection de fonctionnalités et réduction de dimensionnalité améliore l’efficacité computationnelle et réduit les coûts. Des techniques telles que le dropout et l’arrêt précoce améliorent la généralisation, permettant aux modèles de fonctionner efficacement avec moins de données. Des stratégies de déploiement alternatives comme le calcul de bord réduisent la dépendance à l’égard de l’infrastructure cloud coûteuse, tandis que le calcul sans serveur offre une utilisation des ressources scalable et rentable. En se concentrant sur le développement centré sur les données et en explorant des méthodes de déploiement économiques, les organisations peuvent établir un écosystème d’IA plus durable qui équilibre la performance et la rentabilité.

Les rendements décroissants des modèles plus grands

Le paysage du développement d’IA est en train de subir un changement de paradigme, avec une accentuation croissante sur l’utilisation efficace des données et l’optimisation des modèles. Les entreprises d’IA centralisées ont traditionnellement reposé sur la création de modèles de plus en plus grands pour atteindre des résultats de pointe.

L’IA décentralisée, en revanche, présente un ensemble différent de défis et d’opportunités. Les réseaux de blockchain décentralisés, qui forment la base de l’IA décentralisée, ont une conception fondamentalement différente par rapport aux entreprises d’IA centralisées. Cela rend difficile pour les entreprises d’IA décentralisées de concurrencer les entités centralisées en termes de mise à l’échelle de modèles plus grands tout en maintenant l’efficacité dans les opérations décentralisées.

C’est ici que les communautés décentralisées peuvent maximiser leur potentiel et se tailler une niche dans le paysage de l’IA. En exploitant l’intelligence collective et les ressources, les communautés décentralisées peuvent développer et déployer des modèles d’IA sophistiqués qui sont à la fois efficaces et évolutifs. Cela leur permettra de concurrencer efficacement les entreprises d’IA centralisées et de conduire l’avenir du développement d’IA.

Regarder vers l’avenir : La voie du développement d’IA durable

La trajectoire pour le développement d’IA à venir devrait se concentrer sur la création de modèles qui ne sont pas seulement innovants mais également intégrés et économiques. L’accent devrait être mis sur les systèmes qui peuvent atteindre des niveaux élevés de précision et d’utilité avec des coûts et une utilisation des ressources gérables. Une telle stratégie non seulement assurera l’évolutivité des technologies d’IA mais également leur accessibilité et leur durabilité à long terme.

Alors que le domaine de l’intelligence artificielle mûrit, les stratégies pour développer l’IA doivent évoluer en conséquence. Le passage de la valorisation de la taille à la priorisation de l’efficacité et de la rentabilité dans la formation de modèles n’est pas simplement un choix technique mais un impératif stratégique qui définira la prochaine génération d’applications d’IA. Cette approche devrait probablement catalyser une nouvelle ère d’innovation, où le développement d’IA est conduit par des pratiques intelligentes et durables qui promettent une adoption plus large et un impact plus grand.​​​​​​​​​​​​​​​​

Jiahao Sun, le fondateur et PDG de FLock.io, est un ancien élève d'Oxford et est un expert en intelligence artificielle et en blockchain. Avec des rôles précédents en tant que directeur de l'IA pour la Banque royale du Canada et chercheur en IA à l'Imperial College de Londres, il a fondé FLock.io pour se concentrer sur les solutions d'IA centrées sur la confidentialité. Grâce à son leadership, FLock.io est à la pointe des progrès en matière de formation et de déploiement de modèles d'IA sécurisés et collaboratifs, montrant son engagement à utiliser la technologie pour le progrès social.