Leaders d’opinion
Les modèles ouverts continuent de s’améliorer. L’économie devient plus compliquée.

Les modèles d’IA sont manifestement meilleurs qu’il y a 18 mois. Mais lorsque j’ai commencé à creuser davantage, les explications habituelles de ces progrès ne tenaient pas la route.
Ils ne se sont pas améliorés simplement parce qu’ils sont devenus plus grands. « L’open source gagne » n’est qu’à moitié vrai. Et le conseil de se fier aux scores des benchmarks s’est avéré beaucoup moins utile que je ne le pensais. Cela m’a mis du temps à accepter.
Alors, j’ai rassemblé 18 mois de données couvrant 46 modèles provenant de huit laboratoires. Je voulais comprendre si l’intelligence devient une marchandise, si les modèles ouverts rattrapent la pointe, et ce que les entreprises doivent mesurer lorsqu’elles choisissent les systèmes sur lesquels elles vont s’appuyer.
La conclusion principale était simple : un score de benchmark n’est pas réellement une propriété d’un modèle. Il reflète le modèle, le logiciel et le contexte qui l’entourent, ainsi que le temps et la puissance de calcul qui lui ont été alloués. Publier un seul chiffre, c’est masquer les deux autres.
Les implications, toutefois, sont bien plus vastes. Les entreprises comparent des modèles individuels alors qu’elles devraient évaluer le système complet qui doit exécuter le travail.
Les benchmarks masquent le système
Lorsque j’ai cessé de regarder les scores composites et que j’ai comparé les modèles test par test, l’écart entre les meilleurs modèles à poids ouvert et les modèles propriétaires n’était pas du tout un chiffre unique.
Sur SWE-bench Verified, un test plus ancien qui a figuré dans d’innombrables annonces de modèles, l’écart était de 0,2 point. Sur SWE-bench Pro, un test plus récent conçu autour d’un travail logiciel réaliste et multilingue avec une configuration standardisée, il était de 18,2 points.
L’écart apparent entre les modèles dépend du benchmark
| Référence | Écart | Statut |
|---|---|---|
| SWE-bench Verified | 0.2 pts | Saturé, contamination signalée |
| GPQA Diamond | 2.0 pts | Saturé, plafond autour de 92–95 % |
| Terminal-Bench 2.1 | 4.9 pts | En direct, agentique |
| Humanity’s Last Exam | 9.8 pts | En direct, raisonnement de pointe |
| SWE-bench Pro | 18.2 pts | En direct, échafaudage standardisé |
Source : analyse de Jaspreet Singh des principaux modèles à poids ouvert et propriétaires, juillet 2026.
Le même modèle peut également obtenir des scores différents selon qui réalise le test. Kimi K3 a obtenu 80,9 % sur Terminal-Bench 2.1 lors d’une évaluation indépendante et 88,3 % lorsque son fabricant a rapporté le résultat. Cette variation de 7,4 points est supérieure à l’écart open‑vers‑frontière sur trois des cinq benchmarks que j’ai analysés.
Un modèle reçoit des instructions via le logiciel environnant, s’appuie sur le contexte qui lui est fourni, utilise les outils auxquels il a accès et fonctionne dans une enveloppe de raisonnement définie par le développeur. Modifier ces conditions modifie le résultat en conséquence.
Les benchmarks publics sont utiles pour comprendre la direction des progrès. Ils constituent une base peu fiable pour décider de ce qui fonctionnera au sein de votre entreprise.
La fiabilité agentique modifie les calculs
Cela devient plus important à mesure que l’IA passe de la réponse à des questions à l’exécution d’une séquence d’actions.
Prenez un flux de travail de 20 étapes, où l’IA réussit chaque étape avec 95 % de précision. Cela semble fiable. Sur l’ensemble de la séquence, cependant, le flux ne réussit que 36 % du temps.
Un modèle meilleur peut augmenter les chances à chaque étape, surtout pour les tâches agentiques difficiles. C’est l’ingénierie environnante qui détermine si une mauvaise étape gâche le travail. Sauvegarder la progression, vérifier les sorties, réessayer en toute sécurité et récupérer après un échec séparent souvent une démonstration convaincante d’un produit fiable.
Le choix du modèle reste important. Mais le modèle avec le meilleur score ne produit pas automatiquement le système le plus fiable.
Choisir les modèles en fonction du travail
Les données soutiennent une conclusion plus précise que celle généralement avancée par les deux camps du débat open‑vers‑propriétaire.
Les modèles à poids ouvert sont compétitifs pour des travaux bien définis à court terme où le résultat peut être mesuré directement. La classification, l’extraction, le résumé et la génération structurée entrent de plus en plus dans cette catégorie.
Les modèles de pointe justifient encore leur prix élevé sur des tâches agentiques plus longues, le respect des instructions sous pression et les travaux où l’échec est coûteux à détecter a posteriori. C’est là que les nouveaux benchmarks montrent un écart proche de 18 points plutôt que zéro, et où la couche de sécurité fournie par le fournisseur du modèle a de la valeur.
Les entreprises devraient choisir les modèles en fonction des tâches, mais elles ne doivent pas supposer que le changement est gratuit. Le contexte, le raisonnement et les caches d’invite ne se transfèrent pas proprement d’un fournisseur à l’autre. Un modèle moins cher peut devenir plus coûteux si le changement de système oblige le travail à redémarrer ou ajoute des couches d’ingénierie et de gouvernance.
Le choix du modèle devient moins permanent. Le changement reste une décision architecturale.
À mesure que l’intelligence devient moins chère, le jugement reste coûteux
Une capacité générale compétente devient extraordinairement bon marché. Au sommet de la courbe, cependant, chaque point de performance supplémentaire coûte plus que le précédent. Les neuf derniers points de capacité coûtent environ dix fois plus que tout ce qui se situe en dessous.
La plupart des entreprises n’ont pas besoin du modèle le plus puissant pour chaque requête. Elles doivent toutefois savoir quel travail le mérite.
La synthèse, l’extraction, la classification, la rédaction et la traduction tendent vers une capacité utilitaire. Ce qui reste rare, c’est le jugement : savoir laquelle des cinq réponses plausibles est correcte, remarquer que la question était erronée et décider quand s’arrêter et solliciter un humain.
Le jugement provient du contexte propriétaire, des règles métier, des flux de travail, des connaissances historiques et de l’ingénierie qui vérifie le travail et encadre les échecs.
Construisez l’évaluation que personne d’autre ne peut exécuter
Pour une entreprise, le benchmark le plus précieux est construit à partir de son propre travail.
Créez un ensemble d’évaluation privé contenant de 50 à 200 tâches réelles de votre activité. Maintenez le système environnant fixe, exécutez les tests de façon répétée et notez si la tâche a été correctement accomplie plutôt que la qualité de la réponse.
Appliquez la même rigueur aux coûts. Le coût par jeton peut être trompeur lorsqu’un modèle raisonne plus longtemps, nécessite davantage de tentatives ou génère plus de travail pour un relecteur humain. Mesurez plutôt le coût par résultat accepté.
Commencez avec un petit nombre de modèles. Orientez le travail dès le début d’une tâche plutôt que de changer de fournisseur en cours de route. Prenez en compte la charge de sécurité, de gouvernance et opérationnelle de chaque fournisseur supplémentaire en plus de son prix annoncé.
Le marché continuera à produire de nouveaux gagnants de benchmarks, et les entreprises seront toujours tentées de reconstruire leur stratégie IA autour de chacun d’eux. Une meilleure approche consiste à choisir les modèles en fonction du travail, puis à évaluer l’ensemble du système dans les conditions où il doit fonctionner.
Le benchmark qui doit guider votre architecture est celui que seule votre entreprise peut exécuter.












