Modèles et plateformes d’IA
LlamaIndex lance OpenDocRouter, une API unifiée pour l’analyse de documents

LlamaIndex, le 7 octobre 2026, a lancé OpenDocRouter, une plateforme hébergée d’analyse de documents en markdown qui place un ensemble de modèles de pointe et open source derrière une API unique, chaque modèle étant exécuté avec une recette d’analyse versionnée et évalué sur ParseBench en termes de qualité et de coût.
LlamaIndex a déclaré avoir créé le service pour partager un travail dans lequel il était particulièrement performant. L’annonce souligne un domaine très concurrentiel : une recherche sur HuggingFace avec le terme « ocr » fait apparaître des milliers de modèles, les laboratoires de pointe publient des modèles capables de traiter des documents presque chaque mois, et l’utilisation de ces modèles nécessite généralement les mêmes quelques étapes, de la définition des invites et la gestion des limites de débit à la gestion des déploiements et des coûts associés, ainsi que l’évaluation des nouveaux modèles dès leur sortie.
La page d’accueil du produit présente OpenDocRouter comme une API unifiée d’analyse de documents qui transforme les PDF et les images en markdown. Les pages sont traitées comme des appels de modèle individuels dès que la capacité est disponible, et chaque page renvoie son propre markdown, son statut et son coût. Les pages échouées peuvent être retentées séparément, et la sélection de pages permet à l’appelant d’ignorer les pages déjà possédées.
Gamme de lancement et scores ParseBench
Lors du lancement, l’API propose cinq modèles de pointe (Claude Opus 5.5, Gemini 3 Flash, Gemini 3.8 Flash, GPT-5.6 Terra et GPT-6 Luna) ainsi que cinq modèles open source (Infinity-Parser2-Flash, MinerU2.5-Pro, TeleOCR, dots.mocr et PaddleOCR-VL-1.6). LlamaIndex a indiqué avoir choisi cet ensemble de lancement pour couvrir tous les aspects de ses benchmarks, et que chaque modèle est évalué sur ParseBench tant en termes de qualité que de coût.
La page des modèles et des benchmarks rapporte les résultats de ParseBench dans cinq catégories (Tables, Graphiques, Fidélité, Formatage et Ancrage) et définit le score Global comme la moyenne des cinq. Claude Opus 5.5 est répertorié avec un score Global de 84,20, incluant 93,53 pour les Tables et 91,03 pour la Fidélité, à 48,82 $ par 1 000 pages. GPT-6 Luna figure à 71,34 Global et 0,80 $ par 1 000 pages, MinerU2.5-Pro à 70,05 et 0,86 $, et TeleOCR à 57,25 et 2,70 $. Selon la page, le chiffre par 1 000 pages reflète le coût de 1 000 pages typiques aux prix actuels, basé sur le nombre de jetons que chaque modèle utilise par page dans les documents de ParseBench, et les pages d’un utilisateur peuvent consommer plus ou moins de jetons ; les prix indiqués portent la date de version du 6 octobre 2026.
Chaque recette d’analyse d’un modèle possède une version qui change chaque fois que sa sortie peut varier. Dans le tableau des prix par jeton de la page des modèles, Claude Opus 5.5 et GPT-5.6 Terra affichent une date de version du 25 septembre 2026, tandis que GPT-6 Luna porte la date du 5 octobre 2026. LlamaIndex a déclaré que lorsqu’il reçoit de nouveaux modèles qu’il peut proposer, il les fait passer par ParseBench afin d’ajuster les invites, les coûts et d’autres paramètres avant de les ajouter, et il prévoit de continuer à améliorer les modèles les plus populaires grâce à de meilleures invites et à un hébergement optimisé pour réduire la latence.
Fonctionnement de l’API et moteur d’ancrage
L’API accepte les fichiers PDF, PNG et JPEG, ou les URL vers ces formats, via le point d’accès POST /v1/parse. Selon la documentation de l’API, un document peut être envoyé sous forme d’URL HTTPS publique ou d’ID de fichier téléchargé, chaque élément étant limité à 50 Mo ou 500 pages, ou sous forme de données base64 en ligne jusqu’à environ 3 Mo. Les requêtes s’exécutent de façon synchrone pour jusqu’à 50 pages ; les documents plus volumineux s’exécutent de façon asynchrone, jusqu’à 500 pages avec mise en cache obligatoire, et un champ pages optionnel tel que “1-3,7” permet de sélectionner des pages spécifiques. Une réponse comporte un statut de terminé, partiel ou échoué, avec le markdown et l’utilisation de jetons par page.
Les SDK typés Python et TypeScript s’installent via pip et npm, le code source se trouvant dans les dépôts GitHub run-llama/opendocrouter-py et run-llama/opendocrouter-ts, et les méthodes reproduisent les points d’accès, notamment parse.create, uploads.create, credits.get et models.list.
Comme les modèles offrent des garanties différentes concernant les boîtes englobantes et la mise en page (certains produisent des boîtes nativement, d’autres nécessitent des invites, et certains ne le font pas du tout), LlamaIndex a créé un moteur d’ancrage qu’il peut appliquer à n’importe quel modèle. Le paramètre layout: true renvoie du markdown avec des boîtes englobantes ancrées et des éléments de mise en page dans l’ordre de lecture, sous un ensemble partagé de classes de mise en page : title, section_header, text, list_item, table, picture, chart, formula, caption, footnote, page_header, page_footer, code, form et key_value. Les coordonnées d’une boîte sont des fractions de la page mesurées depuis le coin supérieur gauche, les éléments portent des valeurs de confiance, et une page dont la mise en page échoue conserve son markdown sans frais de mise en page.
Concernant la rétention, la documentation indique qu’aucune donnée d’un document n’est conservée à moins que la mise en cache ne soit activée ; les résultats mis en cache sont stockés de façon chiffrée pendant 24 heures, un appel de suppression les supprime plus tôt, et les requêtes ultérieures pour les mêmes pages du même document avec le même modèle et le même paramètre de mise en page sont servies gratuitement depuis le cache. Le service retente chaque page une fois en cas de dépassement de délai, de limites de débit, d’erreurs du fournisseur ou de capacité, ainsi que lorsqu’un modèle boucle ou ne transcrit pas. Les limites de compte comprennent 10 requêtes simultanées, dont cinq peuvent être asynchrones, 300 appels de parsing et 60 appels de sondage par minute, un délai d’attente de 270 secondes par page, et une attente pouvant aller jusqu’à 30 minutes pour la capacité sur les requêtes asynchrones.
Tarification, facturation et distinction LlamaParse
OpenDocRouter facture uniquement par token. Les comptes rechargent des crédits prépayés à partir de 25 $, avec des frais de 5 % sur chaque recharge ; les modèles de pointe sont facturés aux prix des tokens de leurs fournisseurs sans majoration ; et l’activation de la mise en page ajoute 0,20 $ par million de tokens sur les pages dont la mise en page réussit. Les pages échouées, en cache et vides sont gratuites. Pour commencer, une requête doit disposer d’un crédit suffisant pour couvrir sa charge maximale, définie comme le tarif le plus élevé par page du modèle multiplié par le nombre de pages, et tout ce que les pages n’ont pas utilisé est libéré à la fin de la requête.
Le tableau tarifaire de l’annonce, daté du 7 octobre 2026, indique Claude Opus 5.5 à 4,00 $ par million de tokens d’entrée et 20,00 $ par million de tokens de sortie, GPT-6 Luna à 0,10 $ par million d’entrée et 0,50 $ par million de sortie, et MinerU2.5-Pro à 0,08 $ par million d’entrée et 0,39 $ par million de sortie.
LlamaIndex trace une distinction entre le nouveau service et LlamaParse, sa plateforme de documents gérée. Selon le positionnement de l’entreprise, OpenDocRouter est une plateforme permettant d’héberger rapidement les derniers modèles, laissant les développeurs basculer et acheminer entre eux tout en ne payant que ce qu’ils utilisent, tandis que LlamaParse propose des niveaux de parsing ajustés manuellement, des contrôles d’entreprise, des déploiements auto‑hébergés et des API supplémentaires telles que l’extraction de schémas et l’indexation.
OpenDocRouter est en ligne, et LlamaIndex invite les utilisateurs à parcourir les modèles et la documentation, à s’inscrire, à générer une clé API et à commencer l’analyse.












