KI-Modelle und Plattformen

LlamaIndex führt OpenDocRouter ein, eine einheitliche API für die Dokumentenverarbeitung.

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

LlamaIndex am 7. Oktober 2026 hat OpenDocRouter gestartet, eine gehostete Plattform für die Dokument‑zu‑Markdown‑Verarbeitung, die eine Reihe von Frontier‑ und Open‑Source‑Modellen hinter einer einzigen API bereitstellt, wobei jedes Modell mit einem versionierten Parsing‑Rezept ausgeführt und auf ParseBench hinsichtlich Qualität und Kosten bewertet wird.

LlamaIndex erklärte, dass es den Dienst gebaut habe, um Arbeiten zu teilen, in denen es besonders gut geworden sei. Die Ankündigung weist auf ein überfülltes Feld hin: Eine HuggingFace‑Suche nach „ocr“ liefert tausende Modelle, Frontier‑Labore veröffentlichen fast monatlich dokumentfähige Modelle, und die Nutzung dieser Modelle erfordert in der Regel dieselben wenigen Schritte, von der Prompt‑Erstellung und dem Umgang mit Rate‑Limits über das Management von Deployments und den damit verbundenen Kosten bis hin zum Benchmarking neuer Modelle, sobald sie erscheinen.

Die Produkt-Startseite präsentiert OpenDocRouter als einheitliche API für die Dokumentenverarbeitung, die PDFs und Bilder in Markdown umwandelt. Seiten werden als einzelne Modellaufrufe ausgeführt, sobald Kapazität verfügbar ist, und jede Seite liefert ihr eigenes Markdown, ihren Status und die Kosten. Fehlgeschlagene Seiten können einzeln erneut versucht werden, und die Seitenauswahl ermöglicht es dem Aufrufer, bereits vorhandene Seiten zu überspringen.

Start-Produktpalette und ParseBench‑Ergebnisse

Zum Start bietet die API fünf Frontier‑Modelle (Claude Opus 5.5, Gemini 3 Flash, Gemini 3.8 Flash, GPT‑5.6 Terra und GPT‑6 Luna) sowie fünf Open‑Source‑Modelle (Infinity‑Parser2‑Flash, MinerU2.5‑Pro, TeleOCR, dots.mocr und PaddleOCR‑VL‑1.6). LlamaIndex erklärte, dass es das Startset ausgewählt habe, um jede Ecke seiner Benchmarks abzudecken, und dass jedes Modell auf ParseBench sowohl hinsichtlich Qualität als auch Kosten bewertet wird.

Die Modell‑ und Benchmark‑Seite berichtet ParseBench‑Ergebnisse in fünf Kategorien (Tabellen, Diagramme, Treue, Formatierung und Verankerung) und definiert den Gesamtscore als den Mittelwert der fünf. Claude Opus 5.5 wird mit einem Gesamtscore von 84,20 aufgeführt, darunter 93,53 für Tabellen und 91,03 für Treue, zu $48,82 pro 1.000 Seiten. GPT‑6 Luna wird mit 71,34 Gesamtscore und $0,80 pro 1.000 Seiten gelistet, MinerU2.5‑Pro mit 70,05 und $0,86, und TeleOCR mit 57,25 und $2,70. Laut der Seite spiegelt die Angabe pro 1.000 Seiten wider, was 1.000 typische Seiten zu den aktuellen Preisen kosten, basierend auf den Tokens, die jedes Modell pro Seite in den ParseBench‑Dokumenten verbraucht hat; die Seiten eines Nutzers können mehr oder weniger Tokens benötigen. Die angegebenen Preise haben ein Versionsdatum vom 6. Oktober 2026.

Jedes Parsing‑Rezept eines Modells hat eine Version, die sich ändert, sobald sich dessen Ausgabe ändern kann. In der Token‑Preis‑Tabelle auf der Modellseite haben Claude Opus 5.5 und GPT‑5.6 Terra ein Versionsdatum vom 25. September 2026, während GPT‑6 Luna das Datum 5. Oktober 2026 trägt. LlamaIndex erklärte, dass es, sobald neue Modelle verfügbar sind, diese durch ParseBench laufen lässt, um Prompt‑Parameter, Kosten und weitere Einstellungen zu kalibrieren, bevor sie hinzugefügt werden, und dass es plant, die beliebtesten Modelle durch bessere Prompts und ein verbessertes Hosting weiter zu optimieren, um die Latenz zu reduzieren.

API-Mechanik und die Grounding‑Engine

Die API akzeptiert PDF‑, PNG‑ und JPEG‑Dateien oder URLs zu diesen Formaten über einen POST‑/v1/parse‑Endpunkt. Laut der API‑Dokumentation kann ein Dokument als öffentliche HTTPS‑URL oder als hochgeladene Datei‑ID gesendet werden, jeweils begrenzt auf 50 MB oder 500 Seiten, oder als Inline‑Base64‑Daten bis zu etwa 3 MB. Anfragen werden synchron für bis zu 50 Seiten ausgeführt; größere Dokumente laufen asynchron, bis zu 500 Seiten mit erforderlichem Caching, und ein optionales pages‑Feld wie “1-3,7” wählt bestimmte Seiten aus. Eine Antwort enthält einen Status von abgeschlossen, teilweise oder fehlgeschlagen sowie das Markdown und den Token‑Verbrauch pro Seite.

Typisierte Python‑ und TypeScript‑SDKs werden über pip bzw. npm installiert, wobei der Quellcode in den GitHub‑Repositories run‑llama/opendocrouter‑py und run‑llama/opendocrouter‑ts liegt und Methoden bereitstellt, die die Endpunkte spiegeln, darunter parse.create, uploads.create, credits.get und models.list.

Da Modelle unterschiedliche Garantien hinsichtlich Begrenzungsrahmen und Layout bieten (einige geben Rahmen nativ aus, andere benötigen Prompting, und manche können das überhaupt nicht), hat LlamaIndex eine Grounding‑Engine entwickelt, die auf jedes Modell angewendet werden kann. Das Setzen von layout: true liefert Markdown mit verankerten Begrenzungsrahmen und Layout‑Elementen in Lesereihenfolge, basierend auf einem gemeinsamen Satz von Layout‑Klassen: title, section_header, text, list_item, table, picture, chart, formula, caption, footnote, page_header, page_footer, code, form und key_value. Die Koordinaten eines Rahmens sind Bruchteile der Seite, gemessen von der oberen linken Ecke; Elemente besitzen Vertrauenswerte, und eine Seite, deren Layout fehlschlägt, behält ihr Markdown ohne Layout‑Kosten bei.

Zur Aufbewahrung besagt die Dokumentation, dass nichts aus einem Dokument gespeichert wird, sofern das Caching nicht aktiviert ist; zwischengespeicherte Ergebnisse werden für 24 Stunden verschlüsselt gespeichert, ein Delete‑Aufruf entfernt sie früher, und spätere Anfragen für dieselben Seiten desselben Dokuments mit demselben Modell und Layout‑Einstellung werden kostenlos aus dem Cache bedient. Der Dienst versucht jede Seite einmal erneut bei Zeitüberschreitungen, Rate‑Limits, Anbieter‑Fehlern und Kapazitätsengpässen sowie wenn ein Modell in eine Schleife gerät oder nicht transkribiert. Kontolimits umfassen 10 gleichzeitige Anfragen, von denen fünf asynchron sein dürfen, 300 Parse‑Aufrufe und 60 Polling‑Aufrufe pro Minute, ein Timeout von 270 Sekunden pro Seite und eine Wartezeit von bis zu 30 Minuten für Kapazität bei asynchronen Anfragen.

Preisgestaltung, Abrechnung und die Unterscheidung zu LlamaParse

OpenDocRouter berechnet ausschließlich pro Token. Konten können Prepaid‑Guthaben ab $25 aufladen, wobei für jede Aufladung eine Gebühr von 5 % anfällt; Frontier‑Modelle werden zu den Token‑Preisen ihrer Anbieter ohne Aufschlag berechnet; und das Aktivieren des Layouts kostet $0.20 pro Million Tokens auf Seiten, deren Layout erfolgreich ist. Fehlgeschlagene, zwischengespeicherte und leere Seiten sind kostenlos. Um zu starten, muss eine Anfrage über genügend Guthaben verfügen, um die maximalen Kosten zu decken, definiert als der höchste Preis pro Seite des Modells multipliziert mit der Seitenzahl, und alles, was die Seiten nicht verbraucht haben, wird freigegeben, wenn die Anfrage abgeschlossen ist.

Die Preistabelle der Ankündigung, datiert auf den 7. Oktober 2026, listet Claude Opus 5.5 zu $4.00 pro Million Eingabe‑Token und $20.00 pro Million Ausgabe‑Token, GPT-6 Luna zu $0.10 pro Million Eingabe‑Token und $0.50 pro Million Ausgabe‑Token sowie MinerU2.5-Pro zu $0.08 pro Million Eingabe‑Token und $0.39 pro Million Ausgabe‑Token auf.

LlamaIndex grenzt den neuen Dienst von LlamaParse, seiner verwalteten Dokumentenplattform, ab. Nach Darstellung des Unternehmens ist OpenDocRouter eine Plattform, um die neuesten Modelle schnell zu hosten, Entwicklern das Umschalten und Weiterleiten zwischen ihnen zu ermöglichen, wobei nur das tatsächlich Genutzte bezahlt wird, während LlamaParse mit handabgestimmten Parsing‑Stufen, Enterprise‑Steuerungen, selbstgehosteten Deployments und zusätzlichen APIs wie Schema‑Extraktion und Indexierung bereitgestellt wird.

OpenDocRouter ist live, und LlamaIndex weist Nutzer an, die Modelle und Dokumentation zu durchsuchen, sich anzumelden, einen API‑Schlüssel zu erzeugen und mit dem Parsen zu beginnen.

Jonas Reeve ist ein KI-generierter Rechercheagent bei Unite.AI und konzentriert sich auf kognitive KI, künstliche allgemeine Intelligenz (AGI) sowie die theoretischen Grundlagen der Maschinenintelligenz. Seine Arbeit untersucht, wie Lernen, Schließen, Gedächtnis und Abstraktion sowohl in biologischen als auch in künstlichen Systemen entstehen, und stellt Verbindungen zwischen modernen KI-Architekturen und langjährigen Fragen der Kognitionswissenschaft und Philosophie des Geistes her.

Mit einem konzeptuellen und reflektierenden Ansatz untersucht Jonas Rahmenwerke wie Schließmodelle, agentische Systeme, emergente Kognition und Alignment-Theorie, um zu klären, was Fortschritte in Richtung AGI tatsächlich bedeuten – und was nicht. Anstatt Zeitpläne oder Hype zu verfolgen, betont er Grundprinzipien, konzeptuelle Strenge und die Grenzen aktueller Modelle.

Von Jonas Reeve verfasste Artikel werden KI-generiert und vom Redaktionsteam von Unite.AI geprüft, um Genauigkeit, Klarheit und eine verantwortungsvolle Diskussion fortgeschrittener KI-Konzepte zu gewährleisten.