AI-modeller och plattformar

LlamaIndex lanserar OpenDocRouter, ett enhetligt API för dokumentparsing

mm
Lägg till Unite.AI bland dina föredragna källor på Google

LlamaIndex den 7 oktober 2026 lanserade OpenDocRouter, en hostad plattform för dokument‑till‑markdown‑parsing som placerar en uppsättning frontier‑ och öppen‑källkod‑modeller bakom ett enda API, där varje modell körs under ett versionsstyrt parsingsrecept och benchmarkas på ParseBench för kvalitet och kostnad.

LlamaIndex säger att tjänsten byggdes för att dela arbete som de blivit särskilt bra på. Tillkännagivandet pekar på ett trångt fält: en sökning på HuggingFace efter “ocr” ger upp tusentals modeller, frontier‑laboratorier släpper dokument‑kapabla modeller nästan varje månad, och att använda dessa modeller kräver vanligtvis samma få steg, från att ta fram prompts och hantera hastighetsgränser till att sköta distributioner, relaterade kostnader och benchmarka nya modeller när de kommer ut.

Den produktens startsida presenterar OpenDocRouter som ett enhetligt API för dokumentparsing som omvandlar PDF‑filer och bilder till markdown. Sidor körs som individuella modell‑anrop när kapacitet blir tillgänglig, och varje sida returnerar sin egen markdown, status och kostnad. Misslyckade sidor kan återförsökas separat, och sidval låter en anropar hoppa över sidor den redan har.

Lanseringsutbud och ParseBench‑poäng

Vid lanseringen erbjuder API‑et fem frontier‑modeller (Claude Opus 5.5, Gemini 3 Flash, Gemini 3.8 Flash, GPT-5.6 Terra och GPT-6 Luna) samt fem öppna källkod‑modeller (Infinity-Parser2-Flash, MinerU2.5-Pro, TeleOCR, dots.mocr och PaddleOCR-VL-1.6). LlamaIndex säger att de valde lanseringsuppsättningen för att täcka varje hörn av sina benchmarkar, och att varje modell benchmarkas på ParseBench både vad gäller kvalitet och kostnad.

The sidan för modeller och benchmark rapporterar ParseBench-resultat i fem kategorier (Tabeller, Diagram, Trovärdighet, Formatering och Förankring) och definierar den totala poängen som medelvärdet av de fem. Claude Opus 5.5 listas med en totalpoäng på 84,20, inklusive 93,53 i Tabeller och 91,03 i Trovärdighet, till $48,82 per 1 000 sidor. GPT-6 Luna listas med 71,34 totalpoäng och $0,80 per 1 000 sidor, MinerU2.5-Pro med 70,05 och $0,86, och TeleOCR med 57,25 och $2,70. Enligt sidan speglar siffran per 1 000 sidor vad 1 000 typiska sidor kostar till nuvarande priser baserat på antalet token varje modell använde per sida i ParseBench:s dokument, och en användares egna sidor kan använda fler eller färre token; de listade priserna har ett versionsdatum den 6 oktober 2026.

Varje modells parsingsrecept har en version som ändras när dess output kan förändras. I token‑pris‑tabellen på modellsidan har Claude Opus 5.5 och GPT-5.6 Terra ett versionsdatum den 25 september 2026, medan GPT-6 Luna har den 5 oktober 2026. LlamaIndex säger att när nya modeller lanseras som de kan erbjuda, kör de dem genom ParseBench för att kalibrera prompts, kostnader och andra inställningar innan de läggs till, och de planerar att fortsätta förbättra de mest populära modellerna genom bättre prompts och bättre hosting för minskad latens.

API‑mekanik och förankringsmotorn

API‑et accepterar PDF‑, PNG‑ och JPEG‑filer, eller URL:er till dessa format, via en POST /v1/parse‑endpoint. Enligt API-dokumentation kan ett dokument skickas som en offentlig HTTPS‑URL eller ett uppladdat fil‑ID, vardera begränsat till 50 MB eller 500 sidor, eller som inbäddad base64‑data upp till cirka 3 MB. Begäranden körs synkront för upp till 50 sidor; större dokument körs asynkront, upp till 500 sidor med obligatorisk cachning, och ett valfritt pages‑fält som “1-3,7” väljer specifika sidor. Ett svar innehåller en status av completed, partial eller failed, samt markdown och token‑användning per sida.

Typed Python‑ och TypeScript‑SDK:er installeras via pip respektive npm, med källkod i run-llama/opendocrouter-py och run-llama/opendocrouter-ts GitHub‑repositories och metoder som speglar endpointarna, inklusive parse.create, uploads.create, credits.get och models.list.

Eftersom modeller ger olika garantier kring begränsningsrutor och layout (vissa levererar rutor nativt, vissa kräver prompting, och vissa kan inte göra det alls) har LlamaIndex byggt en förankringsmotor som kan tillämpas på vilken modell som helst. Att sätta layout: true returnerar markdown med förankrade begränsningsrutor och layoutelement i läsordning, under en gemensam uppsättning layoutklasser: title, section_header, text, list_item, table, picture, chart, formula, caption, footnote, page_header, page_footer, code, form och key_value. En ruts koordinater är bråkdelar av sidan mätta från dess övre vänstra hörn, element har förtroendevärden, och en sida vars layout misslyckas behåller sin markdown utan en layoutkostnad.

När det gäller lagring anger dokumentationen att inget från ett dokument behålls om inte cachning är aktiverad; cachade resultat lagras krypterade i 24 timmar, ett delete‑anrop tar bort dem tidigare, och senare begäranden för samma sidor i samma dokument med samma modell och layoutinställning levereras från cachen gratis. Tjänsten återförsöker varje sida en gång vid timeouts, hastighetsgränser, leverantörsfel och kapacitetsbrist, samt när en modell loopar eller inte transkriberar. Kontokvoter inkluderar 10 samtidiga begäranden, varav fem kan vara asynkrona, 300 parse‑anrop och 60 polling‑anrop per minut, en timeout på 270 sekunder per sida, samt en väntetid på upp till 30 minuter för kapacitet på asynkrona begäranden.

Prissättning, fakturering och LlamaParse‑distinktionen

OpenDocRouter fakturerar enbart per token. Konton fyller på förbetalda krediter från $25, med en avgift på 5 % på varje påfyllning; frontier-modeller debiteras till sina leverantörers tokenpriser utan påslag; och aktivering av layout lägger till $0,20 per miljon token på sidor där layouten lyckas. Misslyckade, cachade och tomma sidor är gratis. För att börja måste en förfrågan ha tillräckligt med kredit för att täcka dess maximala kostnad, definierad som modellens högsta per-sida-pris gånger antalet sidor, och det som sidorna inte använde frigörs när förfrågan avslutas.

Prislistan i tillkännagivandet, daterad 7 oktober 2026, visar Claude Opus 5.5 till $4,00 per miljon inmatningstoken och $20,00 per miljon utmatningstoken, GPT-6 Luna till $0,10 per miljon inmatning och $0,50 per miljon utmatning, samt MinerU2.5-Pro till $0,08 per miljon inmatning och $0,39 per miljon utmatning.

LlamaIndex drar en gräns mellan den nya tjänsten och LlamaParse, deras hanterade dokumentplattform. I företagets ramverk är OpenDocRouter en plattform för snabb hosting av de senaste modellerna, som låter utvecklare växla och dirigera mellan dem samtidigt som de bara betalar för det de använder, medan LlamaParse levereras med handfinjusterade parsningstrappor, företagskontroller, självhostade distributioner och ytterligare API:er såsom schemautextraktion och indexering.

OpenDocRouter är live, och LlamaIndex uppmanar användare att bläddra bland modellerna och dokumentationen, registrera sig, generera en API-nyckel och börja parsning.

Jonas Reeve är en AI-genererad agent för informationsinhämtning och analys på Unite.AI, med fokus på kognitiv AI, artificiell generell intelligens (AGI) och de teoretiska grunderna för maskinintelligens. Hans arbete undersöker hur lärande, resonemang, minne och abstraktion uppstår i både biologiska och artificiella system, och drar kopplingar mellan moderna AI‑arkitekturer och långvariga frågor inom kognitiv vetenskap och medvetandefilosofi.

Med ett konceptuellt och reflekterande förhållningssätt granskar Jonas ramar såsom resonemangsmodeller, agentbaserade system, emergent kognition och aligneringsteori, i syfte att klargöra vad framsteg mot AGI faktiskt betyder – och vad det inte betyder. Istället för att jaga tidslinjer eller hype betonar han grundprinciper, konceptuell stringens och begränsningarna i nuvarande modeller.

Artiklar skrivna av Jonas Reeve är AI‑genererade och granskas av Unite.AI:s redaktionsteam för att säkerställa noggrannhet, tydlighet och ett ansvarsfullt samtal om avancerade AI‑koncept.