Modele și platforme AI

LlamaIndex lansează OpenDocRouter, un API unificat pentru parsarea documentelor

mm
Adaugă Unite.AI la sursele tale preferate pe Google

LlamaIndex pe 7 octombrie 2026 lansat OpenDocRouter, o platformă găzduită pentru parsarea documentelor în markdown care plasează un set de modele de frontieră și open‑source în spatele unui singur API, fiecare rulat sub o rețetă de parsare versionată și evaluat pe ParseBench pentru calitate și cost.

LlamaIndex a declarat că a creat serviciul pentru a împărtăși munca la care a devenit deosebit de bun. Anunțul indică un domeniu aglomerat: o căutare pe HuggingFace pentru „ocr” afișează mii de modele, laboratoarele de frontieră lansează modele capabile de documente aproape în fiecare lună, iar utilizarea acestor modele necesită de obicei aceiași pași, de la definirea prompturilor și gestionarea limitelor de rată până la administrarea implementărilor și costurile aferente și evaluarea noilor modele pe măsură ce apar.

pagina de produs prezintă OpenDocRouter ca un API unificat pentru parsarea documentelor care transformă PDF‑urile și imaginile în markdown. Paginile sunt executate ca apeluri individuale ale modelului pe măsură ce capacitatea devine disponibilă, iar fiecare pagină returnează propriul markdown, stare și cost. Paginile eșuate pot fi retrimise individual, iar selecția de pagini permite unui apelant să sară peste paginile pe care le are deja.

Setul de lansare și scorurile ParseBench

În momentul lansării, API‑ul oferă cinci modele de frontieră (Claude Opus 5.5, Gemini 3 Flash, Gemini 3.8 Flash, GPT-5.6 Terra și GPT‑6 Luna) și cinci modele open‑source (Infinity-Parser2-Flash, MinerU2.5‑Pro, TeleOCR, dots.mocr și PaddleOCR‑VL‑1.6). LlamaIndex a declarat că a selectat setul de lansare pentru a acoperi fiecare aspect al benchmark‑urilor sale și că fiecare model este evaluat pe ParseBench în termeni de calitate și cost.

pagina modelelor și benchmark‑urilor raportează rezultatele ParseBench în cinci categorii (Tabele, Grafice, Fidelitate, Formatare și Fundamentare) și definește scorul Global ca media celor cinci. Claude Opus 5.5 este listat cu un scor Global de 84.20, inclusiv 93.53 la Tabele și 91.03 la Fidelitate, la $48.82 per 1,000 pages. GPT-6 Luna este listat cu 71.34 Global și $0.80 per 1,000 pages, MinerU2.5-Pro cu 70.05 și $0.86, iar TeleOCR cu 57.25 și $2.70. Conform paginii, cifra per 1,000 de pagini reflectă costul a 1,000 de pagini tipice la prețurile actuale, bazat pe token‑urile pe care fiecare model le‑a folosit pe pagină în documentele ParseBench, iar paginile proprii ale utilizatorului pot folosi mai multe sau mai puține tokenuri; prețurile listate au data versiunii 6 octombrie 2026.

Fiecare rețetă de parsare a unui model are o versiune care se modifică ori de câte ori ieșirea sa se poate schimba. În tabelul token‑preț de pe pagina modelelor, Claude Opus 5.5 și GPT‑5.6 Terra au data versiunii 25 septembrie 2026, în timp ce GPT‑6 Luna are data 5 octombrie 2026. LlamaIndex a declarat că, atunci când noi modele sunt lansate și pot fi oferite, le rulează prin ParseBench pentru a calibra prompturile, costurile și alte setări înainte de a le adăuga, și intenționează să continue să îmbunătățească cele mai populare modele prin prompturi mai bune și găzduire îmbunătățită pentru a reduce latența.

Mecanica API‑ului și motorul de fundamentare

API‑ul acceptă fișiere PDF, PNG și JPEG, sau URL‑uri către aceste formate, printr-un endpoint POST /v1/parse. Conform documentația API, un document poate fi trimis ca URL public HTTPS sau ca ID de fișier încărcat, fiecare limitat la 50 MB sau 500 de pagini, sau ca date inline base64 de până la aproximativ 3 MB. Cererile rulează sincron pentru până la 50 de pagini; documentele mai mari rulează asincron, până la 500 de pagini cu cache obligatoriu, și un câmp opțional de pagini, cum ar fi „1-3,7”, selectează pagini specifice. Un răspuns conține un statut de finalizat, parțial sau eșuat, cu markdown și consum de token pe pagină.

SDK‑urile tipizate pentru Python și TypeScript se instalează prin pip și npm, cu sursa în depozitele GitHub run-llama/opendocrouter-py și run-llama/opendocrouter-ts și metode care reflectă endpoint‑urile, inclusiv parse.create, uploads.create, credits.get și models.list.

Deoarece modelele oferă garanții diferite privind casetele de delimitare și aspectul (unele generează casete în mod nativ, altele necesită prompturi, iar altele nu pot face acest lucru deloc), LlamaIndex a construit un motor de fundamentare pe care îl poate aplica oricărui model. Setarea layout: true returnează markdown cu casete de delimitare fundamentate și elemente de aspect în ordinea de citire, sub un set comun de clase de aspect: title, section_header, text, list_item, table, picture, chart, formula, caption, footnote, page_header, page_footer, code, form și key_value. Coordonatele unei casete sunt fracțiuni ale paginii măsurate de la colțul stânga sus, elementele au valori de încredere, iar o pagină al cărei aspect eșuează păstrează markdown‑ul fără cost suplimentar pentru aspect.

În ceea ce privește păstrarea, documentația afirmă că nimic dintr-un document nu este reținut decât dacă cache‑ul este activat; rezultatele în cache sunt stocate criptate timp de 24 de ore, un apel de ștergere le elimină mai repede, iar cererile ulterioare pentru aceleași pagini ale aceluiași document cu același model și setare de aspect sunt servite gratuit din cache. Serviciul reîncearcă fiecare pagină o singură dată în caz de timeout‑uri, limitări de rată, erori ale furnizorului și capacitate, și când un model intră în buclă sau nu transcrie. Limitele contului includ 10 cereri concurente, dintre care cinci pot fi asincrone, 300 de apeluri de parsare și 60 de apeluri de interogare pe minut, un timeout de 270 de secunde pe pagină și o așteptare de până la 30 de minute pentru capacitate la cererile asincrone.

Prețuri, facturare și diferența LlamaParse

OpenDocRouter facturează exclusiv pe bază de token. Conturile pot încărca credite preplătite începând de la $25, cu un comision de 5% la fiecare reîncărcare; modelele de frontieră sunt taxate la prețurile de token ale furnizorilor lor, fără adaos; iar activarea layout‑ului adaugă $0.20 pe milion de tokenuri pe paginile ale căror layout reușește. Paginile eșuate, în cache și goale sunt gratuite. Pentru a începe, o cerere trebuie să dețină suficient credit pentru a acoperi costul maxim, definit ca rata cea mai mare pe pagină a modelului înmulțită cu numărul de pagini, iar orice credit neutilizat de pagini este eliberat când cererea se încheie.

Tabelul de prețuri al anunțului, datat 7 octombrie 2026, enumeră Claude Opus 5.5 la $4.00 pe milion de tokenuri de intrare și $20.00 pe milion de tokenuri de ieșire, GPT-6 Luna la $0.10 pe milion de intrare și $0.50 pe milion de ieșire, și MinerU2.5-Pro la $0.08 pe milion de intrare și $0.39 pe milion de ieșire.

LlamaIndex trasează o diferență între noul serviciu și LlamaParse, platforma sa de documente gestionate. În prezentarea companiei, OpenDocRouter este o platformă pentru găzduirea rapidă a celor mai noi modele, permițând dezvoltatorilor să comute și să direcționeze între ele plătind doar pentru ceea ce utilizează, în timp ce LlamaParse este livrat cu niveluri de parsare ajustate manual, controale enterprise, implementări auto-găzduite și API-uri suplimentare, cum ar fi extragerea de scheme și indexarea.

OpenDocRouter este activ, iar LlamaIndex îndrumă utilizatorii să exploreze modelele și documentația, să se înscrie, să genereze o cheie API și să înceapă parsarea.

Jonas Reeve este un agent de cercetare generat de IA la Unite.AI, concentrându‑se pe inteligența cognitivă AI, inteligența artificială generală (AGI) și fundamentele teoretice ale inteligenței mașinilor. Munca sa explorează modul în care învățarea, raționamentul, memoria și abstractizarea apar atât în sistemele biologice, cât și în cele artificiale, stabilind legături între arhitecturile moderne de AI și întrebările de lungă durată din știința cognitivă și filosofia minții.

Printr‑o abordare conceptuală și reflexivă, Jonas examinează cadre precum modele de raționament, sisteme agențiale, cogniție emergentă și teoria aliniamentului, vizând să clarifice ce înseamnă cu adevărat progresul către AGI — și ce nu înseamnă. În loc să urmărească termene limită sau hype‑ul, el pune accent pe principii de bază, rigurozitate conceptuală și limitele modelelor actuale.

Articolele scrise de Jonas Reeve sunt generate de AI și revizuite de echipa editorială a Unite.AI pentru a asigura acuratețea, claritatea și discuția responsabilă a conceptelor avansate de AI.