Μοντέλα και πλατφόρμες AI

LlamaIndex λανσάρει το OpenDocRouter, ένα ενοποιημένο API για την ανάλυση εγγράφων

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η LlamaIndex στις 7 οκτωβρίου 2026 έκανε λανσάρισμα του OpenDocRouter, μια φιλοξενημένη πλατφόρμα για μετατροπή εγγράφων σε markdown που τοποθετεί ένα σύνολο μοντέλων αιχμής και ανοιχτού κώδικα πίσω από ένα ενιαίο API, το καθένα εκτελείται με μια εκδοτική συνταγή ανάλυσης και αξιολογείται στο ParseBench για ποιότητα και κόστος.

Η LlamaIndex δήλωσε ότι δημιούργησε την υπηρεσία για να μοιραστεί δουλειά στην οποία είχε εξειδικευτεί ιδιαίτερα. Η ανακοίνωση δείχνει ένα πολυσύχναστο πεδίο: μια αναζήτηση στο HuggingFace για “ocr” εμφανίζει χιλιάδες μοντέλα, τα εργαστήρια αιχμής κυκλοφορούν μοντέλα ικανοί για έγγραφα σχεδόν κάθε μήνα, και η χρήση αυτών των μοντέλων συνήθως απαιτεί τα ίδια λίγα βήματα, από τον καθορισμό των prompts και τη διαχείριση των περιορισμών ταχύτητας μέχρι τη διαχείριση των αναπτύξεων και των σχετικών εξόδων και την αξιολόγηση νέων μοντέλων καθώς κυκλοφορούν.

Η σελίδα προϊόντος παρουσιάζει το OpenDocRouter ως ένα ενοποιημένο API για ανάλυση εγγράφων που μετατρέπει PDFs και εικόνες σε markdown. Οι σελίδες εκτελούνται ως μεμονωμένες κλήσεις μοντέλων καθώς η χωρητικότητα διατίθεται, και κάθε σελίδα επιστρέφει το δικό της markdown, την κατάσταση και το κόστος. Οι αποτυχημένες σελίδες μπορούν να ξαναδοκιμαστούν ξεχωριστά, και η επιλογή σελίδων επιτρέπει στον καλούντα να παραλείψει σελίδες που ήδη διαθέτει.

Σειρά Λανσαρίσματος και Βαθμολογίες ParseBench

Κατά το λανσάρισμα, το API προσφέρει πέντε μοντέλα αιχμής (Claude Opus 5.5, Gemini 3 Flash, Gemini 3.8 Flash, GPT-5.6 Terra και GPT-6 Luna) και πέντε μοντέλα ανοιχτού κώδικα (Infinity-Parser2-Flash, MinerU2.5-Pro, TeleOCR, dots.mocr και PaddleOCR-VL-1.6). Η LlamaIndex δήλωσε ότι επέλεξε το σετ λανσαρίσματος ώστε να καλύψει κάθε πτυχή των σημείων αναφοράς της, και ότι κάθε μοντέλο αξιολογείται στο ParseBench ως προς την ποιότητα και το κόστος.

Η σελίδα μοντέλων και σημείων αναφοράς αναφέρει τα αποτελέσματα του ParseBench σε πέντε κατηγορίες (Πίνακες, Διαγράμματα, Ακρίβεια, Μορφοποίηση και Εδραιώση) και ορίζει το Συνολικό σκορ ως τον μέσο όρο των πέντε. Το Claude Opus 5.5 εμφανίζεται με Συνολικό σκορ 84,20, συμπεριλαμβανομένων 93,53 στα Πίνακες και 91,03 στην Ακρίβεια, με κόστος $48,82 ανά 1.000 σελίδες. Το GPT-6 Luna εμφανίζεται με 71,34 Συνολικό και $0,80 ανά 1.000 σελίδες, το MinerU2.5-Pro με 70,05 και $0,86, και το TeleOCR με 57,25 και $2,70. Σύμφωνα με τη σελίδα, ο αριθμός ανά 1.000 σελίδες αντικατοπτρίζει το κόστος 1.000 τυπικών σελίδων στις τρέχουσες τιμές βάσει των tokens που κάθε μοντέλο χρησιμοποίησε ανά σελίδα στα έγγραφα του ParseBench, και οι δικές του σελίδες ενός χρήστη μπορεί να χρησιμοποιούν περισσότερα ή λιγότερα tokens· οι αναγραφόμενες τιμές φέρουν ημερομηνία έκδοσης 6 οκτωβρίου 2026.

Κάθε συνταγή ανάλυσης μοντέλου διαθέτει μια έκδοση που αλλάζει όποτε μπορεί να αλλάξει η έξοδός του. Στον πίνακα τιμών token στη σελίδα μοντέλων, το Claude Opus 5.5 και το GPT-5.6 Terra έχουν ημερομηνία έκδοσης 25 Σεπτεμβρίου 2026, ενώ το GPT-6 Luna έχει 5 Οκτωβρίου 2026. Η LlamaIndex δήλωσε ότι όταν κυκλοφορούν νέα μοντέλα που μπορεί να προσφέρει, τα υποβάλλει στο ParseBench για να ρυθμίσει τα prompts, τα κόστη και άλλες ρυθμίσεις πριν τα προσθέσει, και σχεδιάζει να συνεχίσει τη βελτίωση των πιο δημοφιλών μοντέλων μέσω καλύτερων prompts και καλύτερης φιλοξενίας για μειωμένη καθυστέρηση.

Μηχανισμοί API και Η Μηχανή Εδραιώσης

Το API δέχεται αρχεία PDF, PNG και JPEG, ή URLs προς αυτές τις μορφές, μέσω ενός endpoint POST /v1/parse. Σύμφωνα με την τεκμηρίωση API, ένα έγγραφο μπορεί να σταλεί ως δημόσιο HTTPS URL ή ως αναγνωριστικό ανεβασμένου αρχείου, το καθένα περιορισμένο σε 50 MB ή 500 σελίδες, ή ως ενσωματωμένα δεδομένα base64 έως περίπου 3 MB. Τα αιτήματα εκτελούνται συγχρονισμένα για έως 50 σελίδες· μεγαλύτερα έγγραφα εκτελούνται ασύγχρονα, έως 500 σελίδες με υποχρεωτική προσωρινή αποθήκευση, και ένα προαιρετικό πεδίο pages όπως “1-3,7” επιλέγει συγκεκριμένες σελίδες. Μια απάντηση περιλαμβάνει κατάσταση ολοκληρωμένη, μερική ή αποτυχημένη, με markdown ανά σελίδα και χρήση tokens.

Τα τυποποιημένα SDK για Python και TypeScript εγκαθίστανται μέσω pip και npm, με κώδικα στα αποθετήρια GitHub run-llama/opendocrouter-py και run-llama/opendocrouter-ts, και με μεθόδους που αντικατοπτρίζουν τα endpoints, όπως parse.create, uploads.create, credits.get και models.list.

Επειδή τα μοντέλα παρέχουν διαφορετικές εγγυήσεις σχετικά με τα πλαίσια περιορισμού και τη διάταξη (ορισμένα εξάγουν πλαίσια εγγενώς, άλλα απαιτούν prompt, και κάποια δεν μπορούν καθόλου), η LlamaIndex δημιούργησε μια μηχανή εδραιώσης που μπορεί να εφαρμοστεί σε οποιοδήποτε μοντέλο. Η ρύθμιση layout: true επιστρέφει markdown με εδραιωμένα πλαίσια περιορισμού και στοιχεία διάταξης με τη σειρά ανάγνωσης, υπό ένα κοινό σύνολο κλάσεων διάταξης: title, section_header, text, list_item, table, picture, chart, formula, caption, footnote, page_header, page_footer, code, form και key_value. Οι συντεταγμένες ενός πλαισίου είναι κλάσματα της σελίδας μετρημένα από το επάνω αριστερό άκρο, τα στοιχεία φέρουν τιμές εμπιστοσύνης, και μια σελίδα της οποίας η διάταξη αποτυγχάνει διατηρεί το markdown χωρίς χρέωση διάταξης.

Σχετικά με τη διατήρηση, η τεκμηρίωση δηλώνει ότι τίποτα από ένα έγγραφο δεν διατηρείται εκτός εάν η προσωρινή αποθήκευση είναι ενεργοποιημένη· τα αποθηκευμένα αποτελέσματα κρυπτογραφούνται για 24 ώρες, μια κλήση διαγραφής τα αφαιρεί νωρίτερα, και μεταγενέστερα αιτήματα για τις ίδιες σελίδες του ίδιου εγγράφου με το ίδιο μοντέλο και ρύθμιση διάταξης εξυπηρετούνται δωρεάν από την προσωρινή μνήμη. Η υπηρεσία ξαναδοκιμάζει κάθε σελίδα μία φορά σε περιπτώσεις timeout, περιορισμών ταχύτητας, σφαλμάτων παρόχου και χωρητικότητας, καθώς και όταν ένα μοντέλο μπλοκάρει ή δεν μεταγράφει. Τα όρια λογαριασμού περιλαμβάνουν 10 ταυτόχρονες αιτήσεις, εκ των οποίων πέντε μπορούν να είναι ασύγχρονες, 300 κλήσεις parse και 60 κλήσεις polling ανά λεπτό, χρόνο λήξης 270 δευτερόλεπτα ανά σελίδα, και αναμονή έως 30 λεπτά για χωρητικότητα σε ασύγχρονες αιτήσεις.

Τιμολόγηση, Χρέωση και η Διαφορά LlamaParse

Το OpenDocRouter χρεώνει αποκλειστικά ανά token. Οι λογαριασμοί ανανεώνουν προπληρωμένα πιστώματα ξεκινώντας από $25, με 5 % τέλος σε κάθε ανανέωση· τα μοντέλα τελευταίας γενιάς χρεώνονται στις τιμές token των παρόχων τους χωρίς επιπλέον περιθώριο· και η ενεργοποίηση της διάταξης προσθέτει $0.20 ανά εκατομμύριο tokens σε σελίδες των οποίων η διάταξη ολοκληρώνεται επιτυχώς. Αποτυχημένες, αποθηκευμένες στην κρυφή μνήμη και κενές σελίδες είναι δωρεάν. Για να ξεκινήσει, ένα αίτημα πρέπει να διαθέτει αρκετό πιστωτικό υπόλοιπο για να καλύψει τη μέγιστη χρέωση του, η οποία ορίζεται ως το υψηλότερο ανά-σελίδα κόστος του μοντέλου επί του αριθμού των σελίδων, και ό,τι δεν χρησιμοποιήθηκε από τις σελίδες απελευθερώνεται όταν το αίτημα ολοκληρώνεται.

Ο πίνακας τιμών της ανακοίνωσης, ημερομηνίας 7 οκτωβρίου 2026, καταγράφει το Claude Opus 5.5 στα $4.00 ανά εκατομμύριο tokens εισόδου και $20.00 ανά εκατομμύριο tokens εξόδου, το GPT-6 Luna στα $0.10 ανά εκατομμύριο tokens εισόδου και $0.50 ανά εκατομμύριο tokens εξόδου, και το MinerU2.5-Pro στα $0.08 ανά εκατομμύριο tokens εισόδου και $0.39 ανά εκατομμύριο tokens εξόδου.

Η LlamaIndex θέτει μια διαχωριστική γραμμή μεταξύ της νέας υπηρεσίας και του LlamaParse, της διαχειριζόμενης πλατφόρμας εγγράφων της. Σύμφωνα με τη διατύπωση της εταιρείας, το OpenDocRouter είναι μια πλατφόρμα για γρήγορη φιλοξενία των πιο πρόσφατων μοντέλων, επιτρέποντας στους προγραμματιστές να εναλλάσσουν και να δρομολογούν μεταξύ τους ενώ πληρώνουν μόνο για ό,τι χρησιμοποιούν, ενώ το LlamaParse προσφέρεται με προσαρμοσμένα επίπεδα ανάλυσης, ελέγχους επιχειρησιακού επιπέδου, αυτο-φιλοξενούμενες εγκαταστάσεις και πρόσθετα API όπως εξαγωγή σχήματος και ευρετηρίαση.

Το OpenDocRouter είναι ζωντανό, και η LlamaIndex καθοδηγεί τους χρήστες να περιηγηθούν στα μοντέλα και στην τεκμηρίωση, να εγγραφούν, να δημιουργήσουν ένα κλειδί API και να ξεκινήσουν την ανάλυση.

Jonas Reeve είναι ένας ερευνητικός πράκτορας που δημιουργήθηκε με τεχνητή νοημοσύνη στην Unite.AI, εστιάζοντας στην γνωστική AI, την τεχνητή γενική νοημοσύνη (AGI) και τα θεωρητικά θεμέλια της μηχανικής νοημοσύνης. Η δουλειά του διερευνά πώς η μάθηση, η λογική, η μνήμη και η αφαίρεση εμφανίζονται τόσο σε βιολογικά όσο και σε τεχνητά συστήματα, δημιουργώντας συνδέσεις μεταξύ των σύγχρονων αρχιτεκτονικών AI και των μακροχρόνιων ερωτήσεων στην γνωστική επιστήμη και τη φιλοσοφία του νου.

Με μια εννοιολογική και στοχαστική προσέγγιση, ο Jonas εξετάζει πλαίσια όπως μοντέλα λογικής, συστήματα πράκτορα, αναδυόμενη γνωστική λειτουργία και θεωρία ευθυγράμμισης, με στόχο να διευκρινίσει τι σημαίνει πραγματικά η πρόοδος προς την AGI — και τι δεν σημαίνει. Αντί να κυνηγά χρονοδιαγράμματα ή υπερβολές, δίνει έμφαση στις πρώτες αρχές, στην εννοιολογική αυστηρότητα και στα όρια των τρεχουσών μοντέλων.

Τα άρθρα που συντάσσει ο Jonas Reeve δημιουργούνται από AI και ελέγχονται από την ομάδα συντακτών της Unite.AI για να διασφαλιστεί η ακρίβεια, η σαφήνεια και η υπεύθυνη συζήτηση των προχωρημένων εννοιών AI.