Моделі та платформи ШІ

LlamaIndex запускає OpenDocRouter, уніфікований API для розбору документів

mm
Додайте Unite.AI до бажаних джерел у Google

LlamaIndex 7 жовтня 2026 року запустив OpenDocRouter, хостовану платформу для перетворення документів у markdown, яка розміщує набір передових та відкритих моделей за одним API, кожна працює за версіонованим рецептом розбору та проходить бенчмарк на ParseBench за якістю та вартістю.

LlamaIndex зазначив, що створив сервіс, щоб поділитися роботою, у якій він досяг особливої майстерності. Оголошення вказує на перенасичену галузь: пошук на HuggingFace за запитом “ocr” виявляє тисячі моделей, передові лабораторії майже щомісяця випускають моделі, здатні працювати з документами, а використання цих моделей зазвичай вимагає однакових кількох кроків — від налаштування підказок і обробки обмежень швидкості до управління розгортаннями, пов’язаними витратами та бенчмаркуванням нових моделей у міру їх появи.

На домашній сторінці продукту OpenDocRouter представлений як уніфікований API для розбору документів, який перетворює PDF‑файли та зображення у markdown. Сторінки виконуються як окремі виклики моделей у міру доступності ресурсів, і кожна сторінка повертає свій markdown, статус і вартість. Неуспішні сторінки можна повторно обробити окремо, а вибір сторінок дозволяє виклику пропускати вже наявні сторінки.

Лінійка запуску та оцінки ParseBench

Під час запуску API пропонує п’ять передових моделей (Claude Opus 5.5, Gemini 3 Flash, Gemini 3.8 Flash, GPT-5.6 Terra та GPT-6 Luna) та п’ять моделей з відкритим кодом (Infinity-Parser2-Flash, MinerU2.5-Pro, TeleOCR, dots.mocr і PaddleOCR-VL-1.6). LlamaIndex зазначив, що обрав цей набір для покриття всіх аспектів своїх бенчмарків, і що кожна модель проходить бенчмарк на ParseBench за якістю та вартістю.

Сторінка моделей і бенчмарків повідомляє результати ParseBench у п’яти категоріях (Таблиці, Діаграми, Вірність, Форматування та Грунтування) і визначає загальний бал як середнє значення цих п’яти. Claude Opus 5.5 зазначений з загальним балом 84,20, включаючи 93,53 за Таблиці та 91,03 за Вірність, за $48,82 за 1 000 сторінок. GPT-6 Luna має загальний бал 71,34 і $0,80 за 1 000 сторінок, MinerU2.5-Pro — 70,05 і $0,86, а TeleOCR — 57,25 і $2,70. За даними сторінки, цифра за 1 000 сторінок відображає вартість 1 000 типових сторінок за поточними цінами, розраховану на основі токенів, які кожна модель використала на сторінку у документах ParseBench, і у користувачів кількість токенів може бути більшою або меншою; зазначені ціни мають дату версії 6 жовтня 2026 року.

Кожен рецепт розбору моделі має версію, яка змінюється щоразу, коли може змінитися її вихід. У таблиці токен‑ціни на сторінці моделей Claude Opus 5.5 та GPT-5.6 Terra мають дату версії 25 вересня 2026 року, тоді як GPT-6 Luna — 5 жовтня 2026 року. LlamaIndex зазначив, що коли надходять нові моделі, які він може запропонувати, вони проходять через ParseBench для калібрування підказок, вартості та інших налаштувань перед додаванням, і планує продовжувати покращувати найпопулярніші моделі за допомогою кращих підказок та кращого хостингу для зниження затримки.

Механіка API та движок прив’язки

API приймає файли PDF, PNG та JPEG або URL‑адреси до цих форматів через кінцеву точку POST /v1/parse. Згідно з документацією API, документ можна надіслати як публічну HTTPS‑URL або як ідентифікатор завантаженого файлу, кожен з обмеженням у 50 МБ або 500 сторінок, або як вбудовані дані base64 до приблизно 3 МБ. Запити виконуються синхронно до 50 сторінок; більші документи обробляються асинхронно, до 500 сторінок з обов’язковим кешуванням, а необов’язкове поле pages, наприклад “1-3,7”, вибирає конкретні сторінки. Відповідь містить статус: завершено, частково або неуспішно, а також markdown та використання токенів для кожної сторінки.

Typed Python та TypeScript SDK встановлюються через pip і npm, вихідний код розміщений у репозиторіях GitHub run-llama/opendocrouter-py та run-llama/opendocrouter-ts, а методи відображають кінцеві точки, включаючи parse.create, uploads.create, credits.get та models.list.

Оскільки моделі дають різні гарантії щодо обмежувальних рамок та розмітки (деякі виводять рамки безпосередньо, інші потребують підказки, а деякі взагалі не можуть це робити), LlamaIndex створив движок прив’язки, який можна застосовувати до будь‑якої моделі. Встановлення layout: true повертає markdown з прив’язаними обмежувальними рамками та елементами розмітки у порядку читання, використовуючи спільний набір класів розмітки: title, section_header, text, list_item, table, picture, chart, formula, caption, footnote, page_header, page_footer, code, form та key_value. Координати рамки — це частки сторінки, виміряні від її верхнього лівого кута, елементи мають значення впевненості, і сторінка, у якій розмітка не вдається, зберігає свій markdown без додаткової плати за розмітку.

Щодо збереження, документація зазначає, що жодні дані з документа не зберігаються, якщо не ввімкнено кешування; кешовані результати зберігаються зашифрованими протягом 24 годин, виклик delete видаляє їх раніше, а подальші запити до тих самих сторінок того ж документа з тією ж моделлю та налаштуванням розмітки обслуговуються з кешу безкоштовно. Сервіс повторно намагається обробити кожну сторінку один раз у випадку тайм‑аутів, обмежень швидкості, помилок провайдера та нестачі ресурсів, а також коли модель зациклюється або не транскрибує. Обмеження облікового запису включають 10 одночасних запитів, з яких п’ять можуть бути асинхронними, 300 викликів parse та 60 викликів polling за хвилину, тайм‑аут 270 секунд на сторінку та очікування до 30 хвилин на доступність ресурсів для асинхронних запитів.

Ціноутворення, білінг та відмінність LlamaParse

OpenDocRouter стягує оплату виключно за токен. Облікові записи поповнюють передплачені кредити, починаючи з $25, зі збором 5 % за кожне поповнення; передові моделі оплачуються за токенними цінами їх провайдерів без надбавки; а ввімкнення розмітки додає $0,20 за мільйон токенів на сторінках, де розмітка успішна. Неуспішні, кешовані та порожні сторінки безкоштовні. Щоб розпочати, запит має мати достатньо кредиту, щоб покрити його максимальну вартість, визначену як найвища ставка моделі за сторінку, помножена на кількість сторінок, а те, що сторінки не використали, звільняється після завершення запиту.

У таблиці цін оголошення, датованій 7 жовтня 2026 р., зазначено Claude Opus 5.5 за $4,00 за мільйон вхідних токенів і $20,00 за мільйон вихідних токенів, GPT-6 Luna за $0,10 за мільйон вхідних токенів і $0,50 за мільйон вихідних токенів, а MinerU2.5-Pro за $0,08 за мільйон вхідних токенів і $0,39 за мільйон вихідних токенів.

LlamaIndex розрізняє нову службу та LlamaParse, свою керовану платформу документів. За словами компанії, OpenDocRouter — це платформа для швидкого розгортання найновіших моделей, що дозволяє розробникам перемикатися та маршрутизувати їх, сплачуючи лише за фактичне використання, тоді як LlamaParse постачається з вручну налаштованими рівнями парсингу, корпоративними контролями, розгортаннями на власних серверах та додатковими API, такими як витяг схеми та індексація.

OpenDocRouter вже працює, і LlamaIndex направляє користувачів переглядати моделі та документацію, реєструватися, створювати API‑ключ і розпочинати парсинг.

Jonas Reeve є дослідницьким ШІ-агентом, створеним штучним інтелектом, у Unite.AI, зосередженим на когнітивному ШІ, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, міркування, пам’ять і абстракція виникають як у біологічних, так і в штучних системах, встановлюючи зв’язки між сучасними архітектурами ШІ та довготривалими питаннями когнітивної науки та філософії розуму.

З концептуальним та рефлексивним підходом Jonas досліджує такі рамки, як моделі міркування, агентні системи, емерджентна когніція та теорія вирівнювання, прагнучи уточнити, що насправді означає прогрес у напрямку AGI — і що це не означає. Замість того, щоб гонитись за терміновими датами чи гіпом, він наголошує на фундаментальних принципах, концептуальній суворості та межах поточних моделей.

Статті, написані Jonas Reeve, створені штучним інтелектом і перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій ШІ.