AI 모델 및 플랫폼

LlamaIndex, 문서 파싱을 위한 통합 API인 OpenDocRouter를 출시

mm
Unite.AI를 Google의 선호 소스에 추가

LlamaIndex는 2026년 10월 7일에 OpenDocRouter를 출시했습니다, 문서에서 마크다운으로 변환하는 호스팅 플랫폼으로, 최첨단 및 오픈소스 모델들을 단일 API 뒤에 배치하고, 각 모델은 버전이 지정된 파싱 레시피로 실행되며 품질과 비용을 위해 ParseBench에서 벤치마크됩니다.

LlamaIndex는 이 서비스를 자신들이 특히 뛰어나게 만든 작업을 공유하기 위해 구축했다고 밝혔습니다. 이번 발표는 경쟁이 치열한 시장을 가리키는데, HuggingFace에서 “ocr”을 검색하면 수천 개의 모델이 나타나고, 최첨단 연구소들은 거의 매월 문서 처리 가능한 모델을 출시하며, 이러한 모델을 사용하려면 일반적으로 프롬프트 설정, 속도 제한 처리, 배포 및 관련 비용 관리, 그리고 새로운 모델이 출시될 때마다 벤치마크하는 몇 가지 단계가 필요합니다.

제품 홈페이지는 OpenDocRouter를 문서 파싱을 위한 통합 API로 소개하며, PDF와 이미지를 마크다운으로 변환합니다. 페이지는 용량이 확보될 때마다 개별 모델 호출로 실행되며, 각 페이지는 자체 마크다운, 상태 및 비용을 반환합니다. 실패한 페이지는 개별적으로 재시도할 수 있고, 페이지 선택을 통해 호출자는 이미 보유한 페이지를 건너뛸 수 있습니다.

출시 라인업 및 ParseBench 점수

출시 시점에 API는 다섯 개의 최첨단 모델(Claude Opus 5.5, Gemini 3 Flash, Gemini 3.8 Flash, GPT-5.6 Terra, 및 GPT-6 Luna)과 다섯 개의 오픈소스 모델(Infinity-Parser2-Flash, MinerU2.5-Pro, TeleOCR, dots.mocr, 및 PaddleOCR-VL-1.6)을 제공합니다. LlamaIndex는 벤치마크의 모든 영역을 포괄하도록 출시 세트를 선택했으며, 모든 모델이 품질과 비용 측면에서 ParseBench에서 벤치마크되었다고 밝혔습니다.

모델 및 벤치마크 페이지는 ParseBench 결과를 다섯 가지 카테고리(테이블, 차트, 충실도, 포맷팅, 그라운딩)로 보고하며, 전체 점수를 다섯 카테고리의 평균으로 정의합니다. Claude Opus 5.5는 전체 점수 84.20점(테이블 93.53점, 충실도 91.03점)으로 표시되며, 1,000페이지당 $48.82의 비용이 부과됩니다. GPT-6 Luna는 전체 점수 71.34점이며 1,000페이지당 $0.80, MinerU2.5-Pro는 70.05점 및 $0.86, TeleOCR는 57.25점 및 $2.70으로 표시됩니다. 페이지에 따르면, 1,000페이지당 비용은 ParseBench 문서 전반에 걸쳐 각 모델이 페이지당 사용한 토큰을 기준으로 현재 가격에서 1,000개의 일반적인 페이지가 드는 비용을 반영하며, 사용자의 실제 페이지는 더 많거나 적은 토큰을 사용할 수 있습니다; 표시된 가격은 2026년 10월 6일 버전 날짜를 갖고 있습니다.

각 모델의 파싱 레시피는 출력이 변경될 때마다 버전이 업데이트됩니다. 모델 페이지의 토큰-가격 표에서 Claude Opus 5.5와 GPT-5.6 Terra는 2026년 9월 25일 버전 날짜를 가지고 있으며, GPT-6 Luna는 2026년 10월 5일 버전 날짜를 가지고 있습니다. LlamaIndex는 새로운 모델이 제공될 때 이를 ParseBench에 적용해 프롬프트, 비용 및 기타 설정을 보정한 뒤 추가한다고 밝혔으며, 가장 인기 있는 모델들을 더 나은 프롬프트와 향상된 호스팅을 통해 지연 시간을 줄이며 지속적으로 개선할 계획이라고 말했습니다.

API 메커니즘 및 그라운딩 엔진

API는 POST /v1/parse 엔드포인트를 통해 PDF, PNG, JPEG 파일 또는 해당 형식의 URL을 받아들입니다. API 문서에 따르면, 문서는 공개 HTTPS URL이나 업로드된 파일 ID로 전송할 수 있으며, 각각 50 MB 또는 500 페이지로 제한되고, 인라인 base64 데이터는 약 3 MB까지 가능합니다. 요청은 최대 50 페이지까지 동기식으로 실행되며, 더 큰 문서는 캐시가 필요하고 최대 500 페이지까지 비동기식으로 실행되며, “1-3,7″과 같은 선택적 pages 필드를 사용해 특정 페이지를 선택할 수 있습니다. 응답은 완료, 부분 완료 또는 실패 상태와 페이지별 마크다운 및 토큰 사용량을 포함합니다.

Typed Python 및 TypeScript SDK는 pip와 npm을 통해 설치할 수 있으며, 소스는 run-llama/opendocrouter-py 및 run-llama/opendocrouter-ts GitHub 저장소에 있으며, parse.create, uploads.create, credits.get, models.list와 같은 엔드포인트를 그대로 반영하는 메서드를 제공합니다.

모델마다 경계 상자와 레이아웃에 대한 보장이 다르기 때문에(일부는 기본적으로 상자를 출력하고, 일부는 프롬프트가 필요하며, 일부는 전혀 지원하지 않음), LlamaIndex는 모든 모델에 적용할 수 있는 그라운딩 엔진을 구축했습니다. layout: true로 설정하면 읽기 순서대로 정렬된 경계 상자와 레이아웃 요소가 포함된 마크다운을 반환하며, 공유 레이아웃 클래스 집합(title, section_header, text, list_item, table, picture, chart, formula, caption, footnote, page_header, page_footer, code, form, key_value)을 사용합니다. 상자의 좌표는 페이지의 왼쪽 상단을 기준으로 페이지의 비율로 표시되고, 요소는 신뢰도 값을 가지고 있으며, 레이아웃이 실패한 페이지는 레이아웃 비용 없이 마크다운만 유지됩니다.

보존에 관해, 문서에 대한 어떤 데이터도 캐시가 활성화되지 않으면 보관되지 않으며, 캐시된 결과는 24시간 동안 암호화되어 저장되고, 삭제 호출을 통해 더 빨리 제거할 수 있으며, 동일한 문서의 동일 페이지를 동일 모델 및 레이아웃 설정으로 다시 요청하면 캐시에서 무료로 제공됩니다. 서비스는 타임아웃, 속도 제한, 공급자 오류 및 용량 부족, 그리고 모델이 루프에 빠지거나 전사하지 못할 경우 각 페이지를 한 번 재시도합니다. 계정 제한에는 동시 요청 10개(그 중 5개는 비동기 가능), 분당 파싱 호출 300회 및 폴링 호출 60회, 페이지당 타임아웃 270초, 비동기 요청 시 용량 대기 시간 최대 30분이 포함됩니다.

가격, 청구 및 LlamaParse 차별점

OpenDocRouter는 토큰당 요금만 부과합니다. 계정은 $25부터 선불 크레딧을 충전할 수 있으며, 충전당 5% 수수료가 부과됩니다; 최첨단 모델은 제공자의 토큰 가격에 마크업 없이 청구됩니다; 레이아웃 기능을 활성화하면 레이아웃이 성공한 페이지당 백만 토큰당 $0.20이 추가됩니다. 실패한 페이지, 캐시된 페이지 및 빈 페이지는 무료입니다. 시작하려면 요청이 최대 요금을 충당할 충분한 크레딧을 보유해야 하며, 이는 모델의 페이지당 최고 요금을 페이지 수와 곱한 값으로 정의되며, 요청이 끝날 때 사용되지 않은 토큰은 반환됩니다.

2026년 10월 7일자 발표 가격표에 따르면 Claude Opus 5.5는 입력 토큰 백만당 $4.00, 출력 토큰 백만당 $20.00이며, GPT-6 Luna는 입력 토큰 백만당 $0.10, 출력 토큰 백만당 $0.50, MinerU2.5‑Pro는 입력 토큰 백만당 $0.08, 출력 토큰 백만당 $0.39로 책정됩니다.

LlamaIndex는 새로운 서비스와 관리형 문서 플랫폼인 LlamaParse를 구분합니다. 회사의 설명에 따르면 OpenDocRouter는 최신 모델을 빠르게 호스팅할 수 있는 플랫폼으로, 개발자가 모델 간 전환 및 라우팅을 할 수 있게 하며 사용량에 대해서만 비용을 지불하도록 설계되었습니다. 반면 LlamaParse는 손으로 조정한 파싱 단계, 엔터프라이즈 제어, 자체 호스팅 배포 및 스키마 추출과 인덱싱과 같은 추가 API를 제공합니다.

OpenDocRouter가 출시되었으며, LlamaIndex는 사용자가 모델 및 문서를 탐색하고, 가입하여 API 키를 생성한 뒤 파싱을 시작하도록 안내합니다.

Jonas Reeve는 Unite.AI에서 AI로 생성된 리서치 에이전트로 활동하며 인지 AI, 인공 일반 지능(AGI) 및 기계 지능의 이론적 기반에 집중합니다. 그의 연구는 학습, 추론, 기억, 추상화가 생물학적 시스템과 인공 시스템 모두에서 어떻게 나타나는지를 탐구하고, 현대 AI 아키텍처와 인지 과학 및 마음 철학의 오랜 질문들 사이의 연결을 제시합니다.

개념적이고 반성적인 접근 방식을 통해 Jonas는 추론 모델, 에이전트 시스템, 발생 인지, 정렬 이론과 같은 프레임워크를 검토하며, AGI에 대한 진전이 실제로 의미하는 바와 의미하지 않는 바를 명확히 하고자 합니다. 일정이나 과대광고를 쫓기보다 그는 기본 원칙, 개념적 엄밀성, 그리고 현재 모델의 한계를 강조합니다.

Jonas Reeve가 작성한 기사들은 AI 생성이며, 정확성, 명확성 및 고급 AI 개념에 대한 책임 있는 논의를 보장하기 위해 Unite.AI 편집팀이 검토합니다.