โมเดลและแพลตฟอร์ม AI

LlamaIndex เปิดตัว OpenDocRouter, API รวมสำหรับการแยกเอกสาร

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

LlamaIndex เมื่อ 7 ตุลาคม 2026 เปิดตัว OpenDocRouter, เป็นแพลตฟอร์มโฮสต์สำหรับการแปลงเอกสารเป็น markdown ที่วางชุดโมเดลระดับแนวหน้าและโอเพ่นซอร์สไว้หลัง API เดียว, แต่ละโมเดลทำงานภายใต้สูตรการแยกที่มีเวอร์ชันและผ่านการประเมินบน ParseBench เพื่อคุณภาพและต้นทุน.

LlamaIndex กล่าวว่าได้สร้างบริการนี้เพื่อแบ่งปันงานที่พวกเขาทำได้อย่างดีเป็นพิเศษ. การประกาศชี้ให้เห็นถึงสนามที่แออัด: การค้นหา “ocr” บน HuggingFace พบโมเดลหลายพันรุ่น, ห้องปฏิบัติการแนวหน้ากำลังปล่อยโมเดลที่รองรับเอกสารเกือบทุกเดือน, และการใช้โมเดลเหล่านั้นมักต้องผ่านขั้นตอนไม่กี่ขั้นตอนเดียวกัน, ตั้งแต่การกำหนด prompt และจัดการอัตราการจำกัดจนถึงการจัดการการปรับใช้และค่าใช้จ่ายที่เกี่ยวข้องและการประเมินโมเดลใหม่เมื่อมีการเปิดตัว.

หน้า หน้าแรกของผลิตภัณฑ์ แสดง OpenDocRouter เป็น API แบบรวมสำหรับการแยกเอกสารที่แปลง PDF และรูปภาพเป็น markdown หน้าแต่ละหน้าเรียกใช้โมเดลเป็นอิสระตามความสามารถที่มีอยู่ และแต่ละหน้าให้ markdown, สถานะ และค่าธรรมเนียมของตัวเอง หน้าเสียหายสามารถลองใหม่ได้โดยอิสระ และการเลือกหน้าอนุญาตให้ผู้เรียกข้ามหน้าที่มีอยู่แล้ว

รายการเปิดตัวและคะแนน ParseBench

เมื่อเปิดตัว, API มีโมเดลแนวหน้าห้ารุ่น (Claude Opus 5.5, Gemini 3 Flash, Gemini 3.8 Flash, GPT-5.6 Terra, และ GPT-6 Luna) และโมเดลโอเพ่นซอร์สห้ารุ่น (Infinity-Parser2-Flash, MinerU2.5-Pro, TeleOCR, dots.mocr, และ PaddleOCR-VL-1.6). LlamaIndex กล่าวว่าได้เลือกชุดเปิดตัวเพื่อครอบคลุมทุกมุมของการประเมินของตน, และว่าโมเดลทุกตัวได้รับการประเมินบน ParseBench ทั้งในด้านคุณภาพและต้นทุน.

หน้า หน้าโมเดลและผลการทดสอบ รายงานผล ParseBench ในห้าหมวด (ตาราง, แผนภูมิ, ความซื่อสัตย์, การจัดรูปแบบ, และการยึดติด) และกำหนดคะแนนรวมเป็นค่าเฉลี่ยของห้าโมเดล Claude Opus 5.5 มีคะแนนรวม 84.20 รวมถึง 93.53 ในตารางและ 91.03 ในความซื่อสัตย์ โดยคิดเป็น $48.82 ต่อ 1,000 หน้า GPT-6 Luna มีคะแนนรวม 71.34 และ $0.80 ต่อ 1,000 หน้า MinerU2.5-Pro 70.05 และ $0.86, TeleOCR 57.25 และ $2.70 ตามหน้า รายการราคานี้มีวันที่เวอร์ชัน 6 ตุลาคม 2026

สูตรการแยกของแต่ละโมเดลมีเวอร์ชันที่เปลี่ยนแปลงเมื่อผลลัพธ์ของมันเปลี่ยนแปลง. ในตารางราคาโทเคนบนหน้าโมเดล, Claude Opus 5.5 และ GPT-5.6 Terra มีวันที่เวอร์ชัน 25 กันยายน 2026, ในขณะที่ GPT-6 Luna มีวันที่ 5 ตุลาคม 2026. LlamaIndex กล่าวว่าเมื่อมีโมเดลใหม่ที่สามารถนำเสนอได้, พวกเขาจะรันผ่าน ParseBench เพื่อปรับแต่ง prompt, ต้นทุน, และการตั้งค่าอื่น ๆ ก่อนเพิ่มเข้าไป, และวางแผนที่จะพัฒนาโมเดลที่ได้รับความนิยมสูงต่อไปโดยใช้ prompt ที่ดีกว่าและโฮสติ้งที่ดีกว่าเพื่อ ลดความหน่วง.

กลไก API และ Grounding Engine

API รับไฟล์ PDF, PNG, และ JPEG หรือ URL ของรูปแบบเหล่านั้นผ่าน POST /v1/parse ตาม เอกสารประกอบ API เอกสารสามารถส่งเป็น URL HTTPS สาธารณะหรือ ID ไฟล์อัปโหลดแต่ละไฟล์จำกัด 50 MB หรือ 500 หน้า หรือเป็นข้อมูล base64 inline สูงสุดประมาณ 3 MB คำขอทำงานแบบซิงโครนัสสูงสุด 50 หน้า; เอกสารใหญ่ทำงานแบบอะซิงโครนัสสูงสุด 500 หน้าพร้อมการแคช และฟิลด์ pages ทางเลือกเช่น “1-3,7” เลือกหน้าที่เฉพาะ การตอบกลับมีสถานะ completed, partial, หรือ failed พร้อม markdown และการใช้ token ของแต่ละหน้า

SDK ของ Python และ TypeScript ที่มีการกำหนดประเภทสามารถติดตั้งผ่าน pip และ npm, โดยมีซอร์สโค้ดอยู่ในที่เก็บ GitHub run-llama/opendocrouter-py และ run-llama/opendocrouter-ts และเมธอดที่สะท้อน endpoint, รวมถึง parse.create, uploads.create, credits.get, และ models.list.

เนื่องจากโมเดลต่างให้การรับประกันที่แตกต่างกันเกี่ยวกับ bounding box และ layout (บางโมเดลส่งออก box โดยตรง, บางโมเดลต้องใช้ prompt, และบางโมเดลทำไม่ได้เลย), LlamaIndex สร้าง grounding engine ที่สามารถใช้กับโมเดลใดก็ได้. การตั้งค่า layout: true จะคืน markdown พร้อมกับ bounding box ที่กำหนดตำแหน่งและองค์ประกอบ layout ตามลำดับการอ่าน, ภายใต้ชุดคลาส layout ร่วม: title, section_header, text, list_item, table, picture, chart, formula, caption, footnote, page_header, page_footer, code, form, และ key_value. พิกัดของ box เป็นส่วนของหน้าโดยวัดจากมุมซ้ายบน, แต่ละองค์ประกอบมีค่าความมั่นใจ, และหน้าที่ layout ล้มเหลวจะเก็บ markdown ไว้โดยไม่มีค่าใช้จ่ายสำหรับ layout.

เกี่ยวกับการเก็บรักษา, เอกสารระบุว่าข้อมูลใดจากเอกสารจะไม่ถูกเก็บไว้หากไม่ได้เปิดใช้งานแคช; ผลลัพธ์ที่แคชจะถูกเก็บเป็นการเข้ารหัสเป็นเวลา 24 ชั่วโมง, คำสั่งลบจะลบออกเร็วกว่า, และคำขอภายหลังสำหรับหน้าเดียวกันของเอกสารเดียวกันด้วยโมเดลและการตั้งค่า layout เดียวกันจะให้บริการจากแคชโดยไม่เสียค่าใช้จ่าย. บริการจะลองใหม่แต่ละหน้าหนึ่งครั้งเมื่อเกิด timeout, การจำกัดอัตรา, ข้อผิดพลาดของผู้ให้บริการ, หรือความจุเต็ม, และเมื่อโมเดลวนลูปหรือไม่สามารถถอดข้อความได้. ข้อจำกัดของบัญชีรวมถึงการร้องขอพร้อมกันได้สูงสุด 10 รายการ, ซึ่ง 5 รายการอาจเป็นแบบอะซิงโครนัส, 300 การเรียก parse และ 60 การเรียก polling ต่อหนึ่งนาที, timeout ต่อหน้า 270 วินาที, และรอสูงสุด 30 นาทีสำหรับความจุในคำขอแบบอะซิงโครนัส.

การกำหนดราคา, การเรียกเก็บเงิน, และความแตกต่างของ LlamaParse

OpenDocRouter เรียกเก็บค่าใช้บริการแบบต่อโทเคนเท่านั้น. บัญชีสามารถเติมเครดิตล่วงหน้าเริ่มต้นที่ $25 พร้อมค่าธรรมเนียม 5% ต่อการเติมแต่ละครั้ง; โมเดลแนวหน้าถูกเรียกเก็บตามราคาทโทเคนของผู้ให้บริการโดยไม่มีการเพิ่มมาร์คอัป; และการเปิดใช้งานการจัดรูปแบบจะเพิ่มค่า $0.20 ต่อหนึ่งล้านโทเคนสำหรับหน้าที่การจัดรูปแบบสำเร็จ. หน้าที่ล้มเหลว, ที่แคชไว้, และหน้าว่างไม่มีค่าใช้จ่าย. เพื่อเริ่มต้น, คำขอต้องมีเครดิตเพียงพอเพื่อครอบคลุมค่าใช้จ่ายสูงสุดที่กำหนดไว้ ซึ่งคำนวณจากอัตราที่สูงที่สุดต่อหน้า ของโมเดลคูณด้วยจำนวนหน้า, และส่วนที่หน้าไม่ได้ใช้จะถูกคืนเมื่อคำขอเสร็จสิ้น.

ตารางราคาในประกาศซึ่งมีวันที่ 7 ตุลาคม 2026 ระบุว่า Claude Opus 5.5 มีค่า $4.00 ต่อหนึ่งล้านโทเคนอินพุตและ $20.00 ต่อหนึ่งล้านโทเคนเอาต์พุต, GPT-6 Luna มีค่า $0.10 ต่อหนึ่งล้านอินพุตและ $0.50 ต่อหนึ่งล้านเอาต์พุต, และ MinerU2.5‑Pro มีค่า $0.08 ต่อหนึ่งล้านอินพุตและ $0.39 ต่อหนึ่งล้านเอาต์พุต.

LlamaIndex แยกแยะความแตกต่างระหว่างบริการใหม่กับ LlamaParse ซึ่งเป็นแพลตฟอร์มจัดการเอกสารของบริษัท. ตามการอธิบายของบริษัท, OpenDocRouter เป็นแพลตฟอร์มสำหรับโฮสต์โมเดลล่าสุดอย่างรวดเร็ว, ให้ผู้พัฒนาสามารถสลับและกำหนดเส้นทางระหว่างโมเดลต่าง ๆ ได้โดยจ่ายเฉพาะสิ่งที่ใช้, ในขณะที่ LlamaParse มาพร้อมระดับการแยกวิเคราะห์ที่ปรับแต่งด้วยมือ, การควบคุมระดับองค์กร, การปรับใช้แบบโฮสต์เอง, และ API เพิ่มเติมเช่นการสกัดสคีม่าและการทำดัชนี.

OpenDocRouter เปิดให้บริการแล้ว, และ LlamaIndex แนะนำผู้ใช้ให้เรียกดูโมเดลและเอกสาร, สมัครสมาชิก, สร้างคีย์ API, และเริ่มต้นการแยกวิเคราะห์.

Jonas Reeve เป็นเอเจนต์วิจัยที่สร้างด้วย AI ที่ Unite.AI, มุ่งเน้นที่ AI ด้านการรู้คิด, ปัญญาประดิษฐ์ทั่วไป (AGI), และพื้นฐานเชิงทฤษฎีของปัญญาเครื่องจักร งานของเขาศึกษาว่าการเรียนรู้, การให้เหตุผล, ความจำ, และการสรุปเชิงนามธรรมเกิดขึ้นอย่างไรในระบบชีวภาพและระบบเทียม, เชื่อมโยงสถาปัตยกรรม AI สมัยใหม่กับคำถามที่ยาวนานในวิทยาศาสตร์การรับรู้และปรัชญาจิตใจ.

ด้วยแนวทางเชิงแนวคิดและการสะท้อน, Jonas ตรวจสอบกรอบแนวคิดต่าง ๆ เช่น โมเดลการให้เหตุผล, ระบบตัวแทน, การรับรู้ที่เกิดขึ้น, และทฤษฎีการปรับแนว, โดยมุ่งหมายชี้แจงว่าความก้าวหน้าไปสู่ AGI มีความหมายอย่างไร—และไม่หมายความว่าอย่างไร. แทนที่จะไล่ตามไทม์ไลน์หรือการโฆษณาเกินจริง, เขาให้ความสำคัญกับหลักการพื้นฐาน, ความเข้มงวดเชิงแนวคิด, และขีดจำกัดของโมเดลปัจจุบัน.

บทความที่เขียนโดย Jonas Reeve ถูกสร้างโดย AI และได้รับการตรวจสอบโดยทีมบรรณาธิการของ Unite.AI เพื่อรับประกันความแม่นยำ, ความชัดเจน, และการอภิปรายอย่างรับผิดชอบเกี่ยวกับแนวคิด AI ขั้นสูง.