โมเดลและแพลตฟอร์ม AI
การอ้างอิง: คุณสมบัติใหม่ของ Anthropic ช่วยแก้ปัญหาเรื่องความน่าเชื่อถือของ AI ได้หรือไม่?
การตรวจสอบความถูกต้องของ AI เป็นปัญหาที่รุนแรงมาเป็นเวลานานแล้ว ในขณะที่ โมเดลภาษาขนาดใหญ่ (LLMs) ได้พัฒนาอย่างรวดเร็ว แต่ความท้าทายในการพิสูจน์ความแม่นยำยังคงไม่ได้รับการแก้ไข
Anthropic กำลังพยายามแก้ปัญหานี้ และในบรรดบริษัท AI ใหญ่ๆ ฉันคิดว่าพวกเขามีโอกาสที่ดีที่สุด
บริษัทได้เปิดตัว Citations ซึ่งเป็นคุณสมบัติ API ใหม่สำหรับโมเดล Claude ที่เปลี่ยนแปลงวิธีการตรวจสอบความถูกต้องของระบบ AI คุณสมบัตินี้จะแบ่งเอกสารต้นฉบับออกเป็นชิ้นๆ ที่สามารถเข้าใจได้ และเชื่อมโยงคำสั่ง AI ที่สร้างขึ้นทุกคำกลับไปยังแหล่งที่มาเดิม – คล้ายกับวิธีการอ้างอิงในเอกสารวิชาการ
Citations พยายามแก้ปัญหาหนึ่งของ AI ที่ยังคง存在มาอย่างยาวนาน: การพิสูจน์ว่าเนื้อหาที่สร้างขึ้นมีความถูกต้องและน่าเชื่อถือ ไม่ต้องใช้เทคนิคการสร้างคำสั่งที่ซับซ้อนหรือการตรวจสอบด้วยตนเอง ระบบจะประมวลผลเอกสารและให้การยืนยันระดับประโยคสำหรับทุกคำสั่งที่ทำ
ข้อมูลแสดงผลลัพธ์ที่น่าสนใจ: การปรับปรุงความแม่นยำในการอ้างอิง 15% เมื่อเทียบกับวิธีการแบบดั้งเดิม
ทำไมสิ่งนี้จึงมีความสำคัญในขณะนี้
ความน่าเชื่อถือของ AI ได้กลายเป็นปัญหาที่สำคัญที่สุดต่อการนำไปใช้ในระดับองค์กร (เช่นเดียวกับการนำไปใช้ในระดับบุคคล) เมื่อองค์กรต่างๆ เคลื่อนจากการทดลอง AI ไปสู่การดำเนินงานหลัก ปัญหาในการตรวจสอบผลลัพธ์ของ AI ได้สร้างปัญหาที่สำคัญ
ระบบการตรวจสอบในปัจจุบันแสดงให้เห็นถึงปัญหา: องค์กรต่างๆ ต้องเลือกระหว่างความเร็วและความแม่นยำ การตรวจสอบด้วยตนเองไม่สามารถปรับขนาดได้ ในขณะที่ผลลัพธ์ของ AI ที่ไม่ได้รับการตรวจสอบมีความเสี่ยงสูง ปัญหานี้มีความรุนแรงมากขึ้นในอุตสาหกรรมที่มีการควบคุมที่ต้องการความแม่นยำ
การมาถึงของ Citations เกิดขึ้นในขณะสำคัญของการพัฒนา AI เมื่อโมเดลภาษาได้กลายเป็นระบบที่ซับซ้อนมากขึ้น ความต้องการระบบการตรวจสอบที่มีประสิทธิภาพจึงเพิ่มขึ้นตามไปด้วย เราต้องสร้างระบบที่สามารถใช้งานได้อย่างมั่นใจในสภาพแวดล้อมมืออาชีพที่ต้องการความแม่นยำ
การแบ่งบันโครงสร้างทางเทคนิค
ความพิเศษของ Citations อยู่ที่วิธีการประมวลผลเอกสาร คุณสมบัตินี้ไม่เหมือนกับระบบ AI แบบดั้งเดิมที่มักจะรับเอกสารเป็นบล็อกข้อความเท่านั้น Citations แบ่งเอกสารต้นฉบับออกเป็น “ชิ้นๆ” ซึ่งสามารถเป็นประโยคเดียวหรือส่วนของเอกสารที่ผู้ใช้กำหนดได้ ซึ่งสร้างรากฐานที่ละเอียดสำหรับการตรวจสอบ
นี่คือการแบ่งบันทางเทคนิค:
การประมวลผลเอกสารและการจัดการ
Citations ประมวลผลเอกสารต่างๆ ตามรูปแบบที่แตกต่างกัน สำหรับไฟล์ข้อความ ไม่มีข้อจำกัดเกินกว่า 200,000 โทเค็นสำหรับการร้องขอทั้งหมด ซึ่งรวมถึงบริบท คำสั่ง และเอกสารต้นฉบับ
การประมวลผล PDF มีความซับซ้อนมากกว่า ระบบประมวลผล PDF ด้วยการประมวลผลภาพ ไม่ใช่แค่ข้อความเท่านั้น ซึ่งนำไปสู่ข้อจำกัดบางประการ:
- ขนาดไฟล์ 32MB
- จำนวนหน้าสูงสุด 100 หน้าต่อเอกสาร
- แต่ละหน้าใช้ 1,500-3,000 โทเค็น
การบริหารโทเค็น
เมื่อทำงานกับ Citations คุณต้องคำนึงถึงงบประมาณโทเค็นของคุณอย่างรอบคอบ นี่คือวิธีการแบ่งบัน:
สำหรับข้อความมาตรฐาน:
- ขีดจำกัดการร้องขอทั้งหมด: 200,000 โทเค็น
- รวม: บริบท + คำสั่ง + เอกสาร
- ไม่มีค่าใช้จ่ายเพิ่มเติมสำหรับการออกผลลัพธ์
สำหรับ PDF:
- การบริโภคโทเค็นมากกว่าสำหรับแต่ละหน้า
- การประมวลผลภาพมีความซับซ้อน
- การคำนวณโทเค็นต้องมีความซับซ้อน
Citations vs RAG: ความแตกต่างหลัก
Citations ไม่ใช่ระบบ Retrieval Augmented Generation (RAG) – และความแตกต่างนี้มีความสำคัญ ในขณะที่ระบบ RAG มุ่งเน้นในการค้นหาข้อมูลที่เกี่ยวข้องจากฐานความรู้ Citations ทำงานกับข้อมูลที่คุณได้เลือกไว้แล้ว
คิดว่ามันเป็นเช่นนี้: RAG ตัดสินใจว่าจะใช้ข้อมูลอะไร ในขณะที่ Citations รับรองว่าข้อมูลนั้นถูกใช้อย่างถูกต้อง ซึ่งหมายความว่า:
- RAG: จัดการการค้นหาข้อมูล
- Citations: จัดการการยืนยันข้อมูล
- ศักยภาพในการทำงานร่วมกัน: ทั้งสองระบบสามารถทำงานร่วมกันได้
การออกแบบโครงสร้างนี้หมายความว่า Citations มีความแม่นยำสูงภายในบริบทที่ให้ไว้ ในขณะที่ปล่อยให้กลยุทธ์การค้นหาสำหรับระบบที่เสริม
การผสานรวมและการทำงาน
การกำหนดค่านั้นง่าย: Citations ใช้งานผ่าน API มาตรฐานของ Anthropic ซึ่งหมายความว่าหากคุณกำลังใช้ Claude อยู่แล้ว คุณก็พร้อมที่จะเริ่มต้นได้ ระบบนี้ผสานรวมกับ API ข้อความโดยตรง ซึ่งกำจัดความจำเป็นในการจัดเก็บไฟล์หรือการเปลี่ยนแปลงโครงสร้างพื้นฐานที่ซับซ้อน
โครงสร้างราคาเป็นไปตามรูปแบบโทเค็นของ Anthropic โดยมีข้อได้เปรียบที่สำคัญ: ในขณะที่คุณจ่ายสำหรับโทเค็นจากเอกสารต้นฉบับ ไม่มีค่าใช้จ่ายเพิ่มเติมสำหรับการออกผลลัพธ์ ซึ่งสร้างโครงสร้างต้นทุนที่คาดการณ์ได้ซึ่งปรับขนาดตามการใช้งาน
เมตริกการทำงานบอกเล่าเรื่องราวที่น่าสนใจ:
- การปรับปรุงความแม่นยำในการอ้างอิง 15%
- การกำจัดการหลอกลวงของแหล่งที่มา (จาก 10% เป็น 0)
- การยืนยันระดับประโยคสำหรับทุกคำสั่ง
องค์กร (และบุคคล) ที่ใช้ระบบ AI ที่ไม่ได้รับการตรวจสอบพบว่าตัวเองอยู่ในสถานการณ์ที่ไม่มีประโยชน์ โดยเฉพาะในอุตสาหกรรมที่มีการควบคุมหรือสภาพแวดล้อมที่มีความเสี่ยงสูงซึ่งความแม่นยำมีความสำคัญ
เมื่อมองไปข้างหน้า เราจะเห็น:
- การผสานรวมของคุณสมบัติ Citations ที่กลายเป็นมาตรฐาน
- การพัฒนาระบบการตรวจสอบที่ล้ำกว่าข้อความไปสู่สื่ออื่นๆ
- การสร้างมาตรฐานการตรวจสอบเฉพาะอุตสาหกรรม
อุตสาหกรรมทั้งหมดต้องคิดใหม่เกี่ยวกับความน่าเชื่อถือและระบบการตรวจสอบของ AI ผู้ใช้ต้องสามารถตรวจสอบทุกคำสั่งได้อย่างง่ายดาย












