พื้นฐาน AI

การค้นหาแบบเวกเตอร์คล้ายคลึงคืออะไรและทำงานอย่างไร?

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

การค้นหาแบบเวกเตอร์คล้ายคลึง ค้นหารายการที่การแสดงผลเชิงตัวเลขอยู่ใกล้กับเวกเตอร์คำค้นตามฟังก์ชันระยะห่างหรือความคล้ายคลึงที่เลือก โมเดลการฝัง (embedding) จะแมปข้อความ ภาพ เสียง ผลิตภัณฑ์ หรือผู้ใช้เป็นเวกเตอร์ เพื่อให้รายการที่เกี่ยวข้องอยู่ในพื้นที่แสดงผลที่อยู่ใกล้กัน

ดัชนีการค้นหาไม่สามารถเข้าใจความคล้ายคลึงโดยอิสระจากการฝังและเมตริก หากการแสดงผลเข้ารหัสแนวคิดความเกี่ยวข้องที่ไม่ถูกต้อง อัลกอริธึมการค้นหาเพื่อนบ้านใกล้ที่สุดที่เร็วจะคืนผลลัพธ์ที่ไม่ถูกต้องอย่างมีประสิทธิภาพ

ประเด็นสำคัญ

  • โมเดลการฝัง, การเตรียมข้อมูลล่วงหน้าและเมตริกระยะห่างกำหนดว่าความใกล้หมายถึงอะไร
  • การค้นหา k‑nearest‑neighbor อย่างแม่นยำสแกนทุกผู้สมัคร; ดัชนีแบบประมาณแลกเปลี่ยนการเรียกคืนบางส่วนเพื่อความเร็วและหน่วยความจำ
  • HNSW, ดัชนีไฟล์กลับและการควอนติฟายผลิตภัณฑ์เสนอการแลกเปลี่ยนที่แตกต่างกันระหว่างการสร้าง, การสอบถามและการอัปเดต
  • การกรองเมตาดาต้า, การดึงข้อมูลแบบไฮบริดและการจัดอันดับใหม่เป็นส่วนหนึ่งของระบบ ไม่ใช่สิ่งที่เพิ่มเข้ามาหลังจากนั้น
What is Vector Similarity Search and How Does It Work? diagram showing content, embed, index, search, filter + rerank, results
คุณภาพการดึงข้อมูลมาจากการฝัง, เมตริก, ดัชนี, ตัวกรองและการประเมินที่ทำงานเป็นระบบเดียวกัน

การฝังและเมตริกความคล้ายคลึง

Transformer หรือตัวเข้ารหัสอื่นจะเปลี่ยนรายการเป็นเวกเตอร์ความยาวคงที่ ความคล้ายคลึงแบบโคไซน์เปรียบเทียบมุม, ผลคูณจุดรวมทิศทางและขนาด, และระยะทางยูคลิดวัดระยะห่างเป็นเส้นตรง

การทำให้เป็นมาตรฐานสามารถทำให้การจัดอันดับด้วยความคล้ายคลึงแบบโคไซน์และผลคูณจุดเทียบเท่ากัน เมตริกที่ใช้ฝึกการฝังควรสอดคล้องกับการดึงข้อมูล ประเมินความเกี่ยวข้องเฉพาะโดเมนเนื่องจากความคล้ายคลึงเชิงความหมาย, ความสามารถทดแทนและความชอบของผู้ใช้เป็นเป้าหมายที่ต่างกัน

การค้นหาแบบแม่นยำกับแบบประมาณ

การค้นหาแบบแม่นยำคำนวณความคล้ายคลึงกับทุกเวกเตอร์ที่มีคุณสมบัติเหมาะสมและคืนผู้สมัครที่ใกล้ที่สุดจริง มันง่ายและแม่นยำแต่ค่าใช้จ่ายเพิ่มขึ้นเมื่อจำนวนคอลเลกชัน, มิติ หรืออัตราคำค้นเพิ่มขึ้น

ดัชนีการค้นหาเพื่อนบ้านใกล้ที่สุดแบบประมาณ (ANN) ตรวจสอบชุดผู้สมัครที่เล็กลง วัด recall@k เทียบกับผลลัพธ์จริงพร้อมกับความหน่วง, อัตราผ่านและหน่วยความจำ คำว่า “ประมาณ” อธิบายอัลกอริธึมการค้นหา ไม่ได้บ่งบอกว่าการฝังเองถูกต้องหรือไม่

HNSW, ไฟล์กลับและการบีบอัด

กราฟ Hierarchical Navigable Small World (HNSW) เชื่อมต่อเวกเตอร์ในหลายชั้น คำค้นจะลงจากลิงก์ระยะไกลแบบกระจายไปสู่ลิงก์ท้องถิ่นที่หนาแน่น ความกว้างของการค้นหาควบคุมการแลกเปลี่ยนระหว่างการเรียกคืนและความหน่วง ในขณะที่การสร้างกราฟและการอัปเดตใช้หน่วยความจำ

ดัชนีไฟล์กลับใช้การจัดกลุ่มหยาบ—มักเกี่ยวข้องกับ K‑means—เพื่อค้นหาภายในพื้นที่ที่เลือก การควอนติฟายผลิตภัณฑ์บีบอัดซับสเปซของเวกเตอร์ ลดการใช้หน่วยความจำแต่เพิ่มความคลาดเคลื่อนของระยะทาง Faiss รวมเทคนิคหลายอย่างเข้าด้วยกัน

การกรอง, การดึงข้อมูลแบบไฮบริดและการจัดอันดับใหม่

คำค้นจริงมักต้องการตัวกรองตามผู้เช่า, ภาษา, วันที่, สิทธิ์หรือผลิตภัณฑ์ การกรองล่วงหน้าสามารถทำให้จำนวนผู้สมัครในกราฟน้อยเกินไป; การกรองภายหลังอาจทำให้การดึงข้อมูลเสียเปล่า แผนดัชนีและการสอบถามควรทดสอบด้วยความเลือกของตัวกรองที่เป็นจริง

การค้นหาแบบไฮบริดผสานการจับคู่เชิงอักษรกับความคล้ายคลึงแบบเวกเตอร์ ทำให้ชื่อที่แม่นยำและความหมายเชิงความหมายมีส่วนร่วม ตัวจัดอันดับใหม่สามารถใช้ cross‑encoder ที่มีค่าใช้จ่ายสูงหรือกฎทางธุรกิจกับผู้สมัครระดับบนสุด รักษาการตรวจสอบสิทธิ์ผ่านทุกขั้นตอน

การประเมิน, การอัปเดตและการเปลี่ยนแปลง

ใช้การตัดสินความเกี่ยวข้องที่มีป้ายกำกับหรือความสำเร็จของงานต่อเนื่อง ไม่ใช่เพียงคลัสเตอร์ภาพเท่านั้น ติดตาม recall, precision, normalized discounted cumulative gain, ค่าร้อยละของความหน่วง, หน่วยความจำ, เวลาในการสร้างดัชนีและความสดใหม่

การอัปเกรดโมเดลการฝังต้องทำการฝังใหม่และอาจย้ายทุกจุด เวกเตอร์เวอร์ชันและดัชนีสนับสนุนการย้ายแบบรันคู่และตรวจสอบการเปลี่ยนแปลงของคำค้น/ประชากร การลดมิติสามารถช่วยการมองเห็นแต่อาจบิดเบือนเพื่อนบ้านและไม่ควรสับสนกับการประเมินการดึงข้อมูล

การฝัง, เมตริกและโครงสร้างดัชนี

การค้นหาแบบเวกเตอร์คล้ายคลึงจะแสดงรายการเป็นการฝังเชิงตัวเลขและดึงเวกเตอร์ที่อยู่ใกล้กับคำค้นตามเมตริกเช่นความคล้ายคลึงแบบโคไซน์, ผลคูณจุด, หรือระยะทางยูคลิด โมเดลการฝังกำหนดว่าความใกล้หมายถึงอะไร; ดัชนีเพียงเร่งความเร็วของเรขาคณิตนั้น ปรับให้เวกเตอร์เป็นมาตรฐานเมื่อจำเป็น, รักษาเวอร์ชันของโมเดลและการเตรียมข้อมูลล่วงหน้า, และอย่าเปรียบเทียบระยะทางจากพื้นที่การฝังที่ไม่เข้ากัน โมเดลที่แข็งแกร่งสำหรับความหมายทั่วไปอาจล้มเหลวในเรื่องความเข้ากันของผลิตภัณฑ์, การอ้างอิงทางกฎหมาย, ภาพ, โค้ด, หรือคำศัพท์หลายภาษา หากไม่มีการประเมินตามโดเมน

การค้นหาแบบแม่นยำเปรียบเทียบทุกเวกเตอร์และง่ายแต่มีค่าใช้จ่ายสูงเมื่อขยายขนาด วิธีการค้นหาเพื่อนบ้านใกล้ที่สุดแบบประมาณแลกเปลี่ยนการเรียกคืนเพื่อความเร็วและหน่วยความจำ ดัชนีกราฟเช่น HNSW นำทางเพื่อนบ้านที่เชื่อมต่อ; วิธีไฟล์กลับแบ่งเวกเตอร์เป็นเซลล์หยาบ; การควอนติฟายผลิตภัณฑ์บีบอัดเวกเตอร์; วิธีที่อิงดิสก์แลกเปลี่ยนการจัดเก็บและความหน่วง พารามิเตอร์ในช่วงเวลาการสร้าง, การสอบถามและหน่วยความจำทำงานร่วมกัน ทำการทดสอบเปรียบเทียบบนจำนวนเวกเตอร์, มิติ, การอัปเดต, ตัวกรอง, ความพร้อมทำงานพร้อมกันและฮาร์ดแวร์ที่คล้ายการผลิต

คุณภาพการดึงข้อมูลและการค้นหาแบบไฮบริด

สร้างชุดคำถามที่มีการประเมินด้วยรายการที่เกี่ยวข้องและไม่เกี่ยวข้อง รวมถึงคำที่หายาก, ความคลุมเครือ, ข้อความยาว, ภาษาและความสดใหม่ วัด recall@k, precision@k, mean reciprocal rank, normalized discounted gain, ความหน่วงและต้นทุน แยกวัดการเรียกคืน ANN เทียบกับเพื่อนบ้านที่แม่นยำและความเกี่ยวข้องเชิงความหมายเทียบกับการตัดสินของมนุษย์ ดัชนีที่เร็วสามารถดึงรายการที่คณิตศาสตร์ใกล้ที่สุดแต่ผิดพลาดได้หากการฝังมีคุณภาพต่ำ

การค้นหาด้วยคีย์เวิร์ดยังคงมีประสิทธิภาพสำหรับชื่อที่แม่นยำ, ตัวระบุ, วันที่และโทเคนที่หายาก การดึงข้อมูลแบบไฮบริดผสานการจัดอันดับเชิงอักษรและเวกเตอร์ ในขณะที่ตัวกรองเมตาดาต้าบังคับใช้ผู้เช่า, สิทธิ์, ภาษา, วันที่และประเภท ใช้การตรวจสอบสิทธิ์ก่อนส่งคืนหรือสร้างจากผลลัพธ์; การกรองหลังการดึงข้อมูลอาจทำให้รั่วข้อมูลว่ามีหรือไม่มีเนื้อหา ตัวจัดอันดับใหม่ช่วยปรับปรุง precision แม้เพิ่มความหน่วง การแบ่งส่วนควรสอดคล้องกับโครงสร้างเอกสารและรักษาแหล่งที่มา, เวอร์ชันและตำแหน่งออฟเซ็ตสำหรับการอ้างอิง

วงจรชีวิตการผลิต

การอัปเดตต้องการ ID ที่กำหนดได้อย่างชัดเจน, การกระจายการลบ, tombstones หรือการบีบอัด, และกลยุทธ์สำหรับการฝังใหม่หลังจากเปลี่ยนโมเดล ไม่ควรผสมการฝังเก่าและใหม่โดยไม่แจ้ง; สร้างดัชนีใหม่หรือเวอร์ชันและเปรียบเทียบแบบออฟไลน์ก่อนการเปลี่ยนแปลง ตรวจสอบการกระจายของคำค้นและผลลัพธ์, การค้นหาที่ว่างเปล่าและคะแนนต่ำ, ความหน่วง, สภาพดัชนี, และข้อเสนอแนะที่ประเมิน ปกป้องการฝังเพราะอาจบันทึกข้อมูลที่ละเอียดอ่อนและทำให้สามารถสรุปได้ การค้นหาแบบเวกเตอร์เป็นโครงสร้างพื้นฐานการดึงข้อมูล ไม่ได้รับประกันความเป็นจริง; ระบบต่อเนื่องต้องรักษาหลักฐานและหลีกเลี่ยงเมื่อการสนับสนุนไม่เพียงพอ

ตัวอย่างการทำงาน: การดึงข้อมูลเวกเตอร์ที่รับรู้สิทธิ์

องค์กรหนึ่งแบ่งคู่มือเป็นส่วน ๆ, ฝังด้วยโมเดลที่มีเวอร์ชัน, และเก็บ ID ของเอกสาร, สิทธิ์, ภาษา, เวอร์ชันและออฟเซ็ต ชุดคำถามที่ประเมินเปรียบเทียบการดึงข้อมูลเชิงอักษร, เวกเตอร์, ไฮบริดและการจัดอันดับใหม่ การประเมินวัด recall และ precision ที่ k, ความครอบคลุมของการอ้างอิง, ความหน่วง, ต้นทุน, และผลลัพธ์สำหรับหมายเลขชิ้นส่วนที่แม่นยำและคำศัพท์หลายภาษา การเรียกคืน ANN จะตรวจสอบแยกจากเพื่อนบ้านเวกเตอร์ที่แม่นยำ

ในช่วงเวลาคำค้น ตัวกรองสิทธิ์จะคัดกรองผู้สมัครก่อนที่เนื้อหาจะถูกส่งคืน การค้นหาที่ได้คะแนนต่ำจะหลีกเลี่ยง, และชั้นคำตอบจะอ้างอิงส่วนของแหล่งที่มาและระบุความขัดแย้ง การฝังใหม่สร้างดัชนีใหม่แทนการผสมเวอร์ชันของเวกเตอร์, และเหตุการณ์การลบจะลบแหล่งที่มา, ชิ้นส่วนและแคช การตรวจสอบติดตามคำค้นที่ว่างเปล่า, การกระจายของคะแนนและความหน่วง, การปฏิเสธสิทธิ์, และความเกี่ยวข้องที่ตรวจสอบแล้ว การฝังได้รับการปกป้องเป็นข้อมูลที่ได้จากการแปลงที่ละเอียดอ่อน ความคล้ายคลึงดึงหลักฐาน; แต่ไม่ได้ยืนยันว่าหลักฐานนั้นเป็นจริงหรือใช้ได้

หลักฐานการนำไปใช้และความพร้อมในการปฏิบัติการ

การตัดสินใจในระดับการผลิตต้องการมากกว่าการสาธิตที่ประสบความสำเร็จ กำหนดผู้ใช้เป้าหมาย, สภาพแวดล้อมการทำงาน, อินพุต, เอาต์พุต, การพึ่งพา, เจ้าของ, และผลของความล้มเหลวที่สำคัญแต่ละประการ สร้างฐานข้อมูลที่ทำซ้ำได้และชุดการประเมินที่มีเวอร์ชันก่อนการปรับแต่ง ทดสอบกรณีทั่วไป, เงื่อนไขขอบเขต, อินพุตที่ผิดรูปหรือขาดหาย, การเปลี่ยนแปลงการกระจาย, การหยุดทำงานของการพึ่งพา, การใช้งานผิดวิธี, และกลุ่มหรือสภาพแวดล้อมที่อาจไม่ได้รับการสนับสนุนอย่างเพียงพอ วัดคุณภาพงานพร้อมกับการปรับเทียบหรือความไม่แน่นอน, ความหน่วง, อัตราผ่าน, ต้นทุนทรัพยากร, การเข้าถึง, ความเป็นส่วนตัวและความปลอดภัย บันทึกการแปลงและเกณฑ์ทุกขั้นตอนเพื่อให้ผู้ตรวจสอบอิสระสามารถทำซ้ำผลลัพธ์และแยกแยะหลักฐานจากต้นแบบที่ดึงดูด

ก่อนการเปิดใช้งาน กำหนดอำนาจสำหรับการปล่อย, ข้อยกเว้น, การเปลี่ยนแปลง, การย้อนกลับและการยกเลิก ใช้การเปิดใช้งานแบบขั้นตอน, รักษาการสำรองที่ปลอดภัย, และตรวจสอบการเฝ้าระวังด้วยความล้มเหลวที่ใส่เข้ามาโดยเจตนา โทรเมตรีการปฏิบัติงานควรเปิดเผยคุณภาพอินพุต, พฤติกรรมเอาต์พุต, เวอร์ชันของโมเดลหรือกฎ, สภาพการพึ่งพา, การแทรกแซงของมนุษย์, และผลลัพธ์ที่ยืนยันโดยไม่เก็บข้อมูลละเอียดอ่อนที่ไม่จำเป็น กำหนดเกณฑ์การแจ้งเตือนและผู้รับผิดชอบการตอบสนอง, จากนั้นตรวจสอบหลักฐานจากโลกจริงหลังการปรับใช้แทนการสันนิษฐานว่าประสิทธิภาพออฟไลน์จะคงอยู่ ประเมินใหม่ทุกครั้งที่แหล่งข้อมูล, ผู้ใช้, โมเดล, ผู้จำหน่าย, นโยบาย, ฮาร์ดแวร์หรือเป้าหมายเปลี่ยน ระบบที่ดูแลต้องมีขั้นตอนการกู้คืนที่บันทึกไว้, การเรียนรู้จากเหตุการณ์, การลบและการเก็บรักษา, และจุดชัดเจนที่ควรปิดการทำงานหรือแทนที่

คำถามที่พบบ่อย

จำเป็นต้องใช้ฐานข้อมูลเวกเตอร์สำหรับการค้นหาแบบคล้ายคลึงหรือไม่?

ไม่ จำเป็นต้องใช้ฐานข้อมูลเวกเตอร์โดยเฉพาะ ไลบรารีและฐานข้อมูลเชิงสัมพันธ์สามารถรองรับดัชนีเวกเตอร์ได้ ฐานข้อมูลเฉพาะทางจะมีประโยชน์เมื่อขนาด, การกรอง, ความทนทานและคุณลักษณะการดำเนินงานตรงกับภาระงาน

การฝังที่มีมิติสูงกว่าจะให้ผลลัพธ์ที่ดีกว่าเสมอหรือไม่?

ไม่ การเพิ่มจำนวนมิติทำให้ค่าใช้จ่ายเพิ่มขึ้นและอาจบันทึกสัญญาณรบกวน เปรียบเทียบโมเดลโดยอิงคุณภาพการดึงข้อมูลที่เป็นตัวแทน, ความหน่วงและการจัดเก็บ

อ้างอิงหลัก

Haziqa เป็นนักวิทยาศาสตร์ข้อมูลที่มีประสบการณ์อย่างกว้างขวางในการเขียนเนื้อหาทางเทคนิคสำหรับบริษัท AI และ SaaS