สัมภาษณ์

แฟรงค์ หลิว ผู้อำนวยการฝ่ายปฏิบัติการของ Zilliz – ซีรีส์สัมภาษณ์

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

แฟรงค์ หลิว เป็นผู้อำนวยการฝ่ายปฏิบัติการของ Zilliz ซึ่งเป็นผู้ให้บริการชั้นนำด้านฐานข้อมูลเวกเตอร์และเทคโนโลยี AI พวกเขายังเป็นวิศวกรและนักวิทยาศาสตร์ที่สร้าง LF AI Milvus® ซึ่งเป็นฐานข้อมูลเวกเตอร์แบบเปิดที่ได้รับความนิยมมากที่สุดในโลก

สิ่งใดที่ดึงดูดคุณให้เข้าสู่เครื่องมือการเรียนรู้ของเครื่อง?

การได้รับประสบการณ์แรกเกี่ยวกับพลังของ ML/AI คือในช่วงเรียนปริญญาตรีที่ Stanford แม้ว่าจะไม่เกี่ยวข้องกับสาขาวิชาที่เรียน (วิศวกรรมไฟฟ้า) แต่ฉันถูกดึงดูดเข้าสู่สาขานี้เพราะความสามารถในการทำให้ระบบไฟฟ้าและฟิสิกส์ที่ซับซ้อนกลายเป็นแบบจำลองทางคณิตศาสตร์ที่มีพลัง และสถิติและการเรียนรู้ของเครื่องจักรก็เหมือนกัน ฉันจบปริญญาโทและเขียนวิทยานิพนธ์เกี่ยวกับการใช้ ML เพื่อประเมินความสวยงามของภาพ จากนั้นฉันเข้าทำงานที่ทีม Computer Vision & Machine Learning ของ Yahoo ซึ่งเป็นงานวิจัยและพัฒนาซอฟต์แวร์แบบผสมผสาน เรายังอยู่ในช่วงก่อนที่จะใช้เทคนิค Transformers AlexNet & VGG และได้เห็นฟิลด์และอุตสาหกรรมเติบโตอย่างรวดเร็ว ตั้งแต่การเตรียมข้อมูล การฝึกอบรมแบบขนานมาก ไปจนถึงการผลิตแบบจำลอง ซึ่งเป็นเรื่องที่น่าเหลือเชื่อ

หลังจากที่ทำงานที่ Yahoo ฉัน曾เป็น CTO ของสตาร์ทอัพที่ฉันร่วมก่อตั้ง ซึ่งเราใช้ ML สำหรับการระบุตำแหน่งภายในอาคาร ที่นั่น เราต้องปรับโมเดลแบบลำดับสำหรับไมโครคอนโทรลเลอร์ที่มีขนาดเล็กมาก ซึ่งเป็นความท้าทายด้านวิศวกรรมที่แตกต่างจาก LLMs และโมเดลการกระจายที่มีขนาดใหญ่ในปัจจุบัน เรายังสร้างฮาร์ดแวร์ ดาเชบอร์ดสำหรับการแสดงภาพ และแอปพลิเคชันคลาวด์แบบง่าย แต่ AI/ML เป็นส่วนสำคัญของงานที่เราทำ

แม้ว่าฉันจะอยู่ในหรือใกล้กับ ML มาเกือบ 7 หรือ 8 ปีแล้ว แต่ฉันยังคงรักการออกแบบวงจรและตรรกะดิจิทัล การมีพื้นฐานมาจากวิศวกรรมไฟฟ้าเป็นประโยชน์อย่างมากสำหรับงานที่ฉันทำในปัจจุบัน ความเข้าใจเกี่ยวกับแนวคิดสำคัญในดิจิทัลดีไซน์ เช่น เมมโมรี่เสมือน การคาดการณ์สาขา และการดำเนินการแบบขนานใน HDL ช่วยให้เห็นภาพรวมของ ML และระบบกระจายที่ฉันทำงานด้วย

สำหรับผู้ที่ไม่คุ้นเคยกับคำว่า “ข้อมูลที่ไม่มีโครงสร้าง” คืออะไร?

ข้อมูลที่ไม่มีโครงสร้างหมายถึง “ข้อมูลที่ซับซ้อน” ซึ่งเป็นข้อมูลที่ไม่สามารถเก็บไว้ในรูปแบบที่กำหนดไว้ล่วงหน้าหรือไม่สามารถเข้ากับโมเดลข้อมูลที่มีอยู่ได้ ข้อมูลที่มีโครงสร้างหมายถึงข้อมูลที่มีโครงสร้างที่กำหนดไว้ล่วงหน้า เช่น ข้อมูลตัวเลข, สตริง, ตาราง, วัตถุ, และคีย์/วาลูสโตร์ เป็นต้น

เพื่อให้เข้าใจข้อมูลที่ไม่มีโครงสร้างและความท้าทายในการประมวลผลข้อมูลประเภทนี้ ควรเปรียบเทียบกับข้อมูลที่มีโครงสร้าง ข้อมูลที่มีโครงสร้างสามารถเก็บไว้ในรูปแบบแบบเรลเชชันแนลได้ ตัวอย่างเช่น ฐานข้อมูลที่มีตารางสำหรับเก็บข้อมูลหนังสือ แต่ละแถวในตารางสามารถแสดงถึงหนังสือหนึ่งเล่มที่มี ISBN ที่เฉพาะเจาะจง และคอลัมน์จะแสดงถึงหมวดหมู่ข้อมูลที่เกี่ยวข้อง เช่น ชื่อหนังสือ, ผู้แต่ง, วันที่เผยแพร่ เป็นต้น

ข้อมูลที่ไม่มีโครงสร้างสามารถถือเป็น “ก้อนข้อมูลทวินามที่เป็นแบบสุ่ม” ได้ ซึ่งสามารถแสดงถึงอะไรได้ตามใจชอบ มีขนาดใหญ่หรือเล็กตามที่ต้องการ และสามารถถูกแปลงและอ่านได้ในรูปแบบต่างๆ ซึ่งทำให้ไม่สามารถเก็บไว้ในโมเดลข้อมูลใดๆ ได้

ตัวอย่างของข้อมูลประเภทนี้คืออะไร?

ข้อมูลที่สร้างโดยมนุษย์ เช่น ภาพ, วิดีโอ, เสียง, ภาษาธรรมชาติ เป็นต้น เป็นตัวอย่างของข้อมูลที่ไม่มีโครงสร้าง แต่ก็มีตัวอย่างอื่นๆ ที่น่าสนใจ เช่น ข้อมูลโปรไฟล์ผู้ใช้, โครงสร้างโปรตีน, ลำดับจีโนม, และแม้กระทั่งโค้ดที่อ่านได้โดยมนุษย์ สาเหตุหลักที่ข้อมูลที่ไม่มีโครงสร้างมักจะยากในการจัดการคือสามารถมีรูปแบบใดๆ ก็ได้ และอาจต้องใช้เวลาที่แตกต่างกันในการประมวลผล

การใช้ภาพเป็นตัวอย่าง ภาพสองภาพของฉากเดียวกันอาจมีค่าพิกเซลที่แตกต่างกัน แต่ทั้งสองภาพมีเนื้อหาที่คล้ายกัน ภาษาธรรมชาติยังเป็นตัวอย่างของข้อมูลที่ไม่มีโครงสร้างที่ฉันชอบอ้างถึง วลี “วิศวกรรมไฟฟ้า” และ “วิทยาการคอมพิวเตอร์” มีความเกี่ยวข้องอย่างใกล้ชิด แต่หากไม่มีวิธีการเข้ารหัสความหมายเชิงсемัน蒂คส์ให้กับวลีเหล่านี้ คอมพิวเตอร์อาจคิดว่า “วิทยาการคอมพิวเตอร์” และ “สังคมศาสตร์” มีความเกี่ยวข้องมากกว่า

ฐานข้อมูลเวกเตอร์คืออะไร?

เพื่อเข้าใจฐานข้อมูลเวกเตอร์ ก่อนอื่นควรเข้าใจก่อนว่า “การฝังตัว” (embedding) คืออะไร ซึ่งเป็นเวกเตอร์สูงมิติที่สามารถแสดงถึงความหมายเชิงсемัน蒂คส์ของข้อมูลที่ไม่มีโครงสร้าง โดยทั่วไปแล้ว การฝังตัวที่ใกล้กันในแง่ของระยะทางมักจะสอดคล้องกับข้อมูลที่มีความหมายเชิงсемัน蒂คส์ที่คล้ายกัน

ฐานข้อมูลเวกเตอร์ถูกออกแบบมาเพื่อจัดเก็บ, ดัชนี, และค้นหาข้อมูลที่ไม่มีโครงสร้างจำนวนมากโดยใช้การฝังตัวเป็นตัวแทน การค้นหาข้อมูลในฐานข้อมูลเวกเตอร์มักจะทำโดยใช้เวกเตอร์คำถาม และผลลัพธ์ของการค้นหาคือผลลัพธ์ที่คล้ายกันที่สุด N รายการตามระยะทาง

ฐานข้อมูลเวกเตอร์ที่ดีที่สุดมีคุณสมบัติความสามารถใช้งานที่คล้ายกับฐานข้อมูลแบบเรลเชชันแนล เช่น การขยายขนาดแบบแนวนอน, การแคช, การทำซ้ำ, การล้มเหลว, และการดำเนินการคำถาม เป็นต้น ในฐานะผู้กำหนดประเภท เราได้เข้าร่วมในวงการวิชาการและได้ตีพิมพ์งานวิจัยใน SIGMOD 2021 และ VLDB 2022 ซึ่งเป็นสองการประชุมฐานข้อมูลชั้นนำ

คุณสามารถอธิบายเกี่ยวกับการฝังตัวได้หรือไม่?

โดยทั่วไปแล้ว การฝังตัวเป็นเวกเตอร์สูงมิติที่มาจากการกระตุ้นของชั้นกลางในเครือข่ายนิวรัลหลายชั้น การฝังตัวสามารถสร้างได้จากโมเดล ML ที่ฝึกอบรมมาหรือจากคุณลักษณะที่สร้างขึ้นโดยตรง การฝังตัวที่มีความหมายเชิงсемัน蒂คส์ที่คล้ายกันจะอยู่ใกล้กันในแง่ของระยะทาง และคุณสมบัตินี้เป็นพลังที่ขับเคลื่อนฐานข้อมูลเวกเตอร์

ตัวอย่างการใช้งานที่นิยมของเทคโนโลยีนี้คืออะไร?

ฐานข้อมูลเวกเตอร์เหมาะสำหรับการใช้งานใดๆ ที่ต้องการการค้นหาสมองเซมัน蒂คส์ เช่น การแนะนำผลิตภัณฑ์, การวิเคราะห์วิดีโอ, การค้นหาดокумент, การตรวจจับภัยคุกคามและการฉ้อโกง, และแชทบอทที่ใช้ AI เป็นต้น เพื่ออธิบายให้เห็นภาพชัดเจนยิ่งขึ้น Milvus ซึ่งเป็นฐานข้อมูลเวกเตอร์แบบเปิดที่สร้างโดย Zilliz และเป็นแก่นกลางของ Zilliz Cloud ได้ถูกใช้โดยผู้ใช้ระดับองค์กรมากกว่า 1,000 รายในหลายๆ การใช้งาน

ฉันชอบพูดคุยเกี่ยวกับการใช้งานเหล่านี้และช่วยให้คนเข้าใจว่ามันทำงานอย่างไร แต่ฉันก็ชอบพูดถึงการใช้งานฐานข้อมูลเวกเตอร์ที่ไม่ค่อยเป็นที่รู้จักเช่นกัน การค้นหายาใหม่คือหนึ่งในตัวอย่างที่ฉันชอบพูดถึงมากที่สุด การท้าทายสำหรับการใช้งานนี้คือการค้นหายา候補ที่มีศักยภาพในการรักษาโรคหรืออาการใดๆ ในฐานข้อมูลที่มี化合物มากกว่า 800 ล้านชนิด

อีกตัวอย่างหนึ่งที่ฉันชอบพูดถึงคือ AI ArtLens ของ Cleveland Museum of Art (CMA) ซึ่งเป็นเครื่องมืออินเทอร์แอคทีฟที่รับภาพเป็นคำถามและดึงภาพที่คล้ายกันออกมาจากฐานข้อมูลของพิพิธภัณฑ์ ซึ่งเป็นตัวอย่างของการค้นหาสมองเซมัน蒂คส์แบบย้อนกลับ และเป็นการใช้งานที่พบบ่อยสำหรับฐานข้อมูลเวกเตอร์

คุณสามารถพูดถึงแพลตฟอร์มแบบเปิด Towhee ได้หรือไม่?

เมื่อเราได้พูดคุยกับคนในุมชน Milvus เราพบว่าหลายคนต้องการวิธีการสร้างการฝังตัวสำหรับ Milvus ในรูปแบบที่เป็นเอกภาพ ด้วย Towhee เราตั้งเป้าที่จะแก้ไขช่องว่างนี้ผ่าน “การถ่ายโอนข้อมูลเวกเตอร์” (vector data ETL) ในขณะที่การถ่ายโอนข้อมูลแบบดั้งเดิมมุ่งเน้นไปที่การรวมและแปลงข้อมูลที่มีโครงสร้างจากแหล่งต่างๆ ให้กลายเป็นรูปแบบที่ใช้งานได้ Towhee มีจุดมุ่งหมายเพื่อทำงานกับข้อมูลที่ไม่มีโครงสร้างและรวม ML เข้ากับการถ่ายโอนข้อมูล

แม้ว่า Towhee จะเป็นโครงการอิสระ แต่ก็เป็นส่วนหนึ่งของระบบนิเวศฐานข้อมูลเวกเตอร์ที่กว้างขึ้นซึ่ง Zilliz กำลังสร้างขึ้นโดยมี Milvus เป็นศูนย์กลาง เราเห็น Milvus และ Towhee เป็นสองโครงการที่เสริมกันซึ่งเมื่อใช้ร่วมกันสามารถทำให้การประมวลผลข้อมูลที่ไม่มีโครงสร้างเป็นประชาธิปไตยได้จริงๆ

Zilliz เพิ่งได้รับการสนับสนุน 60 ล้านดอลลาร์ ในรอบ Series B จะเร่งรัดภารกิจของ Zilliz อย่างไร?

ก่อนอื่น ฉันอยากจะขอบคุณ Prosperity7 Ventures, Pavilion Capital, Hillhouse Capital, 5Y Capital, Yunqi Capital และผู้สนับสนุนอื่นๆ ที่เชื่อมั่นในภารกิจของ Zilliz และให้การสนับสนุนเราในรอบ Series B นี้ เราได้ระดมทุนรวมแล้ว 113 ล้านดอลลาร์ และการสนับสนุนรอบนี้จะช่วยให้เราขยายทีมวิศวกรรมและทีมการตลาดของเรา

มีอะไรอีกไหมที่คุณต้องการแบ่งปันเกี่ยวกับ Zilliz?

ในฐานะบริษัท เรากำลังเติบโตอย่างรวดเร็ว แต่สิ่งที่ทำให้ทีมของเราต่างจากคนอื่นๆ ในอุตสาหกรรมฐานข้อมูลและ ML คือความหลงใหลที่แท้จริงต่อสิ่งที่เรากำลังสร้าง เรามีภารกิจที่จะทำให้การประมวลผลข้อมูลที่ไม่มีโครงสร้างเป็นประชาธิปไตย และเป็นเรื่องที่น่าเหลือเชื่อที่ได้เห็นคนเก่งๆ มากมายที่ Zilliz ทำงานเพื่อเป้าหมายเดียวกัน

หากคุณสนใจที่จะรู้เพิ่มเติม ฉันยังเปิดให้พูดคุยเกี่ยวกับ Zilliz, ฐานข้อมูลเวกเตอร์, หรือความก้าวหน้าในการฝังตัวใน AI/ML อยู่เสมอ คุณสามารถติดต่อฉันโดยตรงผ่าน Twitter/LinkedIn ได้

สุดท้าย ขอขอบคุณที่อ่าน!

ขอขอบคุณสำหรับการสัมภาษณ์ที่ยอดเยี่ยม ผู้อ่านสามารถเยี่ยมชม Zilliz เพื่อเรียนรู้เพิ่มเติม

อองตวนเป็นผู้นำที่มีวิสัยทัศน์และเป็นหุ้นส่วนผู้ก่อตั้งของ Unite.AI โดยมีความหลงใหลที่ไม่สั่นคลอนในการ塑造และ推廣อนาคตของ AI และหุ่นยนต์ เขาเป็นผู้ประกอบการซีรีย์ที่เชื่อว่า AI จะมีผลกระทบต่อสังคมมากเท่ากับไฟฟ้า และมักจะพูดถึงศักยภาพของเทคโนโลยีที่เป็นนวัตกรรมและ AGI

ในฐานะ นักอนาคต เขาได้ทำการสำรวจว่านวัตกรรมเหล่านี้จะเปลี่ยนแปลงโลกของเราอย่างไร นอกจากนี้เขายังเป็นผู้ก่อตั้ง Securities.io ซึ่งเป็นแพลตฟอร์มที่มุ่งเน้นในการลงทุนในเทคโนโลยีที่ทันสมัยที่สุดซึ่งกำลังเปลี่ยนแปลงอนาคตและเปลี่ยนแปลงอุตสาหกรรมทั้งหมด