ผู้นำทางความคิด

การเตรียมข้อมูลของมนุษย์สำหรับการเรียนรู้ของเครื่องจักรเป็นกระบวนการที่ต้องใช้ทรัพยากรมาก: วิธีการสองวิธีนี้มีความสำคัญต่อการลดต้นทุน

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

โดย: Dattaraj Rao, Chief Data Scientist, Persistent Systems

เช่นเดียวกับระบบใดๆ ที่พึ่งพาข้อมูลเข้า Machine Learning (ML) ต้องยอมรับหลักการ “ข้อมูลเข้าที่ไม่ดีจะทำให้ผลลัพธ์ไม่ดี” ข้อมูลที่สะอาดและได้รับการระบุฉลากอย่างถูกต้องเป็นรากฐานในการสร้างโมเดล ML ใดๆ อัลกอริธึมการฝึกอบรม ML จะเข้าใจรูปแบบจากข้อมูลที่ถูกต้องและเรียนรู้วิธีการทั่วไปสำหรับข้อมูลที่ไม่เคยเห็นมาก่อน หากคุณภาพของข้อมูลการฝึกอบรมของคุณต่ำ อัลกอริทึม ML จะยากที่จะเรียนรู้และขยายต่อไป

ลองนึกถึงการฝึกสุนัขเป็นตัวอย่าง หากคุณล้มเหลวในการฝึกสุนัขด้วยคำสั่งพื้นฐาน (ข้อมูลเข้า) หรือทำอย่างไม่ถูกต้อง/ไม่แม่นยำ คุณไม่สามารถคาดหวังให้สุนัขเรียนรู้และขยายตัวผ่านการสังเกตุไปสู่พฤติกรรมที่ดีขึ้นได้ การฝึกอบรมที่เหมาะสมต้องใช้เวลาและอาจมีค่าใช้จ่ายสูงหากคุณนำผู้เชี่ยวชาญมา แต่ผลตอบแทนจะดีหากคุณทำถูกตั้งแต่ต้น

เมื่อฝึกอบรมโมเดล ML การสร้างข้อมูลที่มีคุณภาพต้องใช้เวลาและความพยายามจากผู้เชี่ยวชาญด้านโดเมนในการระบุฉลากข้อมูล ซึ่งอาจรวมถึงการเลือกหน้าต่างที่มีวัตถุที่ต้องการในภาพหรือการกำหนดฉลากให้กับข้อความหรือบันทึกฐานข้อมูล โดยเฉพาะสำหรับข้อมูลที่ไม่มีโครงสร้าง เช่น ภาพ วิดีโอ และข้อความ คุณภาพของการระบุฉลากมีบทบาทสำคัญในการกำหนดคุณภาพของโมเดล โดยทั่วไป ข้อมูลที่ไม่มีฉลาก เช่น ภาพและข้อความดิบ มีมากมาย แต่การระบุฉลากเป็นส่วนที่ต้องได้รับการปรับปรุงมากที่สุด นี่คือส่วนของ “มนุษย์ในวงจร” ของวงจรชีวิต ML และโดยทั่วไปเป็นส่วนที่มีค่าใช้จ่ายสูงสุดและต้องใช้แรงงานมากที่สุดในโครงการ ML ใดๆ

เครื่องมือการระบุฉลากข้อมูล เช่น Prodigy, Amazon Sagemaker Ground Truth, NVIDIA RAPIDS และ DataRobot human-in-the-loop มีการปรับปรุงคุณภาพและให้อินเทอร์เฟซที่直观สำหรับผู้เชี่ยวชาญด้านโดเมน อย่างไรก็ตาม การลดเวลาในการระบุฉลากข้อมูลโดยผู้เชี่ยวชาญด้านโดเมนยังคงเป็นความท้าทายที่สำคัญสำหรับองค์กรในปัจจุบัน โดยเฉพาะในสถานการณ์ที่ทีมงานวิทยาศาสตร์ข้อมูลมีจำนวนจำกัด แต่มีความต้องการสูง นี่คือจุดที่วิธีการสองวิธีใหม่ในการเตรียมข้อมูลเข้ามาเล่น

การเรียนรู้เชิงรุก

การเรียนรู้เชิงรุกเป็นวิธีการที่โมเดล ML จะถามผู้เชี่ยวชาญด้านโดเมนเกี่ยวกับการระบุฉลากข้อมูลโดยเฉพาะ โดยไม่ต้องมีการระบุฉลากทั้งหมดให้กับข้อมูลที่ไม่มีฉลาก แต่เพียงแค่การระบุฉลากที่ถูกต้องให้กับจุดข้อมูลที่สำคัญเพื่อให้โมเดลสามารถเรียนรู้ได้ดีขึ้น ตัวอย่างเช่น ในสาขาเวชศาสตร์และวิทยาศาสตร์ชีวิต บริษัทที่เชี่ยวชาญในการวินิจฉัยโรคมะเร็งในระยะแรกเพื่อช่วยให้แพทย์สามารถตัดสินใจได้อย่างมีข้อมูล ในกระบวนการวินิจฉัย mereka cầnระบุฉลากภาพถ่าย CT Scan ที่มีเนื้องอก

หลังจากที่โมเดล ML เรียนรู้จากภาพหลายภาพที่มีเนื้องอกที่ถูกเน้น การเรียนรู้เชิงรุกจะทำให้โมเดลถามผู้ใช้เพียงการระบุฉลากภาพที่มีเนื้องอกที่ไม่แน่นอนเท่านั้น ซึ่งจะเป็นจุดข้อมูลที่สำคัญที่จะช่วยเพิ่มความมั่นใจของโมเดล เมื่อโมเดลมีความมั่นใจเกินเกณฑ์ที่กำหนด จะทำการระบุฉลากโดยอัตโนมัติแทนการถามผู้ใช้ นี่คือวิธีการที่การเรียนรู้เชิงรุกพยายามช่วยสร้างโมเดลที่แม่นยำโดยลดเวลาและความพยายามในการระบุฉลากข้อมูล Frameworks เช่น modAL สามารถช่วยเพิ่มประสิทธิภาพการจำแนกประเภทโดยการถามผู้เชี่ยวชาญด้านโดเมนเพื่อระบุฉลากตัวอย่างที่มีข้อมูลมากที่สุด

การดูแลที่อ่อนแอ

การดูแลที่อ่อนแอคือวิธีการที่ใช้ข้อมูลที่มีเสียงและไม่แม่นยำหรือแนวคิดที่เป็นนามธรรมเพื่อให้คำแนะนำในการระบุฉลากข้อมูลที่ไม่มีการดูแลมาก่อน วิธีการนี้โดยทั่วไปจะใช้การดูแลที่อ่อนแอและพยายามรวมเข้าด้วยกันในแนวทางแบบアンサンブルเพื่อสร้างข้อมูลที่มีการระบุฉลากที่มีคุณภาพ ความพยายามคือการพยายามรวมความรู้ด้านโดเมนเข้ากับการระบุฉลากอัตโนมัติ

ตัวอย่างเช่น หากผู้ให้บริการอินเทอร์เน็ตต้องการระบบที่สามารถระบุอีเมลขยะหรือไม่ขยะ เราสามารถเขียนกฎที่อ่อนแอ เช่น ตรวจสอบคำว่า “ข้อเสนอ”, “祝賀”, “ฟรี” ฯลฯ ซึ่งมักจะเกี่ยวข้องกับอีเมลขยะ กฎอื่นๆ อาจเป็นอีเมลจากรูปแบบที่เฉพาะเจาะจงของที่อยู่แหล่งที่มา ซึ่งสามารถค้นหาได้ด้วยการแสดงออกเป็นรูปแบบปกติ กฎที่อ่อนแอเหล่านี้สามารถรวมกันโดยการดูแลที่อ่อนแอเช่น Snorkel และ Skweak เพื่อสร้างข้อมูลการฝึกอบรมที่มีคุณภาพดีขึ้น

ML ในแก่นแท้ของมันคือการช่วยให้บริษัทต่างๆ ขยายกระบวนการในลักษณะที่ไม่สามารถทำได้ด้วยมือ แต่ ML ไม่ใช่เวทมนตร์และยังคงต้องอาศัยมนุษย์เพื่อ a) ตั้งค่าและฝึกอบรมโมเดลอย่างเหมาะสมตั้งแต่ต้น และ b) เข้าแทรกเมื่อจำเป็นเพื่อให้แน่ใจว่าโมเดลไม่เบี่ยงเบนไปจากผลลัพธ์ที่ไม่ดีหรือเป็นอันตราย

เป้าหมายคือการหาวิธีการที่ช่วยให้กระบวนการของมนุษย์เป็นอัตโนมัติและเพิ่มความเร็วในการเข้าถึงตลาดและผลลัพธ์ แต่ยังคงอยู่ภายในขอบเขตของความแม่นยำที่เหมาะสม การได้รับข้อมูลที่มีการระบุฉลากที่มีคุณภาพสูงเป็นส่วนที่มีค่าใช้จ่ายสูงสุด แต่ก็เป็นส่วนที่สำคัญที่สุดของโครงการ ML ใดๆ นี่คือพื้นที่ที่กำลังพัฒนา และมีการพยายามลดเวลาในการระบุฉลากข้อมูลโดยผู้เชี่ยวชาญด้านโดเมนและปรับปรุงคุณภาพของการระบุฉลากข้อมูล การสำรวจและใช้การเรียนรู้เชิงรุกและการดูแลที่อ่อนแอคือกลยุทธ์ที่ดีในการบรรลุเป้าหมายนี้ในหลายอุตสาหกรรมและกรณีการใช้งาน การเตรียมข้อมูลของมนุษย์เป็นส่วนที่สำคัญของโครงการ ML และเป็นพื้นที่ที่กำลังพัฒนา โดยมีการพยายามลดเวลาในการระบุฉลากข้อมูลโดยผู้เชี่ยวชาญด้านโดเมนและปรับปรุงคุณภาพของการระบุฉลากข้อมูล การสำรวจและใช้การเรียนรู้เชิงรุกและการดูแลที่อ่อนแอคือกลยุทธ์ที่ดีในการบรรลุเป้าหมายนี้ในหลายอุตสาหกรรมและกรณีการใช้งาน ซึ่งเป็นส่วนสำคัญของโครงการ ML และเป็นพื้นที่ที่กำลังพัฒนา

ดัตตาราจ ราว เป็น Chief Data Scientist ที่ Persistent Systems และเป็นผู้เขียนหนังสือ “Keras to Kubernetes: The Journey of a Machine Learning Model to Production” ที่ Persistent Systems ดัตตาราจ เป็นผู้นำ AI Research Lab ซึ่งสำรวจอัลกอริทึมที่ทันสมัยในด้าน Computer Vision, Natural Language Understanding, Probabilistic programming, Reinforcement Learning, Explainable AI และอื่นๆ และแสดงให้เห็นถึงความสามารถในการใช้งานในด้าน Healthcare, Banking และ Industrial ดัตตาราจ มี 11 สิทธิบัตรในด้าน Machine Learning และ Computer Vision