ผู้นำทางความคิด
การเตรียมข้อมูลของมนุษย์สำหรับการเรียนรู้ของเครื่องจักรเป็นกระบวนการที่ต้องใช้ทรัพยากรมาก: วิธีการสองวิธีนี้มีความสำคัญต่อการลดต้นทุน

โดย: Dattaraj Rao, Chief Data Scientist, Persistent Systems
เช่นเดียวกับระบบใดๆ ที่พึ่งพาข้อมูลเข้า Machine Learning (ML) ต้องยอมรับหลักการ “ข้อมูลเข้าที่ไม่ดีจะทำให้ผลลัพธ์ไม่ดี” ข้อมูลที่สะอาดและได้รับการระบุฉลากอย่างถูกต้องเป็นรากฐานในการสร้างโมเดล ML ใดๆ อัลกอริธึมการฝึกอบรม ML จะเข้าใจรูปแบบจากข้อมูลที่ถูกต้องและเรียนรู้วิธีการทั่วไปสำหรับข้อมูลที่ไม่เคยเห็นมาก่อน หากคุณภาพของข้อมูลการฝึกอบรมของคุณต่ำ อัลกอริทึม ML จะยากที่จะเรียนรู้และขยายต่อไป
ลองนึกถึงการฝึกสุนัขเป็นตัวอย่าง หากคุณล้มเหลวในการฝึกสุนัขด้วยคำสั่งพื้นฐาน (ข้อมูลเข้า) หรือทำอย่างไม่ถูกต้อง/ไม่แม่นยำ คุณไม่สามารถคาดหวังให้สุนัขเรียนรู้และขยายตัวผ่านการสังเกตุไปสู่พฤติกรรมที่ดีขึ้นได้ การฝึกอบรมที่เหมาะสมต้องใช้เวลาและอาจมีค่าใช้จ่ายสูงหากคุณนำผู้เชี่ยวชาญมา แต่ผลตอบแทนจะดีหากคุณทำถูกตั้งแต่ต้น
เมื่อฝึกอบรมโมเดล ML การสร้างข้อมูลที่มีคุณภาพต้องใช้เวลาและความพยายามจากผู้เชี่ยวชาญด้านโดเมนในการระบุฉลากข้อมูล ซึ่งอาจรวมถึงการเลือกหน้าต่างที่มีวัตถุที่ต้องการในภาพหรือการกำหนดฉลากให้กับข้อความหรือบันทึกฐานข้อมูล โดยเฉพาะสำหรับข้อมูลที่ไม่มีโครงสร้าง เช่น ภาพ วิดีโอ และข้อความ คุณภาพของการระบุฉลากมีบทบาทสำคัญในการกำหนดคุณภาพของโมเดล โดยทั่วไป ข้อมูลที่ไม่มีฉลาก เช่น ภาพและข้อความดิบ มีมากมาย แต่การระบุฉลากเป็นส่วนที่ต้องได้รับการปรับปรุงมากที่สุด นี่คือส่วนของ “มนุษย์ในวงจร” ของวงจรชีวิต ML และโดยทั่วไปเป็นส่วนที่มีค่าใช้จ่ายสูงสุดและต้องใช้แรงงานมากที่สุดในโครงการ ML ใดๆ
เครื่องมือการระบุฉลากข้อมูล เช่น Prodigy, Amazon Sagemaker Ground Truth, NVIDIA RAPIDS และ DataRobot human-in-the-loop มีการปรับปรุงคุณภาพและให้อินเทอร์เฟซที่直观สำหรับผู้เชี่ยวชาญด้านโดเมน อย่างไรก็ตาม การลดเวลาในการระบุฉลากข้อมูลโดยผู้เชี่ยวชาญด้านโดเมนยังคงเป็นความท้าทายที่สำคัญสำหรับองค์กรในปัจจุบัน โดยเฉพาะในสถานการณ์ที่ทีมงานวิทยาศาสตร์ข้อมูลมีจำนวนจำกัด แต่มีความต้องการสูง นี่คือจุดที่วิธีการสองวิธีใหม่ในการเตรียมข้อมูลเข้ามาเล่น
การเรียนรู้เชิงรุก
การเรียนรู้เชิงรุกเป็นวิธีการที่โมเดล ML จะถามผู้เชี่ยวชาญด้านโดเมนเกี่ยวกับการระบุฉลากข้อมูลโดยเฉพาะ โดยไม่ต้องมีการระบุฉลากทั้งหมดให้กับข้อมูลที่ไม่มีฉลาก แต่เพียงแค่การระบุฉลากที่ถูกต้องให้กับจุดข้อมูลที่สำคัญเพื่อให้โมเดลสามารถเรียนรู้ได้ดีขึ้น ตัวอย่างเช่น ในสาขาเวชศาสตร์และวิทยาศาสตร์ชีวิต บริษัทที่เชี่ยวชาญในการวินิจฉัยโรคมะเร็งในระยะแรกเพื่อช่วยให้แพทย์สามารถตัดสินใจได้อย่างมีข้อมูล ในกระบวนการวินิจฉัย mereka cầnระบุฉลากภาพถ่าย CT Scan ที่มีเนื้องอก
หลังจากที่โมเดล ML เรียนรู้จากภาพหลายภาพที่มีเนื้องอกที่ถูกเน้น การเรียนรู้เชิงรุกจะทำให้โมเดลถามผู้ใช้เพียงการระบุฉลากภาพที่มีเนื้องอกที่ไม่แน่นอนเท่านั้น ซึ่งจะเป็นจุดข้อมูลที่สำคัญที่จะช่วยเพิ่มความมั่นใจของโมเดล เมื่อโมเดลมีความมั่นใจเกินเกณฑ์ที่กำหนด จะทำการระบุฉลากโดยอัตโนมัติแทนการถามผู้ใช้ นี่คือวิธีการที่การเรียนรู้เชิงรุกพยายามช่วยสร้างโมเดลที่แม่นยำโดยลดเวลาและความพยายามในการระบุฉลากข้อมูล Frameworks เช่น modAL สามารถช่วยเพิ่มประสิทธิภาพการจำแนกประเภทโดยการถามผู้เชี่ยวชาญด้านโดเมนเพื่อระบุฉลากตัวอย่างที่มีข้อมูลมากที่สุด
การดูแลที่อ่อนแอ
การดูแลที่อ่อนแอคือวิธีการที่ใช้ข้อมูลที่มีเสียงและไม่แม่นยำหรือแนวคิดที่เป็นนามธรรมเพื่อให้คำแนะนำในการระบุฉลากข้อมูลที่ไม่มีการดูแลมาก่อน วิธีการนี้โดยทั่วไปจะใช้การดูแลที่อ่อนแอและพยายามรวมเข้าด้วยกันในแนวทางแบบアンサンブルเพื่อสร้างข้อมูลที่มีการระบุฉลากที่มีคุณภาพ ความพยายามคือการพยายามรวมความรู้ด้านโดเมนเข้ากับการระบุฉลากอัตโนมัติ
ตัวอย่างเช่น หากผู้ให้บริการอินเทอร์เน็ตต้องการระบบที่สามารถระบุอีเมลขยะหรือไม่ขยะ เราสามารถเขียนกฎที่อ่อนแอ เช่น ตรวจสอบคำว่า “ข้อเสนอ”, “祝賀”, “ฟรี” ฯลฯ ซึ่งมักจะเกี่ยวข้องกับอีเมลขยะ กฎอื่นๆ อาจเป็นอีเมลจากรูปแบบที่เฉพาะเจาะจงของที่อยู่แหล่งที่มา ซึ่งสามารถค้นหาได้ด้วยการแสดงออกเป็นรูปแบบปกติ กฎที่อ่อนแอเหล่านี้สามารถรวมกันโดยการดูแลที่อ่อนแอเช่น Snorkel และ Skweak เพื่อสร้างข้อมูลการฝึกอบรมที่มีคุณภาพดีขึ้น
ML ในแก่นแท้ของมันคือการช่วยให้บริษัทต่างๆ ขยายกระบวนการในลักษณะที่ไม่สามารถทำได้ด้วยมือ แต่ ML ไม่ใช่เวทมนตร์และยังคงต้องอาศัยมนุษย์เพื่อ a) ตั้งค่าและฝึกอบรมโมเดลอย่างเหมาะสมตั้งแต่ต้น และ b) เข้าแทรกเมื่อจำเป็นเพื่อให้แน่ใจว่าโมเดลไม่เบี่ยงเบนไปจากผลลัพธ์ที่ไม่ดีหรือเป็นอันตราย
เป้าหมายคือการหาวิธีการที่ช่วยให้กระบวนการของมนุษย์เป็นอัตโนมัติและเพิ่มความเร็วในการเข้าถึงตลาดและผลลัพธ์ แต่ยังคงอยู่ภายในขอบเขตของความแม่นยำที่เหมาะสม การได้รับข้อมูลที่มีการระบุฉลากที่มีคุณภาพสูงเป็นส่วนที่มีค่าใช้จ่ายสูงสุด แต่ก็เป็นส่วนที่สำคัญที่สุดของโครงการ ML ใดๆ นี่คือพื้นที่ที่กำลังพัฒนา และมีการพยายามลดเวลาในการระบุฉลากข้อมูลโดยผู้เชี่ยวชาญด้านโดเมนและปรับปรุงคุณภาพของการระบุฉลากข้อมูล การสำรวจและใช้การเรียนรู้เชิงรุกและการดูแลที่อ่อนแอคือกลยุทธ์ที่ดีในการบรรลุเป้าหมายนี้ในหลายอุตสาหกรรมและกรณีการใช้งาน การเตรียมข้อมูลของมนุษย์เป็นส่วนที่สำคัญของโครงการ ML และเป็นพื้นที่ที่กำลังพัฒนา โดยมีการพยายามลดเวลาในการระบุฉลากข้อมูลโดยผู้เชี่ยวชาญด้านโดเมนและปรับปรุงคุณภาพของการระบุฉลากข้อมูล การสำรวจและใช้การเรียนรู้เชิงรุกและการดูแลที่อ่อนแอคือกลยุทธ์ที่ดีในการบรรลุเป้าหมายนี้ในหลายอุตสาหกรรมและกรณีการใช้งาน ซึ่งเป็นส่วนสำคัญของโครงการ ML และเป็นพื้นที่ที่กำลังพัฒนา












