พื้นฐาน AI

การเรียนรู้แบบมีผู้ดูแล เทียบกับ การเรียนรู้แบบไม่มีผู้ดูแล

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ในการเรียนรู้ของเครื่องจักร ส่วนใหญ่แล้วงานสามารถแบ่งออกเป็นสองประเภทหลักๆ ได้แก่ การเรียนรู้แบบมีผู้ดูแล (supervised learning) และการเรียนรู้แบบไม่มีผู้ดูแล (unsupervised learning) ในการเรียนรู้แบบมีผู้ดูแล ข้อมูลจะมีฉลากหรือชั้นเรียนที่แนบมา ในขณะที่การเรียนรู้แบบไม่มีผู้ดูแล ข้อมูลจะไม่มีฉลาก มาทำความรู้จักกับเหตุผลที่ความแตกต่างนี้มีความสำคัญ และมาดูกันว่าข้อมูลเรียนรู้แบบใดที่เกี่ยวข้องกับการเรียนรู้แต่ละประเภท

การเรียนรู้แบบมีผู้ดูแล vs การเรียนรู้แบบไม่มีผู้ดูแล

งานส่วนใหญ่ในด้านการเรียนรู้ของเครื่องจักรอยู่ในด้านการเรียนรู้แบบมีผู้ดูแล ในการเรียนรู้แบบมีผู้ดูแล ข้อมูลแต่ละชิ้นจะมีฉลากหรือชั้นเรียนที่กำหนดไว้ ซึ่งหมายความว่าโมเดลการเรียนรู้ของเครื่องจักรสามารถเรียนรู้ที่จะแยกแยะคุณลักษณะที่เกี่ยวข้องกับชั้นเรียนใดชั้นเรียนหนึ่ง และวิศวกรเครื่องจักรสามารถตรวจสอบประสิทธิภาพของโมเดลได้โดยดูว่าข้อมูลถูกจำแนกอย่างถูกต้องหรือไม่ ข้อมูลที่มีฉลากสามารถใช้ในการเรียนรู้รูปแบบที่ซับซ้อนได้ หากข้อมูลมีฉลากที่ถูกต้อง เช่น การเรียนรู้ที่จะแยกแยะสัตว์ต่างๆ ตามคุณลักษณะ เช่น “ขน”, “หาง”, “เล็บ” เป็นต้น

ในทางตรงกันข้าม การเรียนรู้แบบไม่มีผู้ดูแลเกี่ยวข้องกับการสร้างโมเดลที่สามารถค้นหาความสัมพันธ์จากข้อมูลที่ไม่มีฉลาก ซึ่งหมายความว่าเครื่องคอมพิวเตอร์จะวิเคราะห์คุณลักษณะของข้อมูลและกำหนดความสำคัญและรูปแบบของข้อมูลโดยอัตโนมัติ การเรียนรู้แบบไม่มีผู้ดูแลพยายามที่จะค้นหาความคล้ายคลึงกันระหว่างข้อมูลต่างๆ หากการเรียนรู้แบบมีผู้ดูแลมุ่งหมายที่จะจัดประเภทข้อมูลเข้าในชั้นเรียนที่ทราบแล้ว การเรียนรู้แบบไม่มีผู้ดูแลจะวิเคราะห์คุณลักษณะที่เหมือนกันของข้อมูลและจัดกลุ่มเข้าด้วยกันตามคุณลักษณะเหล่านั้น ซึ่งเทียบเท่ากับการสร้างชั้นเรียนของตนเอง

ตัวอย่างของการเรียนรู้แบบมีผู้ดูแล ได้แก่ การถดถอยเชิงเส้น (Linear Regression) การถดถอยลอจิสติก (Logistic Regression) การหาค่าใกล้เคียง (K-nearest Neighbors) การตัดสินใจตามต้นไม้ (Decision Trees) และเครื่องจักรสนับสนุนเวกเตอร์ (Support Vector Machines)

ในทางกลับกัน ตัวอย่างของการเรียนรู้แบบไม่มีผู้ดูแล ได้แก่ การวิเคราะห์องค์ประกอบหลัก (Principal Component Analysis) และการแบ่งกลุ่มโดยใช้ K-means

การเรียนรู้แบบมีผู้ดูแล

การถดถอยเชิงเส้น (Linear Regression) เป็นอัลกอริทึมที่ใช้ในการสร้างความสัมพันธ์ระหว่างคุณลักษณะสองตัว การถดถอยเชิงเส้นใช้ในการคาดการณ์ค่าจำนวนเชิงการนับตามตัวแปรอื่นๆ สูตรของการถดถอยเชิงเส้นคือ Y = a + bX โดยที่ b คือความชันของเส้นตรง และ a คือจุดที่เส้นตัดกับแกน X

การถดถอยลอจิสติก (Logistic Regression) เป็นอัลกอริทึมการจำแนกประเภททวินาม อัลกอริทึมจะวิเคราะห์ความสัมพันธ์ระหว่างคุณลักษณะเชิงจำนวนกับความน่าจะเป็นที่จะจัดประเภทข้อมูลเข้าในชั้นเรียนหนึ่งในชั้นเรียนทั้งสอง ค่าน่าจะเป็นจะถูกบีบอัดให้เข้าใกล้ 0 หรือ 1 ซึ่งหมายความว่าค่าน่าจะเป็นที่เข้มข้นจะเข้าใกล้ 0.99 ในขณะที่ค่าน่าจะเป็นที่อ่อนจะเข้าใกล้ 0

การหาค่าใกล้เคียง (K-nearest Neighbors) จะกำหนดชั้นเรียนให้กับข้อมูลใหม่ตามชั้นเรียนที่กำหนดให้กับข้อมูลที่ใกล้เคียงในเซตการฝึกหัด จำนวนข้อมูลที่ใกล้เคียงที่ถูกพิจารณาโดยอัลกอริทึมมีความสำคัญ และจำนวนข้อมูลที่ใกล้เคียงที่น้อยเกินไปหรือมากเกินไปอาจทำให้การจำแนกประเภทผิดพลาด

การตัดสินใจตามต้นไม้ (Decision Trees) เป็นอัลกอริทึมที่ใช้ในการจำแนกประเภทและถดถอย ต้นไม้ตัดสินใจจะทำงานโดยการแบ่งเซตข้อมูลออกเป็นชิ้นเล็กๆ จนกระทั่งไม่สามารถแบ่งได้อีก ซึ่งจะส่งผลให้เกิดต้นไม้ที่มีจุดตัดสินใจและใบ ต้นไม้ตัดสินใจสามารถจัดการข้อมูลเชิงจำนวนและข้อมูลเชิงชั้นเรียนได้ การแบ่งในต้นไม้จะเกิดขึ้นตามตัวแปรหรือคุณลักษณะเฉพาะ

เครื่องจักรสนับสนุนเวกเตอร์ (Support Vector Machines) เป็นอัลกอริทึมการจำแนกประเภทที่ทำงานโดยการวาดเส้นแบ่ง (hyperplane) ระหว่างข้อมูล ข้อมูลจะถูกแบ่งออกเป็นชั้นเรียนตามด้านของเส้นแบ่งที่พวกมันอยู่ เส้นแบ่งหลายเส้นสามารถถูกวาดบนระนาบเพื่อแบ่งเซตข้อมูลออกเป็นชั้นเรียนหลายชั้นเรียน คุณจำแนกประเภทจะพยายามเพิ่มระยะห่างระหว่างเส้นแบ่งและข้อมูลที่อยู่ด้านใดด้านหนึ่งของระนาบ และระยะห่างที่มากขึ้นระหว่างเส้นและข้อมูลจะทำให้คุณจำแนกประเภทมั่นใจมากขึ้น

การเรียนรู้แบบไม่มีผู้ดูแล

การวิเคราะห์องค์ประกอบหลัก (Principal Component Analysis) เป็นเทคนิคที่ใช้ในการลดมิติ (dimensionality reduction) ซึ่งหมายความว่ามิติหรือความซับซ้อนของข้อมูลจะถูกแสดงในรูปแบบที่ง่ายขึ้น อัลกอริทึมการวิเคราะห์องค์ประกอบหลักจะหามิติใหม่สำหรับข้อมูลที่ตั้งฉากกัน ในขณะที่มิติของข้อมูลลดลง ความแปรปรวนระหว่างข้อมูลควรจะถูกเก็บรักษาไว้ให้มากที่สุด ซึ่งหมายความว่าในทางปฏิบัติ อัลกอริทึมจะนำคุณลักษณะในเซตข้อมูลและทำให้พวกมันง่ายขึ้นเป็นคุณลักษณะที่น้อยลงซึ่งแสดงถึงข้อมูลส่วนใหญ่

การแบ่งกลุ่มโดยใช้ K-means เป็นอัลกอริทึมที่จัดกลุ่มข้อมูลโดยอัตโนมัติตามคุณลักษณะที่คล้ายกัน รูปแบบภายในเซตข้อมูลจะถูกวิเคราะห์และข้อมูลจะถูกแบ่งออกเป็นกลุ่มตามรูปแบบเหล่านั้น ซึ่งเทียบเท่ากับการสร้างชั้นเรียนของตนเองจากข้อมูลที่ไม่มีฉลาก อัลกอริทึม K-means ทำงานโดยการกำหนดจุดศูนย์กลางให้กับกลุ่ม (centroid) และย้ายจุดศูนย์กลางจนกว่าจะพบตำแหน่งที่เหมาะสมที่สุด ตำแหน่งที่เหมาะสมที่สุดคือตำแหน่งที่ระยะห่างระหว่างจุดศูนย์กลางและข้อมูลที่อยู่รอบๆ ในชั้นเรียนนั้นถูกย่อให้เล็กสุด “K” ในการแบ่งกลุ่มโดยใช้ K-means หมายถึงจำนวนจุดศูนย์กลางที่ถูกเลือก

สรุป

เพื่อสรุป มาทำความรู้จักกับความแตกต่างหลักๆ ระหว่างการเรียนรู้แบบมีผู้ดูแลและไม่มีผู้ดูแล

ตามที่เราได้พูดถึงก่อนหน้านี้ ในการเรียนรู้แบบมีผู้ดูแล ข้อมูลที่เข้ามาจะมีฉลากหรือชั้นเรียนที่ทราบแล้ว ในขณะที่การเรียนรู้แบบไม่มีผู้ดูแล ข้อมูลที่เข้ามาจะไม่มีฉลากและจำนวนชั้นเรียนไม่ทราบ การเรียนรู้แบบไม่มีผู้ดูแลมักจะไม่ซับซ้อนในด้านการคำนวณ ในขณะที่การเรียนรู้แบบมีผู้ดูแลมักจะซับซ้อนกว่า ในขณะที่ผลลัพธ์ของการเรียนรู้แบบมีผู้ดูแลมักจะมีความแม่นยำสูง ผลลัพธ์ของการเรียนรู้แบบไม่มีผู้ดูแลมักจะมีความแม่นยำปานกลางหรือต่ำกว่า

นักบล็อกและโปรแกรมเมอร์ที่มีความเชี่ยวชาญใน Machine Learning และ Deep Learning หัวข้อ Daniel หวังที่จะช่วยให้ผู้อื่นใช้พลังของ AI สำหรับสิ่งที่ดี