ผู้นำทางความคิด
การเพิ่มขึ้นของข้อมูลสังเคราะห์ และเหตุผลที่จะช่วยเสริมข้อมูลจริงมากกว่าการแทนที่

เอลอน มัสก์ ได้ประกาศเมื่อเร็วๆ นี้ ว่าเรามีข้อมูลของมนุษย์ที่ใช้ในการฝึกอบรมโมเดล AI ถึงขีดจำกัดแล้ว คำเตือนของเขาคือคำวิจารณ์เรื่องความจำเป็นในการหาข้อมูลใหม่สำหรับการพัฒนา AI ต่อไป ในอุตสาหกรรม เช่น สาธารณสุขและไฟแนนซ์ กฎระเบียบเรื่องความเป็นส่วนตัวที่เข้มงวดทำให้ขาดแคลนข้อมูลมากขึ้น
ในขณะที่ข้อมูลสังเคราะห์ ซึ่งเป็นหนึ่งในวิธีแก้ปัญหาขาดแคลนข้อมูลนี้ ไม่ใช่เรื่องใหม่ แต่ความสำคัญของมันยังคงเพิ่มขึ้นอย่างต่อเนื่อง เช่นเดียวกับการซื้อขายและลงทุนในภาคส่วนนี้เมื่อเร็วๆ นี้ มีความไม่แน่นอนบางประการเกี่ยวกับการใช้ข้อมูลสังเคราะห์ โดยเฉพาะอย่างยิ่งความเสี่ยงของการล่มสลายของโมเดล (model collapse) ซึ่งคุณภาพของผลลัพธ์ของโมเดลภาษาขนาดใหญ่ (Large Language Model, LLM) จะลดลงหากไม่มีข้อมูลโลกแห่งความเป็นจริงในการฝึกอบรม
ข้อมูลสังเคราะห์คืออะไร และสร้างขึ้นอย่างไร
ข้อมูลสังเคราะห์เป็นข้อมูลที่สร้างขึ้นโดยใช้เทคนิคการสร้างข้อมูลเทียม ซึ่งสามารถสร้างข้อมูลที่มีลักษณะคล้ายกับข้อมูลจริงได้ โดยใช้โมเดล AI ที่ฝึกอบรมจากข้อมูลจริงเพื่อสร้างข้อมูลสังเคราะห์ขึ้นมา
โมเดล LLM กำลังถูกใช้ในการสร้างข้อมูลสังเคราะห์หลายประเภท รวมถึงข้อมูลที่มีโครงสร้าง เช่น ข้อมูลตาราง และข้อมูลที่ไม่มีโครงสร้าง เช่น ข้อความ ออดิโอ และวิดีโอ
ความสำคัญที่เพิ่มขึ้นของข้อมูลสังเคราะห์
มีความสนใจในข้อมูลสังเคราะห์มานานแล้ว แต่ในช่วง 5 ปีที่ผ่านมา การพัฒนา LLM ที่รวดเร็วทำให้ความต้องการข้อมูลสังเคราะห์เพิ่มขึ้น และสร้างวิธีการที่มีประสิทธิภาพมากขึ้นในการสร้างข้อมูลสังเคราะห์ในระดับใหญ่
ตามการคาดการณ์ของ Gartner ข้อมูลสังเคราะห์จะคิดเป็น 60% ของข้อมูลที่ใช้ในการฝึกอบรม LLM ภายในปี 2024 ซึ่งเพิ่มขึ้นจาก 1% ในปี 2021
การล่มสลายของโมเดล
ข้อมูลสังเคราะห์มีศักยภาพที่น่าตื่นเต้น แต่ก็มีข้อเสียที่สำคัญ คือ การล่มสลายของโมเดล ซึ่งเป็นปรากฏการณ์ที่โมเดล LLM ที่ฝึกอบรมจากข้อมูลสังเคราะห์เท่านั้นจะผลิตผลลัพธ์ที่ไม่แม่นยำหรือไม่หลากหลาย
ข้อมูลจริงสำหรับการฝึกอบรมโมเดลที่สร้างข้อมูลสังเคราะห์
ข้อมูลสังเคราะห์ส่วนใหญ่ในปัจจุบันสร้างขึ้นโดยใช้ AI ที่ฝึกอบรมจากข้อมูลจริง ดังนั้นจึงจำเป็นต้องมีข้อมูลจริงในการฝึกอบรมโมเดลเหล่านี้
ข้อมูลจริงสำหรับการบรรเทาผลกระทบของการล่มสลายของโมเดล
มีหลายวิธีในการบรรเทาผลกระทบของการล่มสลายของโมเดล รวมถึงการตรวจสอบและทบทวนข้อมูลสังเคราะห์อย่างสม่ำเสมอ และการตรวจสอบคุณภาพของข้อมูลสังเคราะห์ก่อนใช้ในโมเดล
ประโยชน์ที่เป็นไปได้ของข้อมูลสังเคราะห์
เมื่อใช้ข้อมูลสังเคราะห์อย่างชาญฉลาดและผสมผสานกับข้อมูลจริง มันสามารถช่วยแก้ปัญหาที่เกี่ยวข้องกับข้อมูลฝึกอบรม AI ได้ 6 ประการ ได้แก่ การขาดแคลนข้อมูล ความเข้าถึงข้อมูล ความสม่ำเสมอของข้อมูล ความเอนเอียง ความเป็นส่วนตัว และต้นทุน
การขาดแคลนข้อมูล
เมื่อ บริษัท AI ต่างๆ พยายามที่จะขยายตลาดและบรรลุเป้าหมายใหม่ๆ ความต้องการข้อมูลเพื่อฝึกอบรม LLM ก็เพิ่มขึ้นตามไปด้วย ข้อมูลสังเคราะห์มีศักยภาพที่จะช่วยเติมช่องว่างนี้
ความเข้าถึงข้อมูล
บริษัท เทคโนโลยีขนาดใหญ่กำลังทำหน้าที่เป็นคนดูแลข้อมูล ทำให้เกิดอุปสรรคต่อการเข้าถึงข้อมูลสำหรับผู้เล่นขนาดเล็ก ข้อมูลสังเคราะห์มีศักยภาพที่จะทำให้ AI ที่สร้างขึ้นโดยใช้ข้อมูลสังเคราะห์สามารถเข้าถึงได้และราคาไม่แพง
ความสม่ำเสมอของข้อมูล
ในบางกรณี เช่น การฝึกอบรม AI สำหรับการขับขี่อัตโนมัติ ข้อมูลจริงอาจมีความสม่ำเสมอมากเกินไป นักพัฒนาสามารถสร้างข้อมูลสังเคราะห์เพื่อเติมช่องว่างในข้อมูลสำหรับสถานการณ์ที่ไม่ปกติ
ความเอนเอียง
บางชุดข้อมูลจริงอาจมีความเอนเอียงในตัว ดังนั้นข้อมูลสังเคราะห์จึงสามารถช่วยให้ AI ได้รับภาพที่สมดุลยิ่งขึ้น
ความเป็นส่วนตัว
ในภาคส่วน เช่น สาธารณสุขและไฟแนนซ์ ข้อมูลสังเคราะห์สามารถช่วยให้ บริษัท ต่างๆ สร้างชุดข้อมูลฝึกอบรมสำหรับโมเดลของตนโดยไม่ต้องละเมิดความเป็นส่วนตัวของลูกค้า
ต้นทุน
โดยทั่วไปแล้ว ข้อมูลสังเคราะห์มีต้นทุนต่ำกว่าข้อมูลจริง และยังมาพร้อมกับการทำเครื่องหมาย ซึ่งช่วยประหยัดเวลาและต้นทุน
การเสริมข้อมูลจริงมากกว่าการแทนที่
ประโยชน์ของข้อมูลสังเคราะห์สามารถนำมาใช้ได้ หากไม่ถือว่าเป็นทางเลือกแทนข้อมูลจริง แต่ควรใช้เพื่อเสริมข้อมูลจริงให้มากขึ้น
ดังที่กล่าวไว้ข้างต้น การใช้ข้อมูลสังเคราะห์ไม่ควรนำมาแทนที่ข้อมูลจริง แต่ควรใช้เพื่อเสริมข้อมูลจริงให้มากขึ้น และช่วยให้การฝึกอบรม AI มีประสิทธิภาพมากขึ้น












