ผู้นำทางความคิด
การเพิ่มขึ้นของข้อมูลสังเคราะห์และเหตุผลที่มันจะเสริมเพิ่มแทนที่จะทดแทนข้อมูลจริง

Elon Musk เพิ่งประกาศว่าเรามีข้อมูลมนุษย์ที่ใช้ฝึกโมเดล AI จนหมดแล้ว คำเตือนของเขาเป็นความเห็นล่าสุดเกี่ยวกับความจำเป็นของแหล่งข้อมูลใหม่ หาก AI จะก้าวหน้าต่อไปอย่างรวดเร็ว ในอุตสาหกรรมเช่นการดูแลสุขภาพและการเงิน กฎระเบียบความเป็นส่วนตัวที่เข้มงวดทำให้ปัญหาขาดแคลนข้อมูลยิ่งรุนแรงขึ้น
แม้ว่าข้อมูลสังเคราะห์ – ซึ่งเป็นวิธีแก้ปัญหาขาดแคลนข้อมูลนี้ – จะไม่ใช่เรื่องใหม่ ความสำคัญของมันยังคงเติบโตต่อเนื่อง ตามที่แสดงให้เห็นจากการควบรวมกิจการและการลงทุนในสาขานี้ในช่วงหลังนี้ อย่างไรก็ตาม ยังมีความไม่แน่นอนลึกซึ้งเกี่ยวกับการใช้ข้อมูลสังเคราะห์ โดยเฉพาะความเสี่ยงของการล่มของโมเดล (model collapse) ซึ่งคุณภาพของผลลัพธ์จากโมเดลภาษาใหญ่หลายโหมด (LLM) จะเสื่อมลงหากไม่มีข้อมูลโลกจริงมาฝึก เราจะเห็นว่าปัญหานี้แก้ไขได้หรือไม่อาจมีผลกระทบอย่างสำคัญต่ออนาคตของ AI สร้างสรรค์ (Gen AI)
ข้อมูลสังเคราะห์คืออะไรและสร้างอย่างไร
ข้อมูลสังเคราะห์คือข้อมูลที่สร้างขึ้นโดยเทียมแทนที่จะเก็บจากเหตุการณ์จริง ข้อมูลสังเคราะห์ที่สร้างโดย AI ปัจจุบันเป็นรูปแบบที่แพร่หลายที่สุด ซึ่งเกี่ยวข้องกับการฝึกโมเดลด้วยข้อมูลโลกจริงเพื่อค้นหารูปแบบและความสัมพันธ์ แล้วสร้างข้อมูลใหม่ที่เลียนแบบคุณสมบัติสถิติเหล่านั้น
LLM ถูกใช้เพื่อสร้างข้อมูลสังเคราะห์หลายประเภท รวมถึงข้อมูลเชิงโครงสร้าง เช่น ข้อมูลตาราง และข้อมูลที่ไม่มีโครงสร้าง เช่น ข้อความอิสระ วิดีโอและภาพ วิธีการต่าง ๆ ถูกนำมาใช้ขึ้นอยู่กับประเภทของข้อมูลที่ต้องการผลิต
ตัวอย่างเช่น วิธีการสองแบบที่นิยมใช้ในการสร้างข้อมูลภาพสังเคราะห์คือ GANs และโมเดลการแพร่กระจาย (diffusion models) GANs ใช้เครือข่ายประสาทสองตัว: ตัวสร้าง (generator) สร้างเวอร์ชันเทียมของข้อมูลจริง ในขณะที่ตัวแยกแยะ (discriminator) ระบุว่าข้อมูลใดเป็นของจริงหรือเทียม ทั้งสองทำงานร่วมกันอย่างต่อเนื่อง ตัวสร้างพยายาม “หลอก” ตัวแยกแยะ เพื่อพัฒนาความสมจริงและความหลากหลายของข้อมูลเทียม โมเดลการแพร่กระจายใช้แนวทางที่ต่างออกไป โดยเรียนรู้การบิดเบือนข้อมูลจริงแล้วย้อนกลับกระบวนการนี้เพื่อ “ทำความสะอาด” ข้อมูล เมื่อฝึกอย่างมีประสิทธิภาพแล้ว สามารถผลิตข้อมูลเสียงและภาพสังเคราะห์คุณภาพสูงได้
ความสำคัญที่เพิ่มขึ้นของข้อมูลสังเคราะห์
ความสนใจในข้อมูลสังเคราะห์มีมานานแล้ว อย่างไรก็ตาม ในช่วง 5 ปีที่ผ่านมา การพัฒนาอย่างรวดเร็วของ LLM ได้เพิ่มความต้องการข้อมูลสังเคราะห์และสร้างวิธีการผลิตข้อมูลในระดับใหญ่ที่มีประสิทธิภาพมากขึ้น ส่งผลให้การใช้ข้อมูลสังเคราะห์พุ่งสูงขึ้นอย่างมหาศาล
Gartner คาดการณ์ว่าข้อมูลสังเคราะห์จะครอบคลุม 60% ของข้อมูลทั้งหมดที่ใช้ฝึก LLMs ภายในปี 2024 เพิ่มจากเพียง 1% ในปี 2021 มีเหตุผลทุกประการที่จะเชื่อว่าการประมาณนี้ค่อนข้างแม่นยำ ตัวอย่างเช่น โมเดล Phi-4 ของ Microsoft ซึ่งมีประสิทธิภาพเหนือ LLM อื่น ๆ แม้ขนาดเล็กกว่า ได้รับการฝึกสำเร็จด้วยข้อมูลสังเคราะห์ส่วนใหญ่ ในขณะเดียวกัน วิศวกรของ Alexa ของ Amazon กำลังสำรวจการใช้โมเดล “ครู/นักเรียน” โดยโมเดล “ครู” สร้างข้อมูลสังเคราะห์แล้วใช้เป็นข้อมูลฝึกสำหรับโมเดล “นักเรียน” ที่มีขนาดเล็กกว่า
การยอมรับอย่างกว้างขวางนี้สะท้อนให้เห็นในความเคลื่อนไหวสำคัญของตลาด ภาคข้อมูลสังเคราะห์เห็นการบูมของการลงทุนในปี 2021‑22 Gretel AI และ Tonic.ai ได้รับเงินลงทุนรอบ Series B จำนวน 50 ล้านดอลลาร์และ 35 ล้านดอลลาร์ตามลำดับ จากนั้นตามมาด้วย MOSTLY AI ปิดรอบ Series B มูลค่า 25 ล้านดอลลาร์ และ Synthesis AI ได้รับเงินทุน Series A จำนวน 17 ล้านดอลลาร์
เมื่อเร็ว ๆ นี้ แนวโน้มได้เปลี่ยนไปสู่การควบรวมกิจการในระดับใหญ่ การเข้าซื้อของ NVIDIA ต่อ Gretel ในฤดูใบไม้ผลินี้จะสนับสนุนงานของยักษ์เทคโนโลยีในสาขานี้เช่นกัน เช่นเดียวกับบริษัทโซลูชัน AI SAS ที่ได้เข้าซื้อสตาร์ทอัพข้อมูลสังเคราะห์ Hazy ในเดือนพฤศจิกายน 2024
บริษัทวิเคราะห์ Cognilytica ประมาณการว่าตลาดการสร้างข้อมูลสังเคราะห์ในปี 2021 มีมูลค่าประมาณ 110 ล้านดอลลาร์ บริษัทคาดว่าจะเติบโตถึง 1.15 พันล้านดอลลาร์ภายในปี 2027 การคาดการณ์อื่น ๆ คาดว่า CAGR ของภาคนี้จะอยู่ที่ 31% โดยมูลค่าจะเพิ่มขึ้นเป็น 2.33 พันล้านดอลลาร์ภายในปี 2030
การล่มของโมเดล
อย่างไรก็ตาม ศักยภาพที่น่าตื่นเต้นของข้อมูลสังเคราะห์มาพร้อมกับข้อเสียสำคัญคือการล่มของโมเดล (model collapse) ซึ่งเป็นปรากฏการณ์ที่ LLM ที่ฝึกเฉพาะด้วยข้อมูลสังเคราะห์เริ่มผลิตผลลัพธ์ที่แม่นยำหรือต่างหลากหลายน้อยลง
ในขณะที่ข้อมูลโลกจริงมักมีความซับซ้อนสูง ข้อมูลสังเคราะห์มักถูกทำให้เรียบง่ายและบีบอัดโดยโมเดล ตัวอย่างเช่น นักวิจัยพบว่าความแม่นยำของโมเดลที่ฝึกตรวจจับเม็ดมะเร็งจากภาพถ่ายเป็น สัดส่วนผกผัน กับปริมาณข้อมูลฝึกสังเคราะห์ที่ใช้ การศึกษาล่าสุดโดยนักวิชาการจาก Oxford, Cambridge, Imperial College และ University of Toronto พบว่าการใช้ข้อมูลที่โมเดลสร้างขึ้นโดยไม่คัดกรองทำให้เกิด “ข้อบกพร่องที่ไม่สามารถย้อนกลับได้ในโมเดลที่ได้ผลลัพธ์”
ยิ่งแย่ไปกว่านั้น LLM ส่วนใหญ่เป็น “กล่องดำ” ทำให้ยากต่อการเข้าใจว่ามันจะตอบสนองต่อข้อมูลสังเคราะห์อย่างไร นักวิจัยจาก Rice University และ Stanford สรุปว่า หากไม่มีข้อมูลโลกจริงใหม่เข้ามา “โมเดลสร้างสรรค์ในอนาคตจะต้องเผชิญกับการลดลงของคุณภาพ (ความแม่นยำ) หรือความหลากหลาย (การเรียกคืน) อย่างต่อเนื่อง”
ความต้องการข้อมูลโลกจริงยังคงต่อเนื่อง
เห็นได้ชัดว่า แม้ความต้องการข้อมูลสังเคราะห์จะเพิ่มขึ้น ความจำเป็นของข้อมูลโลกจริงก็ยังคงอยู่ ในความเป็นจริง ความต้องการข้อมูลโลกจริงคุณภาพสูงอาจเพิ่มขึ้นอีก เหตุผลมีสองประการ ประการแรก ข้อมูลโลกจริงจะต้องมีเสมอเพื่อฝึกโมเดล AI ที่จะสร้างข้อมูลสังเคราะห์ต่อไป และประการที่สอง เพื่อหลีกเลี่ยงการล่มของโมเดล จำเป็นต้องทำให้ข้อมูลสังเคราะห์สอดคล้องกับข้อมูลโลกจริงอย่างต่อเนื่อง
ข้อมูลจริงสำหรับการฝึกโมเดล AI ที่ผลิตข้อมูลสังเคราะห์
ดังที่กล่าวไว้ก่อนหน้านี้ ส่วนใหญ่ของข้อมูลสังเคราะห์ในปัจจุบันถูกสร้างด้วย Gen AI และโมเดล Gen AI เหล่านี้ต้องได้รับการฝึกด้วยข้อมูลโลกจริงเพื่อสร้างข้อมูลสังเคราะห์ที่ใช้งานได้ เนื่องจากพวกมันสามารถสร้างข้อมูลสังเคราะห์ได้โดยการจำลองรูปแบบและคุณสมบัติสถิติของชุดข้อมูลโลกจริงเท่านั้น
พิจารณา ตัวอย่างล่าสุดของบริษัทประกันภัย ที่สามารถใช้ข้อมูลสังเคราะห์เพื่อทดสอบผู้ให้บริการต่าง ๆ โดยไม่ทำให้ข้อมูลลูกค้าที่เป็นความลับของตนถูกเปิดเผย เพื่อสร้างชุดข้อมูลสังเคราะห์นี้ซึ่งเลียนแบบความเป็นจริงได้อย่างแม่นยำ จำเป็นต้องใช้ข้อมูลโลกจริงของตนเองในการฝึกโมเดล AI ที่จะสร้างข้อมูลสังเคราะห์ต่อไป
ข้อมูลจริงเพื่อบรรเทาการล่มของโมเดล
มีหลายกลยุทธ์เพื่อบรรเทาความเสี่ยงของการล่มของโมเดล ซึ่งรวมถึงการตรวจสอบและทบทวนชุดข้อมูลสังเคราะห์เป็นประจำ และการตรวจสอบคุณภาพของข้อมูลสังเคราะห์ก่อนนำไปใช้ในโมเดลสร้างสรรค์ อย่างไรก็ตาม แนวทางที่พบบ่อยที่สุดคือการกระจายข้อมูลที่ใช้ โดยการผสานข้อมูลสังเคราะห์กับข้อมูลมนุษย์ การสำรวจของ Gartner พบว่า 63% ของผู้ตอบสนองชื่นชอบการใช้ชุดข้อมูลบางส่วนเป็นสังเคราะห์ โดยมีเพียง 13% เท่านั้นที่บอกว่าพวกเขาใช้ข้อมูลสังเคราะห์เต็มรูปแบบ
แม้การเพิ่มข้อมูลโลกจริงเพียงเล็กน้อยก็สามารถปรับปรุงประสิทธิภาพของโมเดลได้อย่างมีนัยสำคัญ นักวิจัยจาก University of South California พบ ว่าบริษัทต่าง ๆ สามารถแทนที่ข้อมูลจริงได้ถึง 90% ด้วยข้อมูลสังเคราะห์โดยไม่เห็นการลดลงอย่างมีนัยสำคัญของประสิทธิภาพ อย่างไรก็ตาม การแทนที่ข้อมูลมนุษย์ที่เหลือ 10% สุดท้ายจะทำให้ประสิทธิภาพลดลงอย่างชัดเจน
คุณภาพก็มีความสำคัญเช่นกัน ดังที่แสดงให้เห็นจากความสำเร็จของ Microsoft กับ Phi-4 LLM นี้ ซึ่งได้รับการฝึกด้วยข้อมูลสังเคราะห์ส่วนใหญ่ที่สร้างโดย GPT-4o อย่างไรก็ตาม ข้อมูลก่อนการฝึกหลายส่วน – ชุดข้อมูลทั่วไปที่ใช้ในขั้นตอนแรกของการฝึกก่อนที่โมเดลจะได้รับการปรับแต่ง – ถูกคัดสรรอย่างระมัดระวังด้วยข้อมูลโลกจริงคุณภาพสูงรวมถึงหนังสือและงานวิจัย
ประโยชน์ที่เป็นไปได้ของข้อมูลสังเคราะห์
เมื่อใช้ข้อมูลสังเคราะห์อย่างชาญฉลาดและผสานกับข้อมูลโลกจริงอย่างมีประสิทธิภาพ มันมีศักยภาพในการแก้ไขปัญหาหกประการที่เกี่ยวกับข้อมูลฝึก AI ได้แก่ ความขาดแคลน การเข้าถึง ความเป็นเอกลักษณ์ ความลำเอียง ปัญหาความเป็นส่วนตัว และค่าใช้จ่าย
ความขาดแคลนของข้อมูล
เมื่อบริษัท AI แข่งกันเพื่อครองส่วนแบ่งตลาดและบรรลุความสำเร็จใหม่ ๆ ความต้องการข้อมูลเพื่อฝึก LLM ของพวกเขาก็เพิ่มขึ้นอย่างไม่อาจหยุดยั้ง ข้อมูลสังเคราะห์มีศักยภาพในการเติมช่องว่างนี้ อย่างน้อยตามที่ การวิจัยของ Gartner ระบุ อย่างไรก็ตาม ควรสังเกตว่าการใช้ข้อมูลจริงในปริมาณมากในชุดข้อมูลก่อนการฝึกและเพื่อทำการซิงค์เพื่อหลีกเลี่ยงการล่มของโมเดลยังคงจำเป็นอยู่
การเข้าถึงข้อมูล
ในปัจจุบัน บริษัทเทคโนโลยีขนาดใหญ่ทำหน้าที่เป็นผู้ควบคุมการเข้าถึงข้อมูล สร้างอุปสรรคต่อผู้เล่นขนาดเล็ก ข้อมูลสังเคราะห์มีศักยภาพในการทำให้ Gen AI เป็นประชาธิปไตยโดยทำให้ข้อมูลฝึกในปริมาณมากเป็นเรื่องที่สามารถซื้อได้และเข้าถึงได้ อย่างไรก็ตาม สิ่งนี้จะไม่ยกเลิกความรับผิดชอบของเทคโนโลยีขนาดใหญ่ในการปรับปรุงการเข้าถึงข้อมูลโลกจริง เนื่องจากข้อมูลดังกล่าวยังคงจำเป็นสำหรับการฝึกโมเดลสร้างข้อมูลสังเคราะห์
ความเป็นเอกลักษณ์ของข้อมูล
ในบางกรณีเฉพาะ เช่น การฝึก AI สำหรับการขับขี่อัตโนมัติ ชุดข้อมูลโลกจริงอาจมีความเป็นเอกลักษณ์เกินไป ในกรณีของการขับรถ นักพัฒนาสามารถสร้างข้อมูลสังเคราะห์เพื่อเติมเต็มช่องว่างของข้อมูลในสถานการณ์ที่ไม่ปกติ ซึ่งจะทำให้โมเดลสามารถฝึกเพื่อรับมือกับเหตุการณ์ที่เกิดขึ้นอย่างหายากบนถนนได้
ความลำเอียง
ชุดข้อมูลโลกจริงบางชุดมีความลำเอียงโดยธรรมชาติ ดังนั้นข้อมูลสังเคราะห์จึงสามารถสร้างขึ้นเพื่อให้โมเดล AI ได้รับภาพที่สมดุลมากขึ้น ตัวอย่างเช่น ในด้านการเงิน หน่วยงานกำกับการเงินของสหราชอาณาจักร (FCA) ได้อ้างว่า ข้อมูลสังเคราะห์มีศักยภาพในการชดเชยความลำเอียงที่อาจเกิดจากการที่กลุ่มบางกลุ่มถูกแทนที่ในชุดข้อมูลมนุษย์ไม่เพียงพอ
ความเป็นส่วนตัว
ในภาคส่วนเช่นการดูแลสุขภาพและการเงิน ความต้องการด้านความเป็นส่วนตัวทำให้การขาดแคลนข้อมูลยิ่งรุนแรงขึ้น ด้วยข้อมูลสังเคราะห์ บริษัทสามารถสร้างชุดข้อมูลฝึกสำหรับโมเดลของตนโดยมีข้อมูลเฉพาะทางโดยไม่ละเมิดความเป็นส่วนตัวของลูกค้า อย่างไรก็ตาม รายงานที่สั่งทำโดย Royal Society ของสหราชอาณาจักร ได้ชี้ให้เห็นว่าเมื่ออ้างอิงถึงข้อมูลสังเคราะห์ในการวิจัยทางการแพทย์ มีการสมมติว่าข้อมูลสังเคราะห์เป็น “เป็นส่วนตัวโดยธรรมชาติ” ซึ่งเป็น “ความเข้าใจผิด” ตามที่นักวิจัยชี้แจง ข้อมูลสังเคราะห์อาจรั่วไหลของข้อมูลที่มาจากชุดข้อมูลต้นฉบับ
โดยเฉพาะอย่างยิ่ง โมเดลที่ฝึกด้วยข้อมูลที่ละเอียดอ่อน เสี่ยงต่อการโจมตีแบบย้อนกลับของโมเดล ซึ่งแฮกเกอร์สามารถสร้างส่วนหนึ่งของชุดข้อมูลต้นฉบับขึ้นมาใหม่ได้
ค่าใช้จ่าย
โดยทั่วไป ข้อมูลสังเคราะห์ถูกสร้างขึ้นด้วยต้นทุนที่ต่ำกว่าข้อมูลจริงในโลกจริง อีกทั้งยังมาพร้อมการทำเครื่องหมาย ซึ่งช่วยประหยัดเวลาและค่าใช้จ่าย ในบางโครงการฝึก AI มากถึง 80% ของโครงการถูกใช้ไปกับ การเตรียมข้อมูล รวมถึงการทำเครื่องหมาย สิ่งนี้อธิบายว่าทำไม บริษัทที่มุ่งเน้นเฉพาะได้ก่อตั้งขึ้นเพื่อจัดหาแรงงานต้นทุนต่ำ เพื่อตอบสนองความต้องการการประมวลผลข้อมูลของยักษ์ใหญ่ใน Silicone Valley.
การเสริมข้อมูลจริงแทนการทดแทน
ประโยชน์เหล่านี้ของข้อมูลสังเคราะห์สามารถนำไปใช้ได้ หากไม่ถือว่าเป็นการทดแทนข้อมูลจริง แต่บทบาทของมันควรเป็นการเสริมชุดข้อมูลจริง เพื่อเพิ่มขนาดของจุดข้อมูลที่มีอยู่
เพื่อให้เข้าใจบริบท LLM ที่กำลังจะเปิดตัวของ Meta, LLAMA Behemoth, กำลังถูกฝึกด้วยข้อมูลจำนวน 30 ล้านล้านจุดข้อมูล. อย่างชัดเจน การหาข้อมูลจริงในระดับนี้เป็นเรื่องท้าทาย หากไม่ใช่เป็นไปไม่ได้ อย่างไรก็ตาม ตามที่ได้กล่าวไว้ การใช้ข้อมูลจริงยังคงเป็นสิ่งจำเป็น ไม่ว่าจะเป็นการฝึกโมเดลที่สร้างข้อมูลสังเคราะห์ หรือการทำให้ข้อมูลสังเคราะห์สอดคล้องกับข้อมูลจริงเพื่อความแม่นยำและหลีกเลี่ยงการล่มของโมเดล ในระดับที่ LLM ทำงานอยู่ในขณะนี้ แม้ว่าข้อมูลสังเคราะห์จะเป็นส่วนสำคัญของข้อมูลฝึกก็ยังคงมีความต้องการข้อมูลจริงอย่างมาก และหมายความว่าจะยังคงมีประเด็นซับซ้อนที่ต้องแก้ไขเกี่ยวกับการควบคุมการเข้าถึง, ความลำเอียง, ค่าใช้จ่ายและเวลา












