ผู้นำทางความคิด
ความสำคัญของคุณภาพข้อมูลในโครงการนำร่อง AI

เทคโนโลยี Artificial Intelligence และ Machine Learning สามารถให้ประโยชน์อย่างมากต่ออุตสาหกรรมทุกขนาด ตามรายงานของ McKinsey รายงาน ระบุว่าธุรกิจที่ใช้เทคโนโลยี AI จะเพิ่มกระแสเงินสดเป็นสองเท่าภายในปี 2030 ในทางกลับกัน บริษัทที่ไม่นำ AI ไปใช้จะเห็นกระแสเงินสดลดลง 20% อย่างไรก็ตาม ประโยชน์เหล่านี้ไม่เพียงแต่เกี่ยวกับเงินเท่านั้น AI ยังช่วยให้ธุรกิจ ต่อสู้กับการขาดแคลนแรงงาน AI ยังช่วยปรับปรุงประสบการณ์ของลูกค้าและผลลัพธ์ของธุรกิจ ทำให้ธุรกิจมีความน่าเชื่อถือมากขึ้น
เนื่องจาก AI มีประโยชน์มากมาย ทำไมธุรกิจทุกแห่งจึงไม่นำ AI ไปใช้ ในปี 2019 การสำรวจของ PwC ระบุว่า 76% ของบริษัทวางแผนจะใช้ AI เพื่อปรับปรุงมูลค่าของธุรกิจ อย่างไรก็ตาม มีเพียง 15% เท่านั้นที่มีข้อมูลคุณภาพสูงเพียงพอที่จะบรรลุเป้าหมายทางธุรกิจ อีก การศึกษา หนึ่งโดย Refinitiv เผยให้เห็นว่า 66% ของผู้ตอบแบบสอบถามระบุว่าข้อมูลคุณภาพต่ำขัดขวางความสามารถในการนำ AI ไปใช้อย่างมีประสิทธิภาพ
การสำรวจพบว่าความท้าทายที่สำคัญที่สุดสามประการในการทำงานกับเทคโนโลยี Machine Learning และ AI คือ “ข้อมูลที่ถูกต้องเกี่ยวกับการครอบคลุม ประวัติ และประชากรของข้อมูล” “การระบุบันทึกที่ไม่สมบูรณ์หรือเสียหาย” และ “การทำความสะอาดและมาตรฐานข้อมูล” สิ่งนี้แสดงให้เห็นว่าข้อมูลคุณภาพต่ำเป็นอุปสรรคหลักสำหรับธุรกิจในการได้รับข้อมูลเชิงลึกจาก AI ที่มีคุณภาพ
ทำไมข้อมูลจึงมีความสำคัญ?
มีหลายเหตุผลที่ทำให้ข้อมูลมีความสำคัญในโครงการนำร่อง AI ดังนี้คือเหตุผลที่สำคัญที่สุด
1. Garbage In and Garbage Out
เป็นเรื่องง่ายที่จะเข้าใจว่าผลลัพธ์ขึ้นอยู่กับข้อมูลเข้า ในกรณีนี้ หากชุดข้อมูลเต็มไปด้วยข้อผิดพลาดหรือมีความเอนเอียง ผลลัพธ์ จะไม่ถูกต้อง ปัญหาส่วนใหญ่ที่เกี่ยวข้องกับข้อมูลไม่ใช่เรื่องของ ปริมาณ ข้อมูล แต่เป็น คุณภาพ ของข้อมูลที่คุณป้อนเข้าไปในโมเดล AI หากคุณมีข้อมูลคุณภาพต่ำ โมเดล AI ของคุณจะไม่ทำงานอย่างถูกต้อง ไม่ว่าจะดีเพียงใด
2. Not All AI Systems are Equal
เมื่อเราคิดถึงชุดข้อมูล เรามักคิดในแง่ของข้อมูลเชิงปริมาณ แต่ก็มีข้อมูลเชิงคุณภาพในรูปแบบของวิดีโอ สัมภาษณ์ส่วนตัว ความคิดเห็น รูปภาพ ฯลฯ ในระบบ AI ข้อมูลเชิงปริมาณมีโครงสร้าง ข้อมูลเชิงคุณภาพไม่มีโครงสร้าง ไม่ใช่ทุกโมเดล AI ที่สามารถจัดการทั้งสองประเภทของชุดข้อมูลได้ ดังนั้น การเลือกประเภทข้อมูลที่เหมาะสมสำหรับโมเดลที่เหมาะสมจึงจำเป็นต่อการได้รับผลลัพธ์ที่คาดหวัง
3. Quality vs. Quantity
เชื่อกันว่าระบบ AI ต้องการข้อมูลจำนวนมากเพื่อเรียนรู้จากมัน ในการถกเถียงเกี่ยวกับคุณภาพเทียบกับปริมาณ บริษัทต่างๆ มักจะชอบปริมาณมากกว่า อย่างไรก็ตาม หากชุดข้อมูลมีคุณภาพสูงแต่สั้นกว่า จะให้การรับประกันว่าผลลัพธ์มีความเกี่ยวข้องและแข็งแกร่ง
4. Characteristics of a Good Dataset
ลักษณะของชุดข้อมูลที่ดีอาจเป็นเรื่องส่วนตัวและขึ้นอยู่กับว่า AI ให้บริการอะไร อย่างไรก็ตาม มีลักษณะทั่วไปบางประการที่คุณควรพิจารณาเมื่อวิเคราะห์ชุดข้อมูล
- ความสมบูรณ์: ชุดข้อมูลต้องสมบูรณ์โดยไม่มีช่องว่างหรือจุดในข้อมูล ทุกเซลล์ควรมีข้อมูลอยู่ในนั้น
- ความครอบคลุม: ชุดข้อมูลควรครอบคลุมที่สุดเท่าที่จะเป็นไปได้ ตัวอย่างเช่น หากคุณกำลังมองหาวекторภัยคุกคามทางไซเบอร์ คุณจะต้องมีรูปแบบลายเซ็นทั้งหมดและข้อมูลที่จำเป็นทั้งหมด
- ความสอดคล้อง: ชุดข้อมูลต้องสอดคล้องกับตัวแปรที่กำหนดให้ ตัวอย่างเช่น หากคุณกำลังสร้างแบบจำลองกล่องบรรจุภัณฑ์ ตัวแปรที่คุณเลือก (พลาสติก กระดาษ กล่องกระดาษ ฯลฯ) ควรจะมีข้อมูลราคาให้เหมาะสมกับประเภทเหล่านั้น
- ความถูกต้อง: ความถูกต้องเป็นกุญแจสำคัญของชุดข้อมูลที่ดี ทุกข้อมูลที่คุณป้อนเข้าไปในโมเดล AI ต้องเชื่อถือได้และถูกต้อง หากส่วนใหญ่ของชุดข้อมูลของคุณไม่ถูกต้อง ผลลัพธ์ก็จะไม่ถูกต้องเช่นกัน
- ความเป็นเอกลักษณ์: จุดนี้คล้ายกับความสอดคล้อง ทุกจุดข้อมูลต้องเป็นเอกลักษณ์สำหรับตัวแปรที่ให้บริการ ตัวอย่างเช่น คุณไม่ต้องการให้ราคาปลาสติกห่ออาหารตกลงไปในประเภทบรรจุภัณฑ์อื่น
การรับประกันคุณภาพข้อมูล
มีหลายวิธีในการรับประกันว่าคุณภาพข้อมูลสูง เช่น การรับประกันว่าแหล่งข้อมูลน่าเชื่อถือ ต่อไปนี้คือเทคนิคที่ดีที่สุดในการรับประกันว่าคุณจะได้รับข้อมูลคุณภาพสูงสุดสำหรับโมเดล AI ของคุณ
1. Data Profiling
การทำโปรไฟล์ข้อมูลเป็นสิ่งจำเป็นในการทำความเข้าใจข้อมูลก่อนใช้งาน การทำโปรไฟล์ข้อมูลให้ข้อมูลเชิงลึกเกี่ยวกับการกระจายของค่า ค่าสูงสุด ค่าต่ำสุด ค่าเฉลี่ย และค่าผิดปกติ นอกจากนี้ยังช่วยในการจัดรูปแบบความไม่สอดคล้องของข้อมูล การทำโปรไฟล์ข้อมูลช่วยให้เข้าใจได้ว่าชุดข้อมูลนั้นใช้ได้หรือไม่
2. Evaluating Data Quality
โดยใช้ห้องสมุดกลางของกฎการตรวจสอบคุณภาพข้อมูลที่สร้างไว้ล่วงหน้า คุณสามารถตรวจสอบชุดข้อมูลใดๆ ได้ หากคุณมีแค็ตตาล็อกข้อมูลที่มีเครื่องมือข้อมูลที่สร้างไว้ คุณสามารถใช้กฎเหล่านั้นซ้ำเพื่อตรวจสอบชื่อลูกค้า อีเมล และรหัสสินค้า นอกจากนี้คุณยังสามารถเพิ่มและมาตรฐานข้อมูลบางส่วนได้
3. Monitoring and Evaluating Data Quality
นักวิทยาศาสตร์มีคุณภาพข้อมูลที่คำนวณไว้ล่วงหน้าสำหรับชุดข้อมูลส่วนใหญ่ที่ต้องการใช้ พวกเขาสามารถแคบลงเพื่อดูว่าปัญหาที่เฉพาะเจาะจงของคุณมีอะไรบ้าง และตัดสินใจว่าจะใช้คุณลักษณะนั้นหรือไม่
4. Data Preparation
นักวิจัยและนักวิทยาศาสตร์通常ต้องปรับข้อมูลเล็กน้อยเพื่อเตรียมให้พร้อมสำหรับการสร้างแบบจำลอง AI นักวิจัยเหล่านี้ต้องการเครื่องมือที่ใช้งานง่ายเพื่อแยกคุณลักษณะ คอลัมน์ และคำนวณค่าจากข้อมูล
โลกของ AI เปลี่ยนแปลงอย่างต่อเนื่อง ในขณะที่แต่ละบริษัทใช้ข้อมูลในทางที่แตกต่างกัน คุณภาพข้อมูลยังคงจำเป็นต่อโครงการนำร่อง AI ทุกโครงการ หากคุณมีข้อมูลที่เชื่อถือได้และมีคุณภาพ คุณสามารถลดความจำเป็นในการมีชุดข้อมูลขนาดใหญ่และเพิ่มโอกาสในการประสบความสำเร็จ หากองค์กรของคุณกำลังเปลี่ยนไปสู่การนำร่อง AI ตรวจสอบว่าคุณมีข้อมูลที่มีคุณภาพดีหรือไม่ ตรวจสอบให้แน่ใจว่าแหล่งข้อมูลของคุณน่าเชื่อถือและดำเนินการตรวจสอบความถูกต้องเพื่อตรวจสอบว่าพวกเขาสอดคล้องกับความต้องการข้อมูลของคุณหรือไม่












