ผู้นำทางความคิด

ความสำคัญของคุณภาพข้อมูลในโครงการนำร่อง AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

เทคโนโลยี Artificial Intelligence และ Machine Learning สามารถให้ประโยชน์อย่างมากต่ออุตสาหกรรมทุกขนาด ตามรายงานของ McKinsey รายงาน ระบุว่าธุรกิจที่ใช้เทคโนโลยี AI จะเพิ่มกระแสเงินสดเป็นสองเท่าภายในปี 2030 ในทางกลับกัน บริษัทที่ไม่นำ AI ไปใช้จะเห็นกระแสเงินสดลดลง 20% อย่างไรก็ตาม ประโยชน์เหล่านี้ไม่เพียงแต่เกี่ยวกับเงินเท่านั้น AI ยังช่วยให้ธุรกิจ ต่อสู้กับการขาดแคลนแรงงาน AI ยังช่วยปรับปรุงประสบการณ์ของลูกค้าและผลลัพธ์ของธุรกิจ ทำให้ธุรกิจมีความน่าเชื่อถือมากขึ้น

เนื่องจาก AI มีประโยชน์มากมาย ทำไมธุรกิจทุกแห่งจึงไม่นำ AI ไปใช้ ในปี 2019 การสำรวจของ PwC ระบุว่า 76% ของบริษัทวางแผนจะใช้ AI เพื่อปรับปรุงมูลค่าของธุรกิจ อย่างไรก็ตาม มีเพียง 15% เท่านั้นที่มีข้อมูลคุณภาพสูงเพียงพอที่จะบรรลุเป้าหมายทางธุรกิจ อีก การศึกษา หนึ่งโดย Refinitiv เผยให้เห็นว่า 66% ของผู้ตอบแบบสอบถามระบุว่าข้อมูลคุณภาพต่ำขัดขวางความสามารถในการนำ AI ไปใช้อย่างมีประสิทธิภาพ

การสำรวจพบว่าความท้าทายที่สำคัญที่สุดสามประการในการทำงานกับเทคโนโลยี Machine Learning และ AI คือ “ข้อมูลที่ถูกต้องเกี่ยวกับการครอบคลุม ประวัติ และประชากรของข้อมูล” “การระบุบันทึกที่ไม่สมบูรณ์หรือเสียหาย” และ “การทำความสะอาดและมาตรฐานข้อมูล” สิ่งนี้แสดงให้เห็นว่าข้อมูลคุณภาพต่ำเป็นอุปสรรคหลักสำหรับธุรกิจในการได้รับข้อมูลเชิงลึกจาก AI ที่มีคุณภาพ

ทำไมข้อมูลจึงมีความสำคัญ?

มีหลายเหตุผลที่ทำให้ข้อมูลมีความสำคัญในโครงการนำร่อง AI ดังนี้คือเหตุผลที่สำคัญที่สุด

1. Garbage In and Garbage Out

เป็นเรื่องง่ายที่จะเข้าใจว่าผลลัพธ์ขึ้นอยู่กับข้อมูลเข้า ในกรณีนี้ หากชุดข้อมูลเต็มไปด้วยข้อผิดพลาดหรือมีความเอนเอียง ผลลัพธ์ จะไม่ถูกต้อง ปัญหาส่วนใหญ่ที่เกี่ยวข้องกับข้อมูลไม่ใช่เรื่องของ ปริมาณ ข้อมูล แต่เป็น คุณภาพ ของข้อมูลที่คุณป้อนเข้าไปในโมเดล AI หากคุณมีข้อมูลคุณภาพต่ำ โมเดล AI ของคุณจะไม่ทำงานอย่างถูกต้อง ไม่ว่าจะดีเพียงใด

2. Not All AI Systems are Equal

เมื่อเราคิดถึงชุดข้อมูล เรามักคิดในแง่ของข้อมูลเชิงปริมาณ แต่ก็มีข้อมูลเชิงคุณภาพในรูปแบบของวิดีโอ สัมภาษณ์ส่วนตัว ความคิดเห็น รูปภาพ ฯลฯ ในระบบ AI ข้อมูลเชิงปริมาณมีโครงสร้าง ข้อมูลเชิงคุณภาพไม่มีโครงสร้าง ไม่ใช่ทุกโมเดล AI ที่สามารถจัดการทั้งสองประเภทของชุดข้อมูลได้ ดังนั้น การเลือกประเภทข้อมูลที่เหมาะสมสำหรับโมเดลที่เหมาะสมจึงจำเป็นต่อการได้รับผลลัพธ์ที่คาดหวัง

3. Quality vs. Quantity

เชื่อกันว่าระบบ AI ต้องการข้อมูลจำนวนมากเพื่อเรียนรู้จากมัน ในการถกเถียงเกี่ยวกับคุณภาพเทียบกับปริมาณ บริษัทต่างๆ มักจะชอบปริมาณมากกว่า อย่างไรก็ตาม หากชุดข้อมูลมีคุณภาพสูงแต่สั้นกว่า จะให้การรับประกันว่าผลลัพธ์มีความเกี่ยวข้องและแข็งแกร่ง

4. Characteristics of a Good Dataset

ลักษณะของชุดข้อมูลที่ดีอาจเป็นเรื่องส่วนตัวและขึ้นอยู่กับว่า AI ให้บริการอะไร อย่างไรก็ตาม มีลักษณะทั่วไปบางประการที่คุณควรพิจารณาเมื่อวิเคราะห์ชุดข้อมูล

  • ความสมบูรณ์: ชุดข้อมูลต้องสมบูรณ์โดยไม่มีช่องว่างหรือจุดในข้อมูล ทุกเซลล์ควรมีข้อมูลอยู่ในนั้น
  • ความครอบคลุม: ชุดข้อมูลควรครอบคลุมที่สุดเท่าที่จะเป็นไปได้ ตัวอย่างเช่น หากคุณกำลังมองหาวекторภัยคุกคามทางไซเบอร์ คุณจะต้องมีรูปแบบลายเซ็นทั้งหมดและข้อมูลที่จำเป็นทั้งหมด
  • ความสอดคล้อง: ชุดข้อมูลต้องสอดคล้องกับตัวแปรที่กำหนดให้ ตัวอย่างเช่น หากคุณกำลังสร้างแบบจำลองกล่องบรรจุภัณฑ์ ตัวแปรที่คุณเลือก (พลาสติก กระดาษ กล่องกระดาษ ฯลฯ) ควรจะมีข้อมูลราคาให้เหมาะสมกับประเภทเหล่านั้น
  • ความถูกต้อง: ความถูกต้องเป็นกุญแจสำคัญของชุดข้อมูลที่ดี ทุกข้อมูลที่คุณป้อนเข้าไปในโมเดล AI ต้องเชื่อถือได้และถูกต้อง หากส่วนใหญ่ของชุดข้อมูลของคุณไม่ถูกต้อง ผลลัพธ์ก็จะไม่ถูกต้องเช่นกัน
  • ความเป็นเอกลักษณ์: จุดนี้คล้ายกับความสอดคล้อง ทุกจุดข้อมูลต้องเป็นเอกลักษณ์สำหรับตัวแปรที่ให้บริการ ตัวอย่างเช่น คุณไม่ต้องการให้ราคาปลาสติกห่ออาหารตกลงไปในประเภทบรรจุภัณฑ์อื่น

การรับประกันคุณภาพข้อมูล

มีหลายวิธีในการรับประกันว่าคุณภาพข้อมูลสูง เช่น การรับประกันว่าแหล่งข้อมูลน่าเชื่อถือ ต่อไปนี้คือเทคนิคที่ดีที่สุดในการรับประกันว่าคุณจะได้รับข้อมูลคุณภาพสูงสุดสำหรับโมเดล AI ของคุณ

1. Data Profiling

การทำโปรไฟล์ข้อมูลเป็นสิ่งจำเป็นในการทำความเข้าใจข้อมูลก่อนใช้งาน การทำโปรไฟล์ข้อมูลให้ข้อมูลเชิงลึกเกี่ยวกับการกระจายของค่า ค่าสูงสุด ค่าต่ำสุด ค่าเฉลี่ย และค่าผิดปกติ นอกจากนี้ยังช่วยในการจัดรูปแบบความไม่สอดคล้องของข้อมูล การทำโปรไฟล์ข้อมูลช่วยให้เข้าใจได้ว่าชุดข้อมูลนั้นใช้ได้หรือไม่

2. Evaluating Data Quality

โดยใช้ห้องสมุดกลางของกฎการตรวจสอบคุณภาพข้อมูลที่สร้างไว้ล่วงหน้า คุณสามารถตรวจสอบชุดข้อมูลใดๆ ได้ หากคุณมีแค็ตตาล็อกข้อมูลที่มีเครื่องมือข้อมูลที่สร้างไว้ คุณสามารถใช้กฎเหล่านั้นซ้ำเพื่อตรวจสอบชื่อลูกค้า อีเมล และรหัสสินค้า นอกจากนี้คุณยังสามารถเพิ่มและมาตรฐานข้อมูลบางส่วนได้

3. Monitoring and Evaluating Data Quality

นักวิทยาศาสตร์มีคุณภาพข้อมูลที่คำนวณไว้ล่วงหน้าสำหรับชุดข้อมูลส่วนใหญ่ที่ต้องการใช้ พวกเขาสามารถแคบลงเพื่อดูว่าปัญหาที่เฉพาะเจาะจงของคุณมีอะไรบ้าง และตัดสินใจว่าจะใช้คุณลักษณะนั้นหรือไม่

4. Data Preparation

นักวิจัยและนักวิทยาศาสตร์通常ต้องปรับข้อมูลเล็กน้อยเพื่อเตรียมให้พร้อมสำหรับการสร้างแบบจำลอง AI นักวิจัยเหล่านี้ต้องการเครื่องมือที่ใช้งานง่ายเพื่อแยกคุณลักษณะ คอลัมน์ และคำนวณค่าจากข้อมูล

โลกของ AI เปลี่ยนแปลงอย่างต่อเนื่อง ในขณะที่แต่ละบริษัทใช้ข้อมูลในทางที่แตกต่างกัน คุณภาพข้อมูลยังคงจำเป็นต่อโครงการนำร่อง AI ทุกโครงการ หากคุณมีข้อมูลที่เชื่อถือได้และมีคุณภาพ คุณสามารถลดความจำเป็นในการมีชุดข้อมูลขนาดใหญ่และเพิ่มโอกาสในการประสบความสำเร็จ หากองค์กรของคุณกำลังเปลี่ยนไปสู่การนำร่อง AI ตรวจสอบว่าคุณมีข้อมูลที่มีคุณภาพดีหรือไม่ ตรวจสอบให้แน่ใจว่าแหล่งข้อมูลของคุณน่าเชื่อถือและดำเนินการตรวจสอบความถูกต้องเพื่อตรวจสอบว่าพวกเขาสอดคล้องกับความต้องการข้อมูลของคุณหรือไม่

Amy Groden-Morrison มีประสบการณ์มากกว่า 15 ปีในตำแหน่งผู้นำด้านการตลาดและการสื่อสารที่บริษัทต่างๆ เช่น TIBCO Software, RSA Security และ Ziff-Davis ผลงานที่ผ่านมาของเธอ ได้แก่ การจัดตั้งโปรแกรมเทคโนโลยีร่วมแบรนด์แรกกับ CNN การเปิดตัวบริษัทจัดงานบน NYSE การเปลี่ยนแบรนด์บริษัทที่จดทะเบียนใน NASDAQ ในช่วงวิกฤต และการปรับตำแหน่งและการตลาดสตาร์ทอัพในพื้นที่บอสตันเพื่อการเข้าซื้อกิจการสำเร็จ ปัจจุบันเธอเป็น VP of Marketing and Sales Operation สำหรับ Alpha Software