พื้นฐาน AI
ETL คืออะไร (Extract, Transform, Load) วิธีการและกรณีการใช้งาน
ETL ย่อมาจาก “extract, transform, load” เป็นกระบวนการที่รวมข้อมูลจากแหล่งต่างๆ เข้าเป็นคลังข้อมูลเดียว เพื่อให้สามารถประมวลผลและวิเคราะห์ข้อมูลได้ ข้อมูลที่มีประโยชน์นี้คือสิ่งที่ช่วยให้ธุรกิจตัดสินใจโดยใช้ข้อมูลและเติบโต
“ข้อมูลคือน้ำมันใหม่”
Clive Humby นักคณิตศาสตร์
การสร้างข้อมูลทั่วโลกเพิ่มขึ้นอย่างมาก โดยที่ตาม Forbes ในอัตราปัจจุบัน มนุษย์กำลังเพิ่มข้อมูลสองเท่าทุกๆ 2 ปี ดังนั้น สแต็คข้อมูลสมัยใหม่จึงพัฒนาไป ข้อมูลมาร์ทถูกเปลี่ยนเป็นคลังข้อมูล และเมื่อไม่เพียงพอ คลังข้อมูลจึงถูกสร้างขึ้น แต่ในโครงสร้างที่แตกต่างกัน กระบวนการ ETL ยังคงเหมือนเดิม
ในบทความนี้ เราจะมาดูวิธีการของ ETL กรณีการใช้งาน ประโยชน์ และวิธีการที่กระบวนการนี้ช่วยสร้างภูมิทัศน์ข้อมูลสมัยใหม่
วิธีการของ ETL
ETL ทำให้สามารถรวมข้อมูลจากแหล่งต่างๆ เข้าเป็นคลังข้อมูลเดียว เพื่อให้สามารถประมวลผล วิเคราะห์ และแบ่งปันข้อมูลกับผู้มีส่วนได้ส่วนเสียของธุรกิจได้ ETL รับประกันความถูกต้องของข้อมูลที่จะใช้ในการรายงาน การวิเคราะห์ และการทำนายโดยใช้โมเดลการเรียนรู้ของเครื่อง มันเป็นกระบวนการที่มี 3 ขั้นตอน คือ การดึงข้อมูล การแปลงข้อมูล และการโหลดข้อมูลเข้าสู่เครื่องมือธุรกิจอินเทลลิเจนซ์ เครื่องมือเหล่านี้จะถูกใช้โดยธุรกิจเพื่อตัดสินใจโดยใช้ข้อมูล
ขั้นตอนการดึงข้อมูล
ในขั้นตอนนี้ ข้อมูลจะถูกดึงจากแหล่งต่างๆ โดยใช้ SQL คิวรี่ Python โค้ด ระบบจัดการฐานข้อมูล หรือเครื่องมือ ETL แหล่งที่มาโดยทั่วไปคือ
- ซอฟต์แวร์การจัดการความสัมพันธ์กับลูกค้า
- เครื่องมือวิเคราะห์
- คลังข้อมูล
- ฐานข้อมูล
- แพลตฟอร์มจัดเก็บข้อมูลบนคลาวด์
- เครื่องมือขายและตลาด
- แอปพลิเคชันมือถือ
แหล่งเหล่านี้อาจเป็นข้อมูลที่มีโครงสร้างหรือไม่มีโครงสร้าง ซึ่งหมายความว่าข้อมูลในขั้นตอนนี้ไม่มีรูปแบบที่เป็นมาตรฐาน
ขั้นตอนการแปลงข้อมูล
ในขั้นตอนการแปลงข้อมูล ข้อมูลดิบที่ถูกดึงมาจะถูกแปลงและรวบรวมเป็นรูปแบบที่เหมาะสมสำหรับระบบเป้าหมาย เพื่อทำเช่นนี้ ข้อมูลดิบจะผ่านกระบวนการแปลงย่อยๆ เช่น
- การทำความสะอาด – ข้อมูลที่ไม่สอดคล้องกันและข้อมูลที่หายไปจะถูกจัดการ
- การทำให้มาตรฐาน – รูปแบบที่เป็นมาตรฐานจะถูกใช้ทั่วทั้งระบบ
- การลบข้อมูลซ้ำ – ข้อมูลที่ซ้ำกันจะถูกลบออก
- การค้นหาค่าที่ไม่ปกติ – ค่าที่ไม่ปกติจะถูกค้นหาและปรับให้เหมาะสม
- การเรียงลำดับ – ข้อมูลจะถูกจัดเรียงให้เหมาะสมเพื่อเพิ่มประสิทธิภาพ
นอกจากการเปลี่ยนรูปแบบข้อมูลแล้ว ยังมีเหตุผลอื่นๆ ที่ทำให้การแปลงข้อมูลจำเป็น ค่า null หากมีอยู่ในข้อมูล ควรจะถูกลบออก นอกจากนี้ยังมีค่าที่ไม่ปกติซึ่งมักจะพบในข้อมูลและทำให้การวิเคราะห์ไม่ถูกต้อง ค่าที่ไม่ปกติเหล่านี้ควรจะถูกจัดการในขั้นตอนการแปลงข้อมูล บ่อยครั้งเราจะพบข้อมูลที่ซ้ำซ้อนและไม่มีค่าสำหรับธุรกิจ ข้อมูลนี้จะถูกลบออกในขั้นตอนการแปลงข้อมูลเพื่อประหยัดพื้นที่จัดเก็บข้อมูลของระบบ
ขั้นตอนการโหลดข้อมูล
เมื่อข้อมูลดิบถูกดึงมาและผ่านกระบวนการแปลงแล้ว ข้อมูลจะถูกโหลดเข้าสู่ระบบเป้าหมาย ซึ่งมักจะเป็นคลังข้อมูลหรือคลังข้อมูลแบบเล็ก มี 2 วิธีในการทำขั้นตอนการโหลดข้อมูล
- การโหลดเต็ม – ข้อมูลทั้งหมดจะถูกโหลดเข้าระบบเป้าหมายในครั้งแรก การโหลดเต็มเป็นกระบวนการที่มีความซับซ้อนน้อยกว่า แต่ใช้เวลานานกว่า และเหมาะสมเมื่อขนาดของข้อมูลไม่ใหญ่มาก
- การโหลดแบบเพิ่ม – การโหลดแบบเพิ่มเป็นการโหลดข้อมูลเป็นช่วงๆ และมี 2 ประเภทย่อย
- การโหลดแบบเพิ่มแบบสตรีม – ข้อมูลจะถูกโหลดเป็นช่วงๆ โดยปกติจะทำทุกวัน การโหลดแบบสตรีมเหมาะสมเมื่มข้อมูลมีปริมาณน้อย
- การโหลดแบบเพิ่มแบบแบตช์ – ในการโหลดแบบเพิ่มแบบแบตช์ ข้อมูลจะถูกโหลดเป็นชุดๆ โดยมีช่วงเวลาหนึ่งระหว่างชุดๆ การโหลดแบบแบตช์เหมาะสมเมื่อขนาดของข้อมูลใหญ่ และเป็นวิธีที่เร็วกว่าแต่มีความซับซ้อนมากกว่า
ประเภทของเครื่องมือ ETL
ETL สามารถทำได้ 2 วิธี คือ ETL แบบมือและ ETL แบบไม่ต้องเขียนโค้ด ใน ETL แบบมือ ไม่มีการใช้เครื่องมืออัตโนมัติ ทีมงานที่ประกอบด้วยนักวิทยาศาสตร์ข้อมูล นักวิเคราะห์ข้อมูล และวิศวกรข้อมูลจะต้องเขียนโค้ดสำหรับกระบวนการดึงข้อมูล การแปลงข้อมูล และการโหลดข้อมูลสำหรับชุดข้อมูลทั้งหมด สิ่งนี้ทำให้สูญเสียประสิทธิภาพและทรัพยากรอย่างมาก
ทางเลือกคือ ETL แบบไม่ต้องเขียนโค้ด ซึ่งมักจะมีฟังก์ชันการลากและวาง เครื่องมือเหล่านี้สามารถลบการเขียนโค้ดออกไปได้ ทำให้แม้แต่ผู้ที่ไม่ใช่คนในวงการเทคสามารถทำ ETL ได้ ด้วยการออกแบบที่มีปฏิสัมพันธ์และเข้าถึงได้ง่าย ส่วนใหญ่ธุรกิจจะใช้ Informatica, Integrate.io, IBM Storage, Hadoop, Azure, Google Cloud Dataflow และ Oracle (ORCL ) Data Integrator สำหรับการดำเนินงาน ETL
มีเครื่องมือ ETL แบบไม่ต้องเขียนโค้ด 4 ประเภทในอุตสาหกรรมข้อมูล
- เครื่องมือ ETL เชิงพาณิชย์
- เครื่องมือ ETL แบบโอเพ่นซอร์ส
- เครื่องมือ ETL แบบกำหนดเอง
- เครื่องมือ ETL บนคลาวด์
แนวทางปฏิบัติที่ดีที่สุดสำหรับ ETL
มีแนวทางปฏิบัติและพิธีการที่ควรปฏิบัติตามเพื่อให้แน่ใจว่ากระบวนการ ETL ได้รับการปรับให้เหมาะสม แนวทางปฏิบัติที่ดีที่สุดจะถูกอภิปรายด้านล่าง
- การทำความเข้าใจบริบทของข้อมูล – วิธีการรวบรวมข้อมูลและความหมายของเมตริกควรจะเข้าใจอย่างถ่องแท้ จะช่วยระบุว่าคุณลักษณะใดที่ไม่จำเป็นและควรจะถูกลบออก
- จุดตรวจการกู้คืน – ในกรณีที่กระบวนการถูกขัดจังหวะและมีการรั่วไหลของข้อมูล ควรจะมีระเบียบการกู้คืนข้อมูลที่รั่วไหล
- บันทึก ETL – ควรมีบันทึก ETL ที่มีประวัติการดำเนินการของข้อมูลก่อน ระหว่าง และหลังการวนซ้ำของ ETL
- การตรวจสอบ – ควรมีการตรวจสอบข้อมูลในระยะเวลาหนึ่งเพื่อให้แน่ใจว่าข้อมูลอยู่ในสถานะที่คุณต้องการ
- ขนาดข้อมูลเล็ก – ขนาดของฐานข้อมูลและตารางควรจะถูกควบคุมให้เล็ก เพื่อให้ข้อมูลกระจายออกไปในแนวระนาบมากกว่าแนวตั้ง การปฏิบัตินี้ช่วยเพิ่มความเร็วในการประมวลผลและทำให้กระบวนการ ETL เร็วขึ้น
- การสร้างชั้นแคช – ชั้นแคชคือชั้นจัดเก็บข้อมูลที่มีความเร็วสูง ซึ่งจัดเก็บข้อมูลที่ใช้บ่อยบนไดสก์ที่สามารถเข้าถึงได้อย่างรวดเร็ว การปฏิบัตินี้ช่วยประหยัดเวลาเมื่อข้อมูลที่ถูกขอเป็นข้อมูลที่แคชไว้
- การประมวลผลแบบขนาน – การปฏิบัติต่อ ETL เป็นกระบวนการแบบซีเรียลจะกินเวลามากและทรัพยากรของธุรกิจ ทำให้กระบวนการไม่มีประสิทธิภาพ วิธีแก้คือการประมวลผลแบบขนานและการรวม ETL หลายๆ อย่างในครั้งเดียว
กรณีการใช้งาน ETL
ETL ทำให้การดำเนินงานของธุรกิจมีประสิทธิภาพและราบรื่นในหลายๆ ด้าน แต่เราจะพูดถึงกรณีการใช้งานที่ได้รับความนิยม 3 กรณีในบทความนี้
การอัปโหลดไปยังคลาวด์
การเก็บข้อมูลที่ศูนย์กลางมีค่าใช้จ่ายสูง ทำให้ธุรกิจต้องใช้ทรัพยากรในการซื้อ การบำรุงรักษา และการดำเนินงานของเซิร์ฟเวอร์ เพื่อหลีกเลี่ยงปัญหานี้ ธุรกิจสามารถอัปโหลดข้อมูลไปยังคลาวด์ได้โดยตรง ซึ่งช่วยประหยัดทรัพยากรและเวลา ทรัพยากรและเวลาที่ประหยัดได้สามารถนำไปใช้ในการปรับปรุงกระบวนการ ETL อื่นๆ
การรวมข้อมูลจากแหล่งต่างๆ
ข้อมูลมักจะกระจายอยู่ทั่วระบบต่างๆ ภายในองค์กร การรวมข้อมูลจากแหล่งต่างๆ เข้าเป็นจุดเดียวเพื่อให้สามารถประมวลผลและวิเคราะห์ข้อมูลได้ และแบ่งปันข้อมูลกับผู้มีส่วนได้ส่วนเสียในภายหลัง เป็นสิ่งที่ทำได้ด้วยกระบวนการ ETL ETL รับประกันว่าข้อมูลจากแหล่งต่างๆ จะถูกจัดรูปแบบให้เหมือนกันในขณะที่ยังคงความถูกต้องของข้อมูล
การสร้างแบบจำลองการคาดการณ์
การตัดสินใจโดยใช้ข้อมูลเป็นรากฐานของกลยุทธ์ธุรกิจที่ประสบความสำเร็จ ETL ช่วยให้ธุรกิจโดยการดึงข้อมูล การแปลงข้อมูล และการโหลดข้อมูลเข้าสู่ฐานข้อมูลที่เชื่อมต่อกับโมเดลการเรียนรู้ของเครื่อง โมเดลเหล่านี้จะวิเคราะห์ข้อมูลหลังจากที่ผ่านกระบวนการ ETL แล้ว และทำการคาดการณ์ตามข้อมูลนั้น
อนาคตของ ETL ในภูมิทัศน์ข้อมูล
ETL มีบทบาทสำคัญในฐานะกระดูกสันหลังของโครงสร้างข้อมูล แต่ว่าไม่แน่ใจว่าจะยังคงเป็นเช่นนั้นต่อไปหรือไม่ เนื่องจากการแนะนำ Zero ETL ในอุตสาหกรรมเทคที่กำลังจะเปลี่ยนแปลงอย่างมาก ด้วย Zero ETL จะไม่ต้องมีการดึงข้อมูล การแปลงข้อมูล และการโหลดข้อมูลแบบดั้งเดิมอีกต่อไป แต่ข้อมูลจะถูกส่งตรงไปยังระบบเป้าหมายในเวลาที่ใกล้เคียงกับเวลาจริง
มีแนวโน้มที่เกิดขึ้นใหม่มากมายในระบบนิเวศของข้อมูล ลองดู unite.ai เพื่อขยายความรู้ของคุณเกี่ยวกับเทรนด์ทางเทค












