พื้นฐาน AI
คลังข้อมูลคืออะไร? สถาปัตยกรรม, ETL, และกรณีการใช้งาน
คลังข้อมูลคือระบบข้อมูลเชิงวิเคราะห์ที่รวมข้อมูลจากแหล่งปฏิบัติการและจัดระเบียบเพื่อการรายงาน, ปัญญาธุรกิจ, และการวิเคราะห์ที่ทำซ้ำได้ มันแยกภาระงานเชิงวิเคราะห์หลายอย่างออกจากแอปพลิเคชันที่บันทึกการทำธุรกรรม
คลังข้อมูลสมัยใหม่อาจเป็นแบบคอลัมน์, แบบกระจาย, แบบไม่มีเซิร์ฟเวอร์, หรือเชื่อมต่อกับการจัดเก็บแบบอ็อบเจกต์ งานที่กำหนดยังคงสอดคล้อง: การรับข้อมูลที่ควบคุม, ความหมายที่โมเดล, ประวัติ, ประสิทธิภาพการสืบค้น, ความปลอดภัย, คุณภาพ, และการส่งมอบที่เชื่อถือได้ให้กับผู้ใช้
ประเด็นสำคัญ
- ระบบปฏิบัติการมุ่งเน้นการทำธุรกรรมในปัจจุบัน; คลังข้อมูลมุ่งเน้นการวิเคราะห์เชิงประวัติศาสตร์ข้ามแหล่งข้อมูล
- ETL ทำการแปลงก่อนการโหลด, ในขณะที่ ELT โหลดก่อนและทำการแปลงภายในแพลตฟอร์มเชิงวิเคราะห์
- โมเดลมิติ, โมเดลแบบทำให้เป็นปกติ, และโมเดลตารางกว้างให้บริการภาระงานและความต้องการการกำกับดูแลที่แตกต่างกัน
- ความเชื่อถือขึ้นอยู่กับแหล่งที่มาของข้อมูล, การทดสอบ, ความสดใหม่, การควบคุมการเข้าถึง, คำจำกัดความเชิงความหมาย, และการตรวจสอบค่าใช้จ่าย

แหล่งข้อมูล, การรับข้อมูล, และการจัดเก็บ
ข้อมูลสามารถมาถึงผ่านการประมวลผลเป็นชุด, การจับการเปลี่ยนแปลงของข้อมูล, สตรีม, ไฟล์, และ API ชั้นการลงจอดจะรักษาบริบทของแหล่งข้อมูล; การแปลงจะทำให้ประเภทเป็นมาตรฐาน, กำจัดข้อมูลซ้ำ, จัดการเหตุการณ์ล่าช้า, และสร้างหน่วยวิเคราะห์ที่นำกลับมาใช้ใหม่ได้
นี่เป็นการขยายกระบวนการทำงานของ ETL ELT ใช้การประมวลผลของคลังข้อมูลสำหรับการแปลง, ในขณะที่ ETL สามารถลดหรือยืนยันข้อมูลก่อนการโหลด ตัวเลือกที่เหมาะสมขึ้นอยู่กับความหน่วง, ความเป็นส่วนตัว, ขนาด, และเครื่องมือ
โมเดลข้อมูลสำหรับคำถาม
โมเดลมิติจัดระเบียบข้อเท็จจริงที่วัดได้รอบมิติอธิบายเช่น ลูกค้า, ผลิตภัณฑ์, และเวลา โมเดลหลักที่ทำให้เป็นปกติสามารถรักษาความสัมพันธ์ขององค์กร, ในขณะที่มาร์ทที่ทำให้เป็นแบบไม่ทำให้เป็นปกติทำให้การสืบค้นทั่วไปง่ายขึ้น
ชั้นเชิงความหมายให้เมตริกที่มีคำนิยามสอดคล้องกัน หากไม่มีมัน ทีมงานอาจสร้างตัวเลขรายได้หรือการรักษาผู้ใช้ที่ดูเหมือนถูกต้องหลายชุดจากแถวเดียวกัน ข้อมูลเชิงโครงสร้าง ยังคงต้องการความหมายที่ตกลงกัน
คลังข้อมูล, แหล่งข้อมูล, และเลคเฮ้าส์
แหล่งข้อมูล (data lake) โดยทั่วไปเก็บไฟล์และข้อมูลดิบหรือประมวลผลที่หลากหลายในการจัดเก็บแบบอ็อบเจกต์ คลังข้อมูลให้บริการตารางเชิงวิเคราะห์ที่จัดการและบริการสืบค้น การออกแบบเลคเฮ้าส์เพิ่มเมตาดาต้าตาราง, ธุรกรรม, และการกำกับดูแลให้กับการจัดเก็บในแหล่งข้อมูล
เหล่านี้เป็นรูปแบบสถาปัตยกรรม, ไม่ใช่การรับประกัน องค์กรมักผสานพวกมันผ่าน data fabric หรือชั้นการกำกับดูแลร่วม ภาระงาน, ความเชี่ยวชาญ, ความสามารถทำงานร่วม, และต้นทุนวงจรชีวิตมีความสำคัญมากกว่าป้ายชื่อ
คุณภาพ, ความปลอดภัย, และการดำเนินงาน
กำหนดเจ้าของ, สัญญา, เป้าหมายความสดใหม่, แหล่งที่มาของข้อมูล, การทดสอบ, การเก็บรักษา, และการเข้าถึงแถวหรือคอลัมน์ แยกข้อมูลที่สามารถระบุตัวตนได้ส่วนบุคคล, ใช้หลักการน้อยที่สุด, และตรวจสอบการสืบค้นที่สำคัญ การเติมข้อมูลย้อนหลังและการเปลี่ยนแผนผังต้องมีขั้นตอนที่ควบคุมและสังเกตได้
วัดการรีเฟรชที่สำเร็จ, ความล่าช้าของข้อมูล, ความล้มเหลวของการทดสอบ, ประสิทธิภาพการสืบค้น, การนำไปใช้, ผลกระทบของเหตุการณ์, และต้นทุนต่อภาระงาน คลังข้อมูลมีประโยชน์เมื่อผู้ใช้สามารถติดตามเมตริกไปยังข้อมูลที่กำกับและทำซ้ำผลลัพธ์ได้
การสร้างโมเดลมิติและเชิงความหมาย
ตารางข้อเท็จจริงบันทึกเหตุการณ์หรือการวัดเป็นช่วงเวลาตามระดับที่กำหนด, เช่น รายการสั่งซื้อหนึ่งรายการหรืออุปกรณ์หนึ่งเครื่องต่อชั่วโมง มิติให้บริบทเชิงอธิบาย การกำหนดระดับก่อนเลือกคอลัมน์ป้องกันการผสมระดับที่ทำให้เกิดการนับซ้ำได้ การวัดแบบบวกสามารถรวมได้ทั่วทุกมิติ; การวัดแบบกึ่งบวกต้องระมัดระวังเมื่อครอบคลุมเวลา
คีย์สำรองทำให้ประวัติของคลังข้อมูลแยกจากตัวระบุแหล่งที่เปลี่ยนแปลง มิติที่เปลี่ยนแปลงช้า (slowly changing dimensions) กำหนดวิธีการจัดการการเปลี่ยนแปลงแอตทริบิวต์: เขียนทับ, เก็บแถวประวัติใหม่, หรือเก็บค่าก่อนหน้าที่จำกัด วิธีที่ถูกต้องสอดคล้องกับคำถามเชิงวิเคราะห์และข้อผูกมัดการเก็บรักษา
เมตริกเชิงความหมายควรกำหนดสูตร, ตัวกรอง, พฤติกรรมเวลา, สกุลเงิน, การยกเว้น, เจ้าของ, และการทดสอบ คำจำกัดความศูนย์กลางช่วยลดความไม่สอดคล้อง, แต่การกำกับดูแลควรอนุญาตการเปลี่ยนแปลงที่เสนอและการเวอร์ชัน หากชั้นเชิงความหมายเดียวกลายเป็นคอขวดเมื่อผู้ใช้ไม่สามารถตรวจสอบหรือขยายได้อย่างรับผิดชอบ
สถาปัตยกรรมการจัดเก็บและการสืบค้นสมัยใหม่
การจัดเก็บแบบคอลัมน์เก็บค่าของคอลัมน์ไว้ด้วยกัน, ช่วยเพิ่มการบีบอัดและสแกนเฉพาะฟิลด์ที่ต้องการ การแบ่งพาร์ทิชันตัดส่วนใหญ่ตามวันที่หรือคีย์อื่น; การจัดกลุ่มทำให้ค่าที่เกี่ยวข้องอยู่ใกล้กัน; มุมมองที่ทำสำเนาและแคชนำผลลัพธ์กลับมาใช้ การเลือกพาร์ทิชันที่ไม่ดีทำให้ไฟล์เล็กมาก, การกระจายไม่สมดุล, หรือการสแกนเต็มที่มีค่าใช้จ่ายสูง
เครื่องยนต์สืบค้นแบบขนานมหาศาลแบ่งการสแกน, การเชื่อม, และการรวมข้อมูลไปยังผู้ทำงาน การเคลื่อนย้ายข้อมูลระหว่างการเชื่อมอาจครอบคลุมเวลารัน, ดังนั้นการกระจาย, สถิติ, และลำดับการเชื่อมจึงสำคัญ การปรับขนาดอัตโนมัติและบริการแบบไม่มีเซิร์ฟเวอร์ทำให้ความจุง่ายขึ้นแต่ต้องมีการควบคุมค่าใช้จ่าย, ความสำคัญของภาระงาน, และการจำกัดการสืบค้นที่วิ่งเกิน
รูปแบบตารางของเลคเฮ้าส์เพิ่มเมตาดาต้า, สแนปชอต, การพัฒนาแผนผัง, และความหมายของธุรกรรมบนไฟล์อ็อบเจกต์ พวกมันเพิ่มความสามารถทำงานร่วมกันแต่ก่อให้เกิดความรับผิดชอบด้านแคตาล็อกและการบำรุงรักษา รูปแบบเปิดลดการล็อกอินเฉพาะเจาะจงได้เฉพาะเมื่อเครื่องยนต์คอมพิวต์, การกำกับดูแล, และขั้นตอนการปฏิบัติการสามารถใช้ได้จริง
ไพพ์ไลน์ที่เชื่อถือได้และผลิตภัณฑ์ข้อมูล
ไพพ์ไลน์ควรเป็นแบบ idempotent หรือสามารถประสานข้อมูลซ้ำได้ เครื่องหมายน้ำและเวลาของเหตุการณ์จัดการการมาถึงล่าช้า; การเติมข้อมูลย้อนหลังทำซ้ำการแปลงเชิงประวัติ; สัญญาแผนผังกำหนดการเปลี่ยนแปลงที่เข้ากันได้ การทดสอบข้อมูลครอบคลุมความเป็นเอกลักษณ์, ความครบถ้วน, ค่าที่ยอมรับ, ความสัมพันธ์, และข้อบังคับทางธุรกิจ—not เพียงว่าการทำงานสำเร็จหรือไม่
ถือชุดข้อมูลสำคัญเป็นผลิตภัณฑ์ที่มีเจ้าของ, เอกสาร, ความคาดหวังของบริการ, การค้นพบ, การสนับสนุน, และผู้ใช้ แหล่งที่มาของข้อมูลเชื่อมต่อฟิลด์แหล่งผ่านการแปลงไปยังรายงาน ทำให้ผลกระทบของการเปลี่ยนแปลงและการสืบสวนเหตุการณ์เร็วขึ้น นโยบายการเข้าถึงควรกระจายหรือประเมินใหม่เมื่อข้อมูลถูกคัดลอก
โปรแกรมคลังข้อมูลประสบความสำเร็จเมื่อการตัดสินใจมีความเชื่อถือได้และเร็วขึ้น, ไม่ใช่เมื่อปริมาณการจัดเก็บเพิ่มขึ้น ให้ยกเลิกตารางที่ไม่ได้ใช้, เปิดเผยค่าใช้จ่ายของการสืบค้นและการจัดเก็บ, ตรวจสอบการเข้าถึงที่สำคัญ, และวัดว่าทีมงานเชื่อถือและนำเมตริกที่กำกับกลับมาใช้แทนการดูแลสเปรดชีตส่วนตัวหรือไม่
ตัวอย่างทำงาน: การออกแบบคลังข้อมูลเชิงวิเคราะห์การขาย
กำหนดระดับของข้อเท็จจริงเป็นหนึ่งรายการสั่งซื้อที่เสร็จสมบูรณ์, จากนั้นเชื่อมมิติผลิตภัณฑ์, ลูกค้า, ช่องทาง, โปรโมชั่น, ภูมิศาสตร์, และวันที่ผ่านคีย์สำรอง เก็บเหตุการณ์สถานะการสั่งซื้อในตารางข้อเท็จจริงแยกต่างหากแทนการผสานสแนปชอตและธุรกรรม รายได้, ปริมาณ, ส่วนลด, ภาษี, และต้นทุนต้องมีสกุลเงิน, การคืน, การยกเลิก, และกฎการรับรู้ที่ชัดเจน คำนิยามเมตริกควรให้ผลลัพธ์เดียวกันในแดชบอร์ด, โน้ตบุ๊ก, และการกระทบยอดการเงิน
การรับข้อมูลจับการเปลี่ยนแปลงของแหล่ง, ลงจอดข้อมูลดิบที่ไม่เปลี่ยนแปลง, ตรวจสอบแผนผัง, และแปลงเป็นโมเดลสเตจและมิติที่ทดสอบแล้ว การอัปเดตที่มาช้าต้องแก้ไขช่วงเวลาประวัติที่เหมาะสมโดยไม่ทำสำเนาข้อเท็จจริง เปรียบเทียบจำนวนแถวและยอดเงินกับระบบแหล่ง, ทดสอบความเป็นเอกลักษณ์และความสัมพันธ์, และบันทึกแหล่งที่มาจากฟิลด์รายงานไปยังแหล่งข้อมูล การเติมข้อมูลย้อนหลังใช้โค้ดเวอร์ชันและการตรวจสอบแยกก่อนแทนที่ตารางที่เชื่อถือได้
การเข้าถึงแยกตัวระบุลูกค้าออกจากการรวมข้อมูลที่เปิดให้ใช้ได้อย่างกว้างขวางและใช้หลักการน้อยที่สุดตามบทบาทและวัตถุประสงค์ การจัดการภาระงานทำให้แดชบอร์ดผู้บริหารตอบสนองได้เร็วในขณะที่นักวิเคราะห์รันการสืบค้นสำรวจ ตรวจสอบความสดใหม่, การทดสอบที่ล้มเหลว, ค่าใช้จ่ายการสืบค้น, ตารางที่ไม่ได้ใช้, และการเปลี่ยนแปลงเชิงความหมาย คลังข้อมูลประสบความสำเร็จเมื่อเมตริกที่กำกับสนับสนุนการตัดสินใจที่ทำซ้ำได้; การรวมศูนย์ข้อมูลเพียงอย่างเดียวอาจทำให้ความสับสนรวมศูนย์หากความเป็นเจ้าของ, คุณภาพ, และคำนิยามยังไม่ถูกแก้ไข
การกู้คืนจากภัยพิบัติควรกำหนดขอบเขตการสำรองข้อมูล, การคัดลอกข้ามภูมิภาค, การคืนแคตาล็อกและสิทธิ์, การสูญเสียข้อมูลที่ยอมรับได้, และเวลาการกู้คืน ทดสอบการกู้คืนในสภาพแวดล้อมแยกและตรวจสอบเมตริก, ไม่ใช่แค่ไฟล์ คีย์การเข้ารหัส, การกำหนดค่าอัตลักษณ์, โค้ดการประสานงาน, และคำนิยามเชิงความหมายเป็นส่วนหนึ่งของระบบที่สามารถกู้คืนได้ คลังข้อมูลที่สามารถคืนค่าเป็นพีเทบไอต์แต่ไม่สามารถทำซ้ำนโยบายการเข้าถึงหรือการคำนวณที่เชื่อถือได้ไม่ได้กู้คืนบริการเชิงวิเคราะห์ของตน
รายการตรวจสอบการดำเนินการเชิงปฏิบัติ
เปลี่ยนแนวคิดให้เป็นกระบวนการทำงานที่มีขอบเขตและทดสอบได้: source → ingest → transform → model → serve → govern. ตั้งชื่อเจ้าของที่รับผิดชอบ, บันทึกข้อมูลและการพึ่งพา, สร้างฐานข้อมูลพื้นฐานง่าย, กำหนดเกณฑ์การยอมรับและหยุด, ทดสอบความล้มเหลวที่เป็นตัวแทน, และกำหนดการเฝ้าระวัง, การย้อนกลับ, และการตรวจสอบก่อนขยายขอบเขต บันทึกเวอร์ชันและสมมติฐานเพื่อให้ทีมอื่นสามารถทำซ้ำผลลัพธ์และเข้าใจการเปลี่ยนแปลง
ก่อนเปิดใช้งาน, ดำเนินการตรวจสอบความพร้อมที่บันทึกไว้กับผู้ที่สร้าง, ดำเนินการ, ปกป้อง, และได้รับผลกระทบจากระบบ ทดสอบกรณีปกติ, เงื่อนไขขอบเขต, ความล้มเหลวของการพึ่งพา, และการใช้งานผิดวิธี; เก็บหลักฐานและความเสี่ยงที่ยังไม่ได้แก้ไข กำหนดว่าใครสามารถอนุมัติการปล่อย, เปลี่ยนเกณฑ์, แทนที่ผลลัพธ์, หรือหยุดการดำเนินงาน ตรวจทานการตัดสินใจหลังจากข้อมูลจริงมาถึง, เพราะการทดลองที่ประสบความสำเร็จทางเทคนิคไม่ได้รับประกันประสิทธิภาพที่เชื่อถือได้ในระดับกว้าง
- ไพพ์ไลน์: แบตช์, สตรีมมิง, ETL, และ ELT.
- โมเดล: ข้อเท็จจริง, มิติ, และเมตริกเชิงความหมาย.
- ความเชื่อถือ: คุณภาพ, แหล่งที่มาของข้อมูล, ความปลอดภัย, และความสดใหม่.
คำถามที่พบบ่อย
คลังข้อมูลเป็นเพียงฐานข้อมูลขนาดใหญ่หรือไม่?
มันเป็นฐานข้อมูลหรือแพลตฟอร์มเชิงวิเคราะห์ที่ออกแบบมาสำหรับการวิเคราะห์เชิงบูรณาการและเชิงประวัติศาสตร์ การสร้างโมเดล, การรับข้อมูล, การกำกับดูแล, และรูปแบบภาระงานของมันแตกต่างจากฐานข้อมูลแอปพลิเคชันการทำธุรกรรม
บริษัทควรใช้ ETL หรือ ELT?
หลายองค์กรใช้ทั้งสองวิธี การแปลงข้อมูลตั้งแต่แรกเมื่อความเป็นส่วนตัว, การตรวจสอบ, หรือแบนด์วิดท์ต้องการ; การแปลงหลังการโหลดเมื่อการประมวลผลของคลังข้อมูลและการทำซ้ำอย่างรวดเร็วเป็นประโยชน์












