ผู้นำทางความคิด
ความเข้าใจในโครงสร้าง On-Premise Data Lakehouse
ในภูมิทัศน์ธนาคารที่ขับเคลื่อนด้วยข้อมูลในปัจจุบัน ความสามารถในการจัดการและวิเคราะห์ข้อมูลจำนวนมากอย่างมีประสิทธิภาพเป็นสิ่งสำคัญสำหรับการรักษาความได้เปรียบในการแข่งขัน Data Lakehouse นำเสนอแนวคิดที่ปฏิวัติวิธีการจัดการข้อมูลในภาคการเงิน โครงสร้างนี้รวมคุณสมบัติที่ดีที่สุดของ Data Warehouse และ Data Lake ให้เราได้ใช้แพลตฟอร์มที่รวมกันสำหรับการเก็บข้อมูล การประมวลผล และการวิเคราะห์ข้อมูลทั้งแบบโครงสร้างและไม่มีโครงสร้าง ทำให้โครงสร้างนี้เป็นทรัพย์สินที่มีค่าสำหรับธนาคารที่ต้องการใช้ข้อมูลเพื่อการตัดสินใจเชิงกลยุทธ์
วิวัฒนาการของโครงสร้างข้อมูล
การเดินทางสู่ Data Lakehouse เป็นกระบวนการวิวัฒนาการ โครงสร้างข้อมูลแบบดั้งเดิมได้กลายเป็นรากฐานของการวิเคราะห์ธนาคาร โดยให้การเก็บข้อมูลแบบโครงสร้างและความสามารถในการค้นหาที่รวดเร็ว อย่างไรก็ตาม ด้วยการระเบิดของข้อมูลที่ไม่มีโครงสร้างจากแหล่งต่างๆ รวมถึงโซเชียลมีเดีย การโต้ตอบของลูกค้า และอุปกรณ์ IoT ทำให้ Data Lake เกิดขึ้นเป็นวิธีแก้ปัญหาในการเก็บข้อมูลดิบจำนวนมาก
Data Lakehouse แสดงถึงขั้นตอนต่อไปในกระบวนการวิวัฒนาการนี้ โดยเชื่อมช่องว่างระหว่าง Data Warehouse และ Data Lake สำหรับธนาคารอย่าง Akbank สิ่งนี้หมายความว่าเราสามารถเพลิดเพลินกับคุณสมบัติที่ดีที่สุดของทั้งสองโลก – โครงสร้างและประสิทธิภาพของ Data Warehouse และความยืดหยุ่นและความสามารถในการปรับขนาดของ Data Lake
แนวคิดหลักของ Data Lakehouse
โครงสร้างแบบผสมผสาน
ที่แก่นแท้ Data Lakehouse นำคุณสมบัติที่ดีที่สุดของ Data Lake และ Data Warehouse มารวมกัน โครงสร้างแบบผสมผสานนี้ช่วยให้ธนาคารสามารถเก็บข้อมูลดิบจำนวนมากได้ ในขณะเดียวกันก็ยังคงสามารถทำการค้นหาที่ซับซ้อนได้อย่างรวดเร็ว
แพลตฟอร์มข้อมูลที่รวมกัน
หนึ่งในข้อได้เปรียบที่สำคัญที่สุดของ Data Lakehouse คือความสามารถในการรวมข้อมูลที่มีโครงสร้างและไม่มีโครงสร้างในแพลตฟอร์มเดียว สำหรับธนาคาร สิ่งนี้หมายความว่าเราสามารถวิเคราะห์ข้อมูลธุรกรรมแบบดั้งเดิมพร้อมๆ กับข้อมูลที่ไม่มีโครงสร้างจากการโต้ตอบของลูกค้า โดยให้มุมมองที่ครอบคลุมมากขึ้นเกี่ยวกับธุรกิจและลูกค้าของเรา
คุณสมบัติและประโยชน์หลัก
Data Lakehouse มีคุณสมบัติและประโยชน์หลายอย่างที่มีคุณค่าอย่างยิ่งในภาคการเงิน
ความสามารถในการปรับขนาด
เมื่อปริมาณข้อมูลของเราขยายตัว โครงสร้าง Lakehouse สามารถปรับขนาดได้อย่างง่ายดายเพื่อรองรับการเติบโตนี้ สิ่งนี้มีความสำคัญอย่างยิ่งในการธนาคาร โดยที่เรากำลังสะสมข้อมูลธุรกรรมและข้อมูลลูกค้าจำนวนมากอย่างต่อเนื่อง โครงสร้าง Lakehouse ช่วยให้เราสามารถขยายความจุและความสามารถในการประมวลผลของเราได้โดยไม่หยุดชะงักการดำเนินงานที่มีอยู่
ความยืดหยุ่น
เราสามารถเก็บและวิเคราะห์หลายประเภทของข้อมูล ตั้งแต่บันทึกธุรกรรมไปจนถึงอีเมลของลูกค้า ความยืดหยุ่นนี้มีคุณค่าอย่างยิ่งในสภาพแวดล้อมการธนาคารในปัจจุบัน โดยที่ข้อมูลที่ไม่มีโครงสร้างจากโซเชียลมีเดีย การโต้ตอบของลูกค้า และแหล่งอื่นๆ สามารถให้ข้อมูลเชิงลึกที่มีค่าเมื่อรวมกับข้อมูลที่มีโครงสร้างแบบดั้งเดิม
การวิเคราะห์แบบเรียลไทม์
สิ่งนี้มีความสำคัญอย่างยิ่งสำหรับการตรวจจับการฉ้อโกง การประเมินความเสี่ยง และการให้ประสบการณ์ลูกค้าที่เป็นส่วนตัว ในการธนาคาร ความสามารถในการวิเคราะห์ข้อมูลแบบเรียลไทม์สามารถหมายถึงความแตกต่างระหว่างการหยุดธุรกรรมที่ฉ้อโกงและการสูญเสียเงินหลายล้าน นอกจากนี้ยังช่วยให้เราสามารถให้บริการที่เป็นส่วนตัวและตัดสินใจได้อย่างรวดเร็วเกี่ยวกับการอนุมัติสินเชื่อหรือคำแนะนำการลงทุน
ความคุ้มค่า
โดยการรวมโครงสร้างข้อมูลของเรา เราสามารถลดต้นทุนโดยรวมได้ แทนที่จะรักษาระบบที่แยกจากกันสำหรับการจัดเก็บข้อมูลและวิเคราะห์ข้อมูลขนาดใหญ่ Data Lakehouse ช่วยให้เราสามารถรวมฟังก์ชันเหล่านี้ได้ สิ่งนี้ไม่เพียงแต่ลดต้นทุนฮาร์ดแวร์และซอฟต์แวร์ แต่ยังทำให้โครงสร้าง IT ของเราง่ายขึ้น ซึ่งนำไปสู่ต้นทุนการบำรุงรักษาและดำเนินการที่ต่ำลง
การกำกับดูแลข้อมูล
ความสามารถที่ดีขึ้นในการนำแนวปฏิบัติในการกำกับดูแลข้อมูลที่เข้มแข็ง ซึ่งจำเป็นในอุตสาหกรรมที่มีการควบคุมอย่างเข้มงวดของเรา โครงสร้าง Lakehouse ที่รวมกันทำให้ง่ายต่อการนำมาตรฐานคุณภาพข้อมูล ความปลอดภัย และความเป็นส่วนตัวที่สม่ำเสมอไปทั่วทั้งข้อมูลของเรา สิ่งนี้มีความสำคัญอย่างยิ่งในการธนาคาร โดยที่เราต้องปฏิบัติตามข้อบังคับที่เข้มงวด เช่น GDPR, PSD2 และข้อบังคับการธนาคารระดับชาติต่างๆ
โครงสร้าง On-Premise Data Lakehouse
Data Lakehouse On-Premise คือโครงสร้าง Data Lakehouse ที่นำไปใช้ภายในศูนย์ข้อมูลขององค์กรเอง แทนที่จะอยู่บนคลาวด์ สำหรับหลายธนาคาร รวมถึง Akbank การเลือกใช้โซลูชัน On-Premise มักถูกขับเคลื่อนโดยข้อกำหนดด้านกฎระเบียบ ความกังวลเรื่องความเป็นส่วนตัวของข้อมูล และความจำเป็นในการควบคุมโครงสร้างข้อมูลของเราอย่างสมบูรณ์
โครงสร้างที่ละเอียดของ On-Premise Data Lakehouse
ชั้นการเก็บข้อมูล
ชั้นการเก็บข้อมูลเป็นพื้นฐานของ Data Lakehouse On-Premise เราใช้การผสมผสานระหว่าง Hadoop Distributed File System (HDFS) และโซลูชันการเก็บข้อมูลแบบอ็อบเจ็กต์ในการจัดการคลังข้อมูลขนาดใหญ่ของเรา สำหรับข้อมูลที่มีโครงสร้าง เช่น ข้อมูลบัญชีลูกค้าและบันทึกธุรกรรม เราใช้ Apache Iceberg รูปแบบตารางที่เปิดซึ่งให้ประสิทธิภาพที่ดีเยี่ยมสำหรับการค้นหาข้อมูลและอัปเดตชุดข้อมูลขนาดใหญ่ สำหรับข้อมูลที่มีการเปลี่ยนแปลงอย่างต่อเนื่อง เช่น บันทึกธุรกรรมแบบเรียลไทม์ เราใช้ Apache Hudi ซึ่งอนุญาตให้ทำการอัปเดตและประมวลผลแบบเพิ่มเติม
ชั้นการประมวลผลข้อมูล
ชั้นการประมวลผลข้อมูลคือที่ที่ “เวทมนตร์” เกิดขึ้น เราใช้การประมวลผลแบบแบตช์และแบบเรียลไทม์ในการจัดการความต้องการข้อมูลที่หลากหลายของเรา
สำหรับกระบวนการ ETL เราใช้ Informatica PowerCenter ซึ่งช่วยให้เราสามารถรวมข้อมูลจากแหล่งต่างๆ ทั่วทั้งธนาคารได้ เราเริ่มรวม dbt (data build tool) สำหรับการแปลงข้อมูลในคลังข้อมูลของเรา
Apache Spark มีบทบาทสำคัญในการประมวลผลข้อมูลขนาดใหญ่ของเรา โดยช่วยให้เราสามารถทำการวิเคราะห์ที่ซับซ้อนบนชุดข้อมูลขนาดใหญ่ สำหรับการประมวลผลแบบเรียลไทม์ โดยเฉพาะสำหรับการตรวจจับการฉ้อโกงและการให้ข้อมูลเชิงลึกของลูกค้าแบบเรียลไทม์ เราใช้ Apache Flink
การค้นหาและวิเคราะห์
เพื่อให้นักวิทยาศาสตร์ข้อมูลและนักวิเคราะห์ของเราสามารถค้นหาข้อมูลเชิงลึกจาก Data Lakehouse ของเราได้ เราได้ใช้ Trino สำหรับการค้นหาที่โต้ตอบ ซึ่งช่วยให้เราสามารถทำการค้นหาด้วย SQL ที่รวดเร็วทั่วทั้งคลังข้อมูลของเรา ไม่ว่าข้อมูลจะเก็บไว้ที่ไหน
การจัดการเมตาดาต้า
การจัดการเมตาดาต้าที่มีประสิทธิภาพเป็นสิ่งสำคัญสำหรับการรักษาความเป็นระเบียบใน Data Lakehouse ของเรา เราใช้ Apache Hive metastore ร่วมกับ Apache Iceberg เพื่อทำแค็ตตาล็อกและดัชนีข้อมูลของเรา เราได้ใช้ Amundsen เครื่องมือเมตาดาต้าแบบเปิดซึ่งพัฒนาโดย LinkedIn เพื่อช่วยให้ทีมข้อมูลของเราค้นพบและเข้าใจข้อมูลที่มีอยู่ในคลังข้อมูลของเรา
ความปลอดภัยและกำกับดูแล
ในภาคการธนาคาร ความปลอดภัยและกำกับดูแลเป็นสิ่งสำคัญ เราใช้ Apache Ranger สำหรับการควบคุมการเข้าถึงและความเป็นส่วนตัวของข้อมูล โดยรับประกันว่าข้อมูลลูกค้าที่ไวต้องตัวจะเข้าถึงได้เฉพาะบุคลากรที่ได้รับอนุญาตเท่านั้น สำหรับการสืบเสาะและตรวจสอบข้อมูล เราใช้ Apache Atlas ซึ่งช่วยให้เราสามารถติดตามการไหลของข้อมูลผ่านระบบของเราและปฏิบัติตามข้อกำหนดด้านกฎระเบียบ
ข้อพิจารณาในการใช้งาน
ความต้องการด้านโครงสร้างพื้นฐาน
การนำ Data Lakehouse On-Premise ไปใช้จำเป็นต้องมีการลงทุนโครงสร้างพื้นฐานที่สำคัญ ที่ Akbank เราต้องอัปเกรดฮาร์ดแวร์ของเราเพื่อรับมือกับความต้องการเก็บข้อมูลและประมวลผลที่เพิ่มขึ้น ซึ่งรวมถึงเซิร์ฟเวอร์ประสิทธิภาพสูง อุปกรณ์เครือข่ายที่แข็งแกร่ง และโซลูชันเก็บข้อมูลที่สามารถปรับขนาดได้
การบูรณาการกับระบบที่มีอยู่
หนึ่งในความท้าทายหลักของเราคือการบูรณาการ Data Lakehouse กับระบบที่มีอยู่ของเรา เราได้พัฒนากลยุทธ์การย้ายข้อมูลแบบขั้นตอน โดยย้ายข้อมูลและกระบวนการจากระบบเก่าไปยังโครงสร้างใหม่แบบค่อยเป็นค่อยไป วิธีนี้ช่วยให้เราสามารถรักษาความต่อเนื่องของธุรกิจในขณะที่เปลี่ยนไปใช้ระบบใหม่
ประสิทธิภาพและความสามารถในการปรับขนาด
การรับประกันประสิทธิภาพสูงในขณะที่ข้อมูลของเราขยายตัวเป็นจุดสนใจหลักของเรา เราได้ใช้กลยุทธ์การแบ่งข้อมูลและปรับให้เหมาะสมกับเครื่องมือค้นหาของเรา เพื่อรักษาเวลาตอบสนองการค้นหาที่รวดเร็วแม้ปริมาณข้อมูลจะเพิ่มขึ้น
ความท้าทายและแนวปฏิบัติที่ดีที่สุด
ความท้าทายทั่วไป
ในระหว่างการเดินทางของเราในการใช้งาน Data Lakehouse On-Premise เราได้เผชิญกับความท้าทายหลายอย่าง:
- ปัญหาการบูรณาการข้อมูล โดยเฉพาะกับระบบเก่า
- การรักษาความสามารถในการทำงานในขณะที่ปริมาณข้อมูลเพิ่มขึ้น
- การรับประกันคุณภาพข้อมูลทั่วทั้งแหล่งข้อมูลที่หลากหลาย
- การฝึกอบรมทีมของเราเกี่ยวกับเทคโนโลยีและกระบวนการใหม่
แนวปฏิบัติที่ดีที่สุด
นี่คือแนวปฏิบัติที่ดีที่สุดที่เราได้ใช้:
- ใช้การกำกับดูแลข้อมูลที่เข้มแข็งตั้งแต่เริ่มต้น
- ลงทุนในเครื่องมือและกระบวนการคุณภาพข้อมูล
- ให้การฝึกอบรมที่ครอบคลุมแก่ทีมของคุณ
- เริ่มต้นด้วยโครงการนำร่องก่อนที่จะใช้งานเต็มรูปแบบ
- ตรวจสอบและปรับให้เหมาะสมโครงสร้างของเราบ่อยๆ
แนวโน้มในอนาคต
เมื่อมองไปข้างหน้า เราเห็นแนวโน้มที่น่าตื่นเต้นหลายอย่างในพื้นที่ Data Lakehouse:
- การนำ AI และ Machine Learning มาใช้มากขึ้นในการจัดการและวิเคราะห์ข้อมูล
- การบูรณาการ Edge Computing กับ Data Lakehouse
- การเพิ่มการทำงานอัตโนมัติในการกำกับดูแลและจัดการคุณภาพข้อมูล
- การวิวัฒนาการอย่างต่อเนื่องของเทคโนโลยีแบบเปิดซึ่งรองรับโครงสร้าง Data Lakehouse
สรุป
Data Lakehouse On-Premise เป็นตัวแทนของขั้นตอนสำคัญในการจัดการข้อมูลสำหรับภาคการธนาคาร ที่ Akbank มันทำให้เราได้รับโอกาสในการรวมโครงสร้างข้อมูลของเรา เพิ่มความสามารถในการวิเคราะห์ และรักษามาตรฐานสูงสุดของความปลอดภัยและกำกับดูแลข้อมูล
เมื่อเราเดินหน้าต่อไปในภูมิทัศน์ที่เปลี่ยนแปลงอย่างรวดเร็วของเทคโนโลยีการธนาคาร โครงสร้าง Data Lakehouse จะมีบทบาทสำคัญอย่างไม่ต้องสงสัยในการใช้ข้อมูลเพื่อความได้เปรียบเชิงกลยุทธ์ สำหรับธนาคารที่ต้องการอยู่ในระดับแข่งขันในยุคดิจิทัล การพิจารณาโครงสร้าง Data Lakehouse – ไม่ว่าจะเป็น On-Premise หรือบนคลาวด์ – ไม่ใช่สิ่งที่เลือกได้อีกต่อไป แต่เป็นสิ่งจำเป็น












