โมเดลและแพลตฟอร์ม AI

LightAutoML: แพลตฟอร์ม AutoML สำหรับบริการทางการเงิน

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

แม้ว่า AutoML จะได้รับความนิยมเมื่อหลายปีที่แล้ว แต่งานวิจัยเกี่ยวกับ AutoML เริ่มต้นขึ้นเมื่อต้นปี 1990 เมื่อนักวิทยาศาสตร์เผยแพร่บทความแรกเกี่ยวกับการเพิ่มประสิทธิภาพไฮเปอร์พารามิเตอร์ ในปี 2014 ICML จัดงานสัมมนา AutoML ครั้งแรก ซึ่ง AutoML ได้รับความสนใจจากนักพัฒนา ML หนึ่งในจุดเน้นสำคัญของ AutoML ในช่วงหลายปีที่ผ่านมา คือ ปัญหาการค้นหาไฮเปอร์พารามิเตอร์ โดยที่โมเดลใช้วิธีการเพิ่มประสิทธิภาพหลายวิธีเพื่อกำหนดไฮเปอร์พารามิเตอร์ที่ทำงานได้ดีที่สุดในพื้นที่ไฮเปอร์พารามิเตอร์ที่ใหญ่สำหรับโมเดลการเรียนรู้ของเครื่องเฉพาะ วิธีการอื่นที่ใช้กันโดยทั่วไปในโมเดล AutoML คือ การประมาณความน่าจะเป็นของไฮเปอร์พารามิเตอร์เฉพาะที่เป็นไฮเปอร์พารามิเตอร์ที่เหมาะสมที่สุดสำหรับโมเดลการเรียนรู้ของเครื่องเฉพาะ โมเดลนี้สามารถทำได้โดยใช้วิธีการเบย์เชียนที่ใช้ข้อมูลทางประวัติศาสตร์จากโมเดลที่ประมาณการไว้ก่อนหน้านี้ และชุดข้อมูลอื่นๆ นอกจากนี้ยังมีวิธีการอื่นๆ ที่พยายามเลือกโมเดลที่ดีที่สุดจากชุดทางเลือกการสร้างแบบจำลอง

ในบทความนี้ เราจะพูดถึง LightAutoML ซึ่งเป็นระบบ AutoML ที่พัฒนาโดยเฉพาะสำหรับบริษัทยุโรปที่ดำเนินธุรกิจในภาคการเงินพร้อมด้วยระบบนิเวศของบริษัทนั้น แพลตฟอร์ม LightAutoML ถูกนำไปใช้ในหลายแอปพลิเคชัน และผลลัพธ์ได้แสดงให้เห็นถึงประสิทธิภาพที่เหนือกว่า ซึ่งเทียบเท่ากับระดับของนักวิทยาศาสตร์ข้อมูล แม้แต่ในขณะสร้างโมเดลการเรียนรู้ของเครื่องระดับสูง แพลตฟอร์ม LightAutoML พยายามที่จะทำการมีส่วนร่วมดังต่อไปนี้ ขั้นแรก แพลตฟอร์ม LightAutoML ถูกพัฒนาโดยเฉพาะสำหรับระบบนิเวศของสถาบันการเงินและธนาคารยุโรปที่ใหญ่ เนื่องจากโครงสร้างและสถาปัตยกรรมของแพลตฟอร์ม LightAutoML จึงสามารถเอาชนะแพลตฟอร์ม AutoML ที่มีอยู่แล้วได้ในการทดสอบที่เปิดกว้างหลายรายการ เช่นเดียวกับแอปพลิเคชันของระบบนิเวศ ประสิทธิภาพของแพลตฟอร์ม LightAutoML ยังถูกเปรียบเทียบกับโมเดลที่ปรับแต่งโดยนักวิทยาศาสตร์ข้อมูล และผลลัพธ์แสดงให้เห็นว่าแพลตฟอร์ม LightAutoML มีประสิทธิภาพที่เหนือกว่า

บทความนี้มีจุดมุ่งหมายเพื่อครอบคลุมแพลตฟอร์ม LightAutoML อย่างลึกซึ้ง และเราจะสำรวจกลไก วิธีการ สถาปัตยกรรมของแพลตฟอร์มพร้อมกับการเปรียบเทียบกับแพลตฟอร์มที่มีอยู่แล้ว ดังนั้น มาเริ่มต้นกัน

LightAutoML: แพลตฟอร์ม AutoML สำหรับบริการทางการเงิน

แม้ว่านักวิจัยจะเริ่มทำงานเกี่ยวกับ AutoML เมื่อต้นปี 1990 AutoML ได้รับความสนใจอย่างมากในช่วงไม่กี่ปีที่ผ่านมา โดยมีบางโซลูชันทางอุตสาหกรรมที่สำคัญที่ใช้โมเดลการเรียนรู้ของเครื่องแบบอัตโนมัติ เช่น AutoGluon ของ Amazon (AMZN ), DarwinAI, H20.ai, IBM Watson AI, Microsoft (MSFT ) AzureML และอื่นๆ แพลตฟอร์มส่วนใหญ่เหล่านี้ใช้โซลูชัน AutoML ที่มีจุดมุ่งหมายทั่วไป ซึ่งพัฒนาโมเดล ML อัตโนมัติข้ามแอปพลิเคชันต่างๆ ในภาคการเงิน การดูแลสุขภาพ การศึกษา และอื่นๆ สมมติฐานหลักที่อยู่เบื้องหลังแนวทางแบบแนวนอนและทั่วไปนี้คือ กระบวนการสร้างโมเดลอัตโนมัติจะเหมือนกันในแอปพลิเคชันทั้งหมด อย่างไรก็ตาม แพลตฟอร์ม LightAutoML ใช้แนวทางแนวตั้งในการพัฒนาโซลูชัน AutoML ที่ไม่ใช่แบบทั่วไป แต่เหมาะสมกับความต้องการของแอปพลิเคชันแต่ละรายการ ในกรณีนี้ คือ สถาบันการเงินที่ใหญ่ แพลตฟอร์ม LightAutoML คือ โซลูชัน AutoML แนวตั้ง ซึ่งมุ่งเน้นไปที่ความต้องการของระบบนิเวศที่ซับซ้อนพร้อมด้วยลักษณะเฉพาะของระบบนิเวศ

LightAutoML: วิธีการและสถาปัตยกรรม

แพลตฟอร์ม LightAutoML ประกอบด้วยโมดูลที่เรียกว่า Presets ซึ่งอุทิศให้กับการพัฒนาโมเดลแบบ end-to-end สำหรับงานการเรียนรู้ของเครื่องแบบคลาสสิก ปัจจุบัน แพลตฟอร์ม LightAutoML สนับสนุน Preset โมดูล ต่อไปนี้คือ Preset โมดูลที่สำคัญ

LightAutoML Tabular Preset

ภายในแพลตฟอร์ม LightAutoML TabularAutoML เป็นไปปายพื้นฐาน และใช้ในการแก้ปัญหา Machine Learning ที่คลาสสิกสามประเภทบนข้อมูลที่เป็นตาราง ได้แก่ การจำแนกประเภทแบบไบนารี่ การถดถอย และการจำแนกประเภทแบบหลายคลาสสำหรับเมตริกการทำงานและการสูญเสียต่างๆ

การกำหนดประเภทอัตโนมัติและก่อนประมวลผลข้อมูล

เพื่อจัดการกับประเภทคุณลักษณะที่แตกต่างกันในแบบที่แตกต่างกัน โมเดลจำเป็นต้องทราบประเภทคุณลักษณะแต่ละรายการ ในกรณีที่มีงานเดียวที่มีชุดข้อมูลขนาดเล็ก ผู้ใช้สามารถระบุประเภทคุณลักษณะแต่ละรายการได้โดยตรง อย่างไรก็ตาม การระบุประเภทคุณลักษณะแต่ละรายการโดยตรงไม่ใช่ทางเลือกที่ใช้ได้ในการทำงานที่มีหลายร้อยงานพร้อมด้วยชุดข้อมูลที่มีคุณลักษณะหลายพันรายการ สำหรับ Preset TabularAutoML แพลตฟอร์ม LightAutoML ต้องจับคู่คุณลักษณะเข้ากับสามคลาส ได้แก่ ตัวเลข ประเภท และวันที่

การตรวจสอบ

การตรวจสอบเป็นส่วนสำคัญของแพลตฟอร์ม AutoML เนื่องจากข้อมูลในอุตสาหกรรมมีการเปลี่ยนแปลงตลอดเวลา และการเปลี่ยนแปลงนี้ทำให้สมมติฐาน IID หรือ Independent Identically Distributed ไม่เกี่ยวข้องเมื่อพัฒนาโมเดล AutoML ใช้การตรวจสอบเพื่อประมาณประสิทธิภาพ ค้นหาไฮเปอร์พารามิเตอร์ และสร้างการคาดการณ์นอกพับ

  • การตรวจสอบแบบ KFold: การตรวจสอบแบบ KFold เป็นการตรวจสอบโดยอัตโนมัติสำหรับ TabularAutoML pipeline รวมถึง GroupKFold สำหรับโมเดลพฤติกรรมและ KFold ที่มีการแบ่งชั้นสำหรับงานจำแนกประเภท
  • การตรวจสอบแบบ Holdout: การตรวจสอบแบบ Holdout จะถูกนำไปใช้หากชุดข้อมูล Holdout ถูกกำหนดไว้
  • การตรวจสอบแบบกำหนดเอง: การตรวจสอบแบบกำหนดเองสามารถสร้างได้โดยผู้ใช้ตามความต้องการของตนเอง การตรวจสอบแบบกำหนดเองรวมถึงการตรวจสอบแบบแบ่งข้ามและแบ่งตามลำดับเวลา

การคัดเลือกคุณลักษณะ

แม้ว่าการคัดเลือกคุณลักษณะจะเป็นประเด็นสำคัญในการพัฒนาโมเดลตามมาตรฐานอุตสาหกรรม เนื่องจากช่วยลดต้นทุนการอนุมานและการใช้งานโมเดล แต่โซลูชัน AutoML ส่วนใหญ่ไม่ได้ให้ความสำคัญกับปัญหานี้ ในทางกลับกัน TabularAutoML pipeline ใช้กลยุทธ์การคัดเลือกคุณลักษณะสามแบบ ได้แก่ ไม่มีการคัดเลือก การคัดเลือกโดยการลบการคัดเลือกตามความสำคัญ และการคัดเลือกแบบไปข้างหน้าตามความสำคัญ

รูปด้านบนเปรียบเทียบกลยุทธ์การคัดเลือกที่แตกต่างกันในข้อมูลธนาคารแบบไบนารี่

การปรับไฮเปอร์พารามิเตอร์

TabularAutoML pipeline ใช้แนวทางต่างๆ ในการปรับไฮเปอร์พารามิเตอร์ตามสิ่งที่ปรับ

  • การปรับไฮเปอร์พารามิเตอร์แบบหยุดเร็ว: การปรับไฮเปอร์พารามิเตอร์แบบหยุดเร็วเลือกจำนวนการวนซ้ำสำหรับทุกโมเดลในช่วงการฝึกอบรม
  • การปรับไฮเปอร์พารามิเตอร์แบบระบบผู้เชี่ยวชาญ: การปรับไฮเปอร์พารามิเตอร์แบบระบบผู้เชี่ยวชาญเป็นวิธีที่ง่ายในการตั้งค่าไฮเปอร์พารามิเตอร์สำหรับโมเดลในลักษณะที่น่าพอใจ ซึ่งจะป้องกันไม่ให้โมเดลสุดท้ายมีการลดคะแนนอย่างมากเมื่อเทียบกับโมเดลที่ปรับแต่งอย่างเข้มงวด
  • การประมาณค่า Parzen ที่มีโครงสร้างแบบต้นไม้หรือ TPE: สำหรับโมเดล GBM หรือต้นไม้ตัดสินใจแบบเพิ่มคุณภาพ TPE เป็นกลยุทธ์การปรับแบบผสมที่เป็นตัวเลือกโดยอัตโนมัติใน pipeline LightAutoML สำหรับแต่ละเฟรมเวิร์ก GBM แพลตฟอร์ม LightAutoML จะฝึกโมเดลสองแบบ โมเดลแรกได้รับไฮเปอร์พารามิเตอร์จากผู้เชี่ยวชาญ และโมเดลที่สองได้รับการปรับให้เหมาะสมเพื่อเข้ากับงบประมาณเวลา
  • การค้นหาไฮเปอร์พารามิเตอร์แบบ Grid Search: การค้นหาไฮเปอร์พารามิเตอร์แบบ Grid Search ถูกนำไปใช้ใน pipeline TabularAutoML เพื่อปรับพารามิเตอร์การปรับให้เหมาะสมของโมเดลเชิงเส้นพร้อมกับการหยุดเร็วและการเริ่มต้นใหม่

โมเดลปรับพารามิเตอร์ทั้งหมดโดยการเพิ่มฟังก์ชันเมตริก ซึ่งถูกกำหนดโดยผู้ใช้หรือเป็นค่าเริ่มต้นสำหรับงานที่แก้ไข

LightAutoML: การทดลองและประสิทธิภาพ

เพื่อประเมินประสิทธิภาพ Preset TabularAutoML ภายในแพลตฟอร์ม LightAutoML จะถูกเปรียบเทียบกับโซลูชันแบบเปิดที่มีอยู่แล้วทั่วทั้งหลายงานและหลายแอปพลิเคชัน ซึ่งแสดงให้เห็นถึงประสิทธิภาพที่เหนือกว่าของแพลตฟอร์ม LightAutoML ประการแรก การเปรียบเทียบจะดำเนินการใน OpenML benchmark ซึ่งประเมินใน 35 ชุดข้อมูลงานจำแนกประเภทไบนารี่และมัลติคลาส

ตามที่เห็น แพลตฟอร์ม LightAutoML มีประสิทธิภาพเหนือกว่าโซลูชัน AutoML ที่มีอยู่แล้วทั้งหมดใน 20 ชุดข้อมูลภายใน benchmark ต่อไปนี้คือตารางที่เปรียบเทียบแพลตฟอร์ม LightAutoML กับระบบ AutoML ที่มีอยู่แล้วในบริบทของชุดข้อมูล

ต่อไปนี้คือตารางที่เปรียบเทียบประสิทธิภาพของแพลตฟอร์ม LightAutoML กับโซลูชัน AutoML ใน 15 ชุดข้อมูลธนาคารที่มีงานจำแนกประเภทไบนารี่ต่างๆ ตามที่เห็น แพลตฟอร์ม LightAutoML มีประสิทธิภาพเหนือกว่าโซลูชัน AutoML ทั้งหมดใน 12 ใน 15 ชุดข้อมูล ซึ่งเป็นเปอร์เซ็นต์ที่ชนะ 80

ความคิดสุดท้าย

ในบทความนี้ เราได้พูดถึง LightAutoML ซึ่งเป็นระบบ AutoML ที่พัฒนาโดยเฉพาะสำหรับบริษัทยุโรปที่ดำเนินธุรกิจในภาคการเงินพร้อมด้วยระบบนิเวศของบริษัทนั้น แพลตฟอร์ม LightAutoML ถูกนำไปใช้ในหลายแอปพลิเคชัน และผลลัพธ์ได้แสดงให้เห็นถึงประสิทธิภาพที่เหนือกว่า ซึ่งเทียบเท่ากับระดับของนักวิทยาศาสตร์ข้อมูล แม้แต่ในขณะสร้างโมเดลการเรียนรู้ของเครื่องระดับสูง แพลตฟอร์ม LightAutoML พยายามที่จะทำการมีส่วนร่วมดังต่อไปนี้ ขั้นแรก แพลตฟอร์ม LightAutoML ถูกพัฒนาโดยเฉพาะสำหรับระบบนิเวศของสถาบันการเงินและธนาคารยุโรปที่ใหญ่ เนื่องจากโครงสร้างและสถาปัตยกรรมของแพลตฟอร์ม LightAutoML จึงสามารถเอาชนะแพลตฟอร์ม AutoML ที่มีอยู่แล้วได้ในการทดสอบที่เปิดกว้างหลายรายการ เช่นเดียวกับแอปพลิเคชันของระบบนิเวศ ประสิทธิภาพของแพลตฟอร์ม LightAutoML ยังถูกเปรียบเทียบกับโมเดลที่ปรับแต่งโดยนักวิทยาศาสตร์ข้อมูล และผลลัพธ์แสดงให้เห็นว่าแพลตฟอร์ม LightAutoML มีประสิทธิภาพที่เหนือกว่า

วิศวกรโดยอาชีพ นักเขียนโดยหัวใจ คุณ Kunal เป็นนักเขียนเทคนิคที่มีความรักและเข้าใจอย่างลึกซึ้งเกี่ยวกับ AI และ ML มุ่งมั่นที่จะทำให้แนวคิดที่ซับซ้อนในด้านเหล่านี้ง่ายขึ้นผ่านเอกสารที่น่าสนใจและให้ข้อมูล