สัมภาษณ์
Roshanak Houmanfar, VP of Machine Learning Products at Integrate.ai – Interview Series

Roshanak (Ro) Houmanfar เป็น VP of machine learning products สำหรับ integrate.ai, บริษัทที่ช่วยให้นักพัฒนาแก้ปัญหาที่สำคัญที่สุดของโลกโดยไม่ต้องเสี่ยงกับข้อมูลที่มีความเสี่ยง Ro มีแนวทางที่จะค้นหาวิธีการใหม่ๆ ในการทำให้แนวคิด AI ที่ซับซ้อนเป็นเรื่องที่ง่ายขึ้น และเชื่อมโยงกับความต้องการของผู้ใช้ โดยใช้ความเชี่ยวชาญนี้ เธออยู่ในแนวหน้าของภารกิจของ integrate.ai ในการทำให้เทคโนโลยีที่เพิ่มความเป็นส่วนตัวเข้าถึงได้
สิ่งใดที่ดึงดูดคุณเข้าสู่ด้านวิทยาศาสตร์ข้อมูลและเครื่องมือการเรียนรู้ของเครื่องจักร?
ฉันเริ่มต้นการเดินทางของฉันในด้านหุ่นยนต์ หลังจากทดลองกับมุมต่างๆ ของหุ่นยนต์ และเผาผลาญห้องทดลองการเชื่อมแล้ว ฉันสรุปได้ว่าฉันสนใจด้านปัญญาประดิษฐ์ของสาขาของฉันมากขึ้น ซึ่งนำฉันเข้าสู่โลกที่น่าหลงใหลของเครื่องมือการเรียนรู้ของเครื่องจักร
คุณสามารถอธิบายบทบาทปัจจุบันของคุณและวันทำงานทั่วไปของคุณได้หรือไม่?
ฉันเป็น VP of Product ที่ integrate.ai, บริษัท SaaS ที่ช่วยให้นักพัฒนาแก้ปัญหาที่สำคัญที่สุดของโลกโดยไม่ต้องเสี่ยงกับข้อมูลที่มีความเสี่ยง เรากำลังสร้างเครื่องมือสำหรับการเรียนรู้ของเครื่องจักรและวิเคราะห์ที่ปลอดภัยต่อความเป็นส่วนตัวสำหรับอนาคตที่กระจายของข้อมูล
ในแต่ละวัน ฉันทำงานร่วมกับทีมของเราในหลายๆ ด้านเพื่อให้บรรลุเป้าหมายสามประการ:
คิดถึงอนาคตของปัญญาประดิษฐ์อาจดูเหมือนอย่างไร และเราจะสามารถกำหนดรูปแบบอนาคตได้อย่างไร เพื่อให้ปัญญาประดิษฐ์แก้ปัญหาที่สำคัญที่สุด
เข้าใจจุดอ่อนของลูกค้าและวิธีการที่เราสามารถสร้างนวัตกรรมเพื่อให้การทำงานของพวกเขามีประสิทธิภาพและประสิทธิผลมากขึ้น
ตรวจสอบให้แน่ใจว่าความมุ่งมั่นและข้อเสนอแนะของลูกค้าถูกพิจารณาในการพัฒนาผลิตภัณฑ์ โดยทำงานร่วมกับทีมของเราเพื่อนำเสนอฟีเจอร์ที่ดีที่สุด
ข้อมูลสังเคราะห์เป็นที่นิยมอย่างมากในเครื่องมือการเรียนรู้ของเครื่องจักร แต่ integrate.ai มีวิธีการที่ขัดแย้งกันเล็กน้อย ในการประยุกต์ใช้ใดๆ ที่ข้อมูลสังเคราะห์อาจไม่ใช่ตัวเลือกที่ต้องการ?
เพื่อทำความเข้าใจว่าเมื่อใดที่ข้อมูลสังเคราะห์ไม่ใช่วิธีแก้ปัญหาที่ดีที่สุด อันดับแรกเราต้องเข้าใจว่าเมื่อใดที่มันใช้ได้ดี ข้อมูลสังเคราะห์ใช้ได้ดีที่สุดเมื่อเป้าหมายการสร้างแบบจำลองมีข้อมูลจริงที่มีอยู่น้อยหรือไม่มีเลย ตัวอย่างเช่น ในปัญหา cold-start และการฝึกอบรมแบบจำลองข้อความและภาพ
อย่างไรก็ตาม ข้อมูลสังเคราะห์ถูกใช้มากขึ้นในสถานการณ์ที่มีข้อมูลจริงมากมาย แต่ข้อมูลนั้นถูกปิดกั้นเนื่องจากข้อบังคับด้านความเป็นส่วนตัว ค่าใช้จ่ายในการจัดศูนย์กลางหรืออุปสรรคในการเชื่อมต่ออื่นๆ ซึ่งเป็นการใช้ข้อมูลสังเคราะห์ที่ไม่เหมาะสม ในกรณีการใช้งานเหล่านี้ มันยากที่จะกำหนดระดับการสร้างข้อมูลสังเคราะห์ที่ถูกต้อง ซึ่งอาจทำให้เกิดข้อมูลสังเคราะห์ที่มีคุณภาพต่ำ ซึ่งอาจทำให้เกิดปัญหาเช่น ความเอนเอียงหรือปัญหาอื่นๆ ที่ยากต่อการแก้ไข
Integrate.ai มีแนวทางในการให้บริการ federated learning คุณสามารถอธิบายว่า federated learning คืออะไรได้หรือไม่?
ในเครื่องมือการเรียนรู้ของเครื่องจักรแบบดั้งเดิม ข้อมูลการฝึกอบรมแบบจำลองทั้งหมดจะต้องอยู่ในฐานข้อมูลเดียวกัน แต่ด้วย federated learning แบบจำลองสามารถฝึกอบรมได้โดยใช้ข้อมูลที่กระจายและตั้งอยู่ในหลายๆ ฐานข้อมูลที่ไม่สามารถย้ายได้ วิธีการทำงานคือส่วนหนึ่งของแบบจำลองการเรียนรู้ของเครื่องจักรถูกฝึกอบรมที่ที่ข้อมูลอยู่ และพารามิเตอร์ของแบบจำลองถูกแบ่งปันระหว่างฐานข้อมูลที่เข้าร่วมเพื่อสร้างแบบจำลองระดับโลกที่ดีขึ้น และเนื่องจากไม่มีข้อมูลที่ย้ายภายในระบบ องค์กรสามารถฝึกอบรมแบบจำลองได้โดยไม่ต้องมีอุปสรรคด้านความเป็นส่วนตัวและความปลอดภัย ค่าใช้จ่ายหรือข้อกังวลอื่นๆ
โดยทั่วไป ข้อมูลการฝึกอบรมที่สามารถเข้าถึงได้ด้วย federated learning มีคุณภาพสูงกว่า เนื่องจากข้อมูลที่จัดศูนย์กลางมักจะสูญเสียความละเอียดบางส่วนเพื่อความสะดวกในการเข้าถึงในสถานที่เดียว
วิธีการที่องค์กรสามารถระบุกรณีการใช้งานที่ดีที่สุดสำหรับ federated learning?
federated learning เป็นเทคโนโลยีเครื่องมือการเรียนรู้ของเครื่องจักรที่สร้างขึ้นสำหรับสถานการณ์ที่การเข้าถึงข้อมูลหรือการนำข้อมูลเข้าสู่โครงสร้างพื้นฐานของเครื่องมือการเรียนรู้ของเครื่องจักรแบบดั้งเดิมที่มีฐานข้อมูลที่จัดศูนย์กลางเป็นเรื่องที่เจ็บปวด หากคุณกำลังเผชิญกับอาการต่อไปนี้ federated learning คือสำหรับคุณ:
- คุณให้บริการผลิตภัณฑ์สมาร์ทที่ขับเคลื่อนด้วยการวิเคราะห์และเครื่องมือการเรียนรู้ของเครื่องจักร และคุณไม่สามารถสร้างผลกระทบต่อผลิตภัณฑ์ของคุณได้เพราะข้อมูลเป็นของลูกค้าของคุณ
- คุณกำลังทำงานผ่านข้อตกลงการบริการหลักหรือข้อตกลงในการแบ่งปันข้อมูลเพื่อเข้าถึงข้อมูลจากพันธมิตรของคุณ
- คุณกำลังใช้เวลาในการสร้างสัญญาการทำงานร่วมกันกับพันธมิตรของคุณ โดยเฉพาะอย่างยิ่งในสถานการณ์ที่ผลลัพธ์ของการทำงานร่วมกันนั้นไม่ชัดเจนต่อคุณ
- คุณมีข้อมูลที่มีค่าและต้องการสร้างรายได้จากชุดข้อมูลของคุณ แต่คุณกลัวผลกระทบต่อชื่อเสียงของคุณ
- คุณกำลังสร้างรายได้จากข้อมูลของคุณแล้ว แต่คุณกำลังใช้เวลาและเงินมากในการทำให้ข้อมูลปลอดภัยในการแบ่งปัน
- โครงสร้างพื้นฐานของคุณถูกทิ้งไว้เบื้องหลังระหว่างการย้ายไปยังคลาวด์ แต่คุณยังคงต้องการการวิเคราะห์และเครื่องมือการเรียนรู้ของเครื่องจักร
- คุณมีหลายบริษัทย่อยที่เป็นส่วนหนึ่งขององค์กรเดียวกัน แต่ไม่สามารถแบ่งปันข้อมูลกันโดยตรง
- ชุดข้อมูลที่คุณกำลังจัดการมีขนาดใหญ่หรือมีค่าใช้จ่ายสูงในการย้าย จึงตัดสินใจไม่ใช้หรือท่อ ETL ของคุณมีค่าใช้จ่ายสูง
- คุณมีการใช้งานหรือโอกาสที่คุณเชื่อว่าสามารถมีผลกระทบอย่างมีนัยสำคัญ แต่คุณไม่มีข้อมูลเพียงพอเพื่อให้การทำงานนั้นเกิดขึ้น
- แบบจำลองการเรียนรู้ของเครื่องจักรของคุณได้ถึงจุดสูงสุดและคุณไม่รู้ว่าจะปรับปรุงมันให้ดีขึ้นได้อย่างไร
ความเป็นส่วนตัวแบบแยกความแตกต่างมักถูกใช้ร่วมกับ federated learning คุณสามารถอธิบายว่าสิ่งนี้คืออะไรได้หรือไม่?
ความเป็นส่วนตัวแบบแยกความแตกต่างเป็นเทคนิคในการรักษาความเป็นส่วนตัวในขณะเดียวกันก็ใช้ประโยชน์จากเครื่องมือการเรียนรู้ของเครื่องจักร โดยใช้คณิตศาสตร์ที่แตกต่างจากเทคนิคการไม่ระบุชื่อแบบดั้งเดิม ความเป็นส่วนตัวแบบแยกความแตกต่างจะเพิ่มเสียงรบกวนระหว่างการฝึกอบรมแบบจำลองท้องถิ่น ซึ่งจะรักษาลักษณะทางสถิติของชุดข้อมูลส่วนใหญ่ในขณะเดียวกันก็จำกัดความเสี่ยงว่าข้อมูลของบุคคลใดๆ จะถูกระบุได้
ในกรณีการใช้งานที่เหมาะสม ความเป็นส่วนตัวแบบแยกความแตกต่างจะนำความเสี่ยงมาใกล้เคียงกับศูนย์ ในขณะที่แบบจำลองการเรียนรู้ของเครื่องจักรยังคงมีประสิทธิภาพที่คล้ายกัน โดยให้ความปลอดภัยที่จำเป็นสำหรับการระบุชื่อข้อมูลโดยไม่ลดคุณภาพของผลลัพธ์ของแบบจำลอง
ความเป็นส่วนตัวแบบแยกความแตกต่างถูกนำมาใช้ในแพลตฟอร์มของ integrate.ai โดยค่าเริ่มต้น เพื่อให้นักพัฒนาสามารถมั่นใจได้ว่าข้อมูลของบุคคลไม่สามารถอนุมานได้จากพารามิเตอร์ของแบบจำลอง
คุณสามารถอธิบายว่าแพลตฟอร์ม federated learning ของ integrate.ai ทำงานอย่างไร?
แพลตฟอร์มของเราใช้เทคโนโลยี federated learning และความเป็นส่วนตัวแบบแยกความแตกต่างเพื่อปลดล็อกความสามารถในการเรียนรู้ของเครื่องจักรและวิเคราะห์บนข้อมูลที่มีความยากหรือเป็นไปไม่ได้ที่จะเข้าถึงเนื่องจากความเป็นส่วนตัว การรักษาความลับหรืออุปสรรคทางเทคนิค การดำเนินการฝึกอบรมแบบจำลองและการวิเคราะห์จะดำเนินการในท้องถิ่น และผลลัพธ์สุดท้ายจะถูกสรุปในลักษณะที่ปลอดภัยและเป็นส่วนตัว
integrate.ai ถูกจัดแพ็คเกจเป็นเครื่องมือสำหรับนักพัฒนา ช่วยให้นักพัฒนาสามารถรวมความสามารถเหล่านี้เข้ากับโซลูชันใดๆ ได้อย่างง่ายดายโดยใช้ซอฟต์แวร์สำหรับการพัฒนาที่ใช้ง่าย (SDK) และบริการคลาวด์สำหรับการจัดการแบบ end-to-end เมื่อแพลตฟอร์มถูกผสมผสานเข้ากับโซลูชันแล้ว ผู้ใช้สุดท้ายสามารถทำงานร่วมกันบนชุดข้อมูลที่มีความเสี่ยงได้ ในขณะที่ผู้ดูแลข้อมูลยังคงควบคุมอย่างเต็มที่ โซลูชันที่รวม integrate.ai สามารถทำงานได้ทั้งเครื่องมือทดลองและบริการที่พร้อมสำหรับการผลิต
คุณสามารถให้ตัวอย่างการใช้แพลตฟอร์มนี้ในด้านการวินิจฉัยที่แม่นยำได้หรือไม่?
หนึ่งในเครือข่ายของพันธมิตรที่เรากำลังทำงานด้วย คือ Autism Sharing Initiative ซึ่งรวบรวมข้อมูลที่เกี่ยวข้องกับการวินิจฉัยออทิสติกและตัวอย่างของข้อมูลจีโนมเพื่อทำความเข้าใจความเชื่อมโยงระหว่างจีโนไทป์และฟีโนไทป์กับการวินิจฉัยออทิสติก แต่ละไซต์ข้อมูลไม่มีข้อมูลเพียงพอเพื่อให้แบบจำลองการเรียนรู้ของเครื่องจักรทำงานได้ดี แต่เมื่อรวมกันแล้วจะสร้างขนาดตัวอย่างที่มีความหมาย อย่างไรก็ตาม การย้ายข้อมูลมีความเสี่ยงต่อความปลอดภัยและความเป็นส่วนตัว และเนื่องจากข้อบังคับและนโยบายของโรงพยาบาล สถาบันวิจัยเหล่านี้จึงเลือกที่จะไม่แบ่งปันข้อมูล
ในเครือข่ายอื่นที่มีการตั้งค่าที่คล้ายกัน นักวิจัยต้องการปรับปรุงการกำหนดการวิจัยทางคลินิกให้กับผู้ป่วยโดยใช้มุมมองที่ครอบคลุมของประวัติผู้ป่วยแต่ละคน
สถาบันวิจัยที่เกี่ยวข้องสามารถเข้าถึงข้อมูลที่แตกต่างกันเกี่ยวกับผู้ป่วยแต่ละคน – ห้องปฏิบัติการหนึ่งมีข้อมูลการสแกนทางการแพทย์ ห้องปฏิบัติการอื่นมีข้อมูลจีโนม และสถาบันวิจัยอื่นมีผลการวิจัยทางคลินิก แต่สถาบันวิจัยเหล่านี้ไม่สามารถแบ่งปันข้อมูลกันโดยตรง
ด้วยโซลูชันของ integrate.ai แต่ละองค์กรสามารถเข้าถึงข้อมูลของกันและกันเพื่อวัตถุประสงค์ของตนโดยไม่ต้องย้ายข้อมูลออกจากผู้ดูแลข้อมูล และด้วยเหตุนี้จึงปฏิบัติตามนโยบายภายในของตน
คุณสามารถพูดถึงความสำคัญของการทำให้ความเป็นส่วนตัวเข้าใจได้ง่ายและวิธีการที่ integrate.ai ช่วยให้ทำได้หรือไม่?
การทำให้ความเป็นส่วนตัวเข้าใจได้ง่ายหมายถึงการเปิดประตูให้กับธุรกิจและองค์กรที่ปิดกั้นมาเนื่องจากความเสี่ยงที่ไม่ชัดเจน กฎระเบียบด้านความเป็นส่วนตัว เช่น GDPR, CCPA และ HIPPA มีความซับซ้อนและแตกต่างกันไปตามอุตสาหกรรม ภูมิภาค และประเภทของข้อมูล ทำให้องค์กรต่างๆ มีความยากในการกำหนดว่าโครงการข้อมูลใดที่ปลอดภัยต่อความเป็นส่วนตัว แทนที่จะใช้เวลาและกำลังคนในการตรวจสอบทุกๆ กล่อง แพลตฟอร์ม federated learning ของ integrate.ai มีความเป็นส่วนตัวแบบแยกความแตกต่าง การเข้ารหัสแบบโฮโมมอร์ฟิก และการคำนวณหลายฝ่ายที่ปลอดภัย โดยให้นักพัฒนาและผู้ดูแลข้อมูลมั่นใจได้ว่าโครงการของพวกเขาจะปฏิบัติตามข้อกำหนดด้านกฎระเบียบโดยอัตโนมัติ โดยไม่ต้องมีข้อผิดพลาดในการกระโดดผ่านแต่ละขั้นตอน
มีอะไรอีกบ้างที่คุณต้องการแบ่งปันเกี่ยวกับ integrate.ai?
โซลูชันของ integrate.ai เป็นเครื่องมือที่มีประสิทธิภาพและเป็นมิตรต่อนักพัฒนาที่ช่วยให้การเรียนรู้ของเครื่องจักรและวิเคราะห์ที่ปลอดภัยต่อความเป็นส่วนตัวและปลอดภัยบนแหล่งข้อมูลที่มีความเสี่ยง โดยใช้ API ที่ง่ายต่อการใช้งาน ทั้งความซับซ้อนของการปฏิบัติตามกฎระเบียบและข้อตกลงบนแหล่งข้อมูลที่มีความเสี่ยงถูกทำให้ง่ายขึ้น โซลูชันของ integrate.ai ช่วยให้นักวิทยาศาสตร์ข้อมูลและนักพัฒนาซอฟต์แวร์สามารถจัดการงานของตนได้อย่างปลอดภัย โดยมีผลกระทบต่อโครงสร้างพื้นฐานและกระบวนการทำงานที่น้อยที่สุด
ขอขอบคุณสำหรับการสัมภาษณ์ที่ดี ผู้อ่านสามารถเยี่ยมชม integrate.ai เพื่อเรียนรู้เพิ่มเติม












