สัมภาษณ์
โอมรี เกลเลอร์ ซีอีโอ และผู้ร่วมก่อตั้ง Run:AI – ซีรีส์สัมภาษณ์

โอมรี เกลเลอร์ เป็นซีอีโอ และผู้ร่วมก่อตั้ง tại Run:AI
Run:AI ทำให้ AI มีความเร็วและคล่องตัวโดยการรวมทรัพยากรการคำนวณ GPU เพื่อให้สามารถควบคุมและจัดสรรทรัพยากรได้อย่างมีประสิทธิภาพ ซึ่งช่วยให้โครงการ AI มีความสอดคล้องกับเป้าหมายทางธุรกิจและเพิ่มผลผลิตของทีมวิทยาศาสตร์ข้อมูลได้อย่างมาก โดยทีมวิทยาศาสตร์ข้อมูลสามารถสร้างและฝึกโมเดลพร้อมกันโดยไม่มีข้อจำกัดด้านทรัพยากร
สิ่งใดที่ดึงดูดคุณให้เข้าสู่โลกของปัญญาประดิษฐ์?
เมื่อฉันเริ่มเรียนปริญญาตรีในสาขาวิศวกรรมไฟฟ้าและอิเล็กทรอนิกส์ที่มหาวิทยาลัยเทลอาวีฟ ฉันพบสิ่งที่น่าสนใจเกี่ยวกับ AI ที่ฉันรู้ว่าจะช่วยพัฒนาให้เราไปสู่ขั้นตอนต่อไปของความเป็นไปได้ในการคำนวณ ตั้งแต่นั้น ฉันรู้ว่าฉันต้องการลงทุนในพื้นที่ AI ไม่ว่าจะเป็นในการวิจัยหรือการเปิดบริษัทที่จะช่วยแนะนำวิธีการใช้ AI ในโลก
คุณมีความสนใจในฮาร์ดแวร์คอมพิวเตอร์ตั้งแต่เมื่อไหร่?
เมื่อฉันได้รับคอมพิวเตอร์เครื่องแรกที่มีโปรเซสเซอร์ Intel (INTC ) 486 เมื่อฉันอายุ 6 หรือ 7 ขวบ ฉันสนใจที่จะเข้าใจว่าทุกอย่างทำงานอย่างไร แม้ว่าฉันอาจจะยังเด็กเกินไปที่จะเข้าใจจริงๆ แต่คอมพิวเตอร์กลายเป็นหนึ่งในงานอดิเรกที่ใหญ่ที่สุดของฉัน นอกเหนือจากกีฬา คอมพิวเตอร์กลายเป็นหนึ่งในสิ่งที่ฉันสนใจที่สุดในการเรียนรู้และพัฒนาต่อ
สิ่งใดที่เป็นแรงบันดาลใจให้คุณก่อตั้ง Run:AI?
ฉันรู้ตั้งแต่เนิ่นๆ ว่าฉันต้องการลงทุนในพื้นที่ AI ในช่วงสองสามปีที่ผ่านมา อุตสาหกรรมได้เติบโตอย่างมาก และการเติบโตส่วนใหญ่นี้มาจากนักวิทยาศาสตร์คอมพิวเตอร์เช่นฉันเอง และฮาร์ดแวร์ที่สามารถรองรับแอปพลิเคชันใหม่ๆ ได้ ฉันจึงตัดสินใจก่อตั้งบริษัทร่วมกับ Ronen Dar เพื่อสร้างนวัตกรรมและช่วยให้ AI เข้าสู่บริษัทระดับองค์กรมากขึ้น
Run:AI ช่วยให้ chuyên家 machine learning สามารถควบคุมการแจกจ่ายทรัพยากร GPU ที่มีราคาแพงได้อย่างไร?
สิ่งที่เราต้องเข้าใจคือวิศวกร machine learning เช่น นักวิจัยและนักวิทยาศาสตร์ข้อมูลต้องการใช้พลังการคำนวณในลักษณะที่ยืดหยุ่น ไม่เพียงแต่การคำนวณใหม่ๆ ที่ต้องการพลังการคำนวณสูงเท่านั้น แต่ยังมีกระบวนการทำงานใหม่ๆ ที่ใช้ในวิทยาศาสตร์ข้อมูล ซึ่งกระบวนการเหล่านี้ตั้งอยู่บนพื้นฐานของการทดลองและการวิ่งทดลอง
เพื่อพัฒนาโซลูชันใหม่ๆ ที่จะช่วยให้การทดลองมีประสิทธิภาพมากขึ้น เราต้องศึกษาการทำงานของกระบวนการเหล่านี้ตลอดเวลา ตัวอย่างเช่น นักวิทยาศาสตร์ข้อมูลอาจใช้ GPU 8 ตัวในหนึ่งวัน แต่ในวันถัดไปอาจไม่ใช้เลย หรืออาจใช้ GPU 1 ตัวเป็นเวลานาน แต่แล้วต้องการใช้ GPU 100 ตัวเพื่อวิ่งทดลอง 100 ครั้งพร้อมกัน เมื่อเราสามารถเข้าใจกระบวนการทำงานนี้สำหรับการเพิ่มประสิทธิภาพพลังการคำนวณสำหรับผู้ใช้หนึ่งคนแล้ว เราก็สามารถขยายสิ่งนี้ไปยังผู้ใช้หลายคนได้
ด้วยวิธีการคำนวณแบบดั้งเดิม จะมีการจัดสรร GPU จำนวนหนึ่งให้กับผู้ใช้แต่ละคน โดยไม่คำนึงว่าพวกเขากำลังใช้งานหรือไม่ ซึ่งบ่อยครั้ง GPU ที่มีราคาแพงจะไม่ได้ใช้งาน และไม่มีผู้ใช้อื่นที่สามารถเข้าถึงได้ ทำให้ได้รับผลตอบแทนจากการลงทุนที่ต่ำกว่าสำหรับ GPU เราเข้าใจถึงลำดับความสำคัญทางการเงินของบริษัทและเสนอวิธีแก้ปัญหาที่ช่วยให้สามารถจัดสรรทรัพยากรได้อย่างยืดหยุ่นตามความต้องการของผู้ใช้ โดยการเสนอบริการที่ยืดหยุ่น เราสามารถจัดสรรพลังการคำนวณเพิ่มเติมให้กับผู้ใช้เมื่อจำเป็นโดยใช้ GPU ที่ไม่ได้ใช้งานโดยผู้ใช้อื่น ซึ่งช่วยให้ได้รับผลตอบแทนจากการลงทุนที่สูงสุดสำหรับทรัพยากรการคำนวณของบริษัทและเร่งการสร้างนวัตกรรมและการเข้าสู่ตลาดของโซลูชัน AI
Run:AI มีฟังก์ชันในการลดจุดบอดที่เกิดจากการแจกจ่ายทรัพยากร GPU แบบคงที่อย่างไร?
เรามีเครื่องมือที่ให้ความเข้าใจอย่างเต็มที่เกี่ยวกับคลัสเตอร์ของทรัพยากร โดยใช้เครื่องมือนี้ เราสามารถสังเกตและเข้าใจว่ามีจุดบอดอยู่หรือไม่ และใช้ GPU ที่ไม่ได้ใช้งานสำหรับผู้ใช้ที่ต้องการทรัพยากรเหล่านั้น เครื่องมือที่ให้ความเข้าใจและควบคุมคลัสเตอร์ยังช่วยลดจุดบอดเหล่านั้น
ในคำพูดล่าสุด คุณเน้นถึงความแตกต่างระหว่างกระบวนการสร้างและฝึกอบรม AI สามารถอธิบายได้ว่า Run:AI ใช้กลไกการจัดการคิว GPU เพื่อจัดการทรัพยากรสำหรับทั้งสองกระบวนการได้อย่างไร?
โมเดล AI ถูกสร้างขึ้นในสองขั้นตอน ขั้นตอนแรกคือการสร้าง โดยที่นักวิทยาศาสตร์ข้อมูลเขียนโค้ดเพื่อสร้างโมเดลจริงๆ ในทำนองเดียวกับที่วิศวกรสร้างรถยนต์ ขั้นตอนที่สองคือการฝึกอบรม โดยที่โมเดลที่เสร็จสมบูรณ์เริ่มเรียนรู้และฝึกอบรมเพื่อปรับปรุงงานเฉพาะอย่าง เช่นเดียวกับการที่คนเรียนรู้ขับรถหลังจากรถถูกประกอบแล้ว
ในการสร้างโมเดลเองไม่ต้องการพลังการคำนวณมากนัก แต่ในระยะหลังอาจต้องการพลังการคำนวณที่เข้มข้นกว่าเพื่อเริ่มการทดสอบภายในเล็กๆ น้อยๆ ตัวอย่างเช่น วิศวกรอาจต้องการทดสอบเครื่องยนต์ก่อนที่จะติดตั้งมันลงในรถยนต์ เนื่องจากความต้องการที่แตกต่างกันในแต่ละขั้นตอน Run:AI จึงช่วยให้สามารถจัดสรร GPU ได้ไม่ว่าจะเป็นการสร้างหรือการฝึกอบรมโมเดล แต่โดยทั่วไปแล้ว การฝึกอบรมโมเดลต้องการ GPU มากกว่าการสร้างโมเดล
นักพัฒนา AI สามารถประหยัดเวลาและทรัพยากรการคำนวณได้มากเพียงใดโดยการรวม Run:AI เข้ากับระบบของตน?
โซลูชันของ Run.ai สามารถปรับปรุงการดิจิทัลของทรัพยากรได้ประมาณสองถึงสามเท่า ซึ่งหมายถึงผลผลิตที่ดีขึ้นโดยรวม 2-3 เท่า
ขอขอบคุณสำหรับการสัมภาษณ์ ผู้อ่านสามารถเยี่ยมชม Run:AI เพื่อเรียนรู้เพิ่มเติม












