สัมภาษณ์
คริสเตียน สตาโน่, Field CTO ที่ Anyscale – สัมภาษณ์ซีรีส์

คริสเตียน สตาโน่, Field CTO ที่ Anyscale, ได้สร้างอาชีพที่จุดตัดกันของโครงสร้างพื้นฐาน AI ระดับใหญ่, แพลตฟอร์ม Machine Learning และการคำนวณแบบกระจาย ก่อนที่จะเข้าร่วม Anyscale เขาได้เป็นผู้นำทีม AI/ML Platform ที่ Attentive ซึ่งเขาสามารถขยายโครงสร้างพื้นฐานที่รองรับการจัดทำแบบจำลองสำหรับผู้ใช้มากกว่า 500 ล้านคน และช่วยขับเคลื่อนการนำระบบการคำนวณแบบไม่รวมที่ใช้ Ray ซึ่งสามารถปรับปรุงความเร็วในการพัฒนาและลดต้นทุนการดำเนินงานได้ ในช่วงแรกของอาชีพเขาได้ทำงานในด้านความปลอดภัยทางไซเบอร์, สถาปัตยกรรมคลาวด์ และโครงการ AI ในภาครัฐที่องค์กรต่างๆ รวมถึง Coalfire และ Deloitte ซึ่งเขามีส่วนร่วมในการสร้างแพลตฟอร์ม Machine Learning ของกระทรวงกลาโหมสหรัฐฯ ในช่วงแรกของการทำงาน
Anyscale เป็นบริษัทที่อยู่เบื้องหลัง Ray, โครงสร้างพื้นฐานการคำนวณแบบกระจายที่เปิดให้ใช้งานซึ่งใช้กันอย่างแพร่หลายสำหรับการขยาย AI และ Python workloads ข้ามคลัสเตอร์ของ CPU และ GPU ซึ่งถูกสร้างโดยทีมที่อยู่เบื้องหลัง Ray จาก UC Berkeley’s RISELab บริษัทนี้มุ่งเน้นในการทำให้การนำไปใช้, การจัดการ และการดูแลโครงสร้างพื้นฐาน AI ระดับใหญ่สำหรับการฝึกอบรม, การอนุมาน, การประมวลผลข้อมูล และการทำงาน AI ที่ซับซ้อน โดยให้ความสามารถในการทำงาน AI ที่กระจายข้ามสภาพแวดล้อมบนคลาวด์และออน-พรีเมส โดยให้ความสามารถในการสังเกตการณ์, การกำกับดูแล และการปรับให้เหมาะสมการทำงานที่ออกแบบมาเพื่อแอปพลิเคชัน AI ในยุคใหม่ Ray ได้กลายเป็นชั้นหลักในโครงสร้างพื้นฐาน AI ที่เกิดขึ้นใหม่ โดยช่วยให้นักพัฒนาได้ขยาย workloads จากเครื่องเดียวไปสู่หลายพันโหนดโดยไม่ต้องเปลี่ยนแปลงโค้ด Python ที่มีอยู่
คุณได้ทำงานในด้านความปลอดภัยทางไซเบอร์, แพลตฟอร์ม Machine Learning ในภาครัฐ และระบบการปรับให้เหมาะสมขนาดใหญ่ คุณได้เห็นรูปแบบใดบ้างเมื่อองค์กรพยายามย้ายจาก AI ทดลองไปสู่การผลิต?
ในอุตสาหกรรมต่างๆ มีรูปแบบที่เกิดขึ้นซ้ำๆ กัน คือ ทีมไม่มีเส้นทางที่เชื่อถือได้จากพัฒนาการไปสู่การผลิต พวกเขาสามารถสร้างแบบจำลองในโน้ตบุ๊กได้ แต่ไม่มีวิธีการมาตรฐานในการทำให้มันทำงานในระบบจริง ทุกๆ การนำไปใช้กลายเป็นกรณีศึกษา และทุกๆ ความล้มเหลวเป็นเรื่องที่น่าประหลาดใจ
สิ่งที่เชื่อมโยงสามสิ่งนี้คือความท้าทายที่เหมือนกัน – ทีมไม่มีแบบจำลองจิตที่ดีสำหรับการขยายออก พวกเขาพยายามแก้ปัญหาในทุกๆ ด้านพร้อมกัน แทนที่จะทำตามลำดับ ฉันคิดว่ามันเป็นสามขั้นตอน: ทำให้มันทำงาน, ทำให้มันถูกต้อง, ทำให้มันเร็ว ขั้นตอนเหล่านี้ไม่ใช่หลักชัยที่เกิดขึ้นเพียงครั้งเดียว – มันเป็นขั้นตอนที่ซ้ำกัน คุณต้องจัดลำดับความสำคัญระหว่างสิ่งที่เสียหายในขณะนี้และสิ่งที่จะเสียหายในอนาคต ทีมที่ประสบความสำเร็จรู้ว่าพวกเขาอยู่ในขั้นตอนไหน และยังคง-disciplined เกี่ยวกับการไม่กระโดดไปข้างหน้าจนกว่าพื้นฐานจะเป็นของแข็ง
ที่ Anyscale เราเห็นทีมเข้ามาในแต่ละขั้นตอน บางทีมยังคงพยายามทำให้มันทำงาน – พวกเขาต้องการเส้นทางที่เชื่อถือได้จากพัฒนาการไปสู่การผลิต ทีมอื่นๆ มีเส้นทางนั้นแล้ว แต่กำลังจมอยู่ในความซับซ้อนของการดำเนินงาน และต้องการทำให้มันถูกต้อง มีหลายทีมที่เข้ามาเพราะพวกเขาได้สร้างบางสิ่งที่ทำงานได้ แต่ไม่สามารถขยายมันไปสู่ระดับที่ธุรกิจต้องการได้ ชั้นการคำนวณที่รวมกันช่วยในแต่ละขั้นตอน แต่จุดเริ่มต้นขึ้นอยู่กับจุดที่ปวดที่สุด
ที่ Attentive คุณได้ช่วยขยายระบบ AI ที่รองรับผู้ใช้หลายร้อยล้านคน อะไรคืออุปสรรคด้านสถาปัตยกรรมหรือองค์กรที่ใหญ่ที่สุดที่คุณต้องเอาชนะเพื่อไปถึงระดับนั้น?
อุปสรรคที่ใหญ่ที่สุดคือการโค้งของความซับซ้อนของโครงสร้างพื้นฐาน เมื่อเราขยายแบบจำลองของเราเพื่อรวมข้อมูลมากขึ้นและรองรับลูกค้ามากขึ้น เราได้ถึงจุดเปลี่ยนของการคำนวณที่แม้แต่โหนดที่ใหญ่ที่สุดก็จะเกิดข้อผิดพลาดของการไม่มีหน่วยความจำ และการขยายแบบง่ายๆ ไม่ได้ผล โครงสร้างพื้นฐานของเราทำงานไม่ไหว
การตอบสนองที่เป็นธรรมชาติคือการเพิ่มเครื่องมือมากขึ้นเพื่อแก้ปัญหา แต่ละเครื่องมือแก้ปัญหาแคบๆ แต่เพิ่มความซับซ้อนของการดำเนินงาน โครงสร้างพื้นฐานของเราต้องกลายเป็นภาพปะติดปะต่อของการรวมตัว ซึ่งแต่ละกรณีใช้งานใหม่ๆ ต้องมีการเย็บปะและต้องมีการจัดการมากขึ้น
สิ่งที่ปลดล็อกการขยายสำหรับเราในที่สุดคือการรวมการประมวลผลข้อมูล, การฝึกอบรม, การอนุมาน และการให้บริการบน Ray และ Anyscale ผลกระทบคือทันที: ต้นทุนโครงสร้างพื้นฐานที่ลดลงอย่างมาก, รอบการฝึกอบรมที่เร็วขึ้นแม้ว่าปริมาณข้อมูลจะเติบโต และความสามารถในการขยายแบบจำลองไปสู่ลูกค้ามากขึ้น
อะไรเป็นแรงบันดาลใจในการตัดสินใจของคุณที่จะ เข้าร่วม Anyscale ในช่วงเวลานี้ และคุณมองเห็นบทบาทของ Field CTO ในการนำเอา AI ไปสู่องค์กรอย่างไร?
ประสบการณ์ของฉันในการนำ Anyscale ไปสู่ Attentive ได้เปลี่ยนแผนการเล่นของฉันในการสร้างแพลตฟอร์ม Machine Learning ก่อนหน้านี้ ส่วนสำคัญของวิศวกรรมแพลตฟอร์มคือต้นทุนในการเย็บปะระบบที่กระจัดกระจาย ด้วย Anyscale เราสามารถกำจัดส่วนมากของต้นทุนนั้นออกไป และมุ่งเน้นไปที่ประสบการณ์ของนักพัฒนา, ความน่าเชื่อถือ และประสิทธิภาพ การเปลี่ยนแปลงนี้มีผลกระทบอย่างมากต่อทั้งผลผลิตของทีมและผลลัพธ์ของระบบ การเข้าร่วม Anyscale เป็นโอกาสในการทำงานกับปัญหานี้เต็มเวลา และช่วยให้องค์กรอื่นๆ นำทางการเปลี่ยนแปลงเดียวกัน ในฐานะ Field CTO บทบาทของฉันคือการนำบทเรียนจากโลกแห่งความเป็นจริงมาเปลี่ยนเป็นรูปแบบที่สามารถทำซ้ำได้ซึ่งลูกค้าของเราสามารถนำไปใช้ในการขยาย AI
หลายองค์กรมยังคงติดอยู่ใน “ขั้นทดลอง” ของ AI เมื่อคุณมองจากมุมมองของคุณ สิ่งใดที่แตกหักเมื่อองค์กรมพยายามขยายการทดลอง AI เหล่านี้ไปสู่ระบบการผลิต?
เมื่อองค์กรมพยายามย้ายจากการทดลอง AI ไปสู่การผลิต สิ่งที่แตกหักไม่ใช่แค่แบบจำลอง – แต่เป็นระบบและกระบวนการโดยรอบ ในบางกรณี ทีมต้องเผชิญกับข้อจำกัดของโครงสร้างพื้นฐานและไม่สามารถฝึกหรือให้บริการได้ในระดับที่ต้องการ พวกเขาต้องจำกัดจำนวนลูกค้าหรือกรณีการใช้งานที่แบบจำลองสามารถให้บริการได้ ปัญหาเหล่านี้เกิดขึ้นในหลายกรณีในระหว่างการผลิต AI ไม่ใช่แค่แบบจำลอง – แต่เป็นกรณีศึกษาที่ไม่คาดคิดหรือการเปลี่ยนแปลงของข้อมูล หนึ่งในจุดล้มเหลวที่พบบ่อยที่สุดคือปัญหาหน่วยความจำ: เมื่อขนาด, การกระจาย, หรือรูปแบบของข้อมูลเปลี่ยนแปลงไป งานอาจไม่มีหน่วยความจำเพียงพอและล้มเหลว
Ray, โครงสร้างพื้นฐานการคำนวณแบบกระจายที่สร้างโดยทีมที่อยู่เบื้องหลัง Anyscale กำลังได้รับความนิยมเป็นฐานสำหรับ AI workloads ทำไมการดำเนินการแบบกระจายจึงกลายเป็นชั้นที่สำคัญในโครงสร้างพื้นฐาน AI ในยุคใหม่?
การดำเนินการแบบกระจายและจัดการ workloads ได้กลายเป็นเรื่องสำคัญสำหรับ AI pipelines AI workloads ในยุคใหม่จำเป็นต้องมีการคำนวณแบบขนานและต้องการทรัพยากรมาก การฝึกอบรม, การอนุมาน และการประมวลผลข้อมูลต้องการการประสานงานของงานขนาดใหญ่บน CPU และ GPU ซึ่งอาจเปลี่ยนแปลงได้ ในภูมิทัศน์การคำนวณในปัจจุบัน ความซับซ้อนของการจัดการ workloads เหล่านี้บนทรัพยากรที่มีจำกัดเป็นภาระการดำเนินงานที่มาก โครงสร้างพื้นฐานแบบดั้งเดิมไม่ได้ถูกออกแบบมาเพื่อความซับซ้อนหรือขนาดนี้ โครงสร้างพื้นฐานแบบใหม่เช่น Ray จึงมีความสำคัญเพราะช่วยให้ทีมสามารถขยาย workloads ได้อย่างราบรื่นจากเครื่องเดียวไปสู่หลายพันโหนดโดยไม่ต้องเปลี่ยนแปลงโค้ด Python ที่มีอยู่
เมื่อมีองค์กรมากขึ้นที่นำ Ray มาใช้ผ่านแพลตฟอร์ม Anyscale คุณเห็นความแตกต่างใดระหว่างองค์กรที่มาตรฐานการนำไปใช้แบบไม่รวมกันและที่ใช้เครื่องมือที่กระจัดกระจาย?
ความแตกต่างระหว่างแพลตฟอร์มที่รวมกันและเครื่องมือที่กระจัดกระจายสุดท้ายแล้วมาจากความสามารถในการมุ่งเน้นและประสิทธิภาพ เมื่อทีมต้องใช้ระบบที่ไม่เชื่อมต่อกัน พวกเขาจะใช้เวลามากในการเย็บปะระบบ, จัดการความไม่สอดคล้อง และตอบสนองต่อความล้มเหลวในหลายๆ สภาพแวดล้อม ในทางกลับกัน แพลตฟอร์มที่รวมกันช่วยให้ทีมสามารถมุ่งเน้นไปที่การปรับปรุงระบบเดียว ซึ่งนำไปสู่ความน่าเชื่อถือที่ดีขึ้น, ประสิทธิภาพที่ดีขึ้น และประสบการณ์ของนักพัฒนาที่ดีขึ้น นอกจากนี้ยังทำให้กระบวนการ on-call และการแก้ปัญหาเป็นไปอย่างราบรื่นเพราะรูปแบบที่สอดคล้องกันและเข้าใจได้ง่าย
จากประสบการณ์ของคุณในการสร้างแพลตฟอร์ม Machine Learning ทั้งระบบ การออกแบบประสบการณ์ของนักพัฒนา (DevEx) มีความสำคัญแค่ไหนในการเร่งการนำเอา AI ไปสู่ทีมต่างๆ?
ประสบการณ์ของนักพัฒนาคือหนึ่งในพื้นที่ที่มีผลกระทบสูงสุดในการเร่งการนำเอา AI ไปสู่ทีมต่างๆ เมื่อทีมแพลตฟอร์มลงทุนในการทำให้ระบบง่ายต่อการใช้งานผ่านการทำงานแบบมาตรฐาน, เทมเพลต และการลดความซับซ้อนของโครงสร้างพื้นฐาน พวกเขาจะเพิ่มผลผลิตของทุกๆ วิศวกรในองค์กร สิ่งนี้มีความสำคัญอย่างยิ่งใน AI ซึ่งความเร็วในการเปลี่ยนแปลงสูงมาก และทีมต้องปรับปรุงอย่างรวดเร็วเพื่อรักษาความสามารถในการแข่งขัน การปรับปรุงประสบการณ์ของนักพัฒนาสามารถแปลผลโดยตรงไปสู่การทดลองที่เร็วขึ้น, เวลาในการผลิตที่เร็วขึ้น และผลกระทบทางธุรกิจที่มากขึ้น
การควบคุมต้นทุนกำลังกลายเป็นข้อกังวลหลักเมื่อ AI workloads ขยายตัว อะไรคือวิธีที่องค์กรมองข้ามในการลดต้นทุนโครงสร้างพื้นฐานโดยไม่สูญเสียประสิทธิภาพ?
เมื่อ AI workloads ขยายตัว การจัดการต้นทุนกลายเป็นเรื่องสำคัญและซับซ้อนมากขึ้น หนึ่งในความท้าทายที่มองข้ามได้ง่ายที่สุดคือวิธีที่ต้นทุนสามารถเพิ่มขึ้นอย่างรวดเร็วเนื่องจากความไม่มีประสิทธิภาพ โดยเฉพาะอย่างยิ่งด้วยโครงสร้างพื้นฐานที่ใช้ GPU การแก้ปัญหานี้ต้องการการผสมผสานระหว่างการกำกับดูแลที่เข้มแข็ง, ความสามารถในการสังเกตการณ์ และการทำงานอัตโนมัติ เช่น การปรับขนาดอัตโนมัติ, การยุติอัตโนมัติ และการจัดการทรัพยากรที่รวมกัน
คุณได้ทำงานในหลายๆ ด้านตั้งแต่ฟีเจอร์สโตร์ไปจนถึงระบบอนุมานแบบเรียลไทม์ คุณคิดว่าสัดส่วนระหว่าง AI แบบแบตช์และแบบเรียลไทม์กำลังเปลี่ยนแปลงไปอย่างไร?
สัดส่วนระหว่าง AI แบบแบตช์และแบบเรียลไทม์ยังคงไม่เปลี่ยนแปลง – ยังคงเป็นเรื่องของความต้องการทางธุรกิจ การประมวลผลแบบแบตช์โดยทั่วไปมีค่าใช้จ่ายน้อยกว่าและง่ายต่อการดำเนินงาน ทำให้เหมาะสำหรับหลายกรณีการใช้งาน ระบบแบบเรียลไทม์จำเป็นเมื่อความหน่วงส่งผลโดยตรงกระทบต่อประสบการณ์ของผู้ใช้หรือผลลัพธ์ทางธุรกิจ เช่น ในแอปพลิเคชันแชทหรือการตรวจจับฉ้อโกง ทั้งสองแนวทางจะยังคงร่วมกัน และคำตอบสุดท้ายขึ้นอยู่กับการแลกเปลี่ยนระหว่างต้นทุน, ความหน่วง และความน่าเชื่อถือ
เมื่อมองไปข้างหน้า “แพลตฟอร์ม AI ขององค์กรที่เติบโตเต็มที่” จะมีลักษณะอย่างไรใน 2-3 ปี และเครื่องมืออย่าง Ray และแพลตฟอร์มอย่าง Anyscale มีบทบาทอย่างไรในอนาคต?
ในอีก 2-3 ปี แพลตฟอร์ม AI ขององค์กรที่เติบโตเต็มที่จะถูกกำหนดโดยคุณลักษณะหลักๆ ดังนี้: พวกมันจะพึ่งพาโครงสร้างพื้นฐานที่รวมกันซึ่งรองรับทั้งวงจรชีวิตของ AI ตั้งแต่การประมวลผลข้อมูลไปจนถึงการฝึกอบรมและการอนุมาน แทนที่จะเป็นเครื่องมือที่ไม่เชื่อมต่อกัน พวกมันจะมีการดำเนินงานวันที่สองที่เข้มแข็ง โดยมีการสังเกตการณ์อัตโนมัติ, ความน่าเชื่อถือ และความสามารถในการแก้ปัญหาอย่างรวดเร็ว การควบคุมต้นทุนจะถูกทำนายและควบคุมได้ ทำให้องค์กรมีความสามารถในการขยายตัวได้อย่างยั่งยืน และสิ่งที่สำคัญที่สุดคือ พวกมันจะทำให้นักพัฒนามีความเร็วในการพัฒนาได้อย่างรวดเร็ว ทำให้ทีมสามารถย้ายจากความคิดไปสู่การผลิตได้อย่างรวดเร็ว แพลตฟอร์มอย่าง Ray และ Anyscale มีบทบาทสำคัญในอนาคตโดยการให้โครงสร้างพื้นฐาน AI ที่เป็นเจ้าของซึ่งทำให้สามารถขยายตัวได้
ขอขอบคุณสำหรับการสัมภาษณ์ที่ยอดเยี่ยม ผู้อ่านสามารถเรียนรู้เพิ่มเติมได้ที่ Anyscale.












