สัมภาษณ์

สุระภ วิจัย ซีอีโอ และผู้ร่วมก่อตั้ง MonsterAPI – ซีรีส์สัมภาษณ์

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

สุระภ วิจัย เป็นซีอีโอ และผู้ร่วมก่อตั้ง MonsterAPI เขาเคยทำงานเป็นนักฟิสิกส์อนุภาคที่ CERN และรับรู้ถึงศักยภาพของการประมวลผลแบบกระจายจากโครงการเช่น LHC@home

MonsterAPI ใช้ GPU ราคาถูกจากฟาร์มการขุดคริปโตเคอร์เรนซีไปยังศูนย์ข้อมูลขนาดเล็กที่ไม่ได้ใช้งาน เพื่อให้บริการโครงสร้างพื้นฐาน GPU ที่มีประสิทธิภาพสูงและราคาไม่แพงสำหรับการเรียนรู้ของเครื่องจักร ทำให้นักพัฒนาสามารถเข้าถึง ปรับแต่ง และใช้งานแบบจำลอง AI ได้อย่างง่ายดายโดยไม่ต้องเขียนโค้ดแม้แต่บรรทัดเดียว

ก่อนที่จะมาเป็น MonsterAPI เขาเคยบริหารสองสตาร์ทอัพ รวมถึงสตาร์ทอัพหนึ่งที่พัฒนาเครื่องมือความปลอดภัยแบบสวมใส่สำหรับสตรีในอินเดีย โดยร่วมมือกับรัฐบาลอินเดียและ IIT Delhi

คุณสามารถแบ่งปันเรื่องราวเบื้องหลัง MonsterGPT ได้หรือไม่?

ภารกิจของเรามีไว้เพื่อ “ช่วยให้นักพัฒนาซอฟต์แวร์ปรับแต่งและใช้งานแบบจำลอง AI ได้อย่างรวดเร็วและง่ายดาย” เราได้ทำความเข้าใจว่ามีหลายความท้าทายที่ซับซ้อนซึ่งนักพัฒนาต้องเผชิญเมื่อต้องการปรับแต่งและใช้งานแบบจำลอง AI

ตั้งแต่การรับมือกับโค้ดไปจนถึงการตั้งค่า Docker containers บน GPU และปรับขนาดตามความต้องการ

และความเร็วที่ระบบนิเวศกำลังเคลื่อนไหว ทำให้การปรับแต่งเพียงอย่างเดียวไม่เพียงพอ ต้องทำได้อย่างถูกต้อง: หลีกเลี่ยงการปรับแต่งที่ไม่เพียงพอหรือมากเกินไป การปรับพารามิเตอร์ไฮเปอร์ การนำวิธีการล่าสุดมาใช้ เช่น LORA และ Q-LORA เพื่อการปรับแต่งที่รวดเร็วและประหยัดยิ่งขึ้น เมื่อปรับแต่งแล้ว แบบจำลองจะต้องถูกใช้งานได้อย่างมีประสิทธิภาพ

ทำให้เราเข้าใจว่าการให้บริการเครื่องมือสำหรับส่วนหนึ่งของกระบวนการเพียงอย่างเดียวไม่เพียงพอ นักพัฒนาต้องการกระบวนการที่ได้รับการปรับให้เหมาะสมทั้งหมดพร้อมกับอินเทอร์เฟซที่ยอดเยี่ยมซึ่งพวกเขาคุ้นเคย ตั้งแต่การปรับแต่งไปจนถึงการประเมินและการใช้งานแบบจำลองของพวกเขา

ฉันตั้งคำถามให้ตัวเอง: ในฐานะนักฟิสิกส์อนุภาคที่เคยเป็นมา ฉันเข้าใจถึงผลกระทบที่ลึกซึ้งที่ AI สามารถมีต่อการทำงานทางวิทยาศาสตร์ แต่ฉันไม่รู้ว่าจะเริ่มต้นจากตรงไหน ฉันมีแนวคิดที่สร้างสรรค์ แต่ไม่มีเวลาในการเรียนรู้ทักษะและความแตกต่างของการเรียนรู้ของเครื่องจักร

หากฉันสามารถพูดคุยกับ AI ได้ และให้คำแนะนำเพื่อสร้างกระบวนการทั้งหมดสำหรับฉันและให้ API endpoint ที่ต้องการได้?

สิ่งนี้นำไปสู่ความคิดของระบบที่ใช้การซักถามเพื่อช่วยให้นักพัฒนาสามารถปรับแต่งและใช้งานแบบจำลอง AI ได้อย่างไม่มีพลัง

MonsterGPT เป็นขั้นตอนแรกในกระบวนการนี้

มีนักพัฒนาซอฟต์แวร์ นักนวัตกรรม และนักวิทยาศาสตร์หลายล้านคนที่สามารถใช้แนวทางนี้เพื่อสร้างแบบจำลองเฉพาะโดเมนสำหรับโครงการของตนได้

คุณสามารถอธิบายเทคโนโลยีที่ซ่อนอยู่เบื้องหลังตัวแทนการปรับใช้ GPT ของ Monster API ได้หรือไม่?

MonsterGPT ใช้เทคโนโลยีที่ทันสมัยเพื่อปรับใช้และปรับแต่งแบบจำลองภาษาขนาดใหญ่แบบเปิด (LLMs) เช่น Phi3 จาก Microsoft และ Llama 3 จาก Meta ได้อย่างมีประสิทธิภาพ

  1. RAG พร้อมการกำหนดค่าบริบท: เตรียมการกำหนดค่าที่มีพารามิเตอร์ที่เหมาะสมสำหรับการปรับแต่ง LLMs หรือการปรับใช้แบบจำลองโดยใช้ REST APIs ที่มีการปรับขนาดจาก MonsterAPI
  2. LoRA (Low-Rank Adaptation): ทำให้การปรับแต่งมีประสิทธิภาพโดยการอัปเดตเพียงส่วนหนึ่งของพารามิเตอร์ ซึ่งลดภาระการคำนวณและความต้องการหน่วยความจำ
  3. เทคนิคการปรับเทียบ: ใช้ GPT-Q และ AWQ เพื่อปรับประสิทธิภาพของแบบจำลองโดยการลดความแม่นยำ ซึ่งลดขนาดหน่วยความจำและเร่งการอนุมานโดยไม่สูญเสียความแม่นยำมากนัก
  4. วLLM Engine: ให้บริการ LLM ที่มีประสิทธิภาพสูงพร้อมคุณสมบัติเช่นการประมวลผลแบบต่อเนื่อง คอร์ CUDA ที่ได้รับการปรับให้เหมาะสม และอัลกอริทึมการถอดรหัสแบบขนานสำหรับการอนุมานขนาดใหญ่อย่างมีประสิทธิภาพ
  5. GPU ที่กระจายและราคาไม่แพงสำหรับการปรับขนาด: งานปรับแต่งและปรับใช้ของเรานั้นใช้เครือข่าย GPU ราคาไม่แพงจากผู้ให้บริการหลายราย ตั้งแต่ศูนย์ข้อมูลขนาดเล็กไปจนถึงคลาวด์ GPU ใหม่ๆ เช่น coreweave เพื่อให้ได้ราคาที่ต่ำกว่า ตัวเลือกที่หลากหลาย และความพร้อมใช้งานของ GPU เพื่อให้การประมวลผลที่มีประสิทธิภาพและปรับขนาดได้

ดูบล็อกโพสต์ใหม่ๆ เกี่ยวกับการปรับใช้ Llama 3 โดยใช้ MonsterGPT:

MonsterGPT ช่วยให้กระบวนการปรับแต่งและปรับใช้แบบจำลอง AI มีประสิทธิภาพมากขึ้นได้อย่างไร?

MonsterGPT มีอินเทอร์เฟซการซักถามที่สามารถเข้าใจคำสั่งภาษาธรรมชาติสำหรับการเปิดตัว การติดตาม และการจัดการงานปรับแต่งและปรับใช้ทั้งหมดได้ ความสามารถนี้ทำให้หลายขั้นตอนที่ซับซ้อนถูกทำให้ง่ายขึ้น เช่น

  • การสร้างพายพ์ข้อมูล
  • การค้นหาโครงสร้างพื้นฐาน GPU ที่เหมาะสมสำหรับงาน
  • การกำหนดค่าพารามิเตอร์ไฮเปอร์ที่เหมาะสม
  • การกำหนดค่าสภาพแวดล้อม ML พร้อมเฟรมเวิร์กและไลบรารีที่เข้ากันได้
  • การนำไปใช้แบบจำลอง LoRA/QLoRA สำหรับการปรับแต่งที่มีประสิทธิภาพพร้อมกลยุทธ์การปรับเทียบ
  • การแก้ไขปัญหา เช่น หน่วยความจำไม่เพียงพอและข้อผิดพลาดระดับโค้ด
  • การออกแบบและการนำไปใช้การปรับขนาดอัตโนมัติหลายโหนดพร้อมกับวLLM Engine สำหรับการปรับใช้ LLM

นักพัฒนาสามารถคาดหวังอินเทอร์เฟซและคำสั่งใดบ้างเมื่อโต้ตอบกับอินเทอร์เฟซการซักถามของ Monster API?

อินเทอร์เฟซเป็นเพียงอินเทอร์เฟซการซักถามง่ายๆ ที่ผู้ใช้สามารถสั่งให้ตัวแทนปรับแต่ง LLM สำหรับงานเฉพาะ เช่น การสรุป การเติมคำพูด การสร้างโค้ด การเขียนบล็อก ฯลฯ และเมื่อปรับแต่งแล้ว GPT สามารถสั่งให้ปรับใช้ LLM และซักถามแบบจำลองที่ปรับใช้แล้วจากอินเทอร์เฟซ GPT เองได้ ตัวอย่างคำสั่งรวมถึง

  • ปรับแต่ง LLM สำหรับการสร้างโค้ดบนเซตข้อมูล X
  • ฉันต้องการแบบจำลองที่ปรับแต่งสำหรับการเขียนบล็อก
  • ให้ API endpoint สำหรับแบบจำลอง Llama 3
  • ปรับใช้แบบจำลองขนาดเล็กสำหรับการใช้งานเขียนบล็อก

สิ่งนี้มีประโยชน์อย่างมากเพราะการค้นหาแบบจำลองที่เหมาะสมสำหรับโครงการของคุณอาจเป็นงานที่ใช้เวลานานได้ เมื่อมีแบบจำลองใหม่ๆ ออกมาอย่างต่อเนื่อง ทำให้เกิดความสับสนได้

วิธีการของ Monster API เทียบกับวิธีการแบบดั้งเดิมในการปรับใช้แบบจำลอง AI ในด้านความสามารถในการใช้งานและประสิทธิภาพ?

วิธีการของ Monster API เพิ่มความสามารถในการใช้งานและประสิทธิภาพมากกว่าวิธีการแบบดั้งเดิมในการปรับใช้แบบจำลอง AI

สำหรับความสามารถในการใช้งาน:

  1. การกำหนดค่าอัตโนมัติ: วิธีการแบบดั้งเดิมต้องการการตั้งค่าพารามิเตอร์และการกำหนดค่าด้วยตนเอง ซึ่งอาจใช้เวลานานและเกิดข้อผิดพลาดได้ MonsterAPI ทำให้กระบวนการนี้ง่ายขึ้นโดยใช้ RAG พร้อมการกำหนดค่าบริบท ลดขั้นตอนการตั้งค่าและความเสี่ยงของข้อผิดพลาด
  2. REST APIs ที่มีการปรับขนาด: MonsterAPI มี REST APIs ที่มีการปรับขนาดสำหรับการปรับใช้และปรับแต่งแบบจำลอง ทำให้สามารถเข้าถึงได้แม้สำหรับผู้ใช้ที่มีประสบการณ์ในการเรียนรู้ของเครื่องจักรน้อย
  3. แพลตฟอร์มที่รวมเป็นหนึ่งเดียว: MonsterAPI รวมกระบวนการทั้งหมด ตั้งแต่การปรับแต่งไปจนถึงการปรับใช้ไว้ในแพลตฟอร์มเดียว วิธีการแบบดั้งเดิมอาจต้องใช้เครื่องมือและแพลตฟอร์มที่แตกต่างกัน ซึ่งอาจทำให้เกิดความไม่มีประสิทธิภาพและความท้าทายในการรวมเข้าด้วยกัน

สำหรับประสิทธิภาพ:

MonsterAPI มีกระบวนการปรับแต่ง LLM ที่มีประสิทธิภาพสูงพร้อมการปรับเทียบและวLLM Engine สำหรับการปรับใช้ LLM ที่มีประสิทธิภาพสูง โดยใช้การปรับขนาดแบบต่อเนื่องและคอร์ CUDA ที่ได้รับการปรับให้เหมาะสม บนโครงสร้างพื้นฐาน GPU ที่มีราคาไม่แพงและปรับขนาดได้ ทำให้เพิ่มผลผลิตของนักพัฒนาด้วยการสร้างแอปพลิเคชัน LLM แบบกำหนดเองสำหรับการผลิตได้โดยไม่ต้องมีทักษะทางเทคนิคที่ซับซ้อน

คุณสามารถให้ตัวอย่างกรณีการใช้งานที่ Monster API ลดเวลาและทรัพยากรที่ต้องการสำหรับการปรับใช้แบบจำลองได้หรือไม่?

บริษัทที่ปรึกษาด้านไอทีต้องการปรับแต่งและปรับใช้แบบจำลอง Llama 3 เพื่อตอบสนองความต้องการของลูกค้า โดยไม่ต้องใช้ MonsterAPI พวกเขาจะต้องมีทีมวิศวกร MLOps 2-3 คนพร้อมทักษะการปรับพารามิเตอร์ไฮเปอร์ที่ลึกซึ้งเพื่อปรับปรุงคุณภาพของแบบจำลองบนเซตข้อมูลที่ให้มา และจากนั้นจึงใช้งานแบบจำลองที่ปรับแต่งแล้วเป็น REST API ที่มีการปรับขนาดโดยใช้การออร์เคสตรา เช่น Kubernetes นอกจากนี้ เพื่อเพิ่มประสิทธิภาพทางเศรษฐกิจในการให้บริการแบบจำลอง พวกเขายังต้องการใช้เฟรมเวิร์ก เช่น LoRA สำหรับการปรับแต่งและ vLLM สำหรับการให้บริการแบบจำลองเพื่อปรับปรุงเมตริกต้นทุนในขณะเดียวกันก็ลดการบริโภคหน่วยความจำ สิ่งนี้อาจเป็นความท้าทายที่ซับซ้อนสำหรับนักพัฒนาส่วนใหญ่และอาจใช้เวลาหลายสัปดาห์หรือแม้กระทั่งหลายเดือนในการบรรลุผลลัพธ์ที่พร้อมสำหรับการผลิต ด้วย MonsterAPI พวกเขาสามารถทดลองการปรับแต่งหลายครั้งภายในหนึ่งวันและใช้งานแบบจำลองที่ปรับแต่งแล้วพร้อมคะแนนการประเมินที่ดีที่สุดภายในไม่กี่ชั่วโมง โดยไม่ต้องมีทรัพยากรวิศวกรหลายคนพร้อมทักษะ MLOps ที่ลึกซึ้ง

Monster API ช่วยให้การเข้าถึงแบบจำลอง AI ที่สร้างขึ้นแบบเจนเนอรेटีฟสำหรับนักพัฒนาส่วนใหญ่และสตาร์ทอัพได้อย่างไร?

นักพัฒนาส่วนใหญ่และสตาร์ทอัพมักต้องดิ้นรนในการผลิตและใช้แบบจำลอง AI คุณภาพสูงเนื่องจากขาดทุนทรัพย์ และทักษะทางเทคนิค วิธีแก้ปัญหาของเราช่วยให้พวกเขาได้รับพลังโดยการลดต้นทุน ทำให้กระบวนการง่ายขึ้น และให้เครื่องมือ no-code/low-code ที่แข็งแกร่งเพื่อนำไปสู่การสร้างแบบจำลอง AI ที่พร้อมสำหรับการผลิต

ด้วยการนำ GPU ที่กระจายและราคาไม่แพงมาใช้ เราให้บริการทรัพยากร GPU ที่มีราคาไม่แพงและปรับขนาดได้ ซึ่งลดอุปสรรคด้านต้นทุนในการปรับใช้แบบจำลองที่มีประสิทธิภาพสูง โครงสร้างพื้นฐานของแพลตฟอร์มที่มีการกำหนดค่าอัตโนมัติและปรับพารามิเตอร์ไฮเปอร์ทำให้กระบวนการง่ายขึ้นและลดความจำเป็นในการมีทักษะทางเทคนิคที่ลึกซึ้ง

API ที่มีการปรับขนาดและกระบวนการที่รวมไว้ในแพลตฟอร์มเดียวทำให้เทคโนโลยี AI ที่ทันสมัยเข้าถึงได้แม้สำหรับผู้ที่มีประสบการณ์ในการเรียนรู้ของเครื่องจักรน้อย นอกจากนี้ การใช้เทคนิคการปรับแต่ง LoRA ที่มีประสิทธิภาพและเทคนิคการปรับเทียบ เช่น GPT-Q และ AWQ เพื่อเพิ่มประสิทธิภาพบนฮาร์ดแวร์ที่มีราคาไม่แพง ทำให้ต้นทุนการเข้าใช้ลดลง

แนวทางนี้ทำให้นักพัฒนาส่วนใหญ่และสตาร์ทอัพสามารถนำแบบจำลอง AI ที่สร้างขึ้นแบบเจนเนอรีตีฟมาใช้และจัดการได้อย่างมีประสิทธิภาพ

คุณเห็นอนาคตของ Monster API ในด้านการพัฒนาเทคโนโลยีและขยายตลาดอย่างไร?

ในระยะยาว เราต้องการช่วยให้นักวิศวกรซอฟต์แวร์ 30 ล้านคนกลายเป็นวิศวกร MLOps โดยใช้ตัวแทน MLOps ของเราและเครื่องมือทั้งหมดที่เรากำลังสร้าง

สิ่งนี้ต้องการให้เราสร้างเทคโนโลยีหลักๆ ที่เป็นกรรมสิทธิ์เกี่ยวกับเฟรมเวิร์กการปรับแต่ง วิธีการบรรจุภัณฑ์ และการออร์เคสตรา

เรามองเห็นว่าการที่มีอินเทอร์เฟซที่ดีและง่ายต่อการใช้งาน การเพิ่มประสิทธิภาพ 10 เท่า และ GPU ที่กระจายและราคาไม่แพง มีศักยภาพที่จะเปลี่ยนแปลงผลผลิตของนักพัฒนาที่ใช้งาน AI และเร่งการนำ AI ที่สร้างขึ้นแบบเจนเนอรีตีฟมาใช้

การวิจัยและความพยายามทั้งหมดของเรามุ่งไปในทิศทางนี้

ขอขอบคุณสำหรับการสัมภาษณ์ที่ยอดเยี่ยม ผู้อ่านสามารถเยี่ยมชม MonsterAPI เพื่อเรียนรู้เพิ่มเติม

อองตวนเป็นผู้นำที่มีวิสัยทัศน์และเป็นหุ้นส่วนผู้ก่อตั้งของ Unite.AI โดยมีความหลงใหลที่ไม่สั่นคลอนในการ塑造และ推廣อนาคตของ AI และหุ่นยนต์ เขาเป็นผู้ประกอบการซีรีย์ที่เชื่อว่า AI จะมีผลกระทบต่อสังคมมากเท่ากับไฟฟ้า และมักจะพูดถึงศักยภาพของเทคโนโลยีที่เป็นนวัตกรรมและ AGI

ในฐานะ นักอนาคต เขาได้ทำการสำรวจว่านวัตกรรมเหล่านี้จะเปลี่ยนแปลงโลกของเราอย่างไร นอกจากนี้เขายังเป็นผู้ก่อตั้ง Securities.io ซึ่งเป็นแพลตฟอร์มที่มุ่งเน้นในการลงทุนในเทคโนโลยีที่ทันสมัยที่สุดซึ่งกำลังเปลี่ยนแปลงอนาคตและเปลี่ยนแปลงอุตสาหกรรมทั้งหมด