โมเดลและแพลตฟอร์ม AI

การอนุมาน AI ที่มีประสิทธิภาพสูงด้วยสถาปัตยกรรม NVIDIA Dynamo

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

เมื่อเทคโนโลยี ปัญญาประดิษฐ์ (AI) มีความก้าวหน้า ความต้องการโซลูชันการอนุมานที่มีประสิทธิภาพและสามารถปรับขนาดได้เพิ่มขึ้นอย่างรวดเร็ว ในไม่ช้า การอนุมาน AI คาดว่าจะมีความสำคัญมากกว่าการฝึกอบรม เนื่องจากบริษัทต่างๆ มุ่งเน้นไปที่การรันโมเดลอย่างรวดเร็วเพื่อทำนายผลลัพธ์ในเวลาจริง การเปลี่ยนแปลงนี้เน้นย้ำถึงความจำเป็นในการมีโครงสร้างพื้นฐานที่แข็งแกร่งเพื่อจัดการข้อมูลจำนวนมากโดยมีการหน่วงช้าให้น้อยที่สุด

การอนุมานเป็นสิ่งจำเป็นในอุตสาหกรรมต่างๆ เช่น ยานพาหนะอัตโนมัติ การตรวจจับการฉ้อโกง และการวินิจฉัยทางการแพทย์ในเวลาจริง อย่างไรก็ตาม มี挑战ที่เป็นเอกลักษณ์ โดยเฉพาะอย่างยิ่งเมื่อปรับขนาดเพื่อตอบสนองความต้องการของงาน เช่น การสตรีมวิดีโอ การวิเคราะห์ข้อมูลแบบเรียลไทม์ และข้อมูลลูกค้า โมเดล AI แบบดั้งเดิมต้องดิ้นรนเพื่อจัดการกับงานที่มีการรับส่งข้อมูลสูงเหล่านี้อย่างมีประสิทธิภาพ ซึ่งมักจะส่งผลให้มีค่าใช้จ่ายสูงและความล่าช้า เมื่อบริษัทต่างๆ ขยายความสามารถ AI ของตน พวกเขาต้องการโซลูชันในการจัดการการอนุมานจำนวนมากโดยไม่สูญเสียประสิทธิภาพหรือเพิ่มค่าใช้จ่าย

นี่คือที่ที่ NVIDIA Dynamo (NVDA ) เข้ามา Dynamo เป็นเฟรมเวิร์ก AI ใหม่ที่ออกแบบมาเพื่อแก้ไขปัญหาการอนุมาน AI ที่มีประสิทธิภาพสูง โดยช่วยให้บริษัทต่างๆ สามารถเร่งการอนุมานได้ ในขณะที่ยังคงประสิทธิภาพที่แข็งแกร่งและลดค่าใช้จ่าย Dynamo สร้างขึ้นบนสถาปัตยกรรม GPU ที่แข็งแกร่งของ NVIDIA และรวมเข้ากับเครื่องมือ เช่น CUDA, TensorRT และ Triton ทำให้ Dynamo เปลี่ยนแปลงวิธีการที่บริษัทต่างๆ จัดการการอนุมาน AI ทำให้ง่ายขึ้นและประสิทธิภาพมากขึ้นสำหรับธุรกิจทุกขนาด

ความท้าทายที่เพิ่มขึ้นของการอนุมาน AI ที่มีประสิทธิภาพสูง

การอนุมาน AI คือกระบวนการของการใช้โมเดลการเรียนรู้ของเครื่องแบบฝึกอบรมล่วงหน้าเพื่อทำนายผลลัพธ์จากข้อมูลในโลกแห่งความเป็นจริง และเป็นสิ่งจำเป็นสำหรับหลายๆ แอปพลิเคชัน AI ในเวลาจริง อย่างไรก็ตาม ระบบแบบดั้งเดิมมักจะพบปัญหาในการจัดการกับความต้องการที่เพิ่มขึ้นของการอนุมาน AI โดยเฉพาะอย่างยิ่งในพื้นที่ เช่น ยานพาหนะอัตโนมัติ การตรวจจับการฉ้อโกง และการวินิจฉัยทางการแพทย์

ความต้องการ AI ในเวลาจริงกำลังเติบโตอย่างรวดเร็ว โดยขับเคลื่อนโดยความจำเป็นในการตัดสินใจอย่างรวดเร็วและทันที รายงานของ Forrester ในเดือนพฤษภาคม 2024 พบว่า 67% ของธุรกิจรวม การสร้าง AI เข้ากับการดำเนินงานของตน ซึ่งเน้นย้ำถึงความสำคัญของ AI ในเวลาจริง การอนุมานเป็นแก่นกลางของหลายๆ งานที่ขับเคลื่อนด้วย AI เช่น การทำให้รถยนต์ขับเคลื่อนอัตโนมัติสามารถตัดสินใจได้อย่างรวดเร็ว การตรวจจับการฉ้อโกงในธุรกรรมทางการเงิน และช่วยในการวินิจฉัยทางการแพทย์ เช่น การวิเคราะห์ภาพทางการแพทย์

尽管มีความต้องการนี้ ระบบแบบดั้งเดิมต้องดิ้นรนเพื่อจัดการกับขนาดของงานเหล่านี้ หนึ่งในปัญหาที่สำคัญที่สุดคือการไม่ได้ใช้ GPU ในการทำงานที่มีประสิทธิภาพสูง ในหลายๆ ระบบ การใช้ GPU ยังคงอยู่ที่ประมาณ 10% ถึง 15% ซึ่งหมายความว่าพลังการประมวลผลที่สำคัญถูกใช้ไม่เต็มที่ เมื่อปริมาณงานสำหรับการอนุมาน AI เพิ่มขึ้น ปัญหาเพิ่มเติมจะเกิดขึ้น เช่น ข้อจำกัดของหน่วยความจำและปัญหา cache ที่ทำให้เกิดความล่าช้าและลดประสิทธิภาพโดยรวม

การบรรลุความล่าช้าที่ต่ำเป็นสิ่งสำคัญสำหรับแอปพลิเคชัน AI ในเวลาจริง แต่ระบบแบบดั้งเดิมต้องดิ้นรนเพื่อรักษาความล่าช้าที่ต่ำ โดยเฉพาะอย่างยิ่งเมื่อใช้โครงสร้างพื้นฐานบนคลาวด์ รายงานของ McKinsey เผยให้เห็นว่า 70% ของโครงการ AI ล้มเหลวในการบรรลุเป้าหมายเนื่องจากปัญหาเกี่ยวกับคุณภาพและความซับซ้อนของข้อมูล สิ่งเหล่านี้เน้นย้ำถึงความจำเป็นในการมีโซลูชันที่มีประสิทธิภาพและสามารถปรับขนาดได้มากขึ้น นี่คือที่ที่ NVIDIA Dynamo เข้ามา

การปรับให้เหมาะสมของการอนุมาน AI ด้วย NVIDIA Dynamo

NVIDIA Dynamo เป็นเฟรมเวิร์กแบบเปิดที่ปรับให้เหมาะสมสำหรับการอนุมาน AI ในขนาดใหญ่ในหลายๆ สภาพแวดล้อมของ GPU มันถูกออกแบบมาเพื่อแก้ไขปัญหาทั่วไปในการสร้าง AI และการให้เหตุผล เช่น การไม่ได้ใช้ GPU อย่างเต็มที่ ข้อจำกัดของหน่วยความจำ และการกำหนดเส้นทางคำขอที่ไม่มีประสิทธิภาพ Dynamo รวมการปรับให้เหมาะสมของฮาร์ดแวร์และนวัตกรรมซอฟต์แวร์เพื่อแก้ไขปัญหาเหล่านี้ โดยให้โซลูชันที่มีประสิทธิภาพมากขึ้นสำหรับแอปพลิเคชัน AI ที่มีความต้องการสูง

หนึ่งในคุณสมบัติที่สำคัญของ Dynamo คือ สถาปัตยกรรมการให้บริการแบบแยกส่วน ซึ่งแยกเฟสการประมวลผลที่ต้องใช้พลังการประมวลผลสูงออกจากเฟสการสร้างโทเค็น โดยการกำหนดแต่ละเฟสให้กับคลัสเตอร์ GPU ที่แตกต่างกัน Dynamo ช่วยให้สามารถปรับให้เหมาะสมได้อย่างอิสระ เฟสการประมวลผลใช้ GPU ที่มีหน่วยความจำสูงสำหรับการดูดซึมบริบทที่รวดเร็ว ในขณะที่เฟสการสร้างโทเค็นใช้ GPU ที่มีการปรับให้เหมาะสมสำหรับการสตรีมโทเค็นที่มีประสิทธิภาพสูง การแยกส่วนนี้ช่วยปรับปรุงการรับส่งข้อมูล ทำให้โมเดล เช่น Llama 70B มีความเร็วเป็นสองเท่า

มันรวมถึงผู้วางแผนการแจกจ่ายทรัพยากร GPU ที่กำหนดการแจกจ่าย GPU ตามการใช้งานจริง โดยการปรับให้เหมาะสมของการทำงานระหว่างคลัสเตอร์การประมวลผลและคลัสเตอร์การสร้างโทเค็นเพื่อป้องกันการให้บริการที่มากเกินไปและรอบการทำงานที่ไม่จำเป็น คุณสมบัติอีกอย่างหนึ่งที่สำคัญคือ KV cache-aware smart router ซึ่งรับประกันว่าการร้องขอที่เข้ามาจะถูกส่งไปยัง GPU ที่มีข้อมูล KV cache ที่เกี่ยวข้อง ลดการคำนวณที่ซ้ำซ้อนและปรับปรุงประสิทธิภาพ คุณสมบัตินี้มีประโยชน์อย่างยิ่งสำหรับโมเดลการให้เหตุผลแบบหลายขั้นตอนที่สร้างโทเค็นมากกว่าโมเดลภาษาขนาดใหญ่มาตรฐาน

NVIDIA Inference TranXfer Library (NIXL) เป็นส่วนประกอบที่สำคัญอีกอย่างหนึ่ง โดยช่วยให้สามารถสื่อสารระหว่าง GPU และหน่วยความจำ/การเก็บข้อมูลที่ไม่เหมือนกัน เช่น HBM และ NVMe ได้อย่างมีประสิทธิภาพ คุณสมบัตินี้รองรับการดึงข้อมูล KV cache ที่มีระยะเวลาหน่วงต่ำกว่า 1 มิลลิวินาที ซึ่งจำเป็นสำหรับงานที่ต้องใช้เวลาอย่างมาก ผู้จัดการ KV cache ที่กระจายก็ช่วยโหลดข้อมูล KV cache ที่ไม่ถูกใช้บ่อยออกจากหน่วยความจำ GPU ไปยังหน่วยความจำของระบบหรือ SSD โดยปลดปล่อยหน่วยความจำ GPU สำหรับการคำนวณที่ใช้งานอยู่ วิธีนี้ปรับปรุงประสิทธิภาพของระบบโดยรวมได้มากถึง 30 เท่า โดยเฉพาะสำหรับโมเดลขนาดใหญ่ เช่น DeepSeek-R1 671B

NVIDIA Dynamo รวมเข้ากับスタックเต็มรูปแบบของ NVIDIA รวมถึง CUDA, TensorRT และ Blackwell GPUs ในขณะที่รองรับแบ็คเอนด์การอนุมานที่ได้รับความนิยม เช่น vLLM และ TensorRT-LLM การทดสอบแสดงให้เห็นว่ามีการปรับปรุงประสิทธิภาพมากถึง 30 เท่าสำหรับโมเดล เช่น DeepSeek-R1 บนระบบ GB200 NVL72

เนื่องจาก Dynamo เป็นตัวสืบทอดของ Triton Inference Server จึงถูกออกแบบมาเพื่อใช้ในโรงงาน AI ที่ต้องการโซลูชันการอนุมานที่มีประสิทธิภาพและคุ้มต้นทุน มันให้ประโยชน์ต่อระบบอัตโนมัติ การวิเคราะห์แบบเรียลไทม์ และการทำงานแบบหลายโมเดล นอกจากนี้ การออกแบบแบบเปิดและแบบโมดูลาร์ยังช่วยให้สามารถปรับแต่งได้ง่าย ทำให้สามารถปรับให้เหมาะสมกับงาน AI ที่หลากหลาย

การประยุกต์ใช้จริงและการมีผลกระทบต่ออุตสาหกรรม

NVIDIA Dynamo ได้แสดงคุณค่าในหลายๆ อุตสาหกรรมที่การอนุมาน AI ในเวลาจริงมีความสำคัญ มันเพิ่มประสิทธิภาพของระบบอัตโนมัติ การวิเคราะห์แบบเรียลไทม์ และโรงงาน AI โดยช่วยให้สามารถใช้งาน AI ได้ในระดับสูง

บริษัท เช่น Together AI ได้ใช้ Dynamo เพื่อปรับขนาดการอนุมาน โดยบรรลุผลการเพิ่มความจุถึง 30 เท่าเมื่อใช้โมเดล DeepSeek-R1 บน GPU Blackwell ของ NVIDIA นอกจากนี้ การกำหนดเส้นทางคำขออย่างฉลาดและการวางแผนการแจกจ่าย GPU ของ Dynamo ยังช่วยปรับปรุงประสิทธิภาพในการใช้งาน AI ระดับใหญ่

ความได้เปรียบในการแข่งขัน: Dynamo เทียบกับทางเลือกอื่นๆ

NVIDIA Dynamo มีข้อได้เปรียบหลักเหนือทางเลือกอื่นๆ เช่น AWS Inferentia และ Google (GOOGL ) TPUs มันถูกออกแบบมาเพื่อจัดการการอนุมาน AI ระดับใหญ่โดยมีประสิทธิภาพ โดยการปรับให้เหมาะสมของการวางแผนการแจกจ่าย GPU การจัดการหน่วยความจำ และการกำหนดเส้นทางคำขอเพื่อปรับปรุงประสิทธิภาพในการใช้งานหลายๆ GPU ไม่เหมือนกับ AWS Inferentia ซึ่งเชื่อมโยงกับโครงสร้างพื้นฐานบนคลาวด์ของ AWS อย่างใกล้ชิด Dynamo ให้ความยืดหยุ่นโดยการรองรับทั้งการปรับใช้แบบไฮบริดคลาวด์และบนพื้นฐาน โดยช่วยให้บริษัทต่างๆ หลีกเลี่ยงการผูกพันผู้ให้บริการ

จุดแข็งหลักของ Dynamo คือ สถาปัตยกรรมแบบเปิดและแบบโมดูลาร์ ซึ่งช่วยให้บริษัทต่างๆ สามารถปรับแต่งเฟรมเวิร์กตามความต้องการของตนเอง มันปรับให้เหมาะสมทุกขั้นตอนของการอนุมาน AI เพื่อให้แน่ใจว่าโมเดล AI จะทำงานได้อย่างราบรื่นและมีประสิทธิภาพ ในขณะเดียวกันก็ใช้ทรัพยากรการประมวลผลที่มีอยู่ให้เกิดประโยชน์สูงสุด ด้วยการเน้นไปที่ความสามารถในการปรับขนาดและความยืดหยุ่น Dynamo จึงเหมาะสำหรับองค์กรที่กำลังมองหาโซลูชันการอนุมาน AI ที่มีประสิทธิภาพสูงและคุ้มต้นทุน

สรุป

NVIDIA Dynamo กำลังปฏิวัติโลกของการอนุมาน AI โดยให้โซลูชันที่มีประสิทธิภาพและสามารถปรับขนาดได้สำหรับความท้าทายที่บริษัทต่างๆ ต้องเผชิญกับแอปพลิเคชัน AI ในเวลาจริง การออกแบบแบบเปิดและแบบโมดูลาร์ทำให้สามารถปรับให้เหมาะสมกับการใช้ GPU และการจัดการหน่วยความจำได้ดีขึ้น และการกำหนดเส้นทางคำขอได้อย่างมีประสิทธิภาพ ทำให้เหมาะสำหรับงาน AI ระดับใหญ่

ไม่เหมือนกับระบบแบบดั้งเดิมหรือคู่แข่ง Dynamo รองรับทั้งการปรับใช้แบบไฮบริดคลาวด์และบนพื้นฐาน โดยให้ความยืดหยุ่นแก่บริษัทต่างๆ และลดการผูกพันผู้ให้บริการ ด้วยประสิทธิภาพและความสามารถในการปรับให้เหมาะสมที่น่าประทับใจ NVIDIA Dynamo ตั้งมาตรฐานใหม่สำหรับการอนุมาน AI โดยให้โซลูชันที่มีประสิทธิภาพสูง คุ้มต้นทุน และสามารถปรับขนาดได้สำหรับความต้องการ AI ของบริษัทต่างๆ

ดร. อัสซาด อับบาส เป็น Professor ที่ COMSATS University Islamabad, Pakistan ซึ่งได้รับ Ph.D. จาก North Dakota State University, USA การวิจัยของเขาเน้นไปที่เทคโนโลยีขั้นสูง รวมถึง cloud, fog, และ edge computing, big data analytics, และ AI ดร. อับบาสได้ทำการมีส่วนร่วมอย่างมากด้วยการเผยแพร่ผลงานในวารสารและประชุมวิชาการที่มีชื่อเสียง เขายังเป็นผู้ก่อตั้ง MyFastingBuddy