ผู้นำทางความคิด

การปรับปรุงการอนุมาน AI: เทคนิคและแนวทางปฏิบัติที่ดีที่สุด

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

เมื่อพูดถึงแอปพลิเคชันที่ขับเคลื่อนด้วย AI ในแบบเรียลไทม์ เช่น รถยนต์ไร้คนขับ หรือ การตรวจสอบสุขภาพ การประมวลผลอินพุตเพิ่มเติมเพียงวินาทีเดียวอาจมีผลกระทบร้ายแรงได้ แอปพลิเคชัน AI ในแบบเรียลไทม์ต้องการ GPU และพลังประมวลผลที่เชื่อถือได้ ซึ่งเคยเป็นเรื่องที่มีค่าใช้จ่ายสูงและเป็นอุปสรรคต่อการนำไปใช้ – จนถึงตอนนี้

ด้วยการนำกระบวนการอนุมานที่ได้รับการปรับปรุงมาใช้ธุรกิจไม่เพียงแต่สามารถเพิ่มประสิทธิภาพ AI ให้สูงสุดเท่านั้น แต่ยังสามารถลดการบริโภคพลังงานและค่าใช้จ่ายในการดำเนินงาน (มากถึง 90%) เพิ่มความเป็นส่วนตัวและความปลอดภัย และแม้แต่เพิ่มความพึงพอใจของลูกค้า

ปัญหาการอนุมานทั่วไป

บางปัญหาที่พบบ่อยที่สุดซึ่งบริษัทต่างๆ ต้องเผชิญเมื่อต้องจัดการกับประสิทธิภาพของ AI ได้แก่ การใช้ GPU ที่ไม่ได้ถูกใช้ประโยชน์แบบคลัสเตอร์ การใช้แบบจำลองทั่วไปโดยอัตโนมัติ และการขาดความเข้าใจเกี่ยวกับค่าใช้จ่ายที่เกี่ยวข้อง

ทีมงานมักจะจัดเตรียมคลัสเตอร์ GPU สำหรับการใช้งานสูงสุด แต่ระหว่าง 70 ถึง 80% ของเวลาที่เหลือจะไม่ได้ใช้เนื่องจากการทำงานที่ไม่สม่ำเสมอ

นอกจากนี้ ทีมงานยังใช้แบบจำลองทั่วไปขนาดใหญ่ (GPT-4, Claude) แม้สำหรับงานที่สามารถรันบนแบบจำลองโอเพ่นซอร์สที่เล็กกว่าและราคาถูกกว่าก็ตาม สาเหตุหลักมาจากขาดความรู้และความชันของการเรียนรู้ในการสร้างแบบจำลองที่กำหนดเอง

สุดท้าย วิศวกรโดยทั่วไปไม่มีข้อมูลเกี่ยวกับค่าใช้จ่ายจริงสำหรับการร้องขอแต่ละครั้ง ซึ่งนำไปสู่ค่าใช้จ่ายที่สูง Tools เช่น PromptLayer, Helicone สามารถช่วยให้ได้รับข้อมูลนี้

ด้วยการขาดการควบคุมในการเลือกแบบจำลอง การแบตช์ และการใช้ประโยชน์ ค่าใช้จ่ายในการอนุมานสามารถเพิ่มขึ้นแบบทวีคูณ (มากถึง 10 เท่า) เสียทรัพยากร และลดความแม่นยำและประสบการณ์ของผู้ใช้

การบริโภคพลังงานและค่าใช้จ่ายในการดำเนินงาน

การรัน LLM ขนาดใหญ่ เช่น GPT-4, Llama 3 70B หรือ Mixtral-8x7B ต้องการ พลังงานที่มากกว่า ต่อโทเค็น ในเฉลี่ย 40 ถึง 50% ของพลังงานที่ใช้โดยศูนย์ข้อมูลจะใช้สำหรับการจัดหาไฟฟ้า และอีก 30 ถึง 40% จะใช้สำหรับการทำความเย็นของอุปกรณ์

ดังนั้น สำหรับบริษัทที่รันการอนุมานตลอด 24 ชั่วโมง การพิจารณาใช้บริการในสถานที่แทนการให้บริการบนคลาวด์จะช่วยลดค่าใช้จ่ายและ การบริโภคพลังงาน

ความเป็นส่วนตัวและความปลอดภัย

ตาม การศึกษาเกณฑ์มาตรฐานความเป็นส่วนตัวของ Cisco ปี 2025, “64% ของผู้ตอบแบบสอบถามกังวลเกี่ยวกับการแบ่งปันข้อมูลที่ละเอียดอ่อนโดยไม่ตั้งใจต่อสาธารณะหรือคู่แข่ง แต่เกือบครึ่งหนึ่งยอมรับว่าได้ป้อนข้อมูลพนักงานหรือข้อมูลที่ไม่ใช่สาธารณะเข้าไปในเครื่องมือ GenAI” ซึ่งเพิ่มความเสี่ยงในการไม่ปฏิบัติตามกฎระเบียบหากข้อมูลถูกบันทึกหรือแคชไม่เหมาะสม โอกาสอื่นสำหรับความเสี่ยงคือการรันแบบจำลองข้ามองค์กรลูกค้าที่แตกต่างกันบนโครงสร้างพื้นฐานที่ใช้ร่วมกัน ซึ่งอาจนำไปสู่การรั่วไหลของข้อมูลและปัญหาด้านประสิทธิภาพ และมีความเสี่ยงที่จะส่งผลกระทบต่อผู้ใช้รายอื่น ดังนั้น บริษัทจึงมักจะชอบบริการที่ติดตั้งในคลาวด์ของตนเอง

ความพึงพอใจของลูกค้า

เมื่อการตอบสนองใช้เวลาเกินกว่าไม่กี่วินาที ผู้ใช้โดยทั่วไปจะหยุดใช้งาน ซึ่งสนับสนุนความพยายามของวิศวกรในการเพิ่มประสิทธิภาพให้ได้ความหน่วงเวลาเป็นศูนย์ นอกจากนี้ แอปพลิเคชันยังนำเสนอ “อุปสรรค เช่น การหลอกลวงและความไม่แม่นยำที่อาจจำกัดผลกระทบและความนิยมในวงกว้าง” ตาม ข่าวประชาสัมพันธ์ของ Gartner.

ประโยชน์ของธุรกิจในการจัดการปัญหาเหล่านี้

การเพิ่มประสิทธิภาพการแบตช์ การเลือกแบบจำลองที่เหมาะสม (เช่น การเปลี่ยนจาก Llama 70B หรือแบบจำลองที่ปิดใช้งาน เช่น GPT เป็น Gemma 2B เมื่อเป็นไปได้) และการปรับปรุงการใช้ GPU สามารถลดค่าใช้จ่ายในการอนุมานได้ระหว่าง 60 ถึง 80% การใช้เครื่องมืออย่าง vLLM สามารถช่วยได้ เช่นเดียวกับการเปลี่ยนไปใช้แบบจำลองเสิร์ฟเวอร์เลสแบบจ่ายตามการใช้งานสำหรับเวิร์กโฟลว์ที่มีการเปลี่ยนแปลง

ให้พิจารณา Cleanlab เป็นตัวอย่าง Cleanlab เปิดตัว Trustworthy Language Model (TLM) เพื่อเพิ่ม คะแนนความน่าเชื่อถือให้กับการตอบสนองของ LLM ทุกครั้ง มันถูกออกแบบมาเพื่อผลลัพธ์คุณภาพสูงและความน่าเชื่อถือที่ดีขึ้น ซึ่งจำเป็นสำหรับแอปพลิเคชันระดับองค์กรเพื่อป้องกันการหลอกลวงที่ไม่ได้รับการตรวจสอบ ก่อน Inferless Cleanlabs ประสบปัญหาในการเพิ่มขึ้นของต้นทุน GPU เนื่องจาก GPU กำลังทำงานแม้ไม่ได้ใช้งานอยู่ ปัญหาเหล่านี้เป็นปัญหาแบบเดียวกับที่ผู้ให้บริการคลาวด์ GPU แบบดั้งเดิมมักพบ คือ ความหน่วงสูง การจัดการต้นทุนที่ไม่มีประสิทธิภาพ และสภาพแวดล้อมที่ซับซ้อนในการจัดการ ด้วยการอนุมานแบบเสิร์ฟเวอร์เลส พวกเขาลดค่าใช้จ่ายลง 90% ในขณะที่ยังคงรักษาระดับการทำงานไว้ สิ่งสำคัญที่สุดคือ พวกเขาทำให้ระบบออนไลน์ได้ภายในสองสัปดาห์โดยไม่มีค่าใช้จ่ายเพิ่มเติมสำหรับการจ้างวิศวกร

การปรับปรุงโครงสร้างแบบจำลอง

แบบจำลองพื้นฐาน เช่น GPT และ Claude มักถูกฝึกฝนสำหรับการใช้งานทั่วไป ไม่ใช่ประสิทธิภาพหรืองานเฉพาะ โดยการไม่ปรับแบบจำลองโอเพ่นซอร์สให้เหมาะสมกับกรณีการใช้งานเฉพาะธุรกิจจะสูญเสียหน่วยความจำและเวลาในการประมวลผลสำหรับงานที่ไม่ต้องการขนาดนั้น

ชิป GPU ใหม่ๆ เช่น H100 มีความเร็วและประสิทธิภาพสูง ชิปเหล่านี้มีความสำคัญอย่างยิ่งเมื่อรันการดำเนินการที่มีขนาดใหญ่ เช่น การสร้างวิดีโอหรืองานที่เกี่ยวข้องกับ AI CUDA คอร์ที่เพิ่มขึ้นจะเพิ่มความเร็วในการประมวลผล โดยเอาชนะ GPU ที่เล็กกว่า คอร์เทนเซอร์ของ NVIDIA (NVDA ) เทนเซอร์ถูกออกแบบมาเพื่อเร่งการทำงานเหล่านี้ในระดับใหญ่

หน่วยความจำ GPU ก็มีความสำคัญในการปรับปรุงโครงสร้างแบบจำลองเช่นกัน เนื่องจากแบบจำลอง AI ขนาดใหญ่ต้องการพื้นที่มาก นี้ทำให้ GPU สามารถรันแบบจำลองที่ใหญ่ขึ้นได้โดยไม่สูญเสียความเร็ว ในทางกลับกัน การแสดงผลของ GPU ที่มี VRAM น้อยกว่าจะเสียไปเมื่อพวกมันเคลื่อนย้ายข้อมูลไปยัง RAM ระบบที่ช้ากว่า

ผลประโยชน์หลายประการของการปรับปรุงโครงสร้างแบบจำลอง ได้แก่ การประหยัดเวลาและเงิน การเปลี่ยนจากแบบแปลงที่หนาแน่นไปเป็นรูปแบบที่ได้รับการปรับให้เหมาะสม เช่น LoRA หรือ FlashAttention สามารถลดเวลาในการตอบสนองต่อการร้องขอได้ 200-400 มิลลิวินาที ซึ่งสำคัญมากในแชทบอทและเกม ตัวอย่างเช่น นอกจากนี้ แบบจำลองที่ถูกปรับให้เหมาะสม (เช่น 4 บิตหรือ 8 บิต) ต้องการ VRAM น้อยกว่าและรันเร็วขึ้นบน GPU ที่ถูกกว่า

ในระยะยาว การปรับปรุงโครงสร้างแบบจำลองช่วยประหยัดเงินในการอนุมาน เนื่องจากแบบจำลองที่ได้รับการปรับปรุงสามารถรันบนชิปที่เล็กกว่าได้

การปรับปรุงโครงสร้างแบบจำลองเกี่ยวข้องกับขั้นตอนต่อไปนี้:

  • การปรับให้เหมาะสม — ลดความแม่นยำ (FP32 → INT4/INT8) เพื่อประหยัดหน่วยความจำและเร่งเวลาในการประมวลผล
  • การคัดเลือก — การลบหน่วยความจำหรือชั้นที่ไม่จำเป็น (แบบโครงสร้างหรือไม่มีโครงสร้าง)
  • การกลั่นกรอง — การฝึกแบบจำลอง “นักเรียน” ที่เล็กกว่าให้เลียนแบบการทำงานของแบบจำลองที่ใหญ่กว่า

การบีบอัดขนาดแบบจำลอง

แบบจำลองที่เล็กกว่าหมายถึงการอนุมานที่เร็วขึ้นและโครงสร้างพื้นฐานที่มีค่าใช้จ่ายน้อยกว่า แบบจำลองขนาดใหญ่ (13B+, 70B+) ต้องการ GPU ที่มีราคาแพง (A100s, H100s) VRAM สูง และพลังงานมาก การบีบอัดพวกมันทำให้สามารถรันบนฮาร์ดแวร์ที่ถูกกว่า เช่น A10s หรือ T4s โดยมีความหน่วงน้อย

แบบจำลองที่ถูกบีบอัดยังถือเป็นสิ่งสำคัญสำหรับการรันการอนุมานบนอุปกรณ์ (โทรศัพท์มือถือ, เบราว์เซอร์, IoT) เนื่องจากแบบจำลองที่เล็กกว่าทำให้สามารถให้บริการคำร้องขอที่พร้อมกันได้มากขึ้นโดยไม่ต้องปรับขนาดโครงสร้างพื้นฐาน ในแชทบอทที่มีผู้ใช้พร้อมกันมากกว่า 1,000 คน การเปลี่ยนจากแบบจำลอง 13B เป็นแบบจำลอง 7B ที่ถูกบีบอัดทำให้สามารถให้บริการผู้ใช้มากกว่าสองเท่าต่อ GPU โดยไม่มีการเพิ่มขึ้นของความหน่วง

การใช้ฮาร์ดแวร์เฉพาะ

ซีพียูแบบทั่วไปไม่ได้ถูกออกแบบมาเพื่อการดำเนินการเทนเซอร์ ฮาร์ดแวร์เฉพาะ เช่น NVIDIA A100s, H100s, Google TPUs หรือ AWS Inferentia สามารถให้การอนุมานที่เร็วขึ้น (10-100 เท่า) โดยมีประสิทธิภาพด้านพลังงานที่ดีขึ้น การลดเวลาในการตอบสนองเพียง 100 มิลลิวินาทีต่อการร้องขอสามารถสร้างความแตกต่างได้เมื่อประมวลผลล้านๆ การร้องขอต่อวัน

พิจารณาตัวอย่างสมมตินี้:

ทีมงานกำลังรัน LLaMA-13B บน GPU A10 ทั่วไปสำหรับระบบ RAG ภายในของพวกเขา ความหน่วงอยู่ที่ประมาณ 1.9 วินาที และพวกเขาไม่สามารถแบตช์ได้มากเนื่องจากข้อจำกัดของ VRAM ดังนั้นพวกเขาจึงเปลี่ยนไปใช้ H100s พร้อม TensorRT-LLM, Enable FP8 และเคอร์เนลการดูแลที่ได้รับการปรับปรุง และเพิ่มขนาดแบตช์จาก 8 เป็น 64 ผลลัพธ์คือการลดความหน่วงลงเหลือ 400 มิลลิวินาทีพร้อมกับการเพิ่มปริมาณการรับข้อมูล 5 เท่า
ดังนั้น พวกเขาจึงสามารถให้บริการคำร้องขอ 5 เท่าในงบเดียวกันและปลดปล่อยวิศวกรจากการรับมือกับปัญหาการขาดแคลนโครงสร้างพื้นฐาน

การประเมินตัวเลือกในการใช้งาน

กระบวนการต่างๆ ต้องการโครงสร้างพื้นฐานที่แตกต่างกัน เช่น แชทบอทที่มีผู้ใช้ 10 คนและเครื่องมือค้นหาที่ให้บริการล้านๆ คำถามต่อวัน มีความต้องการที่แตกต่างกัน การใช้คลาวด์ (เช่น AWS Sagemaker) หรือเซิร์ฟเวอร์ GPU DIY โดยไม่ประเมินอัตราส่วนการทำงานต่อค่าใช้จ่ายจะทำให้สูญเสียค่าใช้จ่ายและประสบการณ์ของผู้ใช้ที่ไม่ดี สิ่งสำคัญคือ หากคุณมอบหมายให้คลาวด์แบบปิดเร็วเกินไป การย้ายโซลูชันในภายหลังจะเจ็บปวด อย่างไรก็ตาม การประเมินในตอนต้นด้วยโครงสร้างแบบจ่ายตามการใช้งานจะให้ตัวเลือกในอนาคต

การประเมินประกอบด้วยขั้นตอนต่อไปนี้:

  • การเทียบค่าความหน่วงและค่าใช้จ่ายของแบบจำลองบนแพลตฟอร์มต่างๆ: การทดสอบ A/B บน AWS, Azure, คลัสเตอร์ GPU ท้องถิ่นหรือเครื่องมือเสิร์ฟเวอร์เลสเพื่อจำลอง
  • การวัดประสิทธิภาพการเริ่มต้น: สิ่งนี้มีความสำคัญอย่างยิ่งสำหรับงานเสิร์ฟเวอร์เลสหรืองานที่ขับเคลื่อนด้วยเหตุการณ์ เนื่องจากแบบจำลองโหลดเร็วขึ้น
  • การประเมินความสามารถในการสังเกตและขีดจำกัดของการปรับขนาด: การประเมินเมตริกที่มีอยู่และระบุว่าปริมาณคำถามต่อวินาทีที่สูงสุดคืออะไรก่อนที่จะลดลง
  • การตรวจสอบการสนับสนุนการปฏิบัติตามกฎระเบียบ: ตรวจสอบว่าคุณสามารถบังคับใช้กฎการรักษาความลับข้อมูลหรือบันทึกการตรวจสอบได้หรือไม่
  • การประมาณการค่าใช้จ่ายในการเป็นเจ้าของทั้งหมด ซึ่งควรรวมชั่วโมง GPU, การจัดเก็บ, แบนด์วิธ และค่าใช้จ่ายสำหรับทีม

สรุป

การอนุมานช่วยให้บริษัทต่างๆ สามารถเพิ่มประสิทธิภาพการทำงานของ AI ลดการใช้พลังงานและค่าใช้จ่าย รักษาความเป็นส่วนตัวและความปลอดภัย และทำให้ลูกค้าพึงพอใจ

ไอศวรรยา โกเอล เป็นร่วมก่อตั้งและซีอีโอของ Inferless ซึ่งเป็นแพลตฟอร์ม serverless ที่มีสถานะ ช่วยให้นักพัฒนาสามารถใช้โมเดลที่กำหนดเองและเปิด源码ได้ โดยมีการเริ่มต้นใหม่ที่ต่ำและ Autoscaling ที่มีประสิทธิภาพ