ผู้นำทางความคิด

โมเดล LLM ที่ทำมาเองสำหรับทุกธุรกิจ? DeepSeek แสดงให้เราเห็นถึงทางเลือก

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

เมื่อครั้งหนึ่ง คำร้องขอทางเทคนิคคือ “โทรศัพท์มือถือสำหรับทุกคน” – และแท้จริงแล้ว การสื่อสารมือถือได้ปฏิวัติธุรกิจ (และโลก) ในปัจจุบัน คำร้องขอเทียบเท่าคือการให้ทุกคนเข้าถึงแอปพลิเคชัน AI แต่พลังที่แท้จริงของ AI คือการนำมาใช้เพื่อตอบสนองความต้องการเฉพาะของธุรกิจและองค์กร เส้นทางที่ Chinese startup DeepSeek ปione ได้แสดงให้เห็นว่า AI สามารถถูกนำมาใช้โดยทุกคน โดยเฉพาะผู้ที่มีงบประมาณจำกัด เพื่อตอบสนองความต้องการเฉพาะของตนเอง การมาถึงของ AI ที่มีต้นทุนต่ำกว่าและประสิทธิภาพที่ดีกว่า สัญญาว่าจะเปลี่ยนแปลงรูปแบบที่ AI เป็นไปไม่ได้สำหรับธุรกิจขนาดเล็กและองค์กรหลายแห่งเนื่องจากต้นทุน

โมเดล LLM เป็นหรือเคยเป็นโครงการที่มีค่าใช้จ่ายสูง ซึ่งต้องการการเข้าถึงข้อมูลจำนวนมาก คอมพิวเตอร์ที่มีประสิทธิภาพสูงในการประมวลผลข้อมูล และเวลาและทรัพยากรในการฝึกอบรมโมเดล แต่กฎเหล่านั้นกำลังเปลี่ยนแปลงไป DeepSeek พัฒนาโมเดล LLM ของตนเองและแอปพลิเคชันประเภท ChatGPT สำหรับการซักถามด้วยการลงทุนที่น้อยกว่ามากเมื่อเทียบกับระบบที่คล้ายกันที่สร้างโดยบริษัทในอเมริกาและยุโรป วิธีการของ DeepSeek เปิดหน้าต่างให้กับการพัฒนา LLM สำหรับองค์กรขนาดเล็กที่ไม่มีเงินหลายพันล้านเพื่อใช้จ่าย ในความเป็นจริง วันหนึ่งอาจไม่ไกลที่สุดเมื่อองค์กรส่วนใหญ่สามารถพัฒนา LLM ของตนเองเพื่อใช้ในการเฉพาะเจาะจง ซึ่งมักจะให้ผลลัพธ์ที่ดีกว่า LLM ทั่วไป เช่น ChatGPT

ในขณะที่มีการถกเถียงเกี่ยวกับต้นทุนจริงของ DeepSeek แต่ไม่ใช่แค่ต้นทุนเท่านั้นที่ทำให้แตกต่าง มันคือการขึ้นอยู่กับชิปที่ไม่ซับซ้อนและแนวทางที่มุ่งเน้นในการฝึกอบรม ในฐานะบริษัทจีนภายใต้การจำกัดการส่งออกของสหรัฐฯ DeepSeek ไม่สามารถเข้าถึงชิป Nvidia ที่มีประสิทธิภาพสูงซึ่งโดยทั่วไปใช้สำหรับการประมวลผลที่หนักในการพัฒนา LLM และดังนั้นจึงถูกบังคับให้ใช้ชิป Nvidia (NVDA ) H-800 ที่มีพลังการประมวลผลน้อยกว่า

เพื่อชดเชยการขาดพลังการประมวลผล DeepSeek ได้ใช้วิธีการที่แตกต่างและเน้นไปที่การพัฒนา LLM ของตนเอง แทนที่จะโยนข้อมูลจำนวนมากเข้าไปในโมเดลและพึ่งพาการประมวลผลเพื่อระบุและใช้ข้อมูล DeepSeek ได้แคบลงในการฝึกอบรม โดยใช้ข้อมูล “cold-start” คุณภาพสูงจำนวนเล็กน้อย และใช้การเรียนรู้แบบเสริมกำลังแบบเชิงกล (IRL) โดยมีแอลกอริทึมที่ใช้ข้อมูลในสถานการณ์ที่แตกต่างกันและเรียนรู้จากมัน วิธีการที่เน้นไปที่การฝึกอบรมนี้ช่วยให้โมเดลเรียนรู้ได้เร็วขึ้น โดยมีข้อผิดพลาดน้อยลงและพลังการประมวลผลที่สูญเสียน้อยลง

ในทำนองเดียวกับที่พ่อแม่อาจชี้แนะการเคลื่อนไหวเฉพาะของทารก เพื่อช่วยให้ทารกกลิ้งได้สำเร็จครั้งแรก – แทนที่จะปล่อยให้ทารกค้นหาด้วยตัวเองหรือสอนให้ทารกรู้จักการเคลื่อนไหวที่หลากหลายซึ่งอาจช่วยให้ทารกกลิ้งได้ – นักวิทยาศาสตร์ข้อมูลที่ฝึกอบรมโมเดล AI ที่เน้นไปที่การฝึกอบรมนี้มุ่งเน้นไปที่สิ่งที่จำเป็นสำหรับงานและผลลัพธ์ที่เฉพาะเจาะจง มากกว่าการให้การเคลื่อนไหวที่หลากหลายซึ่งอาจช่วยให้กลิ้งได้ โมเดลเหล่านี้อาจไม่มีการใช้งานที่เชื่อถือได้เหมือนกับ LLM ที่ใหญ่กว่า เช่น ChatGPT แต่สามารถพึ่งพาได้สำหรับการใช้งานเฉพาะและทำงานด้วยความแม่นยำและประสิทธิภาพ

วิธีการนี้เกี่ยวกับการให้ AI ข้อมูลที่ดีที่สุดเพื่อให้ AI สามารถบรรลุเป้าหมายได้อย่างชาญฉลาดและประหยัดที่สุด และสามารถมีคุณค่าสำหรับองค์กรใดๆ ที่ต้องการพัฒนา LLM สำหรับความต้องการและงานเฉพาะของตนเอง วิธีการนี้มีคุณค่ามากขึ้นสำหรับธุรกิจขนาดเล็กและองค์กรขนาดเล็ก ขั้นตอนแรกคือการเริ่มต้นด้วยข้อมูลที่ถูกต้อง ตัวอย่างเช่น บริษัทที่ต้องการใช้ AI เพื่อช่วยเหลือทีมขายและตลาดควรมีการฝึกอบรมโมเดลของตนเองบนชุดข้อมูลที่เลือกอย่างรอบคอบซึ่งมุ่งเน้นไปที่การซักถามการขาย กลยุทธ์ และเมตริกการขาย ซึ่งจะช่วยให้โมเดลไม่สูญเสียเวลาและพลังการประมวลผลไปกับข้อมูลที่ไม่เกี่ยวข้อง

สิ่งนี้ยังมีความคล้ายคลึงกับการเลี้ยงลูกในหลายๆ ด้าน เช่นเดียวกับที่ฉันเรียนรู้ตัวเองหลังจากที่ฉันกลายเป็นแม่เมื่อไม่กี่เดือนก่อน ในทั้งสองกรณี วิธีการที่มีคำแนะนำและเป็นขั้นตอนจะช่วยหลีกเลี่ยงการเสียทรัพยากรและลดความขัดแย้ง สุดท้าย วิธีการนี้ทั้งสำหรับเด็กและโมเดล AI จะนำไปสู่การปรับปรุงที่ดีขึ้น เมื่อเด็กโตขึ้นหรือโมเดลเรียนรู้มากขึ้น ความสามารถของมันจะดีขึ้น

วิธีการนี้จะช่วยลดต้นทุนและป้องกันไม่ให้โครงการ AI กลายเป็นภาระที่ใช้ทรัพยากร และทำให้โครงการ AI มีความสามารถในการเข้าถึงได้มากขึ้นสำหรับทีมและองค์กรขนาดเล็ก และจะนำไปสู่การทำงานที่ดีขึ้นของโมเดล AI ได้เร็วขึ้น และเนื่องจากโมเดลไม่ได้ถูกโหลดด้วยข้อมูลที่ไม่จำเป็น โมเดลจึงสามารถปรับให้เข้ากับข้อมูลใหม่และความต้องการทางธุรกิจที่เปลี่ยนแปลงได้ – ซึ่งเป็นสิ่งสำคัญในตลาดที่มีการแข่งขัน

การมาถึงของ DeepSeek และโลกของ AI ที่มีต้นทุนต่ำและประสิทธิภาพที่ดีกว่า – แม้ว่าจะทำให้เกิดความตื่นตระหนกในโลก AI และตลาดหุ้นในตอนแรก – แต่โดยรวมแล้วเป็นข่าวดีสำหรับภาค AI ประสิทธิภาพและต้นทุนที่ต่ำกว่าของ AI สำหรับการใช้งานเฉพาะจะนำไปสู่การใช้ AI มากขึ้นโดยทั่วไป ซึ่งจะขับเคลื่อนการเติบโตสำหรับทุกคน ตั้งแต่นักพัฒนาไปจนถึงผู้ผลิตชิปและผู้ใช้ปลายทาง ในความเป็นจริง DeepSeek แสดงให้เห็นถึง Jevons Paradox – ซึ่งประสิทธิภาพที่มากขึ้นจะนำไปสู่การใช้ทรัพยากรมากขึ้น ไม่น้อยลง เมื่อแนวโน้มนี้ดูเหมือนจะดำเนินต่อไป ธุรกิจขนาดเล็กที่มุ่งเน้นการใช้ AI เพื่อตอบสนองความต้องการเฉพาะของตนเองก็จะพร้อมสำหรับการเติบโตและความสำเร็จมากขึ้น

สตาฟ เลวี-เนียมมาร์ค เป็น CEO และผู้ร่วมก่อตั้ง Alta และเป็นผู้เชี่ยวชาญด้านการบริหารผลิตภัณฑ์และการเติบโตของรายได้ ในช่วงก่อนหน้านี้ เธอเป็นหนึ่งในพนักงานแรกของ Monday.com โดยที่เธอได้ช่วยพัฒนา "BigBrain" ซึ่งเป็นเครื่องมือ BI ภายในที่ใช้สำหรับการดำเนินงานของบริษัทประจำวัน สตาฟ จบการศึกษาระดับ BS.c ในสาขาวิชาวิทยาการคอมพิวเตอร์และสถิติจาก The Hebrew University of Jerusalem