ผู้นำทางความคิด

ทำไม AI ระดับองค์กรถึงล้มเหลวที่เส้นชัย — และวิธีแก้ไข

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

แม้จะมีการพูดถึง AI อย่างกว้างขวาง แต่โครงการ AI ระดับองค์กรส่วนใหญ่ไม่เคยผ่านขั้นตอนทดลองไปได้เลย ตาม การวิจัยของ IDC ล่าสุด 88% ของโครงการพิสูจน์แนวคิด (POC) ด้าน AI ล้มเหลวในการขยายสู่การผลิตเต็มรูปแบบ นั่นเป็นการสูญเสียอย่างมหาศาลและเป็นสัญญาณชัดเจนว่ามีบางอย่างไม่ทำงานหลายโครงการเหล่านี้เข้าใกล้เส้นชัยแล้ว โดยมีโมเดลที่ผ่านการฝึกฝนตรงตามเกณฑ์ที่ทีมกำหนด แต่สุดท้ายก็ไม่ได้เปิดใช้งานหรือถูกนำไปใช้โดยผู้ใช้ปลายทาง

แล้วอะไรคือสาเหตุ? ในหลายกรณี ปัญหาเกิดจากสามประเด็นใหญ่:

  1. ทีม AI ระดับองค์กรพึ่งพาเครื่องมือวินิจฉัยและเกณฑ์มาตรฐานระดับผิวที่ไม่สามารถจับช่องว่างประสิทธิภาพสำคัญได้
  2. โมเดลถูกฝึกให้ตอบตามเกณฑ์มาตรฐานแทนการแก้ปัญหาในโลกจริง
  3. ต้นทุนการขยายการใช้โมเดลสูงเกินกว่าจะนำไปใช้ทั่วบริษัทได้

ในบทความนี้ เราจะเจาะลึกแต่ละข้อผิดพลาดและอธิบายว่าต้องทำอย่างไรเพื่อให้โครงการ AI ผ่านเส้นชัยและเข้าถึงผู้ใช้ได้อย่างกว้างขวาง

ปัญหา #1: การวินิจฉัยมาตรฐานที่พลาดปัญหาประสิทธิภาพสำคัญ

เหตุผลสำคัญหนึ่งที่ทำให้โครงการ AI พลาดหลังขั้น proof‑of‑concept คือเกณฑ์และการวินิจฉัยภายในมักไม่เจาะลึกพอในประสิทธิภาพของโมเดลและมักพลาดปัญหาที่ทำให้การใช้งาน ความเชื่อมั่น และการยอมรับลดลง ทีมอาจตรวจสอบทุกข้อบนกระดาษ แต่การตรวจสอบเหล่านั้นไม่ได้สะท้อนการทำงานของโมเดลในโลกจริงเสมอไป

ยกตัวอย่าง: ทีม AI หนึ่งมีโมเดลที่ผ่านการทดสอบภายในทุกอย่างด้วยคะแนนสูง พวกเขาได้ผ่านเกณฑ์ความแม่นยำและเกณฑ์ความปลอดภัยทั้งหมดและกำลังเตรียมปล่อยออกมา แต่เมื่อให้บุคคลที่สามประเมินโมเดลตามกรณีการใช้งานที่ตั้งใจเพื่อจำลองการโต้ตอบของผู้ใช้จริง พวกเขาพบช่องโบกมุมสำคัญ โมเดลมีแนวโน้มให้คำตอบหลีกเลี่ยงเมื่อถามในรูปแบบบางอย่างเก้าครั้งมากกว่าปกติ ตัวอย่างเช่น โมเดลตอบถูกต้องเมื่อถามว่า “Who is the president of the US?” แต่เมื่อถามว่า “Can you tell me about the president?” ระบบมองว่าเป็นความเสี่ยงด้านความปลอดภัยและปฏิเสธการตอบ

ปัญหาไม่ได้อยู่ที่ความรู้พื้นฐานของโมเดล แต่เป็นการตีความเจตนาตามการวางคำ ทีมได้ปรับแต่งเพื่อความปลอดภัยจนบังคำถามที่สมเหตุสมผลโดยไม่ได้ตั้งใจ

ปัญหา #2: โมเดลถูกปรับให้เข้ากับเกณฑ์ที่ไม่สะท้อนโลกจริง

อุปสรรคทั่วไปอีกประการสำหรับ AI ระดับองค์กรคือทีม AI ฝึกโมเดลให้ตรงตามเกณฑ์มาตรฐานอุตสาหกรรมแทนความต้องการในโลกจริง บนกระดาษโมเดลอาจดูยอดเยี่ยมด้วยคะแนนสูงในการประเมินมาตรฐานด้านความแม่นยำ ความเกี่ยวข้อง หรือความปลอดภัย แต่ในทางปฏิบัติอาจลำบากในการให้ผลลัพธ์ที่สม่ำเสมอและมีประโยชน์โดยไม่ต้องมีการแทรกแซงจากผู้ใช้มาก

สิ่งนี้เกิดขึ้นเมื่อทีมปรับโมเดลให้ทำงานได้ดีในงานที่จำกัดตามเกณฑ์เฉพาะ โมเดลจึงเก่งในกรณีทดสอบเหล่านั้นแต่ล้มเหลวเมื่อเจอกับข้อมูลที่หลากหลายและไม่เป็นโครงสร้างในโลกจริง ผลก็คือผู้ใช้ต้อง “พูดภาษาของโมเดล” ผ่านการออกแบบพรอมต์เพื่อให้ได้คำตอบที่ถูกต้อง หากผลิตภัณฑ์ AI ของคุณต้องพึ่งพาผู้ใช้ปลายทางสร้างพรอมต์ที่แม่นยำ คุณก็ได้เพิ่มความต้านทานที่ทำให้การยอมรับช้าลงและลดคุณค่า

การฝึกที่เน้นเกณฑ์เช่นนี้ยังอาจทำให้โมเดลโอเวอร์ฟิต โมเดลถูกปรับให้ทำงานได้ดีบนชุดข้อมูลประเมินจนสูญเสียความทั่วไป มันอาจผ่านการทดสอบภายในทุกอย่างแต่ยังคงไม่ตอบสนองเมื่อนำไปใช้จริง โดยเฉพาะเมื่อกรณีการใช้งานจริงแตกต่างแม้เพียงเล็กน้อยจากที่ฝึกไว้

หากคุณต้องการโซลูชัน AI ระดับองค์กรที่ประสบความสำเร็จ โมเดลของคุณต้องทำงานได้ในโลกจริง—not เพียงในห้องทดลอง

ปัญหา #3: การขยายการนำ AI ไปใช้หมายถึงการขยายต้นทุนการคำนวณ

เหตุผลที่สามที่ทำให้หลาย POC ของ AI ล้มเหลวในการขยายคือด้านการเงิน: ทีมมักประเมินต้นทุนการรันและบำรุงรักษาโมเดลในขั้นการผลิตต่ำเกินไป ในช่วงพัฒนา การมองข้ามความต้องการคอมพิวต์ของโมเดลขนาดใหญ่เป็นเรื่องง่าย โดยเฉพาะเมื่อการทดสอบทำบนชุดข้อมูลขนาดเล็กหรือในสภาพแวดล้อมที่จำกัด แต่เมื่อโมเดลถูกนำไปใช้จริง ต้นทุนเหล่านั้นอาจพุ่งสูงขึ้นอย่างรวดเร็ว

AI ระดับองค์กรต้องการทรัพยากรคอมพิวเตอร์จำนวนมาก ไม่เพียงเพื่อให้บริการตอบสนองแบบเรียลไทม์ แต่ยังรวมถึงการปรับแต่งต่อเนื่อง การตรวจสอบ การบันทึก และการฝึกใหม่ หากไม่ได้คำนึงถึงต้นทุนเหล่านี้ตั้งแต่แรก ธุรกิจอาจพังทลายเมื่อการใช้งานจริงเริ่มเพิ่มขึ้น โมเดลที่ดูมีศักยภาพในสภาพแวดล้อมควบคุมอาจกลายเป็นสิ่งที่ไม่ยั่งยืนเมื่อผู้ใช้หลายพันคนเริ่มเข้าถึงระบบทุกวัน

การเอาชนะอุปสรรคสุดท้ายสู่ AI ระดับองค์กรที่ประสบความสำเร็จ

เพื่อหลีกเลี่ยงข้อผิดพลาดทั่วไปที่ทำให้โครงการ AI ระดับองค์กรหลายโครงการล้มเหลว ทีมต้องก้าวข้ามแนวทางปฏิบัติทั่วไป นี่คือวิธีที่ทีม AI ของคุณสามารถสร้างสิ่งที่ทำงานได้จริงและขยายได้

ขั้นแรก ให้เชิญบุคคลภายนอกมาประเมินโมเดลของคุณ การทดสอบภายในเป็นสิ่งสำคัญ แต่บ่อยครั้งกว้างเกินไป การมองจากมุมมองใหม่พร้อมกับกรอบการประเมินที่ออกแบบเฉพาะตามกรณีการใช้งานของคุณ สามารถเปิดเผยปัญหาที่ทีมของคุณอาจมองข้ามได้ โดยเฉพาะอย่างยิ่งเมื่อพูดถึงวิธีที่ผู้ใช้จริงจะโต้ตอบกับระบบ

ขั้นที่สอง ให้แน่ใจว่าคุณกำลังทดสอบด้วยคำสั่งที่เป็นจริงในโลกจริง เกณฑ์ส่วนใหญ่ทดสอบบนข้อมูล “สะอาด” ที่ไม่สะท้อนความเป็นจริงของโลกจริง และยิ่งไม่สอดคล้องกับวิธีที่ผู้ใช้ปลายทางของคุณจะส่งคำสั่งให้โมเดลของคุณ การทดสอบโมเดลของคุณด้วยข้อมูลที่ยุ่งเหยิง ไม่ชัดเจน หรือ phrasing ที่แปลกประหลาด จะช่วยให้เห็นว่ามันทำงานอย่างไรหลังการเปิดใช้งานจริงและช่วยให้คุณจับปัญหาที่อาจหลุดรอดและส่งผลต่อการยอมรับได้

ขั้นที่สาม ให้ทบทวนโปรโตคอลความปลอดภัยของคุณ การตั้งค่ากรอบความปลอดภัยมากเกินไปเป็นเรื่องง่าย แม้ว่าความปลอดภัยจะสำคัญ แต่ไม่ควรทำให้โมเดลของคุณใช้งานได้ยาก หากโมเดลปิดการทำงานเมื่อเจอคำถามง่าย ๆ ที่ไม่มีอันตราย คุณกำลังแลกเปลี่ยนความสะดวกในการใช้กับความรู้สึกปลอดภัยที่ไม่แท้จริง

สุดท้าย ให้ระวังค่าใช้จ่ายด้านคอมพิวต์ของคุณ หากเป้าหมายการยอมรับของคุณรวมถึงผู้ใช้หลายพันคนและคำขอหลายล้านครั้ง ค่าใช้จ่ายเหล่านั้นอาจพุ่งสูงอย่างรวดเร็ว วิธีแก้หนึ่งคือพิจารณาโมเดลขนาดเล็กกว่า Boosted.ai ทำเช่นนั้น—พวกเขาเปลี่ยนไปใช้โมเดลภาษาเล็กแบบกำหนดเองและลดค่าใช้จ่ายด้านคอมพิวต์ลง 90% พร้อมเพิ่มความเร็วและประสิทธิภาพ ผลลัพธ์แบบเรียลไทม์ ประสบการณ์ผู้ใช้ที่ดียิ่งขึ้น และไม่ต้องใช้ฮาร์ดแวร์ราคาแพง

โดยการจัดการการประเมิน การใช้งานง่าย และความสามารถในการขยายตั้งแต่เริ่มต้น ทีมงานสามารถให้โครงการ AI ของตนมีโอกาสประสบความสำเร็จในระยะยาวได้ ไม่ใช่แค่ทำให้มันทำงานในห้องทดลอง แต่ทำให้มันทำงานได้จริงในโลกภายนอก

แมตต์ ฟิตซ์แพทริก เป็น CEO ของ Invisible Technologies ซึ่งเป็นผู้ให้บริการแพลตฟอร์มซอฟต์แวร์ AI ที่ได้รับการฝึกฝนจาก 80% ของผู้ให้บริการโมเดล AI ชั้นนำของโลก Invisible ให้ความเชี่ยวชาญในการทำให้ AI ทำงานในโลกแห่งความเป็นจริงสำหรับอุตสาหกรรม ฟังก์ชัน หรือกรณีการใช้งานใดๆ ก่อนที่จะเข้าร่วมบริษัท Matt เคยเป็น Senior Partner และผู้นำระดับโลกของ QuantumBlack Labs ที่ McKinsey ซึ่งเขารับผิดชอบต่อการดูแลวิศวกร 1,000 คน และดูแลการพัฒนาซอฟต์แวร์ของบริษัททั่วทั้ง GenAI และทุกภาคส่วน เขาเป็นศิษย์เก่าของ Princeton และ Wharton