โมเดลและแพลตฟอร์ม AI

นอกเหนือจากมาตรฐาน: ทำไมการประเมิน AI ต้องมีการตรวจสอบความเป็นจริง

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

หากคุณได้ติดตาม AI ในช่วงนี้ คุณอาจได้เห็นข่าวที่รายงานถึงความสำเร็จของโมเดล AI ที่ทำลายสถิติในมาตรฐานที่กำหนด มาตั้งแต่การรับรู้ภาพใน ImageNet ไปจนถึงการทำคะแนนสูงกว่ามนุษย์ในด้านการแปลและการวินิจฉัยภาพทางการแพทย์ มาตรฐานเหล่านี้ได้ถูกใช้เป็นมาตรฐานในการวัดประสิทธิภาพของ AI มาเป็นเวลานาน อย่างไรก็ตาม แม้ว่าตัวเลขเหล่านี้จะน่าประทับใจ แต่ก็ไม่ได้สะท้อนถึงความซับซ้อนของการนำไปใช้งานในโลกแห่งความเป็นจริงได้เสมอไป โมเดลที่ทำงานได้ดีในมาตรฐานอาจยังทำได้ไม่ดีนอกเหนือจากสิ่งนั้น ในบทความนี้ เราจะสำรวจว่าทำไมมาตรฐานที่กำหนดจึงไม่เพียงพอในการวัดคุณค่าของ AI และสำรวจวิธีการประเมินใหม่ที่สะท้อนถึงความท้าทายที่ซับซ้อนและจริงจังในการนำ AI ไปใช้ในโลกแห่งความเป็นจริง

รายละเอียดการประเมินในโลกจริงที่ขาดหาย

คะแนนมาตรฐานมีประโยชน์เพราะทำซ้ำได้และช่วยเปรียบเทียบโมเดลหลายรุ่นบนงานเดียวกัน แต่คะแนนสูงไม่ได้รับประกันว่าระบบจะทำงานดีเมื่อข้อมูล ผู้ใช้ และข้อจำกัดต่างจากห้องทดลอง โมเดลอาจเรียนรู้รูปแบบเฉพาะของชุดทดสอบหรือได้รับประโยชน์จากข้อมูลที่คล้ายกับข้อสอบในระหว่างฝึก ทำให้ดูมีความสามารถมากกว่าที่เป็นจริง

ความคาดหวังของมนุษย์ยังซับซ้อนกว่าเมตริกอัตโนมัติ ผู้ใช้สนใจว่าคำตอบเหมาะกับบริบท อธิบายเหตุผลได้ ยอมรับความไม่แน่นอน และไม่สร้างอันตรายหรือไม่ ระบบที่เพิ่มคะแนนความแม่นยำเพียงเล็กน้อยแต่อธิบายไม่ได้ มีอคติต่อบางกลุ่ม หรือพังเมื่อพบสถานการณ์ใหม่ อาจมีคุณค่าน้อยกว่าโมเดลที่คะแนนต่ำกว่าแต่เชื่อถือได้และปรับตัวดีกว่า

การเปลี่ยนแปลงของบริบทและ distribution shift

มาตรฐานเป็นภาพนิ่งของช่วงเวลาหนึ่ง ขณะที่ภาษา เหตุการณ์ ตลาด พฤติกรรมผู้ใช้ และวิธีโจมตีระบบเปลี่ยนอยู่เสมอ โมเดลทางการแพทย์ที่ทดสอบกับประชากรกลุ่มเดียวอาจล้มเหลวในโรงพยาบาลอื่น ระบบการเงินที่ทำงานดีในตลาดปกติอาจไม่เสถียรในช่วงวิกฤต และโมเดลภาษาอาจตอบข้อมูลใหม่ไม่ถูกต้องแม้ทำคะแนนความรู้ทั่วไปได้สูง

การประเมินจึงควรตรวจทั้งข้อมูลในขอบเขตและนอกขอบเขต ใช้การทดสอบซ้ำตามเวลา และติดตามผลหลังนำไปใช้จริง การทดสอบ adversarial และ stress test ช่วยเปิดเผยความเปราะบางที่ค่าเฉลี่ยบนชุดข้อมูลมาตรฐานมองไม่เห็น รวมถึงกรณีที่อินพุตมีสัญญาณรบกวน ผู้ใช้พยายามหลอกระบบ หรือข้อมูลบางส่วนหายไป

ความยุติธรรม เหตุผล และคุณสมบัติที่วัดยาก

คะแนนรวมอาจซ่อนความแตกต่างระหว่างกลุ่มประชากร ระบบรู้จำใบหน้าอาจมีค่าเฉลี่ยสูงแต่ผิดพลาดมากสำหรับเพศหรือเชื้อชาติบางกลุ่ม การประเมินจึงต้องแยกผลตามกลุ่ม ตรวจข้อมูลฝึกและผลกระทบ และรวมผู้มีส่วนได้ส่วนเสียที่ได้รับผลจากระบบ ไม่ควรถือว่าความแม่นยำเพียงค่าเดียวแทนความยุติธรรม ความเป็นส่วนตัว ความปลอดภัย หรือการเข้าถึงได้

งานด้านเหตุผลก็มีปัญหาคล้ายกัน โมเดลอาจเลือกคำตอบถูกจากการจดจำรูปแบบโดยไม่เข้าใจขั้นตอน หรือให้เหตุผลที่ฟังน่าเชื่อแต่ไม่สัมพันธ์กับกระบวนการที่ทำให้ได้คำตอบจริง การประเมินควรใช้ปัญหาใหม่ที่ป้องกันการท่องจำ ตรวจความสม่ำเสมอเมื่อปรับถ้อยคำ ขอหลักฐานหรือขั้นตอน และให้ผู้เชี่ยวชาญตรวจคุณภาพของการอนุมาน

กรอบประเมินแบบหลายมิติ

แนวทางที่เหมาะสมควรรวมการทดสอบในโลกจริง การประเมินโดยมนุษย์ การตรวจความแข็งแกร่งและความปลอดภัย การวิเคราะห์อคติ และตัวชี้วัดเฉพาะโดเมน ผลลัพธ์ควรรายงานเป็นโปรไฟล์หลายด้านแทนคะแนนเดียว เพื่อให้ผู้ตัดสินใจเห็นข้อแลกเปลี่ยนและข้อจำกัดอย่างชัดเจน

การทดสอบต้องออกแบบตามบริบทการใช้งานจริง AI ทางการแพทย์ควรผ่านกรณีศึกษาที่แพทย์ออกแบบและตรวจผลทางคลินิก ระบบสำหรับตลาดการเงินควรทดสอบในภาวะผันผวน ระบบช่วยตัดสินใจของภาครัฐต้องประเมินความยุติธรรม ความโปร่งใส และช่องทางอุทธรณ์ เป้าหมายคือพิสูจน์ว่าระบบให้ประโยชน์อย่างสม่ำเสมอ ไม่ใช่เพียงชนะตารางคะแนน

ความน่าดึงดูดของมาตรฐาน

มาตรฐานได้ถูกใช้เป็นรากฐานในการประเมิน AI มาเป็นเวลานาน มาตรฐานเหล่านี้ให้เซตข้อมูลที่ถูกออกแบบมาเพื่อวัดงานเฉพาะ เช่น การรับรู้วัตถุหรือการแปลภาษา เช่น ImageNet เป็นมาตรฐานที่ใช้กันอย่างแพร่หลายในการทดสอบการจำแนกประเภทวัตถุ ในขณะที่ BLEU และ ROUGE เป็นมาตรฐานที่ใช้ในการวัดคุณภาพของข้อความที่สร้างโดยเครื่องจักรโดยการเปรียบเทียบกับข้อความที่เขียนโดยมนุษย์ มาตรฐานเหล่านี้ช่วยให้นักวิจัยสามารถเปรียบเทียบความก้าวหน้าและสร้างการแข่งขันที่ดีในสนาม

ความคาดหวังของมนุษย์เทียบกับคะแนนมาตรฐาน

หนึ่งในข้อจำกัดที่สำคัญที่สุดของมาตรฐานคือมันไม่ได้สะท้อนถึงสิ่งที่มนุษย์ให้ความสำคัญเสมอไป พิจารณาการแปลภาษา โมเดลอาจทำคะแนนได้ดีในมาตรฐาน BLEU ซึ่งวัดความคล้ายคลึงกันระหว่างการแปลของเครื่องจักรและข้อความอ้างอิงที่เขียนโดยมนุษย์ ในขณะที่มาตรฐานอาจวัดความเป็นไปได้ของการแปลในระดับคำ แต่ก็ไม่ได้คำนึงถึงความคล่องแคล่วหรือความหมายของการแปลที่มนุษย์ให้ความสำคัญ

ความท้าทายของมาตรฐานที่กำหนดในบริบทที่เปลี่ยนแปลง

  • การปรับตัวเข้ากับสภาพแวดล้อมที่เปลี่ยนแปลง

มาตรฐานที่กำหนดมีการประเมินประสิทธิภาพของ AI ในสภาพแวดล้อมที่ควบคุมได้ แต่สถานการณ์ในโลกแห่งความเป็นจริงนั้นไม่คาดเดาได้ เช่น AI ที่สนทนาอาจทำได้ดีในคำถามที่เขียนไว้ล่วงหน้า แต่อาจต้องดิ้นรนในการสนทนาที่มีหลายขั้นตอน ซึ่งรวมถึงคำถามที่ไม่คาดคิดหรือคำพูดที่ไม่เหมาะสม

  • การคำนึงถึงด้านจริยธรรมและสังคม

มาตรฐานที่กำหนดมักจะไม่ได้ประเมินประสิทธิภาพของ AI ในด้านจริยธรรม โมเดลการรับรู้ภาพอาจทำคะแนนได้สูง แต่ก็อาจจำแนกผู้คนจากกลุ่มชาติพันธุ์บางกลุ่มไม่ถูกต้องเนื่องจากข้อมูลการฝึกที่มีอคติ

  • ความไม่สามารถจับภาพด้านที่ซับซ้อน

มาตรฐานที่กำหนดดีในการทดสอบทักษะระดับผิวเผิน เช่น การสร้างข้อความที่ถูกต้องตามไวยากรณ์หรือการสร้างภาพที่สมจริง แต่มักจะไม่สามารถจับภาพคุณสมบัติระดับลึก เช่น การให้เหตุผลหรือความเหมาะสมในบริบท

  • การปรับตัวเข้ากับบริบท

โมเดล AI มักจะดิ้นรนในการปรับตัวเข้ากับสภาพแวดล้อมใหม่ๆ โดยเฉพาะเมื่อเผชิญกับข้อมูลที่อยู่นอกชุดข้อมูลการฝึก มาตรฐานที่กำหนดมักจะถูกออกแบบมาเพื่อทดสอบโมเดลในข้อมูลที่คล้ายกับที่ใช้ในการฝึก

  • การให้เหตุผลและการอนุมาน

มาตรฐานที่กำหนดสามารถวัดการรับรู้รูปแบบหรือการสร้างเนื้อหาได้ แต่มักจะไม่สามารถวัดการให้เหตุผลหรือการอนุมานในระดับสูง AI ต้องทำมากกว่าแค่เลียนแบบรูปแบบ มันควรเข้าใจผลกระทบ การเชื่อมโยงเชิงตรรกะ และอนุมานข้อมูลใหม่

นอกเหนือจากมาตรฐาน: วิธีการประเมิน AI ใหม่

เพื่อข้ามช่องว่างระหว่างประสิทธิภาพในมาตรฐานและความสำเร็จในโลกแห่งความเป็นจริง วิธีการประเมิน AI ใหม่กำลังเกิดขึ้น

  • การให้ข้อมูลจากมนุษย์: แทนที่จะพึ่งพาเมตริกอัตโนมัติเพียงอย่างเดียว ให้พิจารณาใช้การให้ข้อมูลจากผู้เชี่ยวชาญหรือผู้ใช้ปลายทางเพื่อประเมินผลลัพธ์ของ AI
  • การทดสอบในสถานการณ์จริง: ระบบ AI ควรได้รับการทดสอบในสภาพแวดล้อมที่ใกล้เคียงกับสถานการณ์จริงมากที่สุด
  • การตรวจสอบความแข็งแกร่งและการทดสอบภายใต้สภาพที่ไม่ปกติ: เป็นสิ่งสำคัญที่จะต้องทดสอบระบบ AI ภายใต้สภาพที่ไม่ปกติหรือภายใต้การโจมตี
  • การประเมินหลายมิติ: แทนที่จะพึ่งพาเมตริกเดียว ให้ประเมิน AI ในหลายมิติ รวมถึงความแม่นยำ ความยุติธรรม ความแข็งแกร่ง และการคำนึงถึงด้านจริยธรรม
  • การทดสอบเฉพาะโดเมน: การประเมินควรจะถูกปรับให้เหมาะสมกับโดเมนที่เฉพาะเจาะจง เช่น AI ในทางการแพทย์ควรได้รับการทดสอบในกรณีศึกษาที่ออกแบบโดยผู้เชี่ยวชาญทางการแพทย์

สรุป

แม้ว่ามาตรฐานจะมีส่วนช่วยในการพัฒนาการวิจัย AI แต่ก็ไม่เพียงพอในการสะท้อนประสิทธิภาพในโลกแห่งความเป็นจริง เมื่อ AI ถูกนำไปใช้ในสถานการณ์จริง การประเมิน AI ควรจะเน้นไปที่ความเป็นมนุษย์และความครอบคลุม การทดสอบในสถานการณ์จริง การให้ข้อมูลจากมนุษย์ และการให้ความสำคัญกับความยุติธรรมและความแข็งแกร่งเป็นสิ่งสำคัญ วัตถุประสงค์ไม่ใช่การเป็นแชมป์เปียนในตารางคะแนน แต่เพื่อสร้าง AI ที่น่าเชื่อถือ ปรับเปลี่ยนได้ และมีคุณค่าในโลกที่ซับซ้อนและเปลี่ยนแปลงอย่างรวดเร็ว

แหล่งข้อมูลและลิงก์อ้างอิง

ดร. Tehseen Zia เป็น Professor ที่ COMSATS University Islamabad โดยได้รับ PhD ใน AI จาก Vienna University of Technology, Austria มีเชี่ยวชาญด้าน Artificial Intelligence, Machine Learning, Data Science, และ Computer Vision โดยมีส่วนร่วมที่สำคัญด้วยการเผยแพร่ในวารสารวิทยาศาสตร์ที่มีชื่อเสียง ดร. Tehseen ยังได้ดำเนินโครงการอุตสาหกรรมต่างๆ ในฐานะ Principal Investigator และให้บริการเป็นที่ปรึกษาด้าน AI