มุมมองของ Anderson

การใช้ AI เพื่อคาดการณ์ภาพยนตร์ฮิต

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
ChatGPT-4o and Adobe Firefly

แม้ภาพยนตร์และโทรทัศน์มักถูกมองว่าเป็นอุตสาหกรรมสร้างสรรค์ที่เปิดกว้าง แต่ในความเป็นจริงวงการนี้หลีกเลี่ยงความเสี่ยงมานาน ต้นทุนการผลิตสูง สถานที่ถ่ายทำต่างประเทศราคาถูกอาจกำลังสูญเสียข้อได้เปรียบสำหรับโครงการจากสหรัฐฯ และโครงสร้างการผลิตที่กระจัดกระจายทำให้บริษัทอิสระรับภาระจากความล้มเหลวครั้งใหญ่ได้ยาก

ตลอดทศวรรษที่ผ่านมา อุตสาหกรรมจึงสนใจมากขึ้นว่าแมชชีนเลิร์นนิงสามารถค้นหาแนวโน้มหรือรูปแบบในการตอบสนองของผู้ชมต่อโครงการภาพยนตร์และโทรทัศน์ที่เสนอไว้ได้หรือไม่

แหล่งข้อมูลหลักยังคงเป็นระบบ Nielsen ซึ่งมีขนาดใหญ่แต่มีรากฐานจากโทรทัศน์และโฆษณา กับวิธีเก็บตัวอย่างอย่างกลุ่มสนทนา ซึ่งแลกขนาดข้อมูลกับการเลือกกลุ่มประชากรอย่างเจาะจง ประเภทหลังยังรวมแบบประเมินจากรอบฉายภาพยนตร์ฟรี แต่เมื่อถึงจุดนั้น งบประมาณการผลิตส่วนใหญ่ถูกใช้ไปแล้ว

ทฤษฎีว่าด้วย “ภาพยนตร์ฮิต”

ระบบแมชชีนเลิร์นนิงยุคแรกใช้วิธีวิเคราะห์ดั้งเดิม เช่น linear regression, K-Nearest Neighbors, Stochastic Gradient Descent, Decision Tree และ Random Forest ตลอดจน Neural Networks โดยมักนำหลายวิธีมารวมกันในรูปแบบที่ใกล้กับการวิเคราะห์สถิติก่อนยุค AI ตัวอย่างหนึ่งคือโครงการปี 2019 ของ University of Central Florida ที่พยายามทำนายรายการโทรทัศน์ที่ประสบความสำเร็จจากการจับคู่นักแสดงและผู้เขียน รวมถึงปัจจัยอื่น

การศึกษาปี 2018 ประเมินประสิทธิภาพของตอนจากการจับคู่ตัวละครและผู้เขียน
การศึกษาปี 2018 ประเมินประสิทธิภาพของตอนจากการจับคู่ตัวละครและผู้เขียน

งานที่เกี่ยวข้องและใช้งานจริงมากที่สุด แม้จะถูกวิจารณ์บ่อยครั้ง คือระบบแนะนำเนื้อหา ซึ่งจัดทำดัชนีวิดีโอด้วยคุณลักษณะที่ติดป้ายด้วยคนหรือดึงโดยอัตโนมัติ จากนั้นเลือกวิดีโอผู้สมัครและจัดอันดับตามโปรไฟล์ผู้ใช้ที่อนุมานจากพฤติกรรมการรับชม

กระบวนการแนะนำวิดีโอทั่วไป ซึ่งเลือกผู้สมัครก่อนจัดอันดับตามโปรไฟล์ผู้ใช้
กระบวนการแนะนำวิดีโอทั่วไป ซึ่งเลือกผู้สมัครก่อนจัดอันดับตามโปรไฟล์ผู้ใช้

อย่างไรก็ตาม วิธีเหล่านี้วิเคราะห์โครงการที่ประสบความสำเร็จแล้ว สำหรับรายการหรือภาพยนตร์ใหม่ยังไม่ชัดเจนว่าควรใช้ข้อมูลจริงชนิดใดเป็นเกณฑ์ โดยเฉพาะเมื่อรสนิยมสาธารณะเปลี่ยนไป ขณะที่แหล่งข้อมูลก็ได้รับการปรับปรุงและขยาย จึงมักไม่มีข้อมูลที่สม่ำเสมอต่อเนื่องหลายทศวรรษ

นี่คือปัญหา cold start ซึ่งระบบแนะนำต้องประเมินรายการที่ยังไม่มีข้อมูลปฏิสัมพันธ์ ในสถานการณ์นี้ collaborative filtering แบบดั้งเดิมใช้ไม่ได้ เพราะต้องอาศัยรูปแบบพฤติกรรมผู้ใช้ เช่น การรับชม การให้คะแนน หรือการแชร์ เพื่อสร้างคำทำนาย ภาพยนตร์และรายการใหม่ส่วนใหญ่ยังไม่มีความคิดเห็นจากผู้ชมเพียงพอที่จะรองรับวิธีดังกล่าว

การคาดการณ์ของ Comcast

งานวิจัยใหม่จาก Comcast Technology AI ร่วมกับ George Washington University เสนอวิธีแก้ปัญหาโดยป้อนเมตาดาต้าที่มีโครงสร้างของภาพยนตร์ที่ยังไม่ออกฉายให้โมเดลภาษา

ข้อมูลนำเข้าประกอบด้วยนักแสดง ประเภท เรื่องย่อ ระดับความเหมาะสมของเนื้อหา อารมณ์ และรางวัล แล้วโมเดลส่งคืนรายชื่อภาพยนตร์ที่น่าจะประสบความสำเร็จในอนาคตตามลำดับ

ผู้วิจัยใช้ผลลัพธ์ของโมเดลแทนความสนใจของผู้ชมในช่วงที่ยังไม่มีข้อมูลการมีส่วนร่วม โดยหวังจะลดอคติช่วงแรกที่เอื้อให้ชื่อเรื่องซึ่งเป็นที่รู้จักอยู่แล้ว

บทความสั้นสามหน้าชื่อ Predicting Movie Hits Before They Happen with LLMs มาจากนักวิจัยหกคนของ Comcast Technology AI และหนึ่งคนจาก GWU ผู้เขียนรายงานว่า LLM ที่ใช้เมตาดาต้าภาพยนตร์ทำผลงานเหนือกว่าเกณฑ์ฐานได้อย่างมีนัยสำคัญ และอาจเป็นระบบช่วยให้คะแนนเนื้อหาใหม่จำนวนมากที่ออกทุกวันและทุกสัปดาห์โดยอัตโนมัติ

การให้ข้อมูลเชิงลึกก่อนทีมบรรณาธิการหรืออัลกอริทึมจะสะสมข้อมูลปฏิสัมพันธ์เพียงพออาจช่วยให้กระบวนการตรวจเนื้อหาเร็วขึ้น ผู้เขียนยังเชื่อว่าประสิทธิภาพ LLM ที่ดีขึ้นอย่างต่อเนื่องและการเติบโตของเอเจนต์แนะนำจะทำให้แนวคิดนี้ประยุกต์ใช้ได้ในหลายสาขา

หากวิธีนี้มีความน่าเชื่อถือ ก็อาจลดการพึ่งพาตัวชี้วัดย้อนหลังและชื่อเรื่องที่ได้รับการประชาสัมพันธ์หนัก โดยสร้างวิธีที่ขยายขนาดได้ในการชี้เนื้อหาที่มีศักยภาพก่อนออกฉาย ทีมบรรณาธิการจึงอาจได้รับการคาดการณ์ความสนใจจากเมตาดาต้าโดยไม่ต้องรอพฤติกรรมผู้ใช้ และกระจายการมองเห็นไปยังผลงานใหม่ได้กว้างขึ้น

วิธีการและข้อมูล

ผู้เขียนกำหนดเวิร์กโฟลว์สี่ขั้น ได้แก่ สร้างชุดข้อมูลเฉพาะจากเมตาดาต้าของภาพยนตร์ที่ยังไม่ออกฉาย กำหนดโมเดลฐานสำหรับเปรียบเทียบ ประเมิน LLM ที่เหมาะสมทั้งด้วยการให้เหตุผลภาษาธรรมชาติและการทำนายจาก embedding และปรับผลลัพธ์ด้วยการออกแบบพรอมป์ในโหมดสร้าง โดยใช้โมเดลภาษา Llama 3.1 และ 3.3 ของ Meta

เนื่องจากไม่มีชุดข้อมูลสาธารณะที่ทดสอบสมมติฐานนี้ได้โดยตรง ชุดข้อมูลเดิมส่วนใหญ่สร้างก่อนยุค LLM และไม่มีเมตาดาต้าละเอียด ทีมวิจัยจึงสร้างชุดทดสอบจากแพลตฟอร์มความบันเทิงของ Comcast ซึ่งให้บริการผู้ใช้หลายสิบล้านคนผ่านทั้งช่องทางโดยตรงและบุคคลที่สาม

ชุดข้อมูลติดตามภาพยนตร์ออกใหม่และตรวจว่าภายหลังได้รับความนิยมหรือไม่ โดยนิยามความนิยมผ่านปฏิสัมพันธ์ของผู้ใช้ งานนี้เน้นภาพยนตร์แทนซีรีส์ เพราะผู้เขียนเห็นว่าภาพยนตร์ได้รับอิทธิพลจากความรู้ภายนอกน้อยกว่า จึงเพิ่มความน่าเชื่อถือของการทดลอง

ป้ายกำกับถูกกำหนดจากเวลาที่ชื่อเรื่องใช้ในการเข้าสู่กลุ่มยอดนิยมในช่วงเวลาและขนาดรายชื่อต่าง ๆ LLM ได้รับเมตาดาต้า เช่น ประเภท เรื่องย่อ ระดับความเหมาะสม ยุค นักแสดง ทีมงาน อารมณ์ รางวัล และประเภทตัวละคร

เกณฑ์เปรียบเทียบมีสองแบบ คือการจัดลำดับแบบสุ่ม และโมเดล Popular Embedding หรือ PE ซึ่งอธิบายในส่วนถัดไป

โครงการใช้โมเดลภาษาขนาดใหญ่เป็นวิธีจัดอันดับหลัก สร้างรายชื่อภาพยนตร์ตามลำดับพร้อมคะแนนความนิยมที่คาดการณ์และเหตุผล พรอมป์ถูกออกแบบให้โมเดลทำหน้าที่เป็น “ผู้ช่วยบรรณาธิการ” ระบุภาพยนตร์ที่กำลังจะออกฉายซึ่งน่าจะได้รับความนิยมโดยอาศัยเมตาดาต้าที่มีโครงสร้างเท่านั้น

จากนั้นโมเดลต้องเรียงรายชื่อที่กำหนดใหม่โดยห้ามเพิ่มชื่อเรื่องอื่น และส่งผลเป็น JSON แต่ละคำตอบประกอบด้วยอันดับ คะแนนความนิยม เหตุผล และการอ้างถึงตัวอย่างก่อนหน้าที่มีอิทธิพลต่อผลลัพธ์ เมตาดาต้าหลายระดับนี้ตั้งใจช่วยให้โมเดลเข้าใจบริบทและคาดแนวโน้มผู้ชมในอนาคตได้ดีขึ้น

การทดสอบ

การทดลองมีสองช่วงหลัก ช่วงแรกทดสอบโมเดลหลายแบบเพื่อกำหนดเกณฑ์ฐาน โดยเลือกเวอร์ชันที่ทำได้ดีกว่าการเรียงแบบสุ่ม

ช่วงที่สองทดสอบ LLM ในโหมดสร้าง โดยเปรียบเทียบกับเกณฑ์ฐานที่แข็งแรงกว่าแทนการจัดลำดับสุ่ม จึงบังคับให้โมเดลต้องเอาชนะระบบที่มีความสามารถทำนายอยู่แล้ว ผู้เขียนเห็นว่าการประเมินนี้ใกล้กับโลกจริงมากกว่า เพราะทีมบรรณาธิการและระบบแนะนำไม่ได้เลือกระหว่างโมเดลกับความบังเอิญ แต่เลือกระหว่างระบบหลายตัวที่มีความสามารถทำนายต่างกัน

ข้อได้เปรียบของการไม่รู้ผลลัพธ์

ข้อจำกัดสำคัญคือช่องว่างระหว่างวันตัดข้อมูลความรู้ของโมเดลกับวันออกฉายจริง โมเดลภาษาได้รับการฝึกด้วยข้อมูลที่สิ้นสุดก่อนภาพยนตร์เผยแพร่หกถึงสิบสองเดือน จึงไม่มีข้อมูลหลังออกฉาย คำทำนายจึงอาศัยเมตาดาต้าอย่างเดียวและไม่ได้เรียนรู้ปฏิกิริยาจริงของผู้ชม

การประเมินเกณฑ์ฐาน

ทีมวิจัยสร้างตัวแทนเชิงความหมายของเมตาดาต้าภาพยนตร์ด้วยโมเดล embedding สามตัว ได้แก่ BERT V4, Linq-Embed-Mistral 7B และ Llama 3.3 70B ซึ่งถูกควอนไทซ์เป็น 8 บิตให้เหมาะกับข้อจำกัดของสภาพแวดล้อมทดลอง Linq-Embed-Mistral ได้รับเลือกเพราะอยู่ในอันดับสูงสุดของตาราง MTEB หรือ Massive Text Embedding Benchmark

แต่ละโมเดลสร้างเวกเตอร์ embedding ของภาพยนตร์ผู้สมัคร แล้วนำไปเปรียบเทียบกับค่า embedding เฉลี่ยของภาพยนตร์ยอดนิยมหนึ่งร้อยอันดับจากสัปดาห์ก่อนวันฉายของแต่ละเรื่อง

การปรับปรุงของโมเดล Popular Embedding เมื่อเทียบกับเกณฑ์สุ่มในเมตาดาต้าสี่รูปแบบ
การปรับปรุงของโมเดล Popular Embedding เมื่อเทียบกับเกณฑ์สุ่มในเมตาดาต้าสี่รูปแบบ

ความนิยมถูกอนุมานจาก cosine similarity ระหว่าง embedding คะแนนความคล้ายสูงหมายถึงแนวโน้มได้รับความนิยมสูง จากนั้นวัดความแม่นยำของอันดับแต่ละโมเดลเทียบกับการเรียงสุ่ม

ผลแสดงว่า BERT V4 และ Linq-Embed-Mistral 7B ปรับปรุงการระบุภาพยนตร์ยอดนิยมสามอันดับแรกได้มากที่สุด แม้ทั้งคู่จะทำนายเรื่องที่นิยมที่สุดเพียงเรื่องเดียวได้ต่ำกว่าเล็กน้อย สุดท้ายเลือก BERT เป็นเกณฑ์ฐานสำหรับเทียบกับ LLM เพราะความมีประสิทธิภาพและผลโดยรวมชดเชยข้อจำกัดดังกล่าว

การประเมิน LLM

นักวิจัยประเมินด้วยการจัดอันดับสองแบบ คือ pairwise และ listwise การจัดอันดับแบบ pairwise ตรวจว่าโมเดลเรียงรายการหนึ่งเทียบกับอีกรายการถูกต้องหรือไม่ ส่วน listwise ตรวจความแม่นยำของรายชื่อผู้สมัครทั้งชุด

การใช้ทั้งสองแบบช่วยวัดทั้งความถูกต้องเฉพาะคู่ภาพยนตร์ และความสอดคล้องของรายชื่อทั้งหมดกับลำดับความนิยมจริง มีการใช้โมเดลเต็มที่ไม่ผ่านการควอนไทซ์เพื่อป้องกันการสูญเสียประสิทธิภาพ และให้การเปรียบเทียบระหว่างการทำนายด้วย LLM กับเกณฑ์ embedding สม่ำเสมอและทำซ้ำได้

ตัวชี้วัด

เพื่อวัดประสิทธิภาพในการทำนายความนิยม ทีมวิจัยใช้ทั้งตัวชี้วัดแบบจัดอันดับและแบบจำแนก โดยสนใจเป็นพิเศษว่าระบบระบุภาพยนตร์ยอดนิยมสามอันดับแรกได้หรือไม่

มีตัวชี้วัดสี่รายการ ได้แก่ Accuracy@1 ซึ่งวัดว่ารายการยอดนิยมที่สุดปรากฏในอันดับหนึ่งบ่อยเพียงใด Reciprocal Rank ซึ่งใช้ส่วนกลับของตำแหน่งเพื่อสะท้อนว่ารายการยอดนิยมจริงอยู่สูงแค่ไหนในผลทำนาย Normalized Discounted Cumulative Gain หรือ NDCG@k ซึ่งวัดความสอดคล้องของอันดับทั้งหมดกับความนิยมจริง และ Recall@3 ซึ่งวัดสัดส่วนชื่อเรื่องยอดนิยมจริงที่ปรากฏในสามอันดับแรกของโมเดล

เนื่องจากปฏิสัมพันธ์ของผู้ใช้ส่วนใหญ่เกิดใกล้ส่วนบนของเมนูจัดอันดับ การประเมินจึงเน้นค่า k ต่ำเพื่อให้สะท้อนการใช้งานจริง

งานวิจัยประเมิน Llama 3.1 ขนาด 8B, Llama 3.1 ขนาด 405B และ Llama 3.3 ขนาด 70B ด้วยการวัดว่าตัวชี้วัดดีขึ้นเพียงใดเมื่อเทียบกับ BERT V4 โมเดลแต่ละตัวได้รับพรอมป์หลายระดับ ตั้งแต่ข้อมูลน้อยไปจนถึงละเอียดมาก เพื่อศึกษาผลของรายละเอียดข้อมูลต่อคุณภาพการทำนาย

การปรับปรุงประสิทธิภาพของโมเดลภาษาขนาดใหญ่เมื่อเทียบกับ BERT V4 ในตัวชี้วัดการจัดอันดับ
การปรับปรุงประสิทธิภาพของโมเดลภาษาขนาดใหญ่เมื่อเทียบกับ BERT V4 ในตัวชี้วัดการจัดอันดับ

ผู้เขียนรายงานว่าผลดีที่สุดมาจาก Llama 3.1 405B ที่ใช้พรอมป์ละเอียดที่สุด ตามด้วย Llama 3.3 70B แนวโน้มที่พบคือเมื่อใช้พรอมป์ยาวและซับซ้อนแบบ MD V4 โมเดลภาษาที่ซับซ้อนกว่ามักให้ผลดีขึ้นในหลายตัวชี้วัด แต่ผลลัพธ์ไวต่อชนิดข้อมูลที่เพิ่มเข้าไป

ประสิทธิภาพดีขึ้นเมื่อเพิ่มรางวัลของนักแสดงในพรอมป์ โดยนับรางวัลสำคัญที่นักแสดงห้าคนแรกของแต่ละเรื่องได้รับ เมตาดาต้าที่ละเอียดนี้ให้ผลเหนือกว่าพรอมป์แบบง่ายที่ไม่รวมชื่อเสียงของนักแสดง และเห็นประโยชน์ชัดที่สุดในโมเดลขนาดใหญ่ Llama 3.1 405B กับ Llama 3.3 70B ซึ่งทำนายแม่นยำขึ้นเมื่อได้รับสัญญาณด้านชื่อเสียงและความคุ้นเคยของผู้ชม

ในทางกลับกัน โมเดลเล็กที่สุด Llama 3.1 8B ดีขึ้นเมื่อพรอมป์เพิ่มรายละเอียดเล็กน้อยจากประเภทไปยังเรื่องย่อ แต่ผลกลับลดลงเมื่อเพิ่มช่องข้อมูลมากขึ้น แสดงว่าโมเดลอาจมีความจุไม่พอรวมพรอมป์ซับซ้อนอย่างมีประสิทธิภาพและจึงถ่ายทอดความรู้ไปยังกรณีใหม่ได้แย่ลง

เมื่อพรอมป์มีเพียงประเภทภาพยนตร์ โมเดลทุกตัวทำผลงานต่ำกว่าเกณฑ์ฐาน แสดงว่าเมตาดาต้าจำกัดเกินไปไม่เพียงพอต่อการทำนายที่มีความหมาย

แหล่งข้อมูลและลิงก์อ้างอิง

งานวิจัย โมเดล และเอกสารที่กล่าวถึงในบทความ:

บทสรุป

LLM กลายเป็นสัญลักษณ์ของ generative AI ซึ่งอาจอธิบายได้ว่าทำไมจึงถูกนำไปใช้ในงานที่วิธีอื่นอาจเหมาะกว่า อย่างไรก็ดี เรายังไม่รู้ขีดความสามารถของมันในหลายอุตสาหกรรมอย่างครบถ้วน การทดลองใช้อย่างรอบคอบจึงมีเหตุผล

ในกรณีนี้ เช่นเดียวกับตลาดหุ้นและการพยากรณ์อากาศ ข้อมูลในอดีตใช้เป็นฐานทำนายอนาคตได้เพียงจำกัด สำหรับภาพยนตร์และรายการโทรทัศน์ ช่องทางส่งมอบเนื้อหาเองก็เปลี่ยนตลอดเวลา ต่างจากช่วงปี 1978–2011 ซึ่งเคเบิล ดาวเทียม และสื่อพกพาอย่าง VHS กับ DVD เป็นคลื่นการเปลี่ยนแปลงที่ค่อย ๆ พัฒนาในประวัติศาสตร์

ไม่มีวิธีทำนายใดคำนวณได้ทั้งหมดว่าความสำเร็จหรือความล้มเหลวของผลงานอื่นจะส่งผลต่อความเป็นไปได้ของโครงการที่เสนอมากเพียงใด ทั้งที่สถานการณ์นี้เกิดขึ้นบ่อยในวงการภาพยนตร์และโทรทัศน์ซึ่งนิยมตามกระแส

ถึงกระนั้น หากใช้อย่างรอบคอบ LLM อาจช่วยเสริมระบบแนะนำในช่วง cold start และสนับสนุนวิธีการทำนายหลายรูปแบบได้อย่างมีประโยชน์

เผยแพร่ครั้งแรกวันอังคารที่ 6 พฤษภาคม 2025

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai