มุมมองของ Anderson
การใช้ AI เพื่อคาดการณ์ภาพยนตร์ฮิต

แม้ภาพยนตร์และโทรทัศน์มักถูกมองว่าเป็นอุตสาหกรรมสร้างสรรค์ที่เปิดกว้าง แต่ในความเป็นจริงวงการนี้หลีกเลี่ยงความเสี่ยงมานาน ต้นทุนการผลิตสูง สถานที่ถ่ายทำต่างประเทศราคาถูกอาจกำลังสูญเสียข้อได้เปรียบสำหรับโครงการจากสหรัฐฯ และโครงสร้างการผลิตที่กระจัดกระจายทำให้บริษัทอิสระรับภาระจากความล้มเหลวครั้งใหญ่ได้ยาก
ตลอดทศวรรษที่ผ่านมา อุตสาหกรรมจึงสนใจมากขึ้นว่าแมชชีนเลิร์นนิงสามารถค้นหาแนวโน้มหรือรูปแบบในการตอบสนองของผู้ชมต่อโครงการภาพยนตร์และโทรทัศน์ที่เสนอไว้ได้หรือไม่
แหล่งข้อมูลหลักยังคงเป็นระบบ Nielsen ซึ่งมีขนาดใหญ่แต่มีรากฐานจากโทรทัศน์และโฆษณา กับวิธีเก็บตัวอย่างอย่างกลุ่มสนทนา ซึ่งแลกขนาดข้อมูลกับการเลือกกลุ่มประชากรอย่างเจาะจง ประเภทหลังยังรวมแบบประเมินจากรอบฉายภาพยนตร์ฟรี แต่เมื่อถึงจุดนั้น งบประมาณการผลิตส่วนใหญ่ถูกใช้ไปแล้ว
ทฤษฎีว่าด้วย “ภาพยนตร์ฮิต”
ระบบแมชชีนเลิร์นนิงยุคแรกใช้วิธีวิเคราะห์ดั้งเดิม เช่น linear regression, K-Nearest Neighbors, Stochastic Gradient Descent, Decision Tree และ Random Forest ตลอดจน Neural Networks โดยมักนำหลายวิธีมารวมกันในรูปแบบที่ใกล้กับการวิเคราะห์สถิติก่อนยุค AI ตัวอย่างหนึ่งคือโครงการปี 2019 ของ University of Central Florida ที่พยายามทำนายรายการโทรทัศน์ที่ประสบความสำเร็จจากการจับคู่นักแสดงและผู้เขียน รวมถึงปัจจัยอื่น

งานที่เกี่ยวข้องและใช้งานจริงมากที่สุด แม้จะถูกวิจารณ์บ่อยครั้ง คือระบบแนะนำเนื้อหา ซึ่งจัดทำดัชนีวิดีโอด้วยคุณลักษณะที่ติดป้ายด้วยคนหรือดึงโดยอัตโนมัติ จากนั้นเลือกวิดีโอผู้สมัครและจัดอันดับตามโปรไฟล์ผู้ใช้ที่อนุมานจากพฤติกรรมการรับชม

อย่างไรก็ตาม วิธีเหล่านี้วิเคราะห์โครงการที่ประสบความสำเร็จแล้ว สำหรับรายการหรือภาพยนตร์ใหม่ยังไม่ชัดเจนว่าควรใช้ข้อมูลจริงชนิดใดเป็นเกณฑ์ โดยเฉพาะเมื่อรสนิยมสาธารณะเปลี่ยนไป ขณะที่แหล่งข้อมูลก็ได้รับการปรับปรุงและขยาย จึงมักไม่มีข้อมูลที่สม่ำเสมอต่อเนื่องหลายทศวรรษ
นี่คือปัญหา cold start ซึ่งระบบแนะนำต้องประเมินรายการที่ยังไม่มีข้อมูลปฏิสัมพันธ์ ในสถานการณ์นี้ collaborative filtering แบบดั้งเดิมใช้ไม่ได้ เพราะต้องอาศัยรูปแบบพฤติกรรมผู้ใช้ เช่น การรับชม การให้คะแนน หรือการแชร์ เพื่อสร้างคำทำนาย ภาพยนตร์และรายการใหม่ส่วนใหญ่ยังไม่มีความคิดเห็นจากผู้ชมเพียงพอที่จะรองรับวิธีดังกล่าว
การคาดการณ์ของ Comcast
งานวิจัยใหม่จาก Comcast Technology AI ร่วมกับ George Washington University เสนอวิธีแก้ปัญหาโดยป้อนเมตาดาต้าที่มีโครงสร้างของภาพยนตร์ที่ยังไม่ออกฉายให้โมเดลภาษา
ข้อมูลนำเข้าประกอบด้วยนักแสดง ประเภท เรื่องย่อ ระดับความเหมาะสมของเนื้อหา อารมณ์ และรางวัล แล้วโมเดลส่งคืนรายชื่อภาพยนตร์ที่น่าจะประสบความสำเร็จในอนาคตตามลำดับ
ผู้วิจัยใช้ผลลัพธ์ของโมเดลแทนความสนใจของผู้ชมในช่วงที่ยังไม่มีข้อมูลการมีส่วนร่วม โดยหวังจะลดอคติช่วงแรกที่เอื้อให้ชื่อเรื่องซึ่งเป็นที่รู้จักอยู่แล้ว
บทความสั้นสามหน้าชื่อ Predicting Movie Hits Before They Happen with LLMs มาจากนักวิจัยหกคนของ Comcast Technology AI และหนึ่งคนจาก GWU ผู้เขียนรายงานว่า LLM ที่ใช้เมตาดาต้าภาพยนตร์ทำผลงานเหนือกว่าเกณฑ์ฐานได้อย่างมีนัยสำคัญ และอาจเป็นระบบช่วยให้คะแนนเนื้อหาใหม่จำนวนมากที่ออกทุกวันและทุกสัปดาห์โดยอัตโนมัติ
การให้ข้อมูลเชิงลึกก่อนทีมบรรณาธิการหรืออัลกอริทึมจะสะสมข้อมูลปฏิสัมพันธ์เพียงพออาจช่วยให้กระบวนการตรวจเนื้อหาเร็วขึ้น ผู้เขียนยังเชื่อว่าประสิทธิภาพ LLM ที่ดีขึ้นอย่างต่อเนื่องและการเติบโตของเอเจนต์แนะนำจะทำให้แนวคิดนี้ประยุกต์ใช้ได้ในหลายสาขา
หากวิธีนี้มีความน่าเชื่อถือ ก็อาจลดการพึ่งพาตัวชี้วัดย้อนหลังและชื่อเรื่องที่ได้รับการประชาสัมพันธ์หนัก โดยสร้างวิธีที่ขยายขนาดได้ในการชี้เนื้อหาที่มีศักยภาพก่อนออกฉาย ทีมบรรณาธิการจึงอาจได้รับการคาดการณ์ความสนใจจากเมตาดาต้าโดยไม่ต้องรอพฤติกรรมผู้ใช้ และกระจายการมองเห็นไปยังผลงานใหม่ได้กว้างขึ้น
วิธีการและข้อมูล
ผู้เขียนกำหนดเวิร์กโฟลว์สี่ขั้น ได้แก่ สร้างชุดข้อมูลเฉพาะจากเมตาดาต้าของภาพยนตร์ที่ยังไม่ออกฉาย กำหนดโมเดลฐานสำหรับเปรียบเทียบ ประเมิน LLM ที่เหมาะสมทั้งด้วยการให้เหตุผลภาษาธรรมชาติและการทำนายจาก embedding และปรับผลลัพธ์ด้วยการออกแบบพรอมป์ในโหมดสร้าง โดยใช้โมเดลภาษา Llama 3.1 และ 3.3 ของ Meta
เนื่องจากไม่มีชุดข้อมูลสาธารณะที่ทดสอบสมมติฐานนี้ได้โดยตรง ชุดข้อมูลเดิมส่วนใหญ่สร้างก่อนยุค LLM และไม่มีเมตาดาต้าละเอียด ทีมวิจัยจึงสร้างชุดทดสอบจากแพลตฟอร์มความบันเทิงของ Comcast ซึ่งให้บริการผู้ใช้หลายสิบล้านคนผ่านทั้งช่องทางโดยตรงและบุคคลที่สาม
ชุดข้อมูลติดตามภาพยนตร์ออกใหม่และตรวจว่าภายหลังได้รับความนิยมหรือไม่ โดยนิยามความนิยมผ่านปฏิสัมพันธ์ของผู้ใช้ งานนี้เน้นภาพยนตร์แทนซีรีส์ เพราะผู้เขียนเห็นว่าภาพยนตร์ได้รับอิทธิพลจากความรู้ภายนอกน้อยกว่า จึงเพิ่มความน่าเชื่อถือของการทดลอง
ป้ายกำกับถูกกำหนดจากเวลาที่ชื่อเรื่องใช้ในการเข้าสู่กลุ่มยอดนิยมในช่วงเวลาและขนาดรายชื่อต่าง ๆ LLM ได้รับเมตาดาต้า เช่น ประเภท เรื่องย่อ ระดับความเหมาะสม ยุค นักแสดง ทีมงาน อารมณ์ รางวัล และประเภทตัวละคร
เกณฑ์เปรียบเทียบมีสองแบบ คือการจัดลำดับแบบสุ่ม และโมเดล Popular Embedding หรือ PE ซึ่งอธิบายในส่วนถัดไป
โครงการใช้โมเดลภาษาขนาดใหญ่เป็นวิธีจัดอันดับหลัก สร้างรายชื่อภาพยนตร์ตามลำดับพร้อมคะแนนความนิยมที่คาดการณ์และเหตุผล พรอมป์ถูกออกแบบให้โมเดลทำหน้าที่เป็น “ผู้ช่วยบรรณาธิการ” ระบุภาพยนตร์ที่กำลังจะออกฉายซึ่งน่าจะได้รับความนิยมโดยอาศัยเมตาดาต้าที่มีโครงสร้างเท่านั้น
จากนั้นโมเดลต้องเรียงรายชื่อที่กำหนดใหม่โดยห้ามเพิ่มชื่อเรื่องอื่น และส่งผลเป็น JSON แต่ละคำตอบประกอบด้วยอันดับ คะแนนความนิยม เหตุผล และการอ้างถึงตัวอย่างก่อนหน้าที่มีอิทธิพลต่อผลลัพธ์ เมตาดาต้าหลายระดับนี้ตั้งใจช่วยให้โมเดลเข้าใจบริบทและคาดแนวโน้มผู้ชมในอนาคตได้ดีขึ้น
การทดสอบ
การทดลองมีสองช่วงหลัก ช่วงแรกทดสอบโมเดลหลายแบบเพื่อกำหนดเกณฑ์ฐาน โดยเลือกเวอร์ชันที่ทำได้ดีกว่าการเรียงแบบสุ่ม
ช่วงที่สองทดสอบ LLM ในโหมดสร้าง โดยเปรียบเทียบกับเกณฑ์ฐานที่แข็งแรงกว่าแทนการจัดลำดับสุ่ม จึงบังคับให้โมเดลต้องเอาชนะระบบที่มีความสามารถทำนายอยู่แล้ว ผู้เขียนเห็นว่าการประเมินนี้ใกล้กับโลกจริงมากกว่า เพราะทีมบรรณาธิการและระบบแนะนำไม่ได้เลือกระหว่างโมเดลกับความบังเอิญ แต่เลือกระหว่างระบบหลายตัวที่มีความสามารถทำนายต่างกัน
ข้อได้เปรียบของการไม่รู้ผลลัพธ์
ข้อจำกัดสำคัญคือช่องว่างระหว่างวันตัดข้อมูลความรู้ของโมเดลกับวันออกฉายจริง โมเดลภาษาได้รับการฝึกด้วยข้อมูลที่สิ้นสุดก่อนภาพยนตร์เผยแพร่หกถึงสิบสองเดือน จึงไม่มีข้อมูลหลังออกฉาย คำทำนายจึงอาศัยเมตาดาต้าอย่างเดียวและไม่ได้เรียนรู้ปฏิกิริยาจริงของผู้ชม
การประเมินเกณฑ์ฐาน
ทีมวิจัยสร้างตัวแทนเชิงความหมายของเมตาดาต้าภาพยนตร์ด้วยโมเดล embedding สามตัว ได้แก่ BERT V4, Linq-Embed-Mistral 7B และ Llama 3.3 70B ซึ่งถูกควอนไทซ์เป็น 8 บิตให้เหมาะกับข้อจำกัดของสภาพแวดล้อมทดลอง Linq-Embed-Mistral ได้รับเลือกเพราะอยู่ในอันดับสูงสุดของตาราง MTEB หรือ Massive Text Embedding Benchmark
แต่ละโมเดลสร้างเวกเตอร์ embedding ของภาพยนตร์ผู้สมัคร แล้วนำไปเปรียบเทียบกับค่า embedding เฉลี่ยของภาพยนตร์ยอดนิยมหนึ่งร้อยอันดับจากสัปดาห์ก่อนวันฉายของแต่ละเรื่อง

ความนิยมถูกอนุมานจาก cosine similarity ระหว่าง embedding คะแนนความคล้ายสูงหมายถึงแนวโน้มได้รับความนิยมสูง จากนั้นวัดความแม่นยำของอันดับแต่ละโมเดลเทียบกับการเรียงสุ่ม
ผลแสดงว่า BERT V4 และ Linq-Embed-Mistral 7B ปรับปรุงการระบุภาพยนตร์ยอดนิยมสามอันดับแรกได้มากที่สุด แม้ทั้งคู่จะทำนายเรื่องที่นิยมที่สุดเพียงเรื่องเดียวได้ต่ำกว่าเล็กน้อย สุดท้ายเลือก BERT เป็นเกณฑ์ฐานสำหรับเทียบกับ LLM เพราะความมีประสิทธิภาพและผลโดยรวมชดเชยข้อจำกัดดังกล่าว
การประเมิน LLM
นักวิจัยประเมินด้วยการจัดอันดับสองแบบ คือ pairwise และ listwise การจัดอันดับแบบ pairwise ตรวจว่าโมเดลเรียงรายการหนึ่งเทียบกับอีกรายการถูกต้องหรือไม่ ส่วน listwise ตรวจความแม่นยำของรายชื่อผู้สมัครทั้งชุด
การใช้ทั้งสองแบบช่วยวัดทั้งความถูกต้องเฉพาะคู่ภาพยนตร์ และความสอดคล้องของรายชื่อทั้งหมดกับลำดับความนิยมจริง มีการใช้โมเดลเต็มที่ไม่ผ่านการควอนไทซ์เพื่อป้องกันการสูญเสียประสิทธิภาพ และให้การเปรียบเทียบระหว่างการทำนายด้วย LLM กับเกณฑ์ embedding สม่ำเสมอและทำซ้ำได้
ตัวชี้วัด
เพื่อวัดประสิทธิภาพในการทำนายความนิยม ทีมวิจัยใช้ทั้งตัวชี้วัดแบบจัดอันดับและแบบจำแนก โดยสนใจเป็นพิเศษว่าระบบระบุภาพยนตร์ยอดนิยมสามอันดับแรกได้หรือไม่
มีตัวชี้วัดสี่รายการ ได้แก่ Accuracy@1 ซึ่งวัดว่ารายการยอดนิยมที่สุดปรากฏในอันดับหนึ่งบ่อยเพียงใด Reciprocal Rank ซึ่งใช้ส่วนกลับของตำแหน่งเพื่อสะท้อนว่ารายการยอดนิยมจริงอยู่สูงแค่ไหนในผลทำนาย Normalized Discounted Cumulative Gain หรือ NDCG@k ซึ่งวัดความสอดคล้องของอันดับทั้งหมดกับความนิยมจริง และ Recall@3 ซึ่งวัดสัดส่วนชื่อเรื่องยอดนิยมจริงที่ปรากฏในสามอันดับแรกของโมเดล
เนื่องจากปฏิสัมพันธ์ของผู้ใช้ส่วนใหญ่เกิดใกล้ส่วนบนของเมนูจัดอันดับ การประเมินจึงเน้นค่า k ต่ำเพื่อให้สะท้อนการใช้งานจริง
งานวิจัยประเมิน Llama 3.1 ขนาด 8B, Llama 3.1 ขนาด 405B และ Llama 3.3 ขนาด 70B ด้วยการวัดว่าตัวชี้วัดดีขึ้นเพียงใดเมื่อเทียบกับ BERT V4 โมเดลแต่ละตัวได้รับพรอมป์หลายระดับ ตั้งแต่ข้อมูลน้อยไปจนถึงละเอียดมาก เพื่อศึกษาผลของรายละเอียดข้อมูลต่อคุณภาพการทำนาย

ผู้เขียนรายงานว่าผลดีที่สุดมาจาก Llama 3.1 405B ที่ใช้พรอมป์ละเอียดที่สุด ตามด้วย Llama 3.3 70B แนวโน้มที่พบคือเมื่อใช้พรอมป์ยาวและซับซ้อนแบบ MD V4 โมเดลภาษาที่ซับซ้อนกว่ามักให้ผลดีขึ้นในหลายตัวชี้วัด แต่ผลลัพธ์ไวต่อชนิดข้อมูลที่เพิ่มเข้าไป
ประสิทธิภาพดีขึ้นเมื่อเพิ่มรางวัลของนักแสดงในพรอมป์ โดยนับรางวัลสำคัญที่นักแสดงห้าคนแรกของแต่ละเรื่องได้รับ เมตาดาต้าที่ละเอียดนี้ให้ผลเหนือกว่าพรอมป์แบบง่ายที่ไม่รวมชื่อเสียงของนักแสดง และเห็นประโยชน์ชัดที่สุดในโมเดลขนาดใหญ่ Llama 3.1 405B กับ Llama 3.3 70B ซึ่งทำนายแม่นยำขึ้นเมื่อได้รับสัญญาณด้านชื่อเสียงและความคุ้นเคยของผู้ชม
ในทางกลับกัน โมเดลเล็กที่สุด Llama 3.1 8B ดีขึ้นเมื่อพรอมป์เพิ่มรายละเอียดเล็กน้อยจากประเภทไปยังเรื่องย่อ แต่ผลกลับลดลงเมื่อเพิ่มช่องข้อมูลมากขึ้น แสดงว่าโมเดลอาจมีความจุไม่พอรวมพรอมป์ซับซ้อนอย่างมีประสิทธิภาพและจึงถ่ายทอดความรู้ไปยังกรณีใหม่ได้แย่ลง
เมื่อพรอมป์มีเพียงประเภทภาพยนตร์ โมเดลทุกตัวทำผลงานต่ำกว่าเกณฑ์ฐาน แสดงว่าเมตาดาต้าจำกัดเกินไปไม่เพียงพอต่อการทำนายที่มีความหมาย
แหล่งข้อมูลและลิงก์อ้างอิง
งานวิจัย โมเดล และเอกสารที่กล่าวถึงในบทความ:
- soon lose
- K-Nearest Neighbors
- Stochastic Gradient Descent
- Decision Tree
- Neural Networks
- statistical analysis
- initiative to forecast successful TV shows
- often criticized
- recommender systems
- cold start problem
- collaborative filtering
- paper
- Llama 3.1
- 3.3
- platform
- JSON
- knowledge cutoff
- BERT V4
- Linq-Embed-Mistral 7B
- leaderboard
- vector embeddings
- cosine similarity
- non-quantized
- Accuracy@1
- Reciprocal Rank
- Normalized Discounted Cumulative Gain
- a moving target
บทสรุป
LLM กลายเป็นสัญลักษณ์ของ generative AI ซึ่งอาจอธิบายได้ว่าทำไมจึงถูกนำไปใช้ในงานที่วิธีอื่นอาจเหมาะกว่า อย่างไรก็ดี เรายังไม่รู้ขีดความสามารถของมันในหลายอุตสาหกรรมอย่างครบถ้วน การทดลองใช้อย่างรอบคอบจึงมีเหตุผล
ในกรณีนี้ เช่นเดียวกับตลาดหุ้นและการพยากรณ์อากาศ ข้อมูลในอดีตใช้เป็นฐานทำนายอนาคตได้เพียงจำกัด สำหรับภาพยนตร์และรายการโทรทัศน์ ช่องทางส่งมอบเนื้อหาเองก็เปลี่ยนตลอดเวลา ต่างจากช่วงปี 1978–2011 ซึ่งเคเบิล ดาวเทียม และสื่อพกพาอย่าง VHS กับ DVD เป็นคลื่นการเปลี่ยนแปลงที่ค่อย ๆ พัฒนาในประวัติศาสตร์
ไม่มีวิธีทำนายใดคำนวณได้ทั้งหมดว่าความสำเร็จหรือความล้มเหลวของผลงานอื่นจะส่งผลต่อความเป็นไปได้ของโครงการที่เสนอมากเพียงใด ทั้งที่สถานการณ์นี้เกิดขึ้นบ่อยในวงการภาพยนตร์และโทรทัศน์ซึ่งนิยมตามกระแส
ถึงกระนั้น หากใช้อย่างรอบคอบ LLM อาจช่วยเสริมระบบแนะนำในช่วง cold start และสนับสนุนวิธีการทำนายหลายรูปแบบได้อย่างมีประโยชน์
เผยแพร่ครั้งแรกวันอังคารที่ 6 พฤษภาคม 2025












