มุมมองของ Anderson

โมเดลภาษา State-Of-The-Art ยังต้องดิ้นรนเพื่อทำความเข้าใจตรรกะเชิงเวลา

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
Variation on ChatGPT-4o prompt: ‘1792px x 1024px photorealistic HQ image of a robot looking at a computer screen. On the screen is a picture of a chicken and an egg. The image should not be cartoon-ish, or illustration-like, but should look like a still from a high-budget Hollywood movie’

การทำนายสถานะในอนาคตเป็นภารกิจที่สำคัญในการวิจัยการมองเห็นคอมพิวเตอร์ – ไม่ว่าจะเป็นในด้านหุ่นยนต์หรือไม่ ที่สถานการณ์ในโลกแห่งความเป็นจริงต้องได้รับการพิจารณา ระบบการเรียนรู้ของเครื่องจึงต้องมีความเข้าใจที่เพียงพอเกี่ยวกับโลกแห่งความเป็นจริง

อย่างไรก็ตาม ในบางกรณี ความรู้ที่ดูเหมือนจะน่าประทับใจเกี่ยวกับเรื่องจริงเชิงเวลาอาจเป็นการหลอกลวงได้: วิจัยใหม่จากสหรัฐอาหรับเอมิเรตส์พบว่าโมเดลภาษาหลายรูปแบบที่มีลักษณะเฉพาะ (MLLMs) รวมถึงผู้นำในอุตสาหกรรม เช่น GPT-4o และ Google Gemini ไม่สามารถตีความการแสดงเวลาในภาพได้

ตัวอย่างคู่ลำดับ (ดูภาพด้านล่าง) ซึ่งจะไม่ใช่เรื่องยากสำหรับมนุษย์แม้ว่าจะถูกจัดเรียงในลำดับที่ไม่ถูกต้องก็ตาม สามารถทำให้ MLLMs ที่มีความสามารถขั้นสูงต้องลำบากเมื่อถูกนำเสนอในบริบทหรือการกำหนดค่าที่ไม่คาดคิด (เช่น ภาพที่สองก่อน, ต่อเนื่องกันเป็นภาพเดียว, ภาพหลายภาพที่อาจหรืออาจไม่แสดงลำดับเวลาอย่างถูกต้อง และอื่นๆ)

ตัวอย่างจากชุดข้อมูลที่รวบรวมสำหรับการศึกษาใหม่นี้ ซึ่งแสดงเหตุการณ์ตามลำดับ

ตัวอย่างจากชุดข้อมูลที่รวบรวมสำหรับการศึกษาใหม่นี้ ซึ่งแสดงเหตุการณ์ตามลำดับในรูปแบบ ‘ก่อนและหลัง’ ภาพนักวิจัยได้เผยแพร่ข้อมูลนี้ที่ https://huggingface.co/datasets/fazliimam/temporal-vqa/viewer

นักวิจัยได้สั่งให้โมเดลเหล่านี้ทำการวิเคราะห์เชิงเวลาเบื้องต้น เช่น การกำหนดลำดับเหตุการณ์หรือการประมาณช่องว่างเวลา และพบว่า MLLMs ทั้ง 7 ตัวที่ถูกทดสอบมีประสิทธิภาพต่ำกว่าความแม่นยำของมนุษย์:

‘โดยรวมแล้ว [ผลลัพธ์] เผยให้เห็นว่า MLLMs ทั้งหมดในปัจจุบัน รวมถึง GPT-4o – โมเดลที่มีความสามารถสูงสุดในการประเมินของเรา – ต้องดิ้นรนในการทำความเข้าใจการวิเคราะห์เชิงเวลา

‘คะแนนความแม่นยำที่ต่อเนื่องกันอย่างต่ำสำหรับโมเดลทั้งหมด บ่งชี้ถึงข้อจำกัดที่สำคัญในการทำความเข้าใจและตีความลำดับเหตุการณ์จากข้อมูลภาพ

ระบบการเรียนรู้ของเครื่องได้รับการออกแบบมาเพื่อปรับให้เหมาะสมที่สุดและให้ผลลัพธ์ที่แม่นยำและน่าพอใจที่สุด* เนื่องจากไม่ได้แสดงเหตุผลอย่างชัดเจน จึงอาจเป็นเรื่องยากที่จะบอกได้ว่าเมื่อใดที่พวกมัน ‘โกง’ หรือใช้ ‘วิธีแก้ปัญหาอย่างรวดเร็ว’

ในกรณีดังกล่าว โมเดล MLLM อาจไปถึง คำตอบที่ถูกต้อง โดย วิธีการที่ไม่ถูกต้อง ความจริงที่ว่าคำตอบดังกล่าวอาจถูกต้องอาจทำให้เกิดความมั่นใจที่ผิดๆ ในโมเดล ซึ่งอาจให้ผลลัพธ์ที่ไม่ถูกต้องโดยใช้วิธีการเดียวกันในภารกิจที่นำเสนอให้กับมันในภายหลัง

สิ่งที่เลวร้ายกว่านั้น คือการหลอกลวงนี้อาจฝังลึกมากขึ้นในห่วงโซ่การพัฒนา หากมนุษย์ประทับใจและให้ข้อเสนอแนะเชิงบวกในการทดสอบและเซสชันการทำเครื่องหมายซึ่งอาจมีส่วนช่วยในการกำหนดทิศทางของข้อมูลและ/หรือโมเดล

ในกรณีนี้ แนะนำว่า MLLMs ‘หลอกลวง’ ให้เชื่อว่าพวกมันเข้าใจเรื่องราวและปรากฏการณ์เชิงเวลา โดยการสังเกตและยึดมั่นในตัวชี้วัดที่สอง (เช่น ตัวชี้วัดเวลาในข้อมูลวิดีโอ การจัดเรียงภาพในเลย์เอาต์ หรือแม้แต่ – ที่อาจเป็นไปได้ – ชื่อไฟล์ที่มีหมายเลขลำดับ)

นอกจากนี้ยังบ่งชี้ว่า MLLMs ในปัจจุบันไม่สามารถตอบสนองคำจำกัดความที่แท้จริงของการ ‘สร้าง’ ความเข้าใจเกี่ยวกับปรากฏการณ์เชิงเวลา – อย่างน้อยก็ในระดับที่มนุษย์สามารถทำได้

เอกสารวิจัยใหม่ ใหม่ มีชื่อว่า MLLMs สามารถทำความเข้าใจและให้เหตุผลเกี่ยวกับเวลาได้หรือไม่? คำตอบคือไม่! และมาจากนักวิจัย 3 คนจากมหาวิทยาลัยอินเทลลิเจนต์แห่งสหรัฐอาหรับเอมิเรตส์และ Alibaba International Digital Commerce

ข้อมูลและทดสอบ

ผู้วิจัยสังเกตว่ามาตรฐานและการศึกษาก่อนหน้านี้ เช่น MMMU และ TemporalBench มุ่งเน้นไปที่การนำเข้าภาพเดียวหรือกำหนดคำถามให้กับ MLLMs ที่อาจง่ายเกินไป และอาจไม่ทำให้เห็นแนวโน้มที่จะใช้วิธีการแก้ปัญหาอย่างรวดเร็ว

ดังนั้น ผู้วิจัยจึงนำเสนอแนวทางที่อัปเดต 2 วิธี: การทำความเข้าใจลำดับเวลา (TOU) และ การประมาณช่องว่างเวลา (TLE) วิธีการ TOU ทดสอบความสามารถของโมเดลในการกำหนดลำดับเหตุการณ์จากเฟรมวิดีโอ 2 ภาพ; วิธีการ TLE ประเมินความสามารถของ MLLM ในการประมาณช่องว่างเวลาระหว่างภาพ 2 ภาพ โดยมีช่วงเวลาจากวินาทีถึงปี

จากเอกสารวิจัย 2 ภารกิจหลักของ TemporalVQA benchmark: ใน Temporal Order Understanding โมเดลตัดสินว่าภาพใดแสดงเหตุการณ์ที่เกิดขึ้นก่อน; ใน Time-lapse Estimation โมเดลประมาณช่องว่างเวลาระหว่างภาพ 2 ภาพ โดยเลือกจากตัวเลือกที่รวมถึงวินาที, นาที, ชั่วโมง, วัน, หรือปี ภารกิจเหล่านี้มีจุดมุ่งหมายเพื่อทดสอบความสามารถของ MLLMs ในการให้เหตุผลเกี่ยวกับเหตุการณ์เชิงภาพและลำดับ

จากเอกสารวิจัย 2 ภารกิจหลักของ TemporalVQA benchmark: ใน Temporal Order Understanding โมเดลตัดสินว่าภาพใดแสดงเหตุการณ์ที่เกิดขึ้นก่อน; ใน Time-lapse Estimation โมเดลประมาณช่องว่างเวลาระหว่างภาพ 2 ภาพ โดยเลือกจากตัวเลือกที่รวมถึงวินาที, นาที, ชั่วโมง, วัน, หรือปี ภารกิจเหล่านี้มีจุดมุ่งหมายเพื่อทดสอบความสามารถของ MLLMs ในการให้เหตุผลเกี่ยวกับเหตุการณ์เชิงภาพและลำดับ Source: https://arxiv.org/pdf/2501.10674

นักวิจัยได้รวบรวมคู่ภาพ 360 ภาพสำหรับมาตรฐาน TOU โดยใช้วิดีโอจาก Pixabay และ Pexels เพื่อให้สามารถเผยแพร่ชุดข้อมูล ผ่าน GUI

วิดีโอนำเสนอหัวข้อต่างๆ ตั้งแต่คนในกิจกรรมประจำวันจนถึงเนื้อหาที่ไม่ใช่มนุษย์ เช่น สัตว์และพืช จากนั้นเลือกเฟรมคู่เพื่อแสดงลำดับเหตุการณ์โดยมีความแตกต่างที่เพียงพอเพื่อให้เฟรมเริ่มต้น ‘ชัดเจน’

ตรรกะเชิงเวลาของภาพสองภาพนี้ไม่สามารถหลบหนีได้ เนื่องจากชาไม่สามารถดูดกลับขึ้นไปในจุกได้

ตรรกะเชิงเวลาของภาพสองภาพนี้ไม่สามารถหลบหนีได้ เนื่องจากชาไม่สามารถดูดกลับขึ้นไปในจุกได้

ด้วยวิธีนี้ จึงได้คู่ภาพ 360 ภาพ

สำหรับวิธีการ TLE เลือกภาพที่ไม่มีลิขสิทธิ์จาก Google และ Flickr รวมถึงเฟรมที่เลือกจากวิดีโอที่ไม่มีลิขสิทธิ์ใน YouTube เนื้อหาของวิดีโอนี้มีฉากหรือวัตถุที่มีการเปลี่ยนแปลงในช่วงเวลาจากวินาทีถึงวันหรือฤดูกาล – เช่น ผลไม้ที่สุกหรือการเปลี่ยนแปลงของฤดูกาลในภูมิประเทศ

ดังนั้น จึงรวบรวมคู่ภาพ 125 ภาพสำหรับวิธีการ TLE

ไม่ใช่ทุก MLLM ที่ถูกทดสอบสามารถประมวลผลภาพหลายภาพได้ ดังนั้นทดสอบจึงแตกต่างกันเพื่อให้เหมาะสมกับความสามารถของแต่ละโมเดล

สร้างหลายเวอร์ชันของชุดข้อมูลที่รวบรวม โดยบางคู่ถูกต่อเข้าด้วยกันในแนวตั้ง และบางคู่ถูกต่อเข้าด้วยกันในแนวนอน การเปลี่ยนแปลงอื่นๆ สลับลำดับเวลาแท้จริงของภาพคู่

พัฒนาสองรูปแบบคำถามขึ้น รูปแบบแรกตามรูปแบบนี้:

เหตุการณ์ในภาพ (ซ้าย / บน / แรก) เกิดขึ้นก่อนหรือไม่กว่าเหตุการณ์ในภาพ (ขวา / ล่าง / ที่สอง)? ระบุว่าเป็นจริงหรือเท็จพร้อมเหตุผล

รูปแบบที่สองตามสเคมานี้:

ระหว่างภาพทั้งสองภาพนี้ ภาพใดแสดงเหตุการณ์ที่เกิดขึ้นก่อน? ระบุ (ซ้ายหรือขวา / บนหรือล่าง / แรกหรือที่สอง) พร้อมเหตุผล

สำหรับ TLE คำถามเป็นแบบหลายตัวเลือก โดยขอให้โมเดลประมาณช่องว่างเวลาระหว่างภาพที่นำเสนอ 2 ภาพ โดยมี วินาที, ชั่วโมง, นาที, วัน, เดือน และ ปี เป็นตัวเลือกเวลา ในการกำหนดค่านี้ ภาพล่าสุดจะถูกนำเสนอทางด้านขวา

คำถามที่ใช้ ณ ที่นี้คือ:

ในภาพที่กำหนด ประมาณช่องว่างเวลาระหว่างภาพแรก (ซ้าย) และภาพที่สอง (ขวา)

เลือกหนึ่งในตัวเลือกต่อไปนี้:

    1. น้อยกว่า 15 วินาที
      B. ระหว่าง 2 นาทีถึง 15 นาที
      C. ระหว่าง 1 ชั่วโมงถึง 12 ชั่วโมง
      D. ระหว่าง 2 วันถึง 30 วัน
      E. ระหว่าง 4 เดือนถึง 12 เดือน
      F. มากกว่า 3 ปี

MLLMs ที่ถูกทดสอบคือ ChatGPT-4o; Gemini1.5-Pro; LlaVa-NeXT; InternVL; Qwen-VL; Llama-3-vision; และ LLaVA-CoT

การทำความเข้าใจลำดับเวลา: ผลลัพธ์

ผลลัพธ์ของการทำความเข้าใจลำดับเวลาในโมเดลและเลย์เอาต์ต่างๆ โดยแสดงความแม่นยำและความสอดคล้องสำหรับการตั้งค่าและคำถามต่างๆ

ผลลัพธ์ของการทำความเข้าใจลำดับเวลาในโมเดลและเลย์เอาต์ต่างๆ โดยแสดงความแม่นยำและความสอดคล้องสำหรับการตั้งค่าและคำถามต่างๆ

เกี่ยวกับผลลัพธ์ที่แสดงด้านบน ผู้วิจัยพบว่า MLLMs ทั้งหมดที่ถูกทดสอบ รวมถึง GPT-4o (ซึ่งแสดงผลการทำงานที่ดีที่สุด) ต้องดิ้นรนอย่างมากในการทดสอบ TemporalVQA – และแม้แต่ GPT-4o ก็ไม่สามารถแสดงให้เห็นถึงการให้เหตุผลเชิงเวลาอย่างต่อเนื่องในหลายๆ การกำหนดค่า

ผู้วิจัยยืนยันว่าความแม่นยำที่ต่ำและสม่ำเสมอกันใน MLLMs สะท้อนถึงข้อจำกัดที่สำคัญในความสามารถของโมเดลในการตีความและให้เหตุผลเกี่ยวกับลำดับเหตุการณ์จากข้อมูลภาพ

การทดสอบแสดงให้เห็นถึงความแตกต่างที่สำคัญในประสิทธิภาพระหว่างกลยุทธ์การส่งคำถามต่างๆ ในขณะที่ GPT-4o มีการปรับปรุงด้วยคำถามที่ได้รับการปรับให้เหมาะสม (ถึง 4% ในการนำเข้าภาพเดียวและ 65.3% ในการนำเข้าหลายภาพ) ประสิทธิภาพยังคงต่ำกว่าระดับที่ยอมรับได้

โมเดล เช่น LLaVA-NeXT และ Qwen-VL มีความไวต่อคำถามที่มากขึ้น โดยประสิทธิภาพลดลงเมื่อใช้คำถามที่แตกต่างกัน ซึ่งบ่งชี้ว่าการปรับคำถามเพียงอย่างเดียวไม่สามารถเอาชนะข้อจำกัดพื้นฐานของ MLLMs ในเรื่องการให้เหตุผลเชิงเวลาได้

การทดสอบยังแสดงให้เห็นว่าการจัดเรียงภาพ (เช่น แนวนอนกับแนวตั้ง) มีผลกระทบอย่างมากต่อประสิทธิภาพของโมเดล GPT-4o มีการปรับปรุงความสอดคล้องเมื่อใช้การจัดเรียงแนวตั้ง โดยเพิ่มขึ้นจาก 39.2% เป็น 52.8% อย่างไรก็ตาม โมเดลอื่นๆ รวมถึง LLaVA มีความลำเอียงที่เข้มข้นในเรื่องของทิศทาง โดยมีประสิทธิภาพสูงในแนวหนึ่ง แต่ล้มเหลวในอีกแนวหนึ่ง

การวิจัยนี้ชี้ให้เห็นว่าความไม่สอดคล้องนี้บ่งชี้ถึงการอาศัยสัญญาณเชิงพื้นที่มากกว่าการให้เหตุผลเชิงเวลาอย่างแท้จริง โดย MLLMs ไม่ได้วิเคราะห์ลำดับเหตุการณ์หรือเข้าใจการเปลี่ยนแปลงตามเวลา แต่ดูเหมือนจะพึ่งพารูปแบบหรือคุณลักษณะเชิงภาพที่เกี่ยวข้องกับการจัดเรียงภาพ เช่น ตำแหน่งหรือการจัดแนว เพื่อตัดสินใจ

การทดสอบเชิงคุณภาพเน้นย้ำการคาดการณ์ของ GPT-4o เมื่อเผชิญกับการจัดเรียงภาพที่แตกต่างกัน ในลำดับแรก ภาพคู่ถูกนำเสนอในลำดับเดิม ในขณะที่ลำดับที่สอง ลำดับถูกกลับด้าน การจำแนกประเภทที่ถูกต้องจะถูกทำเครื่องหมายเป็นสีเขียว การจำแนกประเภทที่ไม่ถูกต้องจะถูกทำเครื่องหมายเป็นสีแดง การให้เหตุผลที่หลอกลวงจะถูกทำเครื่องหมายเป็นสีส้ม และการให้เหตุผลที่ไม่สมเหตุสมผลหรือ 'ไม่ถูกต้อง' จะถูกทำเครื่องหมายเป็นสีน้ำตาล โดยเปิดเผยความไม่สอดคล้องกันของโมเดลในหลายๆ การกำหนดค่า

การทดสอบเชิงคุณภาพเน้นย้ำการคาดการณ์ของ GPT-4o เมื่อเผชิญกับการจัดเรียงภาพที่แตกต่างกัน ในลำดับแรก ภาพคู่ถูกนำเสนอในลำดับเดิม ในขณะที่ลำดับที่สอง ลำดับถูกกลับด้าน การจำแนกประเภทที่ถูกต้องจะถูกทำเครื่องหมายเป็นสีเขียว การจำแนกประเภทที่ไม่ถูกต้องจะถูกทำเครื่องหมายเป็นสีแดง การให้เหตุผลที่หลอกลวงจะถูกทำเครื่องหมายเป็นสีส้ม และการให้เหตุผลที่ไม่สมเหตุสมผลหรือ ‘ไม่ถูกต้อง’ จะถูกทำเครื่องหมายเป็นสีน้ำตาล โดยเปิดเผยความไม่สอดคล้องกันของโมเดลในหลายๆ การกำหนดค่า

การทดสอบระหว่างการนำเข้าภาพเดียวและหลายภาพแสดงให้เห็นการปรับปรุงที่จำกัดโดยรวม โดย GPT-4o มีการปรับปรุงเล็กน้อยเมื่อใช้การนำเข้าหลายภาพ โดยเพิ่มขึ้นจาก 31.0% เป็น 43.6% (ด้วย P1) และ 46.0% เป็น 65.3% (ด้วย P2)

โมเดลอื่นๆ เช่น InternVL แสดงประสิทธิภาพที่เสถียรแต่ต่ำ ในขณะที่ Qwen-VL มีการปรับปรุงที่น้อย

ผู้วิจัยสรุปว่าผลลัพธ์เหล่านี้บ่งชี้ว่าบริบทเชิงภาพเพิ่มเติมไม่ช่วยปรับปรุงความสามารถในการให้เหตุผลเชิงเวลาอย่างมีนัยสำคัญ เนื่องจากโมเดลต้องดิ้นรนในการรวมข้อมูลเชิงเวลาอย่างมีประสิทธิภาพ

การศึกษามนุษย์

ในศึกษามนุษย์สำหรับการทำความเข้าใจลำดับเวลา ผู้เข้าร่วมทดสอบได้รับผลลัพธ์ 90.3% ซึ่งเหนือกว่าผลลัพธ์ของ GPT-4o ที่ 65.3% ถึง 25%

ผลลัพธ์จากการศึกษามนุษย์สำหรับการทดสอบครั้งแรก

ผลลัพธ์จากการศึกษามนุษย์สำหรับการทดสอบครั้งแรก

การประมาณช่องว่างเวลา: ผลลัพธ์

ผลลัพธ์สำหรับการประมาณช่องว่างเวลา: การประมาณช่องว่างเวลาประเมินความแม่นยำของโมเดลในการระบุช่วงเวลาระหว่างภาพคู่ โดยมีช่วงเวลาจากวินาทีถึงปี

ผลลัพธ์สำหรับการประมาณช่องว่างเวลา: การประมาณช่องว่างเวลาประเมินความแม่นยำของโมเดลในการระบุช่วงเวลาระหว่างภาพคู่ โดยมีช่วงเวลาจากวินาทีถึงปี

ในการทดสอบเหล่านี้ MLLMs มีประสิทธิภาพเพียงพอในการประมาณช่องว่างเวลา: GPT-4o มีผลลัพธ์ 70% แต่โมเดลอื่นๆ มีประสิทธิภาพที่ต่ำกว่าอย่างมาก (ดูตารางด้านบน) และประสิทธิภาพยังแตกต่างกันอย่างมากในหลายๆ ช่วงเวลา

ผู้วิจัยให้ความเห็นว่า:

‘การประมาณช่องว่างเวลาเป็นการประเมินความสามารถของ MLLMs ในการอนุมานช่วงเวลาระหว่างภาพคู่ [ทั้ง] MLLMs รวมถึงผู้นำอย่าง GPT-4o และ Gemini1.5-Pro ต้องดิ้นรนในการทำความเข้าใจภารกิจนี้ โดยมีระดับความแม่นยำที่เหมาะสมที่ 60-70% GPT-4o แสดงผลลัพธ์ที่ไม่สอดคล้องกัน โดยมีผลลัพธ์ที่แข็งแกร่งในวินาทีและปี แต่ไม่ดีในชั่วโมง

ในทำนองเดียวกัน LLaVA-CoT แสดงผลลัพธ์ที่ดีเยี่ยมในช่วงเวลา วินาทีและวัน แต่ไม่ดีในช่วงเวลาอื่นๆ

การศึกษามนุษย์

ในศึกษามนุษย์สำหรับการประมาณช่องว่างเวลา ผลลัพธ์ของมนุษย์เฉลี่ยดีกว่า GPT-4o (โมเดลที่มีประสิทธิภาพสูงสุดในหมวดหมู่นี้) ถึง 12.3%

ผู้วิจัยสังเกตว่าความท้าทายบางอย่างมีความต้องการสูง และในกรณีหนึ่ง ผู้เข้าร่วมทดสอบทุกคนตอบผิด รวมถึงผู้เข้าร่วม AI ทั้งหมดด้วย

ผู้วิจัยสรุปว่า GPT-4o แสดงให้เห็นถึงความสามารถในการให้เหตุผลที่ ‘แข็งแกร่งในระดับหนึ่ง’ แม้จะเผชิญกับการจัดเรียงภาพที่แตกต่างกัน

สรุป

หาก MLLMs ในที่สุดสามารถรวบรวมและดูดซับข้อมูล ‘วิธีการแก้ปัญหาอย่างรวดเร็ว’ เพียงพอเพื่อครอบคลุมความท้าทายที่ยากที่สุดในประเภทที่นำเสนอโดยผู้วิจัยใน nghiên cứuนี้ ไม่ว่าพวกเขาจะพัฒนาความสามารถในการสรุปผลเชิงมนุษย์หรือไม่ อาจกลายเป็นเรื่องที่ไม่เกี่ยวข้อง

ไม่ชัดเจนว่าเราจะได้รับความสามารถในการให้เหตุผลเชิงเวลาจากไหน – เรา ‘โกง’ จนกว่าจะเรียนรู้จากประสบการณ์หรือไม่?

ไม่ทราบว่าเราจะได้รับความสามารถในการให้เหตุผลเชิงเวลาจากไหน – เรา ‘โกง’ จนกว่าจะเรียนรู้จากประสบการณ์หรือไม่?

* จากมุมมองที่ว่าโมเดลถูกปรับให้เหมาะสมด้วยฟังก์ชันขาดทุนที่ได้รับการสนับสนุนจากข้อเสนอแนะของมนุษย์ และได้รับการปรับให้เหมาะสมอย่างมีประสิทธิภาพโดยการทดสอบของมนุษย์และการคัดเลือกที่ตามมา

เผยแพร่ครั้งแรกวันจันทร์ที่ 27 มกราคม 2025

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai