มุมมองของ Anderson

จีพียูอาจดีกว่า ไม่ใช่แค่เร็วกว่า ในการฝึกเครือข่ายประสาทเทียมลึก

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

นักวิจัยจากโปแลนด์และญี่ปุ่น ซึ่งทำงานร่วมกับโซนี่ ได้พบหลักฐานที่แสดงว่าระบบการเรียนรู้ของเครื่องจักรที่ฝึกอบรมบนจีพียูมากกว่าซีพียูอาจมีข้อผิดพลาดน้อยกว่าในช่วงการฝึกอบรม และให้ผลลัพธ์ที่ดีกว่า ซึ่งขัดแย้งกับความเข้าใจทั่วไปที่ว่าจีพียูเพียงแต่ทำงานเร็วกว่า ไม่ใช่ดีกว่า

การวิจัยซึ่งมีชื่อเรื่องว่า ผลกระทบของความไม่แน่นอนของจีพียูต่อการฝึกอบรมของเครือข่ายประสาทเทียมลึกที่คาดการณ์ มาจากคณะจิตวิทยาและวิทยาศาสตร์แห่งมหาวิทยาลัยอาดัม มิคีวิช และสองมหาวิทยาลัยในญี่ปุ่น ร่วมกับโซนี่ คอมพิวเตอร์ สाइنس แล็บ

การศึกษานี้ชี้ให้เห็นว่า ‘ความไม่แน่นอน’ ที่เครือข่ายประสาทเทียมลึกแสดงออกมาในหลายๆ การกำหนดค่าของฮาร์ดแวร์และซอฟต์แวร์ มีความเอื้ออำนวยต่อจีพียูที่มีราคาแพงกว่า (และ มีจำนวนจำกัด) และพบว่าเครือข่ายประสาทเทียมลึกที่ฝึกอบรมบนซีพียูเพียงอย่างเดียวให้ผลลัพธ์ที่มีข้อผิดพลาดมากกว่าในช่วงการฝึกอบรมเท่ากัน

ในตัวอย่างเสริมจากเอกสารนี้ เราจะเห็น (แถวสองแถวล่างสุด) คุณภาพของผลลัพธ์ที่คล้ายกันจากจีพียูหลายตัว และ (แถวบนสุด) คุณภาพของผลลัพธ์ที่ต่ำกว่าจากซีพียูหลายตัว

ในตัวอย่างเสริมจากเอกสารนี้ เราจะเห็น (แถวสองแถวล่างสุด) คุณภาพของผลลัพธ์ที่คล้ายกันจากจีพียูหลายตัว และ (แถวบนสุด) คุณภาพของผลลัพธ์ที่ต่ำกว่าจากซีพียูหลายตัว. Source: https://arxiv.org/pdf/2109.01451.pdf

ปรากฏการณ์ประหลาด

ผลการวิจัยเบื้องต้นนี้ไม่ส่งผลกระทบต่ออัลกอริทึมการเรียนรู้ของเครื่องจักรที่เป็นที่นิยม และในกรณีของโครงสร้างอัตลักษณ์แบบง่าย ปรากฏการณ์นี้ไม่ปรากฏขึ้น

อย่างไรก็ตาม การวิจัยนี้ชี้ให้เห็นว่าอาจมี ‘ความเร็วในการหลบหนี’ สำหรับการฝึกอบรมเครือข่ายประสาทเทียมลึกที่ซับซ้อน ซึ่งการครอบคลุมการดำเนินการเดียวกันที่ความเร็วต่ำกว่าและเวลาการฝึกอบรมที่ยาวกว่าไม่ได้ให้ผลลัพธ์ที่เท่ากัน

นักวิจัยชี้ให้เห็นว่าความแตกต่างของผลลัพธ์นี้อาจเกิดจากเครือข่ายประสาทเทียมลึกบางประเภท และที่ส่วนไม่แน่นอนของการประมวลผลจีพียู ซึ่งมักถูกมองว่าเป็นอุปสรรคที่จะถูก克服ในอนาคต อาจไม่เพียงแต่ให้ประโยชน์ที่สำคัญ แต่ยังอาจถูกนำมาใช้โดยเจตนาในระบบอนาคต

การระบุประการเฉพาะที่เพิ่มประสิทธิภาพและคุณภาพของผลลัพธ์บนจีพียูในลักษณะนี้มีศักยภาพในการให้ข้อมูลเชิงลึกที่ลึกซึ้งยิ่งขึ้นเกี่ยวกับโครงสร้าง ‘กล่องดำ’ ของปัญญาประดิษฐ์ และแม้กระทั่งการปรับปรุงประสิทธิภาพของซีพียู – แม้ว่าปัจจุบันสาเหตุที่แท้จริงยังคงไม่ชัดเจน

อัตลักษณ์เทียบกับ PredNet

ในการศึกษาการผิดปกติ นักวิจัยใช้อัตลักษณ์แบบง่ายและเครือข่ายประสาทเทียมลึกที่คาดการณ์ของมหาวิทยาลัยฮาร์วาร์ด PredNet ซึ่งเป็นงานวิจัยในปี 2016 ที่ออกแบบมาเพื่อสำรวจและพยายามจำลองพฤติกรรมของสมองส่วนใหญ่

ทั้งสองระบบเป็นเครือข่ายประสาทเทียมลึกที่ออกแบบมาเพื่อสร้างภาพที่เหมาะสมผ่านการเรียนรู้ที่ไม่มีการกำกับ (ด้วยข้อมูลที่ไม่มีฉลาก) แม้ว่าอัตลักษณ์จะจัดการเชิงเส้นกับภาพหนึ่งๆ ต่อแบตช์ ซึ่งจะสร้างผลลัพธ์เป็นภาพถัดไปในสายพานที่เกิดซ้ำ อัตลักษณ์นี้ถูกฝึกอบรมบนฐานข้อมูลการเขียนมือ MNIST

อัตลักษณ์ในการทดสอบของนักวิจัยถูกฝึกอบรมบนฐานข้อมูล MNIST ซึ่งประกอบด้วยภาพฝึกอบรม 60,000 ภาพที่ 28x28 พิกเซล และภาพทดสอบ 10,000 ภาพ

อัตลักษณ์ในการทดสอบของนักวิจัยถูกฝึกอบรมบนฐานข้อมูล MNIST ซึ่งประกอบด้วยภาพฝึกอบรม 60,000 ภาพที่ 28×28 พิกเซล และภาพทดสอบ 10,000 ภาพ

ในทางตรงกันข้าม PredNet ประเมินวิดีโอเข้าและในกรณีนี้ถูกฝึกอบรมบนฐานข้อมูล FPSI ซึ่งแสดงถึงวิดีโอที่สวมใส่ในร่างกายในช่วงหนึ่งวันที่ดิสนีย์เวิลด์ในออร์แลนโด ฟลอริดา (ดิสนีย์เป็นหนึ่งในผู้ร่วมวิจัยในงานวิจัยในปี 2012)

ลำดับภาพจาก FPSI ซึ่งแสดงมุมมองบุคคลที่หนึ่งในช่วงหนึ่งวันที่ดิสนีย์เวิลด์

ลำดับภาพจาก FPSI ซึ่งแสดงมุมมองบุคคลที่หนึ่งในช่วงหนึ่งวันที่ดิสนีย์เวิลด์

ทั้งสองโครงสร้างมีความซับซ้อนแตกต่างกัน อัตลักษณ์ถูกออกแบบมาเพื่อสร้างภาพใหม่ ไม่ใช่คาดการณ์ค่าเป้าหมาย ในทางตรงกันข้าม PredNet มี四ชั้น แต่ละชั้นประกอบด้วยนิวรอนการแสดงผลที่ใช้การเรียนรู้แบบโครงข่ายและความจำระยะยาว

ชั้นเหล่านี้สร้างการคาดการณ์บริบทที่ถูกเปรียบเทียบกับเป้าหมายเพื่อสร้างเทอมข้อผิดพลาดที่แพร่กระจายไปทั่วเครือข่าย ทั้งสองแบบจำลองใช้การเรียนรู้ที่ไม่มีการกำกับ

โครงสร้างอัตลักษณ์ที่เรียบง่ายและเชิงเส้น และโครงสร้าง PredNet ที่ซับซ้อนและซ้ำซ้อน

โครงสร้างอัตลักษณ์ที่เรียบง่ายและเชิงเส้น และโครงสร้าง PredNet ที่ซับซ้อนและซ้ำซ้อน

ทั้งสองระบบถูกทดสอบบนหลายๆ การกำหนดค่าของฮาร์ดแวร์และซอฟต์แวร์ รวมถึงซีพียูโดยไม่มีจีพียู (อินเทล i5-4590, i7-6800K, i5-7600K หรือเอเอ็มดี ไรเซน 5 3600) และซีพียูกับจีพียู (อินเทล i5-7600K + เอ็นวิดیا จีทีเอกซ์ 750 ทีไอ, i5-7600K + จีทีเอกซ์ 970, i7-6700K + จีทีเอกซ์ 1080, i7-7700K + จีทีเอกซ์ 1080 ทีไอ, i7-9700 + อาร์ทีเอกซ์ 2080 ทีไอ, i5-7600K + อาร์ทีเอกซ์ 2060 ซูเปอร์, เอเอ็มดี ไรเซน 5 3600 + อาร์ทีเอกซ์ 2070 ซูเปอร์ หรือ i5-9400 + ไททัน อาร์ทีเอกซ์)

เครื่องมือมอนิเตอร์แบบอินเทอร์แอคทีฟ htop ถูกใช้เพื่อให้แน่ใจว่าการฝึกอบรมทั้งหมดเกิดขึ้นบนเธรดเดียว (บนอินเทล i7-6800K) หรือบนเธรดสี่ (บนอินเทล i5-4590 และ i5-7600K) หรือเธรดหก (บนเอเอ็มดี ไรเซน 5 3600)

จุดกึ่งหอย

บนอัตลักษณ์ ความแตกต่างเฉลี่ยทั่วทั้งการกำหนดค่าที่มีและไม่มี cuDNN ไม่มีนัยสำคัญ สำหรับ PredNet ผลลัพธ์เป็นที่น่าประหลาดใจ โดยมีความแตกต่างที่เห็นได้ชัดเจนในผลลัพธ์และคุณภาพระหว่างการฝึกอบรมบนซีพียูและจีพียู

ผลลัพธ์เฉลี่ยของการฝึกอบรม PredNet บนซีพียูสี่ตัวและจีพียูแปดตัว โดยที่เครือข่ายถูกฝึกอบรมบนเฟรมวิดีโอ 5000 เฟรมใน 250 แบทช์ และผลลัพธ์เฉลี่ยของ 1000 เฟรมสุดท้าย (50 แบทช์) ที่แสดง cuDNN ถูกปิด

ผลลัพธ์เฉลี่ยของการฝึกอบรม PredNet บนซีพียูสี่ตัวและจีพียูแปดตัว โดยที่เครือข่ายถูกฝึกอบรมบนเฟรมวิดีโอ 5000 เฟรมใน 250 แบทช์ และผลลัพธ์เฉลี่ยของ 1000 เฟรมสุดท้าย (50 แบทช์) ที่แสดง cuDNN ถูกปิด

นักวิจัยสรุปว่า ‘แม้ว่ากลไกจะไม่ชัดเจน แต่ฮาร์ดแวร์จีพียูเหมือนจะมีความสามารถในการพัฒนาการฝึกอบรมของเครือข่ายประสาทเทียมลึก’

ผลลัพธ์เหล่านี้บ่งชี้ว่าจีพียูอาจดีกว่าในการหลีกเลี่ยงจุดกึ่งหอย – พื้นที่ในความต่างระดับที่อธิบายถึงด้านล่างของความชัน

จุดต่ำสุดของความชันในความต่างระดับคือ 'จุดกึ่งหอย' ที่ได้ชื่อมาจากเหตุผลที่ชัดเจน Source: https://www.pinterest.com.au/pin/436849232581124086/

จุดต่ำสุดของความชันในความต่างระดับคือ ‘จุดกึ่งหอย’ ที่ได้ชื่อมาจากเหตุผลที่ชัดเจน Source: https://www.pinterest.com.au/pin/436849232581124086/

จุดกึ่งหอย แม้ว่าจะเป็นอุปสรรค แต่ถูกมองข้ามไปว่าเป็นเรื่องที่สามารถหลีกเลี่ยงได้ง่ายๆ ในความคิดเห็นล่าสุดเกี่ยวกับการเพิ่มประสิทธิภาพของการล่องหนของความต่างระดับแบบสุ่ม (SGD) แต่เอกสารวิจัยใหม่นี้ชี้ให้เห็นว่าไม่เพียงแต่จีพียูอาจมีความสามารถพิเศษในการหลีกเลี่ยงจุดกึ่งหอย แต่ยังชี้ให้เห็นว่าผลกระทบของจุดกึ่งหอยควรได้รับการพิจารณาใหม่อีกครั้ง

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai