มุมมองของ Anderson
จีพียูอาจดีกว่า ไม่ใช่แค่เร็วกว่า ในการฝึกเครือข่ายประสาทเทียมลึก

นักวิจัยจากโปแลนด์และญี่ปุ่น ซึ่งทำงานร่วมกับโซนี่ ได้พบหลักฐานที่แสดงว่าระบบการเรียนรู้ของเครื่องจักรที่ฝึกอบรมบนจีพียูมากกว่าซีพียูอาจมีข้อผิดพลาดน้อยกว่าในช่วงการฝึกอบรม และให้ผลลัพธ์ที่ดีกว่า ซึ่งขัดแย้งกับความเข้าใจทั่วไปที่ว่าจีพียูเพียงแต่ทำงานเร็วกว่า ไม่ใช่ดีกว่า
การวิจัยซึ่งมีชื่อเรื่องว่า ผลกระทบของความไม่แน่นอนของจีพียูต่อการฝึกอบรมของเครือข่ายประสาทเทียมลึกที่คาดการณ์ มาจากคณะจิตวิทยาและวิทยาศาสตร์แห่งมหาวิทยาลัยอาดัม มิคีวิช และสองมหาวิทยาลัยในญี่ปุ่น ร่วมกับโซนี่ คอมพิวเตอร์ สाइنس แล็บ
การศึกษานี้ชี้ให้เห็นว่า ‘ความไม่แน่นอน’ ที่เครือข่ายประสาทเทียมลึกแสดงออกมาในหลายๆ การกำหนดค่าของฮาร์ดแวร์และซอฟต์แวร์ มีความเอื้ออำนวยต่อจีพียูที่มีราคาแพงกว่า (และ มีจำนวนจำกัด) และพบว่าเครือข่ายประสาทเทียมลึกที่ฝึกอบรมบนซีพียูเพียงอย่างเดียวให้ผลลัพธ์ที่มีข้อผิดพลาดมากกว่าในช่วงการฝึกอบรมเท่ากัน

ในตัวอย่างเสริมจากเอกสารนี้ เราจะเห็น (แถวสองแถวล่างสุด) คุณภาพของผลลัพธ์ที่คล้ายกันจากจีพียูหลายตัว และ (แถวบนสุด) คุณภาพของผลลัพธ์ที่ต่ำกว่าจากซีพียูหลายตัว. Source: https://arxiv.org/pdf/2109.01451.pdf
ปรากฏการณ์ประหลาด
ผลการวิจัยเบื้องต้นนี้ไม่ส่งผลกระทบต่ออัลกอริทึมการเรียนรู้ของเครื่องจักรที่เป็นที่นิยม และในกรณีของโครงสร้างอัตลักษณ์แบบง่าย ปรากฏการณ์นี้ไม่ปรากฏขึ้น
อย่างไรก็ตาม การวิจัยนี้ชี้ให้เห็นว่าอาจมี ‘ความเร็วในการหลบหนี’ สำหรับการฝึกอบรมเครือข่ายประสาทเทียมลึกที่ซับซ้อน ซึ่งการครอบคลุมการดำเนินการเดียวกันที่ความเร็วต่ำกว่าและเวลาการฝึกอบรมที่ยาวกว่าไม่ได้ให้ผลลัพธ์ที่เท่ากัน
นักวิจัยชี้ให้เห็นว่าความแตกต่างของผลลัพธ์นี้อาจเกิดจากเครือข่ายประสาทเทียมลึกบางประเภท และที่ส่วนไม่แน่นอนของการประมวลผลจีพียู ซึ่งมักถูกมองว่าเป็นอุปสรรคที่จะถูก克服ในอนาคต อาจไม่เพียงแต่ให้ประโยชน์ที่สำคัญ แต่ยังอาจถูกนำมาใช้โดยเจตนาในระบบอนาคต
การระบุประการเฉพาะที่เพิ่มประสิทธิภาพและคุณภาพของผลลัพธ์บนจีพียูในลักษณะนี้มีศักยภาพในการให้ข้อมูลเชิงลึกที่ลึกซึ้งยิ่งขึ้นเกี่ยวกับโครงสร้าง ‘กล่องดำ’ ของปัญญาประดิษฐ์ และแม้กระทั่งการปรับปรุงประสิทธิภาพของซีพียู – แม้ว่าปัจจุบันสาเหตุที่แท้จริงยังคงไม่ชัดเจน
อัตลักษณ์เทียบกับ PredNet
ในการศึกษาการผิดปกติ นักวิจัยใช้อัตลักษณ์แบบง่ายและเครือข่ายประสาทเทียมลึกที่คาดการณ์ของมหาวิทยาลัยฮาร์วาร์ด PredNet ซึ่งเป็นงานวิจัยในปี 2016 ที่ออกแบบมาเพื่อสำรวจและพยายามจำลองพฤติกรรมของสมองส่วนใหญ่
ทั้งสองระบบเป็นเครือข่ายประสาทเทียมลึกที่ออกแบบมาเพื่อสร้างภาพที่เหมาะสมผ่านการเรียนรู้ที่ไม่มีการกำกับ (ด้วยข้อมูลที่ไม่มีฉลาก) แม้ว่าอัตลักษณ์จะจัดการเชิงเส้นกับภาพหนึ่งๆ ต่อแบตช์ ซึ่งจะสร้างผลลัพธ์เป็นภาพถัดไปในสายพานที่เกิดซ้ำ อัตลักษณ์นี้ถูกฝึกอบรมบนฐานข้อมูลการเขียนมือ MNIST

อัตลักษณ์ในการทดสอบของนักวิจัยถูกฝึกอบรมบนฐานข้อมูล MNIST ซึ่งประกอบด้วยภาพฝึกอบรม 60,000 ภาพที่ 28×28 พิกเซล และภาพทดสอบ 10,000 ภาพ
ในทางตรงกันข้าม PredNet ประเมินวิดีโอเข้าและในกรณีนี้ถูกฝึกอบรมบนฐานข้อมูล FPSI ซึ่งแสดงถึงวิดีโอที่สวมใส่ในร่างกายในช่วงหนึ่งวันที่ดิสนีย์เวิลด์ในออร์แลนโด ฟลอริดา (ดิสนีย์เป็นหนึ่งในผู้ร่วมวิจัยในงานวิจัยในปี 2012)

ลำดับภาพจาก FPSI ซึ่งแสดงมุมมองบุคคลที่หนึ่งในช่วงหนึ่งวันที่ดิสนีย์เวิลด์
ทั้งสองโครงสร้างมีความซับซ้อนแตกต่างกัน อัตลักษณ์ถูกออกแบบมาเพื่อสร้างภาพใหม่ ไม่ใช่คาดการณ์ค่าเป้าหมาย ในทางตรงกันข้าม PredNet มี四ชั้น แต่ละชั้นประกอบด้วยนิวรอนการแสดงผลที่ใช้การเรียนรู้แบบโครงข่ายและความจำระยะยาว
ชั้นเหล่านี้สร้างการคาดการณ์บริบทที่ถูกเปรียบเทียบกับเป้าหมายเพื่อสร้างเทอมข้อผิดพลาดที่แพร่กระจายไปทั่วเครือข่าย ทั้งสองแบบจำลองใช้การเรียนรู้ที่ไม่มีการกำกับ

โครงสร้างอัตลักษณ์ที่เรียบง่ายและเชิงเส้น และโครงสร้าง PredNet ที่ซับซ้อนและซ้ำซ้อน
ทั้งสองระบบถูกทดสอบบนหลายๆ การกำหนดค่าของฮาร์ดแวร์และซอฟต์แวร์ รวมถึงซีพียูโดยไม่มีจีพียู (อินเทล i5-4590, i7-6800K, i5-7600K หรือเอเอ็มดี ไรเซน 5 3600) และซีพียูกับจีพียู (อินเทล i5-7600K + เอ็นวิดیا จีทีเอกซ์ 750 ทีไอ, i5-7600K + จีทีเอกซ์ 970, i7-6700K + จีทีเอกซ์ 1080, i7-7700K + จีทีเอกซ์ 1080 ทีไอ, i7-9700 + อาร์ทีเอกซ์ 2080 ทีไอ, i5-7600K + อาร์ทีเอกซ์ 2060 ซูเปอร์, เอเอ็มดี ไรเซน 5 3600 + อาร์ทีเอกซ์ 2070 ซูเปอร์ หรือ i5-9400 + ไททัน อาร์ทีเอกซ์)
เครื่องมือมอนิเตอร์แบบอินเทอร์แอคทีฟ htop ถูกใช้เพื่อให้แน่ใจว่าการฝึกอบรมทั้งหมดเกิดขึ้นบนเธรดเดียว (บนอินเทล i7-6800K) หรือบนเธรดสี่ (บนอินเทล i5-4590 และ i5-7600K) หรือเธรดหก (บนเอเอ็มดี ไรเซน 5 3600)
จุดกึ่งหอย
บนอัตลักษณ์ ความแตกต่างเฉลี่ยทั่วทั้งการกำหนดค่าที่มีและไม่มี cuDNN ไม่มีนัยสำคัญ สำหรับ PredNet ผลลัพธ์เป็นที่น่าประหลาดใจ โดยมีความแตกต่างที่เห็นได้ชัดเจนในผลลัพธ์และคุณภาพระหว่างการฝึกอบรมบนซีพียูและจีพียู

ผลลัพธ์เฉลี่ยของการฝึกอบรม PredNet บนซีพียูสี่ตัวและจีพียูแปดตัว โดยที่เครือข่ายถูกฝึกอบรมบนเฟรมวิดีโอ 5000 เฟรมใน 250 แบทช์ และผลลัพธ์เฉลี่ยของ 1000 เฟรมสุดท้าย (50 แบทช์) ที่แสดง cuDNN ถูกปิด
นักวิจัยสรุปว่า ‘แม้ว่ากลไกจะไม่ชัดเจน แต่ฮาร์ดแวร์จีพียูเหมือนจะมีความสามารถในการพัฒนาการฝึกอบรมของเครือข่ายประสาทเทียมลึก’
ผลลัพธ์เหล่านี้บ่งชี้ว่าจีพียูอาจดีกว่าในการหลีกเลี่ยงจุดกึ่งหอย – พื้นที่ในความต่างระดับที่อธิบายถึงด้านล่างของความชัน

จุดต่ำสุดของความชันในความต่างระดับคือ ‘จุดกึ่งหอย’ ที่ได้ชื่อมาจากเหตุผลที่ชัดเจน Source: https://www.pinterest.com.au/pin/436849232581124086/
จุดกึ่งหอย แม้ว่าจะเป็นอุปสรรค แต่ถูกมองข้ามไปว่าเป็นเรื่องที่สามารถหลีกเลี่ยงได้ง่ายๆ ในความคิดเห็นล่าสุดเกี่ยวกับการเพิ่มประสิทธิภาพของการล่องหนของความต่างระดับแบบสุ่ม (SGD) แต่เอกสารวิจัยใหม่นี้ชี้ให้เห็นว่าไม่เพียงแต่จีพียูอาจมีความสามารถพิเศษในการหลีกเลี่ยงจุดกึ่งหอย แต่ยังชี้ให้เห็นว่าผลกระทบของจุดกึ่งหอยควรได้รับการพิจารณาใหม่อีกครั้ง












