โมเดลและแพลตฟอร์ม AI
ระบบ AI อาจชอบภาษามนุษย์มากกว่าข้อมูลตัวเลข

การวิจัยใหม่จาก Columbia Engineering เสนอว่าระบบปัญญาประดิษฐ์ (AI) อาจชอบภาษามนุษย์มากกว่าข้อมูลตัวเลข เช่น 1 และ 0 การศึกษานี้เป็นผลงานของ Hod Lipson ศาสตราจารย์จากภาควิชาวิศวกรรมเครื่องจักร และ Boyuan Chen นักศึกษาระดับ博士 และแสดงให้เห็นว่าระบบ AI สามารถทำงานได้ดีขึ้นหากได้รับการฝึกอบรมด้วยไฟล์เสียงภาษามนุษย์
ในการเปรียบเทียบแบบตัวต่อตัว ผู้วิจัยพบว่าเครือข่ายประสาทเทียมที่ได้รับการฝึกอบรมด้วยไฟล์เสียงสามารถทำงานได้ดีขึ้นในการระบุวัตถุ เมื่อเทียบกับเครือข่ายที่ได้รับการฝึกอบรมด้วยข้อมูลทวินามแบบง่าย
Lipson เป็น James และ Sally Scapa Professor of Innovation และเป็นสมาชิกของ Data Science Institute ของ Columbia
“เพื่อเข้าใจว่าเหตุผลนี้มีความสำคัญอย่างไร มันจะช่วยให้เราทราบว่าเครือข่ายประสาทเทียม通常ได้รับการฝึกอบรมอย่างไร และทำไมการใช้เสียงภาษามนุษย์จึงเป็นการทดลองที่แปลกใหม่” เขากล่าว
การใช้ตัวเลขทวินามเป็นวิธีการที่กะทัดรัดและแม่นยำ ในขณะที่ภาษามนุษย์มีความซับซ้อนและไม่ใช่ตัวเลขเมื่อบันทึกเป็นไฟล์ดิจิทัล ผู้เขียนโปรแกรมไม่ thườngเปลี่ยนแปลงจากตัวเลขเมื่อสร้างเครือข่ายประสาทเทียม เนื่องจากเป็นวิธีการที่มีประสิทธิภาพสูง
ทีมนี้เริ่มการวิจัยนี้หลังจากคิดว่าเครือข่ายประสาทเทียมไม่ได้ทำงานเต็มที่ และพวกเขาคิดว่าเครือข่ายเหล่านี้สามารถทำงานได้ดีขึ้นหากได้รับการฝึกอบรมด้วยเสียงภาษามนุษย์และคำศัพท์เฉพาะ
การฝึกอบรมเครือข่าย
เมื่อทดสอบเทคนิคการเรียนรู้ของเครื่องใหม่ ผู้วิจัย AI มักจะฝึกเครือข่ายประสาทเทียมเพื่อระบุวัตถุและ动物ในภาพถ่าย
ทีมนี้ ซึ่งรวมถึง Chen, Lipson, Yu Li และ Susan Raghupathi ได้ตั้งคการทดลองที่ควบคุมได้เพื่อทดสอบสมมติฐานของพวกเขา และพวกเขาสร้างเครือข่ายประสาทเทียมสองเครือข่ายใหม่ พวกเขาตั้งเป้าที่จะฝึกเครือข่ายเหล่านี้เพื่อระบุ 10 ประเภทของวัตถุใน 50,000 ภาพถ่ายที่เรียกว่า “ภาพฝึกอบรม”
เครือข่าย AI หนึ่งเครือข่ายได้รับการฝึกอบรมในแบบดั้งเดิมด้วยค่าจำนวนทวินาม ในขณะที่เครือข่ายประสาทเทียมทดลองได้รับการฝึกอบรมในแบบที่แตกต่าง มันถูกให้ข้อมูลในตารางที่มีแถวที่มีภาพถ่ายของสัตว์หรือวัตถุ และคอลัมน์ที่สองมีไฟล์เสียงภาษามนุษย์ที่พูดคำศัพท์ของสัตว์หรือวัตถุ ไม่มีตัวเลข 1 และ 0 ที่เกี่ยวข้องกับเครือข่ายทดลอง
ทั้งสองเครือข่ายได้รับการฝึกอบรมเป็นเวลา 15 ชั่วโมง ผลลัพธ์แสดงให้เห็นว่าเครือข่ายดั้งเดิมตอบด้วยชุดของ 1 และ 0 ในขณะที่เครือข่ายประสาทเทียมทดลองสร้างเสียงที่พยายาม “พูด” ว่าวัตถุในภาพคืออะไร แม้ว่าเสียงดั้งเดิมจะไม่สามารถเข้าใจได้ แต่ก็สามารถทำงานได้ดีขึ้นและถูกต้องส่วนใหญ่
ทั้งสองเครือข่ายทำงานได้ดีเท่ากัน โดยระบุวัตถุหรือสัตวุได้ถูกต้อง 92% ของเวลา จากนั้นผู้วิจัยตัดสินใจที่จะทดลองอีกครั้ง แต่คราวนี้ใช้ภาพถ่ายน้อยลงในกระบวนการ
เครือข่ายดั้งเดิมทำงานได้ไม่ดีเนื่องจากข้อมูลที่ไม่เพียงพอ ซึ่งเป็นไปตามที่คาดหวัง โดยลดลงเหลือความแม่นยำประมาณ 35% แต่เครือข่ายทดลองทำงานได้ดีขึ้น โดยมีความแม่นยำ 70% แม้ว่าจะมีข้อมูลน้อยกว่าก็ตาม
https://www.youtube.com/watch?v=Iq2YjHCAPRQ
ผลลัพธ์ที่น่าประหลาดใจ
ครั้งต่อไป ทีมนี้ใช้ภาพที่ยากขึ้น เช่น ภาพสุนัขที่เสียหาย แม้ว่าจะมีภาพที่ยากขึ้น แต่เครือข่ายประสาทเทียมที่ฝึกอบรมด้วยเสียงสามารถระบุวัตถุได้ถูกต้องประมาณ 50% ของเวลา ในขณะที่เครือข่ายดั้งเดิมมีความแม่นยำเพียง 20% เท่านั้น
Boyuan Chen เป็นผู้วิจัยหลักของการศึกษานี้
“ผลการวิจัยของเราสอดคล้องกับวิธีการคิดเกี่ยวกับคอมพิวเตอร์และตัวเลขของหลายๆ ผู้เชี่ยวชาญ มันเป็นสมมติฐานทั่วไปที่ว่าข้อมูลทวินามเป็นวิธีการที่มีประสิทธิภาพมากกว่าในการส่งต่อข้อมูลไปยังเครื่องจักรมากกว่ากระแสเสียง” Chen อธิบาย “ในความเป็นจริง เมื่อเราส่งการวิจัยนี้ไปยังการประชุม AI ใหญ่ๆ หนึ่งผู้ทบทวนแบบไม่ระบุชื่อปฏิเสธเอกสารของเราเพียงเพราะพวกเขารู้สึกว่าผลลัพธ์ของเรานั้น “น่าประหลาดใจและไม่สมเหตุสมผล” มากเกินไป”
“หากคุณคิดถึงข้อเท็จจริงที่ว่าภาษามนุษย์ได้ผ่านกระบวนการปรับให้เหมาะสมมานานหลายพันปีแล้ว มันจะทำให้เข้าใจได้ว่าภาษาพูดของเรามีสมดุลที่ดีระหว่างเสียงและสัญญาณ” Lipson กล่าว “ดังนั้น เมื่อมองผ่านมุมมองของ Shannon Entropy จึงสมเหตุสมผลที่เครือข่ายประสาทเทียมที่ฝึกอบรมด้วยภาษามนุษย์จะทำงานได้ดีกว่าเครือข่ายที่ฝึกอบรมด้วย 1 และ 0 เพียงอย่างเดียว”
การศึกษานี้จะนำเสนอในการประชุมสัมมนา International Conference on Learning Representations ในวันที่ 3 พฤษภาคม 2021
“เราควรพิจารณาใช้วิธีการฝึกอบรม AI ใหม่ๆ และดีกว่าแทนการรวบรวมข้อมูลที่ใหญ่ขึ้น” Chen กล่าว “หากเราคิดใหม่ว่าจะนำเสนอข้อมูลฝึกอบรมให้กับเครื่องจักรอย่างไร เราอาจทำได้ดีกว่าในฐานะครู”
“หนึ่งในความลึกลับที่ยิ่งใหญ่ที่สุดของวิวัฒนาการมนุษย์คือว่าบรรพบุรุษของเราสามารถได้รับภาษาและเด็กๆ เรียนรู้พูดได้อย่างไร” Lipson เพิ่มเติม “หากเด็กๆ ที่มีอายุน้อยที่สุดเรียนรู้ได้ดีที่สุดด้วยคำสั่งพูดซ้ำๆ แล้วระบบ AI ก็อาจทำได้เช่นกัน”












