พื้นฐาน AI

RNNs และ LSTMs ใน Deep Learning คืออะไร?

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

การพัฒนาที่น่าประทับใจมากมายในด้านการประมวลผลภาษาและ AI chatbots ได้รับการขับเคลื่อนด้วย Recurrent Neural Networks (RNNs) และ Long Short-Term Memory (LSTM) networks RNNs และ LSTMs เป็นสถาปัตยกรรมเครือข่ายประสาทเทียมพิเศษที่สามารถประมวลผลข้อมูลลำดับได้ ข้อมูลที่ลำดับเวลาเป็นเรื่องสำคัญ LSTMs เป็นเวอร์ชันที่ดีขึ้นของ RNNs ที่สามารถตีความลำดับข้อมูลที่ยาวขึ้นได้ มาทำความรู้จักกับสถาปัตยกรรมของ RNNs และ LSTMs และวิธีการที่พวกมันทำให้ระบบประมวลผลภาษาที่ซับซ้อนได้

เครือข่ายประสาทเทียมแบบ Feed-Forward คืออะไร?

ก่อนที่เราจะพูดถึงว่า Long Short-Term Memory (LSTM) และ Convolutional Neural Networks (CNN) ทำงานอย่างไร เราควรพูดถึงรูปแบบของเครือข่ายประสาทเทียมโดยทั่วไป

เครือข่ายประสาทเทียมมีจุดมุ่งหมายเพื่อตรวจสอบข้อมูลและเรียนรู้รูปแบบที่เกี่ยวข้อง เพื่อที่จะนำไปใช้กับข้อมูลอื่นและจัดประเภทข้อมูลใหม่ เครือข่ายประสาทเทียมแบ่งออกเป็นสามส่วน: ชั้น输入 ชั้นซ่อน (หรือชั้นซ่อนหลายชั้น) และชั้นเอาท์พุต

ชั้น输入เป็นส่วนที่รับข้อมูลเข้ามาในเครือข่ายประสาทเทียม ในขณะที่ชั้นซ่อนเป็นส่วนที่เรียนรู้รูปแบบในข้อมูล ชั้นซ่อนในเซตข้อมูลเชื่อมต่อกับชั้น输入และชั้นเอาท์พุตโดย “น้ำหนัก” และ “ความเอนเอียง” ซึ่งเป็นเพียงสมมติฐานเกี่ยวกับวิธีการที่จุดข้อมูลเกี่ยวข้องกัน น้ำหนักเหล่านี้ถูกปรับเปลี่ยนระหว่างการฝึกอบรม เมื่อเครือข่ายฝึกอบรม โมเดลจะคาดเดาเกี่ยวกับข้อมูลฝึกอบรม (ค่าเอาท์พุต) และเปรียบเทียบกับป้ายกำกับฝึกอบรมที่แท้จริง ระหว่างการฝึกอบรม เครือข่ายควร (หวังว่า) มีความแม่นยำมากขึ้นในการคาดเดาเกี่ยวกับความสัมพันธ์ระหว่างจุดข้อมูล เพื่อที่จะจัดประเภทจุดข้อมูลใหม่ได้อย่างแม่นยำ เครือข่ายประสาทเทียมที่ลึกมีหลายชั้นในชั้นกลาง/ชั้นซ่อนหลายชั้น ชั้นซ่อนและโหนดที่มากขึ้นในโมเดลจะทำให้โมเดลสามารถจดจำรูปแบบในข้อมูลได้ดีขึ้น

เครือข่ายประสาทเทียมแบบปกติ เช่นที่อธิบายไว้ข้างต้น มักถูกเรียกว่า “เครือข่ายประสาทเทียมแบบหนา” เครือข่ายประสาทเทียมแบบหนาเหล่านี้ถูกผสมผสานกับสถาปัตยกรรมเครือข่ายอื่นๆ ที่เชี่ยวชาญในการตีความข้อมูลประเภทต่างๆ

RNNs (Recurrent Neural Networks) คืออะไร?

Recurrent Neural Networks ใช้หลักการของเครือข่ายประสาทเทียมแบบปกติและทำให้สามารถจัดการกับข้อมูลลำดับได้โดยการให้โมเดลความจำภายใน เมื่อผลลัพธ์ของเครือข่ายถูกสร้างขึ้น ผลลัพธ์จะถูกคัดลอกและส่งกลับเข้าไปในเครือข่ายเป็นข้อมูลเข้า เมื่อตัดสินใจ ไม่เพียงแต่ข้อมูลเข้าและผลลัพธ์ปัจจุบันจะถูกวิเคราะห์ แต่ข้อมูลเข้าก่อนหน้านี้ก็ถูกพิจารณาด้วย อีกนัยหนึ่ง หากข้อมูลเข้าเริ่มต้นสำหรับเครือข่ายคือ X และผลลัพธ์คือ H ทั้ง H และ X1 (ข้อมูลเข้าถัดไปในลำดับข้อมูล) จะถูกส่งเข้าไปในเครือข่ายสำหรับการเรียนรู้รอบถัดไป ในวิธีนี้ บริบทของข้อมูล (ข้อมูลเข้าก่อนหน้า) จะถูกเก็บไว้เมื่อเครือข่ายฝึกอบรม

ผลลัพธ์ของสถาปัตยกรรมนี้คือ RNNs สามารถจัดการกับข้อมูลลำดับได้ อย่างไรก็ตาม RNNs มีปัญหาหลายอย่าง RNNs มีปัญหา vanishing gradient และ exploding gradient

ความยาวของลำดับที่ RNN สามารถตีความได้นั้นจำกัดมาก โดยเฉพาะเมื่อเทียบกับ LSTMs

LSTMs (Long Short-Term Memory Networks) คืออะไร?

Long Short-Term Memory networks สามารถถือเป็นขยายของ RNNs โดยใช้แนวคิดในการเก็บบริบทของข้อมูลเข้า อย่างไรก็ตาม LSTMs ได้รับการปรับเปลี่ยนในหลายวิธีที่สำคัญเพื่อให้สามารถตีความข้อมูลในอดีตได้ดีขึ้น การเปลี่ยนแปลงที่ทำกับ LSTMs เกี่ยวข้องกับปัญหา vanishing gradient และทำให้ LSTMs สามารถพิจารณาลำดับข้อมูลที่ยาวขึ้นได้

โมเดล LSTMs ประกอบด้วย สามส่วนหรือเกต มีเกต输入 เกตเอาท์พุต และเกตลืม RNNs และ LSTMs ใช้ข้อมูลเข้าจากช่วงเวลาก่อนหน้าเมื่อปรับเปลี่ยนความจำของโมเดลและน้ำหนักของข้อมูลเข้า เกต输入ตัดสินใจเกี่ยวกับค่าใดที่สำคัญและควรปล่อยผ่านโมเดล ฟังก์ชัน sigmoid ถูกใช้ในเกต输入 ซึ่งตัดสินใจเกี่ยวกับค่าใดที่จะส่งผ่านเครือข่ายประสาทเทียม ฟังก์ชัน TanH ถูกใช้เพื่อตัดสินใจเกี่ยวกับความสำคัญของค่าข้อมูลเข้า

หลังจากที่ข้อมูลเข้าและสถานะความจำปัจจุบันถูกคำนึงถึง เกตเอาท์พุตตัดสินใจเกี่ยวกับค่าใดที่จะส่งต่อไปยังช่วงเวลาต่อไป ในเกตเอาท์พุต ค่าเหล่านั้นถูกวิเคราะห์และมอบหมายความสำคัญตั้งแต่ -1 ถึง 1 สิ่งนี้ควบคุมข้อมูลก่อนที่จะถูกส่งต่อไปยังการคำนวณช่วงเวลาต่อไป สุดท้าย หน้าที่ของเกตลืมคือการลบข้อมูลที่โมเดลถือว่าไม่จำเป็นในการตัดสินเกี่ยวกับธรรมชาติของข้อมูลเข้า เกตลืมใช้ฟังก์ชัน sigmoid บนค่าเหล่านั้น โดยส่งออกตัวเลขระหว่าง 0 (ลืม) ถึง 1 (เก็บ)

เครือข่ายประสาทเทียม LSTMs ประกอบด้วยชั้น LSTMs พิเศษที่สามารถตีความข้อมูลคำลำดับและชั้นเชื่อมต่อหนาๆ เช่นที่อธิบายไว้ข้างต้น เมื่อข้อมูลผ่านชั้น LSTMs จะเข้าสู่ชั้นเชื่อมต่อหนาๆ

นักบล็อกและโปรแกรมเมอร์ที่มีความเชี่ยวชาญใน Machine Learning และ Deep Learning หัวข้อ Daniel หวังที่จะช่วยให้ผู้อื่นใช้พลังของ AI สำหรับสิ่งที่ดี