พื้นฐาน AI

เครือข่ายประสาทเทรานส์ฟอร์มเมอร์คืออะไร?

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

เทรานส์ฟอร์มเมอร์ คือสถาปัตยกรรมเครือข่ายประสาทที่ประมวลความสัมพันธ์ระหว่างโทเคนโดยใช้ attention. ต่างจากเครือข่ายแบบ recurrent ที่ต้องส่งสถานะซ่อนจากตำแหน่งหนึ่งไปยังตำแหน่งต่อไป, เทรานส์ฟอร์มเมอร์สามารถคำนวณการโต้ตอบหลายโทเคนต่อโทเคนพร้อมกันระหว่างการฝึก.

เทรานส์ฟอร์มเมอร์เป็นหัวใจของระบบหลายประเภท เช่น ระบบภาษาธรรมชาติ, วิชัน, เสียง และระบบหลายโหมด, แต่สถาปัตยกรรมนี้ไม่ได้เป็นฐานข้อมูลหรือการรับประกันว่ามีการให้เหตุผล. ผลลัพธ์ของมันยังคงเป็นการพยากรณ์ที่ขึ้นกับพารามิเตอร์ที่เรียนรู้, บริบทที่ให้มา และกระบวนการถอดรหัส.

ประเด็นสำคัญ

  • Self‑attention ทำให้แต่ละโทเคนสร้างการแสดงผลที่ขึ้นกับบริบทจากโทเคนอื่นที่ได้รับอนุญาต.
  • ข้อมูลตำแหน่งถูกเพิ่มเข้ามาเนื่องจาก attention เพียงอย่างเดียวไม่สามารถเข้ารหัสลำดับของโทเคนได้.
  • เทรานส์ฟอร์มเมอร์แบบ encoder‑only, decoder‑only และ encoder‑decoder มีเป้าหมายการใช้งานที่ต่างกัน.
  • ความยาวของบริบท, การคำนวณ, ข้อมูลการฝึกและการประเมินผล — ไม่ใช่แค่ attention — กำหนดความสามารถและความน่าเชื่อถือ.
What Are Transformer Neural Networks? diagram showing tokens, embed + position, self-attention, feed-forward, stack blocks, output
Attention สร้างการแสดงผลเชิงบริบท; มาสก์และวัตถุประสงค์กำหนดว่าข้อมูลใดที่พร้อมใช้งาน.

โทเคน, การฝังและตำแหน่ง

ข้อความจะถูกแบ่งเป็นโทเคนก่อน, ซึ่งอาจเป็นคำ, subword หรืออักขระ. รหัสโทเคนแต่ละตัวเลือกเวกเตอร์การฝังที่เรียนรู้ไว้. เทรานส์ฟอร์มเมอร์ด้านวิชันอาจฝังเป็นส่วนของภาพ; เทรานส์ฟอร์มเมอร์ด้านเสียงอาจฝังเป็นเฟรมหรือหน่วยเสียงที่เรียนรู้.

เนื่องจากการดำเนินการ attention แบบไม่มีการปรับแต่งเป็น permutation‑equivariant, โมเดลจำเป็นต้องมีข้อมูลตำแหน่ง. การใช้งานอาจเพิ่ม positional encoding ที่เรียนรู้หรือคงที่, หรือปรับคะแนน attention ด้วยวิธี relative หรือ rotary. ผลลัพธ์คือการผสมผสานระหว่างความหมายของโทเคนกับตำแหน่งที่ปรากฏ.

การคูณจุดสเกลและ multi‑head attention

สำหรับแต่ละตำแหน่ง, การฉายที่เรียนรู้สร้าง query, key และ value. ความคล้ายคลึงระหว่าง query กับ key ที่อนุญาตสร้างน้ำหนัก attention; ค่าที่ถ่วงน้ำหนักนั้นเป็นผลลัพธ์. การสเกลผลคูณจุดช่วยให้ softmax ทำงานได้อย่างเสถียรเมื่อมิติของเวกเตอร์เพิ่มขึ้น.

Multi‑head attention ทำซ้ำการดำเนินการนี้ในหลาย subspace ที่เรียนรู้. หัวต่าง ๆ สามารถเชี่ยวชาญความสัมพันธ์ที่แตกต่างกัน, แม้ว่าแพทเทิร์น attention ที่ดูสวยงามไม่ควรถือเป็นคำอธิบายที่ถูกต้องของการตัดสินใจของโมเดลโดยอัตโนมัติ.

บล็อกเทรานส์ฟอร์มเมอร์

ชั้นย่อย attention ตามด้วยเครือข่าย feed‑forward แบบตำแหน่ง‑wise. การเชื่อมต่อ residual ส่งผ่านการแสดงผลก่อนหน้าไปรอบ ๆ แต่ละชั้นย่อย, ในขณะที่การทำ normalization และ regularization ช่วยการปรับแต่ง. การซ้อนหลายบล็อกสร้างคุณลักษณะที่มีบริบทเพิ่มขึ้นผ่าน deep learning.

ในระหว่างการสร้างแบบ causal, มาสก์จะป้องกันไม่ให้ตำแหน่งอ่านโทเคนในอนาคต. ในช่วงการสรุปผล, decoder พยากรณ์โทเคนหนึ่ง, เพิ่มเข้าไป, แล้วทำซ้ำ. แคช key‑value ช่วยหลีกเลี่ยงการคำนวณใหม่ของการฉาย attention ของโทเคนก่อนหน้า, ลดค่าใช้จ่ายการสร้างแต่ไม่ขจัดทั้งหมด.

ตระกูล encoder, decoder และ encoder‑decoder

โมเดลแบบ encoder‑only เรียนรู้การแสดงผลแบบสองทิศที่เหมาะกับการจำแนกประเภท, การดึงข้อมูลและการทำป้ายกำกับโทเคน. โมเดลแบบ decoder‑only ใช้ causal attention สำหรับการสร้างโทเคนถัดไป. โมเดล encoder‑decoder ให้ decoder ใส่ใจข้อมูลที่เข้ารหัส, ซึ่งมีประโยชน์ต่อการแปลภาษาและงาน sequence‑to‑sequence อื่น ๆ.

ระบบสมัยใหม่มักเริ่มด้วยการ pretraining อย่างกว้างขวางแล้วใช้ transfer learning, การปรับ instruction หรือการปรับ preference. ดังนั้นสถาปัตยกรรมเดียวกันจึงสามารถสนับสนุนพฤติกรรมที่แตกต่างอย่างมาก ขึ้นอยู่กับวัตถุประสงค์และข้อมูล.

ขีดจำกัด, ประสิทธิภาพและการประเมินผล

Attention ครบถ้วนบนลำดับหนึ่งมีการโต้ตอบแบบคู่ที่เป็นกำลังสองตามความยาวของลำดับ, ทำให้เกิดความกดดันด้านหน่วยความจำและการคำนวณ. การใช้ sparse หรือ linear attention, การแบ่งเป็นชั้น, การดึงข้อมูล, การควอนติฟายและการแคชเป็นการแลกเปลี่ยนระหว่างความแม่นยำ, การเข้าถึงบริบท, ความหน่วงเวลาและความซับซ้อนของการนำไปใช้.

หน้าต่างบริบทที่ใหญ่ขึ้นไม่ได้รับประกันว่าข้อเท็จจริงทุกข้อที่ให้มาจะถูกใช้ถูกต้อง. ควรประเมินความเป็นจริง, ความทนทาน, การปรับเทียบ, ความหน่วงเวลา, ค่าใช้จ่ายและรูปแบบความล้มเหลวที่เฉพาะงาน. สำหรับระบบเชิงโต้ตอบ, prompt engineering สามารถกำหนดพฤติกรรม, แต่ไม่สามารถเปลี่ยนโมเดลแบบความน่าจะเป็นให้เป็นแหล่งข้อมูลที่ไม่มีข้อผิดพลาดได้.

การคำนวณของเทรานส์ฟอร์มเมอร์จากโทเคนสู่บริบท

เทรานส์ฟอร์มเมอร์ทำแปลงโทเคนเป็นเวกเตอร์, เพิ่มข้อมูลตำแหน่ง, และส่งผ่านบล็อก attention และ feed‑forward ที่ทำซ้ำ. ใน self‑attention, การฉายที่เรียนรู้สร้าง query, key, และ value. การคูณจุดสเกลเปรียบเทียบแต่ละ query กับ key, softmax ให้ค่าน้ำหนัก, และค่าที่ถ่วงน้ำหนักเป็นบริบท. หัวหลายหัวเรียนรู้สเปซการฉายที่แตกต่างกัน. การเชื่อมต่อ residual และ normalization ทำให้สแต็กลึกคงที่, ในขณะที่เครือข่าย feed‑forward แปลงแต่ละโทเคนแยกกันระหว่างชั้น attention.

โมเดลแบบ encoder‑only ใช้บริบทสองทิศและเหมาะกับงานจำแนกหรือการสร้างการแสดงผล. โมเดลแบบ decoder‑only ใช้มาสก์ causal เพื่อให้แต่ละตำแหน่งพยากรณ์จากโทเคนก่อนหน้าและครอบครองการสร้างโมเดลภาษา. โมเดล encoder‑decoder ให้ decoder ใส่ใจข้อมูลที่เข้ารหัสเพื่อการแปลและการสร้างเชิงโครงสร้าง. ค่าใช้จ่ายของ attention เพิ่มเป็นกำลังสองตามความยาวของลำดับในรูปแบบมาตรฐาน, ทำให้ต้องการวิธีการ sparse, linear, chunked, recurrent และ state‑space. บริบทที่ยาวขึ้นเพิ่มหลักฐานที่มีอยู่, ไม่ได้รับประกันการเรียกคืนหรือการให้เหตุผล.

การฝึก, การปรับตัวและการสรุปผล

เป้าหมายของการ pretraining รวมถึงการพยากรณ์โทเคนถัดไป, การกู้คืนโทเคนที่ถูกมาสก์, และการทำลายแบบ sequence‑to‑sequence. การผสมข้อมูล, การลบสำเนาซ้ำ, tokenizer, การบรรจุบริบท, optimizer, schedule, และการคำนวณกำหนดความสามารถ. การ fine‑tuning สามารถอัปเดตพารามิเตอร์ทั้งหมดหรือใช้ adapters และวิธี low‑rank; การปรับ instruction และ preference ปรับพฤติกรรม. การดึงข้อมูลมักดีกว่าสำหรับข้อเท็จจริงที่เปลี่ยนแปลง, ในขณะที่การปรับช่วยเรื่องรูปแบบและพฤติกรรมของงาน. ควรรักษาชุดประเมินที่ไม่ถูกแก้ไขและทดสอบการปนเปื้อนจากเกณฑ์มาตรฐานสาธารณะ.

การสรุปผลแบบ autoregressive เก็บการฉาย key‑value ของโทเคนก่อนหน้าเพื่อหลีกเลี่ยงการคำนวณซ้ำ. ความหน่วงเวลาขึ้นอยู่กับการประมวลผล prompt และการถอดรหัสแบบต่อเนื่อง; throughput ขึ้นกับการทำ batch, หน่วยความจำ, การจัดการแคช, ความแม่นยำ, และฮาร์ดแวร์. วิธี Greedy, temperature, top‑k, top‑p, และ beam ทำการแลกเปลี่ยนระหว่าง deterministic กับ diversity. การควอนติฟายลดหน่วยความจำแต่สามารถกระทบความสามารถที่หายาก. ตรวจสอบโมเดลที่ใช้งานจริง, tokenizer, template ของ prompt, sampler, และ runtime ที่ความยาวลำดับที่เป็นจริง.

การประเมินผลและการควบคุม

เทรานส์ฟอร์มเมอร์อาจสร้างข้อมูลเท็จ, ปฏิบัติตามคำสั่งที่ดึงมามีเจตนาร้าย, เปิดเผยข้อมูลที่จำได้, หรือทำงานได้แย่ลงเมื่อใช้หลายภาษาและบริบทยาว. ประเมินความสำเร็จของงาน, การสนับสนุนข้อเท็จจริง, การปรับเทียบ, การปฏิเสธ, ความทนทาน, ความปลอดภัย, ความหน่วงเวลา, และค่าใช้จ่าย; ตรวจสอบหลักฐานและการกระทำของเครื่องมือแยกกัน. ใช้การดึงข้อมูลที่รับรู้สิทธิ์, เครื่องมือที่มีประเภท, การอนุญาตภายนอก, การจำกัดอัตรา, และการอนุมัติของมนุษย์สำหรับการกระทำที่สำคัญ. เฝ้าติดตามรุ่นของโมเดลและ prompt, การกระจายอินพุต, ข้อผิดพลาดของเครื่องมือ, และการแก้ไขของผู้ใช้. เทรานส์ฟอร์มเมอร์เป็นสถาปัตยกรรมสำหรับการคำนวณลำดับ, ไม่ได้เป็นหลักฐานของความเข้าใจหรือการรับประกันผลลัพธ์ที่จริง.

ตัวอย่างการทำงาน: ผู้ช่วยเอกสารแบบเทรานส์ฟอร์มเมอร์

บริษัทหนึ่งทำดัชนีคู่มือที่ได้รับการอนุมัติโดยใช้รหัสเอกสาร, เวอร์ชัน, ส่วน, สิทธิ์, และวันที่มีผล. ผู้ช่วยที่ใช้เทรานส์ฟอร์มเมอร์ดึงและจัดลำดับหลักฐานใหม่, จากนั้นตอบเฉพาะจากข้อความที่ได้รับอนุญาตพร้อมอ้างอิง. ชุดประเมินรวมคำถามที่ตอบได้, ไม่ตอบได้, ก ambiguous, และขัดแย้งในหลายบทบาทและประเภทเอกสาร. การเรียกคืนการดึงข้อมูล, ความแม่นยำของการอ้างอิง, ความถูกต้องของคำตอบที่มีพื้นฐาน, การปฏิเสธ, พฤติกรรมบริบทยาว, ความหน่วงเวลา, และค่าใช้จ่าย จะถูกให้คะแนนแยกกัน.

เอกสารที่ดึงมาถูกพิจารณาเป็นข้อมูลที่ไม่เชื่อถือ, ดังนั้นคำสั่งที่ฝังอยู่ไม่สามารถลบล้างนโยบายระบบหรือให้สิทธิ์เครื่องมือได้. ผู้ใช้ต้องยืนยันตัวตนก่อนการดึงข้อมูล, และการกระทำที่มีผลสำคัญยังคงอยู่นอกโมเดล. บันทึกเก็บรักษา ID และเวอร์ชันของหลักฐานโดยไม่บันทึกเนื้อหาเอกสารที่ไม่จำเป็น. การเฝ้าติดตามตรวจพบการเปลี่ยนแปลงของคอร์ปัส, คำตอบที่ไม่ได้รับการสนับสนุน, ข้อผิดพลาดด้านสิทธิ์, และการแก้ไขของผู้ใช้. การเปลี่ยนแปลงโมเดลหรือ tokenizer จะทำการรันใหม่กับชุดทดสอบเต็ม, และการตั้งค่าก่อนหน้าจะยังคงใช้ได้จนกว่าระบบใหม่จะแสดงความปลอดภัยและคุณภาพที่เทียบเท่าหรือดีกว่า.

หลักฐานการนำไปใช้และความพร้อมในการดำเนินงาน

การตัดสินใจเชิงผลิตต้องการมากกว่าการสาธิตที่สำเร็จ. กำหนดผู้ใช้เป้าหมาย, สภาพแวดล้อมการทำงาน, อินพุต, เอาต์พุต, ขึ้นต่อ, เจ้าของ, และผลของความล้มเหลวสำคัญแต่ละประการ. สร้าง baseline ที่ทำซ้ำได้และชุดประเมินที่มีเวอร์ชันก่อนการปรับ. ทดสอบกรณีทั่วไป, เงื่อนไขขอบ, อินพุตที่ผิดรูปหรือขาด, การเปลี่ยนแปลงการกระจาย, การหยุดทำงานของส่วนที่พึ่งพา, การใช้ผิดวัตถุประสงค์, และกลุ่มหรือสภาพแวดล้อมที่อาจไม่ได้รับบริการ. วัดคุณภาพงานพร้อมกับการปรับเทียบหรือความไม่แน่นอน, ความหน่วงเวลา, throughput, ต้นทุนทรัพยากร, การเข้าถึง, ความเป็นส่วนตัว, และความปลอดภัย. บันทึกการแปลงและเกณฑ์ทุกอย่างเพื่อให้ผู้ตรวจสอบอิสระสามารถทำซ้ำผลลัพธ์และแยกแยะหลักฐานจากต้นแบบที่ดึงดูด.

ก่อนเปิดใช้งาน, กำหนดอำนาจรับผิดชอบสำหรับการปล่อย, ข้อยกเว้น, การเปลี่ยนแปลง, การย้อนกลับ, และการยกเลิก. ใช้การปล่อยแบบขั้นตอน, เก็บสำรองที่ปลอดภัย, และตรวจสอบการเฝ้าติดตามด้วยการฉีดข้อผิดพลาดโดยเจตนา. เทเลเมตรีการดำเนินงานควรเปิดเผยคุณภาพอินพุต, พฤติกรรมเอาต์พุต, รุ่นของโมเดลหรือกฎ, สถานะส่วนที่พึ่งพา, การแทรกแซงของมนุษย์, และผลลัพธ์ที่ยืนยันโดยไม่เก็บข้อมูลที่อ่อนไหวที่ไม่จำเป็น. กำหนดเกณฑ์การแจ้งเตือนและผู้รับผิดชอบการตอบสนอง, จากนั้นตรวจสอบหลักฐานจากโลกจริงหลังการปรับใช้แทนการสมมติว่าประสิทธิภาพออฟไลน์จะคงอยู่. ประเมินใหม่เมื่อแหล่งข้อมูล, ผู้ใช้, โมเดล, ผู้จำหน่าย, นโยบาย, ฮาร์ดแวร์, หรือวัตถุประสงค์เปลี่ยนแปลง. ระบบที่ดูแลต้องมีขั้นตอนการกู้คืน, การเรียนรู้จากเหตุการณ์, การลบและการเก็บรักษาเอกสาร, และจุดชัดเจนที่ควรปิดหรือแทนที่.

คำถามที่พบบ่อย

โมเดลภาษาขนาดใหญ่ทุกตัวเป็นเทรานส์ฟอร์มเมอร์หรือไม่?

โมเดลภาษาขนาดใหญ่ส่วนใหญ่ในปัจจุบันใช้รูปแบบเทรานส์ฟอร์มเมอร์, แต่โมเดลภาษาอาจสร้างด้วยสถาปัตยกรรมแบบ recurrent, state‑space หรือแบบผสม.

self‑attention หมายความว่าโมเดลเข้าใจข้อความเหมือนคนหรือไม่?

ไม่. Attention เป็นกลไกการให้ค่าน้ำหนักที่เรียนรู้. พฤติกรรมภาษาที่คล้ายมนุษย์ไม่ได้โดยตัวมันเองเป็นหลักฐานของความเข้าใจ, ความจริง หรือเจตนาที่คล้ายมนุษย์.

แหล่งอ้างอิงหลัก

นักบล็อกและโปรแกรมเมอร์ที่มีความเชี่ยวชาญใน Machine Learning และ Deep Learning หัวข้อ Daniel หวังที่จะช่วยให้ผู้อื่นใช้พลังของ AI สำหรับสิ่งที่ดี