มุมมองของ Anderson

ระบบตรวจจับข้อมูลเท็จโดยใช้ AI สำหรับการสนทนาในศูนย์บริการลูกค้า

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

นักวิจัยในประเทศเยอรมนีได้ใช้เทคนิคการเรียนรู้ของเครื่องจักรเพื่อสร้างระบบวิเคราะห์เสียงที่มีจุดมุ่งหมายหลักในการทำงานเป็นเครื่องตรวจจับข้อมูลเท็จโดยใช้ AI สำหรับลูกค้าในการสื่อสารเสียงกับพนักงานศูนย์บริการและสนับสนุน

ระบบนี้ใช้ฐานข้อมูลเสียงที่สร้างขึ้นพิเศษซึ่งบันทึกเสียงจากนักเรียนและครูจำนวน 40 คนระหว่างการอภิปรายหัวข้อที่มีการถกเถียงกัน รวมถึงเรื่องของการลงโทษประหารชีวิตและค่าเทอมศึกษา ระบบได้รับการฝึกอบรมโดยใช้โครงสร้างที่ใช้ Convolutional Neural Networks (CNNs) และ Long Short-Term Memory (LSTM) และมีอัตราความแม่นยำที่รายงานไว้ถึง 98%

แม้ว่าจุดมุ่งหมายที่ระบุไว้ของงานวิจัยนี้จะกล่าวถึงการสื่อสารของลูกค้า แต่นักวิจัยยอมรับว่ามันทำงานได้อย่างมีประสิทธิภาพในฐานะเครื่องตรวจจับข้อมูลเท็จทั่วไป

‘ผลการวิจัยสามารถใช้ได้กับกระบวนการบริการหลากหลายรูปแบบ และมีประโยชน์อย่างยิ่งสำหรับการโต้ตอบกับลูกค้าที่เกิดขึ้นผ่านโทรศัพท์ อัลกอริทึมที่นำเสนอสามารถใช้ได้ในสถานการณ์ใดๆ ที่ตัวแทน需要ทราบว่าลูกค้ากำลังพูดตามความเชื่อของตนเอง

‘สิ่งนี้อาจนำไปสู่การลดลงของการอ้างสิทธิ์การประกันที่น่าสงสัย หรือคำกล่าวที่ไม่จริงในการสัมภาษณ์งาน ซึ่งไม่เพียงแต่จะช่วยลดความสูญเสียในการดำเนินงานสำหรับบริษัทที่ให้บริการเท่านั้น แต่ยังช่วยให้ลูกค้ามีความซื่อสัตย์มากขึ้น’

การสร้างฐานข้อมูล

เนื่องจากไม่มีฐานข้อมูลที่เหมาะสมและเปิดให้ใช้ฟรีในภาษาเยอรมัน นักวิจัยจากมหาวิทยาลัยวิทยาศาสตร์ประยุกต์ Neu-Ulm (HNU) จึงสร้างฐานข้อมูลของตนเอง โดยการโพสต์ใบปลิวที่มหาวิทยาลัยและโรงเรียนท้องถิ่น และได้รับการตอบรับจากอาสาสมัครจำนวน 40 คน โดยมีอายุไม่ต่ำกว่า 16 ปี อาสาสมัครแต่ละคนได้รับวอเชอร์ Amazon มูลค่า 10 ยูโร

การอภิปรายจัดขึ้นในรูปแบบคลับอภิปรายที่ออกแบบมาเพื่อสร้างความแตกต่างทางความคิดเห็นและกระตุ้นให้เกิดปฏิกิริยารุนแรงเกี่ยวกับหัวข้อที่มีการถกเถียงกัน ซึ่งจำลองสถานการณ์ที่อาจเกิดขึ้นในระหว่างการสนทนาที่มีปัญหาในศูนย์บริการลูกค้า

หัวข้อที่อาสาสมัครต้องพูดอย่างอิสระเป็นเวลา 3 นาทีในสถานที่สาธารณะคือ

– ควรนำการลงโทษประหารชีวิตและการประหารชีวิตสาธารณะกลับมาใช้ใหม่ในเยอรมนีหรือไม่?
– ควรเรียกเก็บค่าเทอมศึกษาเพื่อให้ครอบคลุมค่าใช้จ่ายในเยอรมนีหรือไม่?
– ควรทำให้การใช้ยาเสพติดที่มีผลรุนแรง เช่น เฮโรอีนและเมทแอมเฟตามีน ถูกกฎหมายในเยอรมนีหรือไม่?
– ควรห้ามร้านอาหารชั้นในเยอรมนีที่เสิร์ฟอาหารฟาสต์ฟู้ดที่ไม่ดีต่อสุขภาพ เช่น แมคโดนัลด์หรือเบอร์เกอร์คิงหรือไม่?

การประมวลผลก่อนการฝึกอบรม

โครงการนี้ให้ความสำคัญกับการวิเคราะห์ลักษณะเสียงพูดในแนวทางการรู้จับเสียงอัตโนมัติ (ASR) มากกว่าการวิเคราะห์ภาษาธรรมชาติ (NLP) ซึ่งวิเคราะห์ภาษาที่ระดับภาษาและอนุมาน ‘อุณหภูมิ’ ของการอภิปรายโดยตรงจากภาษาที่ใช้

ตัวอย่างที่ถูกประมวลผลก่อนหน้านี้ถูกวิเคราะห์โดยใช้ Mel-frequency Cepstral Coefficients (MFCCs) ในตอนแรก ซึ่งเป็นวิธีการที่เชื่อถือได้และยังคงได้รับความนิยมในการวิเคราะห์เสียง เนื่องจากวิธีการนี้ถูกเสนอครั้งแรกในปี 1980 จึงใช้ทรัพยากรการประมวลผลที่มีประสิทธิภาพในการรู้จับรูปแบบที่เกิดซ้ำในเสียง และทนต่อคุณภาพการบันทึกเสียงที่หลากหลาย เนื่องจากการอภิปรายจัดขึ้นผ่านแพลตฟอร์ม VOIP ในช่วงการล็อกดาวน์ในเดือนธันวาคม 2020 จึงจำเป็นต้องมีเฟรมเวิร์กการบันทึกที่สามารถคำนึงถึงเสียงที่มีคุณภาพไม่ดีได้เมื่อจำเป็น

เป็นเรื่องที่น่าสนใจที่จะทราบว่าข้อจำกัดทางเทคนิคสองประการ (ทรัพยากร CPU ที่จำกัดในช่วงต้นทศวรรษ 1980 และลักษณะเฉพาะของการเชื่อมต่อ VOIP ในบริบทเครือข่ายที่มีการรบกวน) รวมกันเพื่อสร้างแบบจำลอง ‘เทคนิคที่มีความหนาแน่นต่ำ’ ซึ่งดูเหมือนจะทนทานในสถานการณ์ที่ไม่มีสภาพแวดล้อมและทรัพยากรที่เหมาะสม – ซึ่งคล้ายกับสนามที่เป้าหมายสำหรับอัลกอริทึมที่ได้มา

หลังจากนั้น อัลกอริทึม Fast Fourier Transform (FFT) ถูกนำมาใช้กับเซ็กเมนต์เสียงเพื่อจัดหานำหน้าทางสเปกตรัมของ ‘เฟรมเสียง’ แต่ละเฟรม ก่อนที่จะทำการแมปสุดท้ายไปยัง Mel Scale

การฝึกอบรม ผลลัพธ์ และข้อจำกัด

ระหว่างการฝึกอบรม เวกเตอร์ลักษณะที่ถูกดึงออกมาถูกส่งไปยังชั้นเครือข่ายที่มีการกระจายเวลา จากนั้นจะถูกแบนและส่งไปยังชั้น LSTM

สถาปัตยกรรมของกระบวนการฝึกอบรมสำหรับเครื่องตรวจจับข้อมูลเท็จโดยใช้ AI

สถาปัตยกรรมของกระบวนการฝึกอบรมสำหรับเครื่องตรวจจับข้อมูลเท็จโดยใช้ AI Source: https://arxiv.org/ftp/arxiv/papers/2107/2107.11175.pdf

สุดท้าย ทุกๆ นิวรอนจะถูกเชื่อมต่อกันเพื่อสร้างการคาดการณ์แบบไบนารี่ว่าผู้พูดกำลังพูดสิ่งที่พวกเขามั่นใจว่าเป็นความจริงหรือไม่

ในการทดสอบหลังการฝึกอบรม ระบบได้ระดับความแม่นยำสูงถึง 98.91% ในแง่ของการทำความเข้าใจเจตนา (โดยที่เนื้อหาที่พูดอาจไม่สะท้อนถึงเจตนา) นักวิจัยเชื่อว่างานวิจัยนี้แสดงให้เห็นถึงการระบุความเชื่อมั่นโดยอาศัยรูปแบบเสียง และสิ่งนี้สามารถทำได้โดยไม่ต้องมีการวิเคราะห์ภาษาแบบ NLP

ในแง่ของข้อจำกัด นักวิจัยยอมรับว่าขนาดตัวอย่างทดสอบมีขนาดเล็ก แม้ว่าเอกสารจะไม่ระบุไว้อย่างชัดเจน แต่ข้อมูลทดสอบขนาดเล็กสามารถลดความสามารถในการนำไปใช้จริงในอนาคตได้ หากสมมติฐาน คุณลักษณะที่ถูกออกแบบ และกระบวนการฝึกอบรมถูกปรับให้เหมาะสมกับข้อมูลมากเกินไป เอกสารระบุว่า 6 ใน 8 โมเดลที่สร้างขึ้นระหว่างโครงการมีการปรับให้เหมาะสมในบางจุดของกระบวนการเรียนรู้ และมีการทำงานเพิ่มเติมที่ต้องทำในการทั่วไป化ความสามารถในการใช้งานของพารามิเตอร์ที่ตั้งไว้สำหรับโมเดล

นอกจากนี้ การวิจัยประเภทนี้จำเป็นต้องคำนึงถึงลักษณะเฉพาะของชาติ และเอกสารระบุว่าผู้เข้าร่วมชาวเยอรมันที่เกี่ยวข้องกับการสร้างข้อมูลอาจมีรูปแบบการสื่อสารที่ไม่สามารถนำไปใช้ได้โดยตรงข้ามวัฒนธรรม – ซึ่งเป็นสถานการณ์ที่อาจเกิดขึ้นในประเทศใดๆ

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai