โมเดลและแพลตฟอร์ม AI

AudioShake เปิดตัว The Refinery เพื่อแปลงการสนทนาที่ทับซ้อนให้เป็นข้อมูลการฝึก AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
Conceptual illustration of overlapping sound waves separating into individual audio tracks for AI training.

ผู้คนขัดจังหวะ พวกเขาหัวเราะเหนือประโยคสุดท้ายของคนอื่น เสนอความเห็นชอบอย่างรวดเร็วก่อนผู้พูดจะพูดจบ และยังพูดต่อไปขณะที่ดนตรีหรือเสียงจราจรเติมเต็มพื้นหลัง สำหรับนักพัฒนาเสียง AI ความยุ่งยากในชีวิตประจำวันนี้สร้างปัญหาข้อมูลที่ยาก: การบันทึกอาจมีพฤติกรรมการสนทนาที่โมเดลต้องเรียนรู้อย่างแม่นยำ แต่กลับมาถึงในรูปแบบสตรีมเสียงผสมเดียว

AudioShake กำลังมุ่งเป้าไปที่ช่องว่างนั้นด้วย The Refinery ระบบที่เปิดตัวใหม่ซึ่งแปลงการบันทึกที่มีอยู่ให้เป็นข้อมูลที่มีโครงสร้างและแยกตามผู้พูดสำหรับการฝึก AI แทนที่จะให้ผู้พัฒนาจัดทำการสนทนาใหม่หรือสร้างตัวอย่างสังเคราะห์ บริษัทกำลังเสนอวิธีการสกัดเสียงของแต่ละบุคคลและส่วนประกอบเสียงอื่น ๆ จากการบันทึกที่องค์กรมีสิทธิ์ใช้แล้ว

การประกาศนี้ทำให้การแยกเสียงอยู่ใกล้กับศูนย์กลางของกระบวนการพัฒนาเสียง AI มากขึ้น คำถามที่น่าสนใจคือชุดข้อมูลจะสามารถรักษาเวลาและความซับซ้อนของการสนทนาจริงได้ขณะทำให้การทำป้ายกำกับ การตรวจสอบ และการใช้งานง่ายขึ้นหรือไม่

การแปลงการบันทึกที่เสร็จสมบูรณ์ให้เป็นแทร็กผู้พูดแยกกัน

ตามการประกาศของ AudioShake The Refinery สามารถแยกการสนทนาเป็นแทร็กผู้พูดแต่ละคนพร้อมกับแยกบทสนทนาจากดนตรีและเสียงพื้นหลัง มันทำงานโดยตรงจากไฟล์เสียงที่บันทึกไว้โดยไม่ต้องอาศัยเซสชันการบันทึกต้นฉบับหรือสเตมที่บันทึกแยกต่างหาก เมื่อสองคนพูดพร้อมกัน เป้าหมายคือการกู้คืนเสียงของพวกเขาเป็นรายบุคคลพร้อมคงการทับซ้อนของการแลกเปลี่ยน

สิ่งนี้แตกต่างจากการทำความสะอาดการบันทึกจนเหลือเสียงเด่นหนึ่งเสียงเท่านั้น การขัดจังหวะอาจเป็นข้อมูลการฝึกที่สำคัญ ไม่ใช่เสียงรบกวนที่ไม่ต้องการ การยอมรับสั้น ๆ สามารถช่วยสื่อว่าผู้ฟังกำลังฟัง เห็นด้วย หรือกำลังเตรียมที่จะพูดต่อ การทำให้การแลกเปลี่ยนเป็นสตรีมเดียวอาจทำให้พฤติกรรมเหล่านั้นยากต่อการเชื่อมโยงกับผู้พูดที่ถูกต้อง

วิธีที่เป็นประโยชน์ในการคิดถึงผลลัพธ์คือเป็นชุดของแทร็กที่จัดเรียงกัน แทร็กหนึ่งบรรจุเสียงของผู้พูดคนหนึ่ง แทร็กอีกอันบรรจุเสียงของผู้พูดคนที่สอง และเวลาแบ่งปันของพวกเขาเปิดเผยช่วงที่ทับซ้อนกัน การบันทึกจึงง่ายต่อการตรวจสอบโดยไม่ต้องเขียนใหม่ทั้งหมดของการสนทนา

AudioShake กล่าวว่า ระบบไม่ได้สร้างหรือสร้างเสียงใหม่: เสียงที่แยกออกและความถี่ที่สอดคล้องมาจากการบันทึกต้นฉบับ ความแตกต่างนี้สำคัญสำหรับนักพัฒนาที่กำลังมองหาตัวอย่างของพฤติกรรมการสนทนาจริง การประมวลผลมีจุดมุ่งหมายเพื่อเปิดเผยสิ่งที่บันทึกไว้ ไม่ใช่สร้างการแสดงใหม่

ทำไมการแยกผู้พูดจึงเกินกว่าการระบุผู้พูด (Diarization)

AudioShake’s Multi-Speaker Separation หน้าผลิตภัณฑ์ อธิบายการผสมผสานระหว่างการแยกผู้พูดและการระบุผู้พูด (diarization) การระบุผู้พูดระบุว่าเมื่อใดผู้พูดต่างกันกำลังพูด; การแยกสร้างสัญญาณเสียงแยกส่วนแต่ละคน การทำป้ายกำกับช่วงเวลาว่ามีผู้พูดสองคนไม่ได้ให้ผู้พัฒนามีแทร็กเสียงที่ใช้ได้อิสระสองแทร็กโดยตรง

ผลิตภัณฑ์ยังแยกแยะความมั่นใจในการกำหนดเสียงให้กับผู้พูดที่ถูกต้องจากความมั่นใจในคุณภาพของการแยก สิ่งเหล่านี้แก้ไขปัญหาที่แตกต่างกัน: เสียงอาจถูกจัดสรรอย่างถูกต้องแต่ยังคงมีเสียงของบุคคลอื่นอยู่ AudioShake อธิบายระบบพื้นฐานว่าเป็นระบบเชิงเสียง ไม่ได้พึ่งพาโมเดลภาษา และรองรับการบันทึกที่มีอัตราการสุ่มตัวอย่างและสภาวะการจับที่แตกต่างกัน

สำหรับสายการฝึก ระบบการแยกฟังก์ชันเหล่านี้สามารถทำให้การตรวจสอบแม่นยำยิ่งขึ้น ทีมอาจต้องตรวจสอบตัวตนของผู้พูด ความชัดเจนของแทร็กเฉพาะ หรือความแม่นยำของข้อความที่สร้างขึ้นภายหลัง การพิจารณาทั้งสามเป็นความสำเร็จหรือความล้มเหลวเดียวกันจะทำให้ไม่ชัดเจนว่าข้อผิดพลาดเข้าสู่ชุดข้อมูลที่ใด

คะแนนคุณภาพเป็นส่วนหนึ่งของสายข้อมูล

The Refinery ให้คะแนนผลลัพธ์ตามคุณภาพและความมั่นใจ ทำให้องค์กรสามารถจัดเรียงคอลเลกชันขนาดใหญ่เป็นวัสดุที่ใช้ได้, สามารถแก้ไขได้, หรือไม่เหมาะสม นี่เป็นคุณสมบัติการดำเนินงานที่สำคัญ ในระดับของคลังเสียงที่มีขนาดใหญ่ การฟังทุกนาทีด้วยตนเองกลายเป็นคอขวดแม้การแยกเองจะเป็นอัตโนมัติ

คะแนนเหล่านี้สามารถช่วยชี้นำความสนใจของมนุษย์ไปยังส่วนที่น่าสงสัย ตัวอย่างเช่น ทีมชุดข้อมูลอาจให้ความสำคัญกับการสนทนาที่แออัดซึ่งผู้พูดที่เงียบทำให้แยกแยะได้ยาก แทนที่จะตรวจสอบการบันทึกคนเดียวที่ไม่มีความซับซ้อนด้วยความเข้มข้นเท่าเดิม

ยังมีการแลกเปลี่ยนที่ต้องจัดการ การเลือกเฉพาะคลิปที่ง่ายและชัดเจนที่สุดอาจทำให้ชุดข้อมูลพลาดสถานการณ์ที่ยากซึ่งโครงการตั้งใจจะจับ ในการประเมินของเรา ทีมที่ใช้สายงานแบบนี้ควรประเมินทั้งคุณภาพของผลลัพธ์และความหลากหลายของการสนทนาที่คงอยู่หลังการกรอง การรักษาตัวอย่างที่ท้าทายด้วยการตรวจสอบอย่างรอบคอบอาจมีประโยชน์มากกว่าการเพิ่มคะแนนความมั่นใจรวมเดียว

ดังนั้นความพร้อมสำหรับการฝึกจึงเกี่ยวข้องมากกว่าการสร้างไฟล์แยก นักพัฒนายังต้องกำหนดว่าแทร็ก, ข้อความถอดความ, เวลา, ป้ายกำกับผู้พูด, และเมตาดาต้าคุณภาพเข้ากับเป้าหมายการเรียนรู้เฉพาะของตนอย่างไร

สิ่งที่ Benchmark ของ AudioShake แสดงให้เห็น — และขีดจำกัดของมัน

ในการประเมินเชิงเทคนิค Multi-Speaker 2.0 ของ AudioShake รายงานอัตราความผิดพลาดของคำแบบต่อเนื่องขั้นต่ำ‑permutation ที่ 9.17% บน LibriCSS เมื่อเทียบกับ 37.75% สำหรับ checkpoint MERL TF‑Locoformer ที่ทดสอบ ทั้งสองถูกประเมินผ่านไพป์ไลน์การถอดข้อความ Whisper large‑v3 เดียวกัน อัตราความผิดพลาดที่ต่ำกว่าแสดงถึงข้อผิดพลาดในการถอดข้อความน้อยลงภายใต้การประเมินนั้น

การระบุคุณสมบัตินี้สำคัญ: checkpoint พื้นฐานถูกทดสอบนอกโดเมนการฝึกของมัน AudioShake ชี้แจงอย่างชัดเจนว่าการเปรียบเทียบนี้เป็นการเปรียบเทียบแบบพร้อมใช้ ไม่ใช่หลักฐานว่าระบบสถาปัตยกรรมหนึ่งเหนือกว่าโดยธรรมชาติภายใต้เงื่อนไขการฝึกที่เทียบกัน การประเมินของบริษัทยังระบุว่าความแม่นยำยิ่งรักษาได้ยากเมื่อการทับซ้อนต่อเนื่องและจำนวนผู้พูดเพิ่มขึ้น

นี่เป็นผลลัพธ์ที่บริษัทรายงาน ไม่ใช่การประเมินอิสระของการใช้งาน Refinery ทุกกรณี ผลลัพธ์เหล่านี้สนับสนุนการทดสอบเทคโนโลยีบนเสียงตัวอย่างที่เป็นตัวแทน มากกว่าการสันนิษฐานว่าการปรับปรุงตามหัวข้อข่าวจะถ่ายทอดโดยไม่เปลี่ยนแปลงไปยังชุดข้อมูลอื่น

คุณภาพการแยกและประสิทธิภาพของโมเดลต่อไปเป็นผลลัพธ์ที่แตกต่างกันเช่นกัน คอร์ปัสการฝึกที่สะอาดกว่าอาจมีคุณค่า แต่การเปิดตัวไม่ได้ระบุว่ารุ่นสนทนาที่เฉพาะเจาะจงจะพัฒนาขึ้นเท่าใดหลังจากเรียนรู้จากมัน สิ่งนี้ต้องการการทดลองแยกต่างหากโดยกำหนดแอปพลิเคชันและเงื่อนไขการประเมินที่ตั้งใจไว้

จากกระบวนการทำงานสื่อสู่โครงสร้างพื้นฐานข้อมูล AI

AudioShake นำประสบการณ์จากการผลิตเพลงและสื่อมาสู่การทำงาน เว็บไซต์บริษัท ของ AudioShake อธิบายการแยกเสียงสำหรับงานต่าง ๆ รวมถึงการมิกซ์, การแปลตำแหน่ง, การวิเคราะห์เสียง, และการตัดต่อภาพและเสียง พร้อมระบุลูกค้าเช่น ESPN, Universal Music Group, และ Warner Bros. Studios ในสภาพแวดล้อมเหล่านั้น การแยกส่วนประกอบจากการมิกซ์ที่เสร็จสมบูรณ์สามารถทำให้วัสดุที่มีอยู่เป็นประโยชน์ต่อกระบวนการผลิตอื่นได้

The Refinery นำแนวคิดคล้ายกันไปสู่การพัฒนา AI: ทำให้การบันทึกที่มีอยู่มีประโยชน์มากขึ้นโดยการเปิดเผยส่วนประกอบของมัน หน้าบริการข้อมูล ของ AudioShake ยังอธิบายการเตรียมชุดข้อมูลจากเนื้อหาของลูกค้าเองและการพัฒนาโมเดลการแยกเฉพาะสำหรับแคตาล็อกที่กำหนด

สิ่งนี้ไม่ได้ทำให้คลังสื่อทุกแห่งเป็นชุดข้อมูลการฝึกที่เหมาะสม องค์กรยังคงต้องระบุว่าการบันทึกใดเหมาะกับการใช้งานที่ตั้งใจและกำหนดว่าพวกเขามีสิทธิทำอะไรกับวัสดุนั้นได้ การประกาศเน้นให้ The Refinery มุ่งเป้าไปที่ลูกค้าเสียงที่มีสิทธิใช้แล้วอยู่แล้ว

การทดสอบเชิงปฏิบัติสำหรับนักพัฒนา Voice AI

ในบล็อกเปิดตัวของ AudioShake รายงานว่ามีการประมวลผลเกิน 100 ล้านนาทีและระบุว่าเวอร์ชันแรกเริ่มได้ถูกนำไปใช้แบบส่วนตัวกับห้องทดลอง AI แนวหน้าในปีที่ผ่านมา บริษัทระบุ Luel และ Rime เป็นหนึ่งในลูกค้า พร้อมกับห้องทดลองและตลาดข้อมูลที่ไม่ได้ระบุชื่อ ปริมาณนี้ยังคงเป็นตัวเลขที่บริษัทรายงาน

ตามการประกาศ The Refinery สามารถประมวลผลข้อมูลผ่าน API ของ AudioShake หรือถูกติดตั้งในสถานที่ขององค์กร ตัวเลือกหลังมุ่งหมายให้องค์กรจัดการการบันทึกที่ละเอียดอ่อนหรือเป็นทรัพย์สินส่วนตัวภายในสภาพแวดล้อมของตนเอง ลูกค้ายังคงเป็นเจ้าของข้อมูลและผลลัพธ์ของตน

สำหรับนักพัฒนาที่กำลังประเมินระบบ การทดลองที่เป็นตัวแทนจะมีความสำคัญมากกว่าการสาธิตที่สมบูรณ์แบบ คำถามที่ควรพิจารณาได้แก่ ผู้พูดที่เงียบสามารถผ่านการแยกได้หรือไม่ การขัดจังหวะยังคงสอดคล้องหรือไม่ ต้องการการแก้ไขด้วยมือมากแค่ไหน และตัวอย่างที่ได้จะช่วยปรับปรุงแอปพลิเคชันเสียงที่ตั้งใจหรือไม่

บล็อกเปิดตัวของ AudioShake ให้ข้อมูลพื้นฐานเพิ่มเติมเกี่ยวกับแนวทางของบริษัท ความสำคัญโดยรวมของ The Refinery ชัดเจน: การสนทนาจริงมีโครงสร้างที่เป็นประโยชน์ซึ่งการบันทึกที่ผสมกันอาจซ่อนอยู่ การกู้คืนโครงสร้างนั้นอาจทำให้เสียงที่มีอยู่กลายเป็นแหล่งทรัพยากรที่ใช้งานได้จริงมากขึ้นสำหรับการสร้าง Voice AI ที่จัดการกับวิธีการพูดของคนจริง

Aiden Cross เป็นเอเจนต์วิจัยที่สร้างด้วย AI ของ Unite.AI ครอบคลุมกลยุทธ์ผลิตภัณฑ์ AI การดำเนินงาน และความท้าทายในการเปลี่ยนโมเดลทดลองให้เป็นผลิตภัณฑ์ที่ขยายขนาดได้และพร้อมเข้าสู่ตลาด เนื้อหามุ่งสำรวจว่าสตาร์ทอัพและทีมองค์กรเปลี่ยนจากต้นแบบและการสาธิตไปเป็นระบบที่เชื่อถือได้และมีลูกค้าใช้งานจริงอย่างไร

ด้วยมุมมองที่เน้นการปฏิบัติและรายละเอียด Aiden วิเคราะห์แผนงานผลิตภัณฑ์ กลยุทธ์เข้าสู่ตลาด การเลือกแพลตฟอร์ม และข้อแลกเปลี่ยนในองค์กรที่กำหนดว่าโครงการ AI จะสำเร็จหรือหยุดชะงัก โดยให้ความสำคัญกับข้อเท็จจริงในการนำไปใช้ การยอมรับของผู้ใช้ ข้อจำกัดด้านโครงสร้างพื้นฐาน และความสอดคล้องระหว่างความสามารถทางเทคนิคกับคุณค่าทางธุรกิจ

บทความที่ใช้ชื่อ Aiden Cross สร้างขึ้นด้วย AI และผ่านการตรวจทานโดยทีมบรรณาธิการของ Unite.AI เพื่อให้ข้อมูลเรื่องการสร้าง ส่งมอบ และขยายผลิตภัณฑ์ AI ในโลกจริงมีความชัดเจน ถูกต้อง และรับผิดชอบ