โมเดลและแพลตฟอร์ม AI
AudioShake เปิดตัว The Refinery เพื่อแปลงการสนทนาที่ทับซ้อนให้เป็นข้อมูลการฝึก AI

ผู้คนขัดจังหวะ พวกเขาหัวเราะเหนือประโยคสุดท้ายของคนอื่น เสนอความเห็นชอบอย่างรวดเร็วก่อนผู้พูดจะพูดจบ และยังพูดต่อไปขณะที่ดนตรีหรือเสียงจราจรเติมเต็มพื้นหลัง สำหรับนักพัฒนาเสียง AI ความยุ่งยากในชีวิตประจำวันนี้สร้างปัญหาข้อมูลที่ยาก: การบันทึกอาจมีพฤติกรรมการสนทนาที่โมเดลต้องเรียนรู้อย่างแม่นยำ แต่กลับมาถึงในรูปแบบสตรีมเสียงผสมเดียว
AudioShake กำลังมุ่งเป้าไปที่ช่องว่างนั้นด้วย The Refinery ระบบที่เปิดตัวใหม่ซึ่งแปลงการบันทึกที่มีอยู่ให้เป็นข้อมูลที่มีโครงสร้างและแยกตามผู้พูดสำหรับการฝึก AI แทนที่จะให้ผู้พัฒนาจัดทำการสนทนาใหม่หรือสร้างตัวอย่างสังเคราะห์ บริษัทกำลังเสนอวิธีการสกัดเสียงของแต่ละบุคคลและส่วนประกอบเสียงอื่น ๆ จากการบันทึกที่องค์กรมีสิทธิ์ใช้แล้ว
การประกาศนี้ทำให้การแยกเสียงอยู่ใกล้กับศูนย์กลางของกระบวนการพัฒนาเสียง AI มากขึ้น คำถามที่น่าสนใจคือชุดข้อมูลจะสามารถรักษาเวลาและความซับซ้อนของการสนทนาจริงได้ขณะทำให้การทำป้ายกำกับ การตรวจสอบ และการใช้งานง่ายขึ้นหรือไม่
การแปลงการบันทึกที่เสร็จสมบูรณ์ให้เป็นแทร็กผู้พูดแยกกัน
ตามการประกาศของ AudioShake The Refinery สามารถแยกการสนทนาเป็นแทร็กผู้พูดแต่ละคนพร้อมกับแยกบทสนทนาจากดนตรีและเสียงพื้นหลัง มันทำงานโดยตรงจากไฟล์เสียงที่บันทึกไว้โดยไม่ต้องอาศัยเซสชันการบันทึกต้นฉบับหรือสเตมที่บันทึกแยกต่างหาก เมื่อสองคนพูดพร้อมกัน เป้าหมายคือการกู้คืนเสียงของพวกเขาเป็นรายบุคคลพร้อมคงการทับซ้อนของการแลกเปลี่ยน
สิ่งนี้แตกต่างจากการทำความสะอาดการบันทึกจนเหลือเสียงเด่นหนึ่งเสียงเท่านั้น การขัดจังหวะอาจเป็นข้อมูลการฝึกที่สำคัญ ไม่ใช่เสียงรบกวนที่ไม่ต้องการ การยอมรับสั้น ๆ สามารถช่วยสื่อว่าผู้ฟังกำลังฟัง เห็นด้วย หรือกำลังเตรียมที่จะพูดต่อ การทำให้การแลกเปลี่ยนเป็นสตรีมเดียวอาจทำให้พฤติกรรมเหล่านั้นยากต่อการเชื่อมโยงกับผู้พูดที่ถูกต้อง
วิธีที่เป็นประโยชน์ในการคิดถึงผลลัพธ์คือเป็นชุดของแทร็กที่จัดเรียงกัน แทร็กหนึ่งบรรจุเสียงของผู้พูดคนหนึ่ง แทร็กอีกอันบรรจุเสียงของผู้พูดคนที่สอง และเวลาแบ่งปันของพวกเขาเปิดเผยช่วงที่ทับซ้อนกัน การบันทึกจึงง่ายต่อการตรวจสอบโดยไม่ต้องเขียนใหม่ทั้งหมดของการสนทนา
AudioShake กล่าวว่า ระบบไม่ได้สร้างหรือสร้างเสียงใหม่: เสียงที่แยกออกและความถี่ที่สอดคล้องมาจากการบันทึกต้นฉบับ ความแตกต่างนี้สำคัญสำหรับนักพัฒนาที่กำลังมองหาตัวอย่างของพฤติกรรมการสนทนาจริง การประมวลผลมีจุดมุ่งหมายเพื่อเปิดเผยสิ่งที่บันทึกไว้ ไม่ใช่สร้างการแสดงใหม่
ทำไมการแยกผู้พูดจึงเกินกว่าการระบุผู้พูด (Diarization)
AudioShake’s Multi-Speaker Separation หน้าผลิตภัณฑ์ อธิบายการผสมผสานระหว่างการแยกผู้พูดและการระบุผู้พูด (diarization) การระบุผู้พูดระบุว่าเมื่อใดผู้พูดต่างกันกำลังพูด; การแยกสร้างสัญญาณเสียงแยกส่วนแต่ละคน การทำป้ายกำกับช่วงเวลาว่ามีผู้พูดสองคนไม่ได้ให้ผู้พัฒนามีแทร็กเสียงที่ใช้ได้อิสระสองแทร็กโดยตรง
ผลิตภัณฑ์ยังแยกแยะความมั่นใจในการกำหนดเสียงให้กับผู้พูดที่ถูกต้องจากความมั่นใจในคุณภาพของการแยก สิ่งเหล่านี้แก้ไขปัญหาที่แตกต่างกัน: เสียงอาจถูกจัดสรรอย่างถูกต้องแต่ยังคงมีเสียงของบุคคลอื่นอยู่ AudioShake อธิบายระบบพื้นฐานว่าเป็นระบบเชิงเสียง ไม่ได้พึ่งพาโมเดลภาษา และรองรับการบันทึกที่มีอัตราการสุ่มตัวอย่างและสภาวะการจับที่แตกต่างกัน
สำหรับสายการฝึก ระบบการแยกฟังก์ชันเหล่านี้สามารถทำให้การตรวจสอบแม่นยำยิ่งขึ้น ทีมอาจต้องตรวจสอบตัวตนของผู้พูด ความชัดเจนของแทร็กเฉพาะ หรือความแม่นยำของข้อความที่สร้างขึ้นภายหลัง การพิจารณาทั้งสามเป็นความสำเร็จหรือความล้มเหลวเดียวกันจะทำให้ไม่ชัดเจนว่าข้อผิดพลาดเข้าสู่ชุดข้อมูลที่ใด
คะแนนคุณภาพเป็นส่วนหนึ่งของสายข้อมูล
The Refinery ให้คะแนนผลลัพธ์ตามคุณภาพและความมั่นใจ ทำให้องค์กรสามารถจัดเรียงคอลเลกชันขนาดใหญ่เป็นวัสดุที่ใช้ได้, สามารถแก้ไขได้, หรือไม่เหมาะสม นี่เป็นคุณสมบัติการดำเนินงานที่สำคัญ ในระดับของคลังเสียงที่มีขนาดใหญ่ การฟังทุกนาทีด้วยตนเองกลายเป็นคอขวดแม้การแยกเองจะเป็นอัตโนมัติ
คะแนนเหล่านี้สามารถช่วยชี้นำความสนใจของมนุษย์ไปยังส่วนที่น่าสงสัย ตัวอย่างเช่น ทีมชุดข้อมูลอาจให้ความสำคัญกับการสนทนาที่แออัดซึ่งผู้พูดที่เงียบทำให้แยกแยะได้ยาก แทนที่จะตรวจสอบการบันทึกคนเดียวที่ไม่มีความซับซ้อนด้วยความเข้มข้นเท่าเดิม
ยังมีการแลกเปลี่ยนที่ต้องจัดการ การเลือกเฉพาะคลิปที่ง่ายและชัดเจนที่สุดอาจทำให้ชุดข้อมูลพลาดสถานการณ์ที่ยากซึ่งโครงการตั้งใจจะจับ ในการประเมินของเรา ทีมที่ใช้สายงานแบบนี้ควรประเมินทั้งคุณภาพของผลลัพธ์และความหลากหลายของการสนทนาที่คงอยู่หลังการกรอง การรักษาตัวอย่างที่ท้าทายด้วยการตรวจสอบอย่างรอบคอบอาจมีประโยชน์มากกว่าการเพิ่มคะแนนความมั่นใจรวมเดียว
ดังนั้นความพร้อมสำหรับการฝึกจึงเกี่ยวข้องมากกว่าการสร้างไฟล์แยก นักพัฒนายังต้องกำหนดว่าแทร็ก, ข้อความถอดความ, เวลา, ป้ายกำกับผู้พูด, และเมตาดาต้าคุณภาพเข้ากับเป้าหมายการเรียนรู้เฉพาะของตนอย่างไร
สิ่งที่ Benchmark ของ AudioShake แสดงให้เห็น — และขีดจำกัดของมัน
ในการประเมินเชิงเทคนิค Multi-Speaker 2.0 ของ AudioShake รายงานอัตราความผิดพลาดของคำแบบต่อเนื่องขั้นต่ำ‑permutation ที่ 9.17% บน LibriCSS เมื่อเทียบกับ 37.75% สำหรับ checkpoint MERL TF‑Locoformer ที่ทดสอบ ทั้งสองถูกประเมินผ่านไพป์ไลน์การถอดข้อความ Whisper large‑v3 เดียวกัน อัตราความผิดพลาดที่ต่ำกว่าแสดงถึงข้อผิดพลาดในการถอดข้อความน้อยลงภายใต้การประเมินนั้น
การระบุคุณสมบัตินี้สำคัญ: checkpoint พื้นฐานถูกทดสอบนอกโดเมนการฝึกของมัน AudioShake ชี้แจงอย่างชัดเจนว่าการเปรียบเทียบนี้เป็นการเปรียบเทียบแบบพร้อมใช้ ไม่ใช่หลักฐานว่าระบบสถาปัตยกรรมหนึ่งเหนือกว่าโดยธรรมชาติภายใต้เงื่อนไขการฝึกที่เทียบกัน การประเมินของบริษัทยังระบุว่าความแม่นยำยิ่งรักษาได้ยากเมื่อการทับซ้อนต่อเนื่องและจำนวนผู้พูดเพิ่มขึ้น
นี่เป็นผลลัพธ์ที่บริษัทรายงาน ไม่ใช่การประเมินอิสระของการใช้งาน Refinery ทุกกรณี ผลลัพธ์เหล่านี้สนับสนุนการทดสอบเทคโนโลยีบนเสียงตัวอย่างที่เป็นตัวแทน มากกว่าการสันนิษฐานว่าการปรับปรุงตามหัวข้อข่าวจะถ่ายทอดโดยไม่เปลี่ยนแปลงไปยังชุดข้อมูลอื่น
คุณภาพการแยกและประสิทธิภาพของโมเดลต่อไปเป็นผลลัพธ์ที่แตกต่างกันเช่นกัน คอร์ปัสการฝึกที่สะอาดกว่าอาจมีคุณค่า แต่การเปิดตัวไม่ได้ระบุว่ารุ่นสนทนาที่เฉพาะเจาะจงจะพัฒนาขึ้นเท่าใดหลังจากเรียนรู้จากมัน สิ่งนี้ต้องการการทดลองแยกต่างหากโดยกำหนดแอปพลิเคชันและเงื่อนไขการประเมินที่ตั้งใจไว้
จากกระบวนการทำงานสื่อสู่โครงสร้างพื้นฐานข้อมูล AI
AudioShake นำประสบการณ์จากการผลิตเพลงและสื่อมาสู่การทำงาน เว็บไซต์บริษัท ของ AudioShake อธิบายการแยกเสียงสำหรับงานต่าง ๆ รวมถึงการมิกซ์, การแปลตำแหน่ง, การวิเคราะห์เสียง, และการตัดต่อภาพและเสียง พร้อมระบุลูกค้าเช่น ESPN, Universal Music Group, และ Warner Bros. Studios ในสภาพแวดล้อมเหล่านั้น การแยกส่วนประกอบจากการมิกซ์ที่เสร็จสมบูรณ์สามารถทำให้วัสดุที่มีอยู่เป็นประโยชน์ต่อกระบวนการผลิตอื่นได้
The Refinery นำแนวคิดคล้ายกันไปสู่การพัฒนา AI: ทำให้การบันทึกที่มีอยู่มีประโยชน์มากขึ้นโดยการเปิดเผยส่วนประกอบของมัน หน้าบริการข้อมูล ของ AudioShake ยังอธิบายการเตรียมชุดข้อมูลจากเนื้อหาของลูกค้าเองและการพัฒนาโมเดลการแยกเฉพาะสำหรับแคตาล็อกที่กำหนด
สิ่งนี้ไม่ได้ทำให้คลังสื่อทุกแห่งเป็นชุดข้อมูลการฝึกที่เหมาะสม องค์กรยังคงต้องระบุว่าการบันทึกใดเหมาะกับการใช้งานที่ตั้งใจและกำหนดว่าพวกเขามีสิทธิทำอะไรกับวัสดุนั้นได้ การประกาศเน้นให้ The Refinery มุ่งเป้าไปที่ลูกค้าเสียงที่มีสิทธิใช้แล้วอยู่แล้ว
การทดสอบเชิงปฏิบัติสำหรับนักพัฒนา Voice AI
ในบล็อกเปิดตัวของ AudioShake รายงานว่ามีการประมวลผลเกิน 100 ล้านนาทีและระบุว่าเวอร์ชันแรกเริ่มได้ถูกนำไปใช้แบบส่วนตัวกับห้องทดลอง AI แนวหน้าในปีที่ผ่านมา บริษัทระบุ Luel และ Rime เป็นหนึ่งในลูกค้า พร้อมกับห้องทดลองและตลาดข้อมูลที่ไม่ได้ระบุชื่อ ปริมาณนี้ยังคงเป็นตัวเลขที่บริษัทรายงาน
ตามการประกาศ The Refinery สามารถประมวลผลข้อมูลผ่าน API ของ AudioShake หรือถูกติดตั้งในสถานที่ขององค์กร ตัวเลือกหลังมุ่งหมายให้องค์กรจัดการการบันทึกที่ละเอียดอ่อนหรือเป็นทรัพย์สินส่วนตัวภายในสภาพแวดล้อมของตนเอง ลูกค้ายังคงเป็นเจ้าของข้อมูลและผลลัพธ์ของตน
สำหรับนักพัฒนาที่กำลังประเมินระบบ การทดลองที่เป็นตัวแทนจะมีความสำคัญมากกว่าการสาธิตที่สมบูรณ์แบบ คำถามที่ควรพิจารณาได้แก่ ผู้พูดที่เงียบสามารถผ่านการแยกได้หรือไม่ การขัดจังหวะยังคงสอดคล้องหรือไม่ ต้องการการแก้ไขด้วยมือมากแค่ไหน และตัวอย่างที่ได้จะช่วยปรับปรุงแอปพลิเคชันเสียงที่ตั้งใจหรือไม่
บล็อกเปิดตัวของ AudioShake ให้ข้อมูลพื้นฐานเพิ่มเติมเกี่ยวกับแนวทางของบริษัท ความสำคัญโดยรวมของ The Refinery ชัดเจน: การสนทนาจริงมีโครงสร้างที่เป็นประโยชน์ซึ่งการบันทึกที่ผสมกันอาจซ่อนอยู่ การกู้คืนโครงสร้างนั้นอาจทำให้เสียงที่มีอยู่กลายเป็นแหล่งทรัพยากรที่ใช้งานได้จริงมากขึ้นสำหรับการสร้าง Voice AI ที่จัดการกับวิธีการพูดของคนจริง












