โมเดลและแพลตฟอร์ม AI

Meta เปิดตัวโมเดล Speech Generation Voicebox

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

เมต้าได้ทำการก้าวสำคัญในด้านปัญญาประดิษฐ์สำหรับการพูด โดยเปิดตัวโมเดล AI ที่มีชื่อว่า Voicebox นี่เป็นก้าวสำคัญในด้านการวิจัย AI ที่มีศักยภาพในการนำไปใช้ในหลายๆ ด้าน

Voicebox โมเดล AI ของเมต้า เป็นการพัฒนาที่สำคัญในด้านการสร้างเสียงพูด โมเดลนี้มีความสามารถในการทำงานที่ไม่ได้รับการฝึกฝนมาโดยตรง โดยใช้การเรียนรู้ในบริบท ทำให้ Voicebox สามารถสร้างคลิปเสียงที่มีคุณภาพสูงและแก้ไขเสียงที่บันทึกไว้แล้ว เช่น การลบเสียงรถยนต์หรือเสียงสุนัขออกจากเสียง โดยที่ยังคงรักษาเนื้อหาและรูปแบบของเสียงไว้ โมเดลนี้ยังสามารถสร้างเสียงพูดในหลายๆ ภาษาได้

การเกิดขึ้นของโมเดล AI ที่มีหลายหน้าที่ như Voicebox ชี้ให้เห็นถึงอนาคตที่น่าตื่นเต้น โมเดลเหล่านี้สามารถใช้เพื่อให้เสียงที่ดึงดูดใจกับตัวละครเสมือนและตัวละครที่ไม่ใช่ผู้เล่นในเมต้าเวอร์ส ให้คนตาบอดได้ยินข้อความที่เขียนโดยเพื่อนๆ ที่อ่านโดย AI ในเสียงของพวกเขา และให้เครื่องมือที่สร้างสรรค์สำหรับผู้สร้างในการสร้างและแก้ไขแทร็กเสียงสำหรับวิดีโอ เป็นต้น

ความสามารถที่หลากหลายของ Voicebox

Voicebox มีความสามารถที่หลากหลาย ซึ่งแสดงให้เห็นถึงความเป็นนวัตกรรมในด้านเสียงและ AI:

  • สังเคราะห์เสียงพูดในบริบท: Voicebox สามารถใช้เสียงตัวอย่างที่สั้นเพียง 2 วินาทีเพื่อสร้างเสียงพูดที่มีรูปแบบคล้ายกัน
  • การแก้ไขและลดเสียงรบกวน: Voicebox สามารถสร้างเสียงที่ถูกตัดขาดหรือเสียงที่พูดผิดโดยไม่ต้องบันทึกเสียงใหม่ทั้งหมด ในที่สุดก็สามารถแก้ไขเสียงได้เหมือนกับการใช้เครื่องลบ
  • การถ่ายโอนรูปแบบข้ามภาษา: Voicebox สามารถสร้างเสียงพูดภาษาใดๆ จากเสียงตัวอย่างที่มีภาษาต่างกัน ซึ่งสามารถช่วยให้ผู้คนสื่อสารกันอย่างแท้จริงแม้ว่าจะไม่มีภาษาร่วมกันก็ตาม
  • การสร้างเสียงที่หลากหลาย: เนื่องจากการเรียนรู้ข้อมูลที่หลากหลาย Voicebox จึงสามารถสร้างเสียงพูดที่มีหลายรูปแบบในหลายๆ ภาษา

อนาคตที่มีแนวโน้มสำหรับ AI ที่สร้างสรรค์

การเปิดตัว Voicebox เป็นก้าวสำคัญในด้านการวิจัย AI ที่สร้างสรรค์ การพัฒนานี้แสดงให้เห็นว่า AI กำลังพัฒนาและเข้าใกล้การทำความเข้าใจและจำลองรูปแบบของการสื่อสารของมนุษย์ ความเป็นไปได้ในการใช้ Voicebox นั้นกว้างขวาง ตั้งแต่การปรับปรุงการสื่อสารเสมือนจริงไปจนถึงการให้เครื่องมือแก้ไขเสียงที่ซับซ้อนมากขึ้นสำหรับผู้สร้าง และการทำลายกำแพงภาษา

อย่างไรก็ตาม ในขณะเดียวกันก็จำเป็นต้องพิจารณาผลกระทบทางจริยธรรมของเทคโนโลยีนี้ ความสามารถของโมเดล AI เช่น Voicebox ในการลอกเลียนเสียงบุคคลทำให้เกิดคำถามเกี่ยวกับการยินยอมและความเป็นส่วนตัว จะมีการควบคุมเทคโนโลยีเหล่านี้อย่างไรเพื่อให้แน่ใจว่ามีการใช้อย่างรับผิดชอบ? จะป้องกันไม่ให้เสียงของบุคคลถูกใช้ในทางที่ผิดหรือใช้ไม่เหมาะสมได้อย่างไร? เหล่านี้เป็นความท้าทายที่บริษัทอย่าง Meta จะต้องเผชิญเมื่อ AI ที่สร้างสรรค์ยังคงพัฒนา

Voicebox เป็นเพียงจุดเริ่มต้น เมื่อนักวิจัยคนอื่นๆ พัฒนาต่อยอดจากงานของ Meta อนาคตของการวิจัยเสียงและ AI ที่สร้างสรรค์จะมีศักยภาพและความหวังมาก เรากำลังยืนอยู่ที่จุดเริ่มต้นของยุคใหม่ในด้านปัญญาประดิษฐ์ ซึ่งยังคงทำให้เส้นแบ่งระหว่างดิจิทัลและกายภาพพร่ามัว

Alex McFarland เป็นนักข่าวและนักเขียน AI ที่สำรวจการพัฒนาล่าสุดในด้านปัญญาประดิษฐ์ เขาได้ร่วมงานกับสตาร์ทอัพ AI และสื่อสิ่งพิมพ์ต่างๆ ทั่วโลก