โมเดลและแพลตฟอร์ม AI

นักวิจัยพัฒนาเทคนิคใหม่สำหรับการควบคุมการสร้างภาพ AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

นักวิจัยจากมหาวิทยาลัยแห่งรัฐนอร์ทแคโรไลนาได้พัฒนาเทคนิคใหม่สำหรับการควบคุมการสร้างภาพ AI ซึ่งสามารถใช้ในด้านต่างๆ เช่น ยานพาหนะอัตโนมัติ

การสร้างภาพตามเงื่อนไขและเทคนิคอื่นๆ

การสร้างภาพตามเงื่อนไขเป็นงาน AI ที่เกี่ยวข้องกับการสร้างภาพโดยใช้ระบบ AI ตามเงื่อนไขที่ผู้ใช้กำหนด เทคนิคใหม่ๆ ได้พัฒนาไปสู่การสร้างภาพตามเงื่อนไขและแบบแผนการวางภาพ ซึ่งช่วยให้ผู้ใช้สามารถกำหนดวัตถุและตำแหน่งที่ต้องการบนหน้าจอ

เทคนิคใหม่ที่พัฒนาโดยนักวิจัยจากมหาวิทยาลัยนี้เป็นการสร้างภาพตามเงื่อนไขที่มีการควบคุมมากขึ้น และช่วยให้ผู้ใช้สามารถสร้างภาพที่มีลักษณะเฉพาะตัวและยังคงรักษาลักษณะนั้นไว้ตลอดชุดภาพ

Tianfu Wu เป็นร่วมผู้เขียนของ เอกสารวิจัย และเป็นอาจารย์ผู้ช่วยสาขาวิศวกรรมคอมพิวเตอร์ที่ NC State

“วิธีการของเรามีการปรับเปลี่ยนได้สูง” Wu กล่าว “เช่นเดียวกับวิธีการก่อนหน้านี้ วิธีการของเรายังช่วยให้ผู้ใช้สามารถสร้างภาพตามเงื่อนไขที่กำหนดได้ แต่วิธีการของเรายังช่วยให้ผู้ใช้สามารถสร้างภาพและเพิ่มรายละเอียดลงไปได้ ตัวอย่างเช่น ผู้ใช้สามารถสร้างภาพภูเขาและเพิ่มคนเล่นสกีลงไปในภาพนั้น”

การปรับเปลี่ยนองค์ประกอบ

ด้วยเทคนิคใหม่นี้ ผู้ใช้ยังสามารถปรับเปลี่ยนองค์ประกอบของภาพได้ เพื่อให้สามารถระบุได้ว่าองค์ประกอบนั้นเป็นองค์ประกอบเดียวกัน แต่มีการเปลี่ยนแปลงหรือเคลื่อนไหวในบางวิธี ตัวอย่างเช่น การสร้างภาพชุดของคนเล่นสกีที่กำลังเคลื่อนไหวไปตามภูมิประเทศ

“การประยุกต์ใช้เทคนิคนี้อาจช่วยให้หุ่นยนต์อัตโนมัติสามารถ ‘จินตนาการ’ ถึงผลลัพธ์สุดท้ายก่อนที่จะเริ่มทำงานใดๆ” Wu กล่าว “คุณยังสามารถใช้ระบบนี้เพื่อสร้างภาพสำหรับการฝึกอบรม AI ได้ ดังนั้น คุณไม่ต้องรวบรวมภาพจากแหล่งอื่น แต่สามารถใช้ระบบนี้เพื่อสร้างภาพสำหรับการฝึกอบรม AI อื่นๆ ได้”

เทคนิคใหม่นี้ได้รับการทดสอบกับชุดข้อมูล COCO-Stuff และ Visual Genome และตามมาตรฐานคุณภาพภาพ เทคนิคใหม่นี้มีคุณภาพสูงกว่าวิธีการก่อนหน้านี้

“ขั้นตอนต่อไปของเราคือการขยายงานนี้ไปสู่การสร้างวิดีโอและภาพสามมิติ” Wu กล่าว

ในการฝึกอบรมเทคนิคใหม่นี้ นักวิจัยต้องใช้สถานีงาน 4-GPU เนื่องจากต้องการพลังการคำนวณสูง แต่การนำเทคนิคใหม่นี้ไปใช้นั้นยังคงมีค่าใช้จ่ายในการคำนวณต่ำกว่า

“เราพบว่าหนึ่ง GPU สามารถให้ความเร็วเกือบแบบเรียลไทม์” Wu กล่าว

“นอกเหนือจากเอกสารวิจัยของเราแล้ว เรายังได้เผยแพร่โค้ดต้นฉบับสำหรับเทคนิคใหม่นี้บน GitHub และเรายินดีที่จะร่วมมือกับพันธมิตรในอุตสาหกรรม” Wu กล่าว

Alex McFarland เป็นนักข่าวและนักเขียน AI ที่สำรวจการพัฒนาล่าสุดในด้านปัญญาประดิษฐ์ เขาได้ร่วมงานกับสตาร์ทอัพ AI และสื่อสิ่งพิมพ์ต่างๆ ทั่วโลก