Model dan platform AI

Peneliti Mengembangkan Metode Baru untuk Mengontrol Pembangkitan Gambar AI

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Peneliti dari Universitas North Carolina State telah mengembangkan metode baru untuk mengontrol pembangkitan gambar artificial intelligence (AI), yang dapat digunakan di bidang seperti kendaraan otonom.

Generasi Gambar Kondisional dan Teknik Lainnya

Generasi gambar kondisional adalah tugas AI yang melibatkan sistem AI membuat gambar berdasarkan set kondisi tertentu, yang dapat diminta oleh pengguna. Teknik yang lebih baru telah mengambil ini lebih jauh dan menggabungkan kondisi untuk tata letak gambar, yang memungkinkan pengguna untuk menentukan jenis objek yang ingin muncul di tempat tertentu pada layar.

Metode baru yang dikembangkan oleh peneliti di universitas ini membangun pada semua teknik ini, dan memungkinkan pengguna untuk memiliki kontrol lebih besar atas gambar sambil mempertahankan karakteristik tertentu di seluruh serangkaian gambar.

Tianfu Wu adalah co-penulis dari makalah penelitian dan asisten profesor teknik komputer di NC State.

“Pendekatan kami sangat dapat dikonfigurasi ulang,” kata Wu. “Seperti pendekatan sebelumnya, milik kami memungkinkan pengguna untuk memiliki sistem menghasilkan gambar berdasarkan set kondisi tertentu. Tetapi milik kami juga memungkinkan Anda untuk mempertahankan gambar itu dan menambahkannya. Misalnya, pengguna bisa memiliki AI membuat adegan gunung. Pengguna kemudian bisa memiliki sistem menambahkan peselancar ke adegan itu.”

Manipulasi Elemen

Dengan metode baru, pengguna juga dapat memungkinkan AI untuk memanipulasi elemen sehingga dapat dikenali sebagai sama sementara masih bergerak atau berubah dengan cara tertentu. Salah satu contoh seperti itu adalah AI membuat serangkaian gambar di mana peselancar berbalik ke arah pengamat sambil bergerak melintasi lanskap.

“Salah satu aplikasi untuk ini adalah untuk membantu robot otonom ‘membayangkan’ apa hasil akhirnya mungkin terlihat sebelum mereka memulai tugas tertentu,” kata Wu. “Anda juga bisa menggunakan sistem untuk menghasilkan gambar untuk pelatihan AI. Jadi, alih-alih mengompilasi gambar dari sumber eksternal, Anda bisa menggunakan sistem ini untuk membuat gambar untuk melatih sistem AI lain.”

Pendekatan baru ini diuji dengan dataset COCO-Stuff dan dataset Visual Genome, dan berdasarkan standar untuk kualitas gambar, itu mengungguli teknik sebelumnya yang paling mutakhir.

“Langkah berikutnya adalah untuk melihat apakah kita dapat memperluas pekerjaan ini ke video dan gambar tiga dimensi,” kata Wu.

Untuk melatih pendekatan baru, peneliti harus mengandalkan stasiun kerja 4-GPU karena daya komputasi yang berat yang diperlukan. Meskipun demikian, menggelar sistem ini masih kurang mahal secara komputasi.

“Kami menemukan bahwa satu GPU memberikan Anda kecepatan hampir waktu nyata,” kata Wu.

“Selain makalah kami, kami telah membuat kode sumber untuk pendekatan ini tersedia di GitHub. Yang dikatakan, kami selalu terbuka untuk berkolaborasi dengan mitra industri.”

Alex McFarland adalah seorang jurnalis dan penulis AI yang menjelajahi perkembangan terbaru dalam kecerdasan buatan. Ia telah berkolaborasi dengan berbagai startup dan publikasi AI di seluruh dunia.