AGI dan AI masa depan

Pembangkit Video AI: Menjelajahi Model Sora yang Revolusioner dari OpenAI

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

OpenAI meluncurkan ciptaan AI terbarunya – Sora, sebuah pembangkit video teks-ke-video revolusioner yang mampu menghasilkan video beresolusi tinggi, koheren, dan memiliki panjang hingga 1 menit dari prompt teks sederhana. Sora mewakili lompatan besar dalam AI pembangkit video, dengan kemampuan yang jauh melampaui model sebelumnya.

Dalam posting ini, kami akan memberikan penjelasan teknis yang komprehensif tentang Sora – bagaimana ia bekerja di balik layar, teknik-teknik baru yang digunakan OpenAI untuk mencapai kemampuan pembangkit video yang luar biasa, kekuatan dan keterbatasan saat ini, serta potensi besar yang dimiliki Sora untuk masa depan kreativitas AI.

Ringkasan Sora

Pada tingkat yang lebih tinggi, Sora mengambil prompt teks sebagai input (misalnya “dua anjing bermain di lapangan”) dan menghasilkan video output yang sesuai dengan gambar, gerakan, dan audio yang realistis.

Beberapa kemampuan kunci Sora termasuk:

  • Menghasilkan video hingga 60 detik panjang dengan resolusi tinggi (1080p atau lebih tinggi)
  • Menghasilkan video yang koheren dan memiliki kualitas tinggi dengan objek, tekstur, dan gerakan yang konsisten
  • Mendukung berbagai gaya video, rasio aspek, dan resolusi
  • Mengkondisikan gambar dan video untuk memperpanjang, mengedit, atau beralih di antara mereka
  • Menampilkan kemampuan simulasi yang muncul seperti konsistensi 3D dan kekal objek jangka panjang

Di balik layar, Sora menggabungkan dan menskalakan dua inovasi AI kunci – model difusi dan transformer – untuk mencapai kemampuan pembangkit video yang belum pernah terjadi sebelumnya.

Dasar Teknis Sora

Sora dibangun atas dua teknik AI yang revolusioner yang telah menunjukkan kesuksesan besar dalam beberapa tahun terakhir – model difusi dalam dan transformer:

Model Difusi

Model difusi adalah kelas model generatif dalam yang dapat menghasilkan gambar dan video sintetis yang sangat realistis. Mereka bekerja dengan mengambil data pelatihan yang nyata, menambahkan noise untuk merusaknya, dan kemudian melatih jaringan saraf untuk menghilangkan noise tersebut dalam langkah-langkah kecil untuk memulihkan data asli. Ini melatih model untuk menghasilkan sampel yang memiliki kualitas tinggi dan beragam yang menangkap pola dan detail data visual dunia nyata.

Sora menggunakan jenis model difusi yang disebut denoising diffusion probabilistic model (DDPM). DDPMs memecahkan proses pembangkitan gambar/video menjadi langkah-langkah kecil denoising, membuatnya lebih mudah untuk melatih model untuk membalik proses difusi dan menghasilkan sampel yang jelas.

Secara khusus, Sora menggunakan varian video dari DDPM yang disebut DVD-DDPM yang dirancang untuk memodelkan video langsung di domain waktu sambil mencapai konsistensi temporal yang kuat di seluruh bingkai. Ini adalah salah satu kunci kemampuan Sora untuk menghasilkan video yang koheren dan memiliki kualitas tinggi.

Transformer

Transformer adalah jenis arsitektur jaringan saraf yang revolusioner yang telah mendominasi pemrosesan bahasa alami dalam beberapa tahun terakhir. Transformer memproses data secara paralel di seluruh blok perhatian, memungkinkan mereka untuk memodelkan ketergantungan jangka panjang yang kompleks dalam urutan.

Sora menyesuaikan transformer untuk bekerja pada data visual dengan memasukkan patch video yang di-tokenisasi sebagai gantinya teks token. Ini memungkinkan model untuk memahami hubungan spasial dan temporal di seluruh urutan video. Arsitektur transformer Sora juga memungkinkan kohesi jangka panjang, kekal objek, dan kemampuan simulasi yang muncul lainnya.

Dengan menggabungkan dua teknik ini – menggunakan DDPM untuk sintesis video beresolusi tinggi dan transformer untuk pemahaman global dan kohesi – Sora mendorong batas kemampuan AI pembangkit video.

Keterbatasan dan Tantangan Saat Ini

Meskipun sangat kuat, Sora masih memiliki beberapa keterbatasan kunci:

  • Kurangnya pemahaman fisik – Sora tidak memiliki pemahaman yang kuat tentang fisika dan sebab-akibat. Misalnya, objek yang rusak mungkin “sembuh” selama video.
  • Inkonsistensi pada durasi panjang – Artefak visual dan inkonsistensi dapat menumpuk dalam sampel yang lebih panjang dari 1 menit. Mempertahankan kohesi yang sempurna untuk video yang sangat panjang masih menjadi tantangan terbuka.
  • Kerusakan objek yang sporadis – Sora terkadang menghasilkan video di mana objek bergeser lokasi secara tidak wajar atau muncul/menghilang dari bingkai ke bingkai.
  • Kesulitan dengan prompt yang tidak biasa – Prompt yang sangat baru dan jauh di luar distribusi pelatihan Sora dapat menghasilkan sampel yang berkualitas rendah. Kemampuan Sora paling kuat dekat dengan data pelatihannya.

Penskalaan lebih lanjut dari model, data pelatihan, dan teknik baru akan diperlukan untuk mengatasi keterbatasan ini. Pembangkit video AI masih memiliki jalan panjang di depan.

Pengembangan yang Bertanggung Jawab dari AI Pembangkit Video

Seperti halnya teknologi yang berkembang pesat, ada risiko potensial yang perlu dipertimbangkan bersama dengan manfaat:

  • Informasi sintetis – Sora membuat pembuatan video manipulatif dan palsu lebih mudah daripada sebelumnya. Pengamanan akan diperlukan untuk mendeteksi video yang dihasilkan dan membatasi penyalahgunaan yang merugikan.
  • Bias data – Model seperti Sora mencerminkan bias dan keterbatasan data pelatihan, yang perlu beragam dan representatif.
  • Konten yang merugikan – Tanpa kontrol yang tepat, AI teks-ke-video bisa menghasilkan konten yang kekerasan, berbahaya, atau tidak etis. Kebijakan moderasi konten yang bijak diperlukan.
  • Keprihatinan hak cipta – Pelatihan pada data berhak cipta tanpa izin mengangkat masalah hukum tentang karya turunan. Lisensi data perlu dipertimbangkan dengan hati-hati.

OpenAI perlu sangat berhati-hati dalam menavigasi masalah-masalah ini ketika akhirnya menerapkan Sora secara publik. Secara keseluruhan, digunakan secara bertanggung jawab, Sora mewakili alat yang sangat kuat untuk kreativitas, visualisasi, hiburan, dan banyak lagi.

Masa Depan AI Pembangkit Video

Sora menunjukkan bahwa kemajuan luar biasa dalam AI pembangkit video ada di cakrawala. Berikut beberapa arah menarik yang teknologi ini bisa ambil saat terus berkembang pesat:

  • Sampel dengan durasi yang lebih panjang – Model mungkin segera dapat menghasilkan jam video bukan menit sambil mempertahankan kohesi. Ini memperluas aplikasi yang mungkin secara besar-besaran.
  • Kontrol spasial penuh – Di luar teks dan gambar, pengguna bisa memanipulasi ruang laten video secara langsung, memungkinkan kemampuan editing video yang kuat.
  • Simulasi yang terkendali – Model seperti Sora bisa memungkinkan manipulasi dunia yang disimulasikan melalui prompt teks dan interaksi.
  • Video yang dipersonalisasi – AI bisa menghasilkan konten video yang unik dan disesuaikan untuk pemirsa atau konteks individu.
  • Fusi multimodal – Integrasi yang lebih erat dari modalitas seperti bahasa, audio, dan video bisa memungkinkan pengalaman multimedia interaktif yang sangat kuat.
  • Domain yang dikhususkan – Model video domain-spesifik bisa unggul dalam aplikasi yang disesuaikan seperti pemrosesan citra medis, pemantauan industri, mesin game, dan banyak lagi.

Kesimpulan

Dengan Sora, OpenAI telah membuat lompatan besar dalam AI pembangkit video, menunjukkan kemampuan yang tampaknya beberapa dekade di depan hanya tahun lalu. Meskipun masih ada pekerjaan yang harus dilakukan untuk mengatasi tantangan terbuka, kekuatan Sora menunjukkan potensi besar teknologi ini untuk suatu hari nanti meniru dan memperluas imajinasi visual manusia dalam skala besar.

Model lain dari DeepMind, Google (GOOGL ), Meta, dan banyak lagi akan terus mendorong batas dalam ruang ini. Masa depan AI yang dihasilkan video terlihat sangat cerah. Kami dapat mengharapkan teknologi ini untuk memperluas kemungkinan kreatif dan menemukan aplikasi yang sangat berguna dalam tahun-tahun mendatang, sambil memerlukan tata kelola yang bijak untuk memitigasi risiko.

Ini adalah waktu yang menyenangkan bagi pengembang AI dan praktisi karena model pembangkit video seperti Sora membuka cakrawala baru untuk apa yang mungkin. Dampak kemajuan ini mungkin memiliki pada media, hiburan, simulasi, visualisasi, dan banyak lagi baru saja mulai terungkap.

Saya telah menghabiskan lima tahun terakhir dengan membenamkan diri dalam dunia Machine Learning dan Deep Learning yang menarik. Minat dan keahlian saya telah memimpin saya untuk berkontribusi pada lebih dari 50 proyek rekayasa perangkat lunak yang beragam, dengan fokus khusus pada AI/ML. Rasa ingin tahu saya yang terus-menerus juga telah menarik saya ke arah Natural Language Processing, sebuah bidang yang saya ingin jelajahi lebih lanjut.