AGI dan AI masa depan

Lanskap Evolusi AI Generatif: Survei Mixture of Experts, Multimodalitas, dan Pencarian AGI

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Bidang kecerdasan buatan (AI) telah mengalami pertumbuhan luar biasa pada tahun 2023. AI generatif, yang berfokus pada menciptakan konten realistis seperti gambar, audio, video, dan teks, telah berada di garis depan kemajuan ini. Model seperti DALL-E 3, Stable Diffusion, dan ChatGPT telah menunjukkan kemampuan kreatif baru, tetapi juga menimbulkan kekhawatiran seputar etika, bias, dan penyalahgunaan.

Karena AI generatif terus berkembang dengan cepat, campuran ahli (MoE), pembelajaran multimodal, dan aspirasi menuju kecerdasan buatan umum (AGI) tampaknya akan membentuk frontir penelitian dan aplikasi berikutnya. Artikel ini akan memberikan survei komprehensif tentang keadaan saat ini dan trajektori masa depan AI generatif, menganalisis bagaimana inovasi seperti Gemini Google (GOOGL ) dan proyek yang diantisipasi seperti Q* OpenAI mengubah lanskap. Ini akan mengeksaminasi implikasi dunia nyata di bidang kesehatan, keuangan, pendidikan, dan domain lainnya, sambil menyoroti tantangan yang muncul seputar kualitas penelitian dan keselarasan AI dengan nilai-nilai manusia.

Pengeluaran ChatGPT pada akhir tahun 2022 secara khusus memicu kembali kegembiraan dan kekhawatiran seputar AI, dari kemampuan bahasa alaminya yang mengesankan hingga potensinya untuk menyebarkan informasi yang salah. Sementara itu, model Gemini Google menunjukkan kemampuan percakapan yang jauh lebih baik daripada pendahulunya seperti LaMDA melalui kemajuan seperti perhatian spike-and-slab. Proyek yang dirumorkan seperti Q* OpenAI mengisyaratkan menggabungkan AI percakapan dengan pembelajaran penguatan.

Inovasi ini menandakan prioritas yang bergeser menuju model generatif multimodal dan serbaguna. Persaingan juga terus memanas antara perusahaan seperti Google, Meta, Anthropic, dan Cohere yang berlomba untuk mendorong batas-batas pengembangan AI yang bertanggung jawab.

Evolusi Penelitian AI

Karena kemampuan telah tumbuh, tren penelitian dan prioritas juga telah bergeser, sering kali sesuai dengan tonggak teknologi. Munculnya pembelajaran dalam telah membangkitkan kembali minat pada jaringan saraf, sementara pemrosesan bahasa alami melonjak dengan model seperti ChatGPT. Sementara itu, perhatian pada etika tetap sebagai prioritas konstan di tengah kemajuan yang cepat.

Repositori pracetak seperti arXiv telah mengalami pertumbuhan eksponensial dalam pengajuan AI, memungkinkan penyebaran yang lebih cepat tetapi mengurangi tinjauan sejawat dan meningkatkan risiko kesalahan atau bias yang tidak tercek. Interaksi antara penelitian dan dampak dunia nyata tetap kompleks, memerlukan upaya yang lebih terkoordinasi untuk mengarahkan kemajuan.

MoE dan Sistem Multimodal – Gelombang Berikutnya AI Generatif

Untuk memungkinkan AI yang lebih serbaguna dan canggih di berbagai aplikasi, dua pendekatan yang mendapatkan popularitas adalah campuran ahli (MoE) dan pembelajaran multimodal.

Arsitektur MoE menggabungkan beberapa jaringan saraf “ahli” yang dioptimalkan untuk tugas atau jenis data yang berbeda. Gemini Google menggunakan MoE untuk menguasai percakapan panjang dan menjawab pertanyaan singkat. MoE memungkinkan menangani berbagai input tanpa membesarkan ukuran model.

Sistem multimodal seperti Gemini Google menetapkan standar baru dengan memproses modalitas yang bervariasi di luar teks. Namun, mewujudkan potensi AI multimodal memerlukan mengatasi hambatan teknis dan tantangan etika.

Gemini: Mendefinisikan Ulang Standar dalam Multimodalitas

Gemini adalah AI percakapan multimodal, yang dirancang untuk memahami koneksi antara teks, gambar, audio, dan video. Struktur pengkode ganda, perhatian antar modal, dan dekoding multimodal memungkinkan pemahaman kontekstual yang canggih. Gemini diyakini melampaui sistem pengkode tunggal dalam mengasosiasikan konsep teks dengan wilayah visual. Dengan mengintegrasikan pengetahuan terstruktur dan pelatihan khusus, Gemini melampaui pendahulunya seperti GPT-3 dan GPT-4 dalam:

  • Lebar modalitas yang ditangani, termasuk audio dan video
  • Kinerja pada standar seperti pemahaman bahasa multitugas
  • Pengembangan kode di berbagai bahasa pemrograman
  • Skalabilitas melalui versi yang disesuaikan seperti Gemini Ultra dan Nano
  • Transparansi melalui justifikasi untuk output

Hambatan Teknis dalam Sistem Multimodal

Mewujudkan AI multimodal yang kuat memerlukan memecahkan masalah dalam keanekaragaman data, skalabilitas, evaluasi, dan interpretasi. Dataset yang tidak seimbang dan inkonsistensi anotasi menyebabkan bias. Pengolahan beberapa aliran data membebani sumber daya komputasi, memerlukan arsitektur model yang dioptimalkan. Kemajuan dalam mekanisme perhatian dan algoritma diperlukan untuk mengintegrasikan input multimodal yang kontradiktif. Masalah skalabilitas tetap ada karena overhead komputasi yang luas. Mengembangkan metrik evaluasi melalui standar komprehensif sangat penting. Meningkatkan kepercayaan pengguna melalui AI yang dapat dijelaskan juga tetap penting. Mengatasi hambatan teknis ini akan menjadi kunci untuk membuka kemampuan AI multimodal.

Teknik pembelajaran lanjutan seperti pembelajaran mandiri, pembelajaran meta, dan penyesuaian halus berada di garis depan penelitian AI, meningkatkan otonomi, efisiensi, dan keserbagunaan model AI.

Pembelajaran Mandiri: Otonomi dalam Pelatihan Model

Pembelajaran mandiri menekankan pelatihan model otonom menggunakan data yang tidak dilabeli, sehingga mengurangi upaya pelabelan manual dan bias model. Ini mengintegrasikan model generatif seperti autoencoder dan GAN untuk pembelajaran distribusi data dan rekonstruksi input, dan menggunakan metode kontrastif seperti SimCLR dan MoCo untuk membedakan antara pasangan sampel positif dan negatif. Strategi prediksi diri, yang terinspirasi oleh NLP dan ditingkatkan oleh Transformer Visi terbaru, memainkan peran signifikan dalam pembelajaran mandiri, menunjukkan potensinya dalam meningkatkan kemampuan pelatihan otonom AI.

Pembelajaran Meta

Pembelajaran meta, atau ‘pembelajaran untuk belajar’, berfokus pada melengkapi model AI dengan kemampuan untuk beradaptasi cepat dengan tugas baru menggunakan sampel data terbatas. Teknik ini kritis dalam situasi dengan ketersediaan data yang terbatas, memastikan model dapat dengan cepat beradaptasi dan berkinerja di berbagai tugas. Ini menekankan generalisasi few-shot, memungkinkan AI untuk menangani berbagai tugas dengan data minimal, menekankan pentingnya dalam mengembangkan sistem AI yang serbaguna dan adaptif.

Penyesuaian Halus: Mengkustomisasi AI untuk Kebutuhan Spesifik

Penyesuaian halus melibatkan penyesuaian model pra-pelatihan untuk domain atau preferensi pengguna tertentu. Dua pendekatan utamanya termasuk penyesuaian halus ujung-ke-ujung, yang menyesuaikan semua bobot pengkode dan klasifikasi, dan penyesuaian halus ekstraksi fitur, di mana bobot pengkode dibekukan untuk klasifikasi hilir. Teknik ini memastikan bahwa model generatif disesuaikan secara efektif dengan kebutuhan atau persyaratan domain pengguna, meningkatkan aplikabilitasnya di berbagai konteks.

Keselarasan Nilai Manusia: Mengharmoniskan AI dengan Etika

Keselarasan nilai manusia berfokus pada mengharmoniskan model AI dengan etika dan nilai-nilai manusia, memastikan bahwa keputusan mereka mencerminkan norma dan standar etika masyarakat. Aspek ini sangat penting dalam skenario di mana AI berinteraksi erat dengan manusia, seperti dalam kesehatan dan asisten pribadi, untuk memastikan bahwa sistem AI membuat keputusan yang etis dan sosial bertanggung jawab.

Pengembangan AGI

AGI berfokus pada mengembangkan AI dengan kemampuan untuk pemahaman holistik dan penalaran kompleks, sejalan dengan kemampuan kognitif manusia. Aspirasi jangka panjang ini terus mendorong batas-batas penelitian dan pengembangan AI. Keamanan dan Pengandalian AGI menangani risiko potensial yang terkait dengan sistem AI canggih, menekankan kebutuhan akan protokol keamanan yang ketat dan keselarasan etika dengan nilai-nilai dan norma-norma masyarakat.

Inovasi MoE

Arsitektur Model Campuran Ahli (MoE) mewakili kemajuan signifikan dalam model bahasa berbasis transformer, menawarkan skalabilitas dan efisiensi yang tak tertandingi. Model MoE, seperti Switch Transformer dan Mixtral, dengan cepat meredefinisi skala model dan kinerja di berbagai tugas bahasa.

Konsep Inti

Model MoE menggunakan arsitektur yang dipandu kesparsean dengan beberapa jaringan ahli dan mekanisme pengontrolan yang dapat dipelajari, mengoptimalkan sumber daya komputasi dan beradaptasi dengan kompleksitas tugas. Mereka menunjukkan keunggulan signifikan dalam kecepatan pra-pelatihan tetapi menghadapi tantangan dalam penyesuaian halus dan memerlukan memori yang cukup untuk inferensi.

Model MoE dikenal karena kecepatan pra-pelatihan yang unggul, dengan inovasi seperti DeepSpeed-MoE yang mengoptimalkan inferensi untuk mencapai latensi dan efisiensi biaya yang lebih baik. Kemajuan terbaru telah secara efektif mengatasi bottleneck komunikasi all-to-all, meningkatkan efisiensi pelatihan dan inferensi.

Menghimpun Blok Bangunan untuk Kecerdasan Buatan Umum

AGI mewakili kemungkinan hipotetis AI yang mencapai atau melampaui kecerdasan manusia di berbagai domain. Sementara AI modern unggul dalam tugas sempit, AGI masih jauh dan kontroversial mengingat risikonya yang potensial.

Namun, kemajuan inkremental di bidang seperti pembelajaran transfer, pelatihan multitugas, kemampuan percakapan, dan abstraksi sedikit demi sedikit mendekati visi AGI yang ambisius. Proyek spekulatif Q* OpenAI bertujuan untuk mengintegrasikan pembelajaran penguatan ke dalam LLM sebagai langkah maju berikutnya.

Batas Etika dan Risiko Manipulasi Model AI

Jailbreak memungkinkan penyerang untuk menghindari batas etika yang ditetapkan selama proses penyesuaian halus AI. Ini menghasilkan konten berbahaya seperti disinformasi, ujaran kebencian, email phishing, dan kode berbahaya, yang membahayakan individu, organisasi, dan masyarakat secara luas. Misalnya, model yang di-jailbreak bisa menghasilkan konten yang mempromosikan narasi yang memecah belah atau mendukung kegiatan kriminal siber. (Pelajari Lebih Lanjut)

Sementara belum ada laporan serangan siber menggunakan jailbreaking, beberapa contoh jailbreak sudah tersedia secara online dan dijual di dark web. Alat-alat ini menyediakan prompt yang dirancang untuk memanipulasi model AI seperti ChatGPT, potensialmente memungkinkan peretas untuk mengungkapkan informasi sensitif melalui chatbot perusahaan. Penyebaran alat-alat ini di platform seperti forum kejahatan siber menyoroti urgensi mengatasi ancaman ini. (Baca Lebih Lanjut)

Mengatasi Risiko Jailbreak

Untuk mengatasi ancaman ini, pendekatan multifaset diperlukan:

  1. Penyesuaian Halus yang Kuat: Mengikutsertakan data yang beragam dalam proses penyesuaian halus meningkatkan ketahanan model terhadap manipulasi adversarial.
  2. Pelatihan Adversarial: Melatih dengan contoh adversarial meningkatkan kemampuan model untuk mengenali dan menolak input yang dimanipulasi.
  3. Evaluasi Teratur: Memantau output secara terus-menerus membantu mendeteksi deviasi dari pedoman etika.
  4. Pengawasan Manusia: Melibatkan peninjau manusia menambahkan lapisan keamanan tambahan.

Ancaman Berbasis AI: Eksploitasi Halusinasi

Halusinasi AI, di mana model menghasilkan output yang tidak berdasar pada data pelatihan, dapat dijadikan senjata. Misalnya, penyerang memanipulasi ChatGPT untuk merekomendasikan paket yang tidak ada, menyebabkan penyebaran perangkat lunak berbahaya. Ini menyoroti kebutuhan akan kewaspadaan terus-menerus dan kontra-tindakan yang kuat terhadap eksploitasi semacam itu. (Jelajahi Lebih Lanjut)

Sementara etika mengejar AGI tetap diperdebatkan, pencarian aspiratif ini terus mempengaruhi arah penelitian AI generatif – apakah model saat ini menyerupai batu loncatan atau jalan memutar menuju AI tingkat manusia.

Saya telah menghabiskan lima tahun terakhir dengan membenamkan diri dalam dunia Machine Learning dan Deep Learning yang menarik. Minat dan keahlian saya telah memimpin saya untuk berkontribusi pada lebih dari 50 proyek rekayasa perangkat lunak yang beragam, dengan fokus khusus pada AI/ML. Rasa ingin tahu saya yang terus-menerus juga telah menarik saya ke arah Natural Language Processing, sebuah bidang yang saya ingin jelajahi lebih lanjut.