Model dan platform AI

Membuka Kode Penskalaan: Bagaimana Model AI Mengubah Aturan

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Kecerdasan buatan telah membuat kemajuan luar biasa dalam beberapa tahun terakhir. Model yang dulunya bergelut dengan tugas dasar sekarang unggul dalam memecahkan masalah matematika, menghasilkan kode, dan menjawab pertanyaan kompleks. Inti dari kemajuan ini adalah konsep hukum penskalaan—aturan yang menjelaskan bagaimana model AI meningkat seiring dengan pertumbuhan, pelatihan pada lebih banyak data, atau pemberian sumber daya komputasi yang lebih besar. Selama bertahun-tahun, aturan ini berfungsi sebagai cetakan biru untuk mengembangkan AI yang lebih baik.

Baru-baru ini, tren baru telah muncul. Peneliti menemukan cara untuk mencapai hasil yang luar biasa tanpa hanya membuat model lebih besar. Perubahan ini lebih dari sekedar evolusi teknis. Ini mengubah cara AI dibangun, membuatnya lebih efisien, dapat diakses, dan berkelanjutan.

Dasar-Dasar Hukum Penskalaan

Hukum penskalaan seperti sebuah rumus untuk perbaikan AI. Mereka menyatakan bahwa seiring dengan peningkatan ukuran model, pemberian data lebih banyak, atau pemberian akses ke sumber daya komputasi yang lebih besar, kinerjanya meningkat. Contohnya:

Ukuran model: Model yang lebih besar dengan lebih banyak parameter dapat belajar dan mewakili pola yang lebih kompleks. Parameter adalah bagian yang dapat disesuaikan dari model yang memungkinkan untuk membuat prediksi.

Data: Pelatihan pada dataset yang luas dan beragam membantu model untuk umum lebih baik, memungkinkan mereka untuk menangani tugas yang tidak mereka pelajari secara eksplisit.

Komputasi: Lebih banyak kekuatan komputasi memungkinkan pelatihan yang lebih cepat dan lebih efisien, mencapai kinerja yang lebih tinggi.

Resep ini telah mengarahkan evolusi AI selama lebih dari satu dekade. Jaringan saraf awal seperti AlexNet dan ResNet menunjukkan bagaimana peningkatan ukuran model dapat meningkatkan pengenalan gambar. Kemudian muncul transformator di mana model seperti GPT-3 dan Google (GOOGL ) BERT menunjukkan bahwa penskalaan dapat membuka kemampuan baru, seperti pembelajaran beberapa contoh.

Batasan Penskalaan

Meskipun kesuksesannya, penskalaan memiliki batasan. Seiring dengan pertumbuhan model, perbaikan dari penambahan parameter lebih banyak berkurang. Fenomena ini, yang dikenal sebagai “hukum pengembalian yang menurun,” berarti bahwa menggandakan ukuran model tidak menggandakan kinerjanya. Sebaliknya, setiap peningkatan memberikan keuntungan yang lebih kecil. Ini berarti bahwa untuk lebih meningkatkan kinerja model tersebut akan memerlukan sumber daya yang lebih banyak untuk keuntungan yang relatif modest. Ini memiliki konsekuensi nyata. Membangun model besar datang dengan biaya keuangan dan lingkungan yang signifikan. Pelatihan model besar sangat mahal. GPT-3 dilaporkan biaya jutaan dolar untuk dilatih. Biaya ini membuat AI paling mutakhir tidak dapat diakses oleh organisasi yang lebih kecil. Pelatihan model besar mengkonsumsi sejumlah besar energi. Sebuah studi memperkirakan bahwa pelatihan satu model besar dapat mengemisikan sejumlah karbon seperti lima mobil sepanjang masa hidup mereka.

Peneliti mengenali tantangan ini dan mulai menjelajahi alternatif. Sebagai gantinya untuk mengandalkan kekuatan brutal, mereka bertanya: Bagaimana kita bisa membuat AI lebih pintar, bukan hanya lebih besar?

Membuka Kode Penskalaan

Pembukaan baru-baru ini menunjukkan bahwa memungkinkan untuk mengungguli hukum penskalaan tradisional. Arsitektur yang lebih pintar, strategi data yang lebih baik, dan metode pelatihan yang efisien memungkinkan AI untuk mencapai ketinggian baru tanpa memerlukan sumber daya yang besar.

Desain Model yang Lebih Pintar: Sebagai gantinya untuk membuat model lebih besar, peneliti fokus pada membuatnya lebih efisien. Contoh adalah:

    • Model yang jarang: Sebagai gantinya untuk mengaktifkan semua parameter sekaligus, model yang jarang hanya menggunakan bagian yang diperlukan untuk tugas tertentu. Pendekatan ini menghemat kekuatan komputasi sambil mempertahankan kinerja. Contoh yang terkenal adalah Mistral 7B, yang, meskipun hanya memiliki 7 miliar parameter, mengungguli model yang jauh lebih besar dengan menggunakan arsitektur yang jarang.
    • Peningkatan transformator: Transformator tetap menjadi tulang punggung AI modern, tetapi desainnya berkembang. Inovasi seperti mekanisme perhatian linier membuat transformator lebih cepat dan kurang intensif sumber daya.

Strategi Data yang Lebih Baik: Lebih banyak data tidak selalu lebih baik. Dataset yang dikurasi, berkualitas tinggi sering mengungguli volume murni. Contohnya,

    • Dataset yang terfokus: Sebagai gantinya untuk melatih pada data besar yang tidak disaring, peneliti menggunakan dataset yang bersih dan relevan. Misalnya, OpenAI telah beralih ke data yang dipilih dengan hati-hati untuk meningkatkan keandalan.
    • Pelatihan domain-spesifik: Di bidang khusus seperti kedokteran atau hukum, dataset yang ditargetkan membantu model untuk berkinerja baik dengan contoh yang lebih sedikit.

Metode Pelatihan yang Efisien: Metode pelatihan baru mengurangi permintaan sumber daya tanpa mengorbankan kinerja. Beberapa contoh dari metode pelatihan ini termasuk:

    • Pembelajaran kurikulum: Dengan memulai dengan tugas yang lebih sederhana dan secara bertahap memperkenalkan tugas yang lebih sulit, model belajar lebih efektif. Ini meniru bagaimana manusia belajar.
    • Teknik seperti LoRA (Adaptasi Rendah Peringkat): Metode ini memungkinkan model untuk disesuaikan dengan efisien tanpa melatihnya sepenuhnya.
    • Penggunaan titik kontrol gradien: Pendekatan ini mengurangi penggunaan memori selama pelatihan, memungkinkan model yang lebih besar untuk berjalan pada perangkat keras yang terbatas.

Kemampuan yang Muncul: Seiring dengan pertumbuhan model, mereka kadang-kadang menampilkan kemampuan yang mengejutkan, seperti memecahkan masalah yang tidak mereka pelajari secara eksplisit. Kemampuan yang muncul ini menantang hukum penskalaan tradisional, karena mereka sering muncul dalam model yang lebih besar tetapi tidak dalam model yang lebih kecil. Peneliti sekarang menyelidiki cara untuk membuka kemampuan ini dengan lebih efisien, tanpa mengandalkan penskalaan kekuatan brutal.

Pendekatan Hibrida untuk AI yang Lebih Pintar: Menggabungkan jaringan saraf dengan penalaran simbolis adalah arah yang menjanjikan lainnya. Sistem hibrida ini menggabungkan pengenalan pola dengan penalaran logis, membuatnya lebih pintar dan dapat disesuaikan. Pendekatan ini mengurangi kebutuhan akan dataset besar dan kekuatan komputasi.

Contoh Dunia Nyata

Beberapa model baru-baru ini menunjukkan bagaimana kemajuan ini mengubah aturan:

GPT-4o Mini: Model ini memberikan kinerja yang setara dengan versi yang jauh lebih besar, tetapi dengan biaya dan sumber daya yang jauh lebih kecil. Ini mencapai hasil ini dengan bantuan teknik pelatihan yang lebih pintar dan dataset yang terfokus.

Mistral 7B: Dengan hanya 7 miliar parameter, model ini mengungguli model yang jauh lebih besar. Arsitektur yang jarang membuktikan bahwa desain yang pintar dapat mengungguli ukuran murni.

Claude 3.5: Dengan memprioritaskan keamanan dan pertimbangan etis, model ini menyeimbangkan kinerja yang kuat dengan penggunaan sumber daya yang bijak.

Dampak Membuka Hukum Penskalaan

Kemajuan ini memiliki implikasi dunia nyata.

Membuat AI Lebih Dapat Diakses: Desain yang efisien menurunkan biaya pengembangan dan penerapan AI. Model sumber terbuka seperti Llama 3.1 membuat alat AI canggih tersedia untuk perusahaan yang lebih kecil dan peneliti.

Masa Depan yang Lebih Hijau: Model yang dioptimalkan mengurangi konsumsi energi, membuat pengembangan AI lebih berkelanjutan. Perubahan ini sangat penting karena kekhawatiran tentang jejak lingkungan AI tumbuh.

Mengembangkan Jangkauan AI: Model yang lebih kecil dan lebih efisien dapat berjalan pada perangkat sehari-hari, seperti smartphone dan perangkat IoT. Ini membuka kemungkinan baru untuk aplikasi, dari terjemahan bahasa waktu nyata hingga sistem otonom di mobil.

Intinya

Hukum penskalaan telah membentuk masa lalu AI, tetapi mereka tidak lagi mendefinisikan masa depannya. Arsitektur yang lebih pintar, penanganan data yang lebih baik, dan metode pelatihan yang efisien menghancurkan aturan penskalaan tradisional. Inovasi ini membuat AI tidak hanya lebih kuat, tetapi juga lebih praktis dan berkelanjutan.

Fokus telah bergeser dari pertumbuhan kekuatan brutal ke desain yang pintar. Era baru ini berjanji AI yang dapat diakses oleh lebih banyak orang, ramah lingkungan, dan mampu memecahkan masalah dengan cara yang baru kita bayangkan. Kode penskalaan tidak hanya dipecahkan—tetapi ditulis ulang.

Dr. Tehseen Zia adalah Profesor Asosiasi Tetap di COMSATS University Islamabad, memegang gelar PhD di AI dari Vienna University of Technology, Austria. Mengkhususkan diri dalam Kecerdasan Buatan, Pembelajaran Mesin, Ilmu Data, dan Penglihatan Komputer, ia telah membuat kontribusi signifikan dengan publikasi di jurnal ilmiah terkemuka. Dr. Tehseen juga telah memimpin berbagai proyek industri sebagai Penyelidik Utama dan menjabat sebagai Konsultan AI.