Model dan platform AI

Mistral AI: Menetapkan Tolak Ukur Baru di Luar Ruang Llama2 dalam Open-Source

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Model Bahasa Besar (LLM) baru-baru ini menduduki pusat perhatian, berkat penampilan yang menonjol seperti ChatGPT. Ketika Meta memperkenalkan model Llama mereka, itu memicu minat baru dalam LLM open-source. Tujuannya? Membuat LLM open-source yang terjangkau dan sebaik model top-tier seperti GPT-4, tetapi tanpa harga yang mahal atau kompleksitas.

Campuran keterjangkauan dan efisiensi ini tidak hanya membuka jalur baru bagi peneliti dan pengembang, tetapi juga menandai awal dari era baru kemajuan teknologi dalam pemrosesan bahasa alami.

Baru-baru ini, startup AI generatif telah mendapatkan dana. Bersama-sama, mereka mengumpulkan $20 juta untuk membangun model AI generatif open-source. Anthropic juga mengumpulkan $450 juta, dan Cohere, bermitra dengan Google Cloud, mengamankan $270 juta pada bulan ini.

Pengenalan Mistral 7B: Ukuran & Ketersediaan

mistral AI

Mistral AI, yang berbasis di Paris dan didirikan oleh alumni Google’s DeepMind dan Meta, mengumumkan model bahasa besar pertamanya: Mistral 7B. Model ini dapat diunduh oleh siapa saja dari GitHub dan bahkan melalui 13,4-gigabyte torrent.

Startup ini berhasil mengamankan pendanaan awal yang memecahkan rekor, bahkan sebelum mereka memiliki produk. Mistral AI pertama dengan model 7 miliar parameter melampaui kinerja Llama 2 13B dalam semua tes dan mengalahkan Llama 1 34B dalam banyak metrik.

Dibandingkan dengan model lain seperti Llama 2, Mistral 7B menyediakan kemampuan yang serupa atau lebih baik, tetapi dengan beban komputasi yang lebih rendah. Sementara model dasar seperti GPT-4 dapat mencapai lebih, mereka datang dengan biaya yang lebih tinggi dan tidak seuser-friendly karena mereka sebagian besar dapat diakses melalui API.

Ketika datang ke tugas coding, Mistral 7B memberikan CodeLlama 7B kesempatan untuk bersaing. Plus, itu cukup kompak pada 13,4 GB untuk berjalan pada mesin standar.

Tambah lagi, Mistral 7B Instruct, yang disesuaikan khusus untuk dataset instruksi pada Hugging Face, telah menunjukkan kinerja yang baik. Ini mengalahkan model 7B lainnya pada MT-Bench dan berdiri bahu membahu dengan model chat 13B.

Benchmark Kinerja

Dalam analisis kinerja yang rinci, Mistral 7B diukur melawan model Llama 2. Hasilnya jelas: Mistral 7B melampaui Llama 2 13B dalam semua benchmark. Bahkan, itu mencapai kinerja Llama 34B, terutama dalam benchmark kode dan penalaran.

Benchmark dibagi menjadi beberapa kategori, seperti Penalaran Umum, Pengetahuan Dunia, Pemahaman Membaca, Matematika, dan Kode, di antara lainnya. Pengamatan yang patut diperhatikan adalah metrik kinerja biaya Mistral 7B, yang disebut “ukuran model setara”. Dalam area seperti penalaran dan pemahaman, Mistral 7B menunjukkan kinerja yang serupa dengan model Llama 2 tiga kali ukurannya, menunjukkan potensi penghematan memori dan peningkatan throughput. Namun, dalam benchmark pengetahuan, Mistral 7B sejajar dengan Llama 2 13B, yang kemungkinan disebabkan oleh keterbatasan parameter yang mempengaruhi kompresi pengetahuan.

Apa yang Membuat Mistral 7B Lebih Baik dari Model Bahasa Lainnya?

Mengurangi Mekanisme Perhatian

Meskipun detail mekanisme perhatian teknis, ide dasarnya relatif sederhana. Bayangkan membaca buku dan menyoroti kalimat penting; ini analog dengan cara mekanisme perhatian “menyoroti” atau memberi penting pada titik data tertentu dalam urutan.

Dalam konteks model bahasa, mekanisme ini memungkinkan model untuk fokus pada bagian paling relevan dari data input, memastikan output yang kohesif dan akurat secara kontekstual.

Dalam transformer standar, skor perhatian dihitung dengan rumus:

Transformers attention Formula

Transformers Attention Formula

Rumus untuk skor ini melibatkan langkah kritis – perkalian matriks Q dan K. Tantangan di sini adalah bahwa ketika panjang urutan tumbuh, kedua matriks berkembang sesuai, menyebabkan proses yang intensif secara komputasi. Kekhawatiran skalabilitas ini adalah salah satu alasan utama mengapa transformer standar dapat lambat, terutama ketika menangani urutan panjang.

transformerMekanisme perhatian membantu model fokus pada bagian tertentu dari data input. Biasanya, mekanisme ini menggunakan ‘kepala’ untuk mengelola perhatian. Semakin banyak kepala yang Anda miliki, semakin spesifik perhatian, tetapi juga menjadi lebih kompleks dan lambat. Jelajahi lebih dalam tentang transformer dan mekanisme perhatian di sini.

Perhatian multi-query (MQA) mempercepat proses dengan menggunakan satu set ‘kepala-kunci’ tetapi kadang-kadang mengorbankan kualitas. Sekarang, Anda mungkin bertanya-tanya, mengapa tidak menggabungkan kecepatan MQA dengan kualitas perhatian multi-kepala? Itulah di mana Perhatian Query Berkumpul (GQA) masuk.

Perhatian Query Berkumpul (GQA)

Grouped-query attention

Grouped-query attention

GQA adalah solusi tengah. Alih-alih menggunakan satu atau beberapa ‘kepala-kunci’, itu mengelompokkan mereka. Dengan cara ini, GQA mencapai kinerja yang dekat dengan perhatian multi-kepala yang rinci tetapi dengan kecepatan MQA. Untuk model seperti Mistral, ini berarti kinerja yang efisien tanpa mengorbankan kualitas terlalu banyak.

Perhatian Jendela Geser (SWA)

longformer transformers sliding window

Metode jendela geser adalah metode lain yang digunakan dalam memproses urutan perhatian. Metode ini menggunakan jendela perhatian ukuran tetap di sekitar setiap token dalam urutan. Dengan beberapa lapisan yang menumpuk perhatian jendela, lapisan atas akhirnya mendapatkan perspektif yang lebih luas, mencakup informasi dari seluruh input. Mekanisme ini analog dengan lapangan reseptif yang terlihat dalam Jaringan Saraf Konvolusional (CNN).

Di sisi lain, “jendela geser dilasi” dari model Longformer, yang konseptualnya mirip dengan metode jendela geser, hanya menghitung beberapa diagonal dari matriks . Perubahan ini menghasilkan penggunaan memori yang meningkat secara linier daripada kuadratik, membuatnya menjadi metode yang lebih efisien untuk urutan yang lebih panjang.

Transparansi Mistral AI vs. Kekhawatiran Keamanan dalam Desentralisasi

Dalam pengumuman mereka, Mistral AI juga menekankan transparansi dengan pernyataan: “Tidak ada trik, tidak ada data proprietary.” Namun, model mereka yang hanya tersedia saat ini ‘Mistral-7B-v0.1’ adalah model dasar yang telah dilatih sebelumnya, sehingga dapat menghasilkan respons untuk setiap kueri tanpa moderasi, yang menimbulkan kekhawatiran keamanan potensial. Sementara model seperti GPT dan Llama memiliki mekanisme untuk menentukan kapan harus merespons, sifat desentralisasi Mistral yang sepenuhnya dapat dieksploitasi oleh aktor jahat.

Namun, desentralisasi Model Bahasa Besar memiliki kelebihannya. Sementara beberapa orang mungkin menyalahgunakannya, orang dapat memanfaatkan kekuatannya untuk kebaikan sosial dan membuat kecerdasan buatan yang dapat diakses oleh semua orang.

Fleksibilitas Penerapan

Salah satu sorotan adalah bahwa Mistral 7B tersedia di bawah lisensi Apache 2.0. Ini berarti tidak ada hambatan nyata untuk menggunakannya – baik Anda menggunakannya untuk tujuan pribadi, perusahaan besar, atau bahkan entitas pemerintah. Anda hanya perlu sistem yang tepat untuk menjalankannya, atau Anda mungkin perlu berinvestasi dalam sumber daya cloud.

Sementara ada lisensi lain seperti Lisensi MIT yang lebih sederhana dan Lisensi CC BY-SA-4.0 yang kooperatif, yang mengharuskan kredit dan lisensi yang sama untuk turunan, Apache 2.0 menyediakan fondasi yang kuat untuk upaya skala besar.

Pemikiran Akhir

Munculnya Model Bahasa Besar open-source seperti Mistral 7B menandai pergeseran penting dalam industri AI, membuat model bahasa berkualitas tinggi yang dapat diakses oleh audiens yang lebih luas. Pendekatan inovatif Mistral AI, seperti Perhatian Query Berkumpul dan Perhatian Jendela Geser, menjanjikan kinerja yang efisien tanpa mengorbankan kualitas.

Sementara sifat desentralisasi Mistral menimbulkan beberapa tantangan, fleksibilitas dan lisensi open-source-nya menekankan potensi untuk mendemokratisasi AI. Ketika lanskap berkembang, fokusnya akan secara tidak terelakkan berada pada keseimbangan antara kekuatan model ini dengan pertimbangan etika dan mekanisme keamanan.

Apa yang akan datang untuk Mistral? Model 7B hanya awal. Tim ini berencana untuk meluncurkan model yang lebih besar segera. Jika model baru ini mencapai kinerja 7B, Mistral mungkin akan segera naik sebagai pemain teratas di industri, semua dalam tahun pertama mereka.

Saya telah menghabiskan lima tahun terakhir dengan membenamkan diri dalam dunia Machine Learning dan Deep Learning yang menarik. Minat dan keahlian saya telah memimpin saya untuk berkontribusi pada lebih dari 50 proyek rekayasa perangkat lunak yang beragam, dengan fokus khusus pada AI/ML. Rasa ingin tahu saya yang terus-menerus juga telah menarik saya ke arah Natural Language Processing, sebuah bidang yang saya ingin jelajahi lebih lanjut.