Model dan platform AI

Keadaan Multilingual LLMs: Melampaui Bahasa Inggris

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Menurut penelitian Microsoft (MSFT ), sekitar 88% dari bahasa di dunia, yang digunakan oleh 1,2 miliar orang, tidak memiliki akses ke Large Language Models (LLMs). Hal ini karena sebagian besar LLMs berfokus pada bahasa Inggris, yaitu mereka sebagian besar dibangun dengan data bahasa Inggris dan untuk penutur bahasa Inggris. ​Dominasi bahasa Inggris ini juga berlaku dalam pengembangan LLM dan telah menghasilkan kesenjangan bahasa digital, yang berpotensi mengecualikan sebagian besar orang dari manfaat LLMs. Untuk memecahkan masalah ini untuk LLMs, diperlukan LLM yang dapat dilatih dalam berbagai bahasa dan melakukan tugas dalam berbagai bahasa. Mari kita kenalkan Multilingual LLMs!

Apa itu Multilingual LLMs?

Multilingual LLM dapat memahami dan menghasilkan teks dalam beberapa bahasa. Mereka dilatih pada dataset yang berisi berbagai bahasa dan dapat melakukan berbagai tugas dalam lebih dari satu bahasa dari prompt pengguna.

Aplikasi Multilingual LLM sangat luas, termasuk menerjemahkan literatur ke dalam dialek lokal, komunikasi multibahasa secara real-time, pembuatan konten multibahasa, dan lain-lain. Mereka akan membantu semua orang untuk mengakses informasi dan berkomunikasi dengan mudah, tidak peduli bahasa apa yang mereka gunakan.

Selain itu, multilingual LLMs juga menangani tantangan seperti kurangnya nuansa budaya dan konteks, keterbatasan data pelatihan, dan potensi kehilangan pengetahuan selama penerjemahan.

Bagaimana Multilingual LLMs Bekerja?

Membangun multilingual LLM melibatkan persiapan corpus teks yang seimbang dalam berbagai bahasa dan pemilihan arsitektur dan teknik pelatihan yang sesuai untuk melatih model, lebih disukai Transformer model, yang sangat cocok untuk pembelajaran multibahasa.

Langkah-langkah membangun multilingual LLM

Sumber: Gambar oleh penulis

Salah satu teknik yang digunakan adalah berbagi embeddings, yang menangkap makna semantik kata-kata di berbagai bahasa. Ini membuat LLM mempelajari kesamaan dan perbedaan setiap bahasa, sehingga memungkinkan untuk memahami bahasa yang berbeda dengan lebih baik.

Pengetahuan ini juga memungkinkan LLM untuk beradaptasi dengan berbagai tugas linguistik, seperti menerjemahkan bahasa, menulis dalam gaya yang berbeda, dan lain-lain. Teknik lain yang digunakan adalah cross-lingual transfer learning, di mana model dilatih sebelumnya pada corpus multibahasa besar sebelum dihaluskan pada tugas tertentu.

Proses dua langkah ini memastikan model memiliki fondasi yang kuat dalam pemahaman bahasa multibahasa, sehingga membuatnya dapat disesuaikan dengan berbagai aplikasi downstream.

Contoh Multilingual Large Language Models

Grafik perbandingan multilingual LLM

Sumber: Ruder.io

Beberapa contoh multilingual LLMs yang terkenal telah muncul, masing-masing memenuhi kebutuhan linguistik dan konteks budaya yang spesifik. Mari kita jelajahi beberapa di antaranya:

1. BLOOM

BLOOM adalah multilingual LLM akses terbuka yang memprioritaskan bahasa yang beragam dan aksesibilitas. Dengan 176 miliar parameter, BLOOM dapat menangani tugas dalam 46 bahasa alami dan 13 bahasa pemrograman, membuatnya salah satu LLM terbesar dan paling beragam.

BLOOM yang bersifat open-source memungkinkan peneliti, pengembang, dan komunitas bahasa untuk memanfaatkan kemampuannya dan berkontribusi pada perbaikannya.

2. YAYI 2

YAYI 2 adalah LLM open-source yang dirancang khusus untuk bahasa Asia, mempertimbangkan kompleksitas dan nuansa budaya wilayah tersebut. Ia dilatih dari awal pada corpus multibahasa yang mencakup 16 bahasa Asia dengan 2,65 triliun token yang disaring.

Hal ini membuat model memberikan hasil yang lebih baik, memenuhi kebutuhan bahasa dan budaya di Asia.

3. PolyLM

PolyLM adalah LLM ‘poliglot’ open-source yang fokus pada menangani tantangan bahasa dengan sumber daya yang terbatas dengan menawarkan kemampuan adaptasi. Ia dilatih pada dataset sekitar 640 miliar token dan tersedia dalam dua ukuran model: 1,7B dan 13B. PolyLM mengetahui lebih dari 16 bahasa yang berbeda.

Ia memungkinkan model yang dilatih pada bahasa dengan sumber daya yang tinggi untuk dihaluskan untuk bahasa dengan sumber daya yang terbatas dengan data yang terbatas. Fleksibilitas ini membuat LLMs lebih berguna dalam berbagai situasi bahasa dan tugas.

4. XGLM

XGLM, dengan 7,5 miliar parameter, adalah multilingual LLM yang dilatih pada corpus yang mencakup berbagai bahasa menggunakan teknik pembelajaran few-shot. Ia merupakan bagian dari keluarga LLMs multibahasa besar yang dilatih pada dataset teks dan kode yang besar.

Ia bertujuan untuk mencakup banyak bahasa secara lengkap, sehingga fokus pada inklusivitas dan keberagaman linguistik. XGLM menunjukkan potensi untuk membangun model yang memenuhi kebutuhan komunitas bahasa yang beragam.

5. mT5

mT5 (massively multilingual Text-to-Text Transfer Transformer) dikembangkan oleh Google (GOOGL ) AI. Dilatih pada dataset common crawl, mT5 adalah multilingual LLM yang dapat menangani 101 bahasa, mulai dari bahasa Spanyol dan Cina yang banyak digunakan hingga bahasa yang kurang memiliki sumber daya seperti Basque dan Quechua.

Ia juga unggul dalam tugas multibahasa seperti penerjemahan, ringkasan, pertanyaan-jawaban, dan lain-lain.

Apakah Universal LLM Mungkin?

Konsep LLM yang netral bahasa, yang dapat memahami dan menghasilkan bahasa tanpa bias terhadap bahasa tertentu, sangat menarik.

Sementara mengembangkan LLM universal yang sebenarnya masih jauh, multilingual LLMs saat ini telah menunjukkan kesuksesan yang signifikan. Begitu dikembangkan sepenuhnya, mereka dapat memenuhi kebutuhan bahasa yang kurang terwakili dan komunitas yang beragam.

Sebagai contoh, penelitian menunjukkan bahwa sebagian besar multilingual LLMs dapat memfasilitasi transfer cross-lingual zero-shot dari bahasa yang kaya sumber daya ke bahasa yang kekurangan sumber daya tanpa data pelatihan tugas spesifik.

Juga, model seperti YAYI dan BLOOM, yang fokus pada bahasa dan komunitas tertentu, telah menunjukkan potensi pendekatan yang berfokus pada bahasa dalam mendorong kemajuan dan inklusivitas.

Untuk membangun LLM universal atau memperbaiki Multilingual LLMs saat ini, individu dan organisasi harus melakukan hal-hal berikut:

  • Mengumpulkan penutur asli untuk keterlibatan komunitas dan kurasi dataset bahasa.
  • Mendukung upaya komunitas terkait kontribusi open-source dan pendanaan untuk penelitian dan pengembangan multibahasa.

Tantangan Multilingual LLMs

Sementara konsep LLMs multibahasa universal sangat menjanjikan, mereka juga menghadapi beberapa tantangan yang harus diatasi sebelum kita dapat memanfaatkan manfaatnya:

1. Kuantitas Data

Model multibahasa memerlukan kosakata yang lebih besar untuk mewakili token dalam banyak bahasa daripada model monobahasa, tetapi banyak bahasa kekurangan dataset skala besar. Ini membuatnya sulit untuk melatih model tersebut secara efektif.

2. Kualitas Data

Memastikan akurasi dan kesesuaian budaya dari output LLMs multibahasa di seluruh bahasa adalah masalah yang signifikan. Model harus dilatih dan dihaluskan dengan perhatian yang teliti terhadap nuansa linguistik dan budaya untuk menghindari bias dan ketidakakuratan.

3. Keterbatasan Sumber Daya

Melatih dan menjalankan model multibahasa memerlukan sumber daya komputasi yang substansial seperti GPU yang kuat (misalnya, NVIDIA A100 GPU). Biaya yang tinggi ini menimbulkan tantangan, terutama bagi bahasa dan komunitas dengan sumber daya yang terbatas.

4. Arsitektur Model

Mengadaptasi arsitektur model untuk mengakomodasi struktur linguistik yang beragam dan kompleks adalah tantangan yang sedang berlangsung. Model harus dapat menangani bahasa dengan urutan kata, variasi morfologis, dan sistem penulisan yang berbeda sambil mempertahankan kinerja dan efisiensi yang tinggi.

5. Kompleksitas Evaluasi

Mengevaluasi kinerja LLMs multibahasa di luar benchmark bahasa Inggris sangat penting untuk mengukur efektivitasnya yang sebenarnya. Ini memerlukan mempertimbangkan nuansa budaya, kekhasan linguistik, dan persyaratan domain-spesifik.

LLMs multibahasa memiliki potensi untuk menghancurkan hambatan bahasa, memberdayakan bahasa yang kurang memiliki sumber daya, dan memfasilitasi komunikasi yang efektif di seluruh komunitas yang beragam.

Jangan lewatkan berita dan analisis terbaru tentang AI dan ML – kunjungi unite.ai hari ini.

Haziqa adalah Ilmuwan Data dengan pengalaman luas dalam menulis konten teknis untuk perusahaan AI dan SaaS.