Model dan platform AI

Bagaimana Pemrosesan Bahasa Ditingkatkan Melalui Model BERT Open Source Google

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Bidirectional Encoder Representations from Transformers, atau yang dikenal sebagai BERT, adalah model pelatihan yang telah meningkatkan efisiensi dan efektivitas model NLP. Sekarang bahwa Google (GOOGL ) telah membuat model BERT open source, ini memungkinkan perbaikan model NLP di semua industri. Dalam artikel ini, kita melihat bagaimana BERT membuat NLP menjadi salah satu solusi AI paling kuat dan berguna di dunia saat ini.

Mengaplikasikan Model BERT pada Pencarian

Mesin pencari Google terkenal karena kemampuannya untuk menampilkan konten yang relevan, dan mereka telah membuat program pemrosesan bahasa alami ini open source untuk dunia.

Kemampuan sistem untuk membaca dan menafsirkan bahasa alami menjadi semakin penting karena dunia memproduksi data baru secara eksponensial. Perpustakaan Google yang berisi makna kata, frasa, dan kemampuan untuk menampilkan konten yang relevan, adalah OPEN SOURCE. Di luar pemrosesan bahasa alami, model BERT memiliki kemampuan untuk mengekstrak informasi dari jumlah data yang besar dan tidak terstruktur, dan dapat diterapkan untuk membuat antarmuka pencarian untuk perpustakaan apa pun. Dalam artikel ini, kita akan melihat bagaimana teknologi ini dapat diterapkan di sektor energi.

BERT (Bidirectional Encoder Representations from Transformers) adalah pendekatan pra-pelatihan yang diusulkan oleh tim Google AI Language, yang dikembangkan untuk mengatasi masalah umum model NLP awal: kurangnya data pelatihan yang cukup.

Mari kita jelaskan, tanpa terlalu banyak detail:

Melatih Model

Tugas NLP tingkat rendah (misalnya, pengenalan entitas yang dinamai, segmentasi topik) dan tugas NLP tingkat tinggi (misalnya, analisis sentimen, pengenalan ucapan) memerlukan dataset yang telah diberi label secara spesifik. Meskipun mereka sulit ditemukan dan mahal untuk disusun, dataset yang telah diberi label memainkan peran kunci dalam kinerja model jaringan saraf yang dangkal dan dalam. Hasil inferensi yang berkualitas tinggi hanya dapat dicapai ketika jutaan atau bahkan miliar contoh pelatihan yang telah diberi label tersedia. Dan itu adalah masalah yang membuat banyak tugas NLP tidak dapat diakses. Itu sampai BERT dikembangkan.

BERT adalah model representasi bahasa umum, yang dilatih pada korpus teks yang besar dan tidak terstruktur. Ketika model ini dipaparkan pada jumlah teks yang besar, ia belajar untuk memahami konteks dan hubungan antara kata-kata dalam kalimat. Tidak seperti model pembelajaran sebelumnya yang hanya merepresentasikan makna pada tingkat kata (bank akan memiliki makna yang sama dalam “akun bank” dan “tebing yang berumput”), BERT sebenarnya peduli dengan konteks. Artinya, apa yang datang sebelum dan setelah kata dalam kalimat. Konteks ternyata menjadi kemampuan yang hilang dari model NLP, dengan dampak langsung pada kinerja model. Merancang model yang sadar konteks seperti BERT dikenal oleh banyak orang sebagai awal dari era baru dalam NLP.

Melatih BERT pada jumlah teks yang besar adalah teknik yang dikenal sebagai pra-pelatihan. Ini berarti bahwa bobot model disesuaikan untuk tugas pemahaman teks umum dan bahwa model yang lebih halus dapat dibangun di atasnya. Penulis telah membuktikan keunggulan teknik ini ketika mereka menggunakan model BERT pada 11 tugas NLP dan telah mencapai hasil yang luar biasa.

Model Pra-Pelatihan

Hal terbaik adalah: model BERT pra-pelatihan adalah open source dan tersedia secara umum. Ini berarti bahwa siapa pun dapat menangani tugas NLP dan membangun model mereka di atas BERT. Tidak ada yang dapat mengalahkan itu, kan? Oh, tunggu: ini juga berarti bahwa model NLP sekarang dapat dilatih (dihaluskan) pada dataset yang lebih kecil, tanpa perlu melatih dari awal. Awal dari era baru, memang.

Model pra-pelatihan ini membantu perusahaan mengurangi biaya dan waktu untuk menerapkan model NLP untuk digunakan secara internal atau eksternal. Efektivitas model NLP yang terlatih dengan baik ditekankan oleh Michael Alexis, CEO perusahaan pembangun budaya tim virtual, teambuilding.com.

“Manfaat terbesar dari NLP adalah inferensi dan pemrosesan informasi yang konsisten dan dapat diskalakan.” – Michael Alexis CEO dari teambuilding.com

Michael menyatakan bagaimana NLP dapat diterapkan pada program pembangunan budaya seperti icebreaker atau survei. Perusahaan dapat memperoleh wawasan yang berharga tentang bagaimana budaya perusahaan dengan menganalisis respons karyawan. Ini dapat dicapai tidak hanya dengan menganalisis teks, tetapi juga dengan menganalisis anotasi teks. Pada dasarnya, model juga “membaca di antara garis-garis” untuk mengambil kesimpulan tentang emosi, perasaan, dan pandangan umum. BERT dapat membantu dalam situasi seperti ini dengan pra-pelatihan model dengan basis indikator yang dapat digunakan untuk mengungkap nuansa bahasa dan memberikan wawasan yang lebih akurat.

Meningkatkan Kueri

Kemampuan untuk memodelkan konteks telah membuat BERT menjadi pahlawan NLP dan telah merevolusi Google Search itu sendiri. Di bawah ini adalah kutipan dari tim produk Google Search dan pengalaman mereka saat menyesuaikan BERT untuk memahami niat di balik kueri.

“Berikut beberapa contoh yang menunjukkan kemampuan BERT untuk memahami niat di balik pencarian Anda. Berikut adalah pencarian untuk “2019 brazil traveler to USA needs a visa.” Kata “to” dan hubungannya dengan kata-kata lain dalam kueri sangat penting untuk memahami makna. Ini tentang seorang Brasil yang bepergian ke AS dan bukan sebaliknya. Sebelumnya, algoritma kami tidak memahami pentingnya hubungan ini, dan kami mengembalikan hasil tentang warga AS yang bepergian ke Brasil. Dengan BERT, Search dapat memahami nuansa ini dan tahu bahwa kata “to” yang sangat umum sebenarnya sangat penting di sini, dan kami dapat memberikan hasil yang lebih relevan untuk kueri ini.”– Memahami pencarian lebih baik dari sebelumnya, oleh Pandu Nayak, Google Fellow dan Wakil Presiden Search.

Contoh Pencarian BERT

Contoh pencarian BERT, sebelum dan sesudah. Sumber blog

Dalam artikel sebelumnya tentang NLP dan OCR, kita telah mengilustrasikan beberapa penggunaan NLP di sektor real estat. Kita juga telah menyebutkan bagaimana “alat NLP adalah alat ekstraksi informasi yang ideal”. Mari kita lihat sektor energi dan bagaimana teknologi NLP yang inovatif seperti BERT memungkinkan kasus penggunaan baru.

Model NLP dapat Mengekstrak Informasi dari Jumlah Data yang Besar dan Tidak Terstruktur

Salah satu cara model NLP dapat digunakan adalah untuk mengekstrak informasi kritis dari data teks yang tidak terstruktur. Email, jurnal, catatan, log, dan laporan adalah contoh sumber data teks yang merupakan bagian dari operasi bisnis sehari-hari. Beberapa dokumen ini mungkin terbukti kritis dalam upaya organisasi untuk meningkatkan efisiensi operasional dan mengurangi biaya.

Ketika bertujuan untuk menerapkan perawatan prediktif turbin angin, laporan kegagalan mungkin mengandung informasi kritis tentang perilaku komponen yang berbeda. Namun, karena produsen turbin angin yang berbeda memiliki norma pengumpulan data yang berbeda (yaitu, laporan pemeliharaan datang dalam format dan bahasa yang berbeda), mengidentifikasi item data yang relevan secara manual dapat dengan cepat menjadi mahal bagi pemilik tanaman. Alat NLP dapat mengekstrak konsep, atribut, dan peristiwa yang relevan dari konten yang tidak terstruktur. Analisis teks kemudian dapat digunakan untuk menemukan korelasi dan pola dalam sumber data yang berbeda. Ini memberi pemilik tanaman kesempatan untuk menerapkan perawatan prediktif berdasarkan ukuran kuantitatif yang diidentifikasi dalam laporan kegagalan mereka.

Model NLP dapat Menyediakan Antarmuka Pencarian Bahasa Alami

Demikian pula, ahli geosains yang bekerja untuk perusahaan minyak dan gas biasanya perlu meninjau banyak dokumen yang terkait dengan operasi pengeboran sebelumnya, log sumur, dan data seismik. Karena dokumen-dokumen ini juga datang dalam format yang berbeda dan biasanya tersebar di beberapa lokasi (baik fisik maupun digital), mereka membuang banyak waktu untuk mencari informasi di tempat yang salah. Solusi yang layak dalam kasus seperti ini akan menjadi antarmuka pencarian yang ditenagai oleh NLP, yang akan memungkinkan pengguna untuk mencari data dalam bahasa alami. Kemudian, model NLP dapat mengorelasikan data di seluruh ratusan dokumen dan mengembalikan satu set jawaban untuk kueri. Pekerja dapat kemudian memvalidasi output berdasarkan pengetahuan ahli mereka sendiri dan umpan balik akan lebih lanjut meningkatkan model.

Namun, ada juga pertimbangan teknis untuk menerapkan model seperti itu. Salah satu aspeknya adalah jargon industri yang spesifik dapat membingungkan model pembelajaran tradisional yang tidak memiliki pemahaman semantik yang tepat. Kedua, kinerja model dapat dipengaruhi oleh ukuran dataset pelatihan. Inilah saat model pra-pelatihan seperti BERT dapat membuktikan manfaatnya. Representasi kontekstual dapat memodelkan makna kata yang tepat dan menghilangkan kebingungan yang disebabkan oleh istilah industri yang spesifik. Dengan menggunakan model pra-pelatihan, memungkinkan untuk melatih jaringan pada dataset yang lebih kecil. Ini menghemat waktu, energi, dan sumber daya yang akan diperlukan untuk pelatihan dari awal.

Tentang Bisnis Anda Sendiri?

Apakah Anda dapat memikirkan tugas NLP yang mungkin membantu Anda mengurangi biaya dan meningkatkan efisiensi operasional?

Tim ilmu data Blue Orange Digital dengan senang hati menyesuaikan BERT untuk kepentingan Anda juga!

Josh Miramant adalah CEO dan pendiri Blue Orange Digital, sebuah agen sains data dan pembelajaran mesin peringkat atas dengan kantor di New York City dan Washington DC. Miramant adalah seorang pembicara populer, futuris, dan penasihat bisnis & teknologi strategis untuk perusahaan besar dan startup. Ia membantu organisasi mengoptimalkan dan mengotomatisasi bisnis mereka, menerapkan teknik analitik berbasis data, dan memahami implikasi teknologi baru seperti kecerdasan buatan, data besar, dan Internet of Things.