Pemimpin pemikiran
Evolusi RAG – Panduan untuk RAG Agensi
Apa itu RAG (Retrieval-Augmented Generation)?
Retrieval-Augmented Generation (RAG) adalah teknik yang menggabungkan kekuatan model bahasa besar (LLM) dengan pengambilan data eksternal untuk meningkatkan kualitas dan relevansi respons yang dihasilkan. Model LLM tradisional menggunakan basis pengetahuan yang telah dilatih sebelumnya, sedangkan pipa RAG akan mengquery basis data atau dokumen eksternal pada waktu runtime dan mengambil informasi yang relevan untuk digunakan dalam menghasilkan respons yang lebih akurat dan kaya konteks. Ini sangat membantu dalam kasus di mana pertanyaan itu kompleks, spesifik, atau berdasarkan pada waktu tertentu, karena respons dari model itu diberitahu dan diperkaya dengan informasi domain spesifik yang mutakhir.
Lanskap RAG Saat Ini
Model bahasa besar telah merevolusi cara kita mengakses dan memproses informasi. Namun, ketergantungan hanya pada pengetahuan internal yang telah dimasukkan sebelumnya dapat membatasi fleksibilitas jawaban mereka, terutama untuk pertanyaan yang kompleks. Retrieval-Augmented Generation menyelesaikan masalah ini dengan memungkinkan LLM untuk memperoleh dan menganalisis data dari sumber luar untuk menghasilkan jawaban yang lebih akurat dan mendalam.
Pengembangan terbaru dalam pengambilan informasi dan pemrosesan bahasa alami, terutama LLM dan RAG, membuka peluang baru untuk efisiensi dan kesophistikasian. Pengembangan ini dapat dinilai berdasarkan kontur yang luas sebagai berikut:
- Peningkatan Pengambilan Informasi: Peningkatan pengambilan informasi dalam sistem RAG sangat penting untuk bekerja secara efisien. Karya terbaru telah mengembangkan berbagai vektor, algoritma reranking, metode pencarian hibrida untuk perbaikan pencarian yang presisi.
- Penyimpanan Semantik: Ini ternyata menjadi salah satu cara utama untuk mengurangi biaya komputasi tanpa harus mengorbankan konsistensi respons. Ini berarti bahwa respons terhadap kueri saat ini disimpan bersama dengan konteks semantik dan pragmatik yang melekat, yang pada gilirannya mempromosikan waktu respons yang lebih cepat dan menghasilkan informasi yang konsisten.
- Integrasi Multimodal: Selain sistem LLM dan RAG berbasis teks, pendekatan ini juga mencakup visual dan modalitas lain dari kerangka kerja. Ini memungkinkan akses ke berbagai sumber material dan menghasilkan respons yang semakin canggih dan akurat.
Tantangan dengan Arsitektur RAG Tradisional
Sementara RAG berkembang untuk memenuhi kebutuhan yang berbeda. Masih ada tantangan yang berdiri di depan Arsitektur RAG Tradisional:
- Rangkuman: Meringkas dokumen besar mungkin sulit. Jika dokumen itu panjang, struktur RAG konvensional mungkin melewatkan informasi penting karena hanya mengambil potongan atas K.
- Perbandingan Dokumen: Perbandingan dokumen yang efektif masih menjadi tantangan. Kerangka RAG sering menghasilkan perbandingan yang tidak lengkap karena memilih potongan atas K acak dari setiap dokumen secara acak.
- Analisis Data Terstruktur: Mengatasi kueri data numerik terstruktur, seperti menentukan kapan seorang karyawan akan mengambil cuti berikutnya tergantung pada tempat tinggal mereka, sangat sulit. Pengambilan dan analisis titik data yang akurat tidak akurat dengan model ini.
- Mengatasi Kueri dengan Beberapa Bagian: Menjawab pertanyaan dengan beberapa bagian masih terbatas. Misalnya, menemukan pola cuti umum di seluruh area dalam sebuah organisasi besar sangat sulit ketika dibatasi oleh K potongan, membatasi penelitian yang lengkap.
Menuju RAG Agensi
RAG Agensi menggunakan agen pintar untuk menjawab pertanyaan yang rumit yang memerlukan perencanaan hati-hati, penalaran multistep, dan integrasi alat eksternal. Agen-agen ini melakukan tugas seorang peneliti yang terampil, dengan gesit mengarahkan melalui banyak dokumen, membandingkan data, meringkas temuan, dan menghasilkan respons yang komprehensif dan akurat.
Konsep agen dimasukkan dalam kerangka RAG klasik untuk meningkatkan fungsionalitas dan kemampuan sistem, menghasilkan penciptaan RAG agensi. Agen-agen ini melakukan tugas tambahan dan penalaran di luar pengambilan informasi dan pembuatan dasar, serta mengatur dan mengontrol berbagai komponen pipa RAG.
Tiga Strategi Agensi Utama
Router mengirimkan kueri ke modul atau basis data yang sesuai tergantung pada jenisnya. Router secara dinamis membuat keputusan menggunakan Model Bahasa Besar pada konteks permintaan, untuk membuat panggilan pada mesin pilihan yang harus dikirim untuk meningkatkan akurasi dan efisiensi pipa.
Transformasi kueri adalah proses yang terlibat dalam mengubah kueri pengguna untuk mencocokkan informasi yang diminta atau, sebaliknya, untuk mencocokkan apa yang ditawarkan basis data. Ini bisa berupa pengubahan, perluasan, atau pemecahan pertanyaan yang kompleks menjadi subpertanyaan yang lebih sederhana dan lebih mudah ditangani.
Ini juga memerlukan mesin kueri subpertanyaan untuk memenuhi tantangan menjawab kueri yang kompleks menggunakan beberapa sumber data.
Pertama, pertanyaan yang kompleks dipecah menjadi pertanyaan yang lebih sederhana untuk setiap sumber data. Kemudian, semua jawaban antara dikumpulkan dan hasil akhir disintesis.
Lapisan Agensi untuk Pipa RAG
- Routing: Pertanyaan diarahkan ke basis pengetahuan yang relevan berdasarkan kecocokan. Contoh: Ketika pengguna ingin mendapatkan rekomendasi untuk kategori tertentu buku, kueri dapat diarahkan ke basis pengetahuan yang berisi pengetahuan tentang kategori tersebut.
- Perencanaan Kueri: Ini melibatkan pemecahan kueri menjadi subkueri dan kemudian mengirimkannya ke pipa individu yang sesuai. Agen menghasilkan subkueri untuk semua item, seperti tahun dalam kasus ini, dan mengirimkannya ke basis pengetahuan yang sesuai.
- Penggunaan Alat: Model bahasa berbicara dengan API atau alat eksternal, mengetahui apa yang akan terjadi, pada platform mana komunikasi itu seharusnya dilakukan, dan kapan itu perlu dilakukan. Contoh: Diberikan permintaan pengguna untuk prakiraan cuaca untuk hari tertentu, LLM berkomunikasi dengan API cuaca, mengidentifikasi lokasi dan tanggal, kemudian memparsir hasil yang diterima dari API untuk memberikan informasi yang tepat.
- ReAct adalah proses iteratif berpikir dan bertindak yang dikaitkan dengan perencanaan, menggunakan alat, dan mengamati.
Misalnya, untuk merancang rencana liburan ujung-ke-ujung, sistem akan mempertimbangkan permintaan pengguna dan mengambil detail tentang rute, atraksi wisata, restoran, dan akomodasi dengan memanggil API. Kemudian, sistem akan memeriksa hasilnya dengan mengacu pada kebenaran dan relevansi, menghasilkan rencana perjalanan yang terperinci yang relevan dengan prompt pengguna dan jadwal. - Perencanaan Kueri Dinamis: Sebagai gantinya melakukan secara berurutan, agen menjalankan beberapa tindakan atau subkueri secara paralel dan kemudian menggabungkan hasilnya.
Misalnya, jika seseorang ingin membandingkan hasil keuangan dua perusahaan dan menentukan perbedaan dalam beberapa metrik, maka agen akan memproses data untuk kedua perusahaan secara paralel sebelum menggabungkan temuan; LLMCompiler adalah salah satu kerangka kerja yang mengarah ke orkestrasi paralel yang efisien dari panggilan fungsi.
RAG Agensi dan LLMaIndex
LLMaIndex mewakili implementasi pipa RAG yang sangat efisien. Perpustakaan ini hanya mengisi kekosongan dalam mengintegrasikan data organisasi terstruktur ke dalam model AI generatif dengan menyediakan kenyamanan untuk alat dalam memproses dan mengambil data, serta antarmuka ke berbagai sumber data. Komponen utama LlamaIndex dijelaskan di bawah.
LlamaParse memparsir dokumen.
Llama Cloud untuk layanan perusahaan dengan pipa RAG yang diterapkan dengan jumlah tenaga kerja manual yang minimal.
Dengan menggunakan beberapa LLM dan penyimpanan vektor, LlamaIndex menyediakan cara terintegrasi untuk membangun aplikasi dalam Python dan TypeScript dengan RAG. Karakteristiknya membuatnya menjadi tulang punggung yang sangat diminati oleh perusahaan yang ingin memanfaatkan AI untuk pengambilan keputusan berbasis data yang ditingkatkan.
Komponen Kunci Implementasi RAG Agensi dengan LLMaIndex
Mari kita masuk ke dalam beberapa bahan RAG agensi dan bagaimana mereka diimplementasikan dalam LlamaIndex.
1. Penggunaan Alat dan Pengarahan
Agen pengarahan memilih LLM atau alat mana yang terbaik untuk digunakan untuk pertanyaan tertentu, berdasarkan jenis prompt. Ini mengarah ke keputusan yang peka konteks seperti apakah pengguna menginginkan ringkasan atau ringkasan yang terperinci. Contoh dari pendekatan ini adalah Mesin Kueri Router di LlamaIndex, yang secara dinamis memilih alat yang akan memaksimalkan respons terhadap kueri.
2. Pemeliharaan Konteks Jangka Panjang
Sementara pekerjaan paling penting dari memori adalah untuk mempertahankan konteks selama beberapa interaksi, berbeda dengan agen yang dilengkapi dengan memori dalam varian RAG agensi tetap terus-menerus menyadari interaksi yang menghasilkan respons yang kohesif dan sarat konteks.
LlamaIndex juga mencakup mesin obrolan yang memiliki memori untuk percakapan kontekstual dan kueri satu tembakan. Untuk menghindari kelebihan jendela konteks LLM, memori seperti itu harus dikendalikan secara ketat selama diskusi panjang, dan dikurangi menjadi bentuk ringkas.
3. Mesin Kueri Subpertanyaan untuk Perencanaan
Seringkali, seseorang harus memecahkan kueri yang kompleks menjadi pekerjaan yang lebih kecil dan dapat diatur. Mesin kueri subpertanyaan adalah salah satu fungsi inti untuk yang LlamaIndex digunakan sebagai agen, di mana kueri besar dipecah menjadi kueri yang lebih kecil, dijalankan secara berurutan, dan kemudian digabungkan untuk membentuk jawaban yang kohesif. Kemampuan agen untuk menyelidiki berbagai aspek kueri secara bertahap mewakili konsep perencanaan multistep versus linier.
4. Refleksi dan Koreksi Kesalahan
Agen reflektif menghasilkan output tetapi kemudian memeriksa kualitas output tersebut untuk melakukan koreksi jika perlu. Kemampuan ini sangat penting untuk memastikan akurasi dan bahwa apa yang dihasilkan sesuai dengan niat seseorang. Berkat alur kerja reflektif LlamaIndex, agen akan meninjau kinerjanya baik dengan mencoba lagi atau menyesuaikan aktivitas yang tidak memenuhi tingkat kualitas tertentu. Namun, karena ini self-correcting, RAG Agensi cukup dapat diandalkan untuk aplikasi perusahaan di mana keandalan sangat penting.
5. Penalaran Agensi yang Kompleks:
Eksplorasi berbasis pohon diterapkan ketika agen harus menyelidiki sejumlah jalur yang mungkin untuk mencapai sesuatu. Berbeda dengan pengambilan keputusan berurutan, penalaran berbasis pohon memungkinkan agen untuk mempertimbangkan banyak strategi sekaligus dan memilih yang paling menjanjikan berdasarkan kriteria penilaian yang diperbarui secara real-time.
LlamaCloud dan LlamaParse
Dengan layanan terkelola yang luas yang dirancang untuk peningkatan konteks perusahaan dalam aplikasi LLM dan RAG, LlamaCloud adalah lompatan besar dalam lingkungan LlamaIndex. Solusi ini memungkinkan insinyur AI untuk fokus pada pengembangan logika bisnis inti dengan mengurangi proses pengambilan data yang kompleks.
Mesin parsing lain yang tersedia adalah LlamaParse, yang terintegrasi dengan pipa pengambilan dan pengiriman data dalam LlamaIndex. Ini merupakan salah satu elemen penting yang menangani dokumen yang kompleks dan semi-terstruktur dengan objek yang tertanam seperti tabel dan gambar. Blok bangunan lain yang penting adalah API pengambilan dan pengiriman data yang terkelola, yang menyediakan sejumlah cara untuk dengan mudah memuat, memproses, dan menyimpan data dari berbagai sumber, seperti repositori data pusat LlamaHub atau output LlamaParse. Selain itu, mendukung berbagai integrasi penyimpanan data.
Kesimpulan
RAG Agensi mewakili pergeseran dalam pemrosesan informasi dengan memperkenalkan kecerdasan yang lebih besar ke dalam agen itu sendiri. Dalam banyak situasi, RAG agensi dapat digabungkan dengan proses atau API yang berbeda untuk memberikan hasil yang lebih akurat dan rinci. Misalnya, dalam kasus ringkasan dokumen, RAG agensi akan menilai tujuan pengguna sebelum membuat ringkasan atau membandingkan detail. Ketika menawarkan dukungan pelanggan, RAG agensi dapat menjawab pertanyaan pelanggan yang kompleks dengan akurat dan individual, tidak hanya berdasarkan model pelatihan mereka, tetapi juga memori yang tersedia dan sumber daya eksternal. RAG Agensi menyoroti pergeseran dari model generatif ke sistem yang lebih disesuaikan yang memanfaatkan jenis sumber lain untuk mencapai hasil yang kuat dan akurat. Namun, karena generatif dan cerdas seperti sekarang, model ini dan RAG Agensi berada dalam pencarian efisiensi yang lebih tinggi karena semakin banyak data yang ditambahkan ke pipa.












