Pemimpin pemikiran

Bagaimana Baiknya LLMs Dapat Menyimpulkan Masalah yang Rumit?

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Pengenalan dan evolusi generative AI telah begitu tiba-tiba dan intens sehingga sulit untuk sepenuhnya menghargai seberapa besar teknologi ini telah mengubah kehidupan kita.

Zoom out ke tiga tahun yang lalu. Ya, AI mulai menjadi lebih umum, setidaknya dalam teori. Lebih banyak orang tahu beberapa hal yang bisa dilakukan AI, meskipun bahkan dengan itu ada kesalahpahaman besar tentang kemampuan AI. Entah bagaimana teknologi ini diberi secara bersamaan tidak cukup dan terlalu banyak kredit untuk apa yang sebenarnya bisa dicapai. Namun, orang biasa bisa menunjuk setidaknya satu atau dua area di mana AI bekerja, melakukan tugas yang sangat khusus cukup baik, dalam lingkungan yang sangat terkendali. Apa pun di luar itu masih berada di laboratorium penelitian, atau sederhana tidak ada.

Bandungkan itu dengan hari ini. Dengan nol keterampilan selain kemampuan menulis kalimat atau mengajukan pertanyaan, dunia ada di ujung jari kita. Kita dapat menghasilkan gambar, musik, dan bahkan film yang benar-benar unik dan luar biasa, dan memiliki kemampuan untuk mengganggu industri secara keseluruhan. Kita dapat memperkuat proses mesin pencari, mengajukan pertanyaan sederhana yang jika diformulasikan dengan benar, dapat menghasilkan halaman konten kustom yang cukup baik untuk diluluskan sebagai sarjana universitas … atau anak kelas tiga jika kita menentukan POV. Sementara mereka telah menjadi umum dalam setahun atau dua, kemampuan ini dianggap tidak mungkin beberapa tahun yang lalu. Bidang generative AI ada tetapi belum berkembang secara signifikan.

Hari ini, banyak orang telah bereksperimen dengan generative AI seperti ChatGPT, Midjourney, atau alat lainnya. Yang lain telah mengintegrasikan mereka ke dalam kehidupan sehari-hari. Kecepatan evolusi mereka sangat cepat sehingga hampir mengkhawatirkan. Dan mengingat kemajuan enam bulan terakhir, kita pasti akan terkejut, berulang kali, dalam beberapa tahun mendatang.

Salah satu alat khusus yang digunakan dalam generative AI adalah kinerja Sistem Generasi yang Diperkuat Pencarian (RAG), dan kemampuan mereka untuk berpikir melalui kueri yang sangat kompleks. Pengenalan dataset FRAMES, dijelaskan secara rinci dalam artikel tentang bagaimana dataset evaluasi bekerja, menunjukkan di mana keadaan seni sekarang, dan ke mana itu menuju. Bahkan sejak pengenalan FRAMES pada akhir 2024, sejumlah platform telah memecahkan rekor baru dalam kemampuan mereka untuk menyimpulkan pertanyaan yang sulit dan kompleks.

Mari kita lihat apa yang FRAMES dimaksudkan untuk mengevaluasi dan seberapa baik model generative AI yang berbeda kinerjanya. Kita dapat melihat bagaimana desentralisasi dan platform open-source tidak hanya mempertahankan posisi mereka (terutama Sentient Chat), tetapi juga memungkinkan pengguna untuk mendapatkan gambaran yang jelas tentang penalaran yang luar biasa yang dapat dicapai oleh beberapa model AI.

FRAMES sebagai Jendela ke Otak GenAI

Dataset FRAMES dan proses evaluasinya berfokus pada 824 pertanyaan “multi-hop” yang dirancang untuk memerlukan inferensi, logika, penggunaan beberapa sumber untuk mengambil informasi kunci, dan kemampuan untuk logis memasang semua informasi tersebut untuk menjawab pertanyaan. Pertanyaan tersebut memerlukan antara dua dan 15 dokumen untuk menjawabnya dengan benar, dan juga secara sengaja memasukkan kendala, perhitungan matematika dan deduksi, serta kemampuan untuk memproses logika berbasis waktu. Dengan kata lain, pertanyaan-pertanyaan ini sangat sulit dan sebenarnya mewakili tugas penelitian dunia nyata yang mungkin dilakukan oleh manusia. Kita menghadapi tantangan ini setiap saat, dan harus mencari potongan-potongan informasi yang tersebar di internet, memasang informasi tersebut berdasarkan situs yang berbeda, menciptakan informasi baru dengan menghitung dan menduga, dan memahami bagaimana mengkonsolidasikan fakta-fakta ini menjadi jawaban yang benar dari pertanyaan.

Apa yang ditemukan oleh peneliti ketika dataset pertama kali dirilis dan diuji adalah bahwa model GenAI teratas mampu cukup akurat (sekitar 40%) ketika mereka harus menjawab menggunakan metode tunggal, tetapi dapat mencapai akurasi 73% jika diizinkan untuk mengumpulkan semua dokumen yang diperlukan untuk menjawab pertanyaan. Ya, 73% mungkin tidak tampak seperti revolusi. Tapi jika Anda memahami apa yang harus dijawab, angka tersebut menjadi jauh lebih mengesankan.

Misalnya, salah satu pertanyaan khusus adalah: “Tahun berapa bandleader dari grup yang pertama kali melakukan lagu yang disampel dalam lagu Kanye West ‘Power’ lahir?” Bagaimana seorang manusia akan menyelesaikan masalah ini? Orang itu mungkin melihat bahwa mereka perlu mengumpulkan berbagai elemen informasi, seperti lirik lagu Kanye West yang disebut “Power”, dan kemudian dapat melihat melalui lirik dan mengidentifikasi titik di mana lagu lain disampel. Kita sebagai manusia mungkin bisa mendengarkan lagu (bahkan jika tidak terbiasa dengan itu) dan dapat mengatakan kapan lagu lain disampel.

Tapi pikirkan tentang ini: apa yang harus dilakukan GenAI untuk mendeteksi lagu lain selain aslinya sambil “mendengarkan” lagu itu? Ini adalah tempat di mana pertanyaan dasar menjadi tes yang sangat baik untuk AI yang benar-benar cerdas. Dan jika kita dapat menemukan lagu, mendengarkan, dan mengidentifikasi lirik yang disampel, itu hanya Langkah 1. Kita masih perlu mengetahui apa nama lagu itu, apa nama band itu, siapa pemimpin band itu, dan kemudian apa tahun kelahiran orang itu.

FRAMES menunjukkan bahwa untuk menjawab pertanyaan yang realistis, sejumlah besar pemrosesan pikiran diperlukan. Dua hal yang terlintas di sini.

Pertama, kemampuan model GenAI desentralisasi untuk tidak hanya bersaing, tetapi juga mendominasi hasilnya, luar biasa. Sejumlah perusahaan menggunakan metode desentralisasi untuk meningkatkan kemampuan pemrosesan mereka sambil memastikan bahwa komunitas besar memiliki perangkat lunak, bukan kotak hitam terpusat yang tidak akan membagikan kemajuan mereka. Perusahaan seperti Perplexity dan Sentient memimpin tren ini, masing-masing dengan model yang sangat kuat yang kinerjanya di atas rekor akurasi pertama ketika FRAMES dirilis.

Elemen kedua adalah bahwa sejumlah kecil model AI ini tidak hanya desentralisasi, tetapi juga open-source. Misalnya, Sentient Chat adalah keduanya, dan tes awal menunjukkan seberapa kompleks penalaran mereka, berkat akses open-source yang tak ternilai. Pertanyaan FRAMES di atas dijawab dengan proses berpikir yang sama seperti yang digunakan manusia, dengan detail penalaran yang tersedia untuk ditinjau. Mungkin lebih menarik, platform mereka dirancang sebagai sejumlah model yang dapat memperhalus perspektif dan kinerja tertentu, bahkan jika proses pemperhalusan dalam beberapa model GenAI menghasilkan akurasi yang berkurang. Dalam kasus Sentient Chat, banyak model yang telah dikembangkan. Misalnya, model baru yang disebut “Dobby 8B” dapat tidak hanya mengalahkan benchmark FRAMES, tetapi juga mengembangkan sikap pro-kripto dan pro-kebebasan yang jelas, yang mempengaruhi perspektif model saat memproses potongan informasi dan mengembangkan jawaban.

Di Horizon

Kunci dari semua inovasi yang luar biasa ini adalah kecepatan yang membawa kita ke sini. Kita harus mengakui bahwa secepat teknologi ini berevolusi, itu hanya akan berevolusi lebih cepat di masa depan. Kita akan dapat melihat, terutama dengan model GenAI desentralisasi dan open-source, ambang batas kritis di mana kecerdasan sistem mulai melebihi kecerdasan kita sendiri, dan apa yang itu berarti untuk masa depan.

David Balaban adalah seorang peneliti keamanan komputer dengan lebih dari 17 tahun pengalaman dalam analisis malware dan evaluasi perangkat lunak antivirus. David menjalankan MacSecurity.net dan Privacy-PC.com proyek yang menyajikan pendapat ahli tentang masalah keamanan informasi kontemporer, termasuk teknik sosial, malware, pengujian penetrasi, intelijen ancaman, privasi online, dan peretasan topi putih. David memiliki latar belakang yang kuat dalam memecahkan masalah malware, dengan fokus baru-baru ini pada tindakan pencegahan ransomware.