Sudut Anderson

Heuristik melawan RAG: Shrinkflation sebagai Penggerak Kebijakan

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google
A tiny robot tries to type on a full-size laptop by using a pencil. Z-Image V1.

Di sebagian besar kasus, mencari di web dapat meningkatkan akurasi fakta jawaban ChatGPT atas pertanyaan kita. Jadi, dalam iklim di mana AI sedang berjuang untuk diterima oleh masyarakat, mengapa ChatGPT beralih ke ‘tebakan’?

 

Opini Ini adalah kesalahan untuk percaya bahwa LLM seperti ChatGPT pernah terlibat dalam whistleblowing tentang praktik-praktik yang potensialmente tidak baik dari host mereka, bahkan jika sesi yang mahal dan terbuang telah memicu kemarahan kita untuk benar-benar memasuki detail kekurangan sistem:

Di sini, diskusi tentang preferensi ChatGPT untuk logika internalnya (vs penelitian berbasis web dan verifikasi melalui RAG – yang menghasilkan fewer hallucinations, tetapi lebih mahal) menyebabkan momen kejujuran yang tampak; tetapi ambil dengan sedikit garam. Sumber: chatgpt.com

Di sini, diskusi tentang preferensi ChatGPT untuk logika internalnya (vs penelitian berbasis web dan verifikasi melalui RAG – yang menghasilkan fewer hallucinations, tetapi lebih mahal) menyebabkan momen kejujuran yang tampak; tetapi ambil dengan sedikit garam. Sumber

Sebagian besar – terutama untuk model dengan tanggal pemotongan pengetahuan yang lebih baru – AI hanya berimprovisasi berdasarkan postingan Reddit dan forum yang dilihat selama pelatihan. Bahkan jika ada nilai nyata dari ‘wawasan internal’ seperti itu, mustahil untuk membuktikannya.

Namun, terkadang pertukaran yang panas ini menyebabkan penemuan ‘hack’ (atau setidaknya ‘trik’) yang berjanji untuk mencegah beberapa kebiasaan berulang terburuk pada LLM – seperti ketika, minggu lalu, ChatGPT menyarankan bahwa saya bisa membuatnya bekerja lebih keras dan hallucinate lebih sedikit dengan menyertakan permohonan ‘tidak menggunakan heuristik’:

ChatGPT

Saya telah menggunakan ‘tidak menggunakan heuristik’ banyak sejak itu, dan tidak satu kali pun model tersebut bergantung pada pengetahuan terlatihnya setelah saya menutup permintaan dengan perintah ini. Sebaliknya, GPT langsung menggunakan Retrieval Augmented Generation (RAG), mencari internet untuk dokumen yang menerangi atau membenarkan.

Dalam praktek, untuk sebagian besar permintaan, ini sedikit berbeda dari mengatakan sistem untuk ‘mencari web’ setiap kali Anda mengirim permintaan. Di mana frasa ‘tidak menggunakan heuristik’ sangat dapat membantu adalah ketika mencoba membuat ChatGPT benar-benar membaca PDF yang diunggah baru daripada menggunakan metadata dari unggahan PDF sebelumnya dalam sesi tersebut (atau banyak sumber lain yang mungkin), untuk menghasilkan jawaban yang ‘masuk akal’ tetapi sepenuhnya hallucinated, tanpa membaca atau membaca dokumen yang baru saja Anda hadirkan.

ChatGPT

Namun, semakin lama sesi obrolan berlangsung, semakin kecil kemungkinan bahwa ini akan berhasil – dan akan menjadi kesalahan untuk berpikir bahwa ‘trik’ seperti itu dapat diandalkan atau akan tetap tersedia saat sistem berkembang.

Perdagangan RAG

Dalam konteks budaya yang tumbuh dari shrinkflation, dan fakta bahwa sistem besar seperti infrastruktur GPT OpenAI sangat dipengaruhi oleh perubahan perilaku yang luas, juga mudah untuk percaya bahwa kita sedang mendapatkan berat yang kurang dari pilihan yang dibuat oleh LLM populer seperti ChatGPT.

Pilihan seperti apakah itu akan mengakses web dengan RAG; memulai proses Chain-of-Thought (CoT) yang mungkin mendapatkan hasil yang lebih baik, tetapi yang akan lebih mahal untuk disimpulkan dan mungkin melelahkan pengguna yang tidak sabar; atau bergantung pada embedding terlatih dan pengetahuan lokal – yang merupakan solusi termurah dan tercepat yang mungkin.

Ada beberapa alasan praktis mengapa LLM dengan profil publik yang sensitif, seperti ChatGPT, mungkin lebih suka membatasi panggilan RAG-nya, sehingga lebih memilih heuristiknya sendiri. Pertama, dari perspektif PR, penggunaan web yang sering dan tidak dipicu mendukung karakterisasi LLM sebagai Googlers-by-proxy, yang melemahkan nilai pengetahuan bawaan dan mahal yang dilatihnya – dan daya tarik langganan berbayar.

Kedua, infrastruktur RAG memerlukan biaya untuk dijalankan, dipelihara, dan diperbarui, dibandingkan dengan biaya inferensi lokal yang relatif tidak signifikan, yaitu generasi parametri, yang murah dan cepat.

Ketiga, sistem mungkin tidak memiliki metode efektif untuk menentukan apakah RAG dapat meningkatkan hasil heuristiknya sendiri – dan seringkali tidak dapat menentukan ini tanpa menjalankan heuristik terlebih dahulu. Ini meninggalkan pengguna akhir dengan tugas mengevaluasi hasil heuristik yang salah, dan meminta panggilan RAG jika hasil dari heuristik tampaknya tidak memuaskan.

Dari sudut pandang ‘shrinkflation AI’, jumlah kesalahan heuristik dan keberhasilan RAG dapat menunjukkan, seperti yang baru-baru ini saya alami, bahwa sistem sedang mengoptimalkan biaya daripada hasil.

RAG Tumbuh Perlu dari Waktu ke Waktu

Meskipun ‘pengakuan’ ChatGPT baru-baru ini kepada saya bahwa ini memang benar, ‘shrinkflation’ memiliki konteks yang lebih luas dalam hal ini. Meskipun RAG tidak murah, baik dalam hal gesekan pengalaman (melalui latensi) atau biaya untuk dijalankan, lebih murah daripada melatih ulang model dasar atau bahkan memperbarui model dasar.

Untuk model AI yang lebih tua dengan tanggal pemotongan pengetahuan yang lebih jauh, RAG dapat mempertahankan mata uang sistem, dengan biaya panggilan jaringan dan sumber daya lain; untuk model yang lebih baru, pengambilan RAG sendiri lebih mungkin bersifat redundan atau merusak kualitas hasil, yang dalam beberapa kasus akan lebih baik melalui heuristik.

Oleh karena itu, AI tampaknya perlu memiliki kemampuan tidak hanya untuk memutuskan apakah harus menggunakan RAG, tetapi untuk terus mengembangkan kebijakannya tentang penggunaan RAG saat bobot internalnya menjadi semakin ketinggalan.

Pada saat yang sama, sistem perlu mengisolasi ‘konstanta relatif’ dalam pengetahuan, seperti orbit bulan, sastra klasik, budaya, dan sejarah; serta geografi dasar, fisika, dan prinsip ilmiah lain yang tidak mungkin berubah banyak seiring waktu (yaitu, risiko ‘perubahan tiba-tiba’ tidak ada, tetapi rendah).

Topik Outlier

Saat ini, setidaknya sejauh menyangkut ChatGPT, panggilan RAG (yaitu, penggunaan penelitian web untuk setiap pertanyaan pengguna yang tidak secara eksplisit atau implisit menuntut penelitian web) tampaknya jarang dipilih secara otonom oleh sistem, bahkan ketika menangani ‘marginal’ sub-domain.

Salah satu contoh domain marginal adalah ‘penggunaan perangkat lunak yang tidak biasa’. Dalam kasus seperti itu, data sumber yang tersedia minimal akan berjuang untuk perhatian selama pelatihan, dan status ‘outlier’ dari data tersebut mungkin telah memicu perhatian atau menguburnya sebagai ‘marginal’ atau ‘tidak penting’ – dan bahkan satu posting forum tambahan yang dibuat setelah tanggal pemotongan pengetahuan AI dapat mewakili peningkatan substansial dalam total data yang tersedia dan kualitas jawaban untuk ‘topik kecil’, membuat panggilan RAG layak.

Namun, keuntungan RAG cenderung menurun seiring dengan pertumbuhan model dasar. Sementara model yang lebih kecil mendapat manfaat secara signifikan dari pengambilan, sistem yang lebih besar seperti Qwen3-4B atau GPT-4o-mini/-4o sering menunjukkan perbaikan marginal atau bahkan negatif dari RAG*.

Pada banyak benchmark, pengambilan memperkenalkan lebih banyak gangguan daripada manfaat, menunjukkan perdagangan antara berinvestasi pada model yang lebih besar dengan cakupan internal yang lebih banyak, atau model yang lebih kecil yang dipasangkan dengan pengambilan.

Oleh karena itu, RAG tampaknya paling berguna untuk mengkompensasi celah di model berukuran sedang, yang masih memerlukan fakta eksternal, tetapi dapat menilainya dengan heuristik internal yang kurang kompleks.

Gunakan Hanya dalam Kasus Darurat

Kebijakan panduan ChatGPT tentang keputusan untuk menggunakan RAG tidak terbuka dengan jelas oleh prompt sistem**, tetapi secara implisit ditangani (di bagian akhir):

‘Gunakan alat web untuk mengakses informasi yang mutakhir dari web atau ketika menjawab pengguna memerlukan informasi tentang lokasi mereka. Beberapa contoh ketika harus menggunakan alat web termasuk:

Informasi Lokal: Gunakan alat web untuk menjawab pertanyaan yang memerlukan informasi tentang lokasi pengguna, seperti cuaca, bisnis lokal, atau acara.

Kebaruan: Jika informasi yang mutakhir tentang topik dapat berpotensi mengubah atau meningkatkan jawaban, panggil alat web setiap kali Anda sebaliknya menolak untuk menjawab pertanyaan karena pengetahuan Anda mungkin sudah ketinggalan.

Informasi Niche: Jika jawaban akan mendapat manfaat dari informasi detail yang tidak banyak diketahui atau dipahami (yang mungkin ditemukan di internet), seperti detail tentang lingkungan kecil, perusahaan yang kurang dikenal, atau peraturan yang tidak umum, gunakan sumber web langsung daripada mengandalkan pengetahuan yang telah diproses sebelumnya.

Akurasi: Jika biaya kesalahan kecil atau informasi yang ketinggalan zaman sangat tinggi (misalnya, menggunakan versi perpustakaan perangkat lunak yang ketinggalan zaman atau tidak mengetahui tanggal permainan berikutnya untuk tim olahraga), maka gunakan alat web.’

Khususnya, kita dapat memperhatikan instruksi ini yang mempromosikan RAG dalam kasus di mana data asli langka. Tetapi bagaimana sistem mencapai pemahaman ini? Pengguna dan pengamat kasual ChatGPT mungkin menyimpulkan bahwa pada kesempatan di mana widget ‘mencari web’ ditampilkan setelah jeda, heuristik internal model telah dipolling untuk pertanyaan, dan kosong.

Kita juga dapat memperhatikan bahwa dengan implikasi, RAG hanya direkomendasikan untuk sejumlah kecil kasus penggunaan. Ini meninggalkan GPT direkomendasikan untuk memolling bobotnya sendiri, dalam semua kecuali ‘kontingensi kritis’ (‘Akurasi’, di bagian bawah kutipan di atas), untuk sejumlah besar pertanyaan berbasis fakta di mana kecenderungan AI untuk menghalusinasi bisa menjadi kewajiban yang signifikan.

Kesimpulan

Tren penelitian saat ini dan terbaru menunjukkan bahwa generasi heuristik cepat dan murah, tetapi salah terlalu sering; sementara RAG lebih lambat, lebih mahal, tetapi lebih sering benar – semakin banyak seiring dengan penurunan ukuran model.

Berdasarkan penggunaan saya sendiri dari ChatGPT, saya akan berargumen bahwa OpenAI menggunakan RAG terlalu jarang, sebagai alat presisi daripada pengemudi sehari-hari, terutama karena masalah dengan jendela konteks yang tumbuh membuat LLM lebih mungkin untuk menghalusinasi seiring dengan perkembangan percakapan yang panjang.

Keadaan ini bisa sangat diperburuk dengan memeriksa jawaban heuristik terhadap sumber otoritas berbasis web, tanpa menunggu pengguna akhir untuk meragukan output atau terjebak olehnya, dan tanpa hasil internal yang perlu begitu jelas tidak memuaskan sehingga keputusan untuk menggunakan RAG menjadi tak terhindarkan.

Sebaliknya, sistem bisa dilatih untuk secara selektif dan cerdas meragukan dirinya sendiri menurut kasus, dan oleh karena itu untuk berinteraksi dengan web melalui proses penyaringan yang akan menjadi heuristik itu sendiri. Saya tidak menyadari bahwa arsitektur model saat ini meninggalkan ruang untuk pendekatan seperti ini, yang harus ditambahkan ke friksi filter API.

Sebagaimana adanya, saya tidak bisa membuktikan bahwa ada masalah; bahkan dengan :

ChatGPT mengakui

 

* Silakan merujuk ke tautan di bagian atas paragraf ini.

** Ini adalah ‘self-exposed’ prompt sistem GPT-5 yang, lagi-lagi, mungkin hanya merupakan ringkasan dari postingan forum prompt yang dilatih ulang untuk GPT-5, meskipun beberapa orang mempertahankan bahwa prompt tersebut asli.

Saya tidak benar-benar mengusulkan bahwa ‘kejujuran bersalah’ ChatGPT bermakna di sini; kecenderungan saya untuk menentang garis partai dalam masalah kebijakan OpenAI berarti bahwa itu akan akhirnya ‘setuju’ dengan saya, dan mengulangi opini implisit saya sendiri. Ini jauh dari setara dengan mengungkapkan detail pendaratan Normandia di bawah tekanan.

Pertama dipublikasikan Rabu, 10 Desember 2025

Penulis tentang pembelajaran mesin, spesialis domain sintesis gambar manusia. Mantan kepala konten penelitian di Metaphysic.ai, hingga pembubarannya ke dalam Brahma.ai DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai