Pemimpin pemikiran

Masalah Memori AI: Mengapa Konteks Panjang yang Efisien Mengubah Semuanya, dan Apa yang Dibutuhkan untuk Melakukannya dengan Benar

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Seorang rekan kerja yang melupakan setiap percakapan sebelumnya saat sesi berakhir tidak akan bertahan lama di kebanyakan pekerjaan. Namun, banyak AI bisnis bekerja dengan cara yang sama. Sesi ditutup dan konteks menghilang bersamanya. Seorang konsumen yang mengirimkan pertanyaan satu kali mungkin hampir tidak memperhatikan, tetapi perusahaan yang menjalankan proses yang berlangsung lebih lama dari satu sesi mengenai batasnya hampir seketika.

Pekerjaan nyata dilanjutkan dari satu sesi ke sesi lain, dan keputusan yang diambil pada Kamis biasanya bergantung pada keputusan yang diambil pada Senin, dengan pemikiran di baliknya membutuhkan untuk bertahan di antaranya. AI yang menghapus dirinya sendiri saat sesi berakhir dapat berperforma dengan baik di dalam sesi dan masih tidak memberikan kontribusi pada tugas yang berjalan selama seminggu.

AI perusahaan telah diam-diam mengubah apa yang mereka tuntut dari model. Selama bertahun-tahun, model dinilai terutama berdasarkan seberapa banyak pengetahuan yang telah mereka serap. Bisnis sekarang membutuhkan mereka untuk menjaga informasi yang tepat dalam pandangan saat pekerjaan berkembang, kemampuan yang membutuhkan jenis rekayasa yang berbeda. Sampai saat ini, kemampuan untuk mempertahankan tingkat pengetahuan yang persisten belum tercapai karena jumlah memori yang besar (GPU), komputasi, dan biaya yang diperlukan untuk menskalakan kemampuan tersebut. Menjaga latensi yang dapat diterima dan tingkat halusinasi model menjadi tantangan saat penggunaan bersamaan dengan konteks panjang yang digunakan. Ada permintaan yang meningkat untuk kemampuan pengetahuan tersebut dan tidak cukup memori dan komputasi untuk memenuhinya. Jadi, ini memunculkan pertanyaan: bagaimana Anda mencapai kecerdasan yang lebih akurat dengan skala yang lebih besar dengan infrastruktur dan jejak yang lebih kecil?

Meja dan Filing Cabinet

Dua hal yang dibundel di bawah judul memori, dan mereka berperilaku cukup berbeda sehingga sisanya dari ini bergantung pada menjaga mereka terpisah.

Mulai dengan jendela konteks, yang merupakan seberapa banyak model dapat menyerap dan menalar dalam satu langkah. Ini bekerja seperti permukaan meja. Meja kecil mengambil beberapa halaman sekaligus, sehingga semuanya lainnya menunggu di dalam laci dan diambil serta dibersihkan saat Anda melanjutkan, sedangkan meja besar membiarkan seluruh kasus file terbuka sekaligus saat Anda bekerja di atasnya. Apa yang meja pegang disapu pada akhir hari, setiap hari.

Memori yang persisten adalah filing cabinet di samping meja. Sistem memilih apa yang disimpan dan mengambilnya kembali saat menjadi relevan, sehingga sesuatu yang terjadi minggu ini dapat mempengaruhi apa yang dilakukan minggu depan. Toko itu membawa melintasi sesi, dan membutuhkan keputusan sendiri tentang apa yang disimpan, bagaimana mengatur, dan kapan mengambilnya kembali.

Sebagian besar rekayasa yang terlihat telah masuk ke meja. Jendela yang dulunya memegang beberapa ribu token sekarang berjalan hingga ratusan ribu, dan model terbesar dari OpenAI dan Anthropic mencapai sekitar satu juta.

Istilah untuk pekerjaan ini, ‘rekayasa konteks’, berasal dari Tobi Lutke dari Shopify dan dipopulerkan oleh Andrej Karpathy pada pertengahan 2025. Keterampilan inti dalam aplikasi AI yang serius, Karpathy menulis, adalah mengisi jendela dengan informasi yang tepat untuk langkah berikutnya. Analoginya adalah perangkat keras – model sebagai prosesor, jendela sebagai memori kerja. Praktisi mengadopsi istilah tersebut dengan cepat, karena mereka telah mengelilingi gagasan tanpa label untuk itu.

Memiliki Meja yang Lebih Besar Tidak Menyelesaikan Masalah Memori

Inilah di mana langkah yang jelas – hanya memperbesar meja – mengalami kesulitan.

Peneliti Stanford menunjukkan pada 2024 bahwa ketika informasi yang model butuhkan berada di tengah-tengah input panjang, akurasi turun tajam melawan fakta yang sama ditempatkan di awal atau akhir. Mereka menyebutnya ‘hilang di tengah’, dan ini berlaku bahkan untuk model yang dibuat khusus untuk konteks panjang. Menambahkan lebih banyak informasi di depan model, ternyata, tidak sama dengan model membuat penggunaan yang dapat diandalkan dari itu.

Efek ini telah bertahan saat tim lain mencari, dan studi 2025 yang menjalankan 18 model frontier melawan input yang semakin panjang menemukan bahwa kinerja memburuk jauh sebelum jendela bahkan penuh, pola yang penulisnya sebut sebagai ‘konteks busuk’. Memperbesar meja dan membuat model menalar dengan bersih di atas semua yang ada di atasnya adalah dua masalah yang terpisah, dan yang pertama tidak melakukan apa pun untuk menyelesaikan yang kedua.

Kurasi Menghasilkan Lebih Banyak daripada Kapasitas

Rekayasa konteks telah berkembang menjadi disiplin ilmu di atas dasar ini, dengan survei 2025 yang mengambil lebih dari 1.400 makalah yang menetapkan metode dan Gartner yang menyarankan klien untuk memprioritaskan konteks daripada prompt pada Juli 2025. Kerajinan itu bergerak dari membuat instruksi yang lebih tajam ke mengumpulkan input yang lebih tajam untuk model bekerja.

Meja yang lebih besar meningkatkan taruhan pada apa yang Anda pilih untuk meletakkannya. Menumpahkan seluruh toko dokumen ke permukaan dan beberapa halaman yang penting berakhir hilang di antara kebisingan, kontradiksi, dan versi yang sudah usang, di mana pemilihan yang lebih ketat tentang apa yang sebenarnya relevan dengan tugas membiarkan model yang sama berperforma jauh lebih baik. Penilaian terletak pada apa yang termasuk di depan model, bagaimana itu dikerangkai, kapan itu muncul, dan apa yang tetap di lemari.

Ini adalah apa yang RAG (retrieval-Augmented Generation) dibangun untuk: memotong dokumen menjadi fragmen dan mengambil fragmen yang tampaknya relevan, untuk menghindari jendela yang terlalu kecil untuk memegang seluruhnya. Katakanlah perselisihan kontrak bergantung pada satu klausa di halaman 200. Pendekatan biasa memotong kontrak menjadi fragmen dan membiarkan sistem pengambilan mengambil fragmen yang tampaknya relevan. Menilai halaman 200 sebagai tidak relevan dan model tidak pernah melihat klausa.

Jendela yang cukup besar untuk memegang kontrak seluruhnya melewati langkah pengambilan dan memberikan model klausa bersama dengan semuanya di sekitarnya. Apakah model kemudian membaca input panjang dengan baik adalah masalah keandalan dari bagian sebelumnya, dan ini adalah masalah yang lebih baik untuk ditinggalkan daripada sistem pengambilan yang diam-diam memutuskan klausa tidak layak untuk dilanjutkan.

Di Dalam Sesi, dan Setelah Itu

Konteks panjang adalah apa yang membiarkan agen AI bekerja di seluruh pekerjaan panjang daripada pertukaran tunggal. Agen yang menangani tinjauan kepatuhan multi-hari atau pemasok onboarding mempertahankan pekerjaan seluruhnya di jendela saat berjalan, sehingga setiap langkah mengambil dari keadaan penuh pekerjaan. Jendela yang cukup panjang dapat menggantikan memori di dalam sesi.

Itu juga di mana kesamaan berhenti. Apa pun yang sistem harus ingat minggu depan, setelah sesi ini ditutup, harus hidup di tempat jendela tidak.

Membangun jenis memori ini membawa serangkaian masalah yang berbeda, banyak di antaranya industri hanya baru saja mulai dihadapi. Pelatihan saya dalam psikologi dan neurosains membuat perbandingan dengan memori manusia sulit untuk diabaikan. Kami tidak mengambil rekaman yang sempurna dari suatu peristiwa. Setiap kali kami mengingatnya, kami membangunnya kembali, dan kesalahan kecil dapat secara bertahap menjadi bagian dari versi yang diterima. Memori mesin dapat mengembangkan masalah yang sama ketika informasi yang disimpan berulang kali diringkas, digabung, atau ditulis ulang. Seiring waktu, catatan dapat bergerak lebih jauh dari peristiwa asli kecuali seseorang memeriksa, memperbaiki kesalahan, dan menghapus informasi yang telah menjadi tidak dapat diandalkan.

Banyak perusahaan yang menerapkan sistem ini belum menghadapi masalah ini, dan hanya sedikit yang dekat dengan solusi. Apa yang saya tonton dalam vendor bukanlah ukuran jendela yang mereka iklankan. Model yang memegang 10 juta token tidak berarti apa-apa jika sebagian besar dari apa yang disimpan sudah usang, tidak relevan, atau salah. Jawabannya dapat terlihat baik-sumber sementara bersandar pada materi yang bisnis seharusnya tidak pernah dipercaya. Apa yang mendapatkan uang adalah penilaian tentang apa yang harus disimpan dan kemampuan untuk menalar dengan akurat atas semua informasi, pada sebagian kecil dari biaya infrastruktur dan jejak. Itu melakukan lebih dengan kurang, dan tidak semua jendela yang lebih besar datang dengan kemampuan sebenarnya.

Mathew Haswell adalah Co-Founder dari Refiant, sebuah perusahaan AI yang fokus pada efisiensi AI, kompresi, dan membuat model lebih efisien dan praktis untuk diterapkan, termasuk konteks panjang. Sebagai Master of Medical Science dan ahli saraf oleh pelatihan, ia telah memegang peran eksekutif strategis, bisnis, operasional, dan produk di berbagai perusahaan teknologi, fintech, gaming, ritel, dan jasa keuangan

Secara umum, saya ingin kita fokus lebih pada bagaimana kita memiliki pendekatan efisiensi AI yang inovatif yang memungkinkan konteks panjang dengan sebagian kecil dari komputasi dan memori.