Pemimpin pemikiran

Memori Perusahaan Anda Harus Lebih Lama Dari Model AI-nya

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Orang sering bertanya model apa yang menggerakkan perusahaan saya. Jawabannya penting: itu menentukan kualitas, biaya, dan batasan, dan saya bersedia menghabiskan satu jam untuk menjelaskannya. Saya juga ingin mengetahui hal kedua: apa yang masih dimiliki organisasi ketika model tersebut berubah.

Anggaplah sebagai sebuah tanggal. Jika penyedia Anda menggandakan harganya pada hari Selasa, atau menghentikan endpoint yang Anda bangun, apa yang masih Anda miliki pada pagi hari Rabu?

Bagi banyak perusahaan, jawaban jujurnya adalah: sebuah kunci API, sebuah faktur, dan riwayat percakapan yang sangat panjang yang berada di server orang lain dengan jadwal retensi mereka.

Latar belakang saya adalah kimia. Saya menghabiskan bertahun‑tahun membangun model grey‑box untuk pabrik kimia, terhubung ke SCADA, hasil laboratorium, dan catatan operator sendiri. Pekerjaan itu mengajarkan satu aturan dengan cepat: sebuah angka tanpa kondisi tidak menjadi hasil. Jika seseorang mengganti sensor minggu lalu dan tidak ada yang menuliskannya, pembacaan di layar tidak menjelaskan apa‑apa.

Itu adalah masalah buku catatan laboratorium. Sekarang menjadi masalah pengadaan, dan jarang muncul dalam lembar anggaran AI.

Tiga Pertanyaan yang Dijawab Sekaligus

Jendela konteks yang lebih besar memungkinkan model menggunakan lebih banyak informasi dalam satu permintaan. Penyimpanan yang tahan lama menentukan apa yang bertahan antar permintaan. Portabilitas menentukan apakah informasi tersebut tetap dapat digunakan ketika penyedia berubah. Ini adalah pertanyaan arsitektural yang terpisah, dan jendela satu juta token mendorong semua orang memperlakukan mereka sebagai satu kesatuan.

Dokumentasi resmi Google menawarkan analogi tersebut secara langsung: “Sebuah analogi untuk jendela konteks adalah memori jangka pendek.” Ambil itu secara harfiah. Memori jangka pendek adalah hal yang Anda kehilangan.

Jadi setiap vendor yang menjual jendela yang sangat besar juga menjual sesuatu yang terpisah untuk mempertahankan status. Baca lapisan‑lapisan itu secara spesifik, dengan kata‑kata mereka sendiri, dan catat apa yang sebenarnya dicakup oleh masing‑masing.

OpenAI menyimpan objek Respons secara default selama 30 hari; Objek Percakapan dan item‑itemnya dikecualikan dari TTL tersebut. Penghapusan 30‑hari Amazon berlaku untuk API Manajemen Sesi Bedrock, dan hanya mencakup API tersebut. Alat memori sisi klien milik Anthropic menggambarkan satu batas yang berguna: model meminta operasi memori, aplikasi mengendalikan penyimpanan, sementara perusahaan yang sama juga menyediakan penyimpanan memori terkelola untuk agen yang dihostingnya.

Semua ini adalah keputusan teknik biasa, yang dipublikasikan secara terbuka. Itu juga berarti aturan retensi untuk konteks kerja perusahaan Anda berada dalam catatan rilis orang lain, dan Anda harus dapat menyebutkan aturan mana yang berlaku untuk data Anda masing‑masing.

Di Mana Biaya Peralihan Sebenarnya Berada

Mengganti satu panggilan generasi teks dengan yang lain dapat dilakukan dalam satu akhir pekan. Itulah mengapa mengatakan “kami multi‑model” begitu mudah diucapkan. Lapisan mahal adalah yang tidak pernah didemonstrasikan oleh siapa pun.

Embedding. Mengubah embedding model biasanya memerlukan re‑embedding korpus dan migrasi atau pembangunan ulang indeks. Perubahan generasi model tidak memerlukan persyaratan tersebut, dan keduanya sering bingung — biasanya oleh pihak yang menjanjikan migrasi akan cepat. Literatur 2025 menggambarkan jalur standar sebagai “menyandikan ulang seluruh korpus dan membangun kembali indeks Approximate Nearest Neighbor (ANN), yang menyebabkan gangguan operasional signifikan dan biaya komputasi”; kontribusi paper tersebut, Drift-Adapter, adalah metode untuk menunda pembangunan ulang dengan mempelajari transformasi antar ruang embedding. Bagaimanapun, biaya migrasi mencakup validasi pengambilan dan pekerjaan operasional serta panggilan embedding itu sendiri.

Perilaku yang di‑fine‑tune. Satu kalimat dari Cohere’s pemberitahuan penghentian September 2025 berada di atas setiap meja pengadaan: “Model yang sebelumnya di‑fine‑tune tidak akan lagi dapat diakses.” Perilaku yang Anda bayar untuk dibuat, dihentikan bersamaan dengan endpoint yang menampungnya. Semua orang mengikuti proses yang dipublikasikan. Model Anda tetap menghilang.

Perilaku prompt dan alat. Instruksi yang sama menghasilkan aplikasi yang berbeda pada model yang berbeda. Dalam satu aplikasi perusahaan, peneliti melaporkan penurunan tingkat keberhasilan regresi dari 100% pada model asli menjadi 97,3% pada model yang lebih baru dengan prompt yang identik, yang hanya pulih setelah perancangan ulang prompt secara sengaja. Skenario pengujian muncul di produksi dengan frekuensi masing‑masing, sehingga angka tersebut tidak mendukung perkiraan seberapa sering alur kerja langsung gagal. Aturan operasional yang didukungnya lebih sederhana: validasi setiap peningkatan model pada tingkat aplikasi, sendiri, sebelum mencapai pelanggan.

Semua ini pada akhirnya muncul di faktur, lama setelah halaman harga dibandingkan.

Orang Lain Memegang Kalender Anda

Penghentian berjalan berdasarkan jadwal yang dipublikasikan, dan jadwal tersebut bukan milik Anda. OpenAI memberi pemberitahuan satu tahun sebelum menutup Assistants API pada Agustus 2026 – dermawan menurut standar halaman yang sama, di mana GPT-4.5 Preview hanya mendapat sekitar tiga bulan. Mistral’s kebijakan adalah enam bulan untuk model GA dan satu bulan untuk model preview dan pihak ketiga, dengan peringatan bahwa alias bergulir “dapat mengekspos Anda pada pembaruan diam dalam perilaku dan harga model.”

AWS menyuarakan bagian yang biasanya diam dalam kebijakan siklus hidup: “Migrasikan ke model Aktif sebelum tanggal EOL; migrasi tidak akan terjadi secara otomatis.”

Peta jalan Anda memiliki penulis bersama. Ia tidak pernah hadir dalam rapat perencanaan Anda dan tidak peduli kuartal apa Anda berada.

Harga Juga Merupakan Bagian yang Bergerak

Pada tarif Standar yang tercantum di Gemini 3.7 Flash, lima miliar token input yang tidak di‑cache dan satu miliar token output yang ditagih menelan $7.500 per bulan. Tarif yang saat ini dijadwalkan untuk 1 Januari 2027 akan meningkatkan tagihan token tersebut menjadi $15.000, sebelum biaya atau diskon lainnya, sementara produk Anda melakukan persis apa yang sebelumnya dilakukan.

Daftar harga beku juga dapat menghasilkan tagihan yang lebih besar. Anthropic’s dokumentasi harga mencatat bahwa tokenizer yang digunakan oleh generasi model terbarunya “menghasilkan sekitar 30 % lebih banyak token untuk teks yang sama” – tergantung konten dan spesifik untuk generasi tersebut – yang membuat dampaknya pada faktur apa pun menjadi sesuatu yang harus Anda ukur. Jadi ukur token yang Anda ditagih. Kartu tarif sendiri tidak akan memberi tahu Anda.

Untuk produk yang menjalankan alur kerja, ukuran ekonomi yang berguna adalah biaya dari tugas yang berhasil diselesaikan, termasuk percobaan ulang dan tinjauan manusia. Angka tersebut berubah ketika model berubah meskipun kartu tarif tidak berubah.

Dan tidak ada satupun yang dapat dinegosiasikan dari posisi di mana keluar memakan waktu setahun. Capgemini menyurvei 1,300 eksekutif di organisasi bernilai miliaran dolar pada musim semi 2026 tentang pemasok teknologi kritis secara umum: 36 % mengatakan berpindah dari satu pemasok akan memakan lebih dari dua belas bulan, dan satu dari sepuluh tidak memiliki alternatif yang layak sama sekali. Itu adalah deskripsi hubungan pemasok tanpa sumber kedua.

Bawalah ke Pengadaan

Saya menjalankan perusahaan Prancis, terdaftar di Marseille, dihosting di Eropa, dan saya tetap akan melewatkan pidato kedaulatan secara abstrak. Kemandirian dari setiap pemasok teknologi berada di luar jangkauan perusahaan biasa. Studi Capgemini yang sama menemukan 59 % eksekutif menganggap kedaulatan digital penuh tidak realistis, dan saya setuju dengan mereka.

Memahami dan mengendalikan ketergantungan kritis Anda adalah pekerjaan yang lebih kecil, dan memungkinkan. Tiga pertanyaan, semuanya dapat dijawab dalam sebuah pertemuan: di mana data kami disimpan dan diproses, siapa yang dapat mengaksesnya, dan apa yang diperlukan untuk tetap beroperasi dengan penyedia lain?

Setiap perusahaan tahu cara menanyakan hal itu tentang logistik, pembayaran, dan penyimpanan awan. Ketika ditanya tentang konteks kerja, ketergantungan Eropa muncul dalam pertemuan sebagai diskusi sumber kedua dengan angka terlampir, yang merupakan bentuk yang dapat ditindaklanjuti oleh pengadaan.

Satu peringatan tentang angka yang orang kutip di sini. Fakta bahwa sebuah perusahaan menggunakan beberapa model memberi sedikit informasi tentang apakah ia dapat memindahkan konteks kerjanya antar penyedia. Itu memerlukan uji terpisah: dapatkah catatan, izin, dan pekerjaan yang belum selesai dipindahkan dan tetap dapat digunakan?

Apa yang Sebenarnya Membuat Model Dapat Ditukar

Antarmuka bersama lintas model sangat berguna, dan saya akan membangunnya. Antarmuka tersebut harus menampilkan kemampuan dan ketergantungan khusus model. Portabilitas tidak memerlukan kepura‑puraan bahwa setiap model berperilaku sama, dan abstraksi yang menyamakan perbedaan secara diam‑diam menghilangkan alasan Anda membayar untuk model yang baik.

Pekerjaan yang lebih berat adalah menguasai status yang tidak seharusnya menjadi tanggung jawab tunggal satu penyedia. Empat hal, dalam urutan yang dapat rusak.

Catatan otoritatif di bawah kendali Anda.Pesan, sumber yang diambil, persetujuan, titik pemeriksaan eksekusi. Catat apa yang selesai di sistem eksternal dan apa yang dapat diulang dengan aman: email mungkin sudah terkirim sementara konfirmasi gagal disimpan, dan prosedur pemulihan yang tidak mengetahui hal ini akan mengirimnya dua kali. Setiap status penyedia yang tidak dapat Anda rekonstruksi menjadi ketergantungan. Tuliskan sebagai satu catatan, secara eksplisit, sebelum sebuah insiden yang mendokumentasikannya untuk Anda.

Sumber di samping setiap vektor.Vektor adalah artefak yang dikompilasi; potongan (chunk) adalah kode sumber. Simpan dokumen sumber dan versinya, ID dokumen, batasan potongan, versi pemotong, model embedding beserta versi dan dimensinya, versi indeks, serta proses yang menghasilkan teks. Fragmen teks yang disimpan saja tidak akan merekonstruksi tabel, gambar, atau hasil OCR. Menyimpan semuanya menjadikan proses re‑indeks sebagai migrasi terencana, yang memberikan kenyamanan sebanyak yang saya janjikan.

Catatan yang membedakan sumber, inferensi, dan keputusan. Memori harus memisahkan apa yang dikatakan sumber, apa yang disimpulkan model, dan apa yang disetujui orang. Seorang klien yang berjanji akan membayar pada hari Kamis, perkiraan model bahwa pembayaran akan tertunda, dan perpanjangan yang disepakati hingga hari Jumat adalah tiga catatan berbeda dengan tiga status berbeda, dan sistem harus mengetahui mana yang dapat ditindaklanjuti. Setiap catatan memerlukan asalnya, ruang lingkup, aturan akses, dan status terkini, termasuk apakah telah dikoreksi atau digantikan. Transkrip mungkin berisi bukti; memutarnya kembali tidak secara andal mengidentifikasi kesimpulan mana yang masih berlaku dan keputusan mana yang masih tetap.

Portabilitas yang memang Anda uji. Buatnya dapat diuji dengan dua cara: latihan ekspor-dan-restore, dan rangkaian evaluasi yang mendefinisikan apa yang harus dicapai aplikasi. Kemudian “kami bisa beralih” menjadi ukuran yang dapat dijalankan seseorang: apakah pengganti dapat melanjutkan alur kerja representatif dalam persyaratan Anda untuk kualitas, izin, latensi, dan biaya? Dan pertahankan data pelatihan yang berhak Anda gunakan kembali, bersama dengan versinya, konfigurasi penyetelan, dan tes penerimaan. Hal tersebut memungkinkan pelatihan ulang, tanpa jaminan perilaku yang identik, dan ID model yang disesuaikan berakhir pada tanggal yang ditetapkan oleh seseorang yang belum pernah Anda temui.

Gunakan sesi yang dihosting, cache prompt, dan pengambilan penyedia di mana pun mereka membantu. Mereka sering sangat baik, dan menolak mereka atas prinsip merupakan jenis pengeluaran yang mahal tersendiri. Persyaratannya adalah bahwa catatan yang mereka pegang dapat dipulihkan dan digunakan di tempat lain dengan aturan akses dan retensi tetap utuh. Sewalah komputasi; pertahankan kontrol atas catatan.

Saya juga tidak akan melebih-lebihkan arsitektur tersebut. Sebelum mencapai product-market fit, meluncurkan enam minggu lebih awal sering mengalahkan lapisan abstraksi apa pun, dan sebuah startup yang membangun tiga backend pengambilan sebelum memiliki pelanggan telah membangun sebuah museum. Apakah pertukaran itu tepat tergantung pada produk dan biaya rekonstruksi yang nantinya. Pastikan bahan mentah dapat dipulihkan dan jalan pintas tetap menjadi jalan pintas.

Bagian yang Berubah

Sementara AI hanya menjawab pertanyaan, kehilangan konteks hanyalah ketidaknyamanan. Anda mengetik ulang prompt dan melanjutkan. Sekarang AI menjadwalkan pertemuan, membuat tiket, dan berinteraksi dengan CRM, dan konteks yang hilang menyebabkan pekerjaan yang duplikat atau setengah selesai dalam sistem milik pelanggan Anda.

Vendor model membangun hal-hal luar biasa dan saya menggunakannya setiap hari. Tanggung jawab yang saya jelaskan berada pada kami yang membangun platform di antaranya: membuat ketergantungan terlihat, dan mempertahankan catatan yang dapat diandalkan tentang apa yang telah disetujui dan apa yang telah selesai.

Setiap alur kerja yang selesai harus meninggalkan organisasi dengan sesuatu yang dapat digunakan kembali — hasil yang terverifikasi, keputusan dengan riwayat yang dapat ditelusuri, titik awal yang lebih jelas untuk tugas berikutnya. Nilai yang terkumpul itu seharusnya bertahan lebih lama daripada model yang membantu menciptakannya.

Tanyakan apa yang masih akan Anda miliki pada Rabu pagi.

Ilia Razvin adalah pendiri dan CEO IOSYA, sebuah platform produktivitas bisnis dan otomatisasi alur kerja AI. Sebelumnya ia membangun model proses kotak abu-abu dan sistem pendukung keputusan untuk manufaktur kimia, serta memiliki gelar Master 2 dalam mikrosensor dan sistem deteksi dari Aix-Marseille Université.