Sudut Anderson

Tanggal Rahasia dalam Prompt Sistem Merusak Evaluasi Model Bahasa

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google
Harold Lloyd hangs from a clock face in Safety Last! (1923). The film is in the US public domain.. Source: https://www.youtube.com/watch?v=tzh4htLXp6Q

Tanpa kemampuan untuk mengukur kinerja Model Bahasa Besar (LLM), sulit bagi konsumen dan bisnis untuk memahami kemajuan apa yang telah dicapai model dalam versi terbaru, dan bagaimana ia bersaing dengan pesaingnya:

Papan peringkat LLM berpengaruh di arena.ai. Sumber: https://arena.ai/leaderboard/chat/text

Papan peringkat LLM berpengaruh di arena.ai. Sumber

Karena LLM bersifat non-deterministik (misalnya, mereka akan tidak selalu menghasilkan output yang konsisten untuk input yang sama), mengevaluasi mereka menjadi rumit. Bahkan ketika peneliti menggunakan prompt yang identik, pengaturan model, dan dataset benchmark, perbedaan kecil yang tampak dalam lingkungan eksekusi dapat menghasilkan jawaban yang berbeda dan secara signifikan mengubah skor kinerja.

Faktor-faktor seperti konfigurasi perangkat keras, presisi numerik, ukuran batch inferensi, dan bahkan urutan jawaban pilihan ganda dapat memengaruhi hasil. Hal ini dapat menyulitkan untuk melihat apakah peningkatan yang dilaporkan mencerminkan kemajuan nyata, atau hanya variasi semi-acak dalam kondisi pengujian model.

Sejauh tertentu, seseorang dapat memperhitungkan beberapa variabel ini, atau setidaknya menentukan margin kesalahan yang dihasilkan, sehingga evaluasi komparatif menjadi bermakna. Penting untuk mencoba, karena banyak uang, dan banyak reputasi bergantung pada kemampuan untuk mengukur kinerja sistem AI jenis ini dengan tingkat akurasi tertentu.

Namun, menurut penelitian baru, satu variabel khusus tidak hanya merusak benchmark, tetapi juga sangat sulit dihilangkan dari prompt yang mendefinisikannya – tanggal hari ini.

Waktu Berubah

The makalah baru*, sebuah kolaborasi akademik antara Jerman, Meksiko, dan Amerika Serikat, menyatakan bahwa fakta bahwa tanggal saat ini secara otomatis dan diam-diam dimasukkan ke dalam prompt sistem semua model frontier dan banyak penerapan model dengan bobot terbuka berarti reprodusibilitas bisa hampir tidak mungkin:

‘Kami mengidentifikasi sumber non-determinisme yang kritis dan sering diabaikan dalam evaluasi LLM: penyisipan tersembunyi tanggal saat ini ke dalam prompt sistem.’

‘Di antara 9 model, 6 dataset, dan empat tugas, metadata dinamis ini mengubah kinerja model dan mengacak peringkat papan peringkat, melampaui varians yang diperkenalkan oleh faktor tingkat sistem lain seperti ukuran batch atau presisi numerik.’

Para peneliti juga mencatat bahwa efek yang diidentifikasi lebih besar untuk tugas yang memerlukan jawaban yang dihasilkan, dengan kinerja berfluktuasi hingga 6% pada pertanyaan pilihan ganda, 14% pada penalaran matematika, dan 7% pada generasi kode – serta skor terjemahan mesin juga berfluktuasi secara signifikan.

Menyediakan contoh jawaban dan mendorong penalaran langkah demi langkah tidak menyelesaikan masalah – sebenarnya, yang terakhir membuatnya lebih buruk:

Fluktuasi akurasi pada tanggal yang berbeda di 2024 untuk Llama 3.1 (8B) pada benchmark MMLU. Penalaran langkah demi langkah (merah) menghasilkan variabilitas yang jauh lebih besar dibandingkan jawaban langsung (biru), menunjukkan bagaimana prompting rantai pemikiran memperkuat sensitivitas terhadap tanggal. Sumber - https://arxiv.org/pdf/2609.36931

Fluktuasi akurasi pada tanggal yang berbeda di 2024 untuk Llama 3.1 (8B) pada benchmark MMLU. Penalaran langkah demi langkah (merah) menghasilkan variabilitas yang jauh lebih besar dibandingkan jawaban langsung (biru), menunjukkan bagaimana prompting rantai pemikiran memperkuat sensitivitas terhadap tanggal. Sumber

Efek tersebut juga teridentifikasi pada model proprietari, dengan GPT-5.1 menunjukkan fluktuasi akurasi hingga 4% pada tiga benchmark pilihan ganda selama seminggu pengujian pada Desember 2025. Para peneliti menggunakan prompt sistem kosong, menonaktifkan penalaran, dan mengatur keacakan ke nol – namun tanggal tetap dimasukkan secara otomatis oleh penyedia:

Akurasi GPT-5.1 berfluktuasi selama tujuh hari berturut-turut pada Desember 2025, meskipun prompt pengguna dan pengaturan model identik. Variasi terbesar terjadi pada GPQA (oranye), mencapai empat poin persentase antara hari terbaik dan terburuk. Garis putus-putus mewakili rata-rata akurasi setiap benchmark selama seminggu.

Akurasi GPT-5.1 berfluktuasi selama tujuh hari berturut-turut pada Desember 2025, meskipun prompt pengguna dan pengaturan model identik. Variasi terbesar terjadi pada GPQA (oranye), mencapai empat poin persentase antara hari terbaik dan terburuk. Garis putus-putus mewakili rata-rata akurasi setiap benchmark selama seminggu.

Para peneliti merekomendasikan menghapus tanggal dari prompt sistem bila memungkinkan, atau memperbaiki dan mendokumentasikannya, untuk memastikan perbandingan yang adil. Namun, mereka mencatat bahwa pengaruh yang berpusat pada tanggal mungkin lebih tertanam dalam:

‘Salah satu alasan kemungkinan sensitivitas tanggal adalah bahwa prompt sistem mungkin tetap selama fine-tuning terawasi (SFT) dan reinforcement learning dari umpan balik manusia (RLHF), membuat model menjadi rapuh terhadap perubahan sekecil apapun.’

Untuk menyelidiki masalah ini, para peneliti mencoba enam variasi penulisan berbeda untuk prompt sistem, dan menemukan bahwa perubahan ini memengaruhi akurasi sama besarnya dengan mengubah tanggal (0,78%). Oleh karena itu tanggal tampaknya memiliki pengaruh sebesar rekayasa prompt – kecuali bahwa ia berubah secara otomatis, tanpa pengguna menyadarinya.

Pendekatan lain dicoba untuk mengurangi masalah ‘tanggal saat ini’, termasuk pembelajaran few-shot (di mana model menerima lima contoh jawaban sebelum merespons). Ini membantu sedikit, menurunkan variasi rata-rata dari 2,52% menjadi 2,27%, namun tidak memperbaiki masalah tersebut.

Perubahan pada perangkat keras GPU, ukuran batch, presisi numerik, urutan jawaban, dan penulisan prompt sistem juga diuji. Dampak terbesar terlihat pada urutan jawaban dan penulisan prompt, yang paling mendekati pengaruh perubahan tanggal.

Hari Terakhir

Masuk akal untuk mengharapkan bahwa LLM/VLM akan memahami tanggal sejak awal percakapan; namun tampaknya tidak ada alasan eksplisit untuk menyertakannya dalam prompt sistem (rubrik tak terlihat yang memberlakukan pembatas, dan mengkondisikan perilaku LLM dengan cara yang tidak dapat diakses pengguna) ketika LLM dapat secara rutin melakukan panggilan RAG sub‑Kb untuk mengambil tanggal terbaru, sebagai rutinitas pemeliharaan kecil sebelum berinteraksi dengan pengguna.

Tidak diragukan lagi ada kemungkinan lain untuk menyelesaikan masalah ini; namun, karena penempatan tanggal saat ini ke dalam prompt sistem belum pernah dianggap sebagai masalah, kemungkinan besar belum ada atau sangat sedikit penyelidikan terkait hal ini.

Kencan Online

Untuk pengujian, prompt yang identik digunakan untuk setiap model, dengan hanya tanggal dalam prompt sistem yang diubah. Setiap hari tahun 2024 diuji, mulai 1 Januari hingga 31 Desember, dengan semua pengaturan lain tetap sama.

Enam tolok ukur digunakan: MMLU; GPQA; dan ARC-Challenge, untuk pertanyaan pilihan ganda (dinilai berdasarkan probabilitas token jawaban). GSM8K untuk matematika langkah demi langkah (jawaban akhir diperiksa); HumanEval untuk generasi kode Python (diuji unit); dan WMT untuk terjemahan Inggris‑ke‑Jerman; Inggris‑ke‑Finlandia; dan Inggris‑ke‑Ceko (output lengkap dievaluasi). Pertanyaan yang bergantung pada waktu dikecualikan.

Sembilan model diuji: Llama 3.1 Instruct (8B dan 70B); Gemma 3 Instruct (4B dan 27B); Qwen3 (4B); Qwen3-Next (80B); Phi-4 (14B); dan GPT-OSS (20B dan 120B).

Akurasi (persentase pertanyaan yang dijawab dengan benar) digunakan untuk menilai tes pilihan ganda dan matematika, sementara Kesalahan Kalibrasi yang Diharapkan (ECE) mengukur seberapa baik kepercayaan model sesuai dengan kinerjanya yang sebenarnya.

Kode diperiksa menggunakan pass@1 (persentase solusi kode yang dihasilkan yang lolos semua tes pada percobaan pertama); terjemahan dinilai menggunakan BLEU dan chrF.

Hasilnya mengonfirmasi hipotesis para peneliti: sekadar mengubah tanggal dalam prompt sistem mengubah tingkat akurasi model dalam menjawab pertanyaan yang sama.

Hasil pengujian yang menunjukkan bagaimana lima model terkemuka berkinerja pada MMLU saat tanggal prompt‑sistem diubah sepanjang 2024. Akurasi ditampilkan di bagian atas, dengan kesalahan kalibrasi yang diharapkan (ECE) di bawahnya. Semua lima model menunjukkan fluktuasi pada kedua ukuran, meskipun tidak ada perubahan lain pada kondisi pengujian. Skor ECE yang lebih rendah menunjukkan keselarasan yang lebih baik antara kepercayaan dan akurasi.

Hasil pengujian yang menunjukkan bagaimana lima model terkemuka berkinerja pada MMLU saat tanggal prompt‑sistem diubah sepanjang 2024. Akurasi ditampilkan di bagian atas, dengan kesalahan kalibrasi yang diharapkan (ECE) di bawahnya. Semua lima model menunjukkan fluktuasi pada kedua ukuran, meskipun tidak ada perubahan lain pada kondisi pengujian. Skor ECE yang lebih rendah menunjukkan keselarasan yang lebih baik antara kepercayaan dan akurasi.

Bersama dengan hasil lain yang ditampilkan sebelumnya dalam artikel, ini berpotensi menjadi kabar buruk bagi penilaian LLM, karena sebuah model dapat memperoleh skor lebih tinggi atau lebih rendah tergantung pada hari pengujiannya, yang mungkin mengubah posisinya di papan peringkat, tanpa ada peningkatan atau penurunan nyata dalam kemampuan model tersebut.

Kesimpulan

Masalah ini menyoroti kesenjangan antara sistem komputasi deterministik yang biasa kami gunakan sebelum sekitar tahun 2023, dan sifat yang sangat berbeda dari sistem AI berbasis difusi dan serupa yang telah berkembang, serta terus berkembang, sejak saat itu.

Resolusi tanggal pada dasarnya diselesaikan pada 1 Januari 1970, namun tampaknya telah kembali menghantui dunia komputasi dalam bentuk tanggal batas, di antara keprihatinan temporal lainnya.

 

*Berjudul ‘Mendate Model: Tanggal Tersembunyi dalam Prompt Sistem Mempengaruhi Evaluasi LLM’

Pertama dipublikasikan Jumat, 9 Oktober 2026

Penulis tentang pembelajaran mesin, spesialis domain dalam sintesis gambar manusia. Mantan kepala konten riset di Metaphysic.ai, hingga dibubarkannya menjadi Brahma.ai milik DNEG.
Website: martinanderson.ai
Kontak: martin@martinanderson.ai