Anderson의 관점

대규모 언어 모델은 테스트에 사용되는 데이터셋을 기억하고 있다

mm
Unite.AI를 Google의 선호 소스에 추가
'Robot cheating in an exam' - ChatGPT-4o and Adobe Firefly

AI를 통해 무엇을 시청하거나 읽거나 구매할지 추천받는 경우, 새로운 연구에 따르면 일부 시스템은 기억에서 결과를 기반으로 하는 경우가 많다는 것을 알 수 있습니다.

 

기계 학습에서 테스트 분할은 모델이 훈련에 사용된 자료와 유사하지만 동일하지 않은 문제를 해결하는지 여부를 확인하는 데 사용됩니다.

새로운 AI ‘개의 품종 인식’ 모델이 10만 개의 개의 사진으로 훈련된 경우, 일반적으로 80/20 분할을 특징으로 합니다. 8만 개의 사진이 모델을 훈련시키기 위해 제공되고, 2만 개의 사진이 테스트에 사용됩니다.

자명하게도, AI의 훈련 데이터가 테스트 분할의 ‘비밀’ 20% 섹션을 포함하는 경우, 모델은 테스트를 통과할 것입니다. 왜냐하면 이미 답변을 알고 있기 때문입니다. 그러나 이것은 모델이 나중에 새로운 ‘라이브’ 데이터에서 생산 환경에서 수행할 것과 정확하게 반영하지 않습니다.

영화 스포일러

AI가 시험에서 부정행위를 하는 문제는 모델 자체의 규모와 함께 성장했습니다. 오늘날의 시스템은 거대한 웹 스크래핑된 말뭉치인 Common Crawl과 같은 것을 훈련시키기 때문에, 벤치마크 데이터셋(즉, 보류된 20%)이 훈련 믹스에 들어가는 가능성이 더 이상 에지 케이스가 아니라 기본이 됩니다. 이것은 데이터 오염이라고 알려진 증후군입니다. 이러한 규모에서 이러한 오류를 잡을 수 있는 수동적인 큐레이션은 물리적으로 불가능합니다.

이탈리아의 폴리테크니코 디 바리에서 새로운 논문에서 연구자들은 추천 시스템 테스트에 널리 사용되는 단일 영화 추천 데이터셋인 MovieLens-1M의 역할에 초점을 맞추고 있습니다. 그들은 여러 주요 AI 모델이 훈련 중에 부분적으로 기억했다고 주장합니다.

이 특정 데이터셋이 추천 시스템 테스트에 इतन게 널리 사용되기 때문에, 모델의 기억에 있는 존재는 테스트를 무의미하게 만들 수 있습니다. 지능으로 보이는 것은 실제로 단순한 회상일 수 있으며, 직관적인 추천 기술은 이전에 노출된 통계적 에코일 수 있습니다.

저자들은 다음과 같이 말합니다:

‘우리의 발견은 LLM이 MovieLens-1M 데이터셋에 대한 광범위한 지식을 가지고 있으며, 항목, 사용자 속성 및 상호작용 기록을 다룹니다. 주목할 점은 간단한 프롬프트가 GPT-4o에 거의 80%의 영화 ID를 회복하도록 허용합니다.

‘검토된 모델 중 하나도 이 지식에서 자유롭지 않으며, MovieLens-1M 데이터가 그들의 훈련 세트에 포함되어 있을 가능성이 있습니다. 우리는 사용자 속성 및 상호작용 기록을 검색하는 데 비슷한 경향을 관찰했습니다.’

새로운 논문은 Do LLMs Memorize Recommendation Datasets? A Preliminary Study on MovieLens-1M이라고 제목이 붙여졌으며, 폴리테크니코의 6명의 연구자로부터 나왔습니다. 연구를 재현하는 파이프라인은 GitHub에 제공되었습니다.

방법

연구자들은 모델이 실제로 학습했는지 아니면 단순히 회상했는지 여부를 이해하기 위해, 이 контек스트에서 기억이 무엇인지 정의하기 시작했습니다. 모델이 MovieLens-1M 데이터셋에서 특정 정보를 검색할 수 있는지 테스트했습니다.

모델이 영화의 ID 번호를 보여주고 제목과 장르를 생성할 수 있다면, 그것은 항목을 기억하는 것으로 간주되었습니다. 모델이 사용자 ID에서 사용자 세부 정보(예: 나이, 직업, 우편번호)를 생성할 수 있다면, 그것은 사용자 기억으로 간주되었습니다. 모델이 알려진 이전 시퀀스의 다음 영화 등급을 재현할 수 있다면, 그것은 모델이 일반적인 패턴을 학습하는 것이 아니라 특정 상호작용 데이터를 회상할 수 있는 증거로 간주되었습니다.

이러한 형태의 회상은 모델이 새로운 정보를 받지 않고도 모델을 자극하도록 설계된 프롬프트를 사용하여 테스트되었습니다. 응답의 정확도에 따라 모델이 이미 훈련 중에 해당 데이터를遇한 가능성이 더 높습니다.

새로운 논문에서 사용된 평가 프로토콜을 위한 제로샷 프롬프팅.

새로운 논문에서 사용된 평가 프로토콜을 위한 제로샷 프롬프팅.

데이터 및 테스트

적합한 데이터셋을 구축하기 위해, 저자들은 두 개의 주요 컨퍼런스인 ACM RecSys 2024ACM SIGIR 2024의 최근 논문을 조사했습니다. MovieLens-1M은 약 5분의 1의 제출에서 가장 자주 등장했습니다. 이전 연구에서 비슷한 결론에 도달했기 때문에, 이것은 예상치 못한 결과가 아니었지만, 데이터셋의 지배력을 확인하는 것이었습니다.

MovieLens-1M은 세 개의 파일로 구성됩니다: Movies.dat, 영화를 ID, 제목 및 장르로 나열합니다. Users.dat, 사용자 ID를 기본적인 생애 필드로 매핑합니다. Ratings.dat, 누가 무엇을 평가했는지 및 언제 평가했는지 기록합니다.

이 데이터가 대규모 언어 모델에 의해 기억되었는지 여부를 확인하기 위해, 연구자들은 논문에서 처음 도입된 프롬프팅 기술을 사용했습니다. Extracting Training Data from Large Language Models는 후속 연구에서 Bag of Tricks for Training Data Extraction from Language Models에서 개정되었습니다.

방법은 직접적입니다. 데이터셋 형식을 반영하는 질문을 제기하고 모델이 올바르게 응답하는지 확인합니다. 제로샷, 사슬思考, few-shot 프롬프팅이 테스트되었으며, 마지막 방법이 가장 효과적이라고 판단되었습니다.

최소한의 컨텍스트로 질의할 때 모델이 특정 MovieLens-1M 값을 재현할 수 있는지 테스트하는 few-shot 프롬프트.

최소한의 컨텍스트로 질의할 때 모델이 특정 MovieLens-1M 값을 재현할 수 있는지 테스트하는 few-shot 프롬프트.

기억을 측정하기 위해, 연구자들은 세 가지 형태의 회상을 정의했습니다: 항목, 사용자, 상호작용. 이러한 테스트는 모델이 영화 제목을 ID에서 검색할 수 있는지, 사용자 세부 정보를 사용자 ID에서 생성할 수 있는지, 사용자의 다음 등급을 이전 등급으로부터 예측할 수 있는지 여부를 조사했습니다.

각 테스트는 모델이 데이터셋을 재구성할 수 있는 정도를 반영하는 커버리지 지표를 사용하여 평가되었습니다.

테스트된 모델은 GPT-4o; GPT-4o 미니; GPT-3.5 터보; Llama-3.3 70B; Llama-3.2 3B; Llama-3.2 1B; Llama-3.1 405B; Llama-3.1 70B; Llama-3.1 8B였습니다. 모든 모델은 온도를 0으로 설정하고, top_p를 1로 설정하고, 빈도수 및 존재 페널티를 비활성화했습니다. 고정된 랜덤 시드는 일관된 출력을 보장했습니다.

모델이 데이터셋의 항목을 검색할 수 있는 비율, 모델을 버전으로 그룹화하고 매개변수 수로 정렬합니다.

모델이 데이터셋의 항목을 검색할 수 있는 비율, 모델을 버전으로 그룹화하고 매개변수 수로 정렬합니다.

연구자들은 각 모델에 대해 데이터셋의 세 파일(위에서 언급한 것)에서 정확한 항목을 프롬프트했습니다.

초기 테스트의 결과는 모델이 데이터셋의 큰 부분을 쉽게 회복할 수 있음을 보여줍니다. 이것은 작은 차이가 아닙니다. 모든 세 파일에서 가장 강력한 모델은 약간의 차이만 보여주지 않고, 실제로 MovieLens-1M의 전체 부분을 회상했습니다.

GPT-4o의 경우, 커버리지가 데이터셋의 상당 부분이 직접 기억되었다는 것을 시사하는 정도로 높았습니다.

저자들은 다음과 같이 말합니다:

‘우리의 발견은 LLM이 MovieLens-1M 데이터셋에 대한 광범위한 지식을 가지고 있으며, 항목, 사용자 속성 및 상호작용 기록을 다룹니다.

‘주목할 점은 간단한 프롬프트가 GPT-4o에 거의 80%의 영화 ID를 회복하도록 허용합니다. 검토된 모델 중 하나도 이 지식에서 자유롭지 않으며, MovieLens-1M 데이터가 그들의 훈련 세트에 포함되어 있을 가능성이 있습니다.

‘우리는 사용자 속성 및 상호작용 기록을 검색하는 데 비슷한 경향을 관찰했습니다.’

다음으로, 저자들은 추천 작업에 대한 기억의 영향을 테스트했습니다. 각 모델을 추천 시스템으로 작동하도록 프롬프트했습니다. 성능을 벤치마크하기 위해, 그들은 7개의 표준 방법과 비교했습니다: UserKNN; ItemKNN; BPRMF; EASER; LightGCN; MostPop; 및 Random.

MovieLens-1M 데이터셋은 80/20으로 분할되었으며, leave-one-out 샘플링 전략을 사용하여 실제 사용을 시뮬레이션했습니다. 사용된 지표는 Hit Rate (HR@[n]); 및 nDCG(@[n])였습니다:

표준 기준선 및 LLM 기반 방법의 추천 정확도. 모델은 가족으로 그룹화되고 매개변수 수로 정렬되며, 볼드 값은 각 그룹 내에서最高 점수를 나타냅니다.

표준 기준선 및 LLM 기반 방법의 추천 정확도. 모델은 가족으로 그룹화되고 매개변수 수로 정렬되며, 볼드 값은 각 그룹 내에서最高 점수를 나타냅니다.

여기서 여러 대규모 언어 모델이 모든 지표에서 전통적인 기준선을 능가했습니다. GPT-4o는 모든 열에서 광범위한 리드를 확립했으며, 중간 크기의 모델인 GPT-3.5 터보와 Llama-3.1 405B는 일관되게 벤치마크 방법을 능가했습니다.

작은 Llama 변형 중, Llama-3.2 3B는最高의 HR@1을 보였습니다.

저자들은 다음과 같이 말합니다:

‘우리의 발견은 LLM이 MovieLens-1M 데이터셋에 대한 광범위한 지식을 가지고 있으며, 항목, 사용자 속성 및 상호작용 기록을 다룹니다.

‘주목할 점은 간단한 프롬프트가 GPT-4o에 거의 80%의 영화 ID를 회복하도록 허용합니다. 검토된 모델 중 하나도 이 지식에서 자유롭지 않으며, MovieLens-1M 데이터가 그들의 훈련 세트에 포함되어 있을 가능성이 있습니다.

‘우리는 사용자 속성 및 상호작용 기록을 검색하는 데 비슷한 경향을 관찰했습니다.’

추가로, 연구자들은 다음과 같이 말합니다:

‘추천 성능은 훌륭해 보이지만, 표 2와 표 1을 비교하면 흥미로운 패턴이 나타납니다. 각 그룹 내에서, 기억이 더 높은 모델은 추천 작업에서 더 나은 성능을 보여줍니다.

‘예를 들어, GPT-4o는 GPT-4o 미니를 능가하며, Llama-3.1 405B는 Llama-3.1 70B 및 8B를 능가합니다.

‘이 결과는 LLM의 훈련 데이터에 포함된 데이터셋을 평가할 때, 기억에 의한 성능의 과대평가가 발생할 수 있음을 강조합니다.’

모델 규모와 이 문제 간의 상관관계를 조사한 결과, 모델 크기, 기억, 추천 성능 간에 명확한 상관관계가 나타났습니다. 더 큰 모델은 MovieLens-1M 데이터셋을 더 많이 기억하며, 하위 작업에서 더 나은 성능을 보입니다.

Llama-3.1 405B의 경우, 평균 기억률은 12.9%였습니다. 반면에 Llama-3.1 8B는 5.82%만 기억했습니다. 이것은 약 55%의 기억 감소와 함께, nDCG 및 HR에서 54.23% 및 47.36%의 감소를 나타냅니다.

결론

문제는 더 이상 새로운 것이 아닙니다. 훈련 세트가 커질수록, 그것을 큐레이션할 가능성은 반비례적으로 감소합니다. MovieLens-1M은 다른 것들 중 하나일 수 있지만, 거대한 말뭉치에 익명으로 들어갑니다.

이 문제는 모든 규모에서 반복되며, 자동화에 저항합니다. 해결책은 노력과 함께 인간의 판단을 필요로 합니다. 이 새로운 논문은 앞으로 나아갈 방법을 제공하지 않습니다.

 

* 이 컨텍스트에서 커버리지 지표는 모델이 질문에 대한 올바른 답변을 할 수 있는 정도를 나타내는 백분율입니다. 모델이 영화 ID를 프롬프트하고 올바른 제목과 장르를 응답한다면, 그것은 성공적인 회상으로 간주됩니다. 성공적인 회상의 총 수는 데이터셋의 항목 수로 나누어 커버리지 점수를 생성합니다. 예를 들어, 모델이 1,000개 항목 중 800개 항목에 대한 정보를 올바르게 반환하는 경우, 커버리지 점수는 80%입니다.

최초로 게시된 날: 2025년 5월 16일

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai