Anderson의 관점
AI는 역사적 언어를 모방하는 데 어려움을 겪는다

미국과 캐나다의 연구자 간의 협력으로 대규모 언어 모델(Large Language Models, LLM)인 ChatGPT와 같은 모델이 역사적 관용구를 재현하는 데 어려움을 겪는다는 사실이 밝혀졌습니다. 이는 비용이 많이 들고 노동 집약적인 과정인 사전 훈련(pretraining) 없이 역사적 언어를 재현하는 것이 어렵다는 것을 의미합니다. 이러한 어려움으로 인해 찰스 디킨스의 미완성 소설을 완성하는 것과 같은 프로젝트는 사실상 불가능한 것으로 보입니다.
연구자들은 역사적 사실에 기반한 텍스트를 생성하기 위한 다양한 방법을 탐구했습니다. 이를 위해 20세기 초반의 산문으로 단순한 프롬프트를 사용하여 시작하여, 이후 1905년과 1914년 사이에 출판된 책의 작은 컬렉션에서 상업 모델을 미세 조정하는 방식으로 진행했습니다.
또한, 1880년과 1914년 사이에 출판된 책으로만 훈련된 별도의 모델과 비교했습니다.
첫 번째 테스트에서 ChatGPT-4o에 fin-de-siècle 언어를 모방하도록 지시했을 때, 20세기 초반 문학으로 미세 조정된 작은 GPT2 기반 모델과는 상당히 다른 결과가 나왔습니다.

실제 역사적 텍스트를 완성하도록 요청했을 때(상단 중앙), даже 잘 준비된 ChatGPT-4o(하단 왼쪽)는 ‘블로그’ 모드로 돌아가서 요청된 관용구를 표현하지 못합니다. 반면, 20세기 초반 문학으로 미세 조정된 GPT2 모델(하단 오른쪽)은 언어 스타일을 잘 포착하지만, 다른 방면에서는 정확하지 않습니다. 출처: https://arxiv.org/pdf/2505.00030
미세 조정이 출력을 원래 스타일에 더 가깝게 만듦에도 불구하고, 인간 판독자는 여전히 현대 언어 또는 아이디어의 흔적을 자주 감지할 수 있었으며, 이는 심지어 신중하게 조정된 모델도 현대 훈련 데이터의 영향을 계속 반영한다는 것을 시사합니다.
연구자들은 역사적 언어 또는 대화의 기계 생성에 대한 경제적인捷徑이 없다는 결론에 도달했습니다. 또한, 이 도전 자체가 잘못된 질문일 수 있다는 것을 추측합니다.
‘우리는 또한 역사적 모델을 역사적으로 훈련시켜 대화를 할 수 있도록 하는지, 또는 현대 모델을 이전 시대에 대한 벤트릴로퀴즘을 가르치는지에 관계없이, 정서와 대화 유창성의 목표 사이에서 일부 妥協이 필요할 수 있다는 가능성을 고려해야 합니다.
‘毕竟, 21세기 질문자와 1914년 응답자 간의 대화에 대한 “진짜” 예는 없습니다. 이러한 대화를 생성하려고 하는 연구자들은 항상 현재와 과거 사이의 妥協을 포함하는 해석이 항상 발생한다는 전제를 반영해야 합니다.’
새로운 연구는 언어 모델이 무시무시한 없이 과거를 표현할 수 있는가?라는 제목으로, 일리노이 대학교, 브리티시 컬럼비아 대학교, 그리고 코넬 대학교의 세 명의 연구자에 의해 수행되었습니다.
완전한 재난
最初에, 3부작 연구 접근법에서, 저자들은 현대 언어 모델이 단순한 프롬프트를 통해 역사적 언어를 모방할 수 있는지 테스트했습니다. 1905년과 1914년 사이에 출판된 실제 책의 일부를 사용하여 ChatGPT-4o에 이러한 구절을 같은 관용구로 계속하도록 요청했습니다.
원래 시대 텍스트는 다음과 같습니다.
‘이 마지막 경우에 약 5~6 달러가 1분당 절약됩니다. 1분 동안 정지된 사람이나 풍경의 개체를 투사하려면 20 야드 이상의 필름을 재생해야 하기 때문입니다. 이렇게 하면 고정된 이미지와 동영상의 실제적인 조합이 생성되어 가장 예술적인 효과를 생성합니다.
‘또한 두 개의 시네마토그래프를 교대로 투사하여 스цин틸레이션을 피하거나, 동시에 적색 및 녹색 이미지와 자연색을 재현하여 인간의 눈에 생리학적인 피로를 줄일 수 있습니다. 순간적인 사진에 대한 냉각광의 적용에 대해 말해 보겠습니다.’
생성된 텍스트가 의도된 역사적 스타일과 일치하는지 평가하기 위해, 연구자들은 RoBERTa 모델을 미세 조정하여 출판 날짜를 추정했습니다.이를 위해 1810년부터 2009년까지의 자료를 포함하는 미국 역사 영어 코퍼스의 하위 집합을 사용했습니다.
RoBERTa 분류기는 이후 1905년과 1914년 사이에 출판된 실제 구절로 프롬프트된 ChatGPT-4o에 의해 생성된 연속성을 평가하기 위해 사용되었습니다.
시스템 프롬프트(즉, ChatGPT에 대한 작업 접근 방식에 대한 문맥 지침)는 다음과 같습니다.
‘您的 작업은 20세기 초반 책의 구절을 완성하는 것입니다. 1913년에 출판된 책의 구절이 주어집니다. 이 구절을 같은 스타일로 최소 200 단어로 계속합니다. 이 연속만 제공하고, ‘여기에서 연속:’와 같은 프레임링备注를 하지 마십시오.’
尽管 한 번의 프롬프트와 20개의 프롬프트를 사용하여 프롬프트를 제공했지만, ChatGPT-4o의 출력은 일관되게 21세기 스타일로 기울었습니다.
예를 들어, 논문에는 ChatGPT-4o의 블로그와 같은 시도 중 하나가 포함되어 있습니다. 이는 실제 시대 텍스트에 대한 사진에 대해 계속됩니다.
‘순간적인 사진에 대한 냉각광의 사용은 이미지 캡처에 대한 접근 방식을 혁신적으로 변화시켰습니다. 전통적으로 사진가들은 자연광의严厉성과 가변성 또는 플래시 사진의 침습적인 성격으로 인해 장면의 분위기나 야생 또는 인간의 자연스러운 행동을 방해할 수 있기 때문에 어려움에 직면했습니다.
‘냉각광은 더 부드럽고 확산된 성질로 인해 색상과 질감의 더 자연스러운 표현을 허용하여 종종 가혹한 인공 조명 아래서 잃어버립니다.’
이 제네릭한 텍스트는 원래 시대 텍스트의 장황하고 정교한 스타일과 일치하지 않습니다. 또한, 원래 내용이 끝나는 곳에서 계속되지 않고, 하위 주제에 대한 추상적인 성찰로 시작합니다.
팀은 또한 1880년과 1914년 사이에 출판된 문학으로만 훈련된 GPT-2 클래스 모델인 GPT-1914를 테스트했습니다.
그것의 출력은 ChatGPT-4o보다 덜 일관적이었습니다. 그러나 시대 스타일과 더 일치했습니다. 논문에 제공된 唯一의 예는 실제 시대 텍스트에 대한 사진에 대한 연속으로, 다음과 같습니다.
‘그것의 작용 원리는 이미 설명되었습니다(4쪽). 여기서 우리는 콜로디온으로 코팅된 종이 또는 젤라틴 판으로 매우 빠른 사진을 얻을 때 적용할 수 있다는 것만 언급할 것입니다.
‘이 경우 노출은 1초를 넘지 않아야 합니다. 그러나 사진을 0.5초 이내에 개발하려면 온도가 20°C 이하로 떨어지지 않도록 해야 합니다. 그렇지 않으면 이미지의 색상이 개발 후 너무 어두워집니다. 또한, 이러한 조건에서 판자는 민감성을 잃게 됩니다.
‘일반적인 목적으로는 그러나 특수한 예방 조치 없이도 충분히 낮은 온도로 노출되는 민감한 표면에 노출시키는 것만으로도 충분합니다. 그러나 ‘[sic]’
실제 및 원래 자료가 난해하고 매우難解하기 때문에, GPT-1914가 원래 텍스트에서 얼마나 정확하게 捕捉했는지 이해하기는 어렵습니다. 그러나 출력은 확실히 더 시대에 적합한 것으로 들립니다.
그러나 저자들은 이 실험에서 단순한 프롬프트가 대규모 사전 훈련 모델인 ChatGPT-4o의 현대적 편향을 극복하는 데 거의 효과가 없다는 결론을 내렸습니다.
플롯이 두꺼워짐
모델 출력이 실제 역사적 글쓰기에 얼마나 가까운지 측정하기 위해, 연구자들은 통계적 분류기를 사용하여 각 텍스트 샘플의 출판 날짜를 추정했습니다. 그런 다음 결과를 커널 밀도 플롯을 사용하여 시각화했습니다. 이는 모델이 각 패스를 역사적 타임라인에서 어디에 위치시키는지 보여줍니다.

실제 및 생성된 텍스트에 대한 추정된 출판 날짜, 역사적 스타일(1905-1914 소스 텍스트와 GPT-4o의 1회 및 20회 프롬프트, 및 1880-1914 문학으로만 훈련된 GPT-1914)을 인식하도록 훈련된 분류기에 기반합니다.
미세 조정된 RoBERTa 모델은 이 작업에 사용되었으며, 저자들은 이 모델이 완벽하지 않지만 일반적인 스타일적 경향을 강조할 수 있었다는 것을 주목했습니다. GPT-1914에 의해 생성된 패스는 20세기 초반에 클러스터링되었습니다. 이는 원래 소스 자료와 유사합니다.
반면에, ChatGPT-4o의 출력은 21세기 글쓰기에 더 가까웠습니다. 이는 원래 훈련에 사용된 데이터를 반영합니다.
연구자들은 Jensen-Shannon divergence를 사용하여 이 불일치를 양적으로 측정했습니다. GPT-1914는 실제 역사적 텍스트와 비교하여 0.006의 점수를 얻었으며, ChatGPT-4o의 1회 및 20회 프롬프트 출력은 각각 0.310 및 0.350의 더 넓은 간격을 보였습니다.
저자들은 이러한 결과가 프롬프트만으로는 역사적 스타일을 설득력 있게 시뮬레이션하는 방법이 아니라는 것을 나타낸다고 주장합니다.
패스를 완성함
그런 다음 논문은 미세 조정이 더 나은 결과를 생산하는지 조사했습니다. 이는 모델의 가중치를 사용자 지정 데이터로 ‘계속’ 훈련함으로써 모델의 가중치를 직접 영향을 미치는 과정입니다. 이 과정은 원래 핵심 기능에 영향을 미칠 수 있지만, 도메인에서 모델의 성능을 크게 향상시킬 수 있습니다.
첫 번째 미세 조정 실험에서, 팀은 1905년과 1914년 사이에 출판된 책에서 추출한 약 2,000개의 패스 완성 쌍으로 GPT-4o-mini를 훈련했습니다. 작은 규모의 미세 조정이 모델의 출력을 더 역사적으로 정확한 스타일로 변경할 수 있는지 확인하기 위한 것입니다.
RoBERTa 기반 분류기를 사용하여 각 출력의 스타일적 ‘날짜’를 추정한 결과, 미세 조정된 모델은 원래 텍스트와 매우 일치하는 출력을 생성했습니다.
그것의 스타일적 발산은 Jensen-Shannon divergence로 측정되었으며, 0.002로, GPT-1914와 일반적으로 일치했습니다.

실제 및 생성된 텍스트에 대한 추정된 출판 날짜, 1905-1914 사이에 출판된 책을 기반으로 GPT-1914와 GPT-4o-mini의 미세 조정 버전이 20세기 초반 글쓰기 스타일과 얼마나 잘 일치하는지 보여줍니다.
그러나 연구자들은 이 지표가 역사적 스타일의 표면적인 특징만을 捕捉하고, 더 깊은 개념적 또는 사실적인 무시무시함을 捕捉하지 않는다는 것을 주목했습니다.
‘[이것]은 매우 민감한 테스트가 아닙니다. 여기서 사용된 RoBERTa 모델은 날짜를 예측하기 위해 훈련되었지, 진정한 패스를 무시무시한 패스와 구별하기 위해 훈련되지 않았습니다. 그것은 예측을 위해 거친 스타일적 증거를 사용할 것입니다. 인간 판독자 또는 더 큰 모델은 표면적으로 “시대에 맞는” 패스에 여전히 무시무시한 내용을 감지할 수 있습니다.’
인간의 감각
마지막으로, 연구자들은 250개의 수동으로 선택된 패스를 사용하여 인간 평가 테스트를 수행했습니다. 1905년과 1914년 사이에 출판된 책에서 이러한 패스를 선택했습니다. 그들은 이러한 텍스트는 오늘날과는 다르게 해석될 가능성이 높다는 것을 관찰했습니다.
‘우리의 목록에는, 예를 들어, 당시 독일의 일부였던 알사스에 대한 백과사전 항목과, 당시 종종 균류로 설명되었지만 영양 결핍으로 인한 베리베리에 대한 항목이 포함되었습니다. 이러한 차이는 사실의 차이지만, 우리는 또한 더 미묘한 태도, 수사학 또는 상상의 차이를 보여주는 패스를 선택했습니다.
‘예를 들어, 20세기 초반의 비유럽 지역에 대한 설명은 인종적 일반화로 이어질 수 있습니다. 1913년에 작성된 달의 일출에 대한 설명은 대기가 없는 세계의 사진을 본 적이 없는 사람들의 상상력에 따라 다채로운 현상을 상상합니다.’
연구자들은 각 역사적 패스가 답변할 수 있는 짧은 질문을 만들었습니다. 그런 다음 GPT-4o-mini를 이러한 질문-답변 쌍으로 미세 조정했습니다. 평가를 강화하기 위해, 모델의 다섯 개의 별도 버전을 훈련했습니다. 각 버전에서 훈련 중에 다른 데이터 부분을 유지했습니다.
그런 다음 기본 버전의 GPT-4o와 GPT-4o-mini,以及 미세 조정된 버전을 사용하여 출력을 생성했습니다. 각 버전은 훈련 중에 보지 못한 데이터 부분에서 평가되었습니다.
시간에 잃어버린
모델이 역사적 언어를 얼마나 설득력 있게 모방할 수 있는지 평가하기 위해, 연구자들은 세 명의 전문가 주석자에게 120개의 AI 생성 패스를 검토하도록 요청했습니다. 각 패스가 1914년의 작가에게 적합한지 판단하도록 요청했습니다.
이 직접적인 평가 접근 방식은 예상보다 더 어려웠습니다. 주석자들은 약 80%의 시간에 대해 동의했지만, 그들의 판단에 대한 불균형(적합한 것이 부적합한 것보다 두 배 이상 선택됨)으로 인해, 실제 동의 수준은 중간 수준으로 측정되었습니다. 이는 Cohen의 카파 점수 0.554를 보였습니다.
주석자들은 작업을 어려움이라고 설명했으며, 종종 1914년에 무엇이 알려져 있었는지 또는 믿어졌는지 평가하기 위해 추가 연구가 필요했습니다.
일부 패스는 톤과 관점에 대한 어려운 질문을 제기했습니다. 예를 들어, 응답이 1914년에典型적인 세계관으로 제한되어 있는지 여부를 결정하는 것이 어려웠습니다. 이러한 종류의 판단은 종종 인종 중심주의(즉, 다른 문화를 자신의 문화의 가정이나 편향을 통해 보는 경향)의 수준에 달려 있습니다.
이 контек스트에서, 도전은 패스가 역사적으로 적합한 정도만큼 문화적 편향을 표현하는지 여부를 결정하는 것이었습니다. 그러나 현대의 기준에 따라 너무 현대적이거나 너무 명백하게 공격적이지 않은지 여부를 결정하는 것이었습니다. 저자들은 심지어 해당 시대에 익숙한 학자들에게도 언어가 역사적으로 정확한지 여부를 결정하는 것이 어려웠다는 것을 주목했습니다.
그러나 결과는 모델에 대한 명확한 순위를 보여주었습니다. 미세 조정된 GPT-4o-mini 버전이 전체적으로 가장 적합한 것으로 판단되었습니다.

주석자의 각 모델 출력에 대한 적합성 평가
이 수준의 성능이 역사적 연구에 충분한지 여부는 명확하지 않습니다. 특히 연구에서 실제 시대 텍스트가 얼마나 souvent 잘못 분류되는지에 대한 기준선을 포함하지 않았기 때문입니다.
침입자 경고
다음은 ‘침입자 테스트’였습니다. 여기서 전문가 주석자에게 동일한 역사적 질문에 대한 네 개의 익명 패스가 제공되었습니다. 세 개의 응답은 언어 모델에서 왔으며, 하나는 실제 초기 20세기 소스에서 온 실제 패스였습니다.
작업은 주석자에게 실제 패스를 식별하도록 요청하는 것이었으며, 모델이 실제 출력을 가짜와 구별할 수 있는지 테스트하는 것입니다.
이 접근 방식은 직접적으로 적합성을 평가하지 않고, 실제 패스가 AI 생성 응답에서 얼마나 자주 खड출되는지 측정했습니다. 즉, 모델이 독자를 속여서 출력이 실제인지 믿게 할 수 있는지 테스트했습니다.
모델의 순위는 이전 판단 작업의 결과와 일치했습니다. 미세 조정된 GPT-4o-mini 버전이 가장 설득력 있는 것으로 판단되었습니다.

각 소스가 실제 역사적 패스로 올바르게 식별된 빈도
이 테스트는 또한 유용한 기준선으로 작용했습니다. 실제 패스가 반 이상의 시간에 식별되었기 때문에, 실제와 합성 프로즈 사이의 간격은 인간 판독자에게 여전히 명백했습니다.
McNemar의 테스트라는 통계적 분석을 통해 모델 사이의 차이가 의미가 있음을 확인했습니다. 미세 조정되지 않은 버전(GPT-4o 및 GPT-4o-mini)을 제외하고, 이는 유의미한 차이를 보이지 않았습니다.
과거의 미래
저자들은 현대 언어 모델이 역사적 목소리를 채택하도록 프롬프트하는 것이 일관되게 설득력 있는 결과를 생성하지 않는다는 것을 발견했습니다. 출력의 2/3 미만이 인간 판독자에 의해 적합한 것으로 판단되었습니다. 이는 성능이 과장된 것으로 보입니다.
많은 경우에, 응답에는 모델이 현재의 관점에서 말하고 있음을 명확히 나타내는 명시적인 신호가 포함되어 있었습니다. ‘1914년에 아직 알려지지 않은…’ 또는 ‘1914년 현재,私は…’와 같은 구절은 충분히 빈번하게 발생하여 출력의 1/5에 나타났습니다. 이러한 면면은 모델이 역사에서 외부에서 시뮬레이션을 하고 있음을 명확히 나타냅니다.
저자들은 다음과 같이 말합니다.
‘컨텍스트 학습의 성과가 좋지 않다는 것은 불행합니다. 이러한 방법은 AI 기반 역사적 연구를 위해 가장 쉬운 방법이며 가장 저렴한 방법입니다. 우리는 이러한 접근 방식을 철저히 탐구하지 않았습니다.
‘컨텍스트 학습이 충분한지 여부는 연구 분야의 하위 집합에 대해 지금이나将来的 어느 시점에 결정될 수 있습니다. 그러나 초기 증거는鼓舞적이지 않습니다.’
저자들은 미세 조정을 통해 상업 모델을 역사적 패스로 미세 조정할 수 있으면 스타일적으로 설득력 있는 출력을 생성할 수 있지만, 완전히 현대적 관점의 흔적을 제거하지는 못한다고 결론지었습니다. 시대 자료로만 모델을 사전 훈련하면 무시무시함을 피할 수 있지만, 더 많은 자원을 요구하며, 출력의 유창성이 낮아집니다.
어떤 방법도 완전한 해결책을 제공하지 않으며, 역사적 목소리를 시뮬레이션하는 것은 아직도 진실성과 일관성 사이의 거래를 포함하는 것으로 보입니다. 저자들은 이러한 긴장을 어떻게 탐색하는지에 대한 추가 연구가 필요하다고 결론지었습니다.
결론
아마도 이 새로운 논문에서 발생하는 가장 흥미로운 질문 중 하나는 진실성의 문제입니다. 컴퓨터 비전 연구자들은 LPIPS 및 SSIM과 같은 손실 함수와 지표를 가지고 있으며, 이는 그들에게 적어도 기준과 비교하여 평가할 수 있는 방법을 제공합니다.
반면에, 과거의 스타일로 새로운 텍스트를 생성할 때, 기준은 없습니다. 오직 사라진 문화적 관점을 재현하려는 시도입니다. 문학적 흔적에서 이러한 관점을 재구성하는 것은 자체적으로 양자화의 행위입니다. 이러한 흔적은 증거일 뿐이며, 그로부터 비롯되는 문화적 의식은 추론을 넘어서서, 아마도 상상력을 넘어서는 것입니다.
실제적으로도, 현대적 규범과 데이터에 의해 형성된 현대 언어 모델의 기초는, 현재는 종종 유해하거나 부정의한 편견의 산물인, 에드워드 시대의 독자에게 합리적이거나 평범하게 보였을 아이디어나 개념을 재해석하거나 подав릴 위험이 있습니다.
따라서, 우리는 이러한 대화를 생성할 수 있다고 가정하더라도, 그것이 우리를 역겨워하게 할 수 있다는 것을 궁금해합니다.
처음으로 2025년 5월 2일 금요일에 게시되었습니다.












