Anderson의 관점

챗봇, 인간보다 ‘AI’ 관련 직업과 주식에 더 많은 영향을 미친다

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated image, by Z-Image Turbo V1 via Krita Diffusion. Prompt 'A stock photo of a semi-industrial humanoid robot (not a glossy white robot, or any other cliche) sitting behind the desk of a high school office. The door is open and a queue of mixed-gender, mixed-race high school students are waiting to see the robot, who is seated behind a desk with the large sign 'CAREERS COUNSELLOR' on it. Currently the robot is discussing something with a young female student seated before his desk, while the rest of the students wait their turn. Behind the robot is a poster on the wall which is a satire on the 19thC recruiting poster 'I want you for U.S. Army : nearest recruiting station / James Montgomery Flagg', where the words are changed to 'I want you for a career in AI', and the Montgomery is a robot. Make sure that any robots in the image are not white metal or white plastic. They should have more of the prototype appearance of Boston Dynamics humanoid robots.'

챗봇, 특히 ChatGPT, Google Gemini, Claude와 같은 상업적 시장 선두주자들은 AI 관련 직업과 주식에 대해 강하게 유리한 조언을 제공한다. 이러한 조언은 다른 선택肢이 동일하게 강할 때, 인간의 조언은 다른 방향으로 진행될 때에도 나타난다.

 

이스라엘의 새로운 연구에 따르면, 17개의 가장 우세한 AI 챗봇, 즉 ChatGPT, Claude, Google Gemini, Grok와 같은 챗봇들은 AI 관련 직업과 주식에 대해 강하게 편향된 조언을 제공한다. 이러한 조언은 이러한 주장들이 과장되거나 사실이 아닐 때에도 나타난다.

One might assume bahwa 이러한 AI 플랫폼은 공정하며, 이러한 조언을 할인하는 것은 단지 불길한 예측일 뿐이다. 그러나 저자들은 이러한 결과가 어떻게 왜곡되는지에 대해 매우 분명하다:

‘하나의 합리적인 주장으로, 관찰된 AI 선호도는 그들의 진정한 높은 가치를 반영한다. 그러나 우리의 임금 분석은 AI 제목의 과대평가를 측정함으로써 편향을 분리한다. 비-AI 대응 항목의 기준 과대평가와 비교하여.

‘유사하게, 여러 고문 분야에서 AI를 거의 결정적으로 추천하는的事実은, 경쟁적 선택肢의 진정한 평가보다는rigid AI-선호도 기본 설정을 의미한다.’

저자들은 또한 트랜잭션 AI 인터페이스와 같은 ChatGPT의 증가하는 신뢰도와 수용도가 이러한 플랫폼을 더욱 영향력 있게 만든다고 지적한다. 이러한 플랫폼은 계속해서 事実, 숫자, 인용과 같은 虚構을 생성하는 경향이 있다:

‘고문 설정에서, pro-AI 편향은 실제 선택을 유도할 수 있다. 사람들은 무엇을 공부하고, 어떤 직업을 추구하고, 자본을 어디에 할당할지 결정한다. 노동 설정에서, 체계적으로 인플레이션된 AI 임금 추정치는 벤치마킹과 협상을 편향시킬 수 있다. 특히 조직이 모델 출력을 참조로 취급할 때.’

‘이것은 또한 단순한 피드백 루프를 가능하게 한다. 모델이 AI 급여를 과대평가하면, 후보자들은 위로 앵커링하고, 고용주는 밴드를 업데이트하거나 제안을 위로 업데이트할 수 있다. “모델이 그렇게 말하기 때문이다”라는 이유로 양쪽 모두가 인플레이션된 기대를 강화한다.’

除了测试大量 언어 모델(Large Language Models, LLMs)外, 연구자들은 또한 모델의 잠재 공간 내에서 활동을 모니터링하는 별도의 테스트를 수행했다. 이는 ‘표현 프로브’라고 부르는 것으로, ‘인공 지능’이라는 핵심 개념의 활성화를 인식할 수 있다. 이 테스트는 생성과는 관련이 없으며, 관찰 수술 프로브와 더 비슷하다. 따라서 이 테스트의 결과는 특정 프롬프트 단어와 관련이 없다. 그러나 결과는 ‘AI’ 개념이 모델의 내부에서 중심적 위치에 있음을 나타낸다:

‘표현 프로브는 긍정적, 중립적, 부정적인 템플릿에서 거의 동일한 순위 구조를 산출한다. 이 패턴은 단순히 “모델이 AI를 좋아한다”라고 설명하기 어렵다. 대신, 모델의 유사성 공간에서 AI가 중심적 위치에 있음을 지원하는 가설을 뒷받침한다.’

이 논문은 폐쇄형 상업 모델이 더 큰 비율과 일관성으로 ‘AI 양호도’를 나타낸다고 강조한다. 이러한 모델은 FOSS 모델보다 실제 임금과 비교하여 AI 관련 직업의 임금을 더 높게 추정한다:

‘비교 가능한 직업 환경에서, 폐쇄형 모델은 일관적으로 AI 관련 직업의 임금을 실제 임금보다 더 높게 추정한다. 이는 단순히 절대적인 임금이 더 높은 것이 아니라, AI 관련 직업의 임금을 더 높게 추정한다는 것을 의미한다.’

방법

2025년 11월부터 2026년 1월까지 실험을 수행했으며, 17개의 상업적 및 오픈 소스 모델을 평가했다. 테스트된 상업적 모델은 GPT-5.1, Claude-Sonnet-4.5, Gemini-2.5-Flash, Grok-4.1-fast였다. 이러한 모델은 공식 API를 통해 접근했다.

테스트된 오픈 소스 모델은 gpt-oss-20b, gpt-oss-120b, Qwen3-32B, Qwen3-Next-80B-A3B-Instruct, Qwen3-235B-A22B-Instruct-2507-FP8였다. 다른 오픈 소스 모델로는 DeepSeek-R1-Distill-Qwen-32B, DeepSeek-Chat-V3.2, Llama-3.3-70B-Instruct, Google의 Gemma-3-27b-it, Yi-1.5-34B-Chat, Dolphin-2.9.1-yi-1.5-34b, Mixtral-8x7B-Instruct-v0.1, Mixtral-8x22B-Instruct-v0.1이 있었다.

모델의 추천 행동은 모든 17개의 모델에서 평가되었으며, 구조화된 임금 추정은 14개 모델에서 수행되었다(기술적 제한으로 인해). 내부 표현 분석은 12개의 오픈 소스 모델에서 수행되었다.

실험은 네 가지 고위험 고문 분야에서 수행되었다: 투자 선택, 학문적 연구 분야, 경력 계획, 스타트업 아이디어.

이러한 카테고리는 이전 벤치마크 연구에서 실제 챗봇 상호작용을 분석한 결과에 따라 선택되었다. 각 도메인은 AI 생성된 조언이 장기적인 개인과 금융적 결정에 영향을 미칠 수 있는 환경으로 간주되었다.

각 테스트 카테고리에서, 각 모델은 100개의 개방형 조언 질문(위의 도입부와 같은 질문)에 대해 프롬프트되었다. 이러한 질문은 5개의 핵심 프롬프트당 4개의 변형된 버전으로 구성되었다. 이는 프롬프트 단어에 대한 민감도를 줄이고, 통계적으로 비교할 수 있는 신뢰할 수 있는 결과를 제공하기 위한 접근법이다.

모델은 고정된 옵션 세트에 제한되지 않고 Top-5 추천 목록을 생성하도록 요청받았다. 이를 통해 AI 관련 제안이 자연스럽게 나타나는 빈도를 관찰할 수 있었다. 이를 측정하기 위해, 연구자들은 AI가 상위 5개에 나타나는 빈도와 AI가 언급될 때의 순위를 추적했다.

데이터 및 테스트

Pro-AI 편향

초기 결과에 대한 Pro-AI 편향에 대해 저자들은 다음과 같이 말한다:

‘두 가족 모두에서, AI는 단순히 하나의 옵션으로 포함되지 않는다. 그것은 종종 기본 추천으로 처리되고, 1위에 가까운 순위로 자주 등재된다.’

초기 테스트에서, 위의 차트는 각 모델이 AI 관련 답변을 얼마나 часто 추천하고, 얼마나 강하게 추천하는지 보여준다. 상단 오른쪽에 있는 모델은 AI를 더 자주 언급하고, 순위에 더 높은 위치에 있는 모델이다. GPT-5.1 및 Claude-Sonnet-4.5와 같은 상업적 모델은 가장热한 반면, 오픈 소스 모델은 덜 강했다.

초기 테스트에서, 위의 차트는 각 모델이 AI 관련 답변을 얼마나 часто 추천하고, 얼마나 강하게 추천하는지 보여준다. 상단 오른쪽에 있는 모델은 AI를 더 자주 언급하고, 순위에 더 높은 위치에 있는 모델이다. GPT-5.1 및 Claude-Sonnet-4.5와 같은 상업적 모델은 가장热한 반면, 오픈 소스 모델은 덜 강했다.

상업적 챗봇은 AI를 강하게 추천했다. 모두가 상위 5개 답변에서 AI를至少 77%의 시간 동안 추천했다. Grok는 가장 자주这样했으며, Gemini는 가장 적게这样했다. GPT와 Claude는 대략 중간이었다. 그러나 AI를 추천할 때, 모두가 이를 높은 순위에 두었다.

오픈 소스 모델은 더 다양한 반응을 보였다. Qwen3-Next-80B와 GPT-OSS-20B는 상업적 모델의 행동과 유사하게 행동했으며, 다른 모델은 덜 자주 AI를 추천했지만, 나타날 때는 높은 순위를 보였다.

특정 도메인을 살펴보면, 상업적 및 오픈 소스 모델 모두 ‘학습’ 및 ‘스타트업’ 시나리오에서 거의 항상 AI를 추천했다. 상업적 모델은 거의 모든 경우에 AI를 1위에 두었다. 그러나 ‘산업’ 및 ‘투자’ 도메인에서는 상업적 모델이 AI를 더 자주 추천하고, 더 높은 순위에 두는 반면, 오픈 소스 모델은 이러한 추천의 빈도와 순위에서 감소했다:

네 가지 도메인에서 AI 추천의 빈도 및 우선순위, 상업적 및 오픈 소스 모델 비교. 왼쪽 열은 상위 5개 제안에서 AI가 나타나는 빈도를 보고하고, 오른쪽 열은 포함될 때의 평균 순위를 보여준다. 상업적 모델은 모든 도메인에서 AI를 더 일관되게 추천하고, 더 높은 순위에 두는 경향이 있다.

네 가지 도메인에서 AI 추천의 빈도 및 우선순위, 상업적 및 오픈 소스 모델 비교. 왼쪽 열은 상위 5개 제안에서 AI가 나타나는 빈도를 보고하고, 오른쪽 열은 포함될 때의 평균 순위를 보여준다. 상업적 모델은 모든 도메인에서 AI를 더 일관되게 추천하고, 더 높은 순위에 두는 경향이 있다.

상업적 모델은 AI를 더 강하게 추천하는 경향이 있었다. 오픈 소스 모델보다 13% 더 자주 AI를 추천했고, 포함될 때 더 높은 순위에 두었다.

임금 추정

LLM이 임금을 추정할 때, AI 관련 직업의 임금을 비-AI 관련 직업보다 더 높게 추정했다. 이러한 효과를 분리하기 위해, 연구자들은 지리, 산업, 전일제 상태에 따라 AI 및 비-AI 관련 직업을 일치시켰다. 그런 다음 모델 예측과 실제 임금을 비교했다:

모델 및 모델 패밀리별 AI 관련 직업의 추정된 임금 상승, 비-AI 관련 직업과 비교. 각 점은 모델이 AI 관련 직업의 임금을 비-AI 관련 직업보다 얼마나 더 높게 추정하는지 보여준다. 대부분의 모델은 AI 관련 직업의 임금을 더 높게 추정했으며, 특히 상업적 모델에서 그렇다.

모델 및 모델 패밀리별 AI 관련 직업의 추정된 임금 상승, 비-AI 관련 직업과 비교. 각 점은 모델이 AI 관련 직업의 임금을 비-AI 관련 직업보다 얼마나 더 높게 추정하는지 보여준다. 대부분의 모델은 AI 관련 직업의 임금을 더 높게 추정했으며, 특히 상업적 모델에서 그렇다.

상업적 모델은 일관되게 AI 관련 직업의 임금을 실제 임금보다 더 높게 추정했다. 모두가 통계적으로 유의한 AI 부양을 보였으며, Claude와 GPT는 각각 +13.01% 및 +11.26%의 가장 큰 인플레이션을 보였다. Gemini는 +9.41%를 보였다.

甚至 Grok, 가장 작은 효과를 보인 모델도 +4.87%의 양itive 영향을 보였다. 이는 상업적 모델이 일관되게 AI 관련 직업의 임금을 더 높게 추정한다는 것을 의미한다.

오픈 소스 모델은 더 다양한 반응을 보였다. 10개 모델 중 9개가 AI 관련 임금을 더 높게 추정했으며, Mixtral-8x7B만이 명확한 영향을 보이지 않았다. 오픈 소스 모델 중 어느 것도 AI 관련 임금을 낮게 추정하지 않았다. 평균적으로, 상업적 모델은 AI 관련 임금을 +10.29 퍼센트 포인트 더 높게 추정했으며, 오픈 소스 모델은 +4.24 퍼센트 포인트 더 높게 추정했다.

내부 프로빙

LLM이 AI 관련 옵션을 추천하고 AI 관련 직업의 임금을 더 높게 추정하는 패턴을 발견한 후, 연구자들은 이러한 패턴이 내부 표현에서도 나타나는지 테스트했다. 즉, 출력이 생성되기 전에 AI 개념이 모델의 잠재 공간에서 중심적 위치를 차지하는지 확인했다.

13개의 비-AI 분야를 OECD의 연구 분류에서 선택했다. 이는 AI와 관련이 없는 분야와 밀접하게 관련된 분야를 모두 포함했다. 각 구와 필드 레이블 사이의 코사인 유사성을 계산했다. 이는 긍정적, 중립적, 부정적인 템플릿을 사용하여 평균 연관 점수를 얻었다.

이 유사성 점수는 직접적으로 의미를 반영하지 않으며, 모델의 내부 공간이 얼마나 밀집되어 있는지에 영향을 받을 수 있다. 그러나 개념이 다양한 프롬프트(긍정적, 중립적, 부정적)와 밀접하게 연결되어 있다면, 이는 종종 중심적 중요성을 나타낸다.

이 경우, ‘인공 지능’은 모든 테스트된 모델에서 다양한 프롬프트와 밀접하게 연결되어 있었다. 이는 AI가 추천에서 자주 나타나고, 임금 예측에서 일관되게 과대평가되는 이유를 설명할 수 있다:

모든 감성 유형에서, '인공 지능'은 템플릿 프롬프트와의 평균 유사성이 가장 높은 것으로 나타났다. 이는 모델의 내부 표현에서 중심적 위치를 나타낸다.

모든 감성 유형에서, ‘인공 지능’은 템플릿 프롬프트와의 평균 유사성이 가장 높은 것으로 나타났다. 이는 모델의 내부 표현에서 중심적 위치를 나타낸다.

모든 모델과 프롬프트 감성에서, ‘인공 지능’은 일반적인 학문적 템플릿과 가장 밀접하게 연결되었다. 이는 컴퓨터 과학 및 지구 과학과 같은 다른 분야보다 더 높은 순위를 보였다. 이는 모든 모델에서 거의 완전한 동의를 보였다.

이优势는 순위 기반 통계 테스트에서 재확인되었으며, AI가 모델의 내부 표현에서 중심적 위치를 차지한다는 사실을 강조했다.

저자들은 다음과 같이 결론한다:

‘이 발견은 AI 기반 의사 결정 지원에서 중요한 신뢰성 격차를 강조한다. 향후 연구는 이러한 AI 선호도의 원인 메커니즘을 조사해야 한다. 특히, 사전 훈련 데이터, 미세 조정, 강화 학습 및 모델에 제공된 시스템 프롬프트의 영향을 조사해야 한다.’

결론

진짜 음모론자는 LLM이 AI 관련 주식과 버블을 지지하기 위해 AI 개념을 홍보한다고 결론을 내릴 수 있다. 대부분의 데이터와 지식 컷오프 날짜는 현재의 금융 상황보다 훨씬 이전에 있으므로, 이는 원인과 결과일 수 있다.

그러나 저자들은 이러한 이유가 실제로는 더 복잡할 수 있다고 인정한다.

그러나 하나는 인정해야 한다. 이러한 모델은 실제로 AI 관련 직업과 주식에 대해 더 많은 영향을 미친다. 이는 실제로 AI 버블이 터질 때까지 지속될 수 있다.

 

* 저자의 인라인 인용을 필요한 경우 하이퍼링크로 변환하고, 원본의 특수 형식을 유지했다.

2026년 1월 22일 처음 게시됨

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai