Anderson의 관점
AI 가 웹 검색을 세 가지 다른 현실로 나누고 있다

새로운 연구에 따르면 Google은 자체 검색 제국 내에서 세 가지 다른 정보 시스템을 사용하고 있으며, 일반 검색, AI 요약, Gemini 모두 다른 소스, 순위, 콘텐츠를 선호한다.
감소주의가 지배한다. 지난 12개월 동안, ‘그것을 위해 구글링해 드리겠습니다’ 메임은 새로운 ‘그것을 요약해 드리겠습니다’ 트렌드로 대체되었다. 여기서 AI 요약은 검색 결과를 클릭하는 번거로움을 읽기 위해 점점 더 많이 생략한다(논란의 여지가 있는 소스 사이트의 자금을 줄이는 방식으로). 검색 결과를 몇 개의 생성된 문단으로 요약한다.
누군가는 핵심 지식이 표면화되고, 그 지식을 얻는 사이트의 선택이, 인터넷 정보를 검색하는 세 가지 가장 인기 있는 방법에 걸쳐 tương对적으로 유사할 것으로 생각할 수 있다. 전통적인 웹 검색에서; AI 요약에서(AIOs); 그리고 증가하는 사용을 통해 LLMs such as ChatGPT를 웹 오라클로 사용한다(외부 RAG 호출이 있거나 없거나).
그러나最近의 연구에 따르면, 이것은 놀랍게도,遠からず 그렇지 않다는 것을 나타낸다. 그리고 심지어 Google의 자체 삼위일체 오라클 – SERPS*, AI 요약, 직접 Gemini LLM 시리즈와의 상호작용에서 – 각 경로에 대해 상당한 관심이 있고 흥미로운 불일치가 나타난다.
세 가지로 나누다
새로운 논문에서, 여섯 명의 연구자들은 뉴저지 공과 대학에서 세 가지 검색 방법이 어떻게 발전하고 있는지, 그리고 이러한 접근법의 불일치를 위해 가능한 몇 가지 이론을 제시한다.
이 논문은 다음과 같이 말한다:
‘[첫째, 우리는] 51.5%의 대표적인 실제 사용자 쿼리에서 AIOs가 생성되고, 유기적 검색 결과 위에 표시됨을 발견했다. 논란이 되는 질문은 종종 AIO를 결과로 한다.
‘둘째, 우리는 각 검색 엔진에서 검색된 소스가 크게 다르다는 것을 보여준다(<0.2 평균 Jaccard 유사도). 전통적인 Google 검색은 정부 또는 교육과 같은 인기 있는 웹사이트 또는 기관에서 정보를 검색할 가능성이 훨씬 더 높다. 반면에 생성적 검색 엔진은 Google 소유의 콘텐츠를 검색할 가능성이 훨씬 더 높다.
‘셋째, 우리는 Google의 AI 크롤러를 차단하는 웹사이트가 AIOs에 의해 검색될 가능성이 훨씬 더 낮다는 것을 관찰했다.尽管 그들은 콘텐츠에 접근할 수 있다.
이 논문은 매우 많은 흥미로운 통찰력을 제공한다. 우리는 이 중 몇 가지를 더 자세히 살펴보겠다.
구식 ‘2-1’
연구에서 발견된 많은 흥미로운 결과 중 하나는 Google의 AI 요약이突然 발생하는 뉴스 이벤트에 대해 억제되는 경향이 있다는 것이다. 가장 초기의 소스와 가장 이용 가능한 소스가 가장 정확한 것은 아닐 수 있다.
이 시스템은 항상 작동하지 않는다: 연구자들이 주목한 예에서, Google AI 요약은 복싱 경기 결과를 잘못된 복서에게 승리를 돌렸다. 이는 유일한 소스(사티리 스포츠 피드 on Facebook )가 이(잘못된) 결과를 언급한 경우였다:

Google의 AI 요약은 시간 крит적인 요약을 피하는 이유 중 하나는 초기 정보가 불완전하거나 완전히 부정확할 수 있기 때문이다. 이 경우, 복서 Jake Paul은 실제로 경기를 졌다. 출처
연구자들은 AIOs가 이벤트가 적어도 5일이 지난 경우에 나타날 가능성이 더 높다는 것을 발견했다. 이는 이 경우를異常으로 간주할 수 있지만, 연구자들은 쉽게 이러한 예를 발견할 수 있었다.
AIOs는 쿼리가 물음표로 끝나는 경우에 생성될 가능성이 더 높았다. 그리고 쿼리 의도는 AIO가 표시될지 여부에 영향을 미치는 요소였다:

연구자들의 테스트에서 AI 검색 요약이 생성된 사례의 백분율. 여기서 ‘정보’는 직접적인 질문을 나타내며, 이러한 유형의 상호작용은 다른 유형보다 AIOs를 생성할 가능성이 더 높다.
또한, 논문은 더 긴 쿼리가 AI 요약을 생성할 가능성이 더 높다는 것을 주장한다. 그러나 저자들은 아직 이에 대한 이론을 제시하지 않는다.
나누어진 왕국
아마도 새로운 연구에서 가장 놀라운 결과는 Google의 세 가지 검색 플랫폼 사이의 결과 품질/유형의 상대적으로 작은 중복이다.
이 논문은 반복적으로 보여주듯이, 일반적인 Google 검색, AI 요약, Gemini(LLM)는 동일한 쿼리에서 크게 다른 소스를 검색한다. 중복 점수는 충분히 낮아, 하나의 회사 내에 세 가지 경쟁 검색 로직이 있음을 시사한다. 사용자는 Google이 하나의 권위적인 인덱스와 하나의 순위 철학을 가지고 있다고 가정할 수 있다:

Google의 자체 생태계 내에서, 전통적인 검색, AI 요약, Gemini 사이의 중복은 놀랍게도 작았다. 동일한 쿼리에서 종종 크게 다른 소스 목록을 생성했다. 이 비교에서, 우리는 검색 쿼리에서 세 가지 시스템이 서로 얼마나 일치하는지 보여준다. 쇼핑 및 토론 주제, 지역 검색, 일반 지식 질문 등에서 낮은 점수는 소스 선택에서 더 적은 동의를 나타낸다.
이 분석의 일부에 대해, 저자들은 다음과 같이 말한다:
‘[위의 표]는 벤치마크 데이터셋의 각 쿼리에서 AIO, Gemini, 전통적인 SERP가 반환한 소스 목록의 평균 유사성을 보여준다.
‘주된 결론은 쿼리 하위 집합과 비교되는 검색 엔진의 쌍에 관계없이, 검색된 목록은 다르다. 이는 모두 Google에서 개발되었음에도 불구하고다.
연구자들은 또한 어떤 검색 방법도 rank-biased overlap(RBO) 이상의 점수를 얻지 못했다고 주장한다. 이는 매우 낮은 점수이다. 그들은 Amazon Retail 및 지역화된 쿼리(즉, ‘내 근처의 상점’)가 검색 방법 사이에서 가장 낮은 유사성을 보였다.
그들은 낮은 동의를 ‘검색 엔진 간의 불일치’로 설명한다. 명백한 요인이나 무작위성으로는 이 불일치를 설명할 수 없다고 주장한다.
한 가지 직관적인 설명은, 훈련 데이터 포인트가 PageRank 및 그 후계자에 대해 Google이 지난 20년 동안 개발한 방법과 매우 다른 방식으로 순위를 매긴다는 것이다. 또한, Google 검색 알고리즘이 비밀 의제가 있을 수 있다. 이러한 간섭이나 ‘게이밍’은 Gemini와 같은 확산 기반 AI에서 일관되게 구현하기가 훨씬 더 어렵다.
셀프 서비스..?
일부 웹사이트 또는 웹사이트 카테고리는 AI 요약과 LLM 기반 검색의 전통적인 검색 공간으로의 진입으로 인해 영향을 받았다. 양적으로나 음적으로 영향을 받았다.

전통적인 Google 검색과 비교하여, AI 요약과 Gemini는 많은 주요 웹사이트에서 인용을 줄였고, 더 작은 수의 선호 도메인에 대한 가시성을 증가시켰다. YouTube는 두 시스템 모두에서 가장 큰 수혜자 중 하나였다. 반면에 Reddit, Wikipedia, Facebook 및 많은 기관 소스는 AI 생성 검색에서 더 적게 나타났다.
저자들은 다음과 같이 말한다:
‘우리는 [위의 그래프]에서 세 가지 주요 결론을 얻었다. 첫째, 큰 웹사이트와 잘 알려진 웹사이트가 가장 영향을 받는다. 이는 이러한 웹사이트가 다양한 쿼리에 대한 관련성과 콘텐츠의 다양성을 가지고 있기 때문이다.
‘둘째, 이러한 웹사이트의 대부분은 생성적 검색 엔진에서 전체 인용과 상위 3개 인용이 줄어든다(그래프에서 빨간 막대와 음수). 이는 생성적 검색이 전통적인 검색 엔진보다 더 전문적인 소스에서 정보를 검색하는 경향이 있음을 시사한다.
‘셋째, Google의 AIOs는 Google 웹사이트(즉, google.com 및 youtube.com 도메인)를 선호한다.
‘Gemini도 전통적인 Google 검색과 비교하여 YouTube를 선호하지만, 절대적인 차이는 더 작다.’
어떤 ‘방해물’..?
연구에서는 또한 Google의 AI 웹 크롤러를 차단하는 출판사가 AIOs에 나타날 가능성이 낮다는 것을 발견했다. 이는 이러한 웹사이트가 콘텐츠에 접근할 수 있음에도 불구하고如此하다.
이것은 명백한 자해 행위로 보일 수 있지만, 실제로 Google은 공개적으로 말한 바와 같이, AI 크롤러를 차단하는 플랫폼의 콘텐츠는 AI 요약에 나타나지 않을 것이라고 말한다. 출판사들은 단지 데이터를 스크레이핑하고, 컬렉션으로 구축하고, Gemini 및 기타 Google AI 프로젝트를 위한 다음 라운드의 AI 훈련에 사용할 수 없다.
그러나, 새로운 논문의 연구자들은 이러한 결론에 도달하지 않았다. 대신, 인기 있는 AI 차단 출판사가 Gemini에 의해 거의 인용되지 않는다는 것을 발견했다. ‘유효하게 차단된’ 출판사로는 NYTimes, CNN, BBC, ScienceDirect, Reuters, Wiley, Nature, ESPN, Business Insider, CNBC, NPR, WIRED, USA Today, NBC News, Genius, National Geographic, The Conversation, U.S. News & World Report, Scientific American, Consumer Reports 및 STAT가 있었다.

위에서 언급한 출판사들이 시행한 일부 AI 스크레이핑 금지. 하지만 이것이 Google에 의한 더 넓은 금지로 이어졌는가?
저자들은 다음과 같이 말한다:
‘우리의 분석에서, 우리는 21개의 인기 있는 출판사(둘 다 Google 검색과 AIOs에 의해 검색되는 20개 이상의 고유 쿼리)를 Gemini에서 인용되지 않은 것을 발견했다.
‘Facebook, Instagram, Tiktok과 같은 몇몇 소셜 미디어 및 IMDb, Yelp, Tripadvisor와 같은 리뷰 웹사이트도 Gemini에서 인용되지 않았다. 더 깊이 조사한 결과, 이러한 웹사이트 모두가 Google-Extended 봇을 차단하는 robots.txt 파일을 가지고 있었다.
이 발견이 다른 곳에서 검증되고 지속된다면, 이러한 회사들이 Google의 AI 작동과 협력으로 인해 부분적으로 제재를 받고 있는 것으로 추측할 수 있다. 결과는 표면적으로 ‘강인한’ 것으로 보이지만, 새로운 연구의 결과는 혼란보다는 의도적인 행동을 나타낸다.
결론
의견 이 논문은 매우 명료한 zip 폭탄이다. 10페이지의 주요 내용이 거의 압도적인 추가적인 발견으로 펼쳐진다. 우리는 이 중 일부를 더 자세히 살펴보겠다.
부정적인 해석을 내리기에는 충분한 내용이지만, 이 연구는 글로벌 기술 리더가 AI 기반 검색에서 글로벌 리드를 얻고 유지하기 위해 매우 다른 환경과 시대에 개발된 플랫폼을 사용하고 있는 것으로 보인다.
세 가지 검색 방법이 연구에서 조사되었지만, 실제 논쟁은 전통적인 검색 엔진 결과와 데이터 기반 선택 방법 사이에 있다.
AI Like It’s 1999
Google 이전에, 검색 결과를 ‘게이밍’하여 앞면에 나타날 수 있었다. 이는大量의 볼륨을 통해 가능했다. 하지만 2002년경에 Google의 더 복잡하고 비밀스러운 검색 순위 알고리즘이 이러한 ‘숫자 게임’을 종료했다.
그러나, Common Crawl과 같은 초대형 컬렉션이 현대의 AI 혁명을 위한 기초를 마련했을 때, 데이터의 우세는 자동화된 프로세스가 들어오는 데이터 품질을 필터링하고 순위를 매기는 방식에 의해 지배될 운명이었다. 그리고(훨씬 더 적게) 데이터를 순위를 매기기 위해 사람들에게 돈을 지불할 수 있는 정도였다.
그런데, 이러한巨大하고 무차별적인 컬렉션에는 많은 나쁨 또는 저품질 데이터가 포함되어 있었다. 이는 음란물, 욕설, 인종 차별적인 트로프 등과 같은 쉽게 필터링할 수 있는 것들이 아니었지만, 여전히 자아 지향적이고 방대한이었다. 이는 1999-2001년경의 인터넷 검색 결과와 유사했다.
그런데, 이러한 데이터 유도 프로세스는 아직도 훌륭하지 않기 때문에, Gemini와 같은 확산 기반 AI에서 비즈니스처럼 행동하도록 AI를 얻는 것은 매우 어렵다. 이는 Google의 정책 엔지니어가 아니라, AI 모델의 훈련 중에 데이터가 어떻게 변환되고 잠재적인 임베딩으로 변하는지에 대한 불완전한 이해에 의해 결정된다.
* 검색 엔진 결과 페이지.
† 저자의 강조, 내 것이 아님. 그러나, 나는 인용구에서 강조를 위해 기울임꼴 대신 굵은 글자를 사용했다.
처음 게시된 2026년 5월 13일 수요일












