มุมมองของ Anderson
AI กำลังแบ่งการค้นหาทางเว็บออกเป็นสามความเป็นจริงที่แตกต่างกัน

การวิจัยใหม่พบว่า Google ใช้ระบบข้อมูลสามระบบที่แตกต่างกันภายในอาณาจักรการค้นหาของตนเอง โดยมีการค้นหาปกติ การสรุป AI และ Gemini ทั้งหมดที่ชื่นชอบแหล่งที่มา การจัดอันดับ และเนื้อหาที่แตกต่างกัน
ลัทธิแบบย่อขนาดเป็นกษัตริย์ ในช่วง 12 เดือนที่ผ่านมา เมม “ให้ฉันค้นหาใน Google สำหรับคุณ” ได้ถูกแทนที่ด้วยแนวโน้มใหม่ “ให้ฉันสรุปการค้นหา Google สำหรับคุณ” ซึ่งการสรุป AI ในผลการค้นหามักจะช่วยให้ผู้อ่านไม่ต้องคลิกบนลิงก์การค้นหา (ซึ่งอาจทำให้เว็บไซต์แหล่งที่มาไม่ได้รับเงินในกระบวนการนี้) โดยการย่อผลการค้นหาทั้งหมดลงในหลายๆ ย่อหน้า ( ( (แหล่งที่มา)แหล่งที่มา)แหล่งที่มา)
เราอาจคิดว่าความรู้หลักที่แสดงขึ้นมาและการเลือกเว็บไซต์ที่ใช้เป็นแหล่งความรู้น่าจะคล้ายกันพอสมควรในสามวิธีหลักของการค้นหาข้อมูลบนอินเทอร์เน็ต ได้แก่ การค้นหาเว็บแบบดั้งเดิม ภาพรวม AI ที่อยู่ด้านบนของผลการค้นหาส่วนใหญ่ และการใช้ LLM อย่าง ChatGPT เป็นผู้ให้คำตอบจากเว็บมากขึ้น ไม่ว่าจะมีการเรียกใช้ RAG ภายนอกหรือไม่ก็ตาม ( (แหล่งที่มา)แหล่งที่มา)
อย่างไรก็ตาม งานวิจัยล่าสุดจากสหรัฐฯ ชี้ว่าเรื่องนี้แตกต่างจากที่คาดไว้อย่างมาก แม้แต่ภายในสามช่องทางของ Google เอง ได้แก่ SERP สรุปโดย AI และการโต้ตอบโดยตรงกับ Gemini ก็ยังมีความแตกต่างที่สำคัญและน่าสนใจในแต่ละช่องทาง (แหล่งที่มา)
การแบ่งสามทาง
ในบทความใหม่ที่ชัดเจนและกว้างขวาง ใหม่ ที่มีชื่อว่า วิธีการที่ AI สร้างสรรค์ขัดขวางการค้นหา: การศึกษาเชิงประจักษ์ของ Google Search, Gemini และการสรุป AI นักวิจัยหกคนจากสถาบันเทคโนโลยี New Jersey อธิบายวิธีการที่วิธีการค้นหาทั้งสามนี้กำลังแยกออกจากกัน และเสนอทฤษฎีที่เป็นไปได้บางประการสำหรับการแตกหักเหล่านี้ในแนวทาง
บทความระบุว่า:
‘[ขั้นแรก เรา] พบว่าสำหรับ 51.5% ของคำถามผู้ใช้จริงที่เป็นตัวแทน AIOs ถูกสร้างขึ้นและแสดงเหนือผลการค้นหาทางออร์แกนิก คำถามที่ขัดแย้งกันบ่อยครั้งนำไปสู่ AIO
‘ที่สอง เราแสดงให้เห็นว่าแหล่งที่มาของการค้นหานั้นแตกต่างกันอย่างมากสำหรับเครื่องมือค้นหาทั้งสาม (<0.2 ค่าเฉลี่ยของความคล้ายคลึงกัน Jaccard) การค้นหาทาง Google แบบดั้งเดิมมีแนวโน้มที่จะค้นหาข้อมูลจากเว็บไซต์ที่ได้รับความนิยมหรือสถาบันในรัฐบาลหรือการศึกษา ในขณะที่เครื่องมือค้นหาที่สร้างสรรค์จะมีแนวโน้มที่จะค้นหาข้อมูลจากเนื้อหาที่เป็นของ Google มากขึ้น
‘ที่สาม เราสังเกตเห็นว่าเว็บไซต์ที่บล็อกเครื่องมือค้นหา AI ของ Google มีแนวโน้มที่จะไม่ถูกค้นพบโดย AIOs แม้ว่าจะสามารถเข้าถึงเนื้อหานั้นได้’
เนื่องจากบทความเป็นแหล่งรวมข้อมูลที่น่าสนใจมาก มากกว่าที่จะยึดติดกับกระบวนการทำงานเชิงเส้นและวิธีการปกติ เราจะมองใกล้ๆ สิ่งเหล่านี้และข้อค้นพบอื่นๆ ที่น่าสนใจและกระตุ้นความคิด
แบบเก่า ‘สอง-หนึ่ง’
หนึ่งในผลการวิจัยที่น่าสนใจมากมายในศึกษานี้ชี้ให้เห็นว่าการสรุป AI ของ Google มักจะถูกกดดันสำหรับเหตุการณ์ข่าวที่เกิดขึ้นอย่างรวดเร็ว เนื่องจากแหล่งที่มาแรกๆ และมีอยู่มากที่สุดอาจไม่ใช่แหล่งที่มาที่แม่นยำที่สุด
ระบบนี้ไม่ทำงานเสมอไป: ในตัวอย่างที่นักวิจัยสังเกตเห็น การสรุป AI ของ Google เกี่ยวกับผลลัพธ์ของการแข่งขันชกมวยให้เครดิตชัยชนะกับนักชกผิด แม้ว่าแหล่งเดียวที่ระบุผลลัพธ์ (ไม่ถูกต้อง) นี้คือฟีดกีฬาสะท้อนบน Facebook:

One of the reasons that Google’s AI overviews avoid time-critical summaries is that early information may be incomplete, or completely inaccurate. In this case, boxer Jake Paul actually lost the match. Source
ผู้เขียนระบุว่าการสรุป AI มีแนวโน้มที่จะปรากฏเมื่อเหตุการณ์เกิดขึ้นอย่างน้อย 5 วัน ซึ่งทำให้เป็นความผิดปกติ – แต่ไม่ว่าในกรณีใด นักวิจัยก็สามารถเรียกสิ่งนี้ได้อย่างง่ายดาย
การสรุป AI มีแนวโน้มที่จะถูกสร้างขึ้นเมื่อคำถามถูกปิดด้วยเครื่องหมายคำถาม และว่า เจตนาในการค้นหา เป็นปัจจัยในการพิจารณาว่าการสรุป AI จะถูกนำเสนอหรือไม่:

Percentage of incidents where an AI search summary was produced in one of the researchers’ round of tests. Here ‘informational’ indicates direct questions, which tend to produce AIOs more than any other type of interaction.
นอกจากนี้ บทความยังระบุด้วยว่า คำถามที่ยาวขึ้น มีแนวโน้มที่จะสร้างสรุป AI แทนที่จะแสดงผลการค้นหาโดยตรงเท่านั้น แม้ว่าผู้เขียนจะไม่ได้ให้ทฤษฎีใดๆ เพื่ออธิบายสิ่งนี้
อาณาจักรที่ถูกแบ่งแยก
ผลลัพธ์ที่น่าประหลาดใจที่สุดจากงานใหม่นี้คือการขาดการเชื่อมต่อระหว่างผลลัพธ์ของการค้นหาที่ได้รับจาก Google Search ปกติ การสรุป AI และ Gemini (LLM)
บทความแสดงให้เห็นว่า Google Search ปกติ การสรุป AI และ Gemini (LLM) ค้นหาแหล่งที่มาที่แตกต่างกันสำหรับคำถามเดียวกัน โดยมีคะแนนความคล้ายคลึงกันที่ต่ำพอที่จะชี้ให้เห็นว่ามีการเข้าถึงข้อมูลที่แตกต่างกันสามแบบภายในบริษัทเดียว ในขณะที่ผู้ใช้อาจคิดว่า Google มีดัชนีที่มีอำนาจและปรัชญาการจัดอันดับเดียว:

Even inside Google’s own ecosystem, the overlap between traditional Search, AI Overviews and Gemini proved surprisingly small, with the same query often producing substantially different source lists depending on which Google system handled the request. In this comparison, we see how closely the three systems matched each other across thousands of search queries, from shopping and debate topics to local searches and general knowledge questions, with lower scores indicating less agreement between the sources selected.
เกี่ยวกับส่วนนี้ของการวิเคราะห์ ผู้เขียนระบุว่า:
‘[ตารางด้านบน] แสดงถึงความคล้ายคลึงกันโดยเฉลี่ยระหว่างรายการแหล่งที่มาจาก AIO, Gemini และการค้นหาทางเว็บแบบดั้งเดิมสำหรับคำถามในเซตข้อมูลมาตรฐาน
‘สิ่งสำคัญที่สุดคือ ไม่ว่าจะเป็นคำถามใดและไม่ว่าจะเป็นคู่เครื่องมือค้นหาที่เปรียบเทียบกัน รายการแหล่งที่มานั้นไม่เหมือนกัน แม้ว่าทั้งสามจะถูกพัฒนาโดย Google.’
นักวิจัยระบุด้วยว่าไม่มีวิธีการค้นหาที่ทดสอบมีคะแนนความคล้ายคลึงกัน RBO (Rank-Biased Overlap) มากกว่า 0.27 ซึ่งเป็นคะแนนที่ต่ำมาก พวกเขายังระบุด้วยว่า Amazon Retail และคำถามที่ระบุพื้นที่ (เช่น ‘ร้านค้าใกล้ฉัน’) มีความคล้ายคลึงกันที่ต่ำที่สุด (แหล่งที่มา)
พวกเขาให้เหตุผลว่าความไม่เห็นด้วยนี้เกิดจาก ‘ความไม่สอดคล้องกันระหว่างเครื่องมือค้นหา’ และชี้ให้เห็นว่าความสุ่มหรือปัจจัยอื่นๆ ที่ชัดเจนไม่สามารถอธิบายการไม่สอดคล้องกันนี้ได้
คำอธิบายที่เข้าใจได้อย่างหนึ่งคือ จุดข้อมูลฝึกถูกจัดอันดับด้วยวิธีที่ต่างจาก PageRank และระบบสืบทอดที่ Google พัฒนามาตลอดสองทศวรรษอย่างมาก ยิ่งกว่านั้น หากอัลกอริทึมค้นหาของ Google มีวาระซ่อนเร้น การแทรกแซงหรือ “จัดเกม” แบบนั้นก็ทำอย่างสม่ำเสมอใน AI ที่อาศัยการกระจายอย่าง Gemini ได้ยากกว่ามาก แม้จะใช้ตัวกรอง พรอมป์ระบบ และวิธีควบคุมอื่นๆ ของโมเดลเชิงพาณิชย์ก็ตาม ( ( (แหล่งที่มา)แหล่งที่มา)แหล่งที่มา)
บริการตนเอง..?
บางเว็บไซต์หรือหมวดหมู่ของเว็บไซต์อาจได้รับผลกระทบจากการมาถึงของการสรุป AI และการค้นหาทาง LLM ในพื้นที่ค้นหาทางดั้งเดิม – ทั้งเชิงบวกและเชิงลบ:

Compared to traditional Google Search, AI Overviews and Gemini both reduced citations from many major websites, while increasing visibility for a smaller number of favored domains. YouTube proved to be one of the biggest beneficiaries across both systems, while Reddit, Wikipedia, Facebook and many institutional sources appeared less frequently in AI-generated retrieval.
ผู้เขียนระบุว่า:
‘เรามีสามข้อสรุปหลักจาก [กราฟด้านบน] ข้อแรก เว็บไซต์ขนาดใหญ่และเป็นที่รู้จักมากที่สุดได้รับผลกระทบมากที่สุด (ทั้งเชิงบวกและเชิงลบ) สิ่งนี้เป็นเรื่องปกติ เนื่องจากเว็บไซต์ขนาดใหญ่มีชื่อเสียงและความหลากหลายในเนื้อหาที่จะเกี่ยวข้องกับคำถามที่แตกต่างกัน
‘ที่สอง เว็บไซต์ส่วนใหญ่เหล่านี้ได้รับการอ้างอิงน้อยลงโดยรวม และการอ้างอิงอันดับต้นๆ น้อยลงด้วยเครื่องมือค้นหาที่สร้างสรรค์ (แสดงเป็นแถบสีแดงและตัวเลขลบใน [กราฟด้านบน]) สิ่งนี้ชี้ให้เห็นว่าการค้นหาที่สร้างสรรค์มักจะค้นหาข้อมูลจากแหล่งที่มาเฉพาะเจาะจงมากกว่าการค้นหาทางดั้งเดิม
‘ที่สาม การสรุป AI ของ Google ชอบแหล่งที่มาจากเว็บไซต์ของ Google (เช่น โดเมน google.com และ youtube.com)
‘Gemini ก็มีชอบ YouTube เช่นกัน เมื่อเปรียบเทียบกับการค้นหาทาง Google แบบดั้งเดิม แต่ความแตกต่างที่แท้จริงนั้นน้อยกว่า’
มี ‘อุปสรรค’..?
การศึกษาพบว่าผู้จัดพิมพ์ที่บล็อก เครื่องมือค้นหา AI ของ Google – โบตอัตโนมัติที่สแกนข้อมูลจากเว็บไซต์ของคุณ เว้นแต่คุณจะบอกมันไม่ให้ทำโดยใช้ไฟล์ robots.txt – มีแนวโน้มที่จะไม่ปรากฏในผลสรุป AI
สิ่งนี้อาจดูเหมือนเป็นการทำร้ายตนเอง แต่ในความเป็นจริง Google ได้ประกาศสาธารณะ ว่าเนื้อหาที่มาจากแพลตฟอร์มที่บล็อกเครื่องมือค้นหา AI จะไม่ถูกป้องกันไม่ให้ปรากฏในผลสรุป AI; แต่ผู้จัดพิมพ์จะไม่ให้ข้อมูลของตนถูกสแกน คัดเลือก และนำไปใช้ในการฝึกอบรม AI ของ Gemini และโครงการ AI ของ Google อื่นๆ
อย่างไรก็ตาม นี่ไม่ใช่สิ่งที่นักวิจัยพบ ในทางกลับกัน พบว่าผู้จัดพิมพ์ที่ปิดกั้น AI มักจะไม่ถูกอ้างอิงโดย Gemini ในทั้งรูปแบบ LLM และรูปแบบผลลัพธ์การค้นหาที่เร็วและคล่องตัวกว่า ‘ผู้จัดพิมพ์ที่มีผลกระทบ’ ที่ได้รับการรายงานจากบทความนี้ ได้แก่ NYTimes, CNN, BBC, ScienceDirect, Reuters, Wiley, Nature, ESPN, Business Insider, CNBC, NPR, WIRED, USA Today, NBC News, Genius, National Geographic, The Conversation, U.S. News & World Report, Scientific American, Consumer Reports และ STAT

Some of the robots.txt AI-scraping bans effected by the publishers listed above. But has it led to a wider censure by Google?
ผู้เขียนระบุว่า:
‘ในระหว่างการวิเคราะห์โดเมนที่ได้รับผลกระทบมากที่สุด เราพบว่า 21 ผู้จัดพิมพ์ที่ได้รับความนิยม (ซึ่งถูกเรียกสำหรับคำถามที่ไม่ซ้ำกันอย่างน้อย 20 คำถามโดยการค้นหาทาง Google และ AIOs) ไม่เคยถูกอ้างอิงโดย Gemini
‘เว็บไซต์สื่อสังคมและเว็บไซต์สำหรับการให้คำวิจารณ์หลายแห่ง เช่น Facebook, Instagram, Tiktok, IMDb, Yelp และ Tripadvisor ไม่เคยได้รับการอ้างอิงจาก Gemini เช่นกัน หลังจากการตรวจสอบเพิ่มเติม เราพบว่าเว็บไซต์เหล่านี้ทั้งหมดบล็อกเครื่องมือค้นหา AI ของ Google ในไฟล์ robots.txt ของตน’
หากผลการวิจัยนี้ได้รับการยืนยันจากที่อื่นและยังคงอยู่ อาจมีการคาดเดาว่าบริษัทเหล่านี้อาจถูกกดดันโดย Google ให้เข้าร่วมและร่วมมือกับการดำเนินงาน AI ของตนผ่านการลงโทษบางอย่าง แต่ผลการวิจัยของงานใหม่นี้มีมากเกินกว่าที่จะบ่งบอกถึงความสับสนมากกว่าการวางแผนล่วงหน้า ดังนั้นจึงเป็นเพียงคำวิจารณ์ที่สมเหตุสมผลเท่านั้นที่สามารถทำได้ว่าผลลัพธ์เหล่านี้ดูเหมือน ‘โกรธ’ แต่สิ่งที่แท้จริงที่ทำให้เกิดผลลัพธ์เหล่านี้ยังไม่ชัดเจน
สรุป
(ความคิดเห็น นี่คือบทความที่มีใจกว้างและลึกซึ้ง ซึ่ง 10 หน้าหลักของบทความนี้สามารถขยายออกไปเป็นผลการวิจัยที่น่าสนใจมากมาย ตั้งแต่นี้เรามีเวลาเพียงพอในการครอบคลุมเพียงส่วนเล็กๆ ของสิ่งเหล่านี้ จึงแนะนำให้อ่านบทความต้นฉบับ (PDF) แม้กระทั่งสำหรับผู้อ่านโดยทั่วไปแหล่งที่มา)
แม้มุมมองเชิงลบอาจนำไปสู่การตีความข้อค้นพบของผู้เขียนในทางเสียหายได้หลายแบบ แต่งานนี้น่าจะสะท้อนถึงผู้นำเทคโนโลยีระดับโลกที่พยายามคว้าและรักษาความเป็นผู้นำด้านการค้นหาด้วย AI โดยใช้แพลตฟอร์มที่แตกต่างกันมาก ซึ่งพัฒนาขึ้นในบริบทและยุคสมัยที่ต่างกัน
แม้บทความจะพิจารณาวิธีค้นหาสามแบบ แต่ความขัดแย้งที่แท้จริงอยู่ระหว่างผลลัพธ์ของเครื่องมือค้นหาแบบดั้งเดิมที่จัดอันดับด้วยวิธีเฉพาะ กับวิธีคัดเลือกตามการกระจายที่แตกต่างอย่างชัดเจนและครอบงำการคัดสรรข้อมูลกับการฝึก AI
AI เหมือนปี 1999
ก่อนที่ Google จะมาถึง มันเป็นไปได้ที่จะ ‘โกง’ ผลการค้นหาโดยใช้ปริมาณมาก และในทางนี้ คุณสามารถบรรลุผลลัพธ์ที่ดีในการค้นหาได้ด้วยความพยายามน้อย (มักจะอัตโนมัติ) การเล่นเกมตัวเลขนี้สิ้นสุดลงโดยอัลกอริทึมการจัดอันดับการค้นหาที่ซับซ้อนและลึกลับของ Google ในปี 2002 แต่เนื่องจากมีผลประโยชน์ที่สำคัญ เนื้อหาที่มีปริมาณมากและคุณภาพต่ำจึงไม่เคยหายไปในความหมายที่แท้จริง
ดังนั้น เมื่อชุดข้อมูลขนาดใหญ่ เช่น Common Crawl ตั้งรากฐานของการปฏิวัติ AI ในยุคใหม่ การมีอำนาจเหนือข้อมูลมีแนวโน้มที่จะถูกครอบงำโดยขอบเขตที่กระบวนการอัตโนมัติสามารถ กรองและจัดอันดับคุณภาพของข้อมูลที่เข้ามา และ (น้อยกว่า) ขอบเขตที่เงินมีอยู่เพียงพอในการจ่ายให้กับผู้คนในการจัดอันดับข้อมูลนั้น
มี มาก ของข้อมูลที่ไม่ดีหรือคุณภาพต่ำในคอลเลกชันเหล่านั้น; ข้อมูลที่อาจไม่รวมถึงลักษณะที่ไม่เหมาะสมหรือการเหยียดเชื้อชาติหรือสิ่งอื่นๆ ที่สามารถกรองออกจากชุดข้อมูลการฝึกอบรมได้ง่าย แต่ข้อมูลนั้นก็ยังเป็นข้อมูลที่มีประโยชน์และมีปริมาณมาก เช่นเดียวกับผลลัพธ์ของการค้นหาทางอินเทอร์เน็ตในช่วงปี 1999-2001
เนื่องจากกระบวนการอุปนัยข้อมูลยังไม่ดี จึงยากสำหรับ Google ที่จะทำให้ AI ทำงานในลักษณะทางธุรกิจ เนื่องจากการตัดสินใจของ Gemini ในรูปแบบ PageRank นั้นถูกกำหนดโดยความเข้าใจที่ไม่สมบูรณ์ของวิธีการที่ข้อมูลขนาดใหญ่เปลี่ยนเป็นกระจายข้อมูลและการฝังตัวแบบแฝงระหว่างการฝึกอบรม AI (แหล่งที่มา)
* หน้าผลลัพธ์การค้นหา
† การเน้นของผู้เขียน ไม่ใช่ของผม แต่ผมได้เปลี่ยนการเน้นจากตัวเอียงเป็นตัวหนา เนื่องจากการเน้นด้วยตัวเอียงไม่ทำงานดีในคำพูดที่เป็นตัวเอียงโดยทั่วไป
เผยแพร่ครั้งแรกวันพุธที่ 13 พฤษภาคม 2026












