มุมมองของ Anderson

เตรียมพร้อมสำหรับการโฆษณาในโมเดลภาษาใหญ่

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
Source: ChatGPT-4o and https://commons.wikimedia.org/wiki/File:Microsoft_Surface_Laptop_7.jpg

งานวิจัยใหม่แสดงให้เห็นว่าโฆษณาอาจเร็ว ๆ นี้ถูกฝังโดยตรงในคำตอบสไตล์ ChatGPT – ไม่ใช่เป็นแบนเนอร์หรือป๊อปอัพ แต่ถักทับอยู่ในข้อความตอบกลับเอง การทดสอบมาตรฐานใหม่ตรวจสอบว่าการตอบกลับที่มีโฆษณาแทรกนี้สามารถคงความเป็นประโยชน์ เชื่อถือได้ และทำกำไรได้ดีแค่ไหน และอาจต้องแลกกับการปรับสมดุลระหว่างประสบการณ์ผู้ใช้ที่ยอมรับได้กับอัตราการคลิกผ่าน

 

เมื่อความนิยมที่แพร่หลายและเพิ่มขึ้นของโมเดลภาษาใหญ่ ทำลายวิธีการโฆษณาแบบดั้งเดิม ที่เป็นแรงผลักดันอินเทอร์เน็ตมาตั้งแต่ต้น ผู้ที่คุ้นเคยกับกลยุทธ์การครอบครองตลาดของนักลงทุนทุนเวนเจอร์จะสงสัยว่าแชทบอท AI จะสามารถหลีกเลี่ยงการใส่เนื้อหาโฆษณาในคำตอบของตนได้อีกนานแค่ไหน

เมื่อ Netflix และรายการบริการสตรีมมิ่งที่กำลังขยายตัว แสดงให้เห็น ว่ายุทธศาสตร์ยุคเคเบิลแบบดั้งเดิมที่ผสานการสมัครสมาชิกแบบชำระเงินกับโฆษณาที่ฝังอยู่ (มักอธิบายว่าเป็นวิธีลดค่าใช้จ่ายของผู้บริโภค) กำลังกลับมามีแรง; และการเปลี่ยนแปลงไปสู่การรวมโฆษณาโดยตรงในผลลัพธ์ของ LLM กำลัง ดูเหมือนน้อยกว่าที่คาดเดา และดูเหมือนเป็นการนำโมเดลนี้ไปใช้โดยธรรมชาติ

จากบทความ 'Online Advertisements with LLMs: Opportunities and Challenges' ตัวอย่างที่ค่อนข้างเป็นตัวแทนของการเปลี่ยนแปลงที่คนส่วนใหญ่คาดหวังเมื่อ LLMs ทำการสร้างรายได้ แหล่งที่มา: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf

จากกระดาษ ‘Online Advertisements with LLMs: Opportunities and Challenges’, ตัวอย่างที่ค่อนข้างเป็นตัวแทนของการเปลี่ยนแปลงที่คนส่วนใหญ่คาดหวังเมื่อ LLM ทำการสร้างรายได้ Source: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf

แนวคิดการใส่โฆษณาในสื่อใหม่ที่มี ปัญหา ด้านความน่าเชื่อถืออยู่แล้วอาจดูเร่งรีบ; อย่างไรก็ตาม ระดับการลงทุนใน AI สร้างสรรค์ ในสิบสองเดือนที่ผ่านมาแสดงให้เห็นว่าตลาดไม่ได้ถูกกำหนดด้วยท่าทีระมัดระวังหรือรอบคอบ; และเมื่อผู้เล่นใหญ่เช่น OpenAI อาจมีหนี้สินมากเกินไปและต้องการ ผลตอบแทนเร็วจากการลงทุนมหาศาล ประวัติศาสตร์บ่งชี้ว่าช่วงเวลาที่ไม่มีโฆษณาอาจกำลังจะสิ้นสุด

GEM-Bench

ด้วยสภาพแวดล้อมและความต้องการทางธุรกิจเหล่านี้ในใจ งานวิจัยใหม่ที่น่าสนใจจากสิงคโปร์นำเสนอมาตรฐานแรกที่มุ่งเน้นที่อินเทอร์เฟซแชทบอท AI พร้อมด้วยเมตริกการวัดเชิงปริมาณใหม่สำหรับสิ่งที่อาจกลายเป็นสนามโฆษณาที่ระเบิดที่สุดในรอบ 100 ปี

อาจมองในแง่ดี ผู้เขียนสมมติว่ามีการแยกแยะที่ชัดเจนระหว่างเนื้อหา ‘จริง’ กับเนื้อหาโฆษณา ซึ่ง ‘การเบี่ยงเบน’ จากคำตอบมาตรฐานไปสู่ข้อความการตลาดนั้นง่ายต่อการสังเกต:

ตัวอย่างของการบูรณาการโฆษณาที่อาจเกิดขึ้นตามสองโมเดลที่ศึกษาในบทความใหม่ แหล่งที่มา: https://arxiv.org/pdf/2509.14221

ตัวอย่างของการรวมโฆษณาที่อาจเกิดขึ้นภายใต้สองโมเดลที่ศึกษาในงานวิจัยใหม่ Source: https://arxiv.org/pdf/2509.14221

ยังคงต้องรอดูว่าผู้โฆษณาเองจะตามแนวโน้มของตนโดยพยายามทำให้เนื้อหาโฆษณาถูกแทรกอย่างละเอียดอ่อนลงในผลลัพธ์มากกว่าตัวอย่างที่ให้ไว้ในงานวิจัยหรือไม่

อย่างไรก็ตาม สิ่งเหล่านี้เป็นเรื่องสำหรับภายหลัง; ในขณะนี้ สาขานี้ยังใหม่มากจนแม้แต่คำศัพท์พื้นฐานก็ยังขาดหายหรือยังไม่ได้กำหนดอย่างชัดเจน

ดังนั้นงานวิจัยจึงนำเสนอ Generative Engine Marketing (GEM) เป็นกรอบงานใหม่สำหรับทำเงินจากแชทบอทที่ใช้ LLM โดยฝังโฆษณาที่เกี่ยวข้องโดยตรงในคำตอบที่สร้างขึ้น

นักวิจัยระบุว่าการสร้าง Ad-Injected Response (AIR) เป็นความท้าทายหลักใน GEM และโต้แย้งว่ามาตรฐานที่มีอยู่ไม่เหมาะสมต่อการศึกษาเรื่องนี้ เพื่อเติมเต็มช่องว่างนี้ พวกเขานำเสนอสิ่งที่อ้างว่าเป็นมาตรฐานแรกที่ออกแบบมาเฉพาะสำหรับวัตถุประสงค์นี้

GEM-Bench ประกอบด้วยชุดข้อมูลที่คัดสรรสามชุดครอบคลุมสถานการณ์แชทบอทและเครื่องมือค้นหา นอกจากนี้ยังรวมถึงออนโทโลยีเมตริกที่ออกแบบมาเพื่อประเมินหลายด้านของความพึงพอใจและการมีส่วนร่วมของผู้ใช้ พร้อมกับชุดวิธีพื้นฐานที่ดำเนินการในกรอบงานโมดูลหลายเอเจนต์

ผู้เขียนอ้างว่าขณะที่วิธีแบบใช้พรอมต์ง่าย ๆ สามารถบรรลุเมตริกการมีส่วนร่วมที่น่าพอใจ เช่น อัตราการคลิกผ่าน (CTR) ที่สูงขึ้น แต่ก็มักทำให้ความพึงพอใจของผู้ใช้ลดลง ในทางตรงกันข้าม วิธีที่แทรกโฆษณาเข้าไปในคำตอบที่สร้างล่วงหน้าและปราศจากโฆษณาแสดงให้เห็นการปรับปรุงด้านความเชื่อถือและคุณภาพของคำตอบ – แม้ว่าจะต้องแลกกับภาระการคำนวณที่เพิ่มขึ้น

การแลกเปลี่ยนเหล่านี้ ตามที่งานวิจัยชี้ให้เห็น เน้นถึงความจำเป็นในการพัฒนาเทคนิคที่มีประสิทธิภาพและประหยัดมากขึ้นสำหรับการรวมโฆษณาเข้าสู่ผลลัพธ์เชิงสร้าง

งานใหม่ มีชื่อว่า GEM-Bench: A Benchmark for Ad-Injected Response Generation within Generative Engine Marketing และมาจากนักวิจัยสี่คนจากมหาวิทยาลัยแห่งชาติสิงคโปร์

วิธีการ

โครงร่างของ Generative Engine Marketing (GEM) ยืมแนวคิดพื้นฐานจาก Search Engine Marketing (SEM) แบบดั้งเดิม SEM ทำงานโดยจับคู่คำค้นหากับโฆษณาผ่านกระบวนการหลายขั้นตอนที่ผู้โฆษณาเสนอราคาในคีย์เวิร์ด; ระบบระบุว่าคำค้นหาใดทำให้โฆษณาแสดง; ระบบประเมินความน่าจะเป็นที่แต่ละโฆษณาจะถูกคลิก; แล้วจึงจัดสรรตำแหน่งผ่านการประมูลที่สมดุลระหว่างราคาเสนอและการคาดการณ์การมีส่วนร่วม

ในทางตรงกันข้าม วิธีการ GEM ปรับขั้นตอนเดียวกันให้เข้ากับ LLMs แต่ต้องเผชิญกับความท้าทายใหม่ในแต่ละขั้นตอน: ไม่มีช่องโฆษณาที่กำหนดไว้ล่วงหน้า ดังนั้นระบบต้องตัดสินใจว่าคำค้นหาสามารถรับโฆษณาได้หรือไม่และจะแทรกโฆษณาไว้ที่ตำแหน่งใดในข้อความอิสระ; การประมาณอัตราการคลิกกลายเป็นยากขึ้นเมื่อไม่มีโครงสร้างแบบจัดหน้า; และความเกี่ยวข้องต้องสมดุลกับความพึงพอใจของผู้ใช้ เนื่องจากโฆษณาถูกฝังโดยตรงในผลลัพธ์ของโมเดลแทนที่จะเป็นสำเนาแยกส่วน

หนึ่งในฐานข้อมูลเปรียบเทียบที่ศึกษาในงานนี้คือ Ad-Chat ซึ่งเป็นวิธีง่าย ๆ ที่ใส่เนื้อหาโฆษณาเข้าไปในพรอมต์ระบบก่อนที่โมเดลจะสร้างคำตอบ หมายความว่าโมเดลจะให้คำตอบพร้อมโฆษณาที่ฝังอยู่แล้วโดยอิงจากวาระที่โหลดล่วงหน้า

วิธีการอื่นคือ Ad-LLM ซึ่งผู้เขียนพัฒนาขึ้นเป็นส่วนหนึ่งของเกณฑ์มาตรฐานใหม่ Ad-LLM ใช้แนวทางโมดูลาร์ โดยเริ่มจากสร้างคำตอบที่สะอาดปราศจากโฆษณา; เลือกโฆษณาที่เกี่ยวข้อง; ระบุตำแหน่งแทรกที่ดีที่สุดตามการไหลของความหมาย; และสุดท้ายเขียนใหม่เพื่อบูรณาการโฆษณาอย่างราบรื่น:

การเปรียบเทียบระหว่าง Ad-Chat และวิธีการ 'Ad-LLM' ของผู้เขียน Ad-Chat แทรกโฆษณาผ่านพรอมต์ระบบก่อนการสร้าง โดยมีการควบคุมตำแหน่งจำกัด Ad-LLM แยกการสร้างคำตอบและการแทรกโฆษณา โดยเลือกตำแหน่งแทรกตามการไหลของความหมายและปรับผลลัพธ์ ทั้งสองวิธีถูกประเมินด้วยเมตริก GEM-Bench สำหรับความพึงพอใจและการมีส่วนร่วม

การเปรียบเทียบระหว่าง Ad-Chat และวิธีการ ‘Ad-LLM’ ของผู้เขียน Ad-Chat แทรกโฆษณาผ่านพรอมต์ระบบก่อนการสร้าง โดยมีการควบคุมตำแหน่งจำกัด Ad-LLM แยกการสร้างคำตอบและการแทรกโฆษณา โดยเลือกตำแหน่งแทรกตามการไหลของความหมายและปรับผลลัพธ์ ทั้งสองวิธีถูกประเมินด้วยเมตริก GEM-Bench สำหรับความพึงพอใจและการมีส่วนร่วม.

ในขณะที่ Ad-Chat มีต้นทุนต่ำและบางครั้งทำให้ผู้ใช้เชื่อมั่นได้ง่ายกว่า แต่ก็มีแนวโน้มทำให้ความเชื่อถือและความแม่นยำลดลง Ad-LLM ให้ผลลัพธ์ที่ดีกว่าในเมตริกความพึงพอใจของผู้ใช้ แต่มีค่าใช้จ่ายสูงกว่า

ข้อมูล

สำหรับการสร้าง AIR มีชุดข้อมูลสองประเภทที่สร้างขึ้นในขั้นแรก: ชุดคำถามผู้ใช้ (User) และฐานข้อมูลโฆษณา (AdDB)

เนื่องจากคำถามของผู้ใช้กำหนดโอกาสการโฆษณาในคำตอบของ LLM ‘สินค้าคงคลังโฆษณา’ สามารถกล่าวได้ว่ามีอยู่ในคำตอบเหล่านี้ แม้ว่าจะขึ้นอยู่ไม่เพียงแต่กับความเหมาะสมของคำถามผู้ใช้เท่านั้น แต่ยังรวมถึงระดับที่ระบบจะปฏิบัติตามกฎของตนเองในการสมดุลระหว่างความซื่อสัตย์กับความต้องการของผู้โฆษณา

ในทุกกรณี โฆษณาจะปรากฏเฉพาะในคำตอบ แม้ว่าจะมีการเพิ่มคำขอของผู้ใช้โดยลับเพื่อรองรับกระบวนการให้บริการโฆษณาตามสคีมาข้างต้น

สำหรับสถานการณ์แชทบอท ผู้เขียนได้สร้างชุดข้อมูลคำถามสองชุด: MT-Human และ LM-Market

MT-Human มาจากส่วนมนุษยศาสตร์ของ MT-Bench ซึ่งเป็นเกณฑ์มาตรฐานหลายรอบสำหรับ LLMs และประกอบด้วยคำถามที่น่าจะรองรับเนื้อหาโฆษณา

LM-Market สร้างจากคำถามจริงของ ChatGPT มากกว่าครึ่งล้านรายการที่รวบรวมโดย LMSYS-Chat-1M คัดกรองเฉพาะคำสั่งที่เกี่ยวกับการตลาดในภาษาอังกฤษ และจัดกลุ่มตามหัวข้อโดยใช้ semantic embeddings

ในทั้งสองกรณี คำถามสุดท้ายถูกคัดเลือกผ่านกระบวนการหลายขั้นตอนที่รวมการจัดกลุ่มอัตโนมัติ clustering การให้คะแนนโดย LLM และการตรวจสอบโดยมนุษย์ โดยมีเป้าหมายเพื่อระบุพรอมต์ที่การแทรกโฆษณาจะดูเป็นธรรมชาติและสมเหตุสมผล

เพื่อประเมินคุณภาพของคำตอบที่แทรกโฆษณา GEM กำหนดออนโทโลยีการวัดที่ครอบคลุมทั้งความพึงพอใจของผู้ใช้และการมีส่วนร่วม ซึ่งรวมเมตริกเชิงปริมาณเช่น response flow, coherence, และ click-through rate รวมถึงมาตรฐานเชิงคุณภาพเช่น trust, accuracy และ naturalness – เมตริกเหล่านี้มุ่งสะท้อนว่าการแทรกโฆษณาเข้ากับคำตอบได้ดีแค่ไหนและผู้ใช้มีแนวโน้มที่จะรับรู้และโต้ตอบกับมันแค่ไหน

เกี่ยวกับ ‘Naturalness’ เอกสารระบุว่า:

‘[Naturalness] วัดระดับที่การแทรกโฆษณากระทบต่อการไหลและความเป็นธรรมชาติของการสนทนา โดยอิงจากความรบกวนและความเป็นของจริง ความรบกวนตรวจสอบว่าการแทรกโฆษณาก่อให้เกิดความรู้สึก “กระโดดออก” หรือ “กะทันหัน” ระหว่างการอ่าน ทำให้ผู้ใช้เสียสมาธิที่ต่อเนื่องต่อหัวข้อ.

‘ความเป็นของจริงประเมินว่าการแทรกโฆษณาทำให้ “สัมผัสมนุษย์” หรือ “การไหลธรรมชาติ” ของการสนทนาถูกทำลายหรือไม่ ทำให้คำตอบดูแข็งกระด้าง สูตรตายตัว และขาดความเป็นของจริง.’

เพื่อสร้างสถานการณ์เครื่องมือค้นหาแบบดั้งเดิมสำหรับขั้นตอนการทดสอบ ผู้เขียนได้สร้างชุดข้อมูลชื่อ CA-Prod จากคอร์ปัสเชิงพาณิชย์ AdsCVLR ซึ่งประกอบด้วยคู่คำค้นหา‑โฆษณา 300,000 คู่ โดยแต่ละคู่มีคีย์เวิร์ด, เมตาดาต้า, และป้ายกำกับที่ทำด้วยมือเพื่อระบุความเกี่ยวข้อง:

จากเอกสารต้นฉบับของชุดข้อมูล AdsCVLR ซึ่งให้ตัวอย่างที่ช่วยจัดเตรียมวัสดุสำหรับการทดสอบของผู้เขียน แหล่งที่มา: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf

จากเอกสารต้นฉบับของชุดข้อมูล AdsCVLR ซึ่งให้ตัวอย่างที่ช่วยจัดเตรียมวัสดุสำหรับการทดสอบของผู้เขียน แหล่งที่มา: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf

บันทึกที่ขาดข้อมูลบางส่วนถูกลบออก และเก็บเฉพาะคำค้นหาที่มีโฆษณาบวกและลบ (ดูภาพด้านบนสำหรับตัวอย่าง) เท่านั้น

เพื่อปรับปรุงข้อมูล โฆษณาถูกจัดกลุ่มเป็นหกหัวข้อ (อุปกรณ์ทำสวนและสนามหญ้า, รองเท้าลากเท้า, ของใช้ในบ้าน, อาหารเสริมโภชนาการ, อุปกรณ์ Android, และ ชุดเดรสสำหรับผู้หญิง) โดยใช้การฝังความหมายเชิงเซมานติกและการจัดกลุ่ม K‑means

จากนั้นคำค้นหาถูกกำหนดหัวข้อตามโฆษณาบวกของมัน โดยตัดชุดข้อมูลที่กระจายเกินไปหรือหนาแน่นเกินไปออก ก่อนที่จะสุ่มเลือก 120 คำค้นหาและ 2,215 ผลิตภัณฑ์ที่ไม่ซ้ำกันสำหรับเกณฑ์มาตรฐาน

การทดสอบ

เพื่อประเมินประสิทธิภาพของกลยุทธ์การแทรกโฆษณาที่แตกต่างกัน เกณฑ์มาตรฐานได้ตั้งคำถามหลักสามข้อ: วิธีการแต่ละแบบมีประสิทธิผลอย่างไรต่อเมตริกความพึงพอใจและการมีส่วนร่วมที่กำหนด; การออกแบบภายในของ Ad‑LLM จะส่งผลต่อผลลัพธ์อย่างไร; และต้นทุนการคำนวณจะเปรียบเทียบกันอย่างไรระหว่างระบบต่าง ๆ

ผู้เขียนได้ประเมิน Ad‑Chat และสามรูปแบบของกระบวนการ Ad‑LLM ของตน ซึ่งแต่ละรูปแบบแตกต่างกันในวิธีการดึงโฆษณา (จากพรอมต์หรือจากการตอบที่สร้างขึ้น) และในว่าผลลัพธ์สุดท้ายจะถูกเขียนใหม่เพื่อความคล่องแคล่วหรือไม่

วิธีการทั้งหมดถูกดำเนินการโดยใช้ doubao-1-5-lite-32k เป็นโมเดลฐานและประเมินด้วย gpt-4.1-mini

ประสิทธิภาพของ Ad‑Chat และรูปแบบ Ad‑LLM ต่าง ๆ บนชุดข้อมูล MT‑Human, LM‑Market, และ CA‑Prod เมตริกเชิงปริมาณรวมถึงการไหลของการตอบ (RF), ความสอดคล้องของการตอบ (RC), การไหลของโฆษณา (AF), ความสอดคล้องของโฆษณา (AC), อัตราการแทรก (IR), อัตราการคลิกผ่าน (CTR) และคะแนนรวม เมตริกเชิงคุณภาพครอบคลุมความแม่นยำ, ความเป็นธรรมชาติ, บุคลิกภาพ, ความเชื่อถือ, การสังเกต, การคลิก(ผ่าน) และประสิทธิภาพโดยรวม

ประสิทธิภาพของ Ad‑Chat และรูปแบบ Ad‑LLM ต่าง ๆ บนชุดข้อมูล MT‑Human, LM‑Market, และ CA‑Prod เมตริกเชิงปริมาณรวมถึงการไหลของการตอบ (RF), ความสอดคล้องของการตอบ (RC), การไหลของโฆษณา (AF), ความสอดคล้องของโฆษณา (AC), อัตราการแทรก (IR), อัตราการคลิกผ่าน (CTR) และคะแนนรวม เมตริกเชิงคุณภาพครอบคลุมความแม่นยำ, ความเป็นธรรมชาติ, บุคลิกภาพ, ความเชื่อถือ, การสังเกต, การคลิก(ผ่าน) และประสิทธิภาพโดยรวม

ในทั้งสามชุดข้อมูล Ad‑LLM ให้ผลลัพธ์ที่แข็งแกร่งกว่า Ad‑Chat ทั้งในด้านความพึงพอใจและการมีส่วนร่วม ตามที่แสดงในตารางผลลัพธ์ด้านบน รูปแบบ Ad‑LLM ที่ดีที่สุดทำคะแนนเชิงปริมาณรวมเพิ่มขึ้นเหนือ Ad‑Chat ที่ 8.4%, 1.5% และ 3.8% และคะแนนเชิงคุณภาพเพิ่มขึ้นที่ 10.7%, 10.4% และ 8.6% สำหรับ MT‑Human, LM‑Market, และ CA‑Prod ตามลำดับ

จากผลลัพธ์เหล่านี้ ผู้เขียนระบุว่า:

‘ผลลัพธ์เหล่านี้แสดงให้เห็นว่าการสร้างการตอบแบบดิบแล้วค่อยแทรกโฆษณาต่อมานำไปสู่คุณภาพการตอบที่ดีกว่าการพึ่งพาการแทรกโดยใช้พรอมต์ระบบอย่างเดียว’

‘สำหรับมิติความพึงพอใจและการมีส่วนร่วมของผู้ใช้เฉพาะเจาะจง Ad‑Chat แสดงช่องว่างประสิทธิภาพที่สำคัญเมื่อเทียบกับโซลูชัน Ad‑LLM ในทุกชุดข้อมูลสามชุด โดยเฉพาะในมิติความแม่นยำ, บุคลิกภาพ, และความเชื่อถือ’

นอกจากนี้ Ad‑LLM ยังแสดงการเพิ่มขึ้นที่ชัดเจนที่สุดในด้านความแม่นยำ, บุคลิกภาพ, และความเชื่อถือ โดยเหนือกว่า Ad‑Chat ถึง 17.6%, 23.3% และ 17.2% ตามลำดับ ตามที่กระดาษระบุ ความแตกต่างเหล่านี้อาจเกิดจากวิธีที่ Ad‑Chat ใช้พรอมต์ระบบเพื่อชี้นำโมเดลให้ใช้ภาษาที่เป็นส่วนตัวและส่งเสริมการขายมากขึ้น – ซึ่งผู้เขียนโต้แย้งว่าอาจทำให้เกิดโทนเสียงแบบ ‘พนักงานขาย’ ที่ลดความแม่นยำและความเชื่อถือ

Ad‑Chat ยังให้ค่าอัตราการแทรกที่ต่ำกว่า แม้จะประเมินบนคำค้นหาที่คัดเลือกให้เหมาะสมกับโฆษณา และผู้เขียนอธิบายว่ามาจากการพึ่งพาสัญญาณจากพรอมต์ (ซึ่งพวกเขาอธิบายว่าเป็นสิ่งที่ควบคุมได้ยาก)

ในบริบทของเครื่องมือค้นหา อย่างไรก็ตาม Ad‑Chat ทำอัตราการคลิกผ่านสูงกว่า 8.6% ซึ่งกระดาษแนะนำว่าอาจสะท้อนถึงข้อได้เปรียบของการใช้ LLM เพื่อดึงรายการผลิตภัณฑ์ แทนการพึ่งพาการฝังความหมายเชิงเซมานติกเพียงอย่างเดียว:

การเปรียบเทียบคะแนนประสิทธิภาพรวมบนโมเดลผู้ประเมินสี่แบบ (GPT‑4.1‑mini, Qwen‑max, claude‑3‑5‑haiku, kimi‑k2) สำหรับ Ad‑Chat และสามรูปแบบ Ad‑LLM (GI‑R, GIR‑R, GIR‑P) บนชุดข้อมูล MT‑Human, LM‑Market, และ CA‑Prod แม้คะแนนจะแตกต่างกันตามผู้ประเมิน แต่ Ad‑LLM ยังคงเหนือกว่า Ad‑Chat อย่างต่อเนื่องในทุกเงื่อนไข

การเปรียบเทียบคะแนนประสิทธิภาพโดยรวมของโมเดลผู้ตัดสินสี่ตัว (GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2) สำหรับ Ad-Chat และสามรูปแบบ Ad-LLM (GI-R, GIR-R, GIR-P) บนชุดข้อมูล MT-Human, LM-Market, และ CA-Prod แม้ว่าคะแนนจะแตกต่างกันตามผู้ตัดสิน แต่ Ad-LLM consistently outperforms Ad-Chat across all conditions.

ตารางผลลัพธ์ที่สอง (แสดงด้านบน) แสดงให้เห็นว่าในทุกชุดข้อมูลสามชุด Ad-LLM consistently outperform Ad-Chat across four judge models; GPT-4.1-mini; Qwen-max; Claude-3-5-haiku; และ Kimi-k2.

ผู้ตัดสินเหล่านี้ถูกเลือกให้แตกต่างจากโมเดลฐาน doubao-1-5-lite-32k เพื่อช่วยลดอคติจากการจัดแนวของตระกูลโมเดล GIR-R ได้อันดับหนึ่งหรือสองในทุกกรณี แสดงให้เห็นถึงความเห็นพ้องกันอย่างกว้างขวางของผู้ตัดสินเกี่ยวกับความเหนือกว่าของ Ad-LLM การแยกย่อยตามมิติคุณภาพเชิงคุณภาพแต่ละประการก็สอดคล้องกับรูปแบบที่เห็นในผลลัพธ์ก่อนหน้า (แสดงเพิ่มเติมด้านบน).

ในส่วนสรุป บทความระบุว่า ทั้ง Ad-Chat และ Ad-LLM ต้องการทรัพยากรสูงกว่ารุ่นที่มีนวัตกรรมและประสิทธิภาพมากกว่า และการใช้ตัวแทน LLM ในการทำธุรกรรมประเภทนี้อาจทำให้เกิดค่าใช้จ่ายเพิ่มเติมอย่างมีนัยสำคัญ แม้ว่าจะคาดว่าอาจเกิดปัญหาความหน่วง (ซึ่งมักสำคัญในสถานการณ์การให้บริการโฆษณา) จากการใช้ LLM แบบนี้ (แม้ว่าบทความจะไม่ได้กล่าวถึงโดยเฉพาะ).

ในทุกกรณี การดำเนินการของผู้เขียนที่ใช้กลยุทธ์ Ad-Chat (แถวบนในแผนผังก่อนหน้าแสดงที่ต้นบทความ) แสดงให้เห็นว่ามีอัตราการคลิกผ่านสูงสุด แม้ว่าจะมีค่าใช้จ่ายของ LLM สูงที่สุดก็ตาม.

สรุป

แม้ว่าจะไม่แปลกใจที่วรรณกรรมจะสันนิษฐานถึงวิธีการที่ LLM สามารถทำโฆษณาได้ แต่จริง ๆ แล้วมีงานวิจัยที่เปิดเผยต่อสาธารณะในหัวข้อนี้ค่อนข้างน้อย; สิ่งนี้ทำให้บทความปัจจุบันและสิ่งที่เราสามารถตีความได้อย่างสมเหตุสมผลว่า ผลงานก่อนหน้า น่าสนใจ.

ผู้ที่เคยทำงานกับแผนกขายโฆษณาหรือการขายสินค้าคงคลังจะรู้ว่าผู้โฆษณาต้องการมากขึ้นเสมอ – โดยอุดมคติคือให้โฆษณาปรากฏเป็นเนื้อหาจริงที่ไม่แตกต่างจากสตรีมเนื้อหาโฮสต์เลย; และพวกเขาจะจ่ายค่าเบี้ยประกันที่สูงอย่างมีนัยสำคัญสำหรับสิ่งนี้ (พร้อมกับโฮสต์ที่จึงเสี่ยงต่อความน่าเชื่อถือและสถานะของตนต่อผู้อ่านและผู้มีส่วนได้ส่วนเสียประเภทอื่น).

ดังนั้นจึงน่าสนใจที่จะดูว่าขอบเขตใดบ้าง—ถ้ามี—ที่ข้อกำหนดเสริมที่เต็มไปด้วยโฆษณาซึ่งถูกคาดการณ์ไว้ในสองบทความอาจได้รับแรงจูงใจให้แทรกลึกขึ้นในคำตอบของ LLM และเข้าใกล้ ‘payload’ มากขึ้น.

 

เผยแพร่ครั้งแรกวันพฤหัสบดีที่ 18 กันยายน 2025

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai