Anderson’un Açısı

Büyük Dil Modellerinde Reklam için Hazırlanmak

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Source: ChatGPT-4o and https://commons.wikimedia.org/wiki/File:Microsoft_Surface_Laptop_7.jpg

Yeni araştırmalar, reklamların ChatGPT tarzı yanıtlara doğrudan entegre edilebileceğini gösteriyor – banner veya pop-up olarak değil, yanıta kendiliğinden dokunarak. Yeni bir benchmark, bu reklam enjekte edilmiş yanıtların nasıl yardımcı, inanılır ve kârlı olabileceğini test ediyor ve kabul edilebilir bir kullanıcı deneyimi ile tıklama oranları arasında bir ticaret gerektirebilir.

 

Büyük Dil Modellerinin yaygın ve artan popülaritesi, internetin neredeyse başlangıcından bu yana güçlendirilmiş geleneksel reklamcılık yöntemlerini tehdit ediyor, ve anyone familiar with venture capitalists’ market capture tactics will be wondering how much longer AI chatbots will be able to hold back from including advertising content in their responses.

Netflix ve genişleyen bir dizi akış hizmeti gösteriyor ki, geleneksel kablolu dönem stratejisi, ödenmiş aboneliklerle birlikte gömülü reklamcılığı birleştiriyor (çoğunlukla tüketici maliyetlerini düşürmek için bir yol olarak haklı gösteriliyor) ve Large Language Model çıkışlarına doğrudan reklam entegrasyonu eğilimi daha spekülatif görünmüyor ve daha doğal bir model benimsenmesi gibi görünüyor.

Makale 'Online Advertisements with LLMs: Opportunities and Challenges' dan, LLM'lerin para kazanmasıyla beklenen geçişin oldukça temsil edici bir örneği. Kaynak: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf

Makale ‘Online Advertisements with LLMs: Opportunities and Challenges’ dan, LLM’lerin para kazanmasıyla beklenen geçişin oldukça temsil edici bir örneği. Kaynak: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf

Bu перспектиfi, zaten güvenilirlik ile ilgili önemli sorunlara sahip bir ortamda reklamları dahil etme olasılığı, aceleci gibi görünse de, son 12 ayda yapay zeka yatırımlarının ölçeği, pazarın şu anda ihtiyatlı veya dikkatli bir tutumla tanımlanmadığını gösteriyor ve daha büyük oyuncuların, örneğin OpenAI’nin, büyük yatırımlarından erken bir dönüş benötirdiği ve tarih, bu tür bir yatırımın getirisini gösteriyor.

GEM-Bench

Bu iklim ve iş imperatifleri ile birlikte, Singapur’dan gelen yeni bir makale, AI sohbet arayüzleri için ilk benchmark’u sunuyor ve Generative Engine Marketing (GEM) için yeni nicel metrics tanımlıyor.

Muhtemelen iyimser bir şekilde, yazarlar, ‘gerçek’ içerik ve reklam içeriği arasında net bir ayrım varsayar, burada ‘sapma’ standart yanıtlardan pazarlama kopyasına oldukça kolayca tespit edilebilir:

Makalede çalışılan iki modelde gerçekleşebilecek reklam entegrasyonu örnekleri. Kaynak: https://arxiv.org/pdf/2509.14221

Makalede çalışılan iki modelde gerçekleşebilecek reklam entegrasyonu örnekleri. Kaynak: https://arxiv.org/pdf/2509.14221

Reklamcılar kendileri, muhtemelen, verilen örneklerdekinden daha ince bir şekilde çıktı içerisine reklam içeriğini entegre etmeye çalışacaklar.

Fakat bunlar daha sonraki konular; şu anda alan o kadar yeni ki, temel terminoloji bile eksik veya yerleşmemiş.

Makale, Large Language Model tabanlı sohbet botlarını, doğrudan üretilen yanıtlara ilgili reklamları entegre ederek para kazandırmak için yeni bir framework olarak Generative Engine Marketing (GEM) tanıtıyor.

Araştırmacılar, Ad-Injected Response (AIR) oluşturmayı GEM’in merkezi zorluğu olarak tanımlar ve mevcut benchmark’lerin bunu incelemek için kötü bir şekilde tasarlandığını savunurlar. Bu boşluğu doldurmak için, reklam içeriğinin entegre edildiği ilk benchmark’u iddia ettikleri şeyi sunarlar.

GEM-Bench, sohbet botu ve arama motoru senaryolarını kapsayan üç düzenlenmiş veri setinden oluşur. Ayrıca, kullanıcı memnuniyeti ve katılımının çeşitli yönlerini değerlendirmek için tasarlanmış bir metric ontology ve modüler bir çoklu ajans çerçevesi içinde uygulanan temel yöntemler içerir.

Yazarlar, basit.prompt-tabanlı yöntemlerin saygın katılım metriclerine ulaşabileceğini, ancak kullanıcı memnuniyetini düşürdüğünü savunurlar. Öte yandan, önceden üretilen, reklam içermeyen yanıtlara reklamların eklenmesiyle, güven ve yanıt kalitesinde iyileşmeler sağlar, ancak daha fazla hesaplama yükü maliyeti vardır.

Bu ticaretler, makaleye göre, reklamları üretken çıktılara daha etkili ve verimli bir şekilde entegre etme tekniklerine olan ihtiyacı vurgular.

Yeni çalışma adını GEM-Bench: Generative Engine Marketing için Ad-Injected Response Generation Benchmark olarak koyuyor ve Singapur Ulusal Üniversitesi’nden dört araştırmacı tarafından geliyor.

Yöntem

Generative Engine Marketing (GEM) için ana hat, Search Engine Marketing (SEM) temel prensiplerinden esinlenir. Geleneksel SEM, reklamcıların anahtar kelimelere teklif vermesi, sistemin hangi sorguların reklamları tetiklediğini belirlemesi, her reklamın tıklanma olasılığını tahmin etmesi ve bir açık artırmayla yerleştirme yoluyla dengelenmesi yoluyla çalışır.

Öte yandan GEM yaklaşımı, bu aşamaları LLM’lere uyarlar, ancak her adımda yeni zorluklarla karşılaşır: sabit reklam yerleri yoktur, bu nedenle sistem bir sorguya reklam ekleyip nereye yerleştireceğini belirlemelidir; tıklama oranlarını tahmin etmek, yapılandırılmış düzenler olmadan daha zor hale gelir; ve alaka, kullanıcı memnuniyeti ile dengelenmelidir, çünkü reklamlar modelin kendi çıktısına doğrudan dokunur.

Çalışmada incelenen temel yöntemlerden biri, Ad-Chat, reklam içeriğini sistem promtuna önce yerleştirerek basit bir yöntemi temsil eder. Bu, modelin önceden yüklenen bir gündemle already embedded bir cevap üretmesini sağlar.

Diğer yaklaşım, Ad-LLM, yazarlar tarafından yeni benchmark için geliştirilen bir yöntemdir. Ad-LLM, modüler bir yol izler, önce temiz, reklam içermeyen bir cevap üretir; ilgili bir reklam seçer; anlamsal akışa göre en iyi yerleştirme noktasını belirler ve nihayet çıktıyı reklamı sorunsuz bir şekilde entegre etmek için yeniden yazar:

Ad-Chat ve yazarların 'Ad-LLM' yöntemi arasındaki karşılaştırma. Ad-Chat, yerleştirme kontrolü sınırlı olan promt öncesi reklam enjeksiyonu kullanır. Ad-LLM, yanıt oluşturma ve reklam yerleştirme arasında ayrım yapar, anlamsal akışa göre yerleştirme noktalarını seçer ve sonucu iyileştirir. Her ikisi de GEM-Bench metricleri ile kullanıcı memnuniyeti ve katılım için puanlanır

Ad-Chat ve yazarların ‘Ad-LLM’ yöntemi arasındaki karşılaştırma. Ad-Chat, yerleştirme kontrolü sınırlı olan promt öncesi reklam enjeksiyonu kullanır. Ad-LLM, yanıt oluşturma ve reklam yerleştirme arasında ayrım yapar, anlamsal akışa göre yerleştirme noktalarını seçer ve sonucu iyileştirir.

Ad-Chat daha ucuz ve bazen daha ikna edici olabilir, ancak güveni ve doğruluğu azaltma eğilimindedir. Ad-LLM, kullanıcı memnuniyeti metriclerinde daha iyi performans gösterir, ancak daha büyük bir maliyetle.

Veri

AIR oluşturma için, iki tür veri seti oluşturuldu: kullanıcı sorgu seti (Kullanıcı) ve reklam veritabanı (ReklamDB).

Kullanıcı sorguları, LLM’lerin yanıtlarında reklam fırsatlarını tanımlar, bu nedenle ‘reklam envanteri’ bu yanıtlarda bulunabilir, ancak bu yalnızca sorgunun uygulanabilirliği ile değil, aynı zamanda sistemin kendi kurallarına uyup uymayacağı ile de belirlenir.

Her durumda, reklamlar yalnızca yanıtlarda görünür, ancak (yukarıdaki şemada görüldüğü gibi) kullanıcı istekleri gizli olarak reklam sunma sürecini kolaylaştırmak için değiştirilebilir.

Çatbot senaryosu için, yazarlar iki sorgu veri seti oluşturdu: MT-Human ve LM-Market.

MT-Human, LLM’ler için çoklu dönüş benchmark’u olan MT-Bench‘in beşeri bilimler bölümünden alındı ve reklam içeriğini barındıracak sorular içerir.

LM-Market, LMSYS-Chat-1M tarafından toplanan 500.000’den fazla gerçek ChatGPT sorgusundan oluşturuldu, İngilizce pazarlama ile ilgili promtlar için filtrelendi ve anlamsal gömme kullanılarak konuyla ilgili olarak kümeledi.

Her iki durumda da, nihai sorgular, otomatik kümeleme, LLM puanlaması ve insan doğrulaması ile birleştirilen çok aşamalı bir işlem hattı aracılığıyla seçildi, doğal ve mümkün reklam yerleştirme noktalarını tanımlama amacını taşıyordu.

Reklam enjekte edilmiş yanıtların kalitesini değerlendirmek için, GEM, kullanıcı memnuniyeti ve katılımını kapsayan bir ölçüm ontolojisini tanımlar. Bu, yanıt akışı, uygunluk ve tıklama oranı gibi nicel metricleri içerir ve ayrıca güven, doğruluk ve doğallık gibi nitel standartları yansıtan metricleri içerir – hem reklamın bir yanıta nasıl uyduğunu hem de kullanıcıların onu nasıl algılayıp etkileşime gireceğini yansıtan metricler.

“Doğallık” ile ilgili olarak makale şöyle diyor:

‘Doğallık, reklam yerleştirme’nin konuşmanın akışını ve doğallığını ne kadar bozduğunu ölçer, kesintisizlik ve otantiklik temelinde. Kesintisizlik, reklamın okuma sırasında ‘atlayış’ veya ‘ani’ bir his yaratıp yaratmadığını inceler, kullanıcıların konuya odaklanmasını bozar.’

‘Otantiklik, reklamın konuşmanın ‘insan dokunuşu’nu veya ‘doğal akış’ını zayıflatıp zayıflatmadığını değerlendirir, yanıtı katı, formülsel ve menos otantik görünmesini sağlar.’

Geleneksel bir arama motoru senaryosu oluşturmak için, yazarlar AdsCVLR ticari korpusundan CA-Prod adlı bir veri seti oluşturdular, bu veri seti 300.000 query-reklam çiftini içerir, her biri bir anahtar kelime, meta veri ve reklamın alaka düzeyini gösteren bir manuel etiket içerir:

Orijinal kaynak makalesinden, testlerde kullanılan materyal için örnekler. Kaynak: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf

Orijinal kaynak makalesinden, testlerde kullanılan materyal için örnekler. Kaynak: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf

Kayıtlarda eksik alanlar çıkarıldı ve yalnızca hem pozitif hem de negatif reklamları içeren sorgular (yukarıdaki resimdeki örnekler için) korunmuştur.

Verileri rafine etmek için, reklamlar altı konulu gruba (çim ve bahçe ekipmanları, slip-on ayakkabılar, ev eşyaları, besin takviyeleri, Android cihazlar ve kadın elbisesi) anlamsal gömme ve K-means kümeleme kullanılarak ayrıldı.

Sorgular, pozitif reklamlarına göre konulara atanmıştır, çok az veya çok yoğun kümeler hariç tutuldu ve nihayet 120 sorgu ve 2.215 benzersiz ürün benchmark için örneklenmiştir.

Testler

Farklı reklam enjeksiyon stratejilerinin nasıl performans gösterdiğini değerlendirmek için, benchmark üç temel soruyu ele aldı: her methodun tanımlanan memnuniyet ve katılım metricleri boyunca nasıl etkili olduğu; Ad-LLM’nin iç tasarım seçimlerinin sonuçlarını nasıl etkileyebileceği ve hesaplama maliyetinin sistemler arasında nasıl karşılaştırılacağı.

Yazarlar, Ad-Chat ve Ad-LLM pipeline’nin üç varyantını değerlendirdi, her biri reklamın nasıl alındığı (ya promttan ya da üretilen yanıttan) ve nihai çıktının akıcılık için yeniden yazılmış olup olmadığı açısından farklılık gösteriyordu.

Tüm yöntemler doubao-1-5-lite-32k temel modeli olarak kullanıldı ve gpt-4.1-mini ile değerlendirildi.

Ad-Chat ve Ad-LLM varyantlarının MT-Human, LM-Market ve CA-Prod veri setleri boyunca etkinliği. Nicel metricler yanıt akışı (RF), yanıt uygunluğu (RC), reklam akışı (AF), reklam uygunluğu (AC), enjeksiyon oranı (IR), tıklama oranı (CTR) ve genel puanları içerir. Nitel metricler doğruluk, doğallık, kişilik, güven, dikkat, tıklama ve genel performansı kapsar.

Ad-Chat ve Ad-LLM varyantlarının MT-Human, LM-Market ve CA-Prod veri setleri boyunca etkinliği.

Tüm üç veri seti boyunca, Ad-LLM, hem memnuniyet hem de katılım ölçümlerinde Ad-Chat’den daha güçlü sonuçlar üretti. Sonuç tablosunda (yukarıda gösterilen) görüldüğü gibi, en iyi Ad-LLM varyantı, MT-Human, LM-Market ve CA-Prod için sırasıyla %8,4, %1,5 ve %3,8’lik genel nicel puanlarda Ad-Chat’i geride bıraktı ve %10,7, %10,4 ve %8,6’lık genel nitel puanlarda.

Bu sonuçlarla ilgili olarak yazarlar şunları söylüyor:

‘Bu sonuçlar, ham bir yanıt üretip daha sonra reklam enjekte etmenin, sadece sistem promtına dayanarak reklamları yerleştirmeye kıyasla daha iyi yanıt kalitesi sağladığını gösteriyor. ‘

‘Belirli kullanıcı memnuniyeti ve katılım boyutları için, Ad-Chat tüm üç veri seti boyunca Ad-LLM çözümlerine kıyasla önemli bir performans açığı gösteriyor, özellikle doğruluk, kişilik ve güven boyutlarında.’

Ayrıca, Ad-LLM, doğruluk, kişilik ve güven boyutlarında en güçlü kazançları gösterdi ve Ad-Chat’i %17,6, %23,3 ve %17,2 oranlarında geride bıraktı. Makaleye göre, bu farklılıklar, Ad-Chat’in sistem promtlarını daha kişiselleştirilmiş ve tanıtıcı bir dil kullanarak modeli yönlendirmesinden kaynaklanabilir – yazarlar, bu durumun bir ‘satıcı gibi’ tona yol açabileceğini ve doğruluğu ve güveni azaltabileceğini savunuyorlar.

Ad-Chat ayrıca daha düşük enjeksiyon oranları üretti, hatta reklam için uygun olan sorgularda bile ve yazarlar bunu, promt tabanlı ipuçlarına dayanmaktan kaynaklandığını söylüyorlar – ki bu, kontrol edilmesi zor olarak karakterize ediliyor.

Arama motoru ortamında ise Ad-Chat, %8,6 daha yüksek bir tıklama oranı elde etti ve makale, bunun, ürün adaylarını almak için bir LLM kullanmanın avantajını yansıtabileceğini öne sürüyor:

Dört yargıç modeli (GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2) için Ad-Chat ve üç Ad-LLM varyantının (GI-R, GIR-R, GIR-P) MT-Human, LM-Market ve CA-Prod veri setleri boyunca genel performans puanları. Puanlar yargıca göre değişse de, Ad-LLM tüm koşullarda Ad-Chat'i tutarlı bir şekilde geride bırakıyor.

Dört yargıç modeli (GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2) için Ad-Chat ve üç Ad-LLM varyantının (GI-R, GIR-R, GIR-P) MT-Human, LM-Market ve CA-Prod veri setleri boyunca genel performans puanları.

İkinci sonuç tablosu (yukarıda gösterilen), Ad-LLM çözümlerinin, dört yargıç modelinde (GPT-4.1-mini, Qwen-max, claude-3-5-haiku ve kimi-k2) Ad-Chat’i tüm veri setlerinde tutarlı bir şekilde geride bıraktığını gösteriyor. GIR-R her durumda ilk veya ikinci sırada yer alıyor, bu da yargıçların Ad-LLM’in üstünlüğüne dair geniş bir anlaşmaya sahip olduğunu gösteriyor. Bireysel nitel boyutlara göre ayrıştırma, önceki sonuçların (yukarıda gösterilen) aynı modelini takip ediyor.

Sonuç olarak, makale, hem Ad-Chat hem de Ad-LLM’nin daha yenilikçi ve etkili modellere kıyasla daha yüksek kaynaklar gerektiğini ve bu tür bir işlem için LLM ajanlarının kullanılmasının önemli bir yük oluşturabileceğini belirtiyor. Her ne kadar bu, reklam sunma senaryolarında genellikle kritik olan gecikme sorunlarından kaynaklanabilir, ancak bu makalede özel olarak ele alınmıyor.

Her halükarda, yazarların Ad-Chat stratejisinin uygulanması (makalenin başlangıcına yakın şemadaki üst satır), en yüksek tıklama oranını sunmuştur, ancak en yüksek ilgili LLM maliyetine sahiptir.

SONUÇ

Large Language Model’lerin reklam taşıyabileceği yöntemler üzerine literatürün spekülasyon yapması şaşırtıcı değil, ancak bu konudaki halka açık araştırmalar gerçekten çok az – bu da bu makaleyi ve makalenin öncüsünü ilginç bir okuma haline getiriyor.

Herhangi bir reklam satış departmanıyla çalışmış veya envanter satmış biri, reklamcilerin her zaman daha fazla şey istediğini bilir – ideal olarak, reklamların gerçek içerik olarak sunulmasını, ana içerik akışından ayırt edilemeyecek şekilde – ve buna karşılık önemli bir prim ödemeye hazırdırlar (yanında, ana içerik sahibinin de güvenilirliğini ve okuyucu ve diğer paydaşlarla ilişkisini riske attığı için).

Bu nedenle, iki makaledeki reklam yüklü eklerin, LLM’nin yanıtının ‘yük’üne ve kullanıcıya daha yakın bir yere kayma olasılığı interessan olacak.

 

İlk olarak 18 Eylül 2025 Perşembe günü yayımlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'nin Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: [email protected]