Andersons hoek
Alibaba ontwikkelt zoekmachine-simulatie-AI die gebruik maakt van live-gegevens

In samenwerking met academische onderzoekers in China heeft Alibaba een zoekmachine-simulatie-AI ontwikkeld die gebruik maakt van echte wereldgegevens van de live-infrastructuur van de e-commerce-gigant om nieuwe rangschikkingsmodellen te ontwikkelen die niet worden gehinderd door ‘historische’ of verouderde informatie.
De motor, genaamd AESim, vertegenwoordigt de tweede grote aankondiging in een week om de noodzaak te erkennen voor AI-systemen om live en actuele gegevens te kunnen evalueren en incorporeren, in plaats van alleen gegevens te abstraheren die beschikbaar waren op het moment dat het model werd getraind. De eerdere aankondiging was van Facebook, die vorige week aankondigde de BlenderBot 2.0-taalmodel, een NLP-interface die live polling van internetzoekresultaten in reactie op queries bevat.
Het doel van het AESim-project is om een experimentele omgeving te bieden voor de ontwikkeling van nieuwe Learning-To-Rank (LTR) oplossingen, algoritmen en modellen in commerciële informatieverwervingsystemen. Bij het testen van het kader vonden de onderzoekers dat het nauwkeurig de online-prestaties weerspiegelde binnen nuttige en actiegerichte parameters.
De auteurs van het artikel, waaronder vier vertegenwoordigers van de Nanjing-universiteit en van de onderzoeksafdeling van Alibaba, beweren dat een nieuwe benadering van LTR-simulaties noodzakelijk was om twee redenen: het falen van recente soortgelijke initiatieven in diepe leer om reproduceerbare technieken te creëren, met een reeks aandachttrekkende algoritmen die faalden om te vertalen naar toepasbare real-world-systemen; en het gebrek aan overdraagbaarheid, in termen van prestaties van de trainingsgegevens versus nieuwe gegevens in gevallen waarin de systemen aanvankelijk effectiever waren.
Live gaan
Het artikel beweert dat AESim het eerste e-commerce-simulatieplatform is dat gebaseerd is op de gegevens van live en actuele gebruikers en activiteit, en dat het nauwkeurig de online-prestaties kan weerspiegelen door unilaterale gebruik van live-gegevens, waardoor een blauwe hemel-trainingsomgeving wordt gecreëerd voor latere onderzoekers om LTR-methodologieën en innovaties te evalueren.
Het model omvat een nieuwe benadering van een typisch schema voor industriële zoekmachines: de eerste fase is het ophalen van items die verband houden met de query van de gebruiker, die niet aanvankelijk aan de gebruiker worden gepresenteerd, maar eerst worden gesorteerd door een gewogen LTR-model. Vervolgens worden de gesorteerde resultaten doorgegeven aan een filter die de doelstellingen van het bedrijf bij het leveren van de resultaten in overweging neemt – doelstellingen die advertentie- en diversiteitsfactoren kunnen omvatten.
Architectuur van AESim
In AESim worden de queries vervangen door categorie-indexen, waardoor het systeem items uit een categorie-index kan ophalen voordat ze worden doorgegeven aan een aanpasbare re-ranker die de definitieve lijst produceert. Hoewel het kader onderzoekers in staat stelt om de effecten van gezamenlijke rangschikking over meerdere modellen te bestuderen, wordt dit aspect voor toekomstig werk achtergelaten, en zoekt de huidige implementatie automatisch de ideale evaluatie op basis van een enkel model.
AESim creëert embeddings (virtuele representaties in de machine learning-architectuur) die de ‘virtuele gebruiker’ en hun query omvatten, en maakt gebruik van een Wasserstein Generative Adversarial Network met Gradient Penalty (WGAN-GP) benadering.
De architectuur bestaat uit een database met miljoenen beschikbare items, gesorteerd op categorie, een aanpasbare rangschikkingsysteem, een feedbackmodule en synthetische datasets gegenereerd door de GAN-gebaseerde componenten. De feedbackmodule is de laatste fase in de workflow, die in staat is om de prestaties van de laatste iteratie van een rangschikkingsmodel te evalueren.
Generatieve Adversarial Imitation Learning
Om de beslissingslogica van de ‘Virtuele Gebruiker Module’ te modelleren, wordt de feedbackmodule (die de uiteindelijke resultaten levert) getraind met Generatieve Adversarial Imitation Learning (GAIL), een theorie die voor het eerst in 2016 door onderzoekers van Stanford werd voorgesteld. GAIL is een modelvrije paradigma dat een systeem in staat stelt om een beleid rechtstreeks vanuit gegevens te ontwikkelen door imitatie-leer.
De trainingssets die door AESim zijn ontwikkeld, zijn in wezen hetzelfde als statische, historische datasets die in eerdere toezichtige leermodellen voor soortgelijke systemen werden gebruikt. Het verschil met AESim is dat het niet afhankelijk is van een statische dataset voor feedback, en niet wordt gehinderd door de item-orders die werden gegenereerd op het moment dat (oude) trainingsgegevens werden samengesteld.
Het generatieve aspect van AESim richt zich op de creatie van een virtuele gebruiker door middel van WGAN-GP, die ‘neppe’ gebruiker- en querykenmerken produceert, en vervolgens probeert om deze neppe gegevens te onderscheiden van echte gebruikersgegevens die door de live-netwerken worden geleverd waartoe AESim toegang heeft.

Een cloud-representatie van neppe en echte gebruikers in een typische industriële zoekmachine-simulatie.
Testen
De onderzoekers testten AESim door een paarwijze, puntsgewijze en ListMLE instantie in het systeem te implementeren, waarbij elk een niet-overlappende willekeurige slice van zoekopdrachten in de context van een re-ranker-algoritme moest dienen.
Op dit punt wordt AESim uitgedaagd door de snel veranderende en diverse live-gegevens op dezelfde manier als Facebooks nieuwe taalmodel waarschijnlijk zal worden. Daarom zijn de resultaten bekeken in het licht van de algehele prestaties.
Gedurende tien dagen heeft AESim een opmerkelijke consistentie getoond over drie modellen, hoewel de onderzoekers opmerkten dat een aanvullende test van een Document Context Language Model (DLCM) module slecht presteerde in de offline-omgeving, maar zeer goed in de live-omgeving, en erkennen dat het systeem gaps zal vertonen met zijn live-tegenhangers, afhankelijk van de configuratie en modellen die worden getest.














