Andersons vinkel
Alibaba Utvecklar Sökmotorsimulerings-AI som Använder Livsdata

I samarbete med akademiska forskare i Kina har Alibaba utvecklat en sökmotorsimulerings-AI som använder riktiga världens data från e-handelsjättens levande infrastruktur för att utveckla nya rankningsmodeller som inte är begränsade av “historiska” eller föråldrade uppgifter.
Motorn, som kallas AESim, representerar den andra stora tillkännagivandet på en vecka som erkänner behovet av AI-system som kan utvärdera och inkorporera livs- och aktuella data, istället för att bara abstrahera data som var tillgänglig när modellen tränades. Den tidigare tillkännagivandet var från Facebook, som i förra veckan presenterade BlenderBot 2.0-språkmodellen, en NLP-gränssnitt som har live-utfrågning av internet-sökresultat i svar på frågor.
Målet med AESim-projektet är att tillhandahålla en experimentell miljö för utveckling av nya Learning-To-Rank (LTR) lösningar, algoritmer och modeller i kommersiella informationsåtervinningssystem. Vid testning av ramverket fann forskarna att det korrekt återspeglade online-prestation inom användbara och handlingsbara parametrar.
Artikelns författare, inklusive fyra representanter från Nanjing universitet och från Alibabas forskningsavdelning, hävdar att en ny tillvägagångssätt för LTR-simuleringar var nödvändig av två skäl: misslyckandet av nyligen liknande initiativ i djupinlärning för att skapa reproducerbara tekniker, med en mängd uppmärksammade algoritmer som misslyckades med att översättas till tillämpliga realvärldssystem; och bristen på överförbarhet, i termer av prestation av utbildningsdata kontra ny data i fall där systemen initialt var mer effektiva.
Going Live
Artikeln hävdar att AESim är den första e-handelssimuleringsplattformen som bygger på data från levande och aktuella användare och aktivitet, och att den kan korrekt återspegla online-prestation genom ensidig användning av livsdata, vilket ger en blå himmel-träningsplats för senare forskare att utvärdera LTR-metodologier och innovationer.
Modellen inkorporerar en ny synvinkel på en typisk schema för industriella sökmotorer: den första fasen är återvinning av artiklar relaterade till användarens fråga, som inte initialt presenteras för användaren, men som först sorteras av en viktad LTR-modell. Sedan skickas de sorterade resultaten genom en filter som överväger företagets mål med att tillhandahålla resultaten – mål som kan inkludera annonsering och mångfaldsfaktorer.
Arkitektur av AESim
I AESim ersätts frågorna med kategorindex, vilket tillåter systemet att hämta artiklar från en kategorindex innan de skickas till en anpassningsbar omrangör som producerar den slutliga listan. Även om ramverket tillåter forskare att studera effekterna av gemensam rangordning över flera modeller, lämnas denna aspekt för framtida arbete, och den nuvarande implementeringen söker automatiskt efter den idealiska utvärderingen baserat på en enda modell.
AESim skapar inbäddningar (virtuella representationer i maskinlärningsarkitekturen) som omfattar den “virtuella användaren” och deras fråga, och använder en Wasserstein Generative Adversarial Network med Gradient Penalty (WGAN-GP)-tillvägagångssätt.
Arkitekturen består av en databas med miljontals tillgängliga artiklar sorterade efter kategori, ett anpassningsbart rangordningssystem, ett återkopplingsmodul och syntetiska datamängder genererade av GAN-baserade komponenter. Återkopplingsmodulen är den sista fasen i arbetsflödet, som kan utvärdera prestationen av den senaste iterationen av en rangordningsmodell.
Generativ Adversarial Imitation Learning
För att modellera beslutslogiken för “Virtual User Module”, tränas återkopplingsmodulen (som tillhandahåller de slutliga resultaten) genom Generative Adversarial Imitation Learning (GAIL), en teori som först föreslogs av Stanford-forskare 2016. GAIL är en modellfri paradigm som tillåter ett system att utveckla en policy direkt från data genom imitation learning.
Träningsuppsättningarna som utvecklats av AESim är i princip desamma som statiska, historiska datamängder som används i tidigare övervakade lärandemodeller för liknande system. Skillnaden med AESim är att det inte är beroende av en statisk datamängd för återkoppling, och inte är begränsat av artikelordningarna som genererades när (gamla) träningsdata samlades in.
Den generativa aspekten av AESim handlar om skapandet av en virtuell användare genom WGAN-GP, som genererar “falska” användar- och frågeegenskaper, och sedan försöker skilja denna falska data från äkta användardata som tillhandahålls av de levande nätverken som AESim har tillgång till.

En molnrepresentation av falska och riktiga användare i en typisk industriell sökmotorsimulering.
Testning
Forskarna testade AESim genom att distribuera en parvis, punktvis och ListMLE-instans i systemet, var och en av dem som skulle tjäna en icke-överlappande slumpmässig skiva av sökfrågor i sammanhanget av en omrangör-algoritm.
Vid denna punkt utmanas AESim av de snabbt förändrade och varierade livsdata på samma sätt som Facebooks nya språkmodell sannolikt kommer att vara. Därför har resultaten övervägts i ljuset av den övergripande prestationen.
Testad under tio dagar visade AESim en anmärkningsvärd konsekvens över tre modeller, även om forskarna noterade att en ytterligare test av en Document Context Language Model (DLCM)-modul presterade dåligt i den offline-miljön, men mycket bra i den levande miljön, och medger att systemet kommer att visa luckor med dess levande motsvarigheter, beroende på konfigurationen och modellerna som testas.














