Intervjuer
Fabiana Clemente, medgrundare och Chief Data Officer på YData – Intervju-serie

Fabiana Clemente är medgrundare och Chief Data Officer på YData. YData är ett AI-startup som skapade den första datacentrerade utvecklingslösningen för att kombinera dataupptäckt, förbättring och skalbarhet i en enda plattform.
Vad var det som initialt drog dig till AI och maskinlärning?
Min bakgrund är i tillämpad matematik, där jag hade möjlighet att lära mig och förstå hur vi kan extrahera information från data samt göra det med hjälp av kod. På den tiden var det inte lika “sexigt” som maskinlärning, men det var definitivt det som väckte min passion för området.
Kan du berätta om bakgrunden till Ydata?
Som data scientist som har arbetat för både startup-företag och stora företag, har jag haft min beskärda del av utmaningar – ibland var tillgången till data blockerad på grund av säkerhets- eller sekretessskäl, och ibland var tillgången lätt, men datans kvalitet var inte ens i närheten av vad som behövdes för att bygga AI-baserade lösningar. Att veta att dessa utmaningar är mycket vanliga i de flesta organisationer, inspirerade oss att starta företaget med målet att hjälpa dessa team att övervinna dessa hinder genom att accelerera sin AI-utveckling med förbättrad data.
Kan du beskriva vad syntetisk data är för vår publik?
Syntetisk data anses vara alla data som inte genererats i den verkliga världen, alltså alla data som skapas artificiellt. Det finns metoder som möjliggör generering av syntetisk data – från regelbaserade strategier till användning av maskin- eller djupinlärningsmodeller för att lära sig “reglerna” åt oss. På YData har vi antagit och specialiserat oss på en djupinlärningsbaserad strategi för att generera ny data som behåller beteendet från verkliga världshändelser utan problem kring sekretess.
Vad gör syntetisk data så viktig?
Ju mer organisationer inser vikten av data för att främja sina affärer, desto mer kommer betydelsen och rollen av syntetisk data att förstås. Att samla in riktiga data är inte bara tidskrävande och dyrt, utan ibland också omöjligt. För att bygga AI-applikationer krävs data – och här kommer syntetisk data till undsättning. Förmågan att generera osynliga scenarier eller att enkelt låsa upp tillgången till data är nyckeln till att utvecklas i en värld där pionjärer som Andrew Ng hävdar att att bli datacentrerad är nyckeln till en framgångsrik AI-adoption.
I självkörande bilar eller andra maskinautomatiseringsaktiviteter kan vi redan uppfatta betydelsen av syntetisk data, så jag skulle säga att det är helt naturligt att denna förståelse sprids över alla branschvertikaler.
Hur genererar Ydata syntetisk data?
YData använder främst djupa generativa modeller för att lära sig de statistiska attributen och korrelationerna mellan variabler i den ursprungliga datan. Detta möjliggör för modellen att generera en statistiskt relevant datamängd som har samma affärsvärde som den ursprungliga, utan att tillåta spårbarhet till de ursprungliga posterna.
YData driver denna teknik framåt och är företaget bakom Syntetisk Data Community – en grupp av data science-experter som är engagerade i att evangelisera och hjälpa alla som vill lära sig och använda denna teknik.
Hur hjälper Ydata-plattformen till att upptäcka och låsa upp nya datakällor?
YDatas plattform innehåller inbyggda kopplingar till alla typer av databaser, datawarehouse eller datalagring, som möjliggör för användarna att enkelt få tillgång till relevant metadata och förstå om den befintliga datan är användbar för att besvara de affärsfrågor de har i händerna – utan att ens titta på de riktiga posterna.
Kan du dela några detaljer om den öppna källkoden för syntetisk data-gemenskapen?
Syntetisk data är bara i sin linda och därför är medvetenheten om hur den genereras, fördelarna eller begränsningarna fortfarande ganska okända för en större publik. Därför har vi på YData beslutat att ta en mer pedagogisk väg genom att skapa syntetisk data-gemenskapen – förutom att det är en plats för att utbyta idéer eller få hjälp från experter inom syntetisk data, är det också en plats där data scientists och andra tekniska profiler kan börja sin resa inom syntetisk data, med några av de mest intressanta algoritmerna från litteraturen.
Vi erbjuder också en perspektiv på datakvalitet, så att data scientists kan först förstå datan de arbetar med, innan de syntetiserar eller förbättrar datasynthetisering. Vi är verkligen engagerade i att hjälpa data teams att bli mer och mer datacentrerade.
YData meddelade nyligen 2,7 miljoner dollar i finansiering för att påskynda sin internationella expansion. Kan du dela några detaljer om vad detta innebär för företagets framtid och expansionsstrategi?
YData föddes redan internationellt – vi visste att denna typ av teknik behöver tidiga antagare som vanligtvis finns i de mest sofistikerade länderna. Därför var våra första kunder redan utanför Portugal, över hela Europa, och vi etablerar nu en närvaro i Nordamerika också. Denna finansiering kommer att möjliggöra för oss att stärka vår närvaro på båda kontinenterna, inte bara kommersiellt utan också för att växa teamet: vi är ett fullt distribuerat team som möjliggör för oss att anställa de bästa talangerna, oavsett var de är.
Finns det något annat du vill dela om YData?
YData driver gränsen för datacentrerad AI och skapar en ny kategori: DataPrepOps – även om det är ett ful namn, är det en smärta som de flesta företag står inför idag när det gäller data science-utveckling. Datakvalitetstrenden fortsätter att växa och efter Data Pipelines och Data Observability, är Data Quality for Data Science teams fortfarande i sin linda och YData är på väg att bli en tankeledare inom dataförberedelse.
Tack för den underbara intervjun, läsare som vill lära sig mer kan besöka YData.












