Interviews
Fabiana Clemente, medstifter og Chief Data Officer i YData – Interviewserie

Fabiana Clemente er medstifter og Chief Data Officer i YData. YData er en AI-startup, der har skabt den første data-centreret udviklingsløsning, der kombinerer dataopdagelse, -forbedring og -skalering på én enkelt platform.
Hvad var det, der oprindeligt tiltrak dig til AI og maskinlæring?
Min baggrund er i anvendt matematik, hvor jeg fik mulighed for at lære og forstå, hvordan vi kan udtrække informationer fra data samt gøre det ved hjælp af kode. På det tidspunkt var det ikke så “sexy” som maskinlæring, men det var bestemt det, der antændte min passion for området.
Kan du dele historien bag Ydata?
Som en datavidenskabsmand, der har arbejdet for både startups og virksomheder, havde jeg min retfærdige del af udfordringer – nogle gange var adgangen til data blokeret under påstanden om sikkerhed eller privatliv, andre gange var adgangen let, men datakvaliteten var ikke engang tæt på, hvad der var nødvendigt for at bygge AI-baserede løsninger. At vide, at disse udfordringer er meget hyppige i de fleste organisationer, inspirerede os til at starte virksomheden med målet at hjælpe disse hold med at overvinde disse hindringer ved at accelerere deres AI-udvikling med forbedret data.
Kan du beskrive for vores læsere, hvad syntetisk data er?
Syntetisk data betragtes som enhver data, der ikke er genereret i den virkelige verden, således enhver data, der er skabt kunstigt. Der er metoder, der muliggør generation af syntetisk data – fra regelbaserede strategier til brug af maskin- eller dyb læringmodeller til at lære disse “regler” for os. I YData har vi adopteret og specialiseret os i en dyb læring-baseret strategi til at generere ny data, der fastholder adfærd fra virkelige verdensbegivenheder uden bekymringer omkring privatliv.
Hvad gør syntetisk data så vigtigt?
Jo mere organisationer forstår vigtigheden af data for at styrke deres forretninger, jo mere vil vigtigheden og rollen af syntetisk data blive forstået. At indsamle rigtige data er ikke kun tidskrævende og dyrt, men også nogle gange umuligt. For at bygge AI-applikationer er data en hård krav – her kommer syntetisk data til undsætning. Evnen til at generere usete scenarier eller blot at låse adgangen til data er nøgle til at udvikle sig i en verden, hvor pionerer som Andrew Ng siger, at det at blive data-centreret er nøgle til en succesfuld AI-adoption.
I selv kørende biler eller andre maskinautomatiseringsaktiviteter kan vi allerede opfange vigtigheden af syntetisk data, så jeg ville sige, at det er naturligt, at denne forståelse spreder sig over alle industrielle vertikaler.
Hvordan genererer Ydata syntetisk data?
YData udnytter primært dybe generative modeller for at lære de statistiske attributter og korrelationer mellem variabler i den oprindelige data. Dette giver mulighed for, at modellen kan generere et statistisk relevant dataset, der har samme forretningsværdi som den oprindelige, uden at tillade sporing til de oprindelige poster.
YData skyder denne teknologi fremad og er bag Syntetisk Data Fællesskab – en gruppe af datavidenskabsfolk, der er dedikeret til at forkynne og hjælpe alle, der ønsker at lære og bruge denne teknologi.
Hvordan hjælper Ydata-platformen med at opdage og låse op for nye datakilder?
YData’s platform indeholder indbyggede forbindelser til enhver type database, datawarehouse eller datalag, der giver brugerne mulighed for let at få adgang til relevante metadata og forstå, om den eksisterende data er nyttig til at besvare de forretningsspørgsmål, de har i hænderne – uden endda at se på de rigtige poster.
Kan du dele nogle detaljer omkring det åbne fællesskab for syntetisk data?
Syntetisk data er kun i sine begyndelser, og derfor er bevidstheden om, hvordan det genereres, fordelene eller begrænsningerne, stadig ikke fuldt ud kendt for et større publikum. Derfor har vi i YData besluttet at tage en mere uddannelsesmæssig vej ved at skabe det syntetiske datafællesskab – ud over at være et sted, hvor man kan udveksle ideer eller få hjælp fra eksperter inden for syntetisk data, er det også et sted, hvor datavidenskabsfolk og andre tekniske profiler kan starte deres rejse ind i syntetisk data med nogle af de mest interessante algoritmer fra litteraturen.
Desuden tilbyder vi også en perspektiv på datakvalitet, så datavidenskabsfolk kan først forstå data, de arbejder med, før de syntetiserer eller forbedrer datasynet. Vi er virkelig dedikeret til at hjælpe datahold med at blive mere og mere data-centreret.
YData annoncerede nyligt 2,7 millioner dollars i finansiering for at accelerere sin internationale udvidelse. Kan du dele nogle detaljer om, hvad dette betyder for virksomhedens fremtid og udvidelsesstrategi?
YData blev født internationalt – vi vidste, at denne type teknologi behøver tidlige adopterer, der normalt er i de mest avancerede lande. Derfor var vores første kunder allerede uden for Portugal, over hele Europa, og vi etablerer nu en tilstedeværelse i Nordamerika. Denne finansiering vil give os mulighed for at styrke vores tilstedeværelse i begge disse kontinenter, ikke kun kommercielt, men også for at vokse holdet: vi er et fuldt distribueret hold, der giver os mulighed for at ansætte de bedste talenter, uanset hvor de er.
Er der noget andet, du gerne vil dele om YData?
YData skyder grænserne for data-centreret AI og skaber en ny kategori: DataPrepOps – selvom det er et grimt navn, er det en smerte, de fleste virksomheder står overfor i dag, når det kommer til datavidenskabsudvikling. Datakvalitetstrenden fortsætter med at vokse, og efter Data Pipelines og Data Observability er Datakvalitet for Data Science-hold stadig i sin barndom, og YData er ved at blive en tankeleder inden for dataforberedning.
Tak for det gode interview, læsere, der ønsker at lære mere, skal besøge YData.












