Interviuri
Edo Liberty, Fondator și Șef Științific la Pinecone – Seria de Interviuri

Edo Liberty, Fondator și Șef Științific la Pinecone, este un expert de top în sisteme de date la scară largă și învățare automată. Înainte de a lansa Pinecone – baza de date vectorială construită pentru performanță și scalabilitate – a fost Director de Cercetare la AWS și Șef al Laboratorului de Cercetare Amazon (AMZN ) AI, unde echipa sa a dezvoltat tehnologii de bază pentru SageMaker, OpenSearch, Kinesis și multe altele. Anterior, a condus laboratorul de cercetare Yahoo din New York, dezvoltând platforme și aplicații de învățare automată pentru căutare, publicitate și securitate. Lucrările sale se concentrează pe algoritmi și fundamente matematice pentru manipularea seturilor de date masive, cuprinzând reducerea dimensionalității, clustering, streaming și algebră liniară la scară largă.
Pinecone este o bază de date vectorială complet gestionată, construită pentru a putea fi utilizată pentru căutarea eficientă și scalabilă a seturilor de date dinamice mari. Aceasta suportă atât încorporări dense, cât și sparse, indexare în timp real și filtrare bazată pe metadate, integrându-se în mod transparent cu cloud-urile, modelele și cadrele de lucru principale. Cu scalare automată fără server, securitate de nivel întreprindere și standarde de conformitate precum SOC 2, ISO 27001, GDPR și HIPAA, Pinecone oferă o bază fiabilă pentru implementarea aplicațiilor AI la scară largă.
Ați fondat Pinecone în 2019, după ce ați condus cercetarea la Amazon AI Labs și ați construit sisteme precum SageMaker. Ce v-a inspirat să lansați Pinecone și să vă concentrați în mod special pe bazele de date vectoriale?
La AWS, echipa noastră de învățare automată a construit sisteme uimitoare, dar atunci când venea vorba de memoria sistemelor, nu exista nicio modalitate de a căuta semantic prin cantități uriașe de date nestructurate. Acest lucru necesita ingineri extrem de specializați care știau cum să construiască soluții complexe de căutare vectorială. Știam că, dacă exista o modalitate ca oamenii să aibă acces ușor la bogăția semantică pe care vectorii o captează și să o combineze cu modele sofisticate, atunci oricine ar putea accelera valoarea inteligenței artificiale pentru sine. Așadar, am părăsit AWS cu scopul de a transforma cu adevărat modul în care se poate obține valoarea maximă din datele nestructurate proprii, utilizând puterea inteligenței artificiale.
Pinecone a crescut și a devenit compania care definește spațiul bazelor de date vectoriale. Privind în urmă, care au fost cele mai mari obstacole tehnice sau de piață pe care a trebuit să le depășiți pentru a stabili această nouă categorie?
Cea mai mare provocare? Nimeni nu știa ce este o bază de date vectorială! Trebuia să educăm piața cu privire la ceea ce construiam și de ce era important. Am întrebat clienții noștri cum îi numeau ei înșiși și ne-au spus că îi numeau o bază de date vectorială.
Odată ce alții au început să înțeleagă, oamenii ne întrebau de ce nu puteau utiliza doar soluții open source? Și trebuia să explicăm toate limitările soluțiilor open source și compromisurile de scalabilitate și performanță pe care le-ar fi obținut – și, după toate acestea, ar fi avut nevoie de ingineri experimentați pentru a construi infrastructura. De aceea, am fost întotdeauna un serviciu gestionat și ne-am concentrat pe experiența utilizatorului. Sistemul nostru este extrem de complex sub aspect tehnic, deoarece aveți nevoie de această infrastructură specializată pentru căutarea asemănării la scară de miliarde. Dar o facem accesibilă printr-un apel API pe care orice dezvoltator îl poate utiliza.
Aceasta a însemnat abstractizarea întregii complexități a algoritmilor de vecinătate aproximativă, managementul indexului și sistemele distribuite. Dezvoltatorii nu vor să se gândească la parametrii HNSW, ei doar vor ca totul să funcționeze.
Ați trecut recent de la funcția de CEO la cea de Șef Științific, aducându-l pe Ash Ashutosh să conducă compania. Ce v-a motivat această decizie și cum vedeți evoluția rolului dvs. în următorul capitol al Pinecone?
Pinecone, ca companie, este o companie de inteligență artificială și o companie axată pe cercetare. Am ajuns unde suntem astăzi pentru că am redefinit căutarea, sistemele și algoritmii. Și am fost foarte activi din punct de vedere academic, publicând rapoarte tehnice și articole, ținând prelegeri și educând piața, chiar și scriind cărți și susținând cursuri universitare despre inteligență artificială și memorie. Pe măsură ce compania crește, avem nevoie să formalizăm aceste eforturi sub forma unui laborator de cercetare, care să fie separat de restul afacerii. Gândiți-vă la DeepMind și Google (GOOGL ) ca exemplu. În viitor, voi concentra energia mea pe conducerea cercetării noastre, pe facerea inteligenței artificiale mai cunoscătoare și pe construirea următorului set de produse contextuale de la Pinecone.
În același timp, Ash va fi un CEO fantastic și lider pentru Pinecone. El a fondat și extins mai multe companii de infrastructură și știe cum să opereze o companie precum Pinecone în mod eficient. El este profund cunoscător și creativ în ceea ce privește tehnologia și piața noastră. Și el este obsedat de clienți. Ash și eu vom colabora profund pentru a crește compania și afacerea noastră.
În postarea dvs. de blog, ați scris despre concentrarea asupra “facerea inteligenței artificiale mai cunoscătoare”. Ce înseamnă acest lucru în practică și cum este tehnologia Pinecone poziționată în mod unic pentru a facilita acest proces?
Inteligența artificială fără memorie este ca o persoană strălucită cu amnezie: multă inteligență, dar fără context. “Facerea inteligenței artificiale mai cunoscătoare” înseamnă oferirea sistemelor de inteligență artificială capacitatea de a accesa, înțelege și raționa asupra cantităților uriașe de informații în timp real.
Facem posibilă dezvoltarea de aplicații bazate pe inteligență artificială care oferă perspective relevante în timp real, extrase din date semantice înțelese și organizate, și asigurându-ne că sistemele de inteligență artificială nu doar ghicesc, ci pot recupera și sintetiza cunoștințe la cerere. Acest lucru duce la ieșiri mai precise, mai bine informate și mai actualizate pentru utilizatorii finali.
Facem acest lucru oferind toate componentele și capacitățile necesare pentru recuperarea de înaltă calitate, precisă și de la capăt la coadă, într-un singur loc, împreună cu o performanță de top pentru recuperarea la scară largă.
Având în vedere că ați predat “Memoria pe Termen Lung în Inteligența Artificială” la Princeton, cum vedeți relația dintre bazele de date vectoriale și viitorul modelelor de inteligență artificială? Credeți că memoria și contextul sunt ingredientele lipsă pentru modelele mari de astăzi?
În mod absolut. Modelele de limbaj mari sunt mașini de recunoaștere a pattern-urilor – strălucite, dar în mod fundamental limitate de datele de antrenament și ferestrele de context. Cursul pe care l-am predat cu Matthijs Douze de la Meta s-a concentrat pe algoritmii care fac posibilă căutarea vectorială peste cantități uriașe de date. Viitorul nu constă în modele mai mari, ci în recuperarea mai inteligentă a datelor, în timp real.
Multe întreprinderi se confruntă cu dificultăți la trecerea de la proiecte-pilot de inteligență artificială la implementări la scară de producție. Cum ajută Pinecone la podirea acestui gol și care sunt cele mai bune practici pe care le-ați observat la clienții de succes?
Gap-ul de obicei se reduce la trei lucruri: performanță (și cost) la scară, securitate și complexitate. Un demo care funcționează cu 10 milioane de documente se prăbușește la 10 miliarde. Rularea a ceva timp de o oră este diferită de a rula ceva non-stop, 24/7, fără toleranță la întreruperi. De aceea, ne-am concentrat asupra arhitecturii noastre fără server, a funcțiilor de nivel întreprindere și a ușurinței în utilizare.
Cea mai importantă chestiune este să începeți pur și simplu. Clienții noștri sunt adesea surprinși de cât de mult pot face fără să ne contacteze. Am proiectat astfel, dar suntem întotdeauna acolo atunci când clienții noștri ne necesită.
Ați petrecut cariera dvs. trecând între academia, cercetarea în tehnologia de vârf (Yahoo, AWS) și antreprenoriat. Cum v-au modelat aceste medii diferite abordarea dvs. de a construi Pinecone?
Academia m-a învățat să gândesc de la principii. Cum să abstractizez și să proiectez soluții excelente. La Yahoo și AWS, am învățat cum să construiesc platforme de date simple pe care inginerii le iubesc.
Antreprenoriatul este locul unde înveți că cea mai bună tehnologie câștigă doar dacă rezolvă probleme reale într-un mod pe care oamenii îl pot utiliza cu adevărat.
Acest amestec este crucial pentru ceea ce construim. Nu scriem doar articole de cercetare sau construim tehnologie pentru tehnologie. Fiecare inovație trebuie să facă viața dezvoltatorilor mai ușoară și aplicațiile întreprinderilor mai puternice.
Convergența căutării și a inteligenței artificiale pare a fi una dintre cele mai mari schimbări în calcul. Unde credeți că se îndreaptă acest lucru în următorii cinci ani și cum va ajuta Pinecone să modeleze acest viitor?
Căutarea devine conversațională și contextuală. În cinci ani, nu veți mai “căuta” – veți avea dialoguri cu sisteme de inteligență artificială care înțeleg nu doar întrebarea dvs., ci și intenția, contextul, istoricul. Fiecare interacțiune va fi informată de baze de cunoștințe uriașe, care sunt actualizate în timp real.
Construim infrastructura pentru acest lucru. Baza noastră de date vectorială este doar începutul. Văd un viitor în care fiecare aplicație are context încorporat, în care inteligența artificială nu halucinează pentru că este ancorată în date, în care granița dintre căutare și cunoaștere dispare.
Ca Șef Științific, veți fi mai implicat în date, modele și prototipuri. Care sunt domeniile de cercetare în care sunteți cel mai interesat să vă implicați în acest moment?
Oh, Doamne, de unde să încep? Pe termen scurt și mediu, mă implic în eficiență și ușurință în utilizare. Putem face căutarea vectorială de 10 ori mai rapidă, în timp ce o facem de 10 ori mai ieftină? Putem face API-urile noastre și mai simple decât sunt astăzi? Acestea sunt probleme dificile.
Pe termen lung, sunt obsedat de intersecția dintre recuperare și raționament. Cum puteți construi sisteme care nu doar găsesc fapte relevante, ci și înțeleg relațiile dintre ele? Și apoi folosiți acest context pentru a crea inteligență artificială mai cunoscătoare și agenți mai puternici.
În cele din urmă, la nivel personal: retrăgându-vă din rolul de CEO, ce vă entuziasmează cel mai mult despre această tranziție și ce fel de descoperiri sperați să deblocați în următoarea etapă a Pinecone?
Sunt cel mai fericit când sunt adânc în cod, lucrând cu echipa noastră de cercetare, având acele momente “wow, acest lucru funcționează cu adevărat!” la 2 dimineața.
Visul meu? Să fac recuperarea atât de bună încât să devină invizibilă. Unde dezvoltatorii pot construi aplicații contextuale fără să se gândească la încorporări, indici sau orice altceva și pur și simplu funcționează.
Suntem în acest moment incredibil în care inteligența artificială și datele converg. Potențialul este nelimitat și am șansa de a petrece zilele mele făcând ca acest viitor să se întâmple acum.
Mulțumim pentru acest interviu minunat, cititorilor care doresc să afle mai multe despre Pinecone.












