Rozhovory

Edo Liberty, zakladatel a hlavní vědec ve společnosti Pinecone – rozhovor

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Edo Liberty, zakladatel a hlavní vědec ve společnosti Pinecone, je předním odborníkem na velké datové systémy a strojové učení. Předtím, než založil Pinecone – vektorovou databázi postavenou pro výkon a škálovatelnost – byl ředitelem výzkumu ve společnosti AWS a vedoucím laboratoře Amazon (AMZN ) AI, kde jeho tým vyvinul základní technologie pro SageMaker, OpenSearch, Kinesis a další. Předtím vedl výzkumné centrum Yahoo v New Yorku, kde rozvíjel platformy a aplikace pro strojové učení v oblasti vyhledávání, reklamy a bezpečnosti. Jeho práce se zaměřuje na algoritmy a matematické základy pro zpracování velkých dat, včetně redukce dimenzionality, clusterizace, streamování a velké lineární algebry.

Pinecone je plně spravovaná vektorová databáze navržená pro efektivní a škálovatelné vyhledávání ve velkých dynamických datech. Podporuje jak husté, tak řídké vložené objekty, indexování v reálném čase a filtrování založené na metadatech, zatímco se integruje bezproblémově s předními cloudy, modely a rámci. Díky serverless autoškálování, podnikovému zabezpečení a standardům dodržování předpisů, jako je SOC 2, ISO 27001, GDPR a HIPAA, Pinecone poskytuje spolehlivý základ pro nasazení velkých aplikací AI.

Založil jste Pinecone v roce 2019 po vedení výzkumu v Amazon AI Labs a budování systémů, jako je SageMaker. Co vás inspirovalo k založení Pinecone a soustředění se specificky na vektorové databáze?

V AWS náš tým pro strojové učení postavil úžasné systémy, ale když šlo o paměť, nebyl žádný způsob, jak provést semantické vyhledávání ve velkém množství nestrukturovaných dat. To vyžadovalo extrémně specializované inženýry, kteří věděli, jak postavit komplexní řešení založená na vektorovém vyhledávání. Věděl jsem, že pokud existuje způsob, jak lidem umožnit snadno přístup k semantické bohatosti, kterou vektory zachycují, a kombinovat ji se sofistikovanými modely, pak by kdokoli mohl urychlit hodnotu AI pro sebe. Takže jsem opustil AWS s cílem skutečně transformovat, jak udělat co nejlépe z vlastních nestrukturovaných dat pomocí síly AI.

Pinecone se stal definujícím podnikem v oblasti vektorových databází. Ohlédneme-li se zpět, jaké byly největší technické nebo tržní překážky, které jste museli překonat, aby jste založili tuto novou kategorii?

Největší výzvou? Nikdo nevěděl, co je vektorová databáze! Museli jsme vzdělat trh o tom, co jsme stavěli a proč je to důležité. Zeptali jsme se našich zákazníků, jak to sami nazývají, a řekli nám, že to nazývají vektorovou databází.

Jakmile se ostatní začali chytat, lidé se ptali, proč nemohou použít open source? A my museli vysvětlit všechny omezení open source a kompromisy mezi škálovatelností a výkonem, které byste dostali – a poté byste stále potřebovali zkušené inženýry, aby postavili vaši infrastrukturu. To je důvod, proč jsme vždy byli spravovanou službou a zaměřili se na uživatelský zážitek. Naší systém je extrémně komplikovaný pod kapotou, protože potřebujete tuto specializovanou infrastrukturu pro vyhledávání podobnosti v miliardách měřítek. Ale děláme to přístupným pomocí API volání, které může použít jakýkoli vývojář.

Toto znamenalo abstrahovat veškerou složitost aproximovaných algoritmů nejbližších sousedů, správy indexů a distribuovaných systémů. Vývojáři nechtějí přemýšlet o parametrech HNSW, chtějí, aby to prostě fungovalo.

Nedávno jste přešli z pozice CEO na pozici hlavního vědce a přivítali Asha Ashutose, aby vedl společnost. Co vás motivovalo k tomuto rozhodnutí a jak vidíte svou roli v další kapitole Pinecone?

Pinecone jako společnost je AI společnost a výzkumně zaměřená společnost. Dostali jsme se tam, kde jsme dnes, protože jsme předefinovali vyhledávání, systémy a algoritmy. A jsme byli velmi aktivní v akademické sféře, publikovali technické zprávy a články, přednášeli a vzdělávali trh, dokonce psali učebnice a přednášeli univerzitní kurzy o AI a paměti. Jak společnost roste, potřebujeme formalizovat tyto úsilí v rámci výzkumné laboratoře, která je oddělena od zbytku podniku. Myslete na DeepMind a Google (GOOGL ) jako příklad. Dalšími směry będu soustředit svou energii na vedení našeho výzkumu, dělání AI znalostního a budování další sady kontextových produktů z Pinecone.

V době, kdy Ash bude fantastickým CEO a lídrem pro Pinecone. Založil a rozšiřoval několik infrastrukturních společností a ví, jak účinně provozovat společnost, jako je Pinecone. Je hluboce znalý a kreativní o naší technologii a našem trhu. A je intenzivně zákaznicky posedlý. Ash a já budeme partnerovat hluboce na růstu společnosti a našeho podnikání.

Vašem blogovém příspěvku jste psali o soustředění se na „dělání AI znalostního“. Můžete vysvětlit, co to znamená v praxi a jak je technologie Pinecone jedinečně positionována, aby to umožnila?

AI bez paměti je jako géniový člověk s amnézií: mnoho inteligence, ale žádná kontext. “Dělání AI znalostního” znamená dát AI systémům schopnost přístupu, porozumění a rozumnění velkých množství informací v reálném čase.

Povolujeme AI poháněným aplikacím poskytovat relevantní přehledy v reálném čase, vytažené ze semanticky pochopitelných a organizovaných dat a zajišťujeme, aby AI systémy nebyly pouze hádáním, ale byly schopny získat a syntetizovat znalosti na vyžádání. To vede k více přesným, informovaným a aktuálnímu výstupu pro koncové uživatele.

Dosahujeme toho tím, že poskytujeme všechny komponenty a schopnosti pro vysoce kvalitní, přesné koncové vyhledávání na jednom místě, spolu s průmyslově vedoucím výkonem pro velké měřítko vyhledávání.

Jako učitel „Long Term Memory in AI“ na Princetonské univerzitě, jak vidíte vztah mezi vektorovými databázemi a budoucností modelů AI? Věříte, že paměť a kontext jsou chybějícími ingrediencemi pro současné velké modely?

Absolutně. LLM jsou stroje pro rozpoznávání vzorců – géniové, ale stále fundamentálně omezené svými trénovacími daty a kontextovými okny. Kurz, který jsem učil s Matthijsem Douzem z Meta, se zaměřil na algoritmy, které umožňují vektorové vyhledávání nad velkými daty. Budoucnost není většími modely, ale chytřejším vyhledáváním nad více daty, v reálném čase.

Mnohé podniky bojují s přechodem z pilotních projektů AI do produkčních nasazení. Jak Pinecone pomáhá překlenout tuto mezeru a jaké nejlepší postupy jste pozorovali u úspěšných zákazníků?

Mezera obvykle spočívá ve třech věcech: výkonu (a nákladů) ve škálovatelnosti, zabezpečení a složitosti. Demo, které funguje s 10 miliony dokumentů, se rozpadne u 10 miliard. Spuštění něčeho na jednu hodinu je jiné než spuštění 24/7 s nulovou tolerancí pro výpadek. To je důvod, proč jsme se soustředili na naši serverless architekturu, podnikové funkce a snadné použití.

Nej重要nější věcí je prostě začít. Naši zákazníci jsou často překvapeni tím, kolik mohou udělat, aniž by museli mluvit s námi. Navrhli jsme to tak úmyslně, ale jsme vždy tam, když naši zákazníci potřebují.

Strávil jste svou kariéru přechodem mezi akademií, velkým technickým výzkumem (Yahoo, AWS) a podnikáním. Jak tyto různé prostředí ovlivnila váš přístup ke stavbě Pinecone?

Akademie mě naučila myslet z prvních principů. Jak abstrahovat a navrhnout velké řešení. V Yahoo a AWS jsem se naučil, jak postavit jednoduché datové platformy, které inženýři rádi staví.

Podnikání je tam, kde se učíte, že nejlepší technologie vyhrávají pouze tehdy, pokud řeší skutečné problémy způsobem, který lidé mohou skutečně použít.

Tato směs je zásadní pro to, co stavíme. Nestavíme pouze výzkumné články nebo technologie pro technologii sama o sobě. Každá inovace musí udělat životy vývojářů snazšími a podnikovým aplikacím více powerful.

Konvergence vyhledávání a AI se zdá být jednou z největších změn v počítačích. Kde si myslíte, že toto směruje v příštích pěti letech a jak bude práce Pinecone helpingovat formovat tuto budoucnost?

Vyhledávání se stává konverzačním a kontextovým. Za pět let nebudete “hledat” – budete mít dialogy s AI systémy, které rozumí nejen vašemu dotazu, ale také vašemu záměru, vašemu kontextu, vaší historii. Každá interakce bude informována rozsáhlými znalostními bázemi, které jsou aktualizovány v reálném čase.

Stavíme infrastrukturu pro toto. Naše vektorová databáze je teprve začátek. Vidím budoucnost, kde každá aplikace má vestavěný kontext, kde AI nehalucinuje, protože je založena na datech, kde hranice mezi vyhledáváním a znalostmi mizí.

Jako hlavní vědec budete mít více rukou na datech, modelech a prototypování. Jaké oblasti výzkumu vás osobně nejvíce zajímají právě teď?

Ó, kde mám začít? Pro krátkodobý a střednědobý horizont se budu věnovat efektivitě a snadnému použití. Můžeme udělat vektorové vyhledávání 10x rychlejší, zatímco děláme to 10x levnější? Můžeme udělat naše API ještě jednodušší, než jsou dnes? Tyto jsou tvrdé problémy.

Pro dlouhodobý horizont jsem posedlý průnikem vyhledávání a rozumnění. Jak postavit systémy, které nenajdou pouze relevantní fakta, ale rozumí vztahům mezi nimi? A poté použít tento kontext pro vytvoření znalostního AI a silnějších agentů.

Nakonec, na osobní úrovni: krok zpět z role CEO, co vás nejvíce baví o této přechodu a jaké průlomy doufáte odemknout v další fázi Pinecone?

Jsem nejšťastnější, když jsem hluboko v kódu, pracuji s naším výzkumným týmem, mám ty “wow, tohle skutečně funguje!” momenty ve 2 hodiny ráno.

Můj sen? Udělat vyhledávání tak dobré, že se stane neviditelným. Kde vývojáři mohou stavět kontextové aplikace bez přemýšlení o vkládání nebo indexech nebo čemkoli jiném a prostě to funguje.

Jsme v tomto úžasném okamžiku, kde se AI a data sbíhají. Potenciál je neomezený a já trávím své dny tvořením této budoucnosti právě teď.

Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit Pinecone.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.