Συνεντεύξεις
Δρ. Ram Sriharsha, Αντιπρόεδρος Μηχανικής στο Pinecone – Σειρά Συνεντεύξεων

Ο Δρ. Ram Sriharsha, είναι ο Αντιπρόεδρος Μηχανικής και Ερευνας στο Pinecone.
Πριν ενταχθεί στο Pinecone, ο Ram είχε θέσεις Αντιπροέδρου στο Yahoo, Databricks και Splunk. Στο Yahoo, ήταν και κύριος μηχανικός λογισμικού και έπειτα ερευνητικός επιστήμονας· στο Databricks, ήταν ο προϊστάμενος προϊόντος και μηχανικής για την ενοποιημένη πλατφόρμα αναλυτικών για γενomics· και, στα τρία χρόνια του στο Splunk, έπαιξε πολλαπλούς ρόλους, συμπεριλαμβανομένου του Sr Principal Scientist, Αντιπρόεδρου Μηχανικής και Distinguished Engineer.
Pinecone είναι μια πλήρως διαχειριζόμενη βάση δεδομένων διανυσμάτων που κάνει εύκολη την προσθήκη αναζήτησης διανυσμάτων σε εφαρμογές παραγωγής. Συνδυάζει βιβλιοθήκες αναζήτησης διανυσμάτων, ικανότητες όπως το φιλτράρισμα και κατανεμημένη υποδομή για να παρέχει υψηλή απόδοση και αξιοπιστία σε οποιοδήποτε μέγεθος.
Τι σας έκανε να ενδιαφερθείτε αρχικά για τη μηχανική μάθηση;
Η στατιστική υψηλής διάστασης, η θεωρία μάθησης και θέματα σαν αυτά με έκαναν να ενδιαφερθώ για τη μηχανική μάθηση. Είναι μαθηματικά καλά ορισμένα, μπορούν να αναλυθούν και έχουν κάποιες θεμελιώδεις ερμηνείες να προσφέρουν για το τι σημαίνει η μάθηση και πώς να σχεδιάσετε αλγόριθμους που μπορούν να μάθουν αποτελεσματικά.
Προηγουμένως ήσασταν Αντιπρόεδρος Μηχανικής στο Splunk, μια πλατφόρμα δεδομένων που βοηθά να μετατρέψει τα δεδομένα σε δράση για Observability, IT, Security και άλλα. Ποια ήταν κάποια από τα βασικά συμπεράσματά σας από αυτή την εμπειρία;
Δεν είχα καταλάβει μέχρι να φτάσω στο Splunk πόσο διαφορετικά είναι τα use cases στην αναζήτηση επιχειρήσεων: οι άνθρωποι χρησιμοποιούν το Splunk για ανάλυση log, observability και ανάλυση ασφάλειας μεταξύ πολλών άλλων use cases. Και αυτό που είναι κοινό σε πολλά από αυτά τα use cases είναι η ιδέα της ανίχνευσης παρόμοιων συμβάντων ή πολύ διαφορετικών (ή ανωμαλών) συμβάντων σε μη δομημένα δεδομένα. Αυτό αποδεικνύεται ένα δύσκολο πρόβλημα και οι παραδοσιακές μέθοδοι αναζήτησης через τέτοια δεδομένα δεν είναι πολύ κλιμακωτές. Κατά τη διάρκεια της θητείας μου στο Splunk, ξεκίνησα έρευνα γύρω από αυτά τα θέματα σχετικά με το πώς θα μπορούσαμε να χρησιμοποιήσουμε τη μηχανική μάθηση (και βαθιά μάθηση) για ανάλυση log, ανάλυση ασφάλειας, κ.λπ. Μέσω αυτής της εργασίας, κατέληξα στο συμπέρασμα ότι οι ενσωματώσεις διανυσμάτων και η αναζήτηση διανυσμάτων θα γίνουν μια θεμελιώδης πρωτοβουλία για νέες προσεγγίσεις σε αυτά τα πεδία.
Μπορείτε να περιγράψετε για μας τι είναι η αναζήτηση διανυσμάτων;
Στην παραδοσιακή αναζήτηση (αλλιώς γνωστή ως αναζήτηση λέξεων-κλειδιών), ψάχνετε για αντιστοιχίες λέξεων-κλειδιών μεταξύ μιας ερώτησης και εγγράφων (αυτό μπορεί να είναι tweets, ιστοσελίδες, νομικά έγγραφα, κ.λπ.). Για να το κάνετε αυτό, χωρίζετε την ερώτησή σας σε tokens, ανακτάτε έγγραφα που περιέχουν το δοσμένο token και συνδυάζετε και βαθμολογείτε για να καθορίσετε τα πιο σχετικά έγγραφα για μια δοσμένη ερώτηση.
Το κύριο πρόβλημα, φυσικά, είναι ότι για να πάρει σχετικά αποτελέσματα, η ερώτησή σας πρέπει να έχει αντιστοιχίες λέξεων-κλειδιών στο έγγραφο. Ένα κλασικό πρόβλημα με την παραδοσιακή αναζήτηση είναι: αν ψάχνετε για “pop” θα αντιστοιχίσετε “pop μουσική”, αλλά δεν θα αντιστοιχίσετε “soda”, κ.λπ. επειδή δεν υπάρχει αντιστοιχία λέξεων-κλειδιών μεταξύ “pop” και εγγράφων που περιέχουν “soda”, mặc dù γνωρίζουμε ότι σε πολλές περιοχές των ΗΠΑ, “pop” σημαίνει το ίδιο με “soda”.
Στην αναζήτηση διανυσμάτων, ξεκινάτε μετατρέποντας και τις ερωτήσεις και τα έγγραφα σε ένα διάνυσμα σε κάποιο χώρο υψηλής διάστασης. Αυτό συνήθως γίνεται με το πέρασμα του κειμένου через ένα μοντέλο βαθιάς μάθησης όπως τα LLMs της OpenAI ή άλλα μοντέλα γλωσσών. Τι παίρνετε ως αποτέλεσμα είναι ένα πίνακα αριθμών κινητής υποδιαστολής που μπορεί να θεωρηθεί ως ένα διάνυσμα σε κάποιο χώρο υψηλής διάστασης.
Η βασική ιδέα είναι ότι τα διάνυσμα που είναι κοντά στον χώρο υψηλής διάστασης είναι επίσης σημασιολογικά παρόμοια. Επιστρέφοντας στο παράδειγμά μας για “soda” και “pop”, αν το μοντέλο έχει εκπαιδευτεί στο σωστό corpus, είναι πιθανό να θεωρήσει “pop” και “soda” σημασιολογικά παρόμοια και επομένως οι αντίστοιχες ενσωματώσεις θα είναι κοντά η μία στην άλλη στο χώρο ενσωματώσεων. Αν αυτό είναι η περίπτωση, τότε η ανάκτηση κοντινών εγγράφων για μια δοσμένη ερώτηση γίνεται το πρόβλημα της αναζήτησης για τους πλησιέστερους γείτονες του αντίστοιχου διανύσματος ερώτησης σε αυτόν τον χώρο υψηλής διάστασης.
Μπορείτε να περιγράψετε τι είναι η βάση δεδομένων διανυσμάτων και πώς επιτρέπει την κατασκευή εφαρμογών αναζήτησης διανυσμάτων υψηλής απόδοσης;
Μια βάση δεδομένων διανυσμάτων αποθηκεύει, ευρετηριάζει και διαχειρίζεται αυτές τις ενσωματώσεις (ή διανύσματα). Οι κύριες προκλήσεις που αντιμετωπίζει μια βάση δεδομένων διανυσμάτων είναι:
- Η κατασκευή ενός αποτελεσματικού ευρετηρίου αναζήτησης για διανύσματα για να απαντήσει ερωτήσεις πλησιέστερων γειτόνων
- Η κατασκευή αποτελεσματικών βοηθητικών ευρετηρίων και δομών δεδομένων για την υποστήριξη φιλτράρισμα ερωτήσεων. Για παράδειγμα, αν θέλετε να αναζητήσετε μόνο ένα υποσύνολο του corpus, θα πρέπει να μπορείτε να εκμεταλλευτείτε το υπάρχον ευρετήριο αναζήτησης χωρίς να χρειαστεί να το ξαναχτίσετε
Υποστήριξη αποτελεσματικών ενημερώσεων και διατηρεί cả τα δεδομένα και το ευρετήριο αναζήτησης φρέσκα, συνεπή, ανθεκτικά, κ.λπ.
Ποια είναι τα διαφορετικά είδη αλγορίθμων μηχανικής μάθησης που χρησιμοποιούνται στο Pinecone;
Γενικά, εργαζόμαστε σε αλγόριθμους αναζήτησης πλησιέστερου γείτονα και αναπτύσσουμε νέους αλγόριθμους για την αποτελεσματική ενημέρωση, ερώτηση και αντιμετώπιση μεγάλων ποσοτήτων δεδομένων με τον πιο οικονομικό τρόπο.
Εργαζόμαστε επίσης σε αλγόριθμους που συνδυάζουν πυκνή και σπάνια ανάκτηση για βελτιωμένη σχετικότητα αναζήτησης.
Τι είναι κάποια από τα προβλήματα πίσω από την κατασκευή αναζήτησης κλιμακωτής;
Ενώ η αναζήτηση πλησιέστερου γείτονα έχει ερευνηθεί για δεκαετίες, πιστεύουμε ότι υπάρχουν πολλά που μένουν να ανακαλυφθούν.
Συγκεκριμένα, όταν πρόκειται για το σχεδιασμό μεγάλης κλίμακας αναζήτησης πλησιέστερου γείτονα που είναι οικονομικά αποδοτική, στην εκτέλεση αποτελεσματικού φιλτράρισμα σε κλίμακα, ή στο σχεδιασμό αλγορίθμων που υποστηρίζουν υψηλής όγκου ενημερώσεις και γενικά φρέσκα ευρετήρια είναι όλα προβληματικά πρόβλημα σήμερα.
Τι είναι κάποια από τα διαφορετικά είδη use cases που αυτή η τεχνολογία μπορεί να χρησιμοποιηθεί για;
Το φάσμα των use cases για τις βάσεις δεδομένων διανυσμάτων μεγαλώνει με την ημέρα. Εκτός από τις χρήσεις τους στην σημασιολογική αναζήτηση, τις βλέπουμε επίσης να χρησιμοποιούνται στην αναζήτηση εικόνων, ανάκτηση εικόνων, γενετική τεχνητή νοημοσύνη, ανάλυση ασφάλειας, κ.λπ.
Τι είναι η όρασή σας για το μέλλον της αναζήτησης;
Πιστεύω ότι το μέλλον της αναζήτησης θα είναι οδηγούμενο από την τεχνητή νοημοσύνη, και δεν πιστεύω ότι αυτό είναι πολύ μακριά. Σε αυτό το μέλλον, περιμένω οι βάσεις δεδομένων διανυσμάτων να είναι μια θεμελιώδης πρωτοβουλία. Σκεφτόμαστε τις βάσεις δεδομένων διανυσμάτων ως τη μακροχρόνια μνήμη (ή την εξωτερική βάση γνώσεων) της τεχνητής νοημοσύνης.
Ευχαριστώ για τη μεγάλη συνέντευξη, οι αναγνώστες που επιθυμούν να μάθουν περισσότερα μπορούν να επισκεφθούν Pinecone.












