Συνεντεύξεις

Αναΐς Ντότις-Γεωργίου, Developer Advocate στην InfluxData – Σειρά Συνεντεύξεων

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η Αναΐς Ντότις-Γεωργίου είναι Developer Advocate για την InfluxData με πάθος για την κάνουν τα δεδομένα όμορφα με τη χρήση των Δεδομένων Analytics, του AI και της Μηχανικής Μάθησης. Παίρνει τα δεδομένα που συλλέγει, κάνει μια смесь ερεύνης, εξερεύνησης και μηχανικής για να μεταφράσει τα δεδομένα σε κάτι που έχει λειτουργία, αξία και ομορφιά. Όταν δεν είναι πίσω από μια οθόνη, μπορείτε να τη βρείτε έξω να ζωγραφίζει, να τεντώνει, να πατάει ή να κυνηγάει ένα ποδόσφαιρο.

InfluxData είναι η εταιρεία που κατασκευάζει InfluxDB, τη βάση δεδομένων χρόνου σειράς ανοιχτού κώδικα που χρησιμοποιείται από περισσότερους από ένα εκατομμύριο développers σε όλο τον κόσμο. Η αποστολή τους είναι να βοηθήσουν τους développers να κατασκευάσουν έξυπνες, πραγματικού χρόνου συστήματα με τα δεδομένα χρόνου σειράς.

Μπορείτε να μοιραστείτε λίγο για το ταξίδι σας από το να είστε Ερευνητικός Βοηθός στο να γίνετε Lead Developer Advocate στην InfluxData; Πώς έχει επηρεάσει η προέλευση σας στα δεδομένα analytics και τη μηχανική μάθηση τον τρέχοντα ρόλο σας;

Απέκτησα το πτυχίο μου στη χημική μηχανική με έμφαση στη βιοϊατρική μηχανική και τελικά εργάστηκα σε εργαστήρια που πραγματοποιούσαν ανάπτυξη εμβολίων και ανίχνευση αυτισμού πριν από τη γέννηση. Από εκεί, άρχισα να προγραμματίζω ρομποτικά χειρισμού υγρών και βοήθησα τους επιστήμονες δεδομένων να κατανοήσουν τις παραμέτρους για την ανίχνευση ανωμαλιών, το οποίο με έκανε πιο ενδιαφερόμενο για την προγραμματισμό.

Στη συνέχεια έγινα εκπρόσωπος ανάπτυξης πωλήσεων στην Oracle (ORCL ) και συνειδητοποίησα ότι πραγματικά χρειαζόμουν να επικεντρωθώ στην κωδικοποίηση. Πήρα ένα boot camp κωδικοποίησης στο Πανεπιστήμιο του Τέξας στα δεδομένα analytics και μπόρεσα να μπει στην τεχνολογία, συγκεκριμένα στις σχέσεις développers.

Η προέλευση μου από τεχνικό υπόβαθρο με βοήθησε να διαμορφώσω τον τρέχοντα ρόλο μου. Παρόλο που δεν είχα εμπειρία ανάπτυξης, μπορούσα να συσχετιστώ και να συμπονέσω με ανθρώπους που είχαν τεχνικό υπόβαθρο και νου αλλά προσπαθούσαν επίσης να μάθουν λογισμικό. Όταν δημιούργησα περιεχόμενο ή τεχνικές οδηγίες, μπόρεσα να βοηθήσω νέους χρήστες να υπερβούν τεχνικές προκλήσεις τοποθετώντας τη συζήτηση σε ένα контекστό που ήταν σχετικό και ενδιαφέρον για αυτούς.

Το έργο σας φαίνεται να συνδυάζει τη δημιουργικότητα με την τεχνική εμπειρία. Πώς ενσωματώνετε το πάθος σας για την κάνουν τα δεδομένα “όμορφα” στη καθημερινή σας δουλειά στην InfluxData;

Τελευταία, εστίασα περισσότερο στη μηχανική δεδομένων παρά στα δεδομένα analytics. Παρόλο που δεν εστίαζα τόσο στα δεδομένα analytics όσο στο παρελθόν, ακόμα απολαμβάνω τα μαθηματικά – νομίζω ότι τα μαθηματικά είναι όμορφα και θα πηδήξω στην ευκαιρία να εξηγήσω τα μαθηματικά πίσω από einen αλγόριθμο.

Το InfluxDB έχει sido ένα γωνιακό λίθο στο χώρο των δεδομένων χρόνου σειράς. Πώς βλέπετε την ανοιχτή κοινότητα να επηρεάζει την ανάπτυξη και την εξέλιξη του InfluxDB;

Η InfluxData είναι πολύ δεσμευμένη στην ανοιχτή αρχιτεκτονική δεδομένων και το οικοσύστημα Apache. Πέρυσι ανακοινώσαμε το InfluxDB 3.0, το νέο πυρήνα για το InfluxDB γραμμένο σε Rust και κατασκευασμένο με Apache Flight, DataFusion, Arrow και Parquet – αυτό που ονομάζουμε το FDAP stack. Όσο οι μηχανικοί στην InfluxData συνεχίζουν να συνεισφέρουν σε αυτά τα έργα upstream, η κοινότητα συνεχίζει να μεγαλώνει και το σύνολο έργων Apache Arrow γίνεται πιο εύχρηστο με περισσότερες λειτουργίες και ευκολία χρήσης, και ευρύτερη διαλειτουργικότητα.

Ποια είναι κάποια από τα πιο ενδιαφέροντα ανοιχτά έργα ή συνεισφορές που έχετε δει πρόσφατα στο контекστό των δεδομένων χρόνου σειράς και του AI;

Έχει sido καλό να δείτε την προσθήκη των LLMs που επαναχρησιμοποιούνται ή εφαρμόζονται σε δεδομένα χρόνου σειράς για zero-shot προβλέψεις. Το Autolab έχει μια συλλογή ανοιχτών μοντέλων γλωσσών χρόνου σειράς και το TimeGPT είναι ένα άλλο εξαιρετικό παράδειγμα.

Επιπλέον, διάφορα ανοιχτά έργα βιβλιοθηκών επεξεργασίας ροής, συμπεριλαμβανομένων Bytewax και Mage.ai, που επιτρέπουν στους χρήστες να εκμεταλλευτούν και να ενσωματώσουν μοντέλα από το Hugging Face είναι khá ενδιαφέροντα.

Πώς εξασφαλίζει η InfluxData ότι οι ανοιχτές πρωτοβουλίες της παραμένουν σχετικές και ωφέλιμες για την κοινότητα développers, ιδιαίτερα με τις ταχείς εξελίξεις στο AI και τη μηχανική μάθηση;

Οι πρωτοβουλίες της InfluxData παραμένουν σχετικές και ωφέλιμες εστιάζοντας στην συνεισφορά σε ανοιχτά έργα που οι εταιρείες AI επίσης εκμεταλλεύονται. Για παράδειγμα, κάθε φορά που το InfluxDB συνεισφέρει στο Apache Arrow, Parquet ή DataFusion, ωφελεί κάθε άλλη εταιρεία τεχνολογίας AI που το εκμεταλλεύεται, συμπεριλαμβανομένων Apache Spark, DataBricks, Rapids.ai, Snowflake, BigQuery, HuggingFace και πολλών άλλων.

Τα μοντέλα γλωσσών χρόνου σειράς γίνονται ολοένα και πιο σημαντικά στις προβλέψεις αναλυτικών. Μπορείτε να εξηγήσετε πώς αυτά τα μοντέλα μεταμορφώνουν τις προβλέψεις χρόνου σειράς και την ανίχνευση ανωμαλιών;

Τα μοντέλα γλωσσών χρόνου σειράς υπερέχουν των γραμμικών και στατιστικών μοντέλων ενώ επίσης παρέχουν zero-shot προβλέψεις. Αυτό σημαίνει ότι δεν χρειάζεται να εκπαιδεύσετε το μοντέλο στα δεδομένα σας πριν από τη χρήση του. Δεν υπάρχει επίσης ανάγκη να ρυθμίσετε ένα στατιστικό μοντέλο, το οποίο απαιτεί βαθιά εμπειρία στα δεδομένα χρόνου σειράς.

Ωστόσο, αντίθετα με την επεξεργασία φυσικής γλώσσας, ο τομέας των δεδομένων χρόνου σειράς λείπει σε δημόσια προσιτά μεγάλης κλίμακας δεδομένα. Τα περισσότερα υπάρχοντα προ-εκπαιδευμένα μοντέλα για δεδομένα χρόνου σειράς έχουν εκπαιδευτεί σε μικρές δείγματα, τα οποία περιέχουν μόνο quelques χιλιάδες – ή vielleicht μόνο quelques εκατοντάδες – δείγματα. Παρόλο που αυτά τα benchmark datasets έχουν sido καθοριστικά για την πρόοδο της κοινότητας χρόνου σειράς, οι περιορισμένες δείγματα και η έλλειψη γενικότητας θέτουν προκλήσεις για την προ-εκπαίδευση βαθιών μοντέλων μάθησης.

Αυτό που πιστεύω ότι κάνει τα ανοιχτά μοντέλα γλωσσών χρόνου σειράς δύσκολα να βρεθούν. Τα Google’s (GOOGL ) TimesFM και IBM’s Tiny Time Mixers έχουν εκπαιδευτεί σε τεράστιες βάσεις δεδομένων με εκατοντάδες δισεκατομμύρια σημεία δεδομένων. Με το TimesFM, για παράδειγμα, η διαδικασία προ-εκπαίδευσης πραγματοποιείται χρησιμοποιώντας Google Cloud TPU v3–256, η οποία αποτελείται από 256 TPU πυρήνες με συνολική μνήμη 2 terabytes. Η διαδικασία προ-εκπαίδευσης διαρκεί περίπου δέκα ημέρες και οδηγεί σε ένα μοντέλο με 1,2 δισεκατομμύρια παραμέτρους. Το προ-εκπαιδευμένο μοντέλο στη συνέχεια ρυθμίζεται σε συγκεκριμένες καθήκοντες και βάσεις δεδομένων χρησιμοποιώντας χαμηλότερη ταχύτητα μάθησης και λιγότερες εποχές.

Ελπίζω ότι αυτή η μεταμόρφωση σημαίνει ότι περισσότεροι άνθρωποι μπορούν να κάνουν ακριβείς προβλέψεις χωρίς βαθιά γνώση του τομέα. Ωστόσο, απαιτεί πολλή δουλειά για να ζυγίσετε τα πλεονεκτήματα και τα μειονεκτήματα της εκμετάλλευσης μοντέλων που είναι υπολογιστικά ακριβά όπως τα μοντέλα γλωσσών χρόνου σειράς από οικονομικής και περιβαλλοντικής πλευράς.

Αυτή η πост στο blog του Hugging Face περιέχει ένα άλλο εξαιρετικό παράδειγμα προβλέψεων χρόνου σειράς.

Τι είναι τα βασικά πλεονεκτήματα της χρήσης μοντέλων γλωσσών χρόνου σειράς над τις παραδοσιακές μεθόδους, ιδιαίτερα σε σχέση με την αντιμετώπιση σύνθετων προτύπων και zero-shot απόδοσης;

Το κρίσιμο πλεονέκτημα είναι ότι δεν χρειάζεται να εκπαιδεύσετε και να ξαναεκπαιδεύσετε ένα μοντέλο στα δεδομένα χρόνου σειράς σας. Αυτό ελπίζω ότι εξαλείφει το πρόβλημα της μηχανικής μάθησης online της παρακολούθησης της ολίσθησης του μοντέλου σας και της ενεργοποίησης της ξαναεκπαίδευσης, ιδανικά εξαλείφοντας την πολυπλοκότητα της πipeline προβλέψεων σας.

Δεν χρειάζεται επίσης να αγωνιέστε για να εκτιμήσετε τις δια-σειριακές συσχετίσεις ή σχέσεις για στατιστικά μοντέλα πολλών متανών. Η πρόσθετη διακύμανση που προστίθεται από τις εκτιμήσεις συχνά βλάπτει τις επακόλουθες προβλέψεις και μπορεί να προκαλέσει στο μοντέλο να μάθει ψευδείς συσχετίσεις.

Μπορείτε να δώσετε κάποια πρακτικά παραδείγματα για το πώς μοντέλα όπως το Google’s TimesFM, το IBM’s TinyTimeMixer και το AutoLab’s MOMENT έχουν εφαρμοστεί σε πραγματικές καταστάσεις;

Αυτό είναι δύσκολο να απαντηθεί·既然 αυτά τα μοντέλα είναι στη σχετική τους νιότη, λίγα είναι γνωστά για το πώς οι εταιρείες τα χρησιμοποιούν σε πραγματικές καταστάσεις.

Στην εμπειρία σας, ποια είναι τα προκλήματα που αντιμετωπίζουν συνήθως οι οργανισμοί όταν ενσωματώνουν μοντέλα γλωσσών χρόνου σειράς στις υφιστάμενες υποδομές δεδομένων τους, και πώς μπορούν να τα υπερβούν;

Τα μοντέλα γλωσσών χρόνου σειράς είναι τόσο νέα που δεν γνωρίζω τα συγκεκριμένα προκλήματα που αντιμετωπίζουν οι οργανισμοί. Ωστόσο, φαντάζομαι ότι θα αντιμετωπίσουν τα ίδια προκλήματα που αντιμετωπίζουν όταν ενσωματώνουν οποιοδήποτε μοντέλο GenAI στη διαδικασία δεδομένων τους. Αυτά τα προκλήματα περιλαμβάνουν:

  • Προβλήματα συμβατότητας και ενσωμάτωσης δεδομένων: Τα μοντέλα γλωσσών χρόνου σειράς συχνά απαιτούν συγκεκριμένα μορφές δεδομένων, συνεπή χρονοσήμανση και τακτά διαστήματα, αλλά η υφιστάμενη υποδομή δεδομένων μπορεί να περιλαμβάνει μη δομημένα ή ασυνεπή δεδομένα χρόνου σειράς που διασκορπίζονται σε διάφορους συστήματα, όπως legacy βάσεις δεδομένων, cloud αποθήκευση ή πραγματικού χρόνου ροές. Για να αντιμετωπιστούν αυτά τα προβλήματα, οι ομάδες πρέπει να εφαρμόσουν robustes pipelines ETL (εξαγωγή, μετασχηματισμός, φόρτωση) για να προεπεξεργαστούν, καθαρίσουν και ευθυγραμμίσουν τα δεδομένα χρόνου σειράς.
  • Κλιμακωσιμότητα και απόδοση μοντέλου: Τα μοντέλα γλωσσών χρόνου σειράς, ιδιαίτερα τα βαθιά μοντέλα μάθησης όπως τα transformers, μπορούν να είναι πόρων-εντατικά, απαιτώντας σημαντικούς υπολογιστικούς και μνημονικούς πόρους για να επεξεργαστούν μεγάλους όγκους δεδομένων χρόνου σειράς σε πραγματικό ή σχεδόν πραγματικό χρόνο. Αυτό θα απαιτούσε από τις ομάδες να αναπτύξουν μοντέλα σε κλιμακωτές πλατφόρμες όπως το Kubernetes ή τις cloud-διαχειριζόμενες υπηρεσίες ML, να εκμεταλλευτούν την επιτάχυνση GPU όταν χρειάζεται και να χρησιμοποιήσουν κατανεμημένα πλαίσια επεξεργασίας όπως Dask ή Ray για να παραλληλοποιήσουν την εύρεση μοντέλου.
  • Ερμηνευσιμότητα και αξιοπιστία: Τα μοντέλα χρόνου σειράς, ιδιαίτερα τα σύνθετα μοντέλα LMs, μπορούν να θεωρηθούν ως “μαύρες κουτίες”, καθιστώντας δύσκολο να ερμηνευτούν οι προβλέψεις. Αυτό μπορεί να είναι ιδιαίτερα προβληματικό σε ρυθμιζόμενους τομείς όπως η finance ή η υγεία.
  • Προστασία και ασφάλεια δεδομένων: Η αντιμετώπιση δεδομένων χρόνου σειράς συχνά περιλαμβάνει ευαίσθητες πληροφορίες, όπως δεδομένα αισθητήρων IoT ή δεδομένα χρηματοοικονομικών συναλλαγών, οπότε η εξασφάλιση της ασφάλειας και της συμμόρφωσης με τις καλύτερες πρακτικές ασφαλείας είναι κρίσιμο όταν ενσωματώνετε μοντέλα LMs. Οι οργανισμοί πρέπει να εξασφαλίσουν ότι οι διαδικασίες και τα μοντέλα δεδομένων τους συμμορφώνονται με τις καλύτερες πρακτικές ασφαλείας, συμπεριλαμβανομένης της κρυπτογράφησης και του ελέγχου πρόσβασης, και να αναπτύξουν μοντέλα σε ασφαλείς, απομονωμένα περιβάλλοντα.

Κοιτάζοντας μπροστά, πώς φανταζόσαστε τον ρόλο των μοντέλων γλωσσών χρόνου σειράς να εξελίσσεται στον τομέα της προβλέψεων αναλυτικών και του AI; Υπάρχουν κάποιες αναδυόμενες τάσεις ή τεχνολογίες που σας ενθουσιάζουν ιδιαίτερα;

Ένα πιθανό επόμενο βήμα στην εξέλιξη των μοντέλων γλωσσών χρόνου σειράς θα μπορούσε να είναι η εισαγωγή εργαλείων που θα επιτρέψουν στους χρήστες να αναπτύξουν, να αποκτήσουν πρόσβαση και να χρησιμοποιήσουν αυτά τα μοντέλα πιο εύκολα. Πολλά από τα μοντέλα γλωσσών χρόνου σειράς που έχω χρησιμοποιήσει απαιτούν πολύ συγκεκριμένα περιβάλλοντα και λείπουν σε βάθος οδηγιών και τεκμηρίωσης. Τελικά, αυτά τα έργα βρίσκονται στις πρώτες φάσεις τους, αλλά θα είναι ενδιαφέρον να δούμε πώς θα εξελιχθούν τους επόμενους μήνες και χρόνια. Ευχαριστώ πολύ για τη μεγάλη συνέντευξη, οι αναγνώστες που επιθυμούν να μάθουν περισσότερα πρέπει να επισκεφθούν την InfluxData.

Ο Antoine είναι ένας οραματιστής ηγέτης και συνιδρυτής της Unite.AI, οδηγείται από μια αμετάβλητη страсть για το σχήμα και την προώθηση του μέλλοντος της τεχνητής νοημοσύνης και της ρομποτικής. Ένας σειριακός επιχειρηματίας, πιστεύει ότι η τεχνητή νοημοσύνη θα είναι τόσο διαταρακτική για την κοινωνία όσο και η ηλεκτρική ενέργεια, και συχνά πιάνεται να μιλάει για το δυναμικό των διαταρακτικών τεχνολογιών και της AGI.

Ως μελλοντολόγος, είναι αφιερωμένος στο να εξερευνήσει πώς αυτές οι καινοτομίες θα σχήματίσουν τον κόσμο μας. Επιπλέον, είναι ο ιδρυτής του Securities.io, μιας πλατφόρμας που επικεντρώνεται στις επενδύσεις σε ακριβές τεχνολογίες που ανασχεδιάζουν το μέλλον και αναμορφώνουν ολόκληρες βιομηχανίες.