Podstawy AI

Co to jest nauka o danych?

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Obszar nauki o danych wydaje się coraz większy i bardziej popularny każdego dnia. Zgodnie z danymi LinkedIn, nauka o danych była jednym z najszybciej rozwijających się obszarów zatrudnienia w 2017 roku i w 2020 roku Glassdoor uznał pracę naukowca danych za jedną z trzech najlepszych prac w Stanach Zjednoczonych. Biorąc pod uwagę rosnącą popularność nauki o danych, nie jest zaskakujące, że coraz więcej ludzi jest zainteresowanych tym obszarem. Jednak co dokładnie jest nauką o danych?

Poznajmy się z nauką o danych, poświęcając trochę czasu na zdefiniowanie nauki o danych, zbadanie, jak duże dane i sztuczna inteligencja zmieniają ten obszar, naukę o niektórych wspólnych narzędziach nauki o danych i zbadanie przykładów nauki o danych.

Co to jest nauka o danych?

Przed zbadaniem jakichkolwiek narzędzi lub przykładów nauki o danych, chcemy uzyskać krótką definicję nauki o danych.

Definiowanie „nauki o danych” jest tak naprawdę trochę trudne, ponieważ termin ten jest stosowany do wielu różnych zadań i metod badawczych. Możemy zacząć od przypomnienia sobie, co oznacza termin „nauka”. Nauka to systematyczne badanie świata fizycznego i naturalnego poprzez obserwację i eksperymenty, mające na celu poszerzenie ludzkiej wiedzy o procesach naturalnych. Ważne słowa w tej definicji to „obserwacja” i „zrozumienie”.

Jeśli nauka o danych jest procesem zrozumienia świata poprzez wzorce w danych, to odpowiedzialność naukowca danych polega na transformacji danych, analizie danych i ekstrakcji wzorców z danych. Innymi słowy, naukowiec danych otrzymuje dane i używa różnych narzędzi i technik, aby przygotować dane do analizy i następnie przeanalizować dane w celu znalezienia znaczących wzorców.

Rola naukowca danych jest podobna do roli tradycyjnego naukowca. Obydwaj są zajęci analizą danych w celu potwierdzenia lub odrzucenia hipotez o tym, jak działa świat, starając się zrozumieć wzorce w danych, aby poprawić nasze zrozumienie świata. Naukowcy danych używają tych samych naukowych metod, co tradycyjni naukowcy. Naukowiec danych zaczyna od gromadzenia obserwacji na temat zjawiska, które chcą zbadać. Następnie formułują hipotezę na temat zjawiska i starają się znaleźć dane, które w jakiś sposób obalają ich hipotezę.

Jeśli hipoteza nie jest obalona przez dane, mogą być w stanie skonstruować teorię lub model, który wyjaśnia, jak działa zjawisko, który mogą następnie przetestować wielokrotnie, sprawdzając, czy utrzymuje się dla innych podobnych zbiorów danych. Jeśli model jest wystarczająco solidny, jeśli dobrze wyjaśnia wzorce i nie jest obalony podczas innych testów, może nawet być użyty do przewidywania przyszłych zdarzeń.

Naukowiec danych zwykle nie gromadzi własnych danych poprzez eksperymenty. Zwykle nie projektują eksperymentów z kontrolami i podwójnymi ślepej próby, aby odkryć interferujące zmienne, które mogą wpłynąć na hipotezę. Większość danych analizowanych przez naukowca danych pochodzi z badań obserwacyjnych i systemów, co jest sposobem, w jaki praca naukowca danych może się różnić od pracy tradycyjnego naukowca, który tendencję do wykonywania więcej eksperymentów.

Powiedziano, że naukowiec danych może być wezwany do wykonania pewnego rodzaju eksperymentu zwanego testem A/B, gdzie modyfikacje są wprowadzane do systemu, który gromadzi dane, aby zobaczyć, jak zmieniają się wzorce danych.

Niezależnie od stosowanych technik i narzędzi, nauka o danych ostatecznie ma na celu poprawienie naszego zrozumienia świata, czyniąc sens z danych i danych uzyskanych przez obserwację i eksperymenty. Nauka o danych jest procesem używania algorytmów, zasad statystycznych i różnych narzędzi i maszyn do wyciągania wniosków z danych, wniosków, które pomagają nam zrozumieć wzorce na świecie wokół nas.

Co robią naukowcy danych?

Możesz zauważyć, że każda aktywność, która obejmuje analizę danych w sposób naukowy, może być nazwana nauką o danych, co jest częścią tego, co sprawia, że definicja nauki o danych jest tak trudna. Aby to wyjaśnić, zbadajmy niektóre z czynności, które naukowiec danych może wykonać na co dzień.

Nauka o danych łączy wiele różnych dyscyplin i specjalności. Zdjęcie: Calvin Andrus via Wikimeedia Commons, CC BY SA 3.0 (https://commons.wikimedia.org/wiki/File:DataScienceDisciplines.png)

W dowolnym dniu naukowiec danych może zostać poproszony o: utworzenie schematu przechowywania i pobierania danych, utworzenie potoków ETL (wyodrębnianie, transformacja, ładowanie) i oczyszczanie danych, zastosowanie metod statystycznych, tworzenie wizualizacji i pulpitu nawigacyjnego, wdrożenie algorytmów sztucznej inteligencji i uczenia maszynowego, przedstawienie zaleceń dotyczących działań na podstawie danych.

Przeanalizujmy powyższe zadania.

Naukowiec danych może być wymagany do instalacji technologii niezbędnych do przechowywania i pobierania danych, zwracając uwagę na sprzęt i oprogramowanie. Osoba odpowiedzialna za tę pozycję może być również określana jako „Inżynier danych”. Jednak niektóre firmy obejmują te odpowiedzialności w ramach roli naukowca danych. Naukowiec danych może również musieć utworzyć lub pomóc w tworzeniu potoków ETL. Dane rzadko są dostarczane w formacie, który naukowiec danych potrzebuje. Zamiast tego dane muszą zostać odebrane w surowej postaci z źródła danych, przekształcone w postać użyteczną i przetworzone (takie jak standaryzacja danych, usuwanie redundancji i uszkodzonych danych).

Metody statystyczne nauki o danych

Zastosowanie statystyki jest konieczne, aby zmienić proste spojrzenie na dane i ich interpretację w prawdziwą naukę. Metody statystyczne są używane do ekstrakcji istotnych wzorców z zbiorów danych, a naukowiec danych musi być dobrze zaznajomiony z pojęciami statystycznymi. Muszą być w stanie odróżnić istotne korelacje od przypadkowych korelacji, kontrolując zmienne interferujące. Muszą również wiedzieć, jakie narzędzia użyć, aby określić, które cechy w zbiorze danych są ważne dla ich modelu / mają siłę przewidywania. Naukowiec danych musi wiedzieć, kiedy użyć podejścia regresji wobec podejścia klasyfikacji i kiedy zwrócić uwagę na średnią próby wobec mediany próby. Naukowiec danych po prostu nie byłby naukowcem bez tych niezbędnych umiejętności.

Wizualizacja danych

Kluczową częścią pracy naukowca danych jest skuteczna komunikacja swoich wyników innym. Jeśli naukowiec danych nie może skutecznie przekazać swoich wyników innym, to implikacje ich wyników nie mają znaczenia. Naukowiec danych powinien być skutecznym opowiadaczem. Oznacza to tworzenie wizualizacji, które przekazują istotne punkty dotyczące zbioru danych i wzorców odkrytych w nim. Istnieje wiele różnych narzędzi wizualizacji danych, które naukowiec danych może użyć, i mogą one wizualizować dane w celu podstawowej, podstawowej eksploracji (eksploracyjna analiza danych) lub wizualizacji wyników modelu.

Zalecenia i aplikacje biznesowe

Naukowiec danych musi mieć pewne intuicyjne zrozumienie wymagań i celów swojej organizacji lub firmy. Naukowiec danych musi zrozumieć te rzeczy, ponieważ muszą wiedzieć, jakie typy zmiennych i cech powinni analizować, eksplorując wzorce, które pomogą ich organizacji osiągnąć cele. Naukowcy danych muszą być świadomi ograniczeń, pod którymi działają, i założeń, które przywódcy organizacji czynią.

Uczenie maszynowe i sztuczna inteligencja

Uczenie maszynowe i inne algorytmy sztucznej inteligencji są narzędziami używanymi przez naukowców danych do analizy danych, identyfikacji wzorców w danych, ustalenia relacji między zmiennymi i dokonywania przewidywań o przyszłych zdarzeniach.

Tradycyjna nauka o danych a nauka o dużych danych

Wraz ze wzrostem wyrafinowania metod zbierania danych i rozmiarów baz danych, powstała różnica między tradycyjną nauką o danych a nauką o „dużych danych”.

Tradycyjna analiza danych i nauka o danych są wykonywane z wykorzystaniem opisowych i eksploracyjnych analiz, mających na celu znalezienie wzorców i analizę wyników projektów. Tradycyjne metody analityczne często koncentrują się tylko na danych historycznych i bieżących. Analitycy danych często pracują z danymi, które już zostały oczyszczone i ustandaryzowane, podczas gdy naukowcy danych często pracują z złożonymi i „brudnymi” danymi. Bardziej zaawansowane techniki analityczne i naukowe mogą być używane do przewidywania przyszłego zachowania, chociaż częściej jest to robione z dużymi danymi, ponieważ modele przewidywania często wymagają dużych ilości danych, aby być niezawodnie budowanymi.

„Duże dane” odnoszą się do danych, które są zbyt duże i złożone, aby mogły być obsługiwane przy użyciu tradycyjnych technik analitycznych i naukowych. Duże dane są często zbierane za pośrednictwem platform internetowych, a zaawansowane narzędzia transformacji danych są używane do przygotowania dużych ilości danych do inspekcji przez naukę o danych. Ponieważ coraz więcej danych jest zbieranych cały czas, coraz większa część pracy naukowca danych obejmuje analizę dużych danych.

Narzędzia nauki o danych

Wspólne narzędzia nauki o danych obejmują narzędzia do przechowywania danych, wykonywania eksploracyjnej analizy danych, modelowania danych, wykonywania ETL i wizualizacji danych. Platformy takie jak Amazon Web Services, Microsoft Azure i Google Cloud oferują narzędzia, które pomagają naukowcom danych przechowywać, transformować, analizować i modelować dane. Są również samodzielne narzędzia nauki o danych, takie jak Airflow (infrastruktura danych) i Tableau (wizualizacja i analiza danych).

Jeśli chodzi o algorytmy uczenia maszynowego i sztucznej inteligencji używane do modelowania danych, są one często dostarczane za pośrednictwem modułów i platform nauki o danych, takich jak TensorFlow, PyTorch i Azure Machine Learning Studio. Te platformy pozwalają naukowcom danych na edytowanie swoich zbiorów danych, tworzenie architektur uczenia maszynowego i szkolenie modeli uczenia maszynowego.

Inne wspólne narzędzia i biblioteki nauki o danych obejmują SAS (do modelowania statystycznego), Apache Spark (do analizy danych strumieniowych), D3.js (do interaktywnych wizualizacji w przeglądarce) i Jupyter (do interaktywnych, współdzielonych bloków kodu i wizualizacji).

Zdjęcie: Seonjae Jo via Flickr, CC BY SA 2.0 (https://www.flickr.com/photos/130860834@N02/19786840570)

Przykłady nauki o danych

Przykłady nauki o danych i jej zastosowań są wszędzie. Nauka o danych ma zastosowania w wszystkim, od dostawy żywności, sportu, ruchu i zdrowia. Dane są wszędzie, więc nauka o danych może być stosowana do wszystkiego.

Jeśli chodzi o żywność, Uber inwestuje w rozwinięcie swojego systemu współdzielonej jazdy, skupiając się na dostawie żywności, Uber Eats. Uber Eats musi dostarczyć ludziom żywność w terminie, gdy jest jeszcze gorąca i świeża. Aby to się stało, naukowcy danych w firmie muszą użyć modelowania statystycznego, które uwzględnia takie aspekty, jak odległość od restauracji do punktów dostawy, świąteczne tłumy, czas gotowania i nawet warunki pogodowe, wszystko to w celu optymalizacji czasu dostawy.

Statystyki sportowe są używane przez menedżerów zespołów, aby określić, którzy gracze są najlepsi i utworzyć silne, niezawodne zespoły, które wygrają mecze. Jednym z najbardziej znanych przykładów jest dokumentacja nauki o danych autorstwa Michaela Lewisa w książce Moneyball, gdzie dyrektor generalny zespołu Oakland Athletics analizował różne statystyki, aby zidentyfikować graczy o wysokiej jakości, którzy mogliby być podpisani do zespołu za stosunkowo niską cenę.

Analiza wzorców ruchu jest krytyczna dla tworzenia samochodów bezzałogowych. Samochody bezzałogowe muszą być w stanie przewidywać aktywność wokół nich i reagować na zmiany warunków drogowych, takich jak zwiększona odległość hamowania wymagana, gdy pada deszcz, a także obecność więcej samochodów na drodze podczas godzin szczytu. Poza samochodami bezzałogowymi aplikacje takie jak Google Maps analizują wzorce ruchu, aby powiedzieć komuterom, jak długo zajmie im dojazd do celu, używając różnych tras i środków transportu.

Jeśli chodzi o dane zdrowotne, nauka o danych łączy się z uczeniem maszynowym i innymi technikami sztucznej inteligencji, aby utworzyć klasyfikatory obrazów w stanie zbadać takie rzeczy, jak zdjęcia rentgenowskie, badania rezonansu magnetycznego i ultrasonograficzne, aby zobaczyć, czy istnieją jakieś potencjalne problemy medyczne, które mogą się pojawić na skanie. Te algorytmy mogą być używane, aby pomóc klinicystom w diagnozie chorób.

Ostatecznie nauka o danych obejmuje wiele różnych działań i łączy aspekty różnych dyscyplin. Jednak nauka o danych jest zawsze zajęta opowiadaniem interesujących, ciekawych historii z danych i używaniem danych, aby lepiej zrozumieć świat.

Blogger i programista ze specjalnościami w Machine Learning i Deep Learning tematy. Daniel liczy, że pomoże innym wykorzystać moc sztucznej inteligencji dla dobra społecznego.