Основы ИИ

Что такое Data Science?

mm
Добавьте Unite.AI в избранные источники в Google

Область данных науки кажется все больше и популярнее каждый день. Согласно LinkedIn, данные науки были одним из самых быстрорастущих областей работы в 2017 году и в 2020 году Glassdoor поставил работу данных науки как одну из трех лучших работ в Соединенных Штатах. Учитывая растущую популярность данных науки, не удивительно, что все больше людей интересуются этой областью. Однако, что такое данные науки точно?

Давайте познакомимся с данными науки, потратив некоторое время на определение данных науки, изучение того, как большие данные и искусственный интеллект меняют эту область, изучение некоторых общих инструментов данных науки и рассмотрение некоторых примеров данных науки.

Что такое Data Science?

Прежде чем мы сможем изучить какие-либо инструменты данных науки или примеры, мы хотим получить краткое определение данных науки.

Определение “данных науки” на самом деле немного сложно, потому что этот термин применяется к многим различным задачам и методам исследования и анализа. Мы можем начать с напоминания о том, что означает термин “наука”. Наука – это систематическое изучение физического и природного мира через наблюдение и эксперимент, направленное на продвижение человеческого понимания природных процессов. Важные слова в этом определении – “наблюдение” и “понимание”.

Если данные науки – это процесс понимания мира из закономерностей в данных, то ответственность данных ученого – преобразовать данные, проанализировать данные и извлечь закономерности из данных. Другими словами, данные ученый предоставляются данными и используют различные инструменты и методы для подготовки данных (сделать их готовыми для анализа) и затем проанализировать данные для значимых закономерностей.

Роль данных ученого аналогична роли традиционного ученого. Оба занимаются анализом данных для поддержки или опровержения гипотез о том, как работает мир, пытаясь понять закономерности в данных, чтобы улучшить наше понимание мира. Данные ученые используют те же научные методы, что и традиционный ученый. Данные ученый начинает с сбора наблюдений о некотором явлении, которое они хотят изучить. Затем они формулируют гипотезу о явлении и пытаются найти данные, которые опровергают их гипотезу каким-либо образом.

Если гипотеза не опровергается данными, они могут попытаться построить теорию или модель о том, как работает явление, которую они могут проверить снова и снова, чтобы увидеть, сохраняется ли она для других подобных наборов данных. Если модель достаточно прочная, если она хорошо объясняет закономерности и не опровергается во время других тестов, ее можно даже использовать для прогнозирования будущих событий.

Данные ученый обычно не собирает свои собственные данные через эксперимент. Они обычно не проектируют эксперименты с контролями и двойными слепыми испытаниями, чтобы обнаружить мешающие переменные, которые могут повлиять на гипотезу. Большинство данных, анализируемых данным ученым, получены через наблюдательные исследования и системы, что является способом, которым работа данных ученого может отличаться от работы традиционного ученого, который склонен выполнять больше экспериментов.

Тем не менее, данные ученый может быть призван выполнить некоторую форму эксперимента называемого A/B-тестированием, где в систему, собирающую данные, вносятся изменения, чтобы увидеть, как меняются закономерности данных.

Независимо от используемых методов и инструментов, данные науки в конечном итоге направлены на улучшение нашего понимания мира, делая смысл из данных, и данные получаются через наблюдение и эксперимент. Данные науки – это процесс использования алгоритмов, статистических принципов и различных инструментов и машин для получения представлений из данных, представлений, которые помогают нам понять закономерности в мире вокруг нас.

Что делают данные ученые?

Вы можете видеть, что любая деятельность, которая включает в себя анализ данных научным образом, может быть названа данными наукой, что является частью того, что делает определение данных науки так трудным. Чтобы сделать это более ясным, давайте изучим некоторые деятельности, которые данные ученые могут выполнять каждый день.

Данные науки объединяют многие различные дисциплины и специальности. Фото: Calvin Andrus via Wikimeedia Commons, CC BY SA 3.0 (https://commons.wikimedia.org/wiki/File:DataScienceDisciplines.png)

В любой данный день данные ученый может быть попросен: создать схему хранения и извлечения данных, создать конвейеры ETL (извлечение, преобразование, загрузка) и очистить данные, использовать статистические методы, создать визуализации данных и панели, реализовать искусственный интеллект и алгоритмы машинного обучения, сделать рекомендации для действий на основе данных.

Давайте разберем задачи, перечисленные выше, немного.

Данные ученый может быть обязаным за установку технологий, необходимых для хранения и извлечения данных, обращая внимание на как аппаратное, так и программное обеспечение. Человек, ответственный за эту позицию, также может быть назван “инженером данных“. Однако некоторые компании включают эти обязанности в роль данных ученого. Данные ученый также может быть обязаным за создание или помощь в создании конвейеров ETL. Данные очень редко приходят в формате, который необходим данным ученым. Вместо этого данные будут нуждаться в получении в сыром виде из источника данных, преобразовании в пригодный для использования формат и предварительной обработке (такой как стандартизация данных, удаление избыточностей и удаление поврежденных данных).

Статистические методы данных науки

Применение статистики необходимо для того, чтобы превратить простое изучение данных и их интерпретацию в настоящую науку. Статистические методы используются для извлечения значимых закономерностей из наборов данных, и данные ученый должен быть хорошо знаком со статистическими понятиями. Они должны быть в состоянии различать значимые корреляции и случайные корреляции, контролируя мешающие переменные. Они также должны знать, какие инструменты использовать для определения того, какие функции в наборе данных важны для их модели/имеют прогностическую силу. Данные ученый должен знать, когда использовать регрессионный подход, а когда – классификационный, и когда следует заботиться о среднем значении выборки, а когда – о медиане выборки. Данные ученый просто не будет ученым без этих важных навыков.

Визуализация данных

Критически важной частью работы данных ученого является передача своих результатов другим. Если данные ученый не может эффективно передать свои результаты другим, то последствия его результатов не имеют значения. Данные ученый должен быть эффективным рассказчиком. Это означает создание визуализаций, которые передают важные моменты о наборе данных и закономерностях, обнаруженных в нем. Существует большое количество различных инструментов визуализации данных, которые данные ученый может использовать, и они могут визуализировать данные для целей начального, базового исследования (исследовательский анализ данных) или визуализировать результаты, которые производит модель.

Рекомендации и бизнес-приложения

Данные ученый должен иметь некоторое представление о требованиях и целях своей организации или бизнеса. Данные ученый должен понимать эти вещи, потому что они должны знать, какие переменные и функции они должны анализировать, исследуя закономерности, которые помогут их организации достичь своих целей. Данные ученые должны быть осведомлены о ограничениях, под которыми они работают, и предположениях, которые делает руководство организации.

Машинное обучение и ИИ

Машинное обучение и другие алгоритмы и модели искусственного интеллекта являются инструментами, используемыми данными учеными для анализа данных, выявления закономерностей в данных, определения отношений между переменными и прогнозирования будущих событий.

Традиционные данные науки vs. Большие данные науки

По мере того, как методы сбора данных становились более сложными и базы данных больше, возникла разница между традиционными данными науки и “большими данными” наукой.

Традиционный анализ данных и данные науки выполняются с помощью описательной и исследовательской аналитики, направленной на поиск закономерностей и анализ результатов проектов. Традиционные методы анализа данных часто фокусируются только на прошлых и текущих данных. Аналитики данных часто работают с данными, которые уже были очищены и стандартизированы, в то время как данные ученые часто работают с сложными и “грязными” данными. Более продвинутые методы анализа данных и данные науки могут использоваться для прогнозирования будущего поведения, хотя это чаще делается с большими данными, поскольку прогностические модели часто требуют больших объемов данных для надежной конструкции.

“Большие данные” относятся к данным, которые слишком велики и сложны, чтобы быть обработанными с помощью традиционных методов анализа данных и науки. Большие данные часто собираются через онлайн-платформы, и используются продвинутые инструменты преобразования данных для того, чтобы сделать большие объемы данных готовыми для изучения данными учеными. По мере того, как собирается все больше данных, большая часть работы данных ученого включает в себя анализ больших данных.

Инструменты данных науки

Общие инструменты данных науки включают инструменты для хранения данных, выполнения исследовательского анализа данных, моделирования данных, выполнения ETL и визуализации данных. Платформы như Amazon (AMZN ) Web Services, Microsoft Azure и Google Cloud предлагают инструменты для помощи данным ученым в хранении, преобразовании, анализе и моделировании данных. Существуют также отдельные инструменты данных науки, такие как Airflow (инфраструктура данных) и Tableau (визуализация и анализ данных).

В плане алгоритмов машинного обучения и искусственного интеллекта, используемых для моделирования данных, они часто предоставляются через модули и платформы данных науки, такие как TensorFlow, PyTorch и Azure Machine Learning Studio. Эти платформы позволяют данным ученым редактировать свои наборы данных, составлять архитектуру машинного обучения и обучать модели машинного обучения.

Другие общие инструменты и библиотеки данных науки включают SAS (для статистического моделирования), Apache Spark (для анализа потоковых данных), D3.js (для интерактивных визуализаций в браузере) и Jupyter (для интерактивных, общедоступных блоков кода и визуализаций).

Фото: Seonjae Jo via Flickr, CC BY SA 2.0 (https://www.flickr.com/photos/130860834@N02/19786840570)

Примеры данных науки

Примеры данных науки и их применения везде. Данные науки имеют применения во всем, от доставки еды до спорта, трафика и здравоохранения. Данные везде, и поэтому данные науки могут быть применены к всему.

В плане еды, Uber инвестирует в расширение своей системы вызова такси, ориентированное на доставку еды, Uber Eats. Uber Eats должен доставить людям еду в срок, пока она еще горячая и свежая. Чтобы это произошло, данные ученые компании должны использовать статистическое моделирование, которое учитывает такие факторы, как расстояние от ресторанов до точек доставки, праздничные спешки, время приготовления и даже погодные условия, все это с целью оптимизации времени доставки.

Спортивная статистика используется менеджерами команд для определения лучших игроков и формирования сильных, надежных команд, которые будут выигрывать игры. Одним заметным примером является документирование данных науки в книге Moneyball, где генеральный менеджер команды “Окленд Атлетикс” анализировал различные статистические данные, чтобы выявить качественных игроков, которые могли быть подписаны в команду по относительно низкой цене.

Анализ трафика имеет решающее значение для создания самоходных транспортных средств. Самоходные транспортные средства должны быть в состоянии предсказать деятельность вокруг них и реагировать на изменения в дорожных условиях, таких как увеличенное время остановки, необходимое при дожде, а также наличие большего количества машин на дороге во время часа пик. Помимо самоходных транспортных средств, приложения, такие как Google Maps, анализируют трафик, чтобы сказать коммутерам, сколько времени потребуется, чтобы добраться до места назначения, используя различные маршруты и виды транспорта.

В плане здравоохранения, компьютерное зрение часто сочетается с машинным обучением и другими методами ИИ для создания классификаторов изображений, способных изучать такие вещи, как рентгеновские снимки, ФМРИ и ультразвуковые исследования, чтобы увидеть, есть ли какие-либо потенциальные медицинские проблемы, которые могут проявиться на сканировании. Эти алгоритмы могут быть использованы для помощи клиницистам в диагностике заболеваний.

В конечном итоге, данные науки охватывают многочисленные деятельности и объединяют аспекты различных дисциплин. Однако, данные науки всегда занимаются рассказыванием интересных историй из данных и использованием данных для лучшего понимания мира.

Блогер и программист с специализацией в Machine Learning и Deep Learning темах. Daniel надеется помочь другим использовать силу ИИ для социального блага.