Модели и платформы ИИ
Что такое Big Data?
Что такое Big Data?
“Big Data” – одно из наиболее часто используемых модных слов в нашей текущей эпохе, но что это действительно значит?
Вот быстрое и простое определение big data. Big data – это данные, которые слишком велики и сложны, чтобы быть обработанными традиционными методами обработки и хранения данных. Хотя это быстрое определение можно использовать как эвристику, было бы полезно иметь более глубокое и полное понимание big data. Давайте рассмотрим некоторые концепции, которые лежат в основе big data, такие как хранение, структура и обработка.
Насколько велико Big Data?
Это не так просто, как сказать “любые данные размером больше ‘X’ являются big data”, окружение, в котором обрабатываются данные, является чрезвычайно важным фактором в определении того, что квалифицируется как big data. Размер, которого должны быть данные, чтобы быть рассмотренными как big data, зависит от контекста или задачи, для которой используются данные. Два набора данных разного размера могут быть рассмотрены как “big data” в разных контекстах.
Чтобы быть более конкретным, если вы попытаетесь отправить файл размером 200 мегабайт в качестве вложения к электронному письму, вы не сможете сделать это. В этом контексте файл размером 200 мегабайт может быть рассмотрен как big data. Напротив, копирование файла размером 200 мегабайт на другое устройство в одной и той же локальной сети может не занять много времени, и в этом контексте он не будет рассматриваться как big data.
Однако давайте предположим, что необходимо предварительно обработать 15 терабайт видео для использования в приложениях компьютерного зрения. В этом случае видеофайлы занимают так много места, что даже мощный компьютер потребует много времени для обработки их всех, и поэтому обработка обычно распределяется между несколькими компьютерами, связанными друг с другом, чтобы уменьшить время обработки. Эти 15 терабайт видеоданных, безусловно, будут квалифицированы как big data.
Типы структур Big Data
Big data существует в трех разных категориях структуры: неструктурированные данные, полуструктурированные и структурированные данные.
Неструктурированные данные – это данные, которые не обладают определенной структурой, то есть данные представляют собой просто один большой пул. Примерами неструктурированных данных могут быть база данных, заполненная незначенными изображениями.
Полуструктурированные данные – это данные, которые не имеют формальной структуры, но существуют в некоторой свободной структуре. Например, данные электронной почты могут быть рассмотрены как полуструктурированные данные, поскольку вы можете сослаться на данные, содержащиеся в отдельных электронных письмах, но формальные закономерности данных не были установлены.
Структурированные данные – это данные, которые имеют формальную структуру, с данными, категоризированными по разным функциям. Примером структурированных данных может быть электронная таблица Excel, содержащая контактную информацию, такую как имена, электронные адреса, телефонные номера и веб-сайты.
Если вы хотите прочитать больше о различиях в этих типах данных, проверьте ссылку здесь.
Метрики для оценки Big Data
Big data можно анализировать с помощью трех разных метрик: объема, скорости и разнообразия.
Объем относится к размеру данных. Средний размер наборов данных часто увеличивается. Например, самый большой жесткий диск в 2006 году был жестким диском емкостью 750 ГБ. Напротив, Facebook (META ), как считается, генерирует более 500 терабайт данных в день, а самый большой жесткий диск, доступный сегодня, – это жесткий диск емкостью 16 терабайт. То, что квалифицируется как big data в одной эпохе, может не быть big data в другой. Больше данных генерируется сегодня, потому что все больше объектов вокруг нас оснащены датчиками, камерами, микрофонами и другими устройствами сбора данных.
Скорость относится к тому, как быстро движутся данные, или, другими словами, сколько данных генерируется в течение определенного периода времени. Потоки социальных сетей генерируют сотни тысяч постов и комментариев каждую минуту, в то время как ваш собственный почтовый ящик, вероятно, будет иметь намного меньше активности. Потоки big data – это потоки, которые часто обрабатывают сотни тысяч или миллионы событий в режиме реального времени. Примерами этих потоков данных являются онлайн-платформы игр и алгоритмы высокочастотной торговли акциями.
Разнообразие относится к разным типам данных, содержащихся в наборе данных. Данные могут состоять из многих разных форматов, таких как аудио, видео, текст, фотографии или серийные номера. В целом традиционные базы данных отформатированы для обработки одного или нескольких типов данных. Другими словами, традиционные базы данных структурированы для хранения данных, которые достаточно однородны и имеют последовательную, предсказуемую структуру. По мере того, как приложения становятся более разнообразными, наполненными различными функциями и используемыми большим количеством людей, базы данных должны были эволюционировать, чтобы хранить больше типов данных. Неструктурированные базы данных идеальны для хранения big data, поскольку они могут хранить несколько типов данных, которые не связаны друг с другом.
Методы обработки Big Data
Существует ряд различных платформ и инструментов, предназначенных для облегчения анализа big data. Пулы big data необходимо анализировать, чтобы извлечь осмысленные закономерности из данных, задача, которая может оказаться довольно сложной с помощью традиционных инструментов анализа данных. В ответ на необходимость в инструментах для анализа больших объемов данных, ряд компаний создал инструменты анализа big data. Инструменты анализа big data включают системы, такие как ZOHO Analytics, Cloudera и Microsoft (MSFT ) BI.












