Смотреть фребинар Олега Брагинского
Big Data в последнее время были серьёзно скомпрометированы. Виноваты не методы, а профанаторы. Линейкой не измерить точно длину окружности, а двумерными интегралами не измерить объем. Big Data – в первую очередь про данные, а лишь затем про методы и применимость. Нельзя управлять каждым столбцом или каждой строкой: надёргаете случайные результаты. В Big Data участвуют очень большие массивы информации. Big Data отличается плохой структурированностью. Это тексты, неполные данные, цифры или потери цифр. Не во всех компаниях есть Big Data. Большие данные – не просто большое количество записей о каких-то событиях. Big Data – сбор данных вокруг компании. Это сбор тех данных, которые раньше не собирались. Например, есть сеть кулинарных магазинов. Имеются данные о том, кто купил, что купил, срок годности, состав продуктов. Это не является Big Data, даже если компания существует десятилетия во всех крупных городах России. Big Data появляется, когда в данной сети кулинарных магазинов мы начинаем собирать данные о влажности воздуха, о цвете футболок покупателей, о цвете глаз продавцов. Можно собирать температуру воздуха, так как можно предположить, что чем жарче, тем менее сладкие продукты будут покупать. Или, например, если холодно – будут покупать более кислые продукты. Измерение температуры – новое действие, раньше этого компания не делала, так как в этом не было необходимости. В зависимости от ветра, мы по-разному ощущаем температуру. Чем сильнее ветер – тем ниже кажется температура: и в жару, и в холод. Это называется real-feel или feel-like. Вот мы уже собираем два типа новых данных: температуру и силу ветра. Пока неочевидно, для чего мы это делаем. Big Data целиком базируется на выдвижении гипотез. Мы не можем просто взять массив данных и что-то оттуда выцепить, предварительно не выдвинув гипотезу. Сначала задаём себе вопрос: что же мы хотим выяснить? Например, что влияет на покупку туфель из кожи пони. Используем максимально возможное количество столбцов с данными. Возможно, влияет температура, количество детей, освещённость помещения или уровень шума. Но чтобы проверить, влияет ли та или другая переменная – мы должны сначала эти данные собрать. После этого делаем попытку найти зависимости между уровнем шума и количеством продаваемых туфель. Между температурой и количеством продаваемых туфель. Перебираем и ищем, какие переменные влияют на продажи, а какие нет. Big Data: 1. собрать данные, которых в компании не было; 2. выдвинуть гипотезы.
Хороший метод работы с данными: кластеризация. Кластеризация – разбиение объектов на группы с устойчивым предсказуемым поведением. «Устойчивый» – группа не меняет поведения при увеличении количества клиентов. «Предсказуемый» – для большинства клиентов группы мы угадываем, как они себя ведут. В ходе кластеризации получаем от 3 до 21 кластера. Делим их на 3 группы: целевые – хорошо покупают, чек выше среднего; перспективные – средний чек, обычное поведение; нецелевые – покупают мало, заходят редко. Например, в ресторане человек заказывает большой стол, приводит с собой много гостей и всех угощает за свой счет – это целевой клиент. Если приходят два человека на бизнес-ланч, быстро кушают, платят и уходят – это перспективные клиенты. Если заходят студенты, пьют только минеральную воду или чай и сидят в ноутбуке, занимая стол часами – нецелевые клиенты. Люди, работающие в крупных компаниях, имеют разные уровни образования, грамотности. Кто-то был уставшим, кто-то спешил. Накапливается множество ошибок в данных. На основе грязных данных можно делать абсурдные выводы. Например, изначально мы не позаботились о качестве данных. Взяли неочищенные данные, провели анализ и получили: главными покупателями тяжелых бутылей воды являются женщины. Поэтому данные всегда нужно чистить. Следующее: данные нужно доопределять. Если я дважды приходил в одну и ту же компанию, дважды получил карточку лояльности, то в базе числится два одинаковых клиента. Клиентов кажется больше. Возникает ошибка. Так может произойти, если я один раз дал вам только телефон, во второй раз и телефон и email. Из-за несовпадения строк вы решите, что «два тех же самых я» – это разные клиенты. Доопределение позволяет этого избежать. Вы пытаетесь по полному набору переменных в неполный добавить недостающие данные. Получаете две идентичные строчки. Их нужно схлопнуть – сделать одну: процесс называется дедубликация. Стоит ещё раз подчеркнуть: Big Data не про математику. Big Data – сбор данных, чистка данных, доопределение, дедубликация и выдвижение гипотез к чистым корректным данным. Часть данных окажется некорректной: содержится большое количество ошибок, отсутствующих переменных. С такими данными работать нельзя.