Сообщения

Показаны сообщения с ярлыком "Data analysis"

Data analysis. NumPy. Часть 2

Изображение
Это вторая статья в серии, где мы знакомимся с базовый набор инструментов для первичного анализа данных с помощью Python. В этой части рассмотрим транслирование(broadcasting), сравнения массивов и маски, "прихотливая" индексация (fancy indexing), сортировки и структурированные данные. Часть 1. Введение в NumPy Часть 2. Подробней о NumPy Часть 3. Первичный анализ. Pandas Часть 4. Визуализация. Matplotlib и Seaborn Часть 5. Немного machine learning с помощью scikit-learn Часть 6. Больше данных. Обучение с Vowpal Wabbit В статье будет описания и различного рода заметки, а примеры с комментариями написаны в  jupyter notebook Транслирование(Broadcasting) (notebook) Еще один способ применения векторизации - использовать возможности транслирования(broadcasting). Это набор правил по применению бинарных универсальных функций к массивам различного размера. Для массивов одного размера бинарные операции выполняются поэлементно. Транслирова...

Аналитическая культура. От сбора данных до бизнес-результатов

Изображение
Книга Карла Андерсона "Аналитическая культура"(Creating a Data-Driven Organization) - это пошаговое руководство по внедрению Data-driven-культуры в компанию — от сбора данных и наглядных отчетов до анализа и обоснованных решений. В частности Data-Driven Organization это состояния при котором такие инструменты как machine learning могут быть очень эффективны. Сейчас тема machine learning сильно раздута, но при этом для многих это некий магический черный ящик, который можно один раз настроить, для какого то бизнеса процесса, и он будет сам по себе жить и давать отличные предикшены. К сожалению пока это не всегда так. Автор книги пытается ответить на два основных вопроса: что означает для компании управление на основе данных? как компания может к нему прийти? Во многих компаниях генерируется множество отчетов, реализованы различные дашборды, но  обычно они ретроспективны, то есть часто лишь представляют прошлые или настоящие факты без обеспечения достаточного ...

Data analysis. NumPy. Часть 1

Изображение
Эта статья первая в серии про базовый набор инструментов для первичного анализа данных с помощью Python. В первую очередь рассмотрим базовую библиотеку для работы с многомерными массивами NumPy . Pandas позволяет эффективно работать с неоднородными данными. Удобно загружать, обрабатывать и анализировать табличные данные  с помощью SQL-подобных запросов. С помощью Matplotlib, Seaborn, Plotly реализуется отличная визуализация. Часть 1. Введение в NumPy Часть 2. Подробней о NumPy Часть 3. Первичный анализ. Pandas Часть 4. Визуализация. Matplotlib и Seaborn Часть 5. Немного machine learning с помощью scikit-learn Часть 6. Больше данных. Обучение с Vowpal Wabbit В статье будет описания и различного рода заметки, а примеры с комментариями написаны в jupyter notebook NumPy — это библиотека языка Python, добавляющая поддержку больших многомерных массивов и матриц, вместе с большой библиотекой высокоуровневых математических функций дл...