Что такое корреляция: как её считать и не обмануться при интерпретации

Корреляция показывает, что две величины меняются вместе, и почти никогда не объясняет почему: на этом спотыкаются даже опытные аналитики. Разобрали простыми словами, какой из трёх коэффициентов брать под ваши данные, как посчитать связь в Excel и на Python за минуту и что означает цифра 0,7. Внутри сквозной пример, где одна строка данных роняет коэффициент с 0,919 до 0,139, и чек-лист из семи проверок перед тем, как показать результат руководителю.
Статью написал:
Ваня Буявец, продюсер, основатель Checkroi
Ваня Буявец
Основатель Checkroi, продюсер, эксперт в выборе онлайн-курсов
Все 2448 статей автора Подписаться на Телеграм-канал
Одобрено экспертом:
Наташа Буявец, основатель Checkroi, эксперт по онлайн-курсам
Наташа Буявец
Основательница Checkroi, продюсер Youtube-каналов, эксперт по онлайн-курсам
Все 3108 экспертных мнений Подписаться на Телеграм-канал
Обложка: Что такое корреляция: как её считать и не обмануться при интерпретации

В США есть график, который выглядит как открытие века: чем больше сыра съедают жители страны, тем чаще люди запутываются в простыне и погибают во сне. Совпадение почти идеальное, коэффициент выше 0,9. Только сыр тут ни при чём, и простыни тоже.

Это и есть корреляция во всей красе: она честно показывает, что две величины меняются вместе, и ничего не говорит о том, почему. Половина ошибок в отчётах аналитиков растёт именно из этого места.

Разберём по порядку: что такое корреляция и какая она бывает, какой из трёх коэффициентов брать под ваши данные, как посчитать связь в Excel, Google Таблицах и на Python, что означает цифра 0,7 и когда ей верить нельзя. В конце соберём чек-лист из семи проверок, который стоит прогонять до того, как вы покажете результат руководителю.

Если вам интересно, кто вообще занимается такими расчётами каждый день, у нас есть отдельный разбор профессии аналитика данных: чем он занят, что должен знать и сколько получает.

Статья пригодится не только аналитикам. Корреляцию считают маркетологи (реклама и заявки), HR-специалисты (условия работы и увольнения), продакт-менеджеры (поведение в приложении и оплаты), финансисты (активы в портфеле). Всем, у кого есть таблица с цифрами и вопрос «а связано ли одно с другим». Она же лежит в основе более сложных инструментов, до которых доходят позже: например, A/B-тестирования.

А если после статьи захочется разобраться в анализе данных системно, а не по кусочкам, у нас собраны курсы по аналитике и Data Science: от коротких интенсивов по статистике до годовых программ с трудоустройством.

CheckroiCheckroiПодборка курсов аналитики и Data Science273 курса • 39 школСравните цены, школы, программу и найдите выгодные предложения по обучениюСравнить

Что такое корреляция простыми словами

Рой-аналитик изучает график связи двух показателей

Корреляция это статистическая связь между двумя величинами: меняется одна, обычно меняется и другая. Слово пришло из латыни и означает примерно «соотношение».

Величины, которые мы сравниваем, в статистике называют переменными. Переменная это просто столбец с числами: расходы на рекламу по неделям, рост людей в группе, температура за месяц. Всё, что меняется от строки к строке и что можно измерить.

Пример, который вы наблюдали сами: чем выше человек ростом, тем больше он обычно весит. Не всегда, бывают худые баскетболисты и плотные люди невысокого роста. Но если взять тысячу человек, тенденция проступит отчётливо. Вот это «обычно, в среднем, с исключениями» и есть корреляция.

Её главная особенность в том, что она описывает не жёсткое правило, а склонность. Если бы связь была жёсткой, мы бы говорили о функции: подставил рост, получил вес. В жизни так не работает почти нигде, поэтому статистике и понадобился отдельный инструмент для «связано, но не намертво».

Силу этой склонности измеряют одним числом: коэффициентом корреляции. Он всегда лежит в промежутке от −1 до +1, и это удобно, потому что позволяет сравнивать между собой связи из разных областей.

  • Ближе к +1 — растёт одна величина, растёт и другая
  • Ближе к −1 — растёт одна, падает другая
  • Около 0 — величины ведут себя независимо

Знак говорит о направлении связи, модуль числа о её силе. Значения 0,8 и −0,8 одинаково сильные, просто одна связь прямая, а вторая обратная. Это первое место, где новички ошибаются: минус в коэффициенте не означает «плохой результат» или «слабая связь».

Запомните формулировку. Корреляция отвечает на вопрос «меняются ли эти величины согласованно», и только на него. Вопрос «почему они меняются согласованно» находится за пределами её компетенции.

Где корреляцию используют на работе

Абстрактная статистика становится понятнее, когда видишь, какие рабочие задачи она закрывает.

Маркетинг. Самый частый сценарий: сравнить расходы на канал с числом заявок и понять, какой канал вообще шевелится вместе с бюджетом. Часто выясняется, что контекстная реклама даёт сильную связь, а соцсети почти нулевую, потому что работают на отложенный спрос. Тот же приём применяют к цене и объёму продаж, к частоте писем и конверсии.

Продуктовая аналитика. Ищут признаки, которые ходят рядом с удержанием пользователей. Классика: если человек в первую неделю сделал определённое действие, он с большей вероятностью останется через месяц. Корреляция такие связи находит, дальше их проверяют экспериментом.

HR. Сопоставляют стаж, зарплату, результаты оценки и увольнения. Помогает заметить, что уходят, скажем, не самые низкооплачиваемые сотрудники, а те, кто дольше всех сидит без повышения.

Финансы и инвестиции. Здесь корреляция это рабочий инструмент управления риском. Если все бумаги в портфеле сильно связаны между собой, они и падать будут вместе. Поэтому инвесторы специально ищут активы с низкой или отрицательной связью: российские акции и золото ведут себя по-разному, и это спасает портфель в плохой год.

Медицина и социология. Связь между образом жизни и заболеваемостью, между уровнем образования и доходом. В этих областях с интерпретацией особенно осторожны, потому что цена ошибочного вывода высока.

Всю процедуру целиком, от подготовки таблицы и графика до проверки выводов, называют корреляционным анализом. Дальше в статье мы пройдём её по шагам на живом примере.

Общее у всех сценариев одно: корреляция работает как детектор гипотез. Она подсвечивает пары величин, на которые стоит посмотреть внимательнее, и экономит время на тех, где смотреть не на что.

Канал основателя Checkroi Вани Буявца3 700 человек читают мой Телеграм-канал про нейросетиСобрал промпты для Claude Code и ChatGPT, разборы ИИ-инструментов и лайфхаки по продвижению бизнеса в одном местеПрисоединиться

Виды корреляции: направление и форма

Три вида связи между показателями: растущая, падающая и без закономерности

Связи различают по двум признакам, и путать их не стоит.

По направлению

Положительная (прямая) корреляция. Величины двигаются в одну сторону. Больше рекламный бюджет, больше заявок. Больше часов подготовки, выше балл на экзамене. Коэффициент со знаком плюс.

Отрицательная (обратная) корреляция. Одна растёт, вторая падает. Выше цена, ниже спрос. Больше времени на загрузку страницы, меньше оформленных заказов. Коэффициент со знаком минус.

Нулевая корреляция. Связи не видно: величины меняются каждая по своим причинам. Цвет корпуса ноутбука и скорость его работы, рост сотрудника и качество его отчётов.

По форме

Линейная связь. Точки на графике выстраиваются вдоль прямой. Каждая дополнительная тысяча рублей бюджета добавляет примерно одинаковое число заявок. Именно такие связи ловит самый популярный коэффициент, о котором пойдёт речь ниже.

Нелинейная связь. Зависимость есть, но она изгибается. Самый частый вид: перевёрнутая дуга, когда сначала растёт, потом падает. Частота рассылок ровно такая: одно письмо в неделю мало, три в неделю хорошо, десять в неделю и люди отписываются.

Это различие важно по вполне практической причине. Мы посчитали связь для рассылок из примера выше: частота писем от одного до восьми в неделю против конверсии, которая сначала росла с 1,2 % до 3,4 %, а потом упала до 1 %. Обычный коэффициент выдал −0,12, то есть «связи практически нет».

А связь при этом сильнейшая и прекрасно видна глазом на графике. Просто она дугообразная, и линейный инструмент её не различает: рост в начале и падение в конце взаимно погасились.

Отсюда правило номер один. Сначала стройте диаграмму рассеяния (это график, где каждая пара значений становится точкой), и только потом считайте коэффициент. Цифра без картинки регулярно врёт, а картинка без цифры никогда.

CheckroiCheckroiПодборка курсов по анализу данных490 курсов • 52 школыСравните цены, школы, программу и найдите выгодные предложения по обучениюСравнить

Три коэффициента корреляции и как выбрать нужный

Все три считаются в пару кликов в обычной таблице, отдельный софт для этого не нужен. Если работаете в Excel, пригодится разбор про сводные таблицы: данные под расчёт корреляции чаще всего собирают именно ими.

Коэффициентов придумано много, но в реальной работе вам понадобятся три. Разбираемся, чем они отличаются и когда какой брать.

Коэффициент Пирсона (r)

Самый известный и тот, который считается по умолчанию везде: в Excel, в Google Таблицах, в Python. Измеряет силу линейной связи между двумя количественными величинами.

Количественные данные это те, которые измеряются в нормальных единицах и которые осмысленно складывать и усреднять: рубли, килограммы, минуты, штуки, проценты.

Требования у Пирсона довольно строгие: связь должна быть примерно прямолинейной, данные без грубых выбросов (так называют одиночные значения, которые стоят далеко в стороне от остальных), распределение близко к нормальному. Нарушите условия, и коэффициент начнёт показывать ерунду, причём молча.

Коэффициент Спирмена (ρ)

Работает не с самими числами, а с рангами: он расставляет значения по местам (первое, второе, третье) и сравнивает порядок. Из-за этого он гораздо спокойнее переносит выбросы и не требует, чтобы связь была прямой линией. Ему достаточно, чтобы она была монотонной: росла или падала без разворотов.

Берите Спирмена, когда данные порядковые (оценки «плохо, нормально, отлично», позиции в рейтинге, уровни удовлетворённости), когда в выборке (так называют набор наблюдений, который вы взяли для расчёта) есть подозрительные выбросы или когда график показывает изгиб.

Коэффициент Кендалла (τ)

Тоже ранговый, но считает по-другому: перебирает все пары наблюдений и смотрит, в скольких из них порядок совпал. Даёт более осторожные, обычно меньшие по модулю значения и устойчивее ведёт себя на маленьких выборках.

Его берут, когда данных мало (условно меньше 20 наблюдений) или когда в них много одинаковых значений.

Таблица выбора: что брать под ваши данные

Ситуация Что брать Почему
Обычные числа (рубли, штуки, минуты), график похож на прямую Пирсон Стандарт, понятен всем, легко объяснить
В данных есть яркий выброс, убирать его нельзя Спирмен Работает с местами, а не с величиной отрыва
Оценки, рейтинги, баллы «от 1 до 5» Спирмен Порядковые данные Пирсону не подходят
Связь есть, но график изогнут (без разворотов) Спирмен Ловит монотонность, прямая линия не нужна
Наблюдений меньше 20 Кендалл Устойчивее на коротких выборках
Много повторяющихся значений Кендалл Корректнее обрабатывает совпадения
График показал дугу с разворотом Ни один Тут нужна регрессия, о ней ниже

Если непонятно, что выбрать: посчитайте Пирсона и Спирмена одновременно, благо это две строчки кода или две формулы. Если результаты близки, берите Пирсона, его проще объяснить коллегам. Если они сильно разошлись, это само по себе сигнал: значит, в данных есть выброс или изгиб, и разбираться надо с ними, а не с выбором коэффициента.

Что означает 0,3 и что означает 0,9

Вы получили число. Дальше нужно понять, много это или мало. Для грубой прикидки в русскоязычной статистике обычно пользуются шкалой Чеддока.

Модуль коэффициента Как называется связь Что это значит на практике
0,1 – 0,3 Слабая Почти шум, строить на этом выводы рано
0,3 – 0,5 Умеренная Что-то есть, нужны дополнительные данные
0,5 – 0,7 Заметная Связь видна, гипотезу стоит проверять
0,7 – 0,9 Высокая Сильная зависимость, работать можно
0,9 – 1,0 Очень высокая Проверьте, не считаете ли вы одно и то же дважды

Последняя строка не шутка. Коэффициент выше 0,95 в реальных бизнес-данных почти всегда означает ошибку. Типичная причина: две колонки на самом деле выражают одну и ту же величину. Выручка и выручка с НДС дадут корреляцию около единицы, и никакой новой информации в этом нет.

И главная оговорка про шкалу: она условна. Значение 0,6 в физическом эксперименте с точными приборами считается провалом, а в социологии, где мы пытаемся предсказать поведение живых людей, это отличный результат. Ориентируйтесь на то, какие значения нормальны в вашей области, а не на таблицу саму по себе.

CheckroiCheckroiПодборка курсов по Python561 курс • 46 школСравните цены, школы, программу и найдите выгодные предложения по обучениюСравнить

Как посчитать корреляцию: Excel, Google Таблицы и Python

Дальше идёт сквозной пример, к которому мы будем возвращаться. Возьмём маленький датасет (так называют готовый набор данных для анализа) из отдела маркетинга: расходы на контекстную рекламу и число заявок за восемь недель.

Неделя Расходы, тыс. ₽ Заявки, шт.
1 30 21
2 45 24
3 52 34
4 38 19
5 60 33
6 71 44
7 55 26
8 66 40

Excel

Заведите два столбца, скажем B2:B9 для расходов и C2:C9 для заявок. В любой свободной ячейке напишите:

=КОРРЕЛ(B2:B9; C2:C9)

В англоязычной версии функция называется =CORREL(). Она считает именно коэффициент Пирсона. На наших данных получится 0,919.

Если нужны сразу все пары в большой таблице, включите «Пакет анализа» (Файл → Параметры → Надстройки), и в разделе «Данные» появится пункт «Анализ данных» с корреляцией внутри.

Google Таблицы

Здесь та же формула английским вариантом, разделитель обычно запятая:

=CORREL(B2:B9, C2:C9)

Результат тот же самый: 0,919. Никакой разницы с Excel в расчётах нет.

Python

Если строк тысячи, таблицы становятся неудобными, и работу проще делать в Python. Библиотека pandas умеет считать корреляцию одной командой:

import pandas as pd
df = pd.DataFrame({'spend': [30,45,52,38,60,71,55,66],
                  'leads': [21,24,34,19,33,44,26,40]})
print(df['spend'].corr(df['leads']))  # 0.919

Чтобы получить Спирмена, добавьте один параметр:

print(df['spend'].corr(df['leads'], method='spearman'))  # 0.905

Значения близки (0,919 и 0,905), и это хороший знак: связь ведёт себя прилично, выбросов не видно, можно спокойно докладывать результат.

Если нужна ещё и статистическая значимость, берите библиотеку SciPy: scipy.stats.pearsonr(x, y) возвращает сразу пару значений: коэффициент и p-value (число, которое показывает, насколько вероятно получить такой результат случайно). Про него подробнее в разделе про проверки.

Знакомство с Python обычно и начинается с таких задач: посчитать, отфильтровать, построить график. Если этот язык для вас пока незнакомая территория, посмотрите наш разбор языка SQL: у аналитика он обычно идёт первым, ещё до Python.

Ваня БуявецКанал основателя Checkroi Вани БуявцаЗабирайте промпты и обучение по нейросетям в моём Телеграм-каналеБольше 3 700 человек уже применяют Claude Code, ChatGPT и другие нейросети в работе, учёбе, бизнесе и жизниПерейти в канал

Матрица корреляций, когда столбцов много

Рабочий стол аналитика с тепловой картой связей

Считать связи по одной паре нормально, пока пар три. Когда в таблице двадцать показателей, попарных сравнений набегает под две сотни.

Для таких случаев есть матрица корреляций: квадратная таблица, где каждый показатель сравнивается с каждым. На пересечении строки и столбца стоит коэффициент. По диагонали всегда единицы, потому что показатель идеально коррелирует сам с собой, а половинки относительно диагонали зеркальны.

В pandas это одна команда без аргументов:

df.corr()

Чтобы не читать глазами сетку из четырёхсот чисел, матрицу раскрашивают: сильные положительные связи в один цвет, сильные отрицательные в другой, слабые бледные. Получается тепловая карта, на которой интересные места видно за секунду. В Python её рисуют библиотекой seaborn, в Excel обычным условным форматированием.

У матрицы есть отдельная профессиональная польза: она быстро показывает, что два столбца дублируют друг друга. Если «выручка» и «выручка без скидок» дают 0,99, одну из колонок из модели можно смело выкидывать.

Инструменты, которые превращают такие таблицы в понятные картинки, мы собрали в подборке сервисов для визуализации данных.

Корреляция и причинность: место, где ошибаются почти все

Вернёмся к сыру и простыням из начала статьи. Связь между этими показателями в американских данных есть, и она сильная. Причины никакой нет: просто обе величины много лет росли вместе с населением и качеством статистики. Такие совпадения называют ложной корреляцией, и энтузиасты собрали их целую коллекцию на сайте Spurious Correlations.

Более коварный случай, чем случайное совпадение, это третья переменная: скрытый фактор, который двигает обе величины сразу. Учебниковый пример: продажи мороженого и число утоплений растут одновременно. Мороженое никого не топит, просто и то и другое зависит от жары.

В бизнесе третья переменная встречается постоянно, и выглядит она куда убедительнее мороженого:

  • Пользователи, включившие уведомления, платят чаще. Возможно, уведомления работают. А возможно, их включают те, кто и так был настроен пользоваться продуктом всерьёз
  • Отделы с высокими зарплатами показывают лучшие результаты. Или туда просто нанимают более опытных людей
  • Клиенты, прошедшие онбординг, реже уходят. Или онбординг до конца проходят самые мотивированные

Заметьте, во всех трёх случаях корреляция настоящая и посчитана правильно. Ломается вывод, который из него делают, а сам расчёт в порядке.

Формулировка, которая спасает от 90 % таких ошибок. Вместо «уведомления увеличивают оплаты» говорите «пользователи с уведомлениями платят чаще, причина пока не установлена». Второе утверждение честное и его не стыдно защищать на встрече.

Как всё-таки добраться до причины

Корреляция причину не доказывает, но это не тупик. Дальше есть куда идти.

Эксперимент. Главный и самый надёжный способ. Вы случайным образом делите аудиторию на две группы, одной меняете условие, второй нет, и сравниваете результат. Случайное деление как раз и убирает влияние скрытых факторов. Как это устроено на практике, мы разбирали в статье про A/B-тестирование.

Контроль третьей переменной. Если эксперимент невозможен, попробуйте разбить данные на однородные группы. Считаете связь зарплаты и результата отдельно для новичков и отдельно для опытных сотрудников. Если внутри каждой группы связь исчезла, вы нашли скрытый фактор.

Проверка направления во времени. Причина обязана идти раньше следствия. Если рост заявок начался за две недели до увеличения бюджета, реклама тут точно ни при чём.

Здравый смысл и знание предметной области. Недооценённый инструмент. Человек, который десять лет работает в этой нише, отсеет половину ложных связей быстрее любой статистики.

Чем корреляция отличается от регрессии

Эти два слова в отчётах стоят рядом, и новички их путают. Разница простая.

Корреляция отвечает на вопрос «связаны ли эти величины и насколько сильно». Она симметрична: связь расходов с заявками и заявок с расходами это одно и то же число.

Регрессия отвечает на вопрос «насколько изменится одна величина, если я поменяю другую». Она несимметрична и даёт формулу для прогноза: добавили десять тысяч рублей, ждём примерно шесть дополнительных заявок.

Практический порядок работы такой: корреляцией вы ищете, где вообще есть на что смотреть, а регрессией строите прогноз для найденных связей.

Рядом живёт ещё один показатель, который постоянно встречается в отчётах: коэффициент детерминации R². Для пары величин это просто коэффициент корреляции, возведённый в квадрат.

Читается он приятнее, чем сама корреляция, потому что превращается в проценты. В нашем примере r = 0,919, значит R² = 0,844. Это означает: расходы на рекламу объясняют примерно 84 % разброса в числе заявок, а оставшиеся 16 % приходятся на всё остальное (сезон, конкуренты, качество посадочной страницы).

Заодно этот пересчёт лечит завышенные ожидания от средних коэффициентов. Красивое на вид значение 0,5 в квадрате даёт всего 0,25, то есть объясняет четверть происходящего. Три четверти остаются за кадром.

Семь проверок перед тем, как поверить коэффициенту

Рой сверяет результат по чек-листу перед тем, как показать его коллегам

Это тот самый чек-лист, ради которого писалась статья. Прогоняйте его каждый раз до того, как вставите цифру в презентацию.

Постройте график

Диаграмма рассеяния за десять секунд показывает то, чего не видно в числе: изгиб, две отдельные группы точек, одинокий выброс. Есть знаменитая иллюстрация под названием квартет Энскомба: четыре набора данных с одинаковыми средними и одинаковой корреляцией 0,816, но с непохожими графиками. Один из них вообще прямая с единственной сбитой точкой.

Найдите выбросы

Выброс это наблюдение, которое стоит далеко в стороне от остальных. Одна такая точка способна перевернуть результат целиком.

Смотрите, что происходит с нашим примером. Добавим девятую неделю: была распродажа, потратили всего 28 тысяч, а заявок пришло 58 (это рекорд). Пересчитываем: коэффициент Пирсона падает с 0,919 до 0,139. То есть с «сильная связь» до «связи нет».

Одно наблюдение из девяти полностью уничтожило вывод. Спирмен на тех же данных даёт 0,333: тоже упал, но не так катастрофично, потому что смотрит на порядок, а не на величину отрыва.

Выбросы не надо удалять автоматически. Надо понять их природу. Если это ошибка ввода, удаляйте. Если это реальное событие вроде распродажи, считайте отдельно с ним и без него, и обязательно скажите об этом в отчёте.

Проверьте объём выборки

На пяти точках можно получить корреляцию 0,9 чистой случайностью. Устойчивые результаты начинаются примерно с 30 наблюдений, а для слабых связей нужны сотни.

Наш пример с восемью неделями хорош для объяснения, но для рабочего вывода коротковат: восьми точек мало, и честно об этом сказать полезнее, чем сделать вид, что всё в порядке.

Посмотрите на значимость

p-value это вероятность получить такой же коэффициент случайно, если на самом деле никакой связи нет. Общепринятый порог 0,05: если значение ниже, результат считают статистически значимым.

Формально это выглядит так: коэффициент 0,4 на выборке из 200 наблюдений намного надёжнее, чем 0,8 на выборке из шести. SciPy выдаёт p-value вместе с коэффициентом, в Excel его считают через «Пакет анализа».

Убедитесь, что коэффициент подходит данным

Пирсон на оценках «от 1 до 5» или на данных с изгибом даст число, но верить ему нельзя. Сверьтесь с таблицей выбора выше и посчитайте два коэффициента вместо одного, если сомневаетесь.

Подумайте, откуда взялись данные

Частая ловушка: связь считается на срезе, который сам себя отобрал. Если вы измеряете корреляцию удовлетворённости и лояльности только среди активных клиентов, вы уже выкинули всех недовольных, которые ушли. Результат получится красивым и бессмысленным.

Сформулируйте вывод честно

Последняя и самая важная проверка. Перечитайте свою фразу и найдите в ней глаголы влияния: «увеличивает», «приводит к», «повышает». Если эксперимента не было, замените их на язык наблюдения: «сопровождается», «идёт вместе с», «чаще встречается у тех, кто».

Это выглядит как придирка к словам ровно до того момента, когда компания вложит бюджет в фактор, который ни на что не влиял.

Где научиться анализу данных

Корреляция это вход в статистику, но одним коэффициентом дело не заканчивается. Дальше идут проверка гипотез, регрессия, работа с выборками, а потом инструменты: SQL для доступа к данным, Python для расчётов, BI-системы для дашбордов. По отдельным статьям это собирается долго и с дырами в основании, поэтому многие идут учиться системно.

Мы собрали программы на одной странице: от коротких курсов по статистике до полноценной профессии «аналитик данных» с проектами в портфолио и помощью в трудоустройстве.

КурсШколаСтоимость со скидкойВ рассрочкуДлитель­ностьОбзор курса от Checkroi
Профессия «Бизнес-аналитик»
Перейти на сайт курса
SkillboxSkillbox105 680 ₽5393 ₽/мес.8 месяцевОбзор курса
Профессия «Data Scientist PRO»
Перейти на сайт курса
SkillboxSkillbox224 595 ₽7245 ₽/мес.12 месяцевОбзор курса
Профессия «Аналитик данных с нуля до middle»
Перейти на сайт курса
НетологияНетология145 600 ₽6066 ₽/мес.12 месяцевОбзор курса
Профессия «Аналитик данных»
Перейти на сайт курса
НетологияНетология101 000 ₽4156 ₽/мес.8 месяцевОбзор курса
Системный аналитик с нуля
Перейти на сайт курса
SkillboxSkillbox71 750 ₽5979 ₽/мес.6 месяцевОбзор курса
Аналитик данных с нуля
Перейти на сайт курса
SkillboxSkillbox126 936 ₽4994 ₽/мес.4 месяцаОбзор курса
Data Scientist
Перейти на сайт курса
Академия ЭдюсонЭдюсон109 900 ₽4579 ₽/мес.9 месяцевОбзор курса
Анализ данныхSkyproSkypro134 640 ₽5500 ₽/мес.12 месяцевОбзор курса
Аналитик данных
Перейти на сайт курса
SkillFactorySkillFactory131 814 ₽3662 ₽/мес.6 месяцевОбзор курса
Бизнес-аналитик: тариф Базовый
Перейти на сайт курса
Академия ЭдюсонЭдюсон109 900 ₽4579 ₽/мес.6 месяцевОбзор курса

Больше программ — в полном каталоге курсов по аналитике и Data Science

Если хотите сначала посмотреть, куда этот путь ведёт: у нас есть пошаговый план входа в профессию аналитика данных на 12 месяцев и разбор того, кто такой статистик и где он работает, от Росстата до клинических исследований.

Коротко о главном

Корреляция показывает, что две величины меняются согласованно, и измеряет силу этой согласованности числом от −1 до +1. Знак говорит о направлении, модуль о силе.

Для обычных чисел с прямолинейной связью берут коэффициент Пирсона, для оценок и данных с выбросами Спирмена, для коротких выборок Кендалла. Посчитать можно за минуту: КОРРЕЛ() в Excel, CORREL() в Google Таблицах, .corr() в pandas.

Главная ошибка при интерпретации всегда одна: увидеть связь и объявить её причиной. Между «эти показатели ходят вместе» и «один влияет на другой» лежит эксперимент, и без него вывод остаётся гипотезой.

И перед тем, как показать коэффициент кому-то ещё, потратьте десять секунд на график. Это самая дешёвая проверка из всех существующих и та, которая ловит больше всего ошибок.

Часто задаваемые вопросы

Что такое корреляция простыми словами?

Это статистическая связь между двумя величинами: когда меняется одна, обычно меняется и другая. Например, чем выше человек, тем больше он в среднем весит. Силу такой связи измеряют коэффициентом корреляции от −1 до +1, где знак показывает направление, а модуль числа — силу.

Что означает коэффициент корреляции 0,7?

По шкале Чеддока это высокая связь: величины меняются согласованно и на такой результат уже можно опираться в работе. Но полезнее возвести его в квадрат: 0,7 в квадрате даёт 0,49, то есть одна величина объясняет примерно половину разброса второй, а вторая половина приходится на другие причины.

Чем отличается корреляция Пирсона от Спирмена?

Пирсон работает с самими числами и ловит только прямолинейную связь, поэтому он чувствителен к выбросам. Спирмен сравнивает не значения, а их места в порядке (ранги), поэтому спокойно переносит выбросы и изогнутые зависимости. Если сомневаетесь, посчитайте оба: сильное расхождение между ними — сигнал, что в данных есть проблема.

Как посчитать корреляцию в Excel?

Функцией =КОРРЕЛ(диапазон1; диапазон2), в англоязычной версии это =CORREL(). Она считает коэффициент Пирсона. Для расчёта всех пар в большой таблице подключите надстройку «Пакет анализа»: в разделе «Данные» появится пункт «Анализ данных» с корреляцией внутри.

Почему говорят, что корреляция не доказывает причину?

Потому что согласованное движение двух величин может объясняться случайным совпадением или влиянием скрытого третьего фактора. Классический пример: продажи мороженого и число утоплений растут одновременно, но связывает их жара, а не мороженое. Доказать причину можно только экспериментом, например A/B-тестом.

Сколько данных нужно, чтобы результату можно было верить?

На пяти-шести наблюдениях сильный коэффициент легко получить случайно. Устойчивые выводы начинаются примерно с 30 наблюдений, а для слабых связей нужны сотни. Дополнительно смотрите на p-value: если оно меньше 0,05, результат считается статистически значимым.

Чем корреляция отличается от регрессии?

Корреляция отвечает на вопрос «связаны ли величины и насколько сильно» и симметрична. Регрессия отвечает на вопрос «насколько изменится одна величина, если поменять другую», и даёт формулу для прогноза. На практике корреляцией ищут, где есть на что смотреть, а регрессией строят прогноз по найденным связям.

Корреляция получилась отрицательной — это плохой результат?

Нет, минус говорит только о направлении: одна величина растёт, вторая падает. Значения 0,8 и −0,8 одинаково сильные. Отрицательная связь бывает и полезной находкой: например, инвесторы специально ищут активы, которые двигаются в разные стороны, чтобы портфель не падал целиком.

Читайте Checkroi первым в Google
Добавьте Checkroi в избранные источники — и наши разборы курсов и обзоры школ будут показываться выше в вашей выдаче Google.
Оставить комментарий
0 комментариев
Форма комментария

Оставьте комментарий

Напишите, что думаете. Нам важно ваше мнение!