В США есть график, который выглядит как открытие века: чем больше сыра съедают жители страны, тем чаще люди запутываются в простыне и погибают во сне. Совпадение почти идеальное, коэффициент выше 0,9. Только сыр тут ни при чём, и простыни тоже.
Это и есть корреляция во всей красе: она честно показывает, что две величины меняются вместе, и ничего не говорит о том, почему. Половина ошибок в отчётах аналитиков растёт именно из этого места.
Разберём по порядку: что такое корреляция и какая она бывает, какой из трёх коэффициентов брать под ваши данные, как посчитать связь в Excel, Google Таблицах и на Python, что означает цифра 0,7 и когда ей верить нельзя. В конце соберём чек-лист из семи проверок, который стоит прогонять до того, как вы покажете результат руководителю.
Если вам интересно, кто вообще занимается такими расчётами каждый день, у нас есть отдельный разбор профессии аналитика данных: чем он занят, что должен знать и сколько получает.
Статья пригодится не только аналитикам. Корреляцию считают маркетологи (реклама и заявки), HR-специалисты (условия работы и увольнения), продакт-менеджеры (поведение в приложении и оплаты), финансисты (активы в портфеле). Всем, у кого есть таблица с цифрами и вопрос «а связано ли одно с другим». Она же лежит в основе более сложных инструментов, до которых доходят позже: например, A/B-тестирования.
А если после статьи захочется разобраться в анализе данных системно, а не по кусочкам, у нас собраны курсы по аналитике и Data Science: от коротких интенсивов по статистике до годовых программ с трудоустройством.
Что такое корреляция простыми словами

Корреляция это статистическая связь между двумя величинами: меняется одна, обычно меняется и другая. Слово пришло из латыни и означает примерно «соотношение».
Величины, которые мы сравниваем, в статистике называют переменными. Переменная это просто столбец с числами: расходы на рекламу по неделям, рост людей в группе, температура за месяц. Всё, что меняется от строки к строке и что можно измерить.
Пример, который вы наблюдали сами: чем выше человек ростом, тем больше он обычно весит. Не всегда, бывают худые баскетболисты и плотные люди невысокого роста. Но если взять тысячу человек, тенденция проступит отчётливо. Вот это «обычно, в среднем, с исключениями» и есть корреляция.
Её главная особенность в том, что она описывает не жёсткое правило, а склонность. Если бы связь была жёсткой, мы бы говорили о функции: подставил рост, получил вес. В жизни так не работает почти нигде, поэтому статистике и понадобился отдельный инструмент для «связано, но не намертво».
Силу этой склонности измеряют одним числом: коэффициентом корреляции. Он всегда лежит в промежутке от −1 до +1, и это удобно, потому что позволяет сравнивать между собой связи из разных областей.
- Ближе к +1 — растёт одна величина, растёт и другая
- Ближе к −1 — растёт одна, падает другая
- Около 0 — величины ведут себя независимо
Знак говорит о направлении связи, модуль числа о её силе. Значения 0,8 и −0,8 одинаково сильные, просто одна связь прямая, а вторая обратная. Это первое место, где новички ошибаются: минус в коэффициенте не означает «плохой результат» или «слабая связь».
Запомните формулировку. Корреляция отвечает на вопрос «меняются ли эти величины согласованно», и только на него. Вопрос «почему они меняются согласованно» находится за пределами её компетенции.
Где корреляцию используют на работе
Абстрактная статистика становится понятнее, когда видишь, какие рабочие задачи она закрывает.
Маркетинг. Самый частый сценарий: сравнить расходы на канал с числом заявок и понять, какой канал вообще шевелится вместе с бюджетом. Часто выясняется, что контекстная реклама даёт сильную связь, а соцсети почти нулевую, потому что работают на отложенный спрос. Тот же приём применяют к цене и объёму продаж, к частоте писем и конверсии.
Продуктовая аналитика. Ищут признаки, которые ходят рядом с удержанием пользователей. Классика: если человек в первую неделю сделал определённое действие, он с большей вероятностью останется через месяц. Корреляция такие связи находит, дальше их проверяют экспериментом.
HR. Сопоставляют стаж, зарплату, результаты оценки и увольнения. Помогает заметить, что уходят, скажем, не самые низкооплачиваемые сотрудники, а те, кто дольше всех сидит без повышения.
Финансы и инвестиции. Здесь корреляция это рабочий инструмент управления риском. Если все бумаги в портфеле сильно связаны между собой, они и падать будут вместе. Поэтому инвесторы специально ищут активы с низкой или отрицательной связью: российские акции и золото ведут себя по-разному, и это спасает портфель в плохой год.
Медицина и социология. Связь между образом жизни и заболеваемостью, между уровнем образования и доходом. В этих областях с интерпретацией особенно осторожны, потому что цена ошибочного вывода высока.
Всю процедуру целиком, от подготовки таблицы и графика до проверки выводов, называют корреляционным анализом. Дальше в статье мы пройдём её по шагам на живом примере.
Общее у всех сценариев одно: корреляция работает как детектор гипотез. Она подсвечивает пары величин, на которые стоит посмотреть внимательнее, и экономит время на тех, где смотреть не на что.
Канал основателя Checkroi Вани Буявца3 700 человек читают мой Телеграм-канал про нейросетиСобрал промпты для Claude Code и ChatGPT, разборы ИИ-инструментов и лайфхаки по продвижению бизнеса в одном местеПрисоединитьсяВиды корреляции: направление и форма

Связи различают по двум признакам, и путать их не стоит.
По направлению
Положительная (прямая) корреляция. Величины двигаются в одну сторону. Больше рекламный бюджет, больше заявок. Больше часов подготовки, выше балл на экзамене. Коэффициент со знаком плюс.
Отрицательная (обратная) корреляция. Одна растёт, вторая падает. Выше цена, ниже спрос. Больше времени на загрузку страницы, меньше оформленных заказов. Коэффициент со знаком минус.
Нулевая корреляция. Связи не видно: величины меняются каждая по своим причинам. Цвет корпуса ноутбука и скорость его работы, рост сотрудника и качество его отчётов.
По форме
Линейная связь. Точки на графике выстраиваются вдоль прямой. Каждая дополнительная тысяча рублей бюджета добавляет примерно одинаковое число заявок. Именно такие связи ловит самый популярный коэффициент, о котором пойдёт речь ниже.
Нелинейная связь. Зависимость есть, но она изгибается. Самый частый вид: перевёрнутая дуга, когда сначала растёт, потом падает. Частота рассылок ровно такая: одно письмо в неделю мало, три в неделю хорошо, десять в неделю и люди отписываются.
Это различие важно по вполне практической причине. Мы посчитали связь для рассылок из примера выше: частота писем от одного до восьми в неделю против конверсии, которая сначала росла с 1,2 % до 3,4 %, а потом упала до 1 %. Обычный коэффициент выдал −0,12, то есть «связи практически нет».
А связь при этом сильнейшая и прекрасно видна глазом на графике. Просто она дугообразная, и линейный инструмент её не различает: рост в начале и падение в конце взаимно погасились.
Отсюда правило номер один. Сначала стройте диаграмму рассеяния (это график, где каждая пара значений становится точкой), и только потом считайте коэффициент. Цифра без картинки регулярно врёт, а картинка без цифры никогда.
Три коэффициента корреляции и как выбрать нужный
Все три считаются в пару кликов в обычной таблице, отдельный софт для этого не нужен. Если работаете в Excel, пригодится разбор про сводные таблицы: данные под расчёт корреляции чаще всего собирают именно ими.
Коэффициентов придумано много, но в реальной работе вам понадобятся три. Разбираемся, чем они отличаются и когда какой брать.
Коэффициент Пирсона (r)
Самый известный и тот, который считается по умолчанию везде: в Excel, в Google Таблицах, в Python. Измеряет силу линейной связи между двумя количественными величинами.
Количественные данные это те, которые измеряются в нормальных единицах и которые осмысленно складывать и усреднять: рубли, килограммы, минуты, штуки, проценты.
Требования у Пирсона довольно строгие: связь должна быть примерно прямолинейной, данные без грубых выбросов (так называют одиночные значения, которые стоят далеко в стороне от остальных), распределение близко к нормальному. Нарушите условия, и коэффициент начнёт показывать ерунду, причём молча.
Коэффициент Спирмена (ρ)
Работает не с самими числами, а с рангами: он расставляет значения по местам (первое, второе, третье) и сравнивает порядок. Из-за этого он гораздо спокойнее переносит выбросы и не требует, чтобы связь была прямой линией. Ему достаточно, чтобы она была монотонной: росла или падала без разворотов.
Берите Спирмена, когда данные порядковые (оценки «плохо, нормально, отлично», позиции в рейтинге, уровни удовлетворённости), когда в выборке (так называют набор наблюдений, который вы взяли для расчёта) есть подозрительные выбросы или когда график показывает изгиб.
Коэффициент Кендалла (τ)
Тоже ранговый, но считает по-другому: перебирает все пары наблюдений и смотрит, в скольких из них порядок совпал. Даёт более осторожные, обычно меньшие по модулю значения и устойчивее ведёт себя на маленьких выборках.
Его берут, когда данных мало (условно меньше 20 наблюдений) или когда в них много одинаковых значений.
Таблица выбора: что брать под ваши данные
| Ситуация | Что брать | Почему |
|---|---|---|
| Обычные числа (рубли, штуки, минуты), график похож на прямую | Пирсон | Стандарт, понятен всем, легко объяснить |
| В данных есть яркий выброс, убирать его нельзя | Спирмен | Работает с местами, а не с величиной отрыва |
| Оценки, рейтинги, баллы «от 1 до 5» | Спирмен | Порядковые данные Пирсону не подходят |
| Связь есть, но график изогнут (без разворотов) | Спирмен | Ловит монотонность, прямая линия не нужна |
| Наблюдений меньше 20 | Кендалл | Устойчивее на коротких выборках |
| Много повторяющихся значений | Кендалл | Корректнее обрабатывает совпадения |
| График показал дугу с разворотом | Ни один | Тут нужна регрессия, о ней ниже |
Если непонятно, что выбрать: посчитайте Пирсона и Спирмена одновременно, благо это две строчки кода или две формулы. Если результаты близки, берите Пирсона, его проще объяснить коллегам. Если они сильно разошлись, это само по себе сигнал: значит, в данных есть выброс или изгиб, и разбираться надо с ними, а не с выбором коэффициента.
Что означает 0,3 и что означает 0,9
Вы получили число. Дальше нужно понять, много это или мало. Для грубой прикидки в русскоязычной статистике обычно пользуются шкалой Чеддока.
| Модуль коэффициента | Как называется связь | Что это значит на практике |
|---|---|---|
| 0,1 – 0,3 | Слабая | Почти шум, строить на этом выводы рано |
| 0,3 – 0,5 | Умеренная | Что-то есть, нужны дополнительные данные |
| 0,5 – 0,7 | Заметная | Связь видна, гипотезу стоит проверять |
| 0,7 – 0,9 | Высокая | Сильная зависимость, работать можно |
| 0,9 – 1,0 | Очень высокая | Проверьте, не считаете ли вы одно и то же дважды |
Последняя строка не шутка. Коэффициент выше 0,95 в реальных бизнес-данных почти всегда означает ошибку. Типичная причина: две колонки на самом деле выражают одну и ту же величину. Выручка и выручка с НДС дадут корреляцию около единицы, и никакой новой информации в этом нет.
И главная оговорка про шкалу: она условна. Значение 0,6 в физическом эксперименте с точными приборами считается провалом, а в социологии, где мы пытаемся предсказать поведение живых людей, это отличный результат. Ориентируйтесь на то, какие значения нормальны в вашей области, а не на таблицу саму по себе.
Как посчитать корреляцию: Excel, Google Таблицы и Python
Дальше идёт сквозной пример, к которому мы будем возвращаться. Возьмём маленький датасет (так называют готовый набор данных для анализа) из отдела маркетинга: расходы на контекстную рекламу и число заявок за восемь недель.
| Неделя | Расходы, тыс. ₽ | Заявки, шт. |
|---|---|---|
| 1 | 30 | 21 |
| 2 | 45 | 24 |
| 3 | 52 | 34 |
| 4 | 38 | 19 |
| 5 | 60 | 33 |
| 6 | 71 | 44 |
| 7 | 55 | 26 |
| 8 | 66 | 40 |
Excel
Заведите два столбца, скажем B2:B9 для расходов и C2:C9 для заявок. В любой свободной ячейке напишите:
=КОРРЕЛ(B2:B9; C2:C9)
В англоязычной версии функция называется =CORREL(). Она считает именно коэффициент Пирсона. На наших данных получится 0,919.
Если нужны сразу все пары в большой таблице, включите «Пакет анализа» (Файл → Параметры → Надстройки), и в разделе «Данные» появится пункт «Анализ данных» с корреляцией внутри.
Google Таблицы
Здесь та же формула английским вариантом, разделитель обычно запятая:
=CORREL(B2:B9, C2:C9)
Результат тот же самый: 0,919. Никакой разницы с Excel в расчётах нет.
Python
Если строк тысячи, таблицы становятся неудобными, и работу проще делать в Python. Библиотека pandas умеет считать корреляцию одной командой:
import pandas as pd
df = pd.DataFrame({'spend': [30,45,52,38,60,71,55,66],
'leads': [21,24,34,19,33,44,26,40]})
print(df['spend'].corr(df['leads'])) # 0.919
Чтобы получить Спирмена, добавьте один параметр:
print(df['spend'].corr(df['leads'], method='spearman')) # 0.905
Значения близки (0,919 и 0,905), и это хороший знак: связь ведёт себя прилично, выбросов не видно, можно спокойно докладывать результат.
Если нужна ещё и статистическая значимость, берите библиотеку SciPy: scipy.stats.pearsonr(x, y) возвращает сразу пару значений: коэффициент и p-value (число, которое показывает, насколько вероятно получить такой результат случайно). Про него подробнее в разделе про проверки.
Знакомство с Python обычно и начинается с таких задач: посчитать, отфильтровать, построить график. Если этот язык для вас пока незнакомая территория, посмотрите наш разбор языка SQL: у аналитика он обычно идёт первым, ещё до Python.
Матрица корреляций, когда столбцов много

Считать связи по одной паре нормально, пока пар три. Когда в таблице двадцать показателей, попарных сравнений набегает под две сотни.
Для таких случаев есть матрица корреляций: квадратная таблица, где каждый показатель сравнивается с каждым. На пересечении строки и столбца стоит коэффициент. По диагонали всегда единицы, потому что показатель идеально коррелирует сам с собой, а половинки относительно диагонали зеркальны.
В pandas это одна команда без аргументов:
df.corr()
Чтобы не читать глазами сетку из четырёхсот чисел, матрицу раскрашивают: сильные положительные связи в один цвет, сильные отрицательные в другой, слабые бледные. Получается тепловая карта, на которой интересные места видно за секунду. В Python её рисуют библиотекой seaborn, в Excel обычным условным форматированием.
У матрицы есть отдельная профессиональная польза: она быстро показывает, что два столбца дублируют друг друга. Если «выручка» и «выручка без скидок» дают 0,99, одну из колонок из модели можно смело выкидывать.
Инструменты, которые превращают такие таблицы в понятные картинки, мы собрали в подборке сервисов для визуализации данных.
Корреляция и причинность: место, где ошибаются почти все
Вернёмся к сыру и простыням из начала статьи. Связь между этими показателями в американских данных есть, и она сильная. Причины никакой нет: просто обе величины много лет росли вместе с населением и качеством статистики. Такие совпадения называют ложной корреляцией, и энтузиасты собрали их целую коллекцию на сайте Spurious Correlations.
Более коварный случай, чем случайное совпадение, это третья переменная: скрытый фактор, который двигает обе величины сразу. Учебниковый пример: продажи мороженого и число утоплений растут одновременно. Мороженое никого не топит, просто и то и другое зависит от жары.
В бизнесе третья переменная встречается постоянно, и выглядит она куда убедительнее мороженого:
- Пользователи, включившие уведомления, платят чаще. Возможно, уведомления работают. А возможно, их включают те, кто и так был настроен пользоваться продуктом всерьёз
- Отделы с высокими зарплатами показывают лучшие результаты. Или туда просто нанимают более опытных людей
- Клиенты, прошедшие онбординг, реже уходят. Или онбординг до конца проходят самые мотивированные
Заметьте, во всех трёх случаях корреляция настоящая и посчитана правильно. Ломается вывод, который из него делают, а сам расчёт в порядке.
Формулировка, которая спасает от 90 % таких ошибок. Вместо «уведомления увеличивают оплаты» говорите «пользователи с уведомлениями платят чаще, причина пока не установлена». Второе утверждение честное и его не стыдно защищать на встрече.
Как всё-таки добраться до причины
Корреляция причину не доказывает, но это не тупик. Дальше есть куда идти.
Эксперимент. Главный и самый надёжный способ. Вы случайным образом делите аудиторию на две группы, одной меняете условие, второй нет, и сравниваете результат. Случайное деление как раз и убирает влияние скрытых факторов. Как это устроено на практике, мы разбирали в статье про A/B-тестирование.
Контроль третьей переменной. Если эксперимент невозможен, попробуйте разбить данные на однородные группы. Считаете связь зарплаты и результата отдельно для новичков и отдельно для опытных сотрудников. Если внутри каждой группы связь исчезла, вы нашли скрытый фактор.
Проверка направления во времени. Причина обязана идти раньше следствия. Если рост заявок начался за две недели до увеличения бюджета, реклама тут точно ни при чём.
Здравый смысл и знание предметной области. Недооценённый инструмент. Человек, который десять лет работает в этой нише, отсеет половину ложных связей быстрее любой статистики.
Чем корреляция отличается от регрессии
Эти два слова в отчётах стоят рядом, и новички их путают. Разница простая.
Корреляция отвечает на вопрос «связаны ли эти величины и насколько сильно». Она симметрична: связь расходов с заявками и заявок с расходами это одно и то же число.
Регрессия отвечает на вопрос «насколько изменится одна величина, если я поменяю другую». Она несимметрична и даёт формулу для прогноза: добавили десять тысяч рублей, ждём примерно шесть дополнительных заявок.
Практический порядок работы такой: корреляцией вы ищете, где вообще есть на что смотреть, а регрессией строите прогноз для найденных связей.
Рядом живёт ещё один показатель, который постоянно встречается в отчётах: коэффициент детерминации R². Для пары величин это просто коэффициент корреляции, возведённый в квадрат.
Читается он приятнее, чем сама корреляция, потому что превращается в проценты. В нашем примере r = 0,919, значит R² = 0,844. Это означает: расходы на рекламу объясняют примерно 84 % разброса в числе заявок, а оставшиеся 16 % приходятся на всё остальное (сезон, конкуренты, качество посадочной страницы).
Заодно этот пересчёт лечит завышенные ожидания от средних коэффициентов. Красивое на вид значение 0,5 в квадрате даёт всего 0,25, то есть объясняет четверть происходящего. Три четверти остаются за кадром.
Семь проверок перед тем, как поверить коэффициенту

Это тот самый чек-лист, ради которого писалась статья. Прогоняйте его каждый раз до того, как вставите цифру в презентацию.
Постройте график
Диаграмма рассеяния за десять секунд показывает то, чего не видно в числе: изгиб, две отдельные группы точек, одинокий выброс. Есть знаменитая иллюстрация под названием квартет Энскомба: четыре набора данных с одинаковыми средними и одинаковой корреляцией 0,816, но с непохожими графиками. Один из них вообще прямая с единственной сбитой точкой.
Найдите выбросы
Выброс это наблюдение, которое стоит далеко в стороне от остальных. Одна такая точка способна перевернуть результат целиком.
Смотрите, что происходит с нашим примером. Добавим девятую неделю: была распродажа, потратили всего 28 тысяч, а заявок пришло 58 (это рекорд). Пересчитываем: коэффициент Пирсона падает с 0,919 до 0,139. То есть с «сильная связь» до «связи нет».
Одно наблюдение из девяти полностью уничтожило вывод. Спирмен на тех же данных даёт 0,333: тоже упал, но не так катастрофично, потому что смотрит на порядок, а не на величину отрыва.
Выбросы не надо удалять автоматически. Надо понять их природу. Если это ошибка ввода, удаляйте. Если это реальное событие вроде распродажи, считайте отдельно с ним и без него, и обязательно скажите об этом в отчёте.
Проверьте объём выборки
На пяти точках можно получить корреляцию 0,9 чистой случайностью. Устойчивые результаты начинаются примерно с 30 наблюдений, а для слабых связей нужны сотни.
Наш пример с восемью неделями хорош для объяснения, но для рабочего вывода коротковат: восьми точек мало, и честно об этом сказать полезнее, чем сделать вид, что всё в порядке.
Посмотрите на значимость
p-value это вероятность получить такой же коэффициент случайно, если на самом деле никакой связи нет. Общепринятый порог 0,05: если значение ниже, результат считают статистически значимым.
Формально это выглядит так: коэффициент 0,4 на выборке из 200 наблюдений намного надёжнее, чем 0,8 на выборке из шести. SciPy выдаёт p-value вместе с коэффициентом, в Excel его считают через «Пакет анализа».
Убедитесь, что коэффициент подходит данным
Пирсон на оценках «от 1 до 5» или на данных с изгибом даст число, но верить ему нельзя. Сверьтесь с таблицей выбора выше и посчитайте два коэффициента вместо одного, если сомневаетесь.
Подумайте, откуда взялись данные
Частая ловушка: связь считается на срезе, который сам себя отобрал. Если вы измеряете корреляцию удовлетворённости и лояльности только среди активных клиентов, вы уже выкинули всех недовольных, которые ушли. Результат получится красивым и бессмысленным.
Сформулируйте вывод честно
Последняя и самая важная проверка. Перечитайте свою фразу и найдите в ней глаголы влияния: «увеличивает», «приводит к», «повышает». Если эксперимента не было, замените их на язык наблюдения: «сопровождается», «идёт вместе с», «чаще встречается у тех, кто».
Это выглядит как придирка к словам ровно до того момента, когда компания вложит бюджет в фактор, который ни на что не влиял.
Где научиться анализу данных
Корреляция это вход в статистику, но одним коэффициентом дело не заканчивается. Дальше идут проверка гипотез, регрессия, работа с выборками, а потом инструменты: SQL для доступа к данным, Python для расчётов, BI-системы для дашбордов. По отдельным статьям это собирается долго и с дырами в основании, поэтому многие идут учиться системно.
Мы собрали программы на одной странице: от коротких курсов по статистике до полноценной профессии «аналитик данных» с проектами в портфолио и помощью в трудоустройстве.
| Курс | Школа | Стоимость со скидкой | В рассрочку | Длительность | Обзор курса от Checkroi |
|---|---|---|---|---|---|
| Профессия «Бизнес-аналитик» Перейти на сайт курса | 105 680 ₽ | 5393 ₽/мес. | 8 месяцев | Обзор курса | |
| Профессия «Data Scientist PRO» Перейти на сайт курса | 224 595 ₽ | 7245 ₽/мес. | 12 месяцев | Обзор курса | |
| Профессия «Аналитик данных с нуля до middle» Перейти на сайт курса | 145 600 ₽ | 6066 ₽/мес. | 12 месяцев | Обзор курса | |
| Профессия «Аналитик данных» Перейти на сайт курса | 101 000 ₽ | 4156 ₽/мес. | 8 месяцев | Обзор курса | |
| Системный аналитик с нуля Перейти на сайт курса | 71 750 ₽ | 5979 ₽/мес. | 6 месяцев | Обзор курса | |
| Аналитик данных с нуля Перейти на сайт курса | 126 936 ₽ | 4994 ₽/мес. | 4 месяца | Обзор курса | |
| Data Scientist Перейти на сайт курса | 109 900 ₽ | 4579 ₽/мес. | 9 месяцев | Обзор курса | |
| Анализ данных | 134 640 ₽ | 5500 ₽/мес. | 12 месяцев | Обзор курса | |
| Аналитик данных Перейти на сайт курса | 131 814 ₽ | 3662 ₽/мес. | 6 месяцев | Обзор курса | |
| Бизнес-аналитик: тариф Базовый Перейти на сайт курса | 109 900 ₽ | 4579 ₽/мес. | 6 месяцев | Обзор курса |
Больше программ — в полном каталоге курсов по аналитике и Data Science
Если хотите сначала посмотреть, куда этот путь ведёт: у нас есть пошаговый план входа в профессию аналитика данных на 12 месяцев и разбор того, кто такой статистик и где он работает, от Росстата до клинических исследований.
Коротко о главном
Корреляция показывает, что две величины меняются согласованно, и измеряет силу этой согласованности числом от −1 до +1. Знак говорит о направлении, модуль о силе.
Для обычных чисел с прямолинейной связью берут коэффициент Пирсона, для оценок и данных с выбросами Спирмена, для коротких выборок Кендалла. Посчитать можно за минуту: КОРРЕЛ() в Excel, CORREL() в Google Таблицах, .corr() в pandas.
Главная ошибка при интерпретации всегда одна: увидеть связь и объявить её причиной. Между «эти показатели ходят вместе» и «один влияет на другой» лежит эксперимент, и без него вывод остаётся гипотезой.
И перед тем, как показать коэффициент кому-то ещё, потратьте десять секунд на график. Это самая дешёвая проверка из всех существующих и та, которая ловит больше всего ошибок.




