Владелец кофейни хочет знать, сколько круассанов печь завтра. У него есть выгрузка чеков за два года: дата, время, погода, день недели, сколько продали. Ровно эта таблица и есть датасет. Отдайте её нейросети, и она научится угадывать завтрашний спрос точнее, чем чутьё бариста.
Слово «датасет» звучит так, будто за ним прячется что-то сложное и техническое. На деле это просто набор данных, собранный и приведённый в порядок так, чтобы с ним могла работать программа. Разберём, из чего он состоит, какие бывают типы, где скачать готовые наборы бесплатно и как собрать свой, даже если вы никогда не писали код.
Если вы ещё не разобрались с базой, начните с материала «Что такое нейросети и как они работают»: там объяснили, что вообще происходит внутри модели, когда ей скармливают данные.
Пригодится и разбор того, как устроено машинное обучение. Связь тут прямая: без датасета никакого обучения не будет вообще.
Статья пригодится не только программистам. С датасетами работают маркетологи, HR-специалисты, финансисты, врачи и владельцы небольшого бизнеса. Если хотите освоить это системно, загляните в подборку курсов по аналитике и Data Science: там 300 программ от коротких интенсивов до годовых.
Начнём с самого простого вопроса.
Что такое датасет простыми словами
Датасет (от английского dataset, «набор данных») — это подготовленная коллекция данных об однотипных объектах, с которой может работать программа или аналитик. Чаще всего он выглядит как обычная таблица: каждая строка описывает один объект, каждый столбец — одну его характеристику.
Возьмём датасет клиентов интернет-магазина. В каждой строке один покупатель, в столбцах его характеристики: возраст, город, сколько заказов сделал, на какую сумму, вернулся ли за повторной покупкой. Тысяча покупателей даст тысячу строк.
Вернёмся к кофейне из начала статьи. Её датасет спроса выглядел бы примерно так:
| Дата | День недели | Температура | Осадки | Продано круассанов |
|---|---|---|---|---|
| 03.09 | Среда | +18 | нет | 84 |
| 04.09 | Четверг | +15 | дождь | 112 |
| 05.09 | Пятница | +17 | нет | 139 |
| 06.09 | Суббота | +21 | нет | 68 |
На четырёх строках не увидит закономерность и человек. Семьсот строк за два года уже показывают правила: в дождь берут больше, в выходные меньше, к пятнице спрос растёт. Человек эти правила тоже заметит, но на десятке признаков собьётся, а программа удержит все сразу.
Но таблицей дело не ограничивается. Датасетом может быть папка с 10 000 фотографий кошек и собак, где к каждому снимку приписано, кто на нём. Или архив из 50 000 отзывов с пометкой «положительный» или «отрицательный». Или записи голоса. Логика одна: много однотипных примеров, приведённых к общему виду.
Ключевое слово здесь: «подготовленная». Гора чеков в коробке под кассой это ещё не датасет. Датасетом она станет, когда данные оцифруют, сведут в одну структуру, уберут дубли и ошибки.
Короткое правило. Если данные лежат в одном месте, устроены одинаково и их можно открыть программой без ручного разбора, перед вами датасет. Если каждый файл приходится читать глазами и переписывать вручную, ещё нет.
Из чего состоит датасет: объекты, признаки и таргет

У любого датасета есть три понятия, которые нужно знать. Без них дальше не двинуться. Звучат они страшнее, чем оказываются на практике.
Объект (или запись, строка). Единица информации, о которой мы что-то знаем. Один покупатель, одна фотография, один рабочий день кофейни, одна квартира на сайте объявлений.
Признак (по-английски feature, в русском жаргоне «фича»). Отдельная характеристика объекта. Для квартиры признаками будут площадь, этаж, район, год постройки, наличие балкона. В таблице признак это столбец.
Целевая переменная (таргет, target). Тот самый столбец, значение которого мы хотим научиться предсказывать. Для квартир это цена. Для покупателей: вернётся ли человек за второй покупкой. Для фотографий: что на них изображено.
Признаки бывают трёх сортов. Числовые: площадь 54 м², возраст 35 лет. Категориальные: район, цвет, марка машины (значение из ограниченного списка). Текстовые: сам отзыв, описание вакансии, комментарий.
Модель учится на связке «признаки → таргет». Вы показываете ей тысячу квартир с известной ценой, она нащупывает закономерность, а потом по новой квартире без цены выдаёт свою оценку.
Чем датасет отличается от базы данных и обычной таблицы Excel
Вопрос всплывает у каждого второго новичка, и путаница законная: внешне всё похоже.
База данных — это хранилище, живущее своей жизнью. Оно постоянно меняется: клиент оформил заказ, и в базе появилась новая запись. Задача базы в том, чтобы быстро находить и обновлять информацию прямо сейчас.
Датасет — это снимок данных, зафиксированный на определённый момент и заточенный под конкретную задачу. Его выгружают из базы, приводят в порядок и после этого не трогают. Пока модель учится, датасет остаётся прежним, иначе результаты не с чем будет сравнивать.
Таблица в Excel вполне может быть датасетом, если в ней порядок. Формат тут ни при чём, всё решают размер и аккуратность. Лист Excel жёстко ограничен 1 048 576 строками, а тормозить начинает задолго до этого предела. И данные в нём люди обычно ведут вольно: то «Москва», то «москва», то «МСК» в одном столбце.
Разница практическая, а не философская. Базу вы спрашиваете о том, что происходит сейчас. Датасет вы отдаёте модели, чтобы она нашла закономерность на прошлом.
Канал основателя Checkroi Вани Буявца3 700 человек читают мой Телеграм-канал про нейросетиСобрал промпты для Claude Code и ChatGPT, разборы ИИ-инструментов и лайфхаки по продвижению бизнеса в одном местеПрисоединитьсяКакие бывают датасеты

Данные делят по тому, что внутри. От типа зависит и формат файла, и инструменты, и то, сколько данных понадобится.
| Тип датасета | Что внутри | Типичная задача | Формат файла |
|---|---|---|---|
| Табличный | Строки и столбцы с числами и категориями | Предсказать цену, отток клиентов, спрос | CSV, Excel, Parquet |
| Текстовый | Отзывы, письма, статьи, диалоги | Определить тональность, ответить на вопрос | JSON, TXT, CSV |
| Изображения | Фото и картинки с подписями | Узнать объект на снимке, найти брак на детали | JPG, PNG плюс файл разметки |
| Аудио | Записи речи, музыки, шумов | Распознать речь, определить эмоцию по голосу | WAV, MP3 плюс расшифровки |
| Временной ряд | Значения, привязанные к моментам времени | Спрогнозировать продажи, курс, нагрузку | CSV, Parquet |
| Граф | Объекты и связи между ними | Найти сообщества в соцсети, выявить мошенников | Специальные форматы, JSON |
Есть и второе деление, о котором стоит знать. Структурированные данные ложатся в таблицу без потерь: возраст, сумма, город. Неструктурированные в клетку не помещаются: текст письма, видео, скан документа. Примерно 80 % всех данных в мире относятся ко второй категории, и именно с ними работают нейросети последних лет.
Про форматы файлов коротко. CSV самый простой: это текстовый файл, где значения разделены запятыми, открывается чем угодно, включая Excel. JSON удобен, когда структура сложная и вложенная. Parquet сжимает данные в разы и нужен, когда строк миллионы. Новичку хватит CSV.
Отдельно про большие данные: Big Data это не синоним датасета. Так называют объёмы, которые не влезают на один компьютер и требуют распределённых систем. Обычный рабочий датасет чаще всего помещается в оперативную память ноутбука.
Где брать готовые датасеты: 12 проверенных источников
Собирать данные с нуля нужно далеко не всегда. Для учёбы, пробы гипотезы или пет-проекта проще взять готовое. Ниже площадки, которые работают и не требуют денег.
Мировые площадки
Kaggle (kaggle.com/datasets). Больше 400 тысяч наборов на любую тему, от цен на жильё до снимков МРТ. Главный плюс для новичка в том, что к популярным датасетам приложены чужие решения в виде тетрадок с кодом: можно посмотреть, как задачу решали другие. Здесь же лежат учебная классика вроде «Титаника» и Iris.
Hugging Face (huggingface.co/datasets). Основная площадка для всего, что связано с текстом и языковыми моделями. Наборы качаются одной строчкой кода, есть предпросмотр прямо в браузере и много русскоязычных данных.
Google Dataset Search (datasetsearch.research.google.com). Здесь ничего не хранится: сервис ищет наборы данных по всему интернету и ведёт на первоисточник. Когда не знаете, где искать, начинайте отсюда.
UCI Machine Learning Repository (archive.ics.uci.edu). Академический архив, живущий с 1987 года. Наборы небольшие и чистые, идеальны для первых учебных экспериментов.
ImageNet (image-net.org) и MS COCO (cocodataset.org). Два кита компьютерного зрения: миллионы размеченных фотографий, на которых обучалось большинство современных моделей распознавания.
MNIST это 70 тысяч картинок рукописных цифр размером 28×28 пикселей. Самый затасканный учебный датасет в истории, и это комплимент: на нём удобно проверять, что вы всё поняли правильно.
Русские открытые данные
Здесь у большинства статей провал: все перечисляют Kaggle и забывают, что российских данных там мало. А для задач про наш рынок нужны именно они.
Росстат и ЕМИСС (fedstat.ru). Официальная статистика по стране: население, зарплаты, цены, производство, демография по регионам. Выгружается в Excel и CSV.
Портал открытых данных (data.gov.ru). Общая витрина наборов от федеральных и региональных ведомств.
Банк России (cbr.ru/statistics). Курсы валют, ставки, банковская статистика с многолетней историей. Отличная база для учебных проектов по временным рядам.
Открытые данные Москвы (data.mos.ru). Больше семисот наборов по городу: транспорт, здравоохранение, культура, коммунальное хозяйство. Один из самых живых и регулярно обновляемых российских порталов.
Каталог каталогов (datacatalogs.ru). Сводный указатель российских источников данных: госпорталы, научные репозитории, отраслевые базы.
| Источник | Объём | Язык данных | Регистрация | Кому подойдёт |
|---|---|---|---|---|
| Kaggle | 400 тыс.+ наборов | В основном английский | Нужна | Учёба, пет-проекты, соревнования |
| Hugging Face | 250 тыс.+ наборов | Много языков, есть русский | Не нужна для скачивания | Тексты, речь, работа с моделями |
| Google Dataset Search | Поиск по всему интернету | Любой | Не нужна | Когда не знаете, где искать |
| UCI Repository | Около 700 наборов | Английский | Не нужна | Первые учебные эксперименты |
| Росстат, data.gov.ru | Тысячи наборов | Русский | Не нужна | Задачи про российский рынок |
| Банк России | Сотни рядов | Русский | Не нужна | Финансы, временные ряды |
Как читать лицензию и не нарваться
У каждого датасета есть условия использования, и их пропускают чаще всего. Пока вы учитесь, риск нулевой. Как только результат уходит в коммерческий продукт, лицензия становится вопросом денег.
Три формулировки, которые нужно узнавать в лицо. CC BY и подобные разрешают почти всё, включая коммерцию, но требуют указать автора. Non-commercial или research only прямо запрещают зарабатывать: такой датасет годится для диплома и не годится для сервиса за деньги. Отсутствие лицензии многие читают как «можно всё». На деле она читается как «прав вам никто не давал».
Про персональные данные. В России их оборот регулирует 152-ФЗ. Собирать ФИО, телефоны, адреса и медицинские сведения без согласия людей нельзя, даже если технически данные лежат в открытом доступе. Для учебной задачи проще брать обезличенные наборы, где личности заменены на номера.
Зачем нужен датасет: как на нём учится модель
Модель не понимает мир, она ищет статистические закономерности в примерах. Датасет и есть эти примеры. Дальше всё зависит от того, есть ли в нём правильные ответы.
Обучение с учителем. В датасете рядом с признаками лежит таргет: правильный ответ. Тысяча отзывов, где у каждого проставлена метка «хвалят» или «ругают». Модель прогоняет их через себя, ошибается, подстраивается и в итоге начинает угадывать тональность нового отзыва, которого раньше не видела. Так работает большинство прикладных задач бизнеса.
Обучение без учителя. Правильных ответов нет, модель ищет структуру сама. Загрузили в неё покупателей магазина без всяких меток, и она разбила их на группы: экономные, импульсивные, оптовые. Никто заранее не говорил, что групп должно быть три и какие они. Это полезно, когда вы сами не знаете, что ищете.
Есть и третий подход, обучение с подкреплением, где готового датасета нет вовсе: программа действует в среде, получает награду за удачные ходы и накапливает опыт сама. Так учат играть в шахматы и управлять роботами. Для прикладных бизнес-задач он применяется редко, поэтому в статьях про датасеты его обычно и не встретишь.
Отсюда простой вывод: качество датасета важнее модели. Хороший алгоритм на плохих данных даст плохой результат, а средний алгоритм на чистых данных даст приличный. Специалисты называют это правилом «мусор на входе, мусор на выходе», и оно не устаревает.
Как собрать свой датасет за 6 шагов
Дальше идёт та часть работы, которую в вакансиях называют подготовкой данных, и на неё уходит основная часть времени в проекте. Если примеряете это как профессию, посмотрите, сколько зарабатывает аналитик данных и из чего складывается вилка по грейдам.

Готового набора под вашу задачу может просто не быть. Особенно если задача узкая: спрос на круассаны именно в вашей кофейне никто до вас не оцифровывал.
Шаг 1: сформулируйте, что хотите предсказать
Сбор идёт вторым номером. Первым идёт вопрос. «Хочу понять клиентов» это не задача. «Хочу по первому заказу предсказать, вернётся ли покупатель в течение трёх месяцев» уже задача: понятно, что такое объект (покупатель), что такое таргет (вернулся или нет) и какие признаки нужны.
Пока формулировки нет, любой сбор превратится в накопление файлов, из которых потом ничего не соберётся.
Шаг 2: соберите данные
Четыре рабочих источника, от простого к сложному.
- То, что уже есть. Выгрузка из CRM, отчёт из кассовой программы, таблица откликов на вакансию, статистика сайта. Начинайте отсюда: это бесплатно и легально.
- Открытые данные. Порталы из раздела выше.
- Опросы и формы. Google Формы или Яндекс Формы соберут структурированные ответы сразу в таблицу.
- Парсинг (веб-скрейпинг). Автоматический сбор информации со страниц сайтов. Для новичка есть готовые сервисы без кода, программисты пишут скрипты на Python. Здесь же главная юридическая ловушка: пользовательское соглашение многих сайтов запрещает автоматический сбор, а персональные данные людей парсить нельзя в любом случае.
Шаг 3: разметьте данные
Разметка (аннотация) — это добавление правильных ответов к сырым данным. Человек смотрит фотографию и пишет «кошка». Читает отзыв и ставит «негатив». Обводит рамкой дефект на детали.
Шаг самый скучный и самый дорогой: на него уходит львиная доля бюджета любого проекта. Небольшой объём размечают руками или силами коллег. Тысячи примеров отдают на краудсорсинговые платформы, где задание выполняют исполнители за небольшую плату.
Одно правило спасает больше всего проектов: напишите инструкцию до начала разметки и проверьте её на полусотне примеров. Если два человека по одной инструкции ставят разные метки, инструкция плохая, и переделывать придётся всё.
Шаг 4: очистите и подготовьте данные
Сырые данные всегда грязные, и очистка данных обычно занимает больше времени, чем само обучение модели. Что искать в первую очередь:
- Пропуски. Пустые ячейки заполняют средним значением, заглушкой или выбрасывают строку целиком.
- Дубликаты. Одна и та же запись, попавшая дважды, перекашивает обучение.
- Разнобой в написании. «Москва», «москва» и «МСК» для программы это три разных города.
- Выбросы. Возраст 200 лет или цена в один рубль обычно означают опечатку.
- Единицы измерения. Смешивать рубли с долларами и метры с футами в одном столбце нельзя.
Шаг 5: поделите на выборки
Готовый датасет режут на части, чтобы честно проверить модель. Подробности в следующем разделе.
Шаг 6: проверьте на маленькой модели
До того как вкладываться в масштаб, обучите что-нибудь простое на первой тысяче строк. Если результат чуть лучше случайного угадывания, значит сигнал в данных есть и собирать дальше имеет смысл. Если результат на уровне подбрасывания монетки, проблема в признаках, и увеличение объёма её не вылечит.
Версия для тех, кто не пишет код. Первый датасет спокойно собирается в Google Таблицах: столбцы это признаки, строки это объекты, последний столбец это правильный ответ. Скачиваете файл в формате CSV, и он готов к работе. Python с библиотекой Pandas понадобится позже, когда строк станет больше сотни тысяч.
CheckroiПодборка курсов по Pandas108 курсов • 23 школыСравните цены, школы, программу и найдите выгодные предложения по обучениюСравнить→
Сколько данных нужно и как делить на выборки
Вопрос «сколько строк достаточно» задают чаще всех остальных, и честный ответ звучит неудобно: зависит от задачи. Но ориентиры есть.
Для простой табличной задачи вроде предсказания оттока клиентов начинают с нескольких тысяч строк. Классическому распознаванию изображений с нуля нужны десятки тысяч размеченных снимков. Языковым моделям требуются миллиарды слов, поэтому их с нуля никто и не обучает.
Хорошая новость в том, что второй вариант почти всегда лишний. Есть дообучение готовой модели (по-английски transfer learning): вы берёте нейросеть, уже обученную на миллионах примеров, и показываете ей свои несколько сотен. Для распознавания брака на конвейере или сортировки договоров хватает 200–500 примеров на каждый класс.
И отдельно про качество против количества. Тысяча аккуратно размеченных примеров почти всегда бьёт десять тысяч, размеченных наспех разными людьми по разным правилам. Когда бюджет ограничен, вкладывайте его в единую инструкцию и перепроверку спорных случаев, а не в объём.
Теперь про деление. В англоязычных руководствах эту процедуру называют train/test split, и датасет в ней разбивают на три части:
- Обучающая выборка (train), около 70 %. На ней модель учится.
- Валидационная (validation), около 15 %. На ней подбирают настройки и сравнивают варианты.
- Тестовая (test), около 15 %. Её прячут до самого конца и достают один раз, чтобы узнать честное качество.
Зачем такие сложности? Из-за переобучения. Модель умеет запоминать примеры вместо того, чтобы улавливать закономерность. На знакомых данных она покажет блестящий результат, на новых провалится. Тест на спрятанной части ловит этот самообман.
Вторая ловушка называется утечкой данных. Это когда в признаки случайно попала информация, которой в момент предсказания ещё не существует. Классический пример: модель предсказывает, вернётся ли клиент, а среди столбцов лежит «дата второго заказа». Точность получается фантастическая, польза нулевая.
Третья беда это дисбаланс классов. Если мошеннических транзакций 0,1 %, модель научится всегда отвечать «всё честно» и будет права в 99,9 % случаев, оставаясь бесполезной. Лечится взвешиванием классов или досбором редких примеров.
Кто работает с датасетами и сколько зарабатывает

Данные проходят через руки нескольких специальностей, и порог входа у них разный.
Разметчик данных. Самый низкий порог: смотрит примеры и проставляет метки. Опыт и образование не нужны, ставка почасовая или сдельная. Многие приходят в сферу именно отсюда.
Аналитик данных. Собирает датасеты, чистит их, ищет закономерности и объясняет бизнесу, что происходит. Инструменты: SQL, Excel, Python, системы визуализации. Порог входа умеренный, спрос стабильный. Как выглядит путь с нуля, разобрали в материале «Как стать аналитиком данных».
Data scientist, он же дата-сайентист. Строит на датасетах модели, которые что-то предсказывают. Нужны математика, статистика и Python. Планка выше, доход тоже.
AI-инженер. Доводит модель до работающего сервиса и следит, чтобы она не деградировала на реальных данных.
Актуальные вилки по рынку мы собрали отдельно в обзоре зарплат аналитика данных.
Где научиться работать с данными
Собрать первый датасет можно за вечер по этой статье. Дальше начинается то, что по обрывкам не осваивается: статистика, чистка данных, метрики качества, работа с пропусками. Систематический курс экономит месяцы блужданий, потому что даёт задачи в правильном порядке и живого проверяющего, который укажет на ошибку.
| Курс | Школа | Стоимость со скидкой | В рассрочку | Длительность | Обзор курса от Checkroi |
|---|---|---|---|---|---|
| Профессия «Бизнес-аналитик» Перейти на сайт курса | 105 680 ₽ | 5393 ₽/мес. | 8 месяцев | Обзор курса | |
| Профессия «Data Scientist PRO» Перейти на сайт курса | 224 595 ₽ | 7245 ₽/мес. | 12 месяцев | Обзор курса | |
| Профессия «Аналитик данных с нуля до middle» Перейти на сайт курса | 145 600 ₽ | 6066 ₽/мес. | 12 месяцев | Обзор курса | |
| Профессия «Аналитик данных» Перейти на сайт курса | 101 000 ₽ | 4156 ₽/мес. | 8 месяцев | Обзор курса | |
| Системный аналитик с нуля Перейти на сайт курса | 71 750 ₽ | 5979 ₽/мес. | 6 месяцев | Обзор курса | |
| Аналитик данных с нуля Перейти на сайт курса | 126 936 ₽ | 4994 ₽/мес. | 4 месяца | Обзор курса | |
| Data Scientist Перейти на сайт курса | 109 900 ₽ | 4579 ₽/мес. | 9 месяцев | Обзор курса | |
| Анализ данных | 134 640 ₽ | 5500 ₽/мес. | 12 месяцев | Обзор курса | |
| Аналитик данных Перейти на сайт курса | 131 814 ₽ | 3662 ₽/мес. | 6 месяцев | Обзор курса | |
| Бизнес-аналитик: тариф Базовый Перейти на сайт курса | 109 900 ₽ | 4579 ₽/мес. | 6 месяцев | Обзор курса |
Больше программ — в полном каталоге курсов по аналитике и Data Science
Если пока не решили, куда двигаться, посмотрите подборку курсов по машинному обучению: там программы, которые начинаются с работы с данными и заканчиваются собственной обученной моделью. А если интереснее сторона моделей, а не таблиц, есть отдельная подборка курсов по нейросетям и искусственному интеллекту.
Чек-лист: 8 признаков мусорного датасета
Скачанный набор далеко не всегда пригоден. Пройдитесь по списку до того, как потратите неделю на обучение.
Проверка занимает минут двадцать: открыть файл, посмотреть описание, прогнать пару команд на подсчёт пропусков и дублей. Двадцать минут против недели впустую это выгодный обмен.
- Нет описания столбцов. Если непонятно, что означает колонка f_17, работать с ней вслепую бессмысленно.
- Сильный перекос классов без предупреждения. 99 % одного значения и 1 % другого требуют отдельной работы, о которой автор набора обычно молчит.
- Неизвестно, когда собраны данные. Поведение покупателей 2015 года мало говорит о поведении сегодняшних.
- Нет лицензии. Для учёбы терпимо, для продукта неприемлемо.
- Подозрительно ровные числа. Много круглых значений и повторяющихся строк намекают на сгенерированные данные вместо настоящих.
- Дубликаты между обучающей и тестовой частью. Если автор уже поделил датасет, проверьте пересечение: иначе тест соврёт в вашу пользу.
- Признак, который слишком хорошо предсказывает ответ. Точность 99 % на первой же попытке почти всегда означает утечку данных, а не удачу.
Датасет это фундамент всей работы с данными, и разбираться в нём стоит раньше, чем в моделях и метриках. Ближайший шаг занимает полчаса: откройте Kaggle, скачайте учебный набор «Титаник», посмотрите на столбцы и попробуйте угадать, какой из них таргет. Если угадали, значит эта статья сработала.




