Датасет: что это такое, зачем нужен и как его собрать

Датасет это набор данных, на котором учится любая нейросеть, и собрать первый можно в обычной таблице за вечер. Разобрали простыми словами, из чего он состоит, чем отличается от базы данных, где скачать готовые наборы бесплатно и какие российские порталы открытых данных работают в 2026 году. Плюс инструкция из шести шагов и чек-лист из восьми признаков, по которым мусорный датасет видно ещё до скачивания.
Статью написал:
Ваня Буявец, продюсер, основатель Checkroi
Ваня Буявец
Основатель Checkroi, продюсер, эксперт в выборе онлайн-курсов
Все 2448 статей автора Подписаться на Телеграм-канал
Одобрено экспертом:
Наташа Буявец, основатель Checkroi, эксперт по онлайн-курсам
Наташа Буявец
Основательница Checkroi, продюсер Youtube-каналов, эксперт по онлайн-курсам
Все 3108 экспертных мнений Подписаться на Телеграм-канал
Обложка: Датасет: что это такое, зачем нужен и как его собрать

Владелец кофейни хочет знать, сколько круассанов печь завтра. У него есть выгрузка чеков за два года: дата, время, погода, день недели, сколько продали. Ровно эта таблица и есть датасет. Отдайте её нейросети, и она научится угадывать завтрашний спрос точнее, чем чутьё бариста.

Слово «датасет» звучит так, будто за ним прячется что-то сложное и техническое. На деле это просто набор данных, собранный и приведённый в порядок так, чтобы с ним могла работать программа. Разберём, из чего он состоит, какие бывают типы, где скачать готовые наборы бесплатно и как собрать свой, даже если вы никогда не писали код.

Если вы ещё не разобрались с базой, начните с материала «Что такое нейросети и как они работают»: там объяснили, что вообще происходит внутри модели, когда ей скармливают данные.

Пригодится и разбор того, как устроено машинное обучение. Связь тут прямая: без датасета никакого обучения не будет вообще.

Статья пригодится не только программистам. С датасетами работают маркетологи, HR-специалисты, финансисты, врачи и владельцы небольшого бизнеса. Если хотите освоить это системно, загляните в подборку курсов по аналитике и Data Science: там 300 программ от коротких интенсивов до годовых.

Начнём с самого простого вопроса.

CheckroiCheckroiПодборка курсов по анализу данных347 курсов • 50 школСравните цены, школы, программу и найдите выгодные предложения по обучениюСравнить

Что такое датасет простыми словами

Датасет (от английского dataset, «набор данных») — это подготовленная коллекция данных об однотипных объектах, с которой может работать программа или аналитик. Чаще всего он выглядит как обычная таблица: каждая строка описывает один объект, каждый столбец — одну его характеристику.

Возьмём датасет клиентов интернет-магазина. В каждой строке один покупатель, в столбцах его характеристики: возраст, город, сколько заказов сделал, на какую сумму, вернулся ли за повторной покупкой. Тысяча покупателей даст тысячу строк.

Вернёмся к кофейне из начала статьи. Её датасет спроса выглядел бы примерно так:

Дата День недели Температура Осадки Продано круассанов
03.09 Среда +18 нет 84
04.09 Четверг +15 дождь 112
05.09 Пятница +17 нет 139
06.09 Суббота +21 нет 68

На четырёх строках не увидит закономерность и человек. Семьсот строк за два года уже показывают правила: в дождь берут больше, в выходные меньше, к пятнице спрос растёт. Человек эти правила тоже заметит, но на десятке признаков собьётся, а программа удержит все сразу.

Но таблицей дело не ограничивается. Датасетом может быть папка с 10 000 фотографий кошек и собак, где к каждому снимку приписано, кто на нём. Или архив из 50 000 отзывов с пометкой «положительный» или «отрицательный». Или записи голоса. Логика одна: много однотипных примеров, приведённых к общему виду.

Ключевое слово здесь: «подготовленная». Гора чеков в коробке под кассой это ещё не датасет. Датасетом она станет, когда данные оцифруют, сведут в одну структуру, уберут дубли и ошибки.

Короткое правило. Если данные лежат в одном месте, устроены одинаково и их можно открыть программой без ручного разбора, перед вами датасет. Если каждый файл приходится читать глазами и переписывать вручную, ещё нет.

Из чего состоит датасет: объекты, признаки и таргет

Рой показывает на таблицу с данными и объясняет, где строки, а где столбцы

У любого датасета есть три понятия, которые нужно знать. Без них дальше не двинуться. Звучат они страшнее, чем оказываются на практике.

Объект (или запись, строка). Единица информации, о которой мы что-то знаем. Один покупатель, одна фотография, один рабочий день кофейни, одна квартира на сайте объявлений.

Признак (по-английски feature, в русском жаргоне «фича»). Отдельная характеристика объекта. Для квартиры признаками будут площадь, этаж, район, год постройки, наличие балкона. В таблице признак это столбец.

Целевая переменная (таргет, target). Тот самый столбец, значение которого мы хотим научиться предсказывать. Для квартир это цена. Для покупателей: вернётся ли человек за второй покупкой. Для фотографий: что на них изображено.

Признаки бывают трёх сортов. Числовые: площадь 54 м², возраст 35 лет. Категориальные: район, цвет, марка машины (значение из ограниченного списка). Текстовые: сам отзыв, описание вакансии, комментарий.

Модель учится на связке «признаки → таргет». Вы показываете ей тысячу квартир с известной ценой, она нащупывает закономерность, а потом по новой квартире без цены выдаёт свою оценку.

Чем датасет отличается от базы данных и обычной таблицы Excel

Вопрос всплывает у каждого второго новичка, и путаница законная: внешне всё похоже.

База данных — это хранилище, живущее своей жизнью. Оно постоянно меняется: клиент оформил заказ, и в базе появилась новая запись. Задача базы в том, чтобы быстро находить и обновлять информацию прямо сейчас.

Датасет — это снимок данных, зафиксированный на определённый момент и заточенный под конкретную задачу. Его выгружают из базы, приводят в порядок и после этого не трогают. Пока модель учится, датасет остаётся прежним, иначе результаты не с чем будет сравнивать.

Таблица в Excel вполне может быть датасетом, если в ней порядок. Формат тут ни при чём, всё решают размер и аккуратность. Лист Excel жёстко ограничен 1 048 576 строками, а тормозить начинает задолго до этого предела. И данные в нём люди обычно ведут вольно: то «Москва», то «москва», то «МСК» в одном столбце.

Разница практическая, а не философская. Базу вы спрашиваете о том, что происходит сейчас. Датасет вы отдаёте модели, чтобы она нашла закономерность на прошлом.

Канал основателя Checkroi Вани Буявца3 700 человек читают мой Телеграм-канал про нейросетиСобрал промпты для Claude Code и ChatGPT, разборы ИИ-инструментов и лайфхаки по продвижению бизнеса в одном местеПрисоединиться

Какие бывают датасеты

Разные типы данных разложены на столе: таблица, фотографии, звуковая дорожка и график

Данные делят по тому, что внутри. От типа зависит и формат файла, и инструменты, и то, сколько данных понадобится.

Тип датасета Что внутри Типичная задача Формат файла
Табличный Строки и столбцы с числами и категориями Предсказать цену, отток клиентов, спрос CSV, Excel, Parquet
Текстовый Отзывы, письма, статьи, диалоги Определить тональность, ответить на вопрос JSON, TXT, CSV
Изображения Фото и картинки с подписями Узнать объект на снимке, найти брак на детали JPG, PNG плюс файл разметки
Аудио Записи речи, музыки, шумов Распознать речь, определить эмоцию по голосу WAV, MP3 плюс расшифровки
Временной ряд Значения, привязанные к моментам времени Спрогнозировать продажи, курс, нагрузку CSV, Parquet
Граф Объекты и связи между ними Найти сообщества в соцсети, выявить мошенников Специальные форматы, JSON

Есть и второе деление, о котором стоит знать. Структурированные данные ложатся в таблицу без потерь: возраст, сумма, город. Неструктурированные в клетку не помещаются: текст письма, видео, скан документа. Примерно 80 % всех данных в мире относятся ко второй категории, и именно с ними работают нейросети последних лет.

Про форматы файлов коротко. CSV самый простой: это текстовый файл, где значения разделены запятыми, открывается чем угодно, включая Excel. JSON удобен, когда структура сложная и вложенная. Parquet сжимает данные в разы и нужен, когда строк миллионы. Новичку хватит CSV.

Отдельно про большие данные: Big Data это не синоним датасета. Так называют объёмы, которые не влезают на один компьютер и требуют распределённых систем. Обычный рабочий датасет чаще всего помещается в оперативную память ноутбука.

Где брать готовые датасеты: 12 проверенных источников

Собирать данные с нуля нужно далеко не всегда. Для учёбы, пробы гипотезы или пет-проекта проще взять готовое. Ниже площадки, которые работают и не требуют денег.

Мировые площадки

Kaggle (kaggle.com/datasets). Больше 400 тысяч наборов на любую тему, от цен на жильё до снимков МРТ. Главный плюс для новичка в том, что к популярным датасетам приложены чужие решения в виде тетрадок с кодом: можно посмотреть, как задачу решали другие. Здесь же лежат учебная классика вроде «Титаника» и Iris.

Hugging Face (huggingface.co/datasets). Основная площадка для всего, что связано с текстом и языковыми моделями. Наборы качаются одной строчкой кода, есть предпросмотр прямо в браузере и много русскоязычных данных.

Google Dataset Search (datasetsearch.research.google.com). Здесь ничего не хранится: сервис ищет наборы данных по всему интернету и ведёт на первоисточник. Когда не знаете, где искать, начинайте отсюда.

UCI Machine Learning Repository (archive.ics.uci.edu). Академический архив, живущий с 1987 года. Наборы небольшие и чистые, идеальны для первых учебных экспериментов.

ImageNet (image-net.org) и MS COCO (cocodataset.org). Два кита компьютерного зрения: миллионы размеченных фотографий, на которых обучалось большинство современных моделей распознавания.

MNIST это 70 тысяч картинок рукописных цифр размером 28×28 пикселей. Самый затасканный учебный датасет в истории, и это комплимент: на нём удобно проверять, что вы всё поняли правильно.

Русские открытые данные

Здесь у большинства статей провал: все перечисляют Kaggle и забывают, что российских данных там мало. А для задач про наш рынок нужны именно они.

Росстат и ЕМИСС (fedstat.ru). Официальная статистика по стране: население, зарплаты, цены, производство, демография по регионам. Выгружается в Excel и CSV.

Портал открытых данных (data.gov.ru). Общая витрина наборов от федеральных и региональных ведомств.

Банк России (cbr.ru/statistics). Курсы валют, ставки, банковская статистика с многолетней историей. Отличная база для учебных проектов по временным рядам.

Открытые данные Москвы (data.mos.ru). Больше семисот наборов по городу: транспорт, здравоохранение, культура, коммунальное хозяйство. Один из самых живых и регулярно обновляемых российских порталов.

Каталог каталогов (datacatalogs.ru). Сводный указатель российских источников данных: госпорталы, научные репозитории, отраслевые базы.

Источник Объём Язык данных Регистрация Кому подойдёт
Kaggle 400 тыс.+ наборов В основном английский Нужна Учёба, пет-проекты, соревнования
Hugging Face 250 тыс.+ наборов Много языков, есть русский Не нужна для скачивания Тексты, речь, работа с моделями
Google Dataset Search Поиск по всему интернету Любой Не нужна Когда не знаете, где искать
UCI Repository Около 700 наборов Английский Не нужна Первые учебные эксперименты
Росстат, data.gov.ru Тысячи наборов Русский Не нужна Задачи про российский рынок
Банк России Сотни рядов Русский Не нужна Финансы, временные ряды

Как читать лицензию и не нарваться

У каждого датасета есть условия использования, и их пропускают чаще всего. Пока вы учитесь, риск нулевой. Как только результат уходит в коммерческий продукт, лицензия становится вопросом денег.

Три формулировки, которые нужно узнавать в лицо. CC BY и подобные разрешают почти всё, включая коммерцию, но требуют указать автора. Non-commercial или research only прямо запрещают зарабатывать: такой датасет годится для диплома и не годится для сервиса за деньги. Отсутствие лицензии многие читают как «можно всё». На деле она читается как «прав вам никто не давал».

Про персональные данные. В России их оборот регулирует 152-ФЗ. Собирать ФИО, телефоны, адреса и медицинские сведения без согласия людей нельзя, даже если технически данные лежат в открытом доступе. Для учебной задачи проще брать обезличенные наборы, где личности заменены на номера.

CheckroiCheckroiПодборка курсов по машинному обучению156 курсов • 28 школСравните цены, школы, программу и найдите выгодные предложения по обучениюСравнить

Зачем нужен датасет: как на нём учится модель

Модель не понимает мир, она ищет статистические закономерности в примерах. Датасет и есть эти примеры. Дальше всё зависит от того, есть ли в нём правильные ответы.

Обучение с учителем. В датасете рядом с признаками лежит таргет: правильный ответ. Тысяча отзывов, где у каждого проставлена метка «хвалят» или «ругают». Модель прогоняет их через себя, ошибается, подстраивается и в итоге начинает угадывать тональность нового отзыва, которого раньше не видела. Так работает большинство прикладных задач бизнеса.

Обучение без учителя. Правильных ответов нет, модель ищет структуру сама. Загрузили в неё покупателей магазина без всяких меток, и она разбила их на группы: экономные, импульсивные, оптовые. Никто заранее не говорил, что групп должно быть три и какие они. Это полезно, когда вы сами не знаете, что ищете.

Есть и третий подход, обучение с подкреплением, где готового датасета нет вовсе: программа действует в среде, получает награду за удачные ходы и накапливает опыт сама. Так учат играть в шахматы и управлять роботами. Для прикладных бизнес-задач он применяется редко, поэтому в статьях про датасеты его обычно и не встретишь.

Отсюда простой вывод: качество датасета важнее модели. Хороший алгоритм на плохих данных даст плохой результат, а средний алгоритм на чистых данных даст приличный. Специалисты называют это правилом «мусор на входе, мусор на выходе», и оно не устаревает.

Как собрать свой датасет за 6 шагов

Дальше идёт та часть работы, которую в вакансиях называют подготовкой данных, и на неё уходит основная часть времени в проекте. Если примеряете это как профессию, посмотрите, сколько зарабатывает аналитик данных и из чего складывается вилка по грейдам.

Рой раскладывает карточки по стопкам и размечает данные

Готового набора под вашу задачу может просто не быть. Особенно если задача узкая: спрос на круассаны именно в вашей кофейне никто до вас не оцифровывал.

Шаг 1: сформулируйте, что хотите предсказать

Сбор идёт вторым номером. Первым идёт вопрос. «Хочу понять клиентов» это не задача. «Хочу по первому заказу предсказать, вернётся ли покупатель в течение трёх месяцев» уже задача: понятно, что такое объект (покупатель), что такое таргет (вернулся или нет) и какие признаки нужны.

Пока формулировки нет, любой сбор превратится в накопление файлов, из которых потом ничего не соберётся.

Шаг 2: соберите данные

Четыре рабочих источника, от простого к сложному.

  • То, что уже есть. Выгрузка из CRM, отчёт из кассовой программы, таблица откликов на вакансию, статистика сайта. Начинайте отсюда: это бесплатно и легально.
  • Открытые данные. Порталы из раздела выше.
  • Опросы и формы. Google Формы или Яндекс Формы соберут структурированные ответы сразу в таблицу.
  • Парсинг (веб-скрейпинг). Автоматический сбор информации со страниц сайтов. Для новичка есть готовые сервисы без кода, программисты пишут скрипты на Python. Здесь же главная юридическая ловушка: пользовательское соглашение многих сайтов запрещает автоматический сбор, а персональные данные людей парсить нельзя в любом случае.
  • CheckroiCheckroiПодборка курсов по Python561 курс • 46 школСравните цены, школы, программу и найдите выгодные предложения по обучениюСравнить

Шаг 3: разметьте данные

Разметка (аннотация) — это добавление правильных ответов к сырым данным. Человек смотрит фотографию и пишет «кошка». Читает отзыв и ставит «негатив». Обводит рамкой дефект на детали.

Шаг самый скучный и самый дорогой: на него уходит львиная доля бюджета любого проекта. Небольшой объём размечают руками или силами коллег. Тысячи примеров отдают на краудсорсинговые платформы, где задание выполняют исполнители за небольшую плату.

Одно правило спасает больше всего проектов: напишите инструкцию до начала разметки и проверьте её на полусотне примеров. Если два человека по одной инструкции ставят разные метки, инструкция плохая, и переделывать придётся всё.

Шаг 4: очистите и подготовьте данные

Сырые данные всегда грязные, и очистка данных обычно занимает больше времени, чем само обучение модели. Что искать в первую очередь:

  • Пропуски. Пустые ячейки заполняют средним значением, заглушкой или выбрасывают строку целиком.
  • Дубликаты. Одна и та же запись, попавшая дважды, перекашивает обучение.
  • Разнобой в написании. «Москва», «москва» и «МСК» для программы это три разных города.
  • Выбросы. Возраст 200 лет или цена в один рубль обычно означают опечатку.
  • Единицы измерения. Смешивать рубли с долларами и метры с футами в одном столбце нельзя.

Шаг 5: поделите на выборки

Готовый датасет режут на части, чтобы честно проверить модель. Подробности в следующем разделе.

Шаг 6: проверьте на маленькой модели

До того как вкладываться в масштаб, обучите что-нибудь простое на первой тысяче строк. Если результат чуть лучше случайного угадывания, значит сигнал в данных есть и собирать дальше имеет смысл. Если результат на уровне подбрасывания монетки, проблема в признаках, и увеличение объёма её не вылечит.

Версия для тех, кто не пишет код. Первый датасет спокойно собирается в Google Таблицах: столбцы это признаки, строки это объекты, последний столбец это правильный ответ. Скачиваете файл в формате CSV, и он готов к работе. Python с библиотекой Pandas понадобится позже, когда строк станет больше сотни тысяч.

CheckroiCheckroiПодборка курсов по Pandas108 курсов • 23 школыСравните цены, школы, программу и найдите выгодные предложения по обучениюСравнить
Ваня БуявецКанал основателя Checkroi Вани БуявцаЗабирайте промпты и обучение по нейросетям в моём Телеграм-каналеБольше 3 700 человек уже применяют Claude Code, ChatGPT и другие нейросети в работе, учёбе, бизнесе и жизниПерейти в канал

Сколько данных нужно и как делить на выборки

Вопрос «сколько строк достаточно» задают чаще всех остальных, и честный ответ звучит неудобно: зависит от задачи. Но ориентиры есть.

Для простой табличной задачи вроде предсказания оттока клиентов начинают с нескольких тысяч строк. Классическому распознаванию изображений с нуля нужны десятки тысяч размеченных снимков. Языковым моделям требуются миллиарды слов, поэтому их с нуля никто и не обучает.

Хорошая новость в том, что второй вариант почти всегда лишний. Есть дообучение готовой модели (по-английски transfer learning): вы берёте нейросеть, уже обученную на миллионах примеров, и показываете ей свои несколько сотен. Для распознавания брака на конвейере или сортировки договоров хватает 200–500 примеров на каждый класс.

И отдельно про качество против количества. Тысяча аккуратно размеченных примеров почти всегда бьёт десять тысяч, размеченных наспех разными людьми по разным правилам. Когда бюджет ограничен, вкладывайте его в единую инструкцию и перепроверку спорных случаев, а не в объём.

Теперь про деление. В англоязычных руководствах эту процедуру называют train/test split, и датасет в ней разбивают на три части:

  • Обучающая выборка (train), около 70 %. На ней модель учится.
  • Валидационная (validation), около 15 %. На ней подбирают настройки и сравнивают варианты.
  • Тестовая (test), около 15 %. Её прячут до самого конца и достают один раз, чтобы узнать честное качество.

Зачем такие сложности? Из-за переобучения. Модель умеет запоминать примеры вместо того, чтобы улавливать закономерность. На знакомых данных она покажет блестящий результат, на новых провалится. Тест на спрятанной части ловит этот самообман.

Вторая ловушка называется утечкой данных. Это когда в признаки случайно попала информация, которой в момент предсказания ещё не существует. Классический пример: модель предсказывает, вернётся ли клиент, а среди столбцов лежит «дата второго заказа». Точность получается фантастическая, польза нулевая.

Третья беда это дисбаланс классов. Если мошеннических транзакций 0,1 %, модель научится всегда отвечать «всё честно» и будет права в 99,9 % случаев, оставаясь бесполезной. Лечится взвешиванием классов или досбором редких примеров.

Кто работает с датасетами и сколько зарабатывает

Команда специалистов работает с данными в общем светлом офисе

Данные проходят через руки нескольких специальностей, и порог входа у них разный.

Разметчик данных. Самый низкий порог: смотрит примеры и проставляет метки. Опыт и образование не нужны, ставка почасовая или сдельная. Многие приходят в сферу именно отсюда.

Аналитик данных. Собирает датасеты, чистит их, ищет закономерности и объясняет бизнесу, что происходит. Инструменты: SQL, Excel, Python, системы визуализации. Порог входа умеренный, спрос стабильный. Как выглядит путь с нуля, разобрали в материале «Как стать аналитиком данных».

Data scientist, он же дата-сайентист. Строит на датасетах модели, которые что-то предсказывают. Нужны математика, статистика и Python. Планка выше, доход тоже.

AI-инженер. Доводит модель до работающего сервиса и следит, чтобы она не деградировала на реальных данных.

Актуальные вилки по рынку мы собрали отдельно в обзоре зарплат аналитика данных.

Где научиться работать с данными

Собрать первый датасет можно за вечер по этой статье. Дальше начинается то, что по обрывкам не осваивается: статистика, чистка данных, метрики качества, работа с пропусками. Систематический курс экономит месяцы блужданий, потому что даёт задачи в правильном порядке и живого проверяющего, который укажет на ошибку.

КурсШколаСтоимость со скидкойВ рассрочкуДлитель­ностьОбзор курса от Checkroi
Профессия «Бизнес-аналитик»
Перейти на сайт курса
SkillboxSkillbox105 680 ₽5393 ₽/мес.8 месяцевОбзор курса
Профессия «Data Scientist PRO»
Перейти на сайт курса
SkillboxSkillbox224 595 ₽7245 ₽/мес.12 месяцевОбзор курса
Профессия «Аналитик данных с нуля до middle»
Перейти на сайт курса
НетологияНетология145 600 ₽6066 ₽/мес.12 месяцевОбзор курса
Профессия «Аналитик данных»
Перейти на сайт курса
НетологияНетология101 000 ₽4156 ₽/мес.8 месяцевОбзор курса
Системный аналитик с нуля
Перейти на сайт курса
SkillboxSkillbox71 750 ₽5979 ₽/мес.6 месяцевОбзор курса
Аналитик данных с нуля
Перейти на сайт курса
SkillboxSkillbox126 936 ₽4994 ₽/мес.4 месяцаОбзор курса
Data Scientist
Перейти на сайт курса
Академия ЭдюсонЭдюсон109 900 ₽4579 ₽/мес.9 месяцевОбзор курса
Анализ данныхSkyproSkypro134 640 ₽5500 ₽/мес.12 месяцевОбзор курса
Аналитик данных
Перейти на сайт курса
SkillFactorySkillFactory131 814 ₽3662 ₽/мес.6 месяцевОбзор курса
Бизнес-аналитик: тариф Базовый
Перейти на сайт курса
Академия ЭдюсонЭдюсон109 900 ₽4579 ₽/мес.6 месяцевОбзор курса

Больше программ — в полном каталоге курсов по аналитике и Data Science

Если пока не решили, куда двигаться, посмотрите подборку курсов по машинному обучению: там программы, которые начинаются с работы с данными и заканчиваются собственной обученной моделью. А если интереснее сторона моделей, а не таблиц, есть отдельная подборка курсов по нейросетям и искусственному интеллекту.

Чек-лист: 8 признаков мусорного датасета

Скачанный набор далеко не всегда пригоден. Пройдитесь по списку до того, как потратите неделю на обучение.

Проверка занимает минут двадцать: открыть файл, посмотреть описание, прогнать пару команд на подсчёт пропусков и дублей. Двадцать минут против недели впустую это выгодный обмен.

  1. Нет описания столбцов. Если непонятно, что означает колонка f_17, работать с ней вслепую бессмысленно.
  2. Пропусков больше трети. Заполнять половину таблицы средними значениями означает придумывать данные.
  3. Сильный перекос классов без предупреждения. 99 % одного значения и 1 % другого требуют отдельной работы, о которой автор набора обычно молчит.
  4. Неизвестно, когда собраны данные. Поведение покупателей 2015 года мало говорит о поведении сегодняшних.
  5. Нет лицензии. Для учёбы терпимо, для продукта неприемлемо.
  6. Подозрительно ровные числа. Много круглых значений и повторяющихся строк намекают на сгенерированные данные вместо настоящих.
  7. Дубликаты между обучающей и тестовой частью. Если автор уже поделил датасет, проверьте пересечение: иначе тест соврёт в вашу пользу.
  8. Признак, который слишком хорошо предсказывает ответ. Точность 99 % на первой же попытке почти всегда означает утечку данных, а не удачу.

Датасет это фундамент всей работы с данными, и разбираться в нём стоит раньше, чем в моделях и метриках. Ближайший шаг занимает полчаса: откройте Kaggle, скачайте учебный набор «Титаник», посмотрите на столбцы и попробуйте угадать, какой из них таргет. Если угадали, значит эта статья сработала.

Часто задаваемые вопросы

Чем датасет отличается от базы данных?

База данных это живое хранилище, которое постоянно меняется: клиент оформил заказ, и в базе появилась новая запись. Датасет это снимок данных на конкретный момент, выгруженный под определённую задачу и зафиксированный. Пока модель учится, датасет не меняется, иначе результаты нельзя будет сравнить между собой.

Сколько строк нужно, чтобы датасет считался достаточным?

Зависит от задачи. Для простой табличной задачи вроде предсказания оттока клиентов начинают с нескольких тысяч строк. Для распознавания изображений с нуля нужны десятки тысяч размеченных снимков. Но при дообучении готовой модели (transfer learning) хватает 200–500 примеров на каждый класс. Качество разметки почти всегда важнее объёма.

Где скачать датасет бесплатно?

Мировые площадки: Kaggle, Hugging Face, Google Dataset Search и UCI Machine Learning Repository. Российские данные ищите на fedstat.ru (Росстат), data.gov.ru, data.mos.ru и на сайте Банка России.

Можно ли собрать датасет без программирования?

Да. Первый датасет спокойно собирается в Google Таблицах или Excel: столбцы это признаки, строки это объекты, последний столбец это правильный ответ. Дальше файл сохраняется в формате CSV и готов к работе. Python с библиотекой Pandas понадобится, когда строк станет больше сотни тысяч или когда данные придётся собирать автоматически.

Что такое разметка данных и обязательно ли её делать?

Разметка это добавление правильных ответов к сырым данным: человек смотрит фотографию и пишет «кошка», читает отзыв и ставит метку «негатив». Она нужна для обучения с учителем, то есть для большинства прикладных задач. Для обучения без учителя, где модель ищет группы в данных сама, разметка не требуется.

Можно ли парсить сайты, чтобы собрать датасет?

Технически да, юридически с оговорками. Пользовательское соглашение многих сайтов прямо запрещает автоматический сбор, а персональные данные людей (ФИО, телефоны, адреса) собирать без их согласия нельзя по 152-ФЗ, даже если они лежат в открытом доступе. Для учебных задач безопаснее брать готовые обезличенные наборы с открытых порталов.

Зачем датасет делят на train и test?

Чтобы честно проверить модель. Модель умеет запоминать примеры вместо того, чтобы улавливать закономерность, и на знакомых данных покажет блестящий результат. Тестовую часть (обычно 15 % данных) прячут до самого конца и достают один раз, чтобы узнать реальное качество на данных, которых модель не видела. Ещё около 15 % отводят под валидационную выборку для подбора настроек.

Как понять, что скачанный датасет плохой?

Тревожные признаки: нет описания столбцов, пропусков больше трети, неизвестна дата сбора данных, отсутствует лицензия, много подозрительно круглых и повторяющихся значений. Отдельный сигнал это точность 99 % на первой же попытке: почти всегда она означает утечку данных, когда в признаки попала информация, которой в момент предсказания ещё не существует.

Читайте Checkroi первым в Google
Добавьте Checkroi в избранные источники — и наши разборы курсов и обзоры школ будут показываться выше в вашей выдаче Google.
Оставить комментарий
0 комментариев
Форма комментария

Оставьте комментарий

Напишите, что думаете. Нам важно ваше мнение!