Термины · Данные

Что такое датасет: 7 ответов и 5 способов его испортить

Про модели спорят все, про данные почти никто, хотя именно данные решают, чему модель научится и где ошибётся. Разобрали, из чего состоит датасет, где брать готовые, что делать с персональными данными и лицензиями и пять типичных способов испортить набор до того, как обучение началось.

Кирилл СандаковКирилл СандаковВайбкодер, предприниматель, продюсерОпубликовано 16.09.202611 мин чтения

Слово встречается в каждом разговоре про обучение, и почти всегда без объяснения. Датасет это структурированный набор примеров, на котором учится модель: таблица, папка изображений, корпус текстов или записей, где у каждого примера есть признаки, а у размеченного датасета ещё и правильный ответ.

Цифры сверены по первоисточникам, открытым 16 сентября 2026 года: страница проекта ImageNet, обзорная страница Common Crawl и раздел каталога Hugging Face. Дальше по порядку: из чего состоит набор, чем размеченный отличается от неразмеченного, как его делят на части, где брать готовые, что с лицензиями и персональными данными, пять способов испортить набор и короткая инструкция по сборке своего.

Главное в одну строку

Практическое правило, которое экономит больше всего времени: слабая модель на хороших данных почти всегда обгоняет сильную модель на грязных.


Часть 1 · Ответ

Что такое датасет простыми словами

  • Простое определение. Набор примеров одного рода, собранный так, чтобы по нему можно было чему-то научиться.
  • Пример из жизни. Таблица квартир с площадью, этажом, районом и ценой. Признаки это первые три столбца, целевая переменная это цена.
  • Пример из зрения. Папка снимков, где у каждого проставлен класс или рамка вокруг объекта.
  • Пример из текста. Корпус отзывов, где у каждого отзыва проставлена тональность.
  • Чего датасет не значит. Просто куча файлов на диске это ещё не набор данных: без структуры и разметки учить на нём нечему.

Часть 2 · Структура

Из чего состоит набор данных

  1. Объект. Одна строка, один снимок, одна запись. То, про что делается предсказание.
  2. Признаки. Всё, что известно про объект до предсказания: площадь, возраст, пиксели, слова.
  3. Целевая переменная. Правильный ответ, если он есть: цена, класс, тональность, координаты.
  4. Метаданные. Откуда взялось, когда собрано, кем размечено, под какой лицензией.
  5. Схема. Описание того, какие столбцы есть и что означает каждое значение. Без неё набор умирает через полгода после автора.

Часть 3 · Разметка

Чем размеченный датасет отличается от неразмеченного

Это различие определяет, каким способом вообще можно учиться на наборе. Разметка стоит дорого и делается людьми, поэтому её объём почти всегда и есть главное ограничение проекта.

Три состояния данных и что с ними можно делать, сентябрь 2026
СостояниеЧто есть в набореКакое обучение возможно
Размеченныйпризнаки и правильные ответыс учителем: классификация, регрессия
Неразмеченныйтолько признакибез учителя: кластеры, аномалии, сжатие
Частично размеченныйответы у малой долиполуавтоматическое, разметка дообучается
Среда вместо наборасостояния и наградас подкреплением, данные порождаются на ходу

Часть 4 · Разбиение

Зачем набор делят на три части

  • Обучающая часть. На ней модель настраивает параметры. Обычно самая большая.
  • Валидационная часть. На ней подбирают настройки самого обучения и сравнивают варианты.
  • Тестовая часть. Её модель не видит до самого конца. Только она даёт честную оценку.
  • Главная ошибка новичка. Подсматривать в тест при подборе настроек. После этого цифра качества перестаёт что-либо значить.
  • Вторая ошибка. Делить случайно там, где данные связаны по времени: модель будет учиться на будущем и предсказывать прошлое.

Часть 5 · Источники

Где брать готовые наборы данных

Из первоисточника, страница проекта ImageNet, открыта 16.09.2026

На главной странице указано: 14 197 122 изображения и 21 841 синсет. Набор организован по иерархии WordNet, где каждое понятие описывается синсетом, то есть набором синонимов. Проект описан как продолжающееся исследовательское усилие по обеспечению исследователей данными для обучения моделей распознавания объектов в большом масштабе.

  • Каталоги наборов. Hugging Face и Kaggle: фильтры по задаче, языку, размеру и формату, доступны из России, 200 на 16.09.2026.
  • Классические наборы зрения. ImageNet для классификации, COCO для детекции, ключевых точек и сегментации.
  • Веб-корпуса. Common Crawl: по описанию на сайте корпус содержит петабайты данных, собираемых регулярно с 2008 года, последний срез на 16.09.2026 обозначен как CC-MAIN-2026-34.
  • Государственные и отраслевые порталы. Открытые данные, статистика, реестры. Качество разное, лицензии надо читать отдельно.
  • Свои данные. Выгрузки из вашей же системы почти всегда полезнее чужого набора, потому что совпадают с задачей.

Часть 6 · Права

Что проверить в лицензии до того, как качать

  1. Разрешено ли коммерческое использование. Это первый вопрос и самый частый сюрприз.
  2. Разрешено ли обучение моделей. Часть наборов допускает исследование и запрещает продуктовое применение.
  3. Требуется ли указание автора. И в каком именно виде.
  4. Наследуется ли лицензия. Некоторые условия распространяются на всё, что вы сделали на основе набора.
  5. Чужие права внутри набора. Изображения людей, логотипы, тексты под охраной. Лицензия на сборник не снимает прав на его элементы.

Общая правовая рамка для сгенерированного и для обучения на чужом материале разобрана в гайде про авторское право и нейросети.


Часть 7 · Закон

Что делать, если в наборе есть люди

Из первоисточника, закон № 152-ФЗ в редакции от 26.07.2026, открыт 16.09.2026

Статья 11 относит к биометрическим персональным данным сведения о физиологических и биологических особенностях человека, на основании которых можно установить его личность, если оператор использует их именно для установления личности; их обработка требует согласия в письменной форме, кроме перечня исключений части 2. Статья 16 запрещает принимать решения, затрагивающие права человека, исключительно на основании автоматизированной обработки, кроме случаев письменного согласия или прямого указания федерального закона.

  • Практический вывод. Набор с лицами, голосами и фамилиями это не просто файлы, а обработка персональных данных со всеми обязанностями оператора.
  • Обезличивание. Убирает не только имя, но и связки, по которым человека можно восстановить: номер договора, точный адрес, редкое сочетание признаков.
  • Правило перед загрузкой в публичный сервис. Что нельзя отправлять в чужую модель, разобрано в гайде про данные и нейросети.

Часть 8 · Ошибки

Пять способов испортить набор до начала обучения

  1. Утечка ответа в признаки. В таблице есть столбец, который существует только потому, что ответ уже известен. Модель покажет блестящее качество и рассыплется в бою.
  2. Перекос классов. Девяносто девять примеров одного класса на один пример другого. Модель научится всегда отвечать первым и формально не ошибётся.
  3. Дубликаты между частями. Один и тот же пример попал и в обучение, и в тест. Оценка завышена, и вы об этом не узнаете.
  4. Смещение в сборе. Все снимки сделаны одной камерой в одном помещении. Модель выучит помещение, а не объект.
  5. Разная разметка у разных людей. Два разметчика понимают класс по-разному. Потолок качества модели упирается в согласованность людей, а не в архитектуру.

Правило одной строки

Если качество на тесте подозрительно высокое, сначала ищите утечку и дубликаты, а не радуйтесь. В девяти случаях из десяти виноват набор, а не удачная архитектура.


Часть 9 · Практика

Как собрать свой набор за выходные

  1. Сформулируйте предсказание одной строкой. Что подаём на вход и что хотим на выходе. Без этого собирать нечего.
  2. Определите объект. Строка, снимок, документ, сессия. От этого зависит всё остальное.
  3. Соберите сто примеров вручную. Сто честных примеров скажут про задачу больше, чем десять тысяч скачанных.
  4. Напишите инструкцию разметчику. Даже если разметчик это вы. Инструкция ловит разночтения раньше, чем они попадут в данные.
  5. Разметьте и перепроверьте пересечением. Двадцать примеров, размеченных дважды, покажут реальную согласованность.
  6. Зафиксируйте схему и лицензию. Один файл описания рядом с данными экономит недели через полгода.
  7. Разделите на части до первого обучения. И больше не трогайте тестовую часть.

Если следующим шагом идёт своя модель, порядок действий и развилки собраны в гайде про создание своей нейросети.


Часть 10 · Форматы

В каком виде обычно лежат данные

  • CSV. Простые таблицы, читается всем, ломается на кавычках и запятых внутри значений.
  • Parquet. Колоночный формат, заметно компактнее и быстрее на больших таблицах.
  • JSON и JSONL. Вложенные структуры и построчные записи, удобно для текстовых корпусов.
  • Папки с изображениями. Классы папками либо отдельный файл разметки с координатами.
  • Архивы веб-обхода. WARC и производные от него: сырой ответ сервера вместе с заголовками.

Памятка

Что запомнить про датасеты

Коротко

  • Датасет это структурированный набор примеров, а не просто папка файлов.
  • Объект, признаки, целевая переменная, метаданные и схема: пять обязательных частей.
  • Разметка определяет, каким способом вообще можно учиться на наборе.
  • Тестовую часть не трогают до самого конца, иначе цифра качества ничего не значит.
  • ImageNet содержит 14 197 122 изображения и 21 841 синсет.
  • Common Crawl собирает веб-корпус регулярно с 2008 года, срез на 16.09.2026 это CC-MAIN-2026-34.
  • Лицензия на сборник не снимает прав на его элементы.
  • Набор с лицами и фамилиями это обработка персональных данных со всеми обязанностями.
  • Утечка ответа в признаки даёт блестящий тест и провал в бою.
  • Слабая модель на хороших данных обгоняет сильную на грязных.

Источники

Что проверялось живьём и когда

  • Страница проекта ImageNet, image-net.org, открыта 16.09.2026: 14 197 122 изображения, 21 841 синсет, организация по иерархии WordNet, определение синсета.
  • Обзорная страница Common Crawl, commoncrawl.org, открыта 16.09.2026: корпус содержит петабайты данных, собираемых регулярно с 2008 года; на странице последнего обхода указан срез CC-MAIN-2026-34.
  • Каталог наборов данных Hugging Face, huggingface.co, открыт 16.09.2026: фильтры по размеру и формату, включая json, csv, parquet, webdataset и папки изображений.
  • Проект COCO, cocodataset.org, открыт 16.09.2026: задачи детекции, ключевых точек, сегментации и описания изображений.
  • Федеральный закон от 27.07.2006 № 152-ФЗ в редакции от 26.07.2026, статьи 11 и 16, consultant.ru, открыты 16.09.2026.
  • Коды ответа с московского адреса без VPN, 16.09.2026: 200 у image-net.org, cocodataset.org, commoncrawl.org, huggingface.co, kaggle.com, consultant.ru.
  • Wordstat, Россия, 16.09.2026: датасет 11 979, датасет данные 977, датасеты скачать 553, датасет для обучения 508, признаки датасета 265, датасет нейросети 241, kaggle датасеты 219.
  • Выдача Яндекса по запросу «что такое датасет», 16.09.2026: kurshub.ru, sky.pro, blog.skillfactory.ru, datalopata.ru, productstar.ru, habr.com, thecode.media, gb.ru; Википедия только одиннадцатой.

Чего тут нет намеренно: рейтинга площадок с наборами данных и советов, где скачать чужие корпуса в обход лицензии. Первое устаревает за месяц, второе создаёт проблему вместо того, чтобы её решать. Цен на разметку тоже нет: они зависят от задачи так сильно, что средняя цифра вводит в заблуждение.


FAQ

Частые вопросы

Что такое датасет простыми словами

Это структурированный набор примеров, на котором учится модель. У каждого примера есть признаки, то есть всё, что известно про него заранее, а у размеченного набора ещё и правильный ответ. Таблица квартир с ценами, папка снимков с классами и корпус отзывов с тональностью это три типичных датасета.

Чем размеченный датасет отличается от неразмеченного

В размеченном у каждого примера проставлен правильный ответ, и на таком наборе возможно обучение с учителем: классификация и регрессия. В неразмеченном есть только признаки, и работать с ним можно методами без учителя: кластеризация, поиск аномалий, снижение размерности.

Зачем делить датасет на обучающую и тестовую части

Чтобы оценка качества была честной. Модель настраивается на обучающей части, настройки обучения подбираются на валидационной, а тестовая часть не показывается до самого конца. Если подсматривать в тест при подборе, итоговая цифра перестаёт что-либо означать за пределами этого набора.

Где взять готовые датасеты

В каталогах наборов данных вроде Hugging Face и Kaggle, в классических академических наборах вроде ImageNet и COCO, в веб-корпусах вроде Common Crawl и на порталах открытых данных. На 16 сентября 2026 года все перечисленные ресурсы открываются с российского адреса без VPN.

Сколько данных нужно, чтобы обучить модель

Зависит от задачи и от того, учите ли вы модель с нуля или дообучаете готовую. Для дообучения под узкую задачу часто хватает сотен примеров. Для обучения с нуля счёт идёт на десятки и сотни тысяч. Практичнее начать со ста честных примеров и посмотреть, где модель ломается.

Можно ли использовать чужой датасет в коммерческом проекте

Только если это разрешает его лицензия, и проверять надо два уровня. Первый это условия самого сборника, второй это права на его элементы: изображения людей, логотипы, тексты под охраной. Лицензия на набор не снимает прав, которые есть у авторов входящих в него материалов.

Что делать, если в датасете есть персональные данные

Считать это обработкой персональных данных со всеми обязанностями оператора и обезличивать всерьёз. Обезличивание убирает не только имя, но и связки, по которым человека можно восстановить: номер договора, точный адрес, редкое сочетание признаков. Для биометрии закон требует согласия в письменной форме.

Почему модель хорошо работает на тесте и плохо в реальности

Чаще всего виноват набор, а не архитектура. Три типичные причины: утечка ответа в признаки, дубликаты между обучающей и тестовой частью и смещение в сборе, когда все примеры собраны в одинаковых условиях. Модель выучила условия сбора, а не саму задачу.

Что такое утечка данных в датасете

Это ситуация, когда среди признаков есть информация, которой в момент предсказания ещё не существует. Например столбец, который заполняется только после наступления события. Модель опирается на него, показывает отличное качество на тесте и полностью разваливается на реальных данных.

Как понять, что датасет плохой

По трём быстрым проверкам. Первая: распределение классов, если один класс занимает почти всё, метрика точности обманывает. Вторая: дубликаты, в том числе между частями набора. Третья: согласованность разметки на пересечении двух разметчиков. Если люди расходятся, модель выше их согласия не поднимется.


Читать дальше

ИИ-офис
Собери свой ИИ-офис и перестань делать руками то, что делает нейросеть

Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.

Посмотреть, что внутри

telegram

Канал с полезными материалами про нейросети

Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.

Перейти в канал
Кирилл Сандаков

Об авторе

Кирилл Сандаков

Вайбкодер, предприниматель, продюсер

Завайбкодил контент-ферму на США в Instagram (более 300 тыс. подписчиков, среди читателей Дональд Трамп Младший), создатель платформы и сообщества ИИ-офис, автор блога о нейросетях «Выжимаем из ИИ Максимум».

Все статьи автора