Про модели спорят все, про данные почти никто, хотя именно данные решают, чему модель научится и где ошибётся. Разобрали, из чего состоит датасет, где брать готовые, что делать с персональными данными и лицензиями и пять типичных способов испортить набор до того, как обучение началось.
Слово встречается в каждом разговоре про обучение, и почти всегда без объяснения. Датасет это структурированный набор примеров, на котором учится модель: таблица, папка изображений, корпус текстов или записей, где у каждого примера есть признаки, а у размеченного датасета ещё и правильный ответ.
Цифры сверены по первоисточникам, открытым 16 сентября 2026 года: страница проекта ImageNet, обзорная страница Common Crawl и раздел каталога Hugging Face. Дальше по порядку: из чего состоит набор, чем размеченный отличается от неразмеченного, как его делят на части, где брать готовые, что с лицензиями и персональными данными, пять способов испортить набор и короткая инструкция по сборке своего.
Главное в одну строку
Практическое правило, которое экономит больше всего времени: слабая модель на хороших данных почти всегда обгоняет сильную модель на грязных.
Часть 1 · Ответ
Часть 2 · Структура
Часть 3 · Разметка
Это различие определяет, каким способом вообще можно учиться на наборе. Разметка стоит дорого и делается людьми, поэтому её объём почти всегда и есть главное ограничение проекта.
| Состояние | Что есть в наборе | Какое обучение возможно |
|---|---|---|
| Размеченный | признаки и правильные ответы | с учителем: классификация, регрессия |
| Неразмеченный | только признаки | без учителя: кластеры, аномалии, сжатие |
| Частично размеченный | ответы у малой доли | полуавтоматическое, разметка дообучается |
| Среда вместо набора | состояния и награда | с подкреплением, данные порождаются на ходу |
Часть 4 · Разбиение
Часть 5 · Источники
Из первоисточника, страница проекта ImageNet, открыта 16.09.2026
На главной странице указано: 14 197 122 изображения и 21 841 синсет. Набор организован по иерархии WordNet, где каждое понятие описывается синсетом, то есть набором синонимов. Проект описан как продолжающееся исследовательское усилие по обеспечению исследователей данными для обучения моделей распознавания объектов в большом масштабе.
Часть 6 · Права
Общая правовая рамка для сгенерированного и для обучения на чужом материале разобрана в гайде про авторское право и нейросети.
Часть 7 · Закон
Из первоисточника, закон № 152-ФЗ в редакции от 26.07.2026, открыт 16.09.2026
Статья 11 относит к биометрическим персональным данным сведения о физиологических и биологических особенностях человека, на основании которых можно установить его личность, если оператор использует их именно для установления личности; их обработка требует согласия в письменной форме, кроме перечня исключений части 2. Статья 16 запрещает принимать решения, затрагивающие права человека, исключительно на основании автоматизированной обработки, кроме случаев письменного согласия или прямого указания федерального закона.
Часть 8 · Ошибки
Правило одной строки
Если качество на тесте подозрительно высокое, сначала ищите утечку и дубликаты, а не радуйтесь. В девяти случаях из десяти виноват набор, а не удачная архитектура.
Часть 9 · Практика
Если следующим шагом идёт своя модель, порядок действий и развилки собраны в гайде про создание своей нейросети.
Часть 10 · Форматы
Памятка
Коротко
Источники
Чего тут нет намеренно: рейтинга площадок с наборами данных и советов, где скачать чужие корпуса в обход лицензии. Первое устаревает за месяц, второе создаёт проблему вместо того, чтобы её решать. Цен на разметку тоже нет: они зависят от задачи так сильно, что средняя цифра вводит в заблуждение.
FAQ
Это структурированный набор примеров, на котором учится модель. У каждого примера есть признаки, то есть всё, что известно про него заранее, а у размеченного набора ещё и правильный ответ. Таблица квартир с ценами, папка снимков с классами и корпус отзывов с тональностью это три типичных датасета.
В размеченном у каждого примера проставлен правильный ответ, и на таком наборе возможно обучение с учителем: классификация и регрессия. В неразмеченном есть только признаки, и работать с ним можно методами без учителя: кластеризация, поиск аномалий, снижение размерности.
Чтобы оценка качества была честной. Модель настраивается на обучающей части, настройки обучения подбираются на валидационной, а тестовая часть не показывается до самого конца. Если подсматривать в тест при подборе, итоговая цифра перестаёт что-либо означать за пределами этого набора.
В каталогах наборов данных вроде Hugging Face и Kaggle, в классических академических наборах вроде ImageNet и COCO, в веб-корпусах вроде Common Crawl и на порталах открытых данных. На 16 сентября 2026 года все перечисленные ресурсы открываются с российского адреса без VPN.
Зависит от задачи и от того, учите ли вы модель с нуля или дообучаете готовую. Для дообучения под узкую задачу часто хватает сотен примеров. Для обучения с нуля счёт идёт на десятки и сотни тысяч. Практичнее начать со ста честных примеров и посмотреть, где модель ломается.
Только если это разрешает его лицензия, и проверять надо два уровня. Первый это условия самого сборника, второй это права на его элементы: изображения людей, логотипы, тексты под охраной. Лицензия на набор не снимает прав, которые есть у авторов входящих в него материалов.
Считать это обработкой персональных данных со всеми обязанностями оператора и обезличивать всерьёз. Обезличивание убирает не только имя, но и связки, по которым человека можно восстановить: номер договора, точный адрес, редкое сочетание признаков. Для биометрии закон требует согласия в письменной форме.
Чаще всего виноват набор, а не архитектура. Три типичные причины: утечка ответа в признаки, дубликаты между обучающей и тестовой частью и смещение в сборе, когда все примеры собраны в одинаковых условиях. Модель выучила условия сбора, а не саму задачу.
Это ситуация, когда среди признаков есть информация, которой в момент предсказания ещё не существует. Например столбец, который заполняется только после наступления события. Модель опирается на него, показывает отличное качество на тесте и полностью разваливается на реальных данных.
По трём быстрым проверкам. Первая: распределение классов, если один класс занимает почти всё, метрика точности обманывает. Вторая: дубликаты, в том числе между частями набора. Третья: согласованность разметки на пересечении двух разметчиков. Если люди расходятся, модель выше их согласия не поднимется.
Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.
Посмотреть, что внутриtelegram
Канал с полезными материалами про нейросети
Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.