Термины · Глубокое обучение

Что такое глубокое обучение: 6 ответов и три даты, всё объясняющие

Термин объясняют либо формулами, либо красивыми словами про мозг, и оба варианта одинаково бесполезны. Разобрали по частям и подпёрли тремя работами, страницы которых открыты 15 сентября 2026 года, с реальными цифрами из аннотаций.

Кирилл СандаковКирилл СандаковВайбкодер, предприниматель, продюсерОпубликовано 15.09.202611 мин чтения

Глубокое обучение упоминают рядом с искусственным интеллектом и машинным обучением так, будто это синонимы, и разобраться, что чему принадлежит, по таким текстам невозможно. Глубокое обучение это часть машинного обучения, где работают нейросети с большим числом слоёв, и слово «глубокое» относится к количеству слоёв, а не к глубине понимания.

Чтобы не пересказывать чужие объяснения, мы открыли три работы, на которых стоит вся область, и взяли цифры прямо из аннотаций: статью в Nature 1986 года, работу с конкурса по распознаванию изображений 2012 года и статью про трансформер 2017 года. Все три страницы открыты 15 сентября 2026 года. Дальше: разграничение терминов, механика обучения, три даты, роль данных и честные границы метода.

Главное в одну строку

Глубокое обучение это многослойные нейросети, которые сами находят признаки в данных, и вся современная волна выросла из трёх работ: 1986, 2012 и 2017 годов.


Часть 1 · Ответ

Что такое глубокое обучение, если коротко

  1. Что это. Обучение нейросетей с большим числом слоёв между входом и выходом.
  2. Чем отличается. Признаки модель находит сама, человек их не задаёт.
  3. Что нужно. Много данных и много вычислений, желательно на видеокартах.
  4. Как учится. Ошибается, измеряет ошибку и правит веса, и так миллионы раз.
  5. Чего не делает. Не понимает смысл и не проверяет факты.

Часть 2 · Разграничение

Как соотносятся ИИ, машинное и глубокое обучение

Это три вложенных круга, и путаница возникает, когда их ставят в один ряд как равные.

  • Искусственный интеллект. Самый широкий круг: любая попытка научить машину решать задачи, которые считались человеческими. Включая правила, написанные вручную.
  • Машинное обучение. Круг поменьше: программа не получает правила, а выводит их из данных. Сюда входят и простые методы без всяких нейросетей.
  • Глубокое обучение. Самый маленький круг: многослойные нейросети. Отличается тем, что признаки не задаются человеком, а возникают в слоях.
  • Где тут языковые модели. Внутри глубокого обучения, в отдельной ветке для текста, разбор в гайде про LLM.

Часть 3 · Слои

Почему обучение называют глубоким

Слово описывает архитектуру, а не качество мышления. Между тем, что подаётся на вход, и тем, что выходит наружу, стоит много промежуточных уровней.

  • Первые слои. В задаче с картинками ловят простое: границы, пятна, перепады яркости.
  • Средние слои. Собирают из простого более сложное: углы, текстуры, части предметов.
  • Последние слои. Работают уже с целыми понятиями вроде лица или автомобиля.
  • Главное следствие. Человеку не нужно объяснять машине, что такое колесо. Признаки складываются сами, если данных достаточно.

Часть 4 · Механика

Что происходит во время обучения

  1. Веса задаются случайно. В начале модель не знает ничего и отвечает наугад.
  2. Делается предсказание. Данные проходят через слои и превращаются в ответ.
  3. Измеряется ошибка. Ответ сравнивается с правильным, разница выражается числом.
  4. Ошибка распределяется назад. Каждый вес получает свою долю вины за результат.
  5. Веса немного меняются. И цикл повторяется миллионы раз, пока ошибка не перестанет падать.

Часть 5 · Определитель

Три работы, на которых держится область

Год, работа и что именно она изменила
ГодРаботаЧто изменила
1986статья в Nature, том 323дала способ обучать многослойные сети
2012свёрточная сеть на конкурсе ImageNetпоказала, что это работает на практике
2017статья про архитектуру трансформерасделала возможными нынешние чаты
2018генеративное предобучениесвязала обучение без разметки и дообучение
2026российский закон о технологиях ИИзафиксировал порог большой модели числом

Часть 6 · 1986

Работа, давшая способ обучать глубокие сети

Со страницы журнала, открыта 15.09.2026

Статья «Learning representations by back-propagating errors» авторов Дэвида Румельхарта, Джеффри Хинтона и Рональда Уильямса опубликована в журнале Nature 9 октября 1986 года, том 323, страницы 533 по 536. Метод, который она описывает, до сих пор лежит в основе обучения любой нейросети, включая те, что отвечают вам в чате.

Тут полезно заметить разрыв: способ обучать глубокие сети существовал за четверть века до того, как они начали работать. Не хватало не идей, а данных и вычислительной мощности.


Часть 7 · 2012

Момент, когда метод доказал себя на практике

Из аннотации работы, страница открыта 15.09.2026

Работа «ImageNet Classification with Deep Convolutional Neural Networks» авторов Алекса Крижевского, Ильи Суцкевера и Джеффри Хинтона, сборник конференции 2012 года. В аннотации: сеть обучена на 1,3 миллиона изображений высокого разрешения и тысяче классов, ошибка составила 39,7 процента по первому варианту и 18,9 процента по пяти, что заметно лучше прежних результатов. В сети 60 миллионов параметров и 500 тысяч нейронов, пять свёрточных слоёв, и отдельно отмечена эффективная реализация на видеокартах для ускорения обучения.

Это и есть точка перелома. До неё нейросети были одним из подходов среди многих, после неё стали основным. И именно тогда видеокарты перестали быть только про игры.


Часть 8 · 2017

Архитектура, из которой выросли чаты

С arXiv, страница открыта 15.09.2026

Статья «Attention Is All You Need» подана 12 июня 2017 года под номером 1706.03762. В аннотации предлагается архитектура Transformer, построенная исключительно на механизмах внимания и полностью отказывающаяся от рекуррентности и свёрток, и приводится измеримый результат на задаче перевода.

Практическое следствие для пользователя: именно внимание позволяет модели связывать далеко стоящие части текста и работать с длинным документом. Как из этой архитектуры выросли нынешние модели, разобрано в гайде про GPT.


Часть 9 · Данные

Почему датасет важнее архитектуры

  • Что такое датасет. Набор данных для обучения: размеченные картинки, пары вопрос-ответ, корпус текста.
  • Почему он решает. Модель выучивает закономерности данных, включая их ошибки и перекосы.
  • Сколько нужно. В работе 2012 года это 1,3 миллиона изображений. Для языковой модели счёт идёт на терабайты текста.
  • Где узкое место. Не в мощности железа, а в сборе и чистке данных. Это самая долгая и самая скучная часть работы.

Часть 10 · Сегодня

Где глубокое обучение работает прямо сейчас

Из текста закона, открыт 15.09.2026

Федеральный закон от 26 июля 2026 года № 243-ФЗ определяет большую фундаментальную модель как содержащую не менее одного миллиарда параметров. Для сравнения: у сети из работы 2012 года их было 60 миллионов, то есть в десятки раз меньше нижней границы, с которой сегодня вообще начинается разговор.

  • Текст. Чаты, перевод, поиск с готовым ответом.
  • Изображения. Генерация, распознавание, обработка фото.
  • Звук. Распознавание речи, синтез голоса, разделение дорожек.
  • Прикладное. Медицинская диагностика по снимкам, промышленный контроль, рекомендации.

Часть 11 · Границы

Чего глубокое обучение не умеет

  • Объяснять свои решения. Знание размазано по весам, и вытащить причину конкретного ответа обычно невозможно.
  • Работать на малых данных. Там, где примеров десятки, простые методы часто выигрывают.
  • Выходить за пределы данных. Модель уверенно ошибается на том, чего в обучении не было, разбор в гайде про галлюцинации.
  • Отличать корреляцию от причины. Она видит совпадения и принимает их за правило.
  • Понимать смысл. Что означает эта фраза на практике, разобрано в гайде про тест Тьюринга.

Памятка

Что стоит запомнить

Коротко

  • Глубокое обучение это многослойные нейросети.
  • Слово «глубокое» про число слоёв, а не про глубину понимания.
  • Признаки модель находит сама, человек их не задаёт.
  • Обучение это цикл: предсказал, измерил ошибку, поправил веса.
  • Способ обучать такие сети описан в Nature 9 октября 1986 года.
  • Практический перелом случился в 2012 году на конкурсе ImageNet.
  • В той сети было 60 миллионов параметров и 500 тысяч нейронов.
  • Видеокарты в той работе прямо названы условием ускорения.
  • Архитектура трансформера предложена в статье от 12 июня 2017 года.
  • Порог большой модели в российском законе это миллиард параметров.

Источники

Что проверялось живьём и когда

  • Nature, «Learning representations by back-propagating errors», Румельхарт, Хинтон, Уильямс, том 323, страницы 533-536, дата публикации на странице журнала 09.10.1986, страница открыта 15.09.2026.
  • «ImageNet Classification with Deep Convolutional Neural Networks», Крижевский, Суцкевер, Хинтон, сборник конференции 2012 года, страница открыта 15.09.2026: 1,3 миллиона изображений, 1000 классов, ошибка 39,7 и 18,9 процента, 60 миллионов параметров, 500 тысяч нейронов, пять свёрточных слоёв, реализация на видеокартах.
  • arXiv 1706.03762 «Attention Is All You Need», подана 12.06.2017, страница открыта 15.09.2026: архитектура только на механизмах внимания.
  • Федеральный закон от 26.07.2026 № 243-ФЗ, официальный портал правовой информации, номер опубликования 0001202607260003, открыт 15.09.2026: порог в один миллиард параметров.
  • Wordstat, Россия, 15.09.2026: частотность запросов про глубокое обучение, обучение нейросети и датасеты.

Чего тут нет намеренно: формул и кода. Они не помогают понять область тому, кто пришёл за определением, а тому, кто идёт в профессию, всё равно понадобится курс, а не абзац в статье.


FAQ

Частые вопросы

Что такое глубокое обучение простыми словами

Это обучение нейросетей с большим числом слоёв. Слово «глубокое» относится не к глубине понимания, а к количеству слоёв между входом и выходом. Каждый следующий слой собирает признаки из предыдущего, и за счёт этого модель улавливает сложные закономерности.

Чем глубокое обучение отличается от машинного

Машинное обучение это вся область, где программа учится на данных, включая простые методы вроде деревьев решений. Глубокое обучение это её часть, где используются многослойные нейросети. Главное отличие в том, что признаки модель находит сама, а не получает от человека.

Что такое датасет

Набор данных, на котором учится модель. Для распознавания это размеченные картинки, для языковой модели огромный корпус текста. Качество датасета влияет на результат сильнее, чем архитектура: на плохих данных хорошая модель выучит плохие закономерности.

Как нейросеть учится

Она делает предсказание, сравнивает его с правильным ответом и меняет свои веса так, чтобы ошибка стала меньше. Метод, которым ошибка распределяется по слоям, описан в работе 1986 года в журнале Nature и называется обратным распространением ошибки.

Почему глубокое обучение выстрелило только в двухтысячных

Метод обучения был известен с 1986 года, но не хватало данных и вычислительной мощности. Перелом произошёл в 2012 году, когда свёрточная сеть на видеокартах выиграла конкурс по распознаванию изображений с большим отрывом от прежних результатов.

Что было в работе 2012 года

Сеть обучали на 1,3 миллиона изображений и тысяче классов, она содержала 60 миллионов параметров и 500 тысяч нейронов и состояла из пяти свёрточных слоёв. Ошибка по первому варианту ответа составила 39,7 процента, по пяти вариантам 18,9 процента, заметно лучше прежних результатов.

При чём тут видеокарты

Обучение сети это миллионы однотипных операций с числами, и видеокарты делают их параллельно. В работе 2012 года эффективная реализация свёрточных сетей на видеокартах прямо названа условием, позволившим ускорить обучение.

Что изменила статья 2017 года

В ней предложили архитектуру трансформера, построенную только на механизмах внимания, без рекуррентности и свёрток. Именно на ней стоят современные языковые модели, и буква T в аббревиатуре GPT означает как раз трансформер.

Сколько параметров у современных моделей

Точные цифры для закрытых моделей разработчики не публикуют. Есть нижняя граница из российского закона: большой фундаментальной моделью считается та, где не менее одного миллиарда параметров. Для сравнения, у сети из работы 2012 года их было 60 миллионов.

Нужно ли это знать, чтобы пользоваться нейросетями

Не обязательно, но одно следствие полезно всем. Модель ищет закономерности в данных, а не понимает смысл, поэтому уверенный тон ответа ничего не гарантирует, а проверка чисел и дат остаётся работой человека.


Читать дальше

ИИ-офис
Собери свой ИИ-офис и перестань делать руками то, что делает нейросеть

Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.

Посмотреть, что внутри

telegram

Канал с полезными материалами про нейросети

Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.

Перейти в канал
Кирилл Сандаков

Об авторе

Кирилл Сандаков

Вайбкодер, предприниматель, продюсер

Завайбкодил контент-ферму на США в Instagram (более 300 тыс. подписчиков, среди читателей Дональд Трамп Младший), создатель платформы и сообщества ИИ-офис, автор блога о нейросетях «Выжимаем из ИИ Максимум».

Все статьи автора