Термин объясняют либо формулами, либо красивыми словами про мозг, и оба варианта одинаково бесполезны. Разобрали по частям и подпёрли тремя работами, страницы которых открыты 15 сентября 2026 года, с реальными цифрами из аннотаций.
Глубокое обучение упоминают рядом с искусственным интеллектом и машинным обучением так, будто это синонимы, и разобраться, что чему принадлежит, по таким текстам невозможно. Глубокое обучение это часть машинного обучения, где работают нейросети с большим числом слоёв, и слово «глубокое» относится к количеству слоёв, а не к глубине понимания.
Чтобы не пересказывать чужие объяснения, мы открыли три работы, на которых стоит вся область, и взяли цифры прямо из аннотаций: статью в Nature 1986 года, работу с конкурса по распознаванию изображений 2012 года и статью про трансформер 2017 года. Все три страницы открыты 15 сентября 2026 года. Дальше: разграничение терминов, механика обучения, три даты, роль данных и честные границы метода.
Главное в одну строку
Глубокое обучение это многослойные нейросети, которые сами находят признаки в данных, и вся современная волна выросла из трёх работ: 1986, 2012 и 2017 годов.
Часть 1 · Ответ
Часть 2 · Разграничение
Это три вложенных круга, и путаница возникает, когда их ставят в один ряд как равные.
Часть 3 · Слои
Слово описывает архитектуру, а не качество мышления. Между тем, что подаётся на вход, и тем, что выходит наружу, стоит много промежуточных уровней.
Часть 4 · Механика
Часть 5 · Определитель
| Год | Работа | Что изменила |
|---|---|---|
| 1986 | статья в Nature, том 323 | дала способ обучать многослойные сети |
| 2012 | свёрточная сеть на конкурсе ImageNet | показала, что это работает на практике |
| 2017 | статья про архитектуру трансформера | сделала возможными нынешние чаты |
| 2018 | генеративное предобучение | связала обучение без разметки и дообучение |
| 2026 | российский закон о технологиях ИИ | зафиксировал порог большой модели числом |
Часть 6 · 1986
Со страницы журнала, открыта 15.09.2026
Статья «Learning representations by back-propagating errors» авторов Дэвида Румельхарта, Джеффри Хинтона и Рональда Уильямса опубликована в журнале Nature 9 октября 1986 года, том 323, страницы 533 по 536. Метод, который она описывает, до сих пор лежит в основе обучения любой нейросети, включая те, что отвечают вам в чате.
Тут полезно заметить разрыв: способ обучать глубокие сети существовал за четверть века до того, как они начали работать. Не хватало не идей, а данных и вычислительной мощности.
Часть 7 · 2012
Из аннотации работы, страница открыта 15.09.2026
Работа «ImageNet Classification with Deep Convolutional Neural Networks» авторов Алекса Крижевского, Ильи Суцкевера и Джеффри Хинтона, сборник конференции 2012 года. В аннотации: сеть обучена на 1,3 миллиона изображений высокого разрешения и тысяче классов, ошибка составила 39,7 процента по первому варианту и 18,9 процента по пяти, что заметно лучше прежних результатов. В сети 60 миллионов параметров и 500 тысяч нейронов, пять свёрточных слоёв, и отдельно отмечена эффективная реализация на видеокартах для ускорения обучения.
Это и есть точка перелома. До неё нейросети были одним из подходов среди многих, после неё стали основным. И именно тогда видеокарты перестали быть только про игры.
Часть 8 · 2017
С arXiv, страница открыта 15.09.2026
Статья «Attention Is All You Need» подана 12 июня 2017 года под номером 1706.03762. В аннотации предлагается архитектура Transformer, построенная исключительно на механизмах внимания и полностью отказывающаяся от рекуррентности и свёрток, и приводится измеримый результат на задаче перевода.
Практическое следствие для пользователя: именно внимание позволяет модели связывать далеко стоящие части текста и работать с длинным документом. Как из этой архитектуры выросли нынешние модели, разобрано в гайде про GPT.
Часть 9 · Данные
Часть 10 · Сегодня
Из текста закона, открыт 15.09.2026
Федеральный закон от 26 июля 2026 года № 243-ФЗ определяет большую фундаментальную модель как содержащую не менее одного миллиарда параметров. Для сравнения: у сети из работы 2012 года их было 60 миллионов, то есть в десятки раз меньше нижней границы, с которой сегодня вообще начинается разговор.
Часть 11 · Границы
Памятка
Коротко
Источники
Чего тут нет намеренно: формул и кода. Они не помогают понять область тому, кто пришёл за определением, а тому, кто идёт в профессию, всё равно понадобится курс, а не абзац в статье.
FAQ
Это обучение нейросетей с большим числом слоёв. Слово «глубокое» относится не к глубине понимания, а к количеству слоёв между входом и выходом. Каждый следующий слой собирает признаки из предыдущего, и за счёт этого модель улавливает сложные закономерности.
Машинное обучение это вся область, где программа учится на данных, включая простые методы вроде деревьев решений. Глубокое обучение это её часть, где используются многослойные нейросети. Главное отличие в том, что признаки модель находит сама, а не получает от человека.
Набор данных, на котором учится модель. Для распознавания это размеченные картинки, для языковой модели огромный корпус текста. Качество датасета влияет на результат сильнее, чем архитектура: на плохих данных хорошая модель выучит плохие закономерности.
Она делает предсказание, сравнивает его с правильным ответом и меняет свои веса так, чтобы ошибка стала меньше. Метод, которым ошибка распределяется по слоям, описан в работе 1986 года в журнале Nature и называется обратным распространением ошибки.
Метод обучения был известен с 1986 года, но не хватало данных и вычислительной мощности. Перелом произошёл в 2012 году, когда свёрточная сеть на видеокартах выиграла конкурс по распознаванию изображений с большим отрывом от прежних результатов.
Сеть обучали на 1,3 миллиона изображений и тысяче классов, она содержала 60 миллионов параметров и 500 тысяч нейронов и состояла из пяти свёрточных слоёв. Ошибка по первому варианту ответа составила 39,7 процента, по пяти вариантам 18,9 процента, заметно лучше прежних результатов.
Обучение сети это миллионы однотипных операций с числами, и видеокарты делают их параллельно. В работе 2012 года эффективная реализация свёрточных сетей на видеокартах прямо названа условием, позволившим ускорить обучение.
В ней предложили архитектуру трансформера, построенную только на механизмах внимания, без рекуррентности и свёрток. Именно на ней стоят современные языковые модели, и буква T в аббревиатуре GPT означает как раз трансформер.
Точные цифры для закрытых моделей разработчики не публикуют. Есть нижняя граница из российского закона: большой фундаментальной моделью считается та, где не менее одного миллиарда параметров. Для сравнения, у сети из работы 2012 года их было 60 миллионов.
Не обязательно, но одно следствие полезно всем. Модель ищет закономерности в данных, а не понимает смысл, поэтому уверенный тон ответа ничего не гарантирует, а проверка чисел и дат остаётся работой человека.
Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.
Посмотреть, что внутриtelegram
Канал с полезными материалами про нейросети
Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.