Словом «компьютерное зрение» называют всё подряд: и поиск по галерее, и турникет по лицу, и проверку деталей на конвейере. За этими сценариями стоят разные задачи с разной точностью и разной ценой ошибки. Разложили девять задач по полкам и показали, чем классификация отличается от детекции и почему это важно на практике.
Проблема обычного объяснения в том, что оно начинается со слова «алгоритмы» и заканчивается словом «нейросети», не объяснив ничего. Компьютерное зрение это область, которая учит программу извлекать смысл из изображения: понять, что на кадре, где именно это находится, к какому из известных объектов относится и что с этим делать дальше.
Фактура сверена по первоисточникам, открытым 16 сентября 2026 года: страница проекта ImageNet, статья про остаточное обучение arXiv 1512.03385 и статья 11 закона о персональных данных в редакции от 26 июля 2026 года. Дальше по порядку: девять задач по одной на раздел, чем они отличаются в цене ошибки, откуда берутся данные для обучения, где область работает надёжно, где проваливается, и что говорит закон про распознавание лиц.
Главное в одну строку
Главное различие, которое снимает половину путаницы: классификация отвечает «что на кадре», детекция отвечает «что и где», сегментация отвечает «какие именно пиксели». Это три разные задачи с разной ценой.
Часть 1 · Ответ
Человеку кажется, что он «видит» стул. На самом деле глаз получает поток яркостей, а смысл достраивает мозг. Компьютерное зрение решает ту же задачу: на входе матрица чисел, на выходе ответ на человеческий вопрос.
Часть 2 · Задачи
Часть 3 · Различие
Это различие снимает большую часть недоразумений в разговорах про точность. Модель может быть отличной в одной задаче и бесполезной в соседней, и сравнивать их напрямую нельзя.
| Задача | Что на выходе | Где это нужно |
|---|---|---|
| Классификация | один класс на весь кадр | сортировка фото, брак или не брак |
| Детекция | рамки и классы объектов | подсчёт людей, поиск товара на полке |
| Сегментация | маска по пикселям | портретный режим, медицинские снимки |
| Распознавание лиц | совпадение с записью в базе | доступ, поиск человека |
| Отслеживание | один объект через кадры | спорт, безопасность, аналитика потока |
Часть 4 · Механика
Из первоисточника, arXiv 1512.03385, подана 10 декабря 2015 года
Работа «Deep Residual Learning for Image Recognition» начинается с прямого признания: более глубокие сети труднее обучать. Авторы предлагают переформулировать слои как обучение остаточных функций относительно входов слоя вместо обучения функций без такой опоры, и приводят эмпирические доказательства, что такие сети оптимизируются легче.
Часть 5 · Данные
Из первоисточника, страница проекта ImageNet, открыта 16.09.2026
На главной странице проекта указано: 14 197 122 изображения, 21 841 синсет. ImageNet организован по иерархии WordNet, где каждое осмысленное понятие называется синсетом, то есть набором синонимов. Проект описывает себя как продолжающееся исследовательское усилие по обеспечению исследователей данными для обучения моделей распознавания объектов в большом масштабе.
Часть 6 · Практика
Часть 7 · Границы
Правило одной строки
Компьютерное зрение отвечает на вопрос «похоже на что», а не на вопрос «безопасно ли». Определение гриба или растения по снимку это подсказка для поиска, а не разрешение съесть, и в разборе про определение грибов это показано на цене ошибки.
Часть 8 · Лица
Из первоисточника, статья 11 закона № 152-ФЗ в редакции от 26.07.2026, открыта 16.09.2026
Сведения, характеризующие физиологические и биологические особенности человека, на основании которых можно установить его личность, и которые используются оператором для установления личности, могут обрабатываться только при наличии согласия в письменной форме. Часть 2 перечисляет исключения: реадмиссия, правосудие и исполнение судебных актов, обязательная дактилоскопическая и геномная регистрация, оборона, безопасность, противодействие терроризму, транспортная безопасность, противодействие коррупции и ряд других оснований.
Часть 9 · Инструменты
Часть 10 · Мифы
Памятка
Коротко
Источники
Чего тут нет намеренно: формул свёртки и разбора конкретных архитектур по слоям. Для понимания задачи они не нужны, а для реализации всё равно придётся читать документацию библиотеки, а не статью. Сравнения коммерческих систем видеоаналитики тоже нет: публичные цифры точности там непроверяемы снаружи.
FAQ
Это область, которая учит программу извлекать смысл из изображения. На входе таблица чисел яркости, на выходе человеческий ответ: что изображено, где именно объект находится, какие пиксели ему принадлежат, что написано на снимке. Нейросети стали основным инструментом этой области примерно с 2012 года.
Компьютерное зрение это задача, нейросеть это способ её решить. Область существовала и до нейросетевого бума и решалась вручную написанными признаками. Сегодня почти все практические результаты получают нейросетями, поэтому слова и стали смешивать в обычной речи.
Классификация изображения, детекция объектов с рамками, сегментация по пикселям, распознавание лиц, распознавание текста со снимка, поиск похожих изображений, отслеживание объекта в видео, оценка позы и движения, генерация и восстановление изображений. Это девять разных задач с разной ценой ошибки.
Классификация даёт один ответ на весь кадр: что здесь изображено. Детекция даёт список объектов с координатами рамок и классами: что именно и где. Сегментация идёт дальше и размечает принадлежность каждого пикселя. Разметка для них дорожает в том же порядке.
Это набор изображений, организованный по иерархии понятий WordNet. На странице проекта указано 14 197 122 изображения и 21 841 синсет. На таких наборах модели учатся отличать классы объектов, и именно соревнования на ImageNet в начале 2010-х годов запустили нынешнюю волну глубокого обучения.
Потому что она видела мало ночных кадров при обучении. Модель улавливает статистику того, что ей показали, и при смене освещения, погоды или ракурса распределение входных данных меняется. Это называется сдвигом данных и лечится не тонкой настройкой, а сбором и разметкой примеров из новых условий.
Если система используется для установления личности, это обработка биометрических персональных данных, а она требует согласия в письменной форме. Часть 2 статьи 11 закона о персональных данных перечисляет исключения, но они касаются государственных задач вроде правосудия, обороны и безопасности, а не пропускной системы работодателя.
Как подсказке для дальнейшей проверки да, как основанию для решения нет. Модель отвечает на вопрос «на что это похоже», а похожие виды могут отличаться признаками, которых на снимке нет. В случае с грибами цена ошибки такова, что снимок не может быть последним аргументом.
Чтобы попробовать нет. Мультимодальная модель в обычном чате уже отвечает на вопросы по загруженной картинке, а готовые сервисы вроде удаления фона работают в браузере. Видеокарта нужна, когда вы обучаете свою модель или обрабатываете видеопоток в реальном времени.
Логичный порядок такой: сначала общее устройство обучения моделей, потом архитектуры, потом конкретная задача. У нас это гайд про обучение с учителем и без учителя, разбор видов нейросетей и отдельные практические статьи про распознавание текста и определение по фото.
Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.
Посмотреть, что внутриtelegram
Канал с полезными материалами про нейросети
Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.