Картинки · описание текстом

Нейросеть опишет картинку: 5 задач и чем это делать

Обратная задача к генерации: на входе изображение, на выходе готовый текст. Разберём, что просить, как получить одинаковый формат и как прогнать целую папку за один заход.

Кирилл СандаковКирилл СандаковВайбкодер, предприниматель, продюсерОпубликовано 13.09.202611 мин чтения

Описать картинку умеет любая современная мультимодальная модель: вы загружаете изображение, она отвечает текстом. В документации OpenAI у модели gpt-6-astra так и написано: входные модальности текст и изображение, выходная только текст. Практическая разница не в том, какая модель умеет, а в том, как поставлена задача: без указания адресата, длины и формата вы получаете общий абзац, который потом переписываете руками.

Ниже: пять задач, ради которых картинки описывают на самом деле, шаблон запроса, который даёт одинаковый результат на сотне файлов, способ прогнать всю папку разом, реальные цены и список мест, где модель уверенно ошибается. Цены сверены с документацией OpenAI 13 сентября 2026 года.

Что узнаешь из гайда

  • Зачем вообще описывать картинки текстом
  • Шаблон запроса, который даёт одинаковый формат
  • Как обработать папку из ста файлов
  • Сколько стоит картинка на входе в токенах
  • Где модель врёт уверенно и что с этим делать

Часть 1 · Зачем

Пять задач, ради которых это делают

Задача, что просить у модели и какой формат ответа нужен
ЗадачаЧто проситьФормат ответа
Alt-тексты для сайтакороткое описание сути кадраодно предложение без вводных
Карточки товараматериал, цвет, форма, деталисписок характеристик
Разбор скриншота с ошибкойчто на экране и что пошло не такдиагноз плюс шаги
Каталогизация архива фототеги: место, событие, кто в кадрестрока таблицы
Доступность для незрячихописание по смыслу, а не по пикселямдва-три предложения

Обратите внимание: во всех пяти строках просят разное. Одно и то же изображение для alt-текста, для карточки товара и для архива описывается по-разному, и именно поэтому универсальное «опиши картинку» почти всегда даёт бесполезный результат.


Часть 2 · Инструменты

Чем описывать: три пути

  1. Чат с загрузкой файла. Самый быстрый путь для одной-двух картинок. Работает в любом крупном чате, включая российские. Минус: на десятой картинке надоедает, на сотой невозможно.
  2. API и скрипт. Тот же результат, но пачкой и в одинаковом формате. Подходит, когда файлов много и нужна таблица на выходе.
  3. Локальная модель. Когда картинки нельзя выгружать наружу: личный архив, документы, съёмка с камер. Качество ниже, зато ничего не покидает компьютер, подробности в гайде про локальный запуск моделей.

Как выбрать за десять секунд

До десяти картинок берите чат. От десяти до нескольких сотен пишите скрипт или ставьте скил. Если на картинках персональные данные, сразу локальная модель, независимо от количества.


Часть 3 · Запрос

Как ставить задачу, чтобы описание было полезным

Главное

Хороший запрос отвечает на три вопроса: для кого, какой длины и в каком формате. Всё остальное вторично.

Рабочий шаблон, который можно копировать и подставлять свои условия:

шаблон запроса
Опиши изображение для <кому и зачем>.
Длина: <одно предложение / до 40 слов / три пункта>.
Обязательно укажи: <предмет, действие, обстановку, цвета>.
Не пиши: вводные обороты, «на изображении», предположения о людях.
Если чего-то не видно, напиши «не видно», не додумывай.

Последняя строка важнее остальных. Без неё модель дорисовывает: видит размытый предмет и уверенно называет его чашкой. С разрешением сказать «не видно» доля выдумок падает заметно. Почему это вообще происходит, разобрано в гайде про галлюцинации нейросетей.


Часть 4 · Масштаб

Как описать целую папку разом

Ручная работа заканчивается примерно на десятой картинке. Дальше нужен конвейер, и он устроен одинаково независимо от инструмента.

  1. Сложить файлы в одну папку. Имена не важны, важно, чтобы не было вложенных архивов и файлов чужих форматов.
  2. Зафиксировать задание. Один и тот же текст запроса для всех файлов, иначе результаты не сравнить и не собрать в таблицу.
  3. Указать формат вывода. Например, три поля через точку с запятой: имя файла, короткое описание, теги. Так ответ сразу ложится в таблицу.
  4. Прогнать пачкой. Скрипт или агент проходит папку, отправляет файлы по очереди и складывает ответы в один документ.
  5. Проверить выборку. Десять случайных строк из ста. Если ошибок нет, дальше можно доверять, если есть, правится задание, а не отдельные ответы.

Удобство скила в том, что задание описывается один раз и потом повторяется командой, а не пересобирается каждый раз заново. Как устроены скилы и как их ставить, разобрано в гайдах лучшие скилы для Claude Code и как установить скил. Для карточек товара есть отдельный разбор в гайде про карточки товаров.


Часть 5 · Деньги

Сколько это стоит на самом деле

Картинка на входе превращается в токены и считается по обычному входному тарифу модели. По документации OpenAI на 13 сентября 2026 года у gpt-6-astra вход стоит 10 долларов за миллион токенов, кешированный вход 1 доллар, выход 50 долларов за миллион. Для оценки стоимости именно изображений OpenAI отсылает к отдельному калькулятору, потому что число токенов зависит от размера картинки.

Отдельная строка это модели генерации изображений: там входная картинка стоит 8 долларов за миллион токенов у gpt-image-2.5-sunburst, flare и gpt-image-2, и 2,5 доллара у gpt-image-1-mini. Но для описания они не нужны: описывает обычная текстовая модель с поддержкой изображений на входе.

Как это выглядит в деньгах

Одно изображение с коротким описанием стоит доли цента. Тысяча картинок это уже заметная, но не страшная сумма, а вот десять тысяч требуют выбора модели подешевле и уменьшения картинок перед отправкой: мелкое изображение это меньше токенов.


Часть 6 · Границы

Где модель ошибается уверенно

  • Мелкий и рукописный текст. Прочитает половину, вторую половину придумает. Для документов нужен инструмент распознавания текста, а не описание.
  • Счёт объектов. Сколько человек в кадре, сколько коробок на полке. Ошибается регулярно, особенно когда объекты перекрывают друг друга.
  • Личности. Опознавать конкретных людей модели отказываются намеренно, и обойти это нельзя.
  • Медицинские снимки. Опишет красиво и правдоподобно, но диагностической ценности в этом нет.
  • Точные бренды и модели техники. Часто угадывает по общему виду и попадает мимо конкретной модели.

Чего делать не надо

Не используйте описания как источник фактов там, где цена ошибки высока: инвентаризация по фотографиям, приёмка товара, медицина, юридические документы. Как черновик описания это отлично, как основание для решения нет.


Часть 7 · Наоборот

Обратная задача: описать картинку для нейросети

Половина людей, которые ищут «как описать картинку нейросетью», имеют в виду противоположное: как словами объяснить модели, что нарисовать. Задача другая, и правила другие. Там работает не подробность, а порядок: объект, действие, обстановка, ракурс, свет, стиль, формат кадра.

Полезный приём на стыке двух задач: возьмите понравившуюся картинку, попросите модель описать её как промпт для генерации, а потом используйте это описание как основу для своей. Так получается перенести стиль, не копируя изображение. Разбор формулы промпта лежит в гайде промты для нейросетей, а выбор генератора в нейросети для генерации картинок.

Коротко

  • Описывает картинку любая мультимодальная модель.
  • Качество решает не модель, а рамки запроса.
  • Задавайте адресата, длину и формат ответа.
  • Разрешите модели писать «не видно», и выдумок станет меньше.
  • От десяти файлов работа переходит в скрипт или скил.
  • Вход у gpt-6-astra стоит 10 долларов за миллион токенов.
  • Личности модели не опознают принципиально.
  • Для текста со сканов нужен не описатель, а распознавание.

Источники

Откуда взяты цифры

  • Карточка модели gpt-6-astra в документации OpenAI, открыта 13.09.2026: входные модальности текст и изображение, выход текст, контекст 1 050 000 токенов, цена 10 долларов за миллион входных токенов, 1 доллар за кешированные, 50 долларов за миллион выходных.
  • Страница цен OpenAI, 13.09.2026: у моделей генерации изображений входная картинка стоит 8 долларов за миллион токенов (gpt-image-2.5-sunburst, flare, gpt-image-2) и 2,5 доллара у gpt-image-1-mini; для оценки стоимости изображений на входе документация отсылает к отдельному калькулятору.
  • Wordstat, Россия: маска «нейросеть для описания картинки» снята 12.09.2026, маска «нейросеть описать картинку» 13.09.2026.
  • Выдача Яндекса по запросу «описать картинку нейросеть», 13.09.2026: на первых позициях узкие сервисы и инструменты, крупных порталов в голове выдачи нет.

FAQ

Частые вопросы

Какая нейросеть описывает картинки

Любая современная мультимодальная модель: она принимает изображение на вход и отвечает текстом. В документации OpenAI у модели gpt-6-astra прямо указано, что входные модальности это текст и изображение, а выходная только текст. То же умеют модели Google и российские сервисы. Вопрос не в том, какая умеет, а в том, насколько подробно и во сколько обойдётся.

Как заставить нейросеть описать картинку подробно

Задайте три вещи: для кого описание, какой длины и в каком формате. Например: опиши фотографию для alt-текста, одно предложение, без вводных слов, укажи предмет, действие и обстановку. Без рамок модель выдаёт средний абзац, который потом всё равно приходится переписывать.

Можно ли описать сразу сто картинок

В чате неудобно, а через скрипт или скил это обычная работа: агент проходит папку, отправляет каждый файл с одним и тем же заданием и складывает результат в таблицу. Так делают alt-тексты, описания карточек товара и каталогизацию архива фотографий. Главное задать единый формат вывода.

Сколько стоит описание одной картинки

Картинка на входе считается токенами по обычному входному тарифу модели. У gpt-6-astra это 10 долларов за миллион входных токенов и 50 за миллион выходных по данным на 13 сентября 2026 года. Одно изображение с коротким описанием обходится в доли цента: дорого выходит не разовая работа, а тысячи файлов подряд.

Опишет ли нейросеть, кто именно на фотографии

Нет, и это сознательное ограничение: модели отказываются опознавать конкретных людей по лицу. Они опишут пол, примерный возраст, одежду, позу и обстановку, но имени не назовут. Для личного архива это значит, что имена проставляете вы, а всё остальное описание берёт на себя нейросеть.

Читает ли нейросеть текст с картинки при описании

Крупный текст прочитает и включит в описание. Мелкий шрифт, рукописный текст и плохое качество съёмки дают ошибки, причём модель не сомневается, а уверенно придумывает. Если задача именно распознать текст, берите инструмент под распознавание, а не просите описание.

Подходит ли это для alt-текстов и SEO

Да, это один из самых выгодных сценариев: alt-текст должен коротко описывать, что на картинке, и такие описания легко генерируются пачкой. Полезная деталь: попросите модель не начинать с оборота «на изображении», а сразу называть предмет. Так alt читается лучше и людьми, и поисковыми системами.

Чем описание отличается от распознавания текста

Распознавание вытаскивает буквы: получаете тот же текст, что напечатан на картинке. Описание объясняет содержание: что за объект, что происходит, какая обстановка. Для сканов документов нужно первое, для фотографий, схем и иллюстраций второе.

Можно ли описывать картинки бесплатно

Да, на бесплатных тарифах чатов: загрузили изображение и спросили. Лимиты небольшие, а загрузка файлов часто ограничена сильнее, чем обычная переписка. Для десятка картинок хватает, для регулярной работы удобнее API с оплатой за токены или локальная модель.

Как описать картинку ДЛЯ нейросети, чтобы она её нарисовала

Это обратная задача, и там важны не подробности, а структура: объект, действие, обстановка, ракурс, свет, стиль, формат кадра. Перечисляйте по порядку и не смешивайте пять требований в одну фразу. Разбор формулы промпта лежит в отдельном гайде про промты для нейросетей.


Читать дальше

ИИ-офис
Собери свой ИИ-офис и перестань делать руками то, что делает нейросеть

Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.

Посмотреть, что внутри

telegram

Канал с полезными материалами про нейросети

Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.

Перейти в канал
Кирилл Сандаков

Об авторе

Кирилл Сандаков

Вайбкодер, предприниматель, продюсер

Завайбкодил контент-ферму на США в Instagram (более 300 тыс. подписчиков, среди читателей Дональд Трамп Младший), создатель платформы и сообщества ИИ-офис, автор блога о нейросетях «Выжимаем из ИИ Максимум».

Все статьи автора