Обратная задача к генерации: на входе изображение, на выходе готовый текст. Разберём, что просить, как получить одинаковый формат и как прогнать целую папку за один заход.
Описать картинку умеет любая современная мультимодальная модель: вы загружаете изображение, она отвечает текстом. В документации OpenAI у модели gpt-6-astra так и написано: входные модальности текст и изображение, выходная только текст. Практическая разница не в том, какая модель умеет, а в том, как поставлена задача: без указания адресата, длины и формата вы получаете общий абзац, который потом переписываете руками.
Ниже: пять задач, ради которых картинки описывают на самом деле, шаблон запроса, который даёт одинаковый результат на сотне файлов, способ прогнать всю папку разом, реальные цены и список мест, где модель уверенно ошибается. Цены сверены с документацией OpenAI 13 сентября 2026 года.
Что узнаешь из гайда
Часть 1 · Зачем
| Задача | Что просить | Формат ответа |
|---|---|---|
| Alt-тексты для сайта | короткое описание сути кадра | одно предложение без вводных |
| Карточки товара | материал, цвет, форма, детали | список характеристик |
| Разбор скриншота с ошибкой | что на экране и что пошло не так | диагноз плюс шаги |
| Каталогизация архива фото | теги: место, событие, кто в кадре | строка таблицы |
| Доступность для незрячих | описание по смыслу, а не по пикселям | два-три предложения |
Обратите внимание: во всех пяти строках просят разное. Одно и то же изображение для alt-текста, для карточки товара и для архива описывается по-разному, и именно поэтому универсальное «опиши картинку» почти всегда даёт бесполезный результат.
Часть 2 · Инструменты
Как выбрать за десять секунд
До десяти картинок берите чат. От десяти до нескольких сотен пишите скрипт или ставьте скил. Если на картинках персональные данные, сразу локальная модель, независимо от количества.
Часть 3 · Запрос
Главное
Хороший запрос отвечает на три вопроса: для кого, какой длины и в каком формате. Всё остальное вторично.
Рабочий шаблон, который можно копировать и подставлять свои условия:
Опиши изображение для <кому и зачем>.
Длина: <одно предложение / до 40 слов / три пункта>.
Обязательно укажи: <предмет, действие, обстановку, цвета>.
Не пиши: вводные обороты, «на изображении», предположения о людях.
Если чего-то не видно, напиши «не видно», не додумывай.Последняя строка важнее остальных. Без неё модель дорисовывает: видит размытый предмет и уверенно называет его чашкой. С разрешением сказать «не видно» доля выдумок падает заметно. Почему это вообще происходит, разобрано в гайде про галлюцинации нейросетей.
Часть 4 · Масштаб
Ручная работа заканчивается примерно на десятой картинке. Дальше нужен конвейер, и он устроен одинаково независимо от инструмента.
Удобство скила в том, что задание описывается один раз и потом повторяется командой, а не пересобирается каждый раз заново. Как устроены скилы и как их ставить, разобрано в гайдах лучшие скилы для Claude Code и как установить скил. Для карточек товара есть отдельный разбор в гайде про карточки товаров.
Часть 5 · Деньги
Картинка на входе превращается в токены и считается по обычному входному тарифу модели. По документации OpenAI на 13 сентября 2026 года у gpt-6-astra вход стоит 10 долларов за миллион токенов, кешированный вход 1 доллар, выход 50 долларов за миллион. Для оценки стоимости именно изображений OpenAI отсылает к отдельному калькулятору, потому что число токенов зависит от размера картинки.
Отдельная строка это модели генерации изображений: там входная картинка стоит 8 долларов за миллион токенов у gpt-image-2.5-sunburst, flare и gpt-image-2, и 2,5 доллара у gpt-image-1-mini. Но для описания они не нужны: описывает обычная текстовая модель с поддержкой изображений на входе.
Как это выглядит в деньгах
Одно изображение с коротким описанием стоит доли цента. Тысяча картинок это уже заметная, но не страшная сумма, а вот десять тысяч требуют выбора модели подешевле и уменьшения картинок перед отправкой: мелкое изображение это меньше токенов.
Часть 6 · Границы
Чего делать не надо
Не используйте описания как источник фактов там, где цена ошибки высока: инвентаризация по фотографиям, приёмка товара, медицина, юридические документы. Как черновик описания это отлично, как основание для решения нет.
Часть 7 · Наоборот
Половина людей, которые ищут «как описать картинку нейросетью», имеют в виду противоположное: как словами объяснить модели, что нарисовать. Задача другая, и правила другие. Там работает не подробность, а порядок: объект, действие, обстановка, ракурс, свет, стиль, формат кадра.
Полезный приём на стыке двух задач: возьмите понравившуюся картинку, попросите модель описать её как промпт для генерации, а потом используйте это описание как основу для своей. Так получается перенести стиль, не копируя изображение. Разбор формулы промпта лежит в гайде промты для нейросетей, а выбор генератора в нейросети для генерации картинок.
Коротко
Источники
FAQ
Любая современная мультимодальная модель: она принимает изображение на вход и отвечает текстом. В документации OpenAI у модели gpt-6-astra прямо указано, что входные модальности это текст и изображение, а выходная только текст. То же умеют модели Google и российские сервисы. Вопрос не в том, какая умеет, а в том, насколько подробно и во сколько обойдётся.
Задайте три вещи: для кого описание, какой длины и в каком формате. Например: опиши фотографию для alt-текста, одно предложение, без вводных слов, укажи предмет, действие и обстановку. Без рамок модель выдаёт средний абзац, который потом всё равно приходится переписывать.
В чате неудобно, а через скрипт или скил это обычная работа: агент проходит папку, отправляет каждый файл с одним и тем же заданием и складывает результат в таблицу. Так делают alt-тексты, описания карточек товара и каталогизацию архива фотографий. Главное задать единый формат вывода.
Картинка на входе считается токенами по обычному входному тарифу модели. У gpt-6-astra это 10 долларов за миллион входных токенов и 50 за миллион выходных по данным на 13 сентября 2026 года. Одно изображение с коротким описанием обходится в доли цента: дорого выходит не разовая работа, а тысячи файлов подряд.
Нет, и это сознательное ограничение: модели отказываются опознавать конкретных людей по лицу. Они опишут пол, примерный возраст, одежду, позу и обстановку, но имени не назовут. Для личного архива это значит, что имена проставляете вы, а всё остальное описание берёт на себя нейросеть.
Крупный текст прочитает и включит в описание. Мелкий шрифт, рукописный текст и плохое качество съёмки дают ошибки, причём модель не сомневается, а уверенно придумывает. Если задача именно распознать текст, берите инструмент под распознавание, а не просите описание.
Да, это один из самых выгодных сценариев: alt-текст должен коротко описывать, что на картинке, и такие описания легко генерируются пачкой. Полезная деталь: попросите модель не начинать с оборота «на изображении», а сразу называть предмет. Так alt читается лучше и людьми, и поисковыми системами.
Распознавание вытаскивает буквы: получаете тот же текст, что напечатан на картинке. Описание объясняет содержание: что за объект, что происходит, какая обстановка. Для сканов документов нужно первое, для фотографий, схем и иллюстраций второе.
Да, на бесплатных тарифах чатов: загрузили изображение и спросили. Лимиты небольшие, а загрузка файлов часто ограничена сильнее, чем обычная переписка. Для десятка картинок хватает, для регулярной работы удобнее API с оплатой за токены или локальная модель.
Это обратная задача, и там важны не подробности, а структура: объект, действие, обстановка, ракурс, свет, стиль, формат кадра. Перечисляйте по порядку и не смешивайте пять требований в одну фразу. Разбор формулы промпта лежит в отдельном гайде про промты для нейросетей.
Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.
Посмотреть, что внутриtelegram
Канал с полезными материалами про нейросети
Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.