Токены это единица, которой нейросеть меряет вашу переписку. Разберём, почему длинный чат дорожает, чем вход отличается от выхода и какие шесть приёмов реально снижают расход.
Токен это маленький кусочек текста, которым нейросеть меряет всё, что читает и пишет: ваш вопрос, приложенные файлы, историю чата и свой ответ. Обычно один токен это часть слова, для русского текста удобно считать по два токена на слово. Токены важны по двум причинам: в них упирается лимит подписки и в них считается счёт при оплате через API. Причём выход (то, что модель написала) стоит примерно в пять раз дороже входа, а повторяющийся текст можно закешировать и платить за него в десять раз меньше.
Что узнаешь из гайда
Часть 1 · Основа
Главное
Токен это не слово и не буква, а кусочек текста в среднем в три-четыре символа. Модель не видит букв, она видит последовательность таких кусочков и предсказывает следующий.
В документации OpenAI определение дано без иносказаний: токены это небольшие единицы информации, которые модель читает и пишет, и токены тратят ваш промпт, файлы, история чата, результаты инструментов и сам ответ. Обратите внимание на список: там пять пунктов, и только один из них это то, что вы напечатали.
Практические ориентиры, чтобы прикидывать в уме:
Почему русский дороже английского
Модели учились в основном на английском, и их словарь под него заточен. Кириллица чаще дробится на части: одно слово может занять три токена вместо одного. Отсюда практический вывод для тех, кто считает деньги: технические инструкции и системные промпты выгоднее писать по-английски, а вот общаться и получать ответ спокойно можно по-русски.
Часть 2 · Контекст
Контекстное окно это потолок объёма, который модель удерживает в одном разговоре. В него входит всё сразу: системная инструкция, ваши сообщения, ответы модели, приложенные файлы и результаты поиска. У пользовательских планов Claude окно 200 тысяч токенов на всех тарифах, включая бесплатный. У DeepSeek в API заявлен миллион токенов.
Что происходит, когда окно заполнилось. Разговор не обрывается, но старые сообщения начинают вытесняться, и модель перестаёт помнить начало. Отсюда знакомый эффект: в длинном чате ассистент вдруг забывает условие, которое вы задали час назад, и начинает противоречить сам себе. Это не поломка, это край окна.
Большое окно не значит бесплатное
Миллион токенов контекста звучит как приглашение загрузить туда всё подряд, но за объём платят. У OpenAI это видно в прайсе буквально: работа с длинным контекстом стоит ровно вдвое дороже обычной, 20 долларов за миллион входных токенов вместо 10 у старшей модели. Большое окно это возможность, а не режим по умолчанию.
Часть 3 · Главная причина расхода
Это ключевая мысль всего гайда. У модели нет памяти между сообщениями. Ощущение диалога создаётся тем, что вся переписка отправляется ей заново на каждом вашем сообщении. Поэтому она не «помнит» ваш прошлый вопрос, она перечитывает его снова.
Посчитаем на пальцах. Допустим, каждое сообщение в переписке весит 500 токенов. Первый вопрос стоит 500. Десятый обойдётся уже примерно в 5 тысяч, потому что перед ним перечитываются все предыдущие. Пятидесятый в 25 тысяч. Вопрос тот же самой длины, а расход вырос в полсотни раз. Добавьте сюда приложенный в начале чата файл на 25 тысяч токенов, и он тоже будет перечитываться каждый раз.
Отсюда главный приём
Новый чат при смене темы. Это одно движение, которое обнуляет весь накопленный груз. Правило простое: продолжаете ту же задачу, остаётесь в чате; начинаете другую, открываете новый. Люди, у которых «лимиты кончаются за час», обычно живут в одном бесконечном чате с января.
Часть 4 · Цена
Токены делятся на входные (всё, что модель прочитала) и выходные (всё, что она написала). Прочитать текст дёшево, сочинить дорого, и в прайсах это видно. Цены ниже за миллион токенов при работе через API, сняты с официальных страниц 8 сентября 2026 года. В подписке вы этих цифр не платите, но именно они определяют, что дороже, а что дешевле.
| Модель | Вход | Вход из кеша | Выход |
|---|---|---|---|
| GPT-6 Astra | 10 | 1 | 50 |
| GPT-5.6 Sol | 4 | 0,40 | 20 |
| GPT-5.6 Luna | 0,20 | 0,02 | 1,20 |
| Claude Opus 5 | 5 | 0,50 | 25 |
| Claude Sonnet 5 | 2 | 0,20 | 10 |
| Claude Haiku 4.5 | 1 | 0,10 | 5 |
| DeepSeek V4 Pro | 1,32 | 0,044 | 3,96 |
Цены в долларах за 1 млн токенов, короткий контекст, обычный режим. У DeepSeek указана дневная ставка, ночью она вдвое ниже.
Из таблицы следуют три вывода, которые стоит запомнить. Первый: выход дороже входа в пять раз у всех, а не у кого-то одного. Второй: разница между старшей и лёгкой моделью внутри одного семейства достигает пятидесяти раз, это больше, чем любая экономия на формулировках. Третий: кеш дешевле обычного входа примерно в десять раз, а у DeepSeek и вовсе в тридцать.
Что это значит в подписке
В подписке вы платите фиксированную сумму, но лимит расходуется по той же логике. Просьба «ответь коротко, пятью пунктами» экономит самую дорогую часть расхода. А привычка просить развёрнутый ответ с примерами там, где хватило бы списка, сжигает лимит быстрее всего остального.
Часть 5 · Кеш
Кеширование это скидка за повторение. Если начало запроса не меняется (та же инструкция, тот же документ, тот же свод правил), сервис запоминает его обработанным и в следующий раз не считает заново, а берёт готовое по льготной ставке.
Цифры разговорные: у OpenAI кешированный вход стоит десятую часть обычного, у Anthropic чтение кеша у Sonnet 5 обходится в 0,20 доллара против 2 за обычный вход, у DeepSeek 0,007 против 0,22. Есть нюанс: запись в кеш у Anthropic стоит дороже обычного входа, поэтому кеш выгоден там, где одно и то же начало используется многократно, а не один раз.
Как поймать кеш в обычной работе
Держите постоянную часть промпта неизменной и в начале, а переменную в конце. Если каждый раз переписывать вступление другими словами, кеш не сработает ни разу. Если формулировать инструкцию одинаково и менять только сам вопрос внизу, попадания начнутся сами собой.
Часть 6 · Выбор
Самая большая экономия прячется не в промптах, а в выборе модели. Разница между старшей и младшей моделью одного семейства в прайсе доходит до пятидесяти раз, при этом на простых задачах разницы в результате вы не заметите.
Тот же совет даёт и сама OpenAI в разделе про растягивание лимитов: брать модель поменьше на рутинных задачах. Как это устроено внутри подписки Claude, подробно разобрано в гайде как экономить токены в Claude, а окна сброса и тарифы у разных сервисов в разборе лимитов нейросетей.
Часть 7 · Практика
Типичная ошибка новичка выглядит так: загрузить в чат отчёт на сто страниц и обсуждать его двадцатью сообщениями. Каждое из этих двадцати сообщений заново тащит за собой все сто страниц. Расход вырастает в десятки раз, а лимит кончается на самом интересном месте.
Как правильно:
Если задача повторяющаяся (каждую неделю разбирать однотипные документы), логика меняется: там как раз стоит держать одинаковое начало промпта и ловить кеш.
Часть 8 · Итог
По убыванию эффекта. Первые три дают основную экономию, остальные добирают.
Чего делать не надо
Не стоит экономить на понятности запроса. Сэкономленные двадцать слов в вопросе это доли процента расхода, а переспрашивание и второй заход на задачу это ещё один полный проход по всему контексту. Короткий невнятный промпт обходится дороже длинного и точного.
Коротко
FAQ
Токен это кусочек текста, которым модель меряет всё, что читает и пишет. Обычно это часть слова: короткое слово занимает один токен, длинное или редкое разбивается на два-три. В документации OpenAI сказано прямо, что токены тратят и ваш запрос, и приложенные файлы, и история переписки, и результаты инструментов, и сам ответ. Для прикидки на русском тексте: примерно два токена на слово, то есть страница текста это около тысячи токенов.
Контекстное окно это максимальный объём текста, который модель способна удерживать в одном разговоре: ваш запрос, файлы, история и ответ вместе. У пользовательских планов Claude окно 200 тысяч токенов, у DeepSeek в API заявлен миллион. Когда разговор перестаёт помещаться в окно, начало диалога вытесняется, и модель буквально забывает, о чём вы говорили в первых сообщениях.
Потому что у модели нет памяти между сообщениями: она каждый раз перечитывает весь диалог заново. На первом сообщении она читает одну реплику, на пятидесятом все сорок девять предыдущих плюс все приложенные файлы. Расход растёт как снежный ком, хотя вы задаёте вопросы той же длины. Именно поэтому новый чат при смене темы экономит больше, чем сокращение формулировок.
Вход это всё, что модель прочитала, выход это то, что она написала. Выход дороже примерно в пять раз: по официальному прайсу OpenAI на сентябрь 2026 миллион входных токенов старшей модели стоит 10 долларов, а миллион выходных 50. У Anthropic та же пропорция: Opus 5 стоит 5 долларов за вход и 25 за выход. Практический вывод: просить короткий ответ выгоднее, чем сокращать вопрос.
Если начало запроса повторяется от раза к разу (например, одна и та же инструкция или один и тот же документ), сервис не считает его заново, а берёт из кеша по льготной ставке. У OpenAI кешированный вход дешевле обычного в десять раз, у Anthropic чтение кеша у Sonnet 5 стоит 0,20 доллара против 2 за обычный вход. У DeepSeek разрыв ещё больше: 0,007 против 0,22 доллара за миллион токенов при попадании в кеш.
Ориентир для русского языка: около 1000-1500 токенов на страницу А4 обычного текста, примерно два токена на слово. Русский расходуется дороже английского, потому что кириллица чаще дробится на части. Договор на 20 страниц это уже около 25 тысяч токенов только на вход, и они будут перечитываться при каждом вашем сообщении в этом чате.
В подписке точного счётчика токенов обычно нет, там показывают остаток лимита: у Claude в разделе Settings, дальше Usage, у ChatGPT и Codex в панели использования, а в терминале по команде /status. При работе через API расход виден точно, в токенах и деньгах, в личном кабинете разработчика. Если нужен именно контроль расхода, API даёт прозрачность, а подписка предсказуемость платежа.
Гораздо меньше, чем кажется. Ваш вопрос обычно составляет несколько процентов от того, что читает модель: остальное это история чата, файлы и системные инструкции. Поэтому сокращение фразы с двадцати слов до пяти почти не влияет на расход, а новый чат, лёгкая модель и заданный объём ответа влияют сильно.
Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.
Посмотреть, что внутриtelegram
Канал с полезными материалами про нейросети
Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.