Токены · механика и экономия

Что такое токены в нейросети простыми словами

Токены это единица, которой нейросеть меряет вашу переписку. Разберём, почему длинный чат дорожает, чем вход отличается от выхода и какие шесть приёмов реально снижают расход.

Кирилл СандаковКирилл СандаковВайбкодер, предприниматель, продюсерОпубликовано 08.09.202612 мин чтения

Токен это маленький кусочек текста, которым нейросеть меряет всё, что читает и пишет: ваш вопрос, приложенные файлы, историю чата и свой ответ. Обычно один токен это часть слова, для русского текста удобно считать по два токена на слово. Токены важны по двум причинам: в них упирается лимит подписки и в них считается счёт при оплате через API. Причём выход (то, что модель написала) стоит примерно в пять раз дороже входа, а повторяющийся текст можно закешировать и платить за него в десять раз меньше.

Что узнаешь из гайда

  • Что такое токен и контекстное окно на человеческом языке
  • Почему пятидесятое сообщение в чате дороже первого
  • Сколько стоит миллион токенов у разных моделей
  • Как работает кеш и когда он реально включается
  • Шесть приёмов, которые снижают расход без потери качества

Часть 1 · Основа

Что такое токен

Главное

Токен это не слово и не буква, а кусочек текста в среднем в три-четыре символа. Модель не видит букв, она видит последовательность таких кусочков и предсказывает следующий.

В документации OpenAI определение дано без иносказаний: токены это небольшие единицы информации, которые модель читает и пишет, и токены тратят ваш промпт, файлы, история чата, результаты инструментов и сам ответ. Обратите внимание на список: там пять пунктов, и только один из них это то, что вы напечатали.

Практические ориентиры, чтобы прикидывать в уме:

  • Слово на русском: примерно два токена. Английское слово чаще одно, поэтому английский текст выходит дешевле.
  • Страница А4: около 1000-1500 токенов.
  • Договор на 20 страниц: порядка 25 тысяч токенов.
  • Часовая расшифровка встречи: около 15-20 тысяч токенов.

Почему русский дороже английского

Модели учились в основном на английском, и их словарь под него заточен. Кириллица чаще дробится на части: одно слово может занять три токена вместо одного. Отсюда практический вывод для тех, кто считает деньги: технические инструкции и системные промпты выгоднее писать по-английски, а вот общаться и получать ответ спокойно можно по-русски.


Часть 2 · Контекст

Контекстное окно: сколько модель держит в голове

Контекстное окно это потолок объёма, который модель удерживает в одном разговоре. В него входит всё сразу: системная инструкция, ваши сообщения, ответы модели, приложенные файлы и результаты поиска. У пользовательских планов Claude окно 200 тысяч токенов на всех тарифах, включая бесплатный. У DeepSeek в API заявлен миллион токенов.

Что происходит, когда окно заполнилось. Разговор не обрывается, но старые сообщения начинают вытесняться, и модель перестаёт помнить начало. Отсюда знакомый эффект: в длинном чате ассистент вдруг забывает условие, которое вы задали час назад, и начинает противоречить сам себе. Это не поломка, это край окна.

Большое окно не значит бесплатное

Миллион токенов контекста звучит как приглашение загрузить туда всё подряд, но за объём платят. У OpenAI это видно в прайсе буквально: работа с длинным контекстом стоит ровно вдвое дороже обычной, 20 долларов за миллион входных токенов вместо 10 у старшей модели. Большое окно это возможность, а не режим по умолчанию.


Часть 3 · Главная причина расхода

Почему длинный чат дорожает

Это ключевая мысль всего гайда. У модели нет памяти между сообщениями. Ощущение диалога создаётся тем, что вся переписка отправляется ей заново на каждом вашем сообщении. Поэтому она не «помнит» ваш прошлый вопрос, она перечитывает его снова.

Посчитаем на пальцах. Допустим, каждое сообщение в переписке весит 500 токенов. Первый вопрос стоит 500. Десятый обойдётся уже примерно в 5 тысяч, потому что перед ним перечитываются все предыдущие. Пятидесятый в 25 тысяч. Вопрос тот же самой длины, а расход вырос в полсотни раз. Добавьте сюда приложенный в начале чата файл на 25 тысяч токенов, и он тоже будет перечитываться каждый раз.

Отсюда главный приём

Новый чат при смене темы. Это одно движение, которое обнуляет весь накопленный груз. Правило простое: продолжаете ту же задачу, остаётесь в чате; начинаете другую, открываете новый. Люди, у которых «лимиты кончаются за час», обычно живут в одном бесконечном чате с января.


Часть 4 · Цена

Вход и выход: почему ответ дороже вопроса

Токены делятся на входные (всё, что модель прочитала) и выходные (всё, что она написала). Прочитать текст дёшево, сочинить дорого, и в прайсах это видно. Цены ниже за миллион токенов при работе через API, сняты с официальных страниц 8 сентября 2026 года. В подписке вы этих цифр не платите, но именно они определяют, что дороже, а что дешевле.

МодельВходВход из кешаВыход
GPT-6 Astra10150
GPT-5.6 Sol40,4020
GPT-5.6 Luna0,200,021,20
Claude Opus 550,5025
Claude Sonnet 520,2010
Claude Haiku 4.510,105
DeepSeek V4 Pro1,320,0443,96

Цены в долларах за 1 млн токенов, короткий контекст, обычный режим. У DeepSeek указана дневная ставка, ночью она вдвое ниже.

Из таблицы следуют три вывода, которые стоит запомнить. Первый: выход дороже входа в пять раз у всех, а не у кого-то одного. Второй: разница между старшей и лёгкой моделью внутри одного семейства достигает пятидесяти раз, это больше, чем любая экономия на формулировках. Третий: кеш дешевле обычного входа примерно в десять раз, а у DeepSeek и вовсе в тридцать.

Что это значит в подписке

В подписке вы платите фиксированную сумму, но лимит расходуется по той же логике. Просьба «ответь коротко, пятью пунктами» экономит самую дорогую часть расхода. А привычка просить развёрнутый ответ с примерами там, где хватило бы списка, сжигает лимит быстрее всего остального.


Часть 5 · Кеш

Кеш: та же работа за десятую часть цены

Кеширование это скидка за повторение. Если начало запроса не меняется (та же инструкция, тот же документ, тот же свод правил), сервис запоминает его обработанным и в следующий раз не считает заново, а берёт готовое по льготной ставке.

Цифры разговорные: у OpenAI кешированный вход стоит десятую часть обычного, у Anthropic чтение кеша у Sonnet 5 обходится в 0,20 доллара против 2 за обычный вход, у DeepSeek 0,007 против 0,22. Есть нюанс: запись в кеш у Anthropic стоит дороже обычного входа, поэтому кеш выгоден там, где одно и то же начало используется многократно, а не один раз.

Как поймать кеш в обычной работе

Держите постоянную часть промпта неизменной и в начале, а переменную в конце. Если каждый раз переписывать вступление другими словами, кеш не сработает ни разу. Если формулировать инструкцию одинаково и менять только сам вопрос внизу, попадания начнутся сами собой.


Часть 6 · Выбор

Модель под задачу

Самая большая экономия прячется не в промптах, а в выборе модели. Разница между старшей и младшей моделью одного семейства в прайсе доходит до пятидесяти раз, при этом на простых задачах разницы в результате вы не заметите.

  • Лёгкая модель: пересказ, перевод, вычитка, форматирование, черновики писем, идеи заголовков, разбор списков.
  • Средняя модель: рабочие тексты, анализ документа, обычный код, разбор данных.
  • Старшая модель: сложная логика, архитектура, спорные решения, задачи, где ошибка дорого стоит.

Тот же совет даёт и сама OpenAI в разделе про растягивание лимитов: брать модель поменьше на рутинных задачах. Как это устроено внутри подписки Claude, подробно разобрано в гайде как экономить токены в Claude, а окна сброса и тарифы у разных сервисов в разборе лимитов нейросетей.


Часть 7 · Практика

Как работать с длинными документами

Типичная ошибка новичка выглядит так: загрузить в чат отчёт на сто страниц и обсуждать его двадцатью сообщениями. Каждое из этих двадцати сообщений заново тащит за собой все сто страниц. Расход вырастает в десятки раз, а лимит кончается на самом интересном месте.

Как правильно:

  1. Сначала выжимка. Первым сообщением попросить краткое изложение нужного раздела или структуру документа.
  2. Дальше работа с выжимкой. Обсуждать уже её, а не исходник: она в десятки раз меньше.
  3. Возвращаться к оригиналу точечно. Нужен пункт 4.2, вставляйте пункт 4.2, а не весь файл.
  4. Разные документы в разные чаты. Иначе они начнут перечитываться вместе.

Если задача повторяющаяся (каждую неделю разбирать однотипные документы), логика меняется: там как раз стоит держать одинаковое начало промпта и ловить кеш.


Часть 8 · Итог

Шесть приёмов экономии

По убыванию эффекта. Первые три дают основную экономию, остальные добирают.

  1. Новый чат при смене темы. Обнуляет накопленную историю, которая перечитывается на каждом сообщении.
  2. Лёгкая модель на рутину. Разница в цене до пятидесяти раз при том же результате на простых задачах.
  3. Заданный объём ответа. Выход дороже входа впятеро, поэтому «коротко, пятью пунктами» экономит самую дорогую часть.
  4. Только нужные материалы. Один раздел вместо всего отчёта, один файл вместо папки.
  5. Одинаковое начало промпта. Включает кеш, а это десятикратная скидка на повторяющуюся часть.
  6. Меньше подключённых инструментов. Каждый коннектор добавляет описание в каждое сообщение, даже когда вы им не пользуетесь.

Чего делать не надо

Не стоит экономить на понятности запроса. Сэкономленные двадцать слов в вопросе это доли процента расхода, а переспрашивание и второй заход на задачу это ещё один полный проход по всему контексту. Короткий невнятный промпт обходится дороже длинного и точного.

Коротко

  • Токен это кусочек текста, на русском примерно два токена на слово.
  • Токены тратят запрос, файлы, история чата, инструменты и ответ.
  • Контекстное окно это потолок объёма одного разговора.
  • Модель перечитывает весь чат заново на каждом сообщении.
  • Выход дороже входа примерно впятеро.
  • Кеш дешевле обычного входа примерно вдесятеро.
  • Разница между старшей и лёгкой моделью доходит до пятидесяти раз.
  • Главный приём это новый чат при смене темы.

FAQ

Частые вопросы

Что такое токен в нейросети простыми словами

Токен это кусочек текста, которым модель меряет всё, что читает и пишет. Обычно это часть слова: короткое слово занимает один токен, длинное или редкое разбивается на два-три. В документации OpenAI сказано прямо, что токены тратят и ваш запрос, и приложенные файлы, и история переписки, и результаты инструментов, и сам ответ. Для прикидки на русском тексте: примерно два токена на слово, то есть страница текста это около тысячи токенов.

Что такое контекстное окно

Контекстное окно это максимальный объём текста, который модель способна удерживать в одном разговоре: ваш запрос, файлы, история и ответ вместе. У пользовательских планов Claude окно 200 тысяч токенов, у DeepSeek в API заявлен миллион. Когда разговор перестаёт помещаться в окно, начало диалога вытесняется, и модель буквально забывает, о чём вы говорили в первых сообщениях.

Почему длинный чат становится дороже

Потому что у модели нет памяти между сообщениями: она каждый раз перечитывает весь диалог заново. На первом сообщении она читает одну реплику, на пятидесятом все сорок девять предыдущих плюс все приложенные файлы. Расход растёт как снежный ком, хотя вы задаёте вопросы той же длины. Именно поэтому новый чат при смене темы экономит больше, чем сокращение формулировок.

Чем отличается цена входа от цены выхода

Вход это всё, что модель прочитала, выход это то, что она написала. Выход дороже примерно в пять раз: по официальному прайсу OpenAI на сентябрь 2026 миллион входных токенов старшей модели стоит 10 долларов, а миллион выходных 50. У Anthropic та же пропорция: Opus 5 стоит 5 долларов за вход и 25 за выход. Практический вывод: просить короткий ответ выгоднее, чем сокращать вопрос.

Что такое кеширование и сколько оно экономит

Если начало запроса повторяется от раза к разу (например, одна и та же инструкция или один и тот же документ), сервис не считает его заново, а берёт из кеша по льготной ставке. У OpenAI кешированный вход дешевле обычного в десять раз, у Anthropic чтение кеша у Sonnet 5 стоит 0,20 доллара против 2 за обычный вход. У DeepSeek разрыв ещё больше: 0,007 против 0,22 доллара за миллион токенов при попадании в кеш.

Сколько токенов в странице текста

Ориентир для русского языка: около 1000-1500 токенов на страницу А4 обычного текста, примерно два токена на слово. Русский расходуется дороже английского, потому что кириллица чаще дробится на части. Договор на 20 страниц это уже около 25 тысяч токенов только на вход, и они будут перечитываться при каждом вашем сообщении в этом чате.

Как узнать, сколько токенов я потратил

В подписке точного счётчика токенов обычно нет, там показывают остаток лимита: у Claude в разделе Settings, дальше Usage, у ChatGPT и Codex в панели использования, а в терминале по команде /status. При работе через API расход виден точно, в токенах и деньгах, в личном кабинете разработчика. Если нужен именно контроль расхода, API даёт прозрачность, а подписка предсказуемость платежа.

Экономят ли токены короткие вопросы

Гораздо меньше, чем кажется. Ваш вопрос обычно составляет несколько процентов от того, что читает модель: остальное это история чата, файлы и системные инструкции. Поэтому сокращение фразы с двадцати слов до пяти почти не влияет на расход, а новый чат, лёгкая модель и заданный объём ответа влияют сильно.


Читать дальше

ИИ-офис
Собери свой ИИ-офис и перестань делать руками то, что делает нейросеть

Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.

Посмотреть, что внутри

telegram

Канал с полезными материалами про нейросети

Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.

Перейти в канал
Кирилл Сандаков

Об авторе

Кирилл Сандаков

Вайбкодер, предприниматель, продюсер

Завайбкодил контент-ферму на США в Instagram (более 300 тыс. подписчиков, среди читателей Дональд Трамп Младший), создатель платформы и сообщества ИИ-офис, автор блога о нейросетях «Выжимаем из ИИ Максимум».

Все статьи автора