Три буквы встречаются в каждой второй статье про ИИ, и почти нигде не сказано, что именно делает модель «большой». Разберём термин по частям: параметры, контекст, токены и цена за миллион, с цифрами из документации и тарифов на 14 сентября 2026 года.
В статьях про ИИ три буквы LLM ставят как само собой разумеющееся, а расшифровка обычно заканчивается на «большая языковая модель», что объясняет ровно ничего. LLM это нейросеть, обученная на текстах предсказывать следующий кусочек текста, и «большая» здесь означает конкретное: миллиарды настраиваемых чисел внутри и окно контекста, измеряемое сотнями тысяч токенов.
Все цифры ниже сняты 14 сентября 2026 года: окно контекста и лимит ответа из документации разработчика, цены за миллион токенов со страницы тарифов, которая с московского адреса открывается нормально, порог «миллиард параметров» из текста закона. Дальше по порядку: расшифровка, разница с нейросетью, параметры, контекст, цена, обучение, границы и локальный запуск.
Главное в одну строку
LLM это языковая модель с миллиардами параметров, у которой есть рабочая память в виде окна контекста, и платят за неё по количеству токенов, а не сообщений.
Часть 1 · Ответ
Часть 2 · Расшифровка
Языковая модель как понятие старше нынешнего бума: так называли ещё простые статистические системы, подсказывавшие следующее слово в телефоне. Новым стало слово «большая», и оно поменяло свойства класса.
Часть 3 · Разграничение
Вопрос звучит часто, а ответ короткий: отношение целого и части. Всякая LLM это нейросеть, но не всякая нейросеть это LLM.
Базовые определения и разница между искусственным интеллектом и нейросетью разобраны в гайде про нейросети простыми словами, чтобы не повторять их здесь.
Часть 4 · Размер
Параметр это число внутри модели, которое было подобрано при обучении. Ничего человекочитаемого в нём нет: нельзя открыть файл и найти строку про столицу Франции. Знание размазано по всем весам сразу.
Из текста закона, открыт 14.09.2026
Федеральный закон от 26 июля 2026 года № 243-ФЗ, статья 3, определяет большую фундаментальную модель как программу, обучающуюся на составах данных, являющуюся основой для создания и доработки другого программного обеспечения и содержащую не менее одного миллиарда параметров. Это первый российский нормативный документ, где размер модели зафиксирован конкретным числом.
Практический смысл размера для пользователя такой: больше параметров обычно означает лучшее понимание сложных запросов и более дорогой ответ. Но связка не прямая, и модель поменьше с хорошим промтом и вашими документами часто обыгрывает гиганта, которому не дали контекста.
Часть 5 · Память
Это понятие путают со знаниями модели чаще всего. Окно контекста не про то, что модель выучила, а про то, сколько текста она видит прямо сейчас.
Из документации разработчика, открыта 14.09.2026
В документации Anthropic контекстное окно названо рабочей памятью модели и прямо отделено от корпуса, на котором она обучалась. У старших моделей окно составляет один миллион токенов, у части прежних двести тысяч, один ответ ограничен ста двадцатью восемью тысячами токенов, а в один запрос помещается до шестисот изображений или страниц PDF. Там же сказано, что с ростом заполнения окна точность и способность вспомнить нужное снижаются.
Часть 6 · Определитель
| Характеристика | Что означает | На что влияет |
|---|---|---|
| Параметры | числа внутри модели | ёмкость и цена ответа |
| Окно контекста | сколько текста видно за раз | длина документа и чата |
| Лимит ответа | максимум токенов в одном ответе | объём генерации за раз |
| Цена за миллион токенов | тариф отдельно на вход и выход | счёт при работе через ключ |
| Кеш запроса | повторное использование части контекста | экономию на длинных инструкциях |
| Режим рассуждений | дополнительные шаги перед ответом | качество на сложных задачах и расход |
| Мультимодальность | вход не только текстом | работу с картинками и PDF |
Часть 7 · Деньги
В чате вы платите подпиской, а при работе через программный ключ платите по факту. Единицей стала не страница и не запрос, а миллион токенов, потому что именно от них зависит нагрузка.
Со страницы тарифов, открыта из Москвы 14.09.2026
На claude.com/pricing цены указаны за миллион токенов отдельно на вход и выход: Fable 5.1 десять и пятьдесят долларов, Opus 5 пять и двадцать пять, Sonnet 5 два и десять, Haiku 4.5 один и пять. Отдельно тарифицируются чтение и запись кеша, а пакетная обработка даёт скидку в половину стоимости.
Отсюда два вывода. Первый: выход почти всегда дороже входа, поэтому просить краткий ответ выгоднее, чем потом сокращать длинный. Второй: русский текст расходует больше токенов на ту же мысль, и это заметно на длинных документах. Подробный разбор счёта в гайде про токены.
Часть 8 · Обучение
Часть 9 · Границы
Что с этим делать по шагам, разобрано в гайде про галлюцинации.
Часть 10 · Свои данные
Самый надёжный способ снизить выдумки это перестать спрашивать модель о фактах и начать давать ей факты вместе с вопросом.
Часть 11 · Локально
Можно, и для части задач это разумно: данные не уходят наружу, лимитов нет, платить помесячно не надо. Но ожидания стоит поставить честно.
Памятка
Коротко
Источники
Чего тут нет намеренно: сравнения моделей по баллам в тестах и точных размеров закрытых моделей. Первое устаревает быстрее, чем выходит статья, второе разработчики не публикуют, и любые «известные цифры» в обзорах это пересказ слухов.
FAQ
Это большая языковая модель, то есть нейросеть, обученная на огромном объёме текста предсказывать продолжение. Слово «большая» тут не фигура речи: речь о миллиардах настраиваемых чисел внутри. Именно такие модели работают в чатах, помощниках по коду и поиске с генеративным ответом.
LLM это частный случай нейросети, заточенный под текст. Нейросетью называют и модель, распознающую номера машин, и генератор картинок. Языковая модель отличается тем, что работает с последовательностью токенов и выдаёт текст, а не метку класса или изображение.
Параметры это числа, которые подбираются при обучении и хранят выученные закономерности. В российском законе от 26 июля 2026 года порог большой фундаментальной модели зафиксирован прямо: не менее одного миллиарда параметров. У массовых моделей счёт идёт на сотни миллиардов, точные цифры разработчики обычно не раскрывают.
Это объём текста, который модель держит перед глазами во время ответа, включая ваш запрос, историю чата, приложенные файлы и сам ответ. В документации Anthropic на 14 сентября 2026 года у старших моделей окно доходит до одного миллиона токенов, а один ответ ограничен ста двадцатью восемью тысячами.
Потому что чем больше заполнено окно, тем труднее модели удержать важное. Разработчики признают это прямо и называют отдельным явлением: рост объёма ухудшает точность и способность вспомнить нужный фрагмент. Практический вывод простой: длинный чат стоит заменять новым с короткой выжимкой.
Потому что модель работает не словами, а токенами, и расход почти линейно зависит от их количества. На странице тарифов Anthropic 14 сентября 2026 года цены указаны именно так: за миллион входных и миллион выходных токенов, отдельно для каждой модели и отдельно для чтения и записи кеша.
Да, при прочих равных. Английские слова чаще укладываются в один токен, а русские словоформы дробятся на несколько. То есть один и тот же смысл на русском занимает больше токенов, а значит больше денег и больше места в окне контекста.
Это способ подать модели ваши документы в момент ответа вместо того, чтобы полагаться на её память. Система находит нужные куски в вашей базе и кладёт их в контекст запроса. Так модель перестаёт вспоминать и начинает читать, и число выдумок резко падает.
Да, есть открытые модели, которые работают локально, но ожидания надо снизить. Домашняя видеокарта тянет модели поменьше, они заметно слабее облачных в длинных рассуждениях и в русском языке. Зато данные не покидают компьютер и лимитов нет.
С точки зрения устройства она выбирает наиболее вероятное продолжение. Практически это даёт поведение, которое выглядит как понимание в большинстве бытовых задач, и ломается там, где нужна проверяемая точность: числа, даты, ссылки, редкие факты.
Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.
Посмотреть, что внутриtelegram
Канал с полезными материалами про нейросети
Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.