Термины · LLM

Что такое LLM: 6 ответов про большие языковые модели

Три буквы встречаются в каждой второй статье про ИИ, и почти нигде не сказано, что именно делает модель «большой». Разберём термин по частям: параметры, контекст, токены и цена за миллион, с цифрами из документации и тарифов на 14 сентября 2026 года.

Кирилл СандаковКирилл СандаковВайбкодер, предприниматель, продюсерОпубликовано 14.09.202611 мин чтения

В статьях про ИИ три буквы LLM ставят как само собой разумеющееся, а расшифровка обычно заканчивается на «большая языковая модель», что объясняет ровно ничего. LLM это нейросеть, обученная на текстах предсказывать следующий кусочек текста, и «большая» здесь означает конкретное: миллиарды настраиваемых чисел внутри и окно контекста, измеряемое сотнями тысяч токенов.

Все цифры ниже сняты 14 сентября 2026 года: окно контекста и лимит ответа из документации разработчика, цены за миллион токенов со страницы тарифов, которая с московского адреса открывается нормально, порог «миллиард параметров» из текста закона. Дальше по порядку: расшифровка, разница с нейросетью, параметры, контекст, цена, обучение, границы и локальный запуск.

Главное в одну строку

LLM это языковая модель с миллиардами параметров, у которой есть рабочая память в виде окна контекста, и платят за неё по количеству токенов, а не сообщений.


Часть 1 · Ответ

Что такое LLM, если коротко

  1. Large. Миллиарды параметров и терабайты текста при обучении.
  2. Language. Работает с текстом как с последовательностью токенов.
  3. Model. Файл с весами плюс код, который эти веса применяет.
  4. Что делает. Предсказывает следующий токен, и из этого складывается связный ответ.
  5. Чего не делает. Не хранит факты списком и не проверяет их.

Часть 2 · Расшифровка

Что в аббревиатуре значит каждое слово

Языковая модель как понятие старше нынешнего бума: так называли ещё простые статистические системы, подсказывавшие следующее слово в телефоне. Новым стало слово «большая», и оно поменяло свойства класса.

  • Языковая модель. Программа, оценивающая вероятность следующего элемента текста. Раньше по паре предыдущих слов, теперь по всему разговору.
  • Большая. На порядки больше параметров и данных. В какой-то момент от количества пошло качество: модель начала решать задачи, которым её прямо не учили.
  • Фундаментальная. Термин из документов и закона: модель, на основе которой делают другие продукты, а не решение под одну задачу.
  • Генеративная. Не классифицирует, а создаёт новое: текст, код, иногда изображение и звук в той же архитектуре.

Часть 3 · Разграничение

Чем LLM отличается от нейросети вообще

Вопрос звучит часто, а ответ короткий: отношение целого и части. Всякая LLM это нейросеть, но не всякая нейросеть это LLM.

  • Нейросеть для распознавания. Получает картинку, выдаёт метку: номер машины, тип дефекта, лицо на фото. Текста не порождает.
  • Нейросеть для генерации изображений. Строит картинку по описанию, устроена иначе и токенами текста не оперирует.
  • LLM. Читает и пишет последовательности токенов, ведёт диалог, работает с кодом и таблицами как с текстом.
  • Мультимодальная LLM. Та же языковая модель, которой добавили вход для изображений и звука. Основа при этом всё равно текстовая.

Базовые определения и разница между искусственным интеллектом и нейросетью разобраны в гайде про нейросети простыми словами, чтобы не повторять их здесь.


Часть 4 · Размер

Что такое параметры и почему их считают миллиардами

Параметр это число внутри модели, которое было подобрано при обучении. Ничего человекочитаемого в нём нет: нельзя открыть файл и найти строку про столицу Франции. Знание размазано по всем весам сразу.

Из текста закона, открыт 14.09.2026

Федеральный закон от 26 июля 2026 года № 243-ФЗ, статья 3, определяет большую фундаментальную модель как программу, обучающуюся на составах данных, являющуюся основой для создания и доработки другого программного обеспечения и содержащую не менее одного миллиарда параметров. Это первый российский нормативный документ, где размер модели зафиксирован конкретным числом.

Практический смысл размера для пользователя такой: больше параметров обычно означает лучшее понимание сложных запросов и более дорогой ответ. Но связка не прямая, и модель поменьше с хорошим промтом и вашими документами часто обыгрывает гиганта, которому не дали контекста.


Часть 5 · Память

Контекстное окно: рабочая память, а не знания

Это понятие путают со знаниями модели чаще всего. Окно контекста не про то, что модель выучила, а про то, сколько текста она видит прямо сейчас.

Из документации разработчика, открыта 14.09.2026

В документации Anthropic контекстное окно названо рабочей памятью модели и прямо отделено от корпуса, на котором она обучалась. У старших моделей окно составляет один миллион токенов, у части прежних двести тысяч, один ответ ограничен ста двадцатью восемью тысячами токенов, а в один запрос помещается до шестисот изображений или страниц PDF. Там же сказано, что с ростом заполнения окна точность и способность вспомнить нужное снижаются.

  • Что попадает в окно. Системная инструкция, вся история чата, приложенные файлы, описания инструментов и сам ответ.
  • Что из этого следует. Длинная переписка не бесплатна и не безопасна для качества.
  • Как с этим жить. Новый чат под новую задачу, короткая выжимка вместо всей истории, документы прикладывать по делу, а не «на всякий случай».

Часть 6 · Определитель

Какие цифры важны и что они означают

Характеристики языковых моделей и их практический смысл
ХарактеристикаЧто означаетНа что влияет
Параметрычисла внутри моделиёмкость и цена ответа
Окно контекстасколько текста видно за раздлина документа и чата
Лимит ответамаксимум токенов в одном ответеобъём генерации за раз
Цена за миллион токеновтариф отдельно на вход и выходсчёт при работе через ключ
Кеш запросаповторное использование части контекстаэкономию на длинных инструкциях
Режим рассужденийдополнительные шаги перед ответомкачество на сложных задачах и расход
Мультимодальностьвход не только текстомработу с картинками и PDF

Часть 7 · Деньги

Почему счёт идёт за миллион токенов

В чате вы платите подпиской, а при работе через программный ключ платите по факту. Единицей стала не страница и не запрос, а миллион токенов, потому что именно от них зависит нагрузка.

Со страницы тарифов, открыта из Москвы 14.09.2026

На claude.com/pricing цены указаны за миллион токенов отдельно на вход и выход: Fable 5.1 десять и пятьдесят долларов, Opus 5 пять и двадцать пять, Sonnet 5 два и десять, Haiku 4.5 один и пять. Отдельно тарифицируются чтение и запись кеша, а пакетная обработка даёт скидку в половину стоимости.

Отсюда два вывода. Первый: выход почти всегда дороже входа, поэтому просить краткий ответ выгоднее, чем потом сокращать длинный. Второй: русский текст расходует больше токенов на ту же мысль, и это заметно на длинных документах. Подробный разбор счёта в гайде про токены.


Часть 8 · Обучение

Как языковую модель делают из груды текста

  1. Предобучение. Модель угадывает продолжение на гигантском корпусе, за счёт чего усваивает грамматику, стиль, факты и структуры рассуждений.
  2. Дообучение на инструкциях. Её учат отвечать на просьбы, а не продолжать текст бесконечно.
  3. Настройка по человеческим оценкам. Люди выбирают лучшие ответы, модель подстраивается. Отсюда же вежливость и склонность соглашаться.
  4. Специализация. Отдельные версии затачивают под код, длинные документы или скорость.
  5. Дальше обучение прекращается. В диалоге веса не меняются. Всё, что выглядит как «она меня запомнила», обеспечивают функции памяти на стороне сервиса.

Часть 9 · Границы

Где языковая модель ломается предсказуемо

  • Точные факты по памяти. Числа, даты, номера статей, цитаты, ссылки. Модель достроит правдоподобное, если не знает точного.
  • Арифметика в уме. Длинные вычисления лучше отдавать калькулятору или коду, а не просить посчитать текстом.
  • Свежие события. Без подключённого поиска модель живёт в мире на момент обучения.
  • Длинный контекст. Формально миллион токенов помещается, фактически из середины начинают выпадать детали.
  • Согласие вместо спора. На прямой вопрос «я прав» вы получите подтверждение чаще, чем возражение.

Что с этим делать по шагам, разобрано в гайде про галлюцинации.


Часть 10 · Свои данные

Как заставить модель работать по вашим документам

Самый надёжный способ снизить выдумки это перестать спрашивать модель о фактах и начать давать ей факты вместе с вопросом.

  • Просто приложить файл. Работает для одного документа и коротких задач.
  • Собрать базу и искать по ней. Система находит нужные фрагменты и кладёт их в контекст. Это и называется RAG, разбор в отдельном гайде.
  • Дать инструменты. Модель сама сходит в поиск, базу или файловую систему. Так работают агенты, разбор в гайде про ИИ-агентов.
  • Чего это не отменяет. Проверки. Модель может исказить даже то, что прочитала, особенно в числах.

Часть 11 · Локально

Можно ли держать языковую модель у себя

Можно, и для части задач это разумно: данные не уходят наружу, лимитов нет, платить помесячно не надо. Но ожидания стоит поставить честно.

  • Что нужно. Видеокарта с достаточным объёмом памяти или свежий ноутбук с большим объёмом оперативной памяти.
  • Что получится. Модели поменьше: они хороши в переводе, суммаризации и простом коде, слабее в длинных рассуждениях и в русском.
  • Чем это запускают. Готовые оболочки, которые ставятся в пару кликов, разбор в гайде про Ollama.
  • Кому не стоит. Если задача разовая, облачный чат дешевле и быстрее любой домашней сборки.

Памятка

Что стоит запомнить про LLM

Коротко

  • LLM это языковая модель с миллиардами параметров.
  • В законе порог большой модели прописан числом: от миллиарда параметров.
  • Параметры хранят закономерности, а не список фактов.
  • Контекстное окно это рабочая память, а не знания.
  • У старших моделей окно доходит до миллиона токенов, ответ до ста двадцати восьми тысяч.
  • Чем полнее окно, тем хуже модель помнит середину.
  • Платят за миллион токенов, отдельно за вход и выход.
  • Выход дороже входа, поэтому краткость выгодна дважды.
  • Русский текст расходует больше токенов, чем английский.
  • Лучший способ убрать выдумки это дать модели свои документы.

Источники

Что проверялось живьём и когда

  • Документация Anthropic по контекстному окну, открыта 14.09.2026: окно до одного миллиона токенов у старших моделей и двести тысяч у части прежних, лимит ответа сто двадцать восемь тысяч токенов, до шестисот изображений или страниц PDF в запросе, прямое признание деградации точности при заполнении окна.
  • Страница тарифов claude.com/pricing, открыта с московского адреса 14.09.2026 кодом 200: цены за миллион токенов по моделям и отдельная тарификация кеша, скидка на пакетную обработку.
  • Федеральный закон от 26.07.2026 № 243-ФЗ, статья 3, текст на официальном сайте Президента России, открыт 14.09.2026: определение большой фундаментальной модели и порог в один миллиард параметров.
  • Wordstat, Россия, 14.09.2026: частотность запросов про LLM, языковые модели и контекст.

Чего тут нет намеренно: сравнения моделей по баллам в тестах и точных размеров закрытых моделей. Первое устаревает быстрее, чем выходит статья, второе разработчики не публикуют, и любые «известные цифры» в обзорах это пересказ слухов.


FAQ

Частые вопросы

Что такое LLM простыми словами

Это большая языковая модель, то есть нейросеть, обученная на огромном объёме текста предсказывать продолжение. Слово «большая» тут не фигура речи: речь о миллиардах настраиваемых чисел внутри. Именно такие модели работают в чатах, помощниках по коду и поиске с генеративным ответом.

Чем LLM отличается от нейросети

LLM это частный случай нейросети, заточенный под текст. Нейросетью называют и модель, распознающую номера машин, и генератор картинок. Языковая модель отличается тем, что работает с последовательностью токенов и выдаёт текст, а не метку класса или изображение.

Что такое параметры модели и сколько их

Параметры это числа, которые подбираются при обучении и хранят выученные закономерности. В российском законе от 26 июля 2026 года порог большой фундаментальной модели зафиксирован прямо: не менее одного миллиарда параметров. У массовых моделей счёт идёт на сотни миллиардов, точные цифры разработчики обычно не раскрывают.

Что такое контекстное окно

Это объём текста, который модель держит перед глазами во время ответа, включая ваш запрос, историю чата, приложенные файлы и сам ответ. В документации Anthropic на 14 сентября 2026 года у старших моделей окно доходит до одного миллиона токенов, а один ответ ограничен ста двадцатью восемью тысячами.

Почему при длинном чате качество падает

Потому что чем больше заполнено окно, тем труднее модели удержать важное. Разработчики признают это прямо и называют отдельным явлением: рост объёма ухудшает точность и способность вспомнить нужный фрагмент. Практический вывод простой: длинный чат стоит заменять новым с короткой выжимкой.

Почему цена считается за миллион токенов

Потому что модель работает не словами, а токенами, и расход почти линейно зависит от их количества. На странице тарифов Anthropic 14 сентября 2026 года цены указаны именно так: за миллион входных и миллион выходных токенов, отдельно для каждой модели и отдельно для чтения и записи кеша.

Русский текст дороже английского

Да, при прочих равных. Английские слова чаще укладываются в один токен, а русские словоформы дробятся на несколько. То есть один и тот же смысл на русском занимает больше токенов, а значит больше денег и больше места в окне контекста.

Что такое RAG и зачем он нужен

Это способ подать модели ваши документы в момент ответа вместо того, чтобы полагаться на её память. Система находит нужные куски в вашей базе и кладёт их в контекст запроса. Так модель перестаёт вспоминать и начинает читать, и число выдумок резко падает.

Можно ли запустить LLM на своём компьютере

Да, есть открытые модели, которые работают локально, но ожидания надо снизить. Домашняя видеокарта тянет модели поменьше, они заметно слабее облачных в длинных рассуждениях и в русском языке. Зато данные не покидают компьютер и лимитов нет.

LLM понимает смысл или просто угадывает

С точки зрения устройства она выбирает наиболее вероятное продолжение. Практически это даёт поведение, которое выглядит как понимание в большинстве бытовых задач, и ломается там, где нужна проверяемая точность: числа, даты, ссылки, редкие факты.


Читать дальше

ИИ-офис
Собери свой ИИ-офис и перестань делать руками то, что делает нейросеть

Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.

Посмотреть, что внутри

telegram

Канал с полезными материалами про нейросети

Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.

Перейти в канал
Кирилл Сандаков

Об авторе

Кирилл Сандаков

Вайбкодер, предприниматель, продюсер

Завайбкодил контент-ферму на США в Instagram (более 300 тыс. подписчиков, среди читателей Дональд Трамп Младший), создатель платформы и сообщества ИИ-офис, автор блога о нейросетях «Выжимаем из ИИ Максимум».

Все статьи автора