LLM (большая языковая модель)
LLM (большая языковая модель)
LLM (Large Language Model, большая языковая модель) — это нейросеть с
миллиардами настраиваемых параметров, обученная на огромных объёмах текста
предсказывать следующий фрагмент слова. Из этой простой задачи — «угадай
продолжение» — вырастает способность писать код, отвечать на вопросы,
переводить и рассуждать.
История
- 2017, США, Google. Восемь исследователей (Ашиш Васвани, Ноам Шазир,
Якоб Ушкорейт и другие) публикуют статью «Attention Is All You Need» —
архитектуру трансформер (transformer). До этого нейросети читали текст
последовательно, слово за словом, и «забывали» начало длинных фраз.
Трансформер смотрит на весь текст сразу через механизм внимания
(attention) — и его легко масштабировать на тысячи видеокарт. - 2018. OpenAI выпускает GPT-1 (117 млн параметров) и показывает: если
просто учить трансформер предсказывать следующее слово на большом корпусе
текста, он выучивает язык. Google в том же году выпускает BERT. - 2020. GPT-3 — 175 млрд параметров. Скачок не в архитектуре, а в
размере: модель внезапно умеет то, чему её не учили специально — переводить,
писать код, решать задачки. В том же году выходит работа про «законы
масштабирования» (scaling laws): качество растёт предсказуемо с ростом
данных, параметров и вычислений. - 30 ноября 2022. OpenAI открывает ChatGPT. За два месяца — примерно
100 млн пользователей, самый быстрый рост потребительского продукта в
истории на тот момент. - 2023–2026. Гонка: Anthropic (Claude), Google (Gemini), Meta (Llama,
открытые веса), китайские DeepSeek и Qwen. Модели становятся
мультимодальными (текст + картинки + аудио), учатся «думать» перед ответом
и работать агентами — самостоятельно выполнять многошаговые задачи.
Что это такое
Формально LLM — это гигантская математическая функция. На входе — текст,
превращённый в числа. На выходе — распределение вероятностей: какой фрагмент
текста, скорее всего, идёт дальше. Всё. Никакой базы фактов, никакой логики
в привычном смысле, никакого «понимания» в человеческом смысле — только
миллиарды чисел (параметров), подобранных так, чтобы предсказание было
максимально точным.
Магия в том, что для по-настоящему хорошего предсказания следующего слова
модели приходится выучить очень многое. Чтобы продолжить фразу «столица
Франции — …», нужно знать географию. Чтобы продолжить «def sort_users(…»,
нужно знать Python. Чтобы продолжить диалог врача с пациентом — понимать
медицину и стиль речи обоих. Так задача «угадай следующее слово» превращает
статистическую машину в универсального помощника.
Важные различия с похожими вещами:
- LLM vs поисковик. Поисковик находит существующие документы и даёт
ссылки. LLM генерирует новый текст из «сжатых» знаний, впитанных при
обучении. Поисковик не ответит на вопрос, которого нет в документах; LLM
ответит всегда — иногда неверно. - LLM vs классический ML. Классическая модель машинного обучения решает
одну задачу (отличить спам от не-спама) и требует обучения под неё. LLM —
универсал: одна и та же модель пишет код, переводит и суммирует, задачу ей
ставят обычным текстом (промптом). - LLM vs база знаний. База знаний хранит факты точно и умеет их
обновлять. LLM «помнит» факты приблизительно, как человек — начитанный, но
без справочника под рукой, и знания у неё заморожены на дате окончания
обучения.
Ключевая мысль
LLM не «ищет ответ» и не «вспоминает факт» — она каждый раз заново генерирует текст, который статистически похож на правильный ответ. Чаще всего похожий на правильный текст и есть правильный. Но не всегда — и в этом корень всех «галлюцинаций».
Аналогии из жизни
- T9 на стероидах. Клавиатура телефона предлагает следующее слово — LLM
делает то же самое, только учитывает не два последних слова, а сотни
страниц контекста. Где работает: честно передаёт механику — предсказание
следующего фрагмента, одного за другим. Где ломается: T9 знает лишь
частоты пар слов, а LLM моделирует глубокие связи — стиль, логику
повествования, структуру кода. Сказать «это просто T9» — всё равно что
сказать «гроссмейстер просто двигает фигурки». - Эрудит, прочитавший всю библиотеку, но без доступа к ней. Отвечает
быстро, по памяти, на любую тему. Где работает: объясняет и широту
знаний, и устаревание (читал до определённой даты), и приблизительность.
Где ломается: живой эрудит чувствует границу своих знаний и скажет «не
помню». LLM устроена так, что всегда генерирует уверенное продолжение —
осознание собственного незнания в неё встроено плохо. - Повар, выучивший все кулинарные книги мира, но никогда не пробовавший
еду. Напишет рецепт идеально — по текстам других поваров. Где
работает: хорошо передаёт, что знания LLM — из текстов, а не из
собственного опыта взаимодействия с миром. Где ломается: современные
модели уже «пробуют еду» — им дают инструменты: выполнить код, посмотреть
результат, поискать в интернете. Агентные системы как раз замыкают этот
цикл обратной связи.
Как это работает
Разберём путь одного запроса — от твоего текста до ответа.
Шаг 1. Токенизация. Текст режется на токены (token — кусочек слова,
обычно 3–5 букв или целое короткое слово). «Идемпотентность» — это примерно
4–5 токенов, «cat» — один. У каждой модели свой словарь на десятки тысяч
токенов. Именно в токенах измеряют и лимиты, и цену API.
Шаг 2. Эмбеддинги. Каждый токен превращается в вектор (embedding —
список из тысяч чисел), кодирующий его смысл. Слова «король» и «королева»
получают близкие векторы — смысл похож.
Шаг 3. Слои внимания. Векторы проходят через десятки одинаковых слоёв
трансформера. В каждом слое механизм внимания (attention) позволяет каждому
токену «посмотреть» на все остальные и решить, какие из них важны для его
смысла. Во фразе «бот упал, потому что он не обработал ошибку» слово «он»
через внимание связывается с «бот». Слой за слоем модель строит всё более
абстрактное представление: сначала грамматика, потом смысл фразы, потом
логика всего документа.
Шаг 4. Предсказание. На выходе — вероятность для каждого токена словаря
быть следующим. Скажем: «ошибку» — 40%, «исключение» — 25%, «таймаут» — 10%…
Шаг 5. Сэмплирование. Модель выбирает один токен — не всегда самый
вероятный. Параметр temperature управляет случайностью: 0 — всегда самый
вероятный (предсказуемо, для кода и фактов), выше — разнообразнее (для
креатива). Поэтому один и тот же вопрос может давать разные ответы.
Шаг 6. Цикл. Выбранный токен дописывается к тексту, и всё повторяется
с шага 1 — токен за токеном, пока не сгенерируется специальный токен «стоп».
Это называется автогрессивной генерацией (autoregressive — каждый следующий
шаг зависит от собственных предыдущих выводов).
твой промпт → [токенизация] → [слои внимания × N] → вероятности
↑ ↓
└────────── дописать выбранный токен ←── [сэмплирование]
А до этого модель прошла три этапа обучения: претрейн (pre-training —
месяцы на тысячах GPU, триллионы токенов из интернета и книг, задача —
предсказание следующего токена), дообучение на инструкциях (SFT —
примеры «вопрос → хороший ответ», чтобы модель отвечала, а не просто
продолжала текст) и обучение с обратной связью от людей (RLHF — люди
сравнивают варианты ответов, модель учится предпочитать полезные и
безопасные).
Контекстное окно — сколько токенов модель видит за раз (у современных
моделей — от 128 тысяч до миллиона+). Всё, что не влезло, для модели не
существует. Именно поэтому в длинных сессиях Claude Code сжимает
(компактирует) историю диалога.
Где встречается в обычной жизни
- Клавиатура телефона подсказывает следующее слово — это маленькая
языковая модель, прабабушка LLM. - Голосовые ассистенты (Алиса, Siri) — новые поколения отвечают через
LLM, а не по заготовленным сценариям. - Переводчики (Google Translate, DeepL, Яндекс Переводчик) — трансформер
и был изначально придуман для машинного перевода. - Чат поддержки банка или магазина — первый рубеж всё чаще LLM-бот,
который понимает вопрос свободной формы, а не только кнопки. - «Кратко о письме» в почте, суммаризация звонков в мессенджерах,
автоответы — всё это LLM, встроенная в привычные продукты.
Где встречается в IT и бизнесе
- Генерация и ревью кода. Claude Code, GitHub Copilot, Cursor. Нужно,
когда рутинную инженерную работу можно описать словами. - Обработка неструктурированного текста в структуру. Из письма, звонка
или анкеты вытащить JSON с полями: имя, бюджет, намерение. Классический ML
требовал бы разметки тысяч примеров — LLM хватает промпта со схемой
(structured output). Нужно, когда данных мало, а форматов много. - Анализ звонков и переписок. Транскрибация (речь → текст) плюс LLM:
оценка качества менеджера, выделение возражений, тегирование лидов. - RAG (Retrieval-Augmented Generation). LLM плюс поиск по своей базе
документов: сначала найти релевантные куски, потом сгенерировать ответ на
их основе. Нужно, когда ответы должны опираться на внутренние актуальные
данные, а не на «замороженные» знания модели. - Агенты. LLM в цикле «подумай → вызови инструмент → посмотри результат
→ повтори»: мониторинг конкурентов, автосборка отчётов, ведение CRM.
Нужно, когда задача многошаговая и заранее не расписывается в жёсткий
алгоритм.
Кто пользуется
- OpenAI (ChatGPT) — по публичным заявлениям 2025 года, сотни миллионов
пользователей в неделю; крупнейший потребительский AI-продукт. - Anthropic (Claude) — упор на надёжность и агентные сценарии; Claude
Code — та самая LLM в терминале, логи которой стали источником этой статьи. - Google (Gemini) — встроена в Поиск, Gmail, Docs и Android — то есть
доносится до миллиардов пользователей. - Meta (Llama) — открытые веса; на Llama и её производных работает
огромная часть самостоятельно развёрнутых (self-hosted) LLM в компаниях. - DeepSeek, Qwen (Alibaba) — китайские модели; DeepSeek в начале 2025
года показал, что модель уровня лидеров можно обучить в разы дешевле, чем
считалось. - Microsoft — Copilot во всём Office; Сбер (GigaChat) и Яндекс
(YandexGPT, Алиса) — российские LLM в экосистемных продуктах.
Альтернативы и конкуренты
- Классический ML (логистическая регрессия, градиентный бустинг).
Плюсы: дёшево, быстро, предсказуемо, объяснимо; идеально для табличных
данных. Минусы: одна модель — одна задача, нужна размеченная выборка, с
произвольным текстом работает плохо. - Правила и шаблоны (rule-based, regex). Плюсы: стопроцентная
предсказуемость, нулевая цена за запрос, легко отлаживать. Минусы:
ломаются на любой формулировке, которую автор правил не предусмотрел;
поддержка превращается в болото. - Малые специализированные модели (BERT-подобные классификаторы, NER).
Плюсы: в сотни раз дешевле LLM на узкой задаче, можно хостить на одном
сервере. Минусы: под каждую задачу — своё обучение; не генерируют текст. - Человек. Плюсы: настоящая ответственность, здравый смысл, работа с
нестандартными случаями. Минусы: дорого, медленно, не масштабируется на
тысячи запросов в час.
Когда НЕ стоит использовать
- Точная арифметика и критичные расчёты — потому что LLM генерирует
правдоподобный текст, а не вычисляет; «примерно 42» в бухгалтерии не
подходит. Правильно: пусть LLM пишет формулу или код, а считает калькулятор. - Ответы, которые обязаны быть на 100% верными без проверки (юридические
справки, медицина, цены в договоре) — потому что галлюцинации неустранимы
полностью; нужен либо человек-контролёр, либо RAG с проверкой источников. - Простые массовые задачи с жёстким бюджетом — потому что если задачу
решает regex или классификатор за копейки, LLM на миллионе запросов в день
— это тысячи долларов и секунды задержки там, где хватило бы миллисекунд.
Про данные
Всё, что ты отправляешь в облачную LLM, уходит на чужие серверы. Персональные данные клиентов, договоры, финансовые детали — только при явном на то праве: обезличивание, on-premise модель или корпоративный контракт с провайдером, где прописано неиспользование данных для обучения.
Связанные понятия
- Трансформер (transformer) — архитектура нейросети с механизмом
внимания, на которой построены все современные LLM. - Токен (token) — минимальный кусочек текста для модели; единица
измерения контекста и цены API. - Контекстное окно (context window) — максимум токенов, который модель
видит за один запрос. - Галлюцинация (hallucination) — уверенный, но фактически неверный ответ
модели. - RAG (Retrieval-Augmented Generation) — связка «поиск по своим данным +
генерация ответа на их основе». - RLHF (Reinforcement Learning from Human Feedback) — дообучение модели
на человеческих оценках, делающее её полезной и безопасной. - MoE (Mixture of Experts) — способ строить огромные модели, активируя
на каждый токен лишь часть параметров (разбирали в статье от 2026-06-18).
Литература и источники
- «Attention Is All You Need» — Vaswani et al., 2017 (en), та самая статья
про трансформер: https://arxiv.org/abs/1706.03762 - Wikipedia: «Large language model» (en) и «Большая языковая модель» (ru) —
хороший обзор с историей и ссылками. - Andrej Karpathy, «Intro to Large Language Models» (en, видео ~1 час) —
лучшее нетехническое введение от сооснователя OpenAI; искать на YouTube. - 3Blue1Brown, серия «Neural networks» — главы про трансформеры и внимание
(en, есть русские субтитры) — визуальное объяснение механики. - Себастьян Рашка, «Build a Large Language Model (From Scratch)», 2024 (en)
— для желающих собрать маленькую LLM руками. - Документация Anthropic (docs.claude.com, en) — практические главы про
промптинг, контекст и агентов.
Где встретилось у меня
Вчера весь день собирал систему бизнес-агентов: мониторинг трендов, разбор
звонков через транскрибацию, автоматические отчёты. LLM была центральным
узлом каждого пайплайна — выбор модели под задачу, structured output, чтобы
ответы ложились в базу, и ревью безопасности всей конструкции. Стало ясно,
что «мозг» всех этих агентов — одно и то же понятие, и его стоит разобрать.
Краткое резюме
- LLM — нейросеть-трансформер, обученная предсказывать следующий токен;
из этой задачи вырастают все её умения. - Она генерирует правдоподобный текст, а не ищет факты — отсюда и сила
(универсальность), и слабость (галлюцинации). - Контекстное окно — рабочая память модели: что не влезло, того для неё нет.
- В бизнесе LLM сильнее всего там, где много неструктурированного текста:
звонки, письма, документы, код. - Не подходит для точных вычислений и непроверяемых критичных ответов;
для массовых простых задач часто избыточна и дорога.