DeepSeek

20 августа 2026 · ~13 мин чтения

сервис llm ии китай open-source

DeepSeek

DeepSeek — китайская ИИ-компания из Ханчжоу и одноимённое семейство больших
языковых моделей с открытыми весами. Прославилась тем, что в январе 2025 года
показала качество уровня лучших западных моделей при затратах на обучение
в разы меньше — и обрушила за один день капитализацию Nvidia на рекордные
в истории биржи ~600 миллиардов долларов.

История

История DeepSeek начинается не с ИИ-стартапа, а с хедж-фонда. В середине
2010-х в Ханчжоу работал квантовый фонд High-Flyer (по-китайски «Хуаньфан») —
«квантовый» здесь значит quantitative (торгующий по математическим моделям,
а не по интуиции трейдеров). Его сооснователь Лян Вэньфэн (Liang Wenfeng),
инженер по образованию, годами закупал видеокарты Nvidia для торговых
алгоритмов — по разным оценкам, к моменту введения американских экспортных
ограничений 2022 года у фонда скопилось порядка 10 тысяч ускорителей A100.
Это важная деталь: у будущей ИИ-компании уже было главное и самое дефицитное —
вычислительный кластер.

В июле 2023 года Лян выделил ИИ-направление в отдельную компанию — DeepSeek.
Декларируемая цель звучала необычно для Китая тех лет: не быстрые коммерческие
продукты, а фундаментальные исследования и AGI (искусственный интеллект
общего назначения). Вехи дальше:

Статус сегодня: частная компания, финансируется High-Flyer, CEO — Лян Вэньфэн.
Флагманские веса публикуются открыто на Hugging Face.

Что это такое

DeepSeek — это одновременно три вещи, и их полезно различать.

Во-первых, компания — исследовательская лаборатория с необычной для отрасли
экономикой: её содержит хедж-фонд, поэтому ей не нужно срочно «отбиваться»
подписками и рекламой. Отсюда стратегия открытых весов: модели выкладываются
целиком, зарабатывает компания на API и репутации.

Во-вторых, семейство моделей. Основная линейка V (V2, V3, V3.1…) — модели
общего назначения, линейка R (R1) — «рассуждающие»: перед ответом модель
генерирует длинную цепочку размышлений (chain-of-thought), что резко улучшает
математику, код и многошаговую логику. Плюс специализированные: Coder, Math,
VL (мультимодальная, с картинками).

В-третьих, сервис: чат chat.deepseek.com (бесплатный), мобильное приложение
и API для разработчиков, совместимый по формату с API OpenAI — в большинстве
случаев достаточно поменять адрес сервера и ключ.

Ключевые различия с соседями по рынку:

Аналогии из жизни

Лоукостер (Ryanair, «Победа»). Та же перевозка из точки А в точку Б, что и
у классической авиакомпании, но в разы дешевле — за счёт беспощадной
оптимизации каждой статьи расходов: один тип самолётов, быстрые развороты,
никакого бесплатного багажа. DeepSeek так же выжал стоимость из каждого этапа:
MoE вместо «плотной» модели, обучение в формате FP8, дешёвые ночные тарифы на
инференс. Где ломается: у лоукостера дешевизна честно оплачена комфортом —
ты это чувствуешь сразу. У DeepSeek качество на многих задачах не хуже
дорогих конкурентов; скидка оплачена не качеством ответов, а вещами, которые
видно не сразу: юрисдикцией данных, цензурными ограничениями, меньшими
гарантиями стабильности API.

Дженерик-лекарство. Аптечный аналог брендового препарата за 10% цены:
действующее вещество то же, эффект тот же. Похоже на «GPT-качество за копейки».
Где ломается: дженерик — это законная копия чужой формулы после истечения
патента. DeepSeek ничью формулу не копировал — он сам изобрёл несколько
приёмов (MLA, GRPO), которые потом стала изучать вся отрасль. Аналогия
несправедливо принижает инженерный вклад.

Штатное расписание больницы (для MoE). В больнице сотни врачей-специалистов,
но на твой конкретный случай зовут двух-трёх профильных, а не весь штат сразу.
Так же MoE-модель: из 671 миллиарда параметров на каждое слово «выходят на
смену» только ~37 миллиардов — маршрутизатор решает, какие «эксперты» нужны.
Где ломается: врачи, которые сегодня не понадобились, могут уйти домой.
А все «эксперты» модели обязаны постоянно сидеть в памяти видеокарт — экономится
вычисление, но не память. Поэтому дешёвая в работе модель всё равно требует
дорогого железа для запуска.

Как это работает

Разберём путь от нажатия Enter до ответа — и почему это стоит дёшево.

Шаг 1. Токенизация. Твой текст режется на токены (кусочки слов). Дальше
всё происходит с числовыми представлениями этих кусочков.

Шаг 2. Маршрутизация (MoE). Классическая «плотная» (dense) модель прогоняет
каждый токен через все свои параметры. DeepSeek-V3 устроена иначе: в каждом
слое стоит маршрутизатор (router), который для каждого токена выбирает
несколько «экспертов» — небольших специализированных подсетей — из сотен
доступных. Работают только выбранные. Итог: модель «знает» на 671 миллиард
параметров, а «думает» на каждый токен всего ~37 миллиардами. Расход
вычислений — как у модели в 18 раз меньше.

Шаг 3. Внимание с компрессией (MLA). Механизм внимания (attention) требует
держать в памяти «кэш» всех предыдущих токенов разговора — на длинных диалогах
это гигабайты. Изобретение DeepSeek — Multi-head Latent Attention: кэш
сжимается в компактное латентное (скрытое, промежуточное) представление и
разворачивается на лету. Память под кэш падает на порядок, значит на ту же
видеокарту влезает больше параллельных пользователей — прямая экономия.

Шаг 4. Генерация. Токены выдаются по одному, каждый следующий — с учётом
всех предыдущих. В «рассуждающем» режиме (R1, V3.1-thinking) модель сначала
пишет скрытую цепочку рассуждений и только потом — финальный ответ. Платишь
за токены размышлений тоже, но качество на сложных задачах заметно выше.

Как это обучали — три этапа:

  1. Претрейнинг: модель читает триллионы токенов текста (у V3 — 14,8 трлн)
    и учится предсказывать следующий токен. DeepSeek делал это в формате FP8
    (8-битные числа вместо обычных 16-битных) — вдвое меньше памяти и трафика
    между картами, одна из причин дешевизны.
  2. SFT (supervised fine-tuning): дообучение на примерах «вопрос — хороший
    ответ», модель учится быть ассистентом.
  3. RL (обучение с подкреплением): модель решает задачи, за верные ответы
    получает «награду». Для R1 использовали собственный алгоритм GRPO (Group
    Relative Policy Optimization) — и показали знаменитый результат R1-Zero:
    способность к рассуждению у модели «выросла» из чистого RL, почти без
    человеческих примеров. Это был главный научный вклад январского релиза.

Почему «дёшево» оказалось так громко

До января 2025 рынок верил в простую формулу: качество = деньги × чипы. Экспортные ограничения на чипы, казалось, гарантировали отставание Китая. DeepSeek показал, что инженерная изобретательность частично заменяет железо — и именно это, а не сама модель, обрушило акции Nvidia: инвесторы испугались, что чипов миру нужно меньше, чем закладывали в прогнозы. Забегая вперёд — страх оказался преувеличенным: дешёвый инференс разогнал спрос на ИИ, и потребление чипов только выросло (это называют парадоксом Джевонса).

Где встречается в обычной жизни

Где встречается в IT и бизнесе

Кто пользуется

Альтернативы и конкуренты

Когда НЕ стоит использовать

Дёшево — не значит без счёта

Рассуждающие модели тратят токены на «размышления»: один сложный запрос к R1 может съесть в 5–10 раз больше выходных токенов, чем обычный ответ. При массовых прогонах сначала померь реальный расход на сотне примеров, потом умножай на объём — «копеечная» модель на миллионе записей всё ещё стоит денег.

Связанные понятия

Литература и источники

Где встретилось у меня

Вчера сверял эталонный прогон Claude Opus с историческими вердиктами DeepSeek
во внутреннем конвейере валидации лидов: два набора оценок по одним и тем же
данным, разбор всех расхождений и итоговый отчёт. Попутно всплыл поучительный
режим отказа — часть записей вообще осталась без вердикта из-за ошибки оплаты
на стороне API-агрегатора, и конвейер молча пропустил их как «чистые»
(fail-open) — отдельный урок про то, что дешёвый API тоже требует контроля
ошибок.

Краткое резюме