DeepSeek
DeepSeek
DeepSeek — китайская ИИ-компания из Ханчжоу и одноимённое семейство больших
языковых моделей с открытыми весами. Прославилась тем, что в январе 2025 года
показала качество уровня лучших западных моделей при затратах на обучение
в разы меньше — и обрушила за один день капитализацию Nvidia на рекордные
в истории биржи ~600 миллиардов долларов.
История
История DeepSeek начинается не с ИИ-стартапа, а с хедж-фонда. В середине
2010-х в Ханчжоу работал квантовый фонд High-Flyer (по-китайски «Хуаньфан») —
«квантовый» здесь значит quantitative (торгующий по математическим моделям,
а не по интуиции трейдеров). Его сооснователь Лян Вэньфэн (Liang Wenfeng),
инженер по образованию, годами закупал видеокарты Nvidia для торговых
алгоритмов — по разным оценкам, к моменту введения американских экспортных
ограничений 2022 года у фонда скопилось порядка 10 тысяч ускорителей A100.
Это важная деталь: у будущей ИИ-компании уже было главное и самое дефицитное —
вычислительный кластер.
В июле 2023 года Лян выделил ИИ-направление в отдельную компанию — DeepSeek.
Декларируемая цель звучала необычно для Китая тех лет: не быстрые коммерческие
продукты, а фундаментальные исследования и AGI (искусственный интеллект
общего назначения). Вехи дальше:
- Ноябрь 2023 — DeepSeek Coder, первая заметная модель для генерации кода,
с открытыми весами. Следом — DeepSeek LLM 67B, конкурент Llama 2. - Май 2024 — DeepSeek-V2. Архитектура MoE (Mixture of Experts, «смесь
экспертов») на 236 миллиардов параметров, из которых на каждый токен работает
только ~21 миллиард. Модель оказалась настолько дешёвой в эксплуатации, что
развязала ценовую войну на китайском рынке ИИ-API — местные гиганты (Alibaba,
Baidu, Tencent) были вынуждены резать цены следом. - Декабрь 2024 — DeepSeek-V3: 671 миллиард параметров (активных ~37 млрд).
В техническом отчёте компания заявила, что финальный прогон обучения занял
2,788 миллиона GPU-часов на «урезанных» под экспортные ограничения картах
H800 — примерно 5,6 миллиона долларов по аренде. Цифра стала мемом: у западных
флагманов бюджеты обучения оценивались в сотни миллионов. Важно: это стоимость
только финального прогона, без экспериментов, зарплат и самого кластера. - 20 января 2025 — DeepSeek-R1, «рассуждающая» (reasoning) модель уровня
OpenAI o1, выложенная под свободной лицензией MIT. Через неделю приложение
DeepSeek стало №1 в американском App Store, а 27 января акции Nvidia упали
примерно на 17% — минус ~590 миллиардов долларов капитализации за день,
крупнейшая дневная потеря стоимости одной компании в истории фондового рынка
США. Этот эпизод так и называют — «DeepSeek moment». - 2025 — обновления R1 (майский R1-0528), V3.1 (гибрид «думающего» и
быстрого режимов, август 2025), экспериментальная V3.2 с разреженным
вниманием (sparse attention) и очередным снижением цен. Что вышло позже —
точно не знаю, проверь на официальном сайте deepseek.com.
Статус сегодня: частная компания, финансируется High-Flyer, CEO — Лян Вэньфэн.
Флагманские веса публикуются открыто на Hugging Face.
Что это такое
DeepSeek — это одновременно три вещи, и их полезно различать.
Во-первых, компания — исследовательская лаборатория с необычной для отрасли
экономикой: её содержит хедж-фонд, поэтому ей не нужно срочно «отбиваться»
подписками и рекламой. Отсюда стратегия открытых весов: модели выкладываются
целиком, зарабатывает компания на API и репутации.
Во-вторых, семейство моделей. Основная линейка V (V2, V3, V3.1…) — модели
общего назначения, линейка R (R1) — «рассуждающие»: перед ответом модель
генерирует длинную цепочку размышлений (chain-of-thought), что резко улучшает
математику, код и многошаговую логику. Плюс специализированные: Coder, Math,
VL (мультимодальная, с картинками).
В-третьих, сервис: чат chat.deepseek.com (бесплатный), мобильное приложение
и API для разработчиков, совместимый по формату с API OpenAI — в большинстве
случаев достаточно поменять адрес сервера и ключ.
Ключевые различия с соседями по рынку:
- DeepSeek vs OpenAI/Anthropic: у западных флагманов веса закрыты — модель
можно арендовать, но не забрать. Веса DeepSeek открыты: скачивай и запускай
на своём железе, если оно есть (для полной V3 нужен серьёзный кластер). - DeepSeek vs Llama (Meta): обе линейки открытые, но лицензия DeepSeek
(MIT у R1/V3) свободнее, чем условия Llama, а по качеству топовые DeepSeek
дольше держались вровень с закрытыми флагманами. - DeepSeek vs Qwen (Alibaba): главный внутрикитайский конкурент. Qwen берёт
широтой линейки (от крошечных до огромных, много размеров), DeepSeek —
агрессивной ценой и исследовательскими прорывами. - Открытые веса ≠ open source: открыт результат обучения (веса), но не
обучающие данные и не весь код пайплайна. Это важная терминологическая
тонкость — «опенсорсной» модель называют с натяжкой.
Аналогии из жизни
Лоукостер (Ryanair, «Победа»). Та же перевозка из точки А в точку Б, что и
у классической авиакомпании, но в разы дешевле — за счёт беспощадной
оптимизации каждой статьи расходов: один тип самолётов, быстрые развороты,
никакого бесплатного багажа. DeepSeek так же выжал стоимость из каждого этапа:
MoE вместо «плотной» модели, обучение в формате FP8, дешёвые ночные тарифы на
инференс. Где ломается: у лоукостера дешевизна честно оплачена комфортом —
ты это чувствуешь сразу. У DeepSeek качество на многих задачах не хуже
дорогих конкурентов; скидка оплачена не качеством ответов, а вещами, которые
видно не сразу: юрисдикцией данных, цензурными ограничениями, меньшими
гарантиями стабильности API.
Дженерик-лекарство. Аптечный аналог брендового препарата за 10% цены:
действующее вещество то же, эффект тот же. Похоже на «GPT-качество за копейки».
Где ломается: дженерик — это законная копия чужой формулы после истечения
патента. DeepSeek ничью формулу не копировал — он сам изобрёл несколько
приёмов (MLA, GRPO), которые потом стала изучать вся отрасль. Аналогия
несправедливо принижает инженерный вклад.
Штатное расписание больницы (для MoE). В больнице сотни врачей-специалистов,
но на твой конкретный случай зовут двух-трёх профильных, а не весь штат сразу.
Так же MoE-модель: из 671 миллиарда параметров на каждое слово «выходят на
смену» только ~37 миллиардов — маршрутизатор решает, какие «эксперты» нужны.
Где ломается: врачи, которые сегодня не понадобились, могут уйти домой.
А все «эксперты» модели обязаны постоянно сидеть в памяти видеокарт — экономится
вычисление, но не память. Поэтому дешёвая в работе модель всё равно требует
дорогого железа для запуска.
Как это работает
Разберём путь от нажатия Enter до ответа — и почему это стоит дёшево.
Шаг 1. Токенизация. Твой текст режется на токены (кусочки слов). Дальше
всё происходит с числовыми представлениями этих кусочков.
Шаг 2. Маршрутизация (MoE). Классическая «плотная» (dense) модель прогоняет
каждый токен через все свои параметры. DeepSeek-V3 устроена иначе: в каждом
слое стоит маршрутизатор (router), который для каждого токена выбирает
несколько «экспертов» — небольших специализированных подсетей — из сотен
доступных. Работают только выбранные. Итог: модель «знает» на 671 миллиард
параметров, а «думает» на каждый токен всего ~37 миллиардами. Расход
вычислений — как у модели в 18 раз меньше.
Шаг 3. Внимание с компрессией (MLA). Механизм внимания (attention) требует
держать в памяти «кэш» всех предыдущих токенов разговора — на длинных диалогах
это гигабайты. Изобретение DeepSeek — Multi-head Latent Attention: кэш
сжимается в компактное латентное (скрытое, промежуточное) представление и
разворачивается на лету. Память под кэш падает на порядок, значит на ту же
видеокарту влезает больше параллельных пользователей — прямая экономия.
Шаг 4. Генерация. Токены выдаются по одному, каждый следующий — с учётом
всех предыдущих. В «рассуждающем» режиме (R1, V3.1-thinking) модель сначала
пишет скрытую цепочку рассуждений и только потом — финальный ответ. Платишь
за токены размышлений тоже, но качество на сложных задачах заметно выше.
Как это обучали — три этапа:
- Претрейнинг: модель читает триллионы токенов текста (у V3 — 14,8 трлн)
и учится предсказывать следующий токен. DeepSeek делал это в формате FP8
(8-битные числа вместо обычных 16-битных) — вдвое меньше памяти и трафика
между картами, одна из причин дешевизны. - SFT (supervised fine-tuning): дообучение на примерах «вопрос — хороший
ответ», модель учится быть ассистентом. - RL (обучение с подкреплением): модель решает задачи, за верные ответы
получает «награду». Для R1 использовали собственный алгоритм GRPO (Group
Relative Policy Optimization) — и показали знаменитый результат R1-Zero:
способность к рассуждению у модели «выросла» из чистого RL, почти без
человеческих примеров. Это был главный научный вклад январского релиза.
Почему «дёшево» оказалось так громко
До января 2025 рынок верил в простую формулу: качество = деньги × чипы. Экспортные ограничения на чипы, казалось, гарантировали отставание Китая. DeepSeek показал, что инженерная изобретательность частично заменяет железо — и именно это, а не сама модель, обрушило акции Nvidia: инвесторы испугались, что чипов миру нужно меньше, чем закладывали в прогнозы. Забегая вперёд — страх оказался преувеличенным: дешёвый инференс разогнал спрос на ИИ, и потребление чипов только выросло (это называют парадоксом Джевонса).
Где встречается в обычной жизни
- Приложение и чат DeepSeek. Бесплатный ассистент без жёстких лимитов —
именно поэтому в январе 2025 приложение возглавило App Store в десятках
стран: людям впервые дали «уровень GPT» бесплатно и без подписки. - Внутри других приложений. Из-за дешёвого API DeepSeek встраивают в
переводчики, «умные» заметочники, чат-ботов поддержки — пользователь видит
«ИИ-функцию», не зная, чья модель отвечает. - Китайские сервисы и техника. Модели DeepSeek интегрировали десятки
китайских компаний — от автопроизводителей до телекома; если пользуешься
китайским гаджетом с ИИ-ассистентом, шанс встретить DeepSeek высок. - Локальные ассистенты энтузиастов. Дистиллированные (уменьшенные путём
переноса знаний от большой модели к малой) версии R1 люди запускают на
обычных ПК через Ollama или LM Studio — «свой ChatGPT без интернета». - Школьные и студенческие лайфхаки. Бесплатность плюс сильная математика
сделали DeepSeek популярным решателем домашек — со всеми вытекающими.
Где встречается в IT и бизнесе
- Снижение стоимости LLM-конвейеров. Классический ход: прототип строят на
дорогой модели, потом массовые однотипные задачи (классификация, извлечение
данных, скоринг) переводят на DeepSeek — счёт за API падает в разы. Нужно,
когда объём запросов большой, а задача формализуемая. - Валидация и разметка данных. Прогнать сотни тысяч записей через LLM
для оценки «спам/не спам», «лид/мусор» — по ценам западных флагманов больно,
по ценам DeepSeek — приемлемо. - Эталонные сравнения (A/B моделей). Из-за дешевизны DeepSeek часто ставят
«вторым мнением» рядом с основной моделью — расхождения вердиктов
подсвечивают спорные случаи. Ровно такой сценарий был у меня вчера. - Self-hosted развёртывания. Компании с жёсткими требованиями к данным
(медицина, финансы, госсектор дружественных юрисдикций) разворачивают
открытые веса на своём железе — данные не покидают контур. - Исследования и обучение. Открытые веса плюс подробные технические
отчёты — готовый учебный материал; университеты и лаборатории строят на
DeepSeek собственные эксперименты, не сжигая бюджеты на обучение с нуля.
Кто пользуется
- Разработчики через агрегаторы: на OpenRouter (маркетплейс LLM-API)
модели DeepSeek стабильно в топах по объёму трафика — их выбирают за
соотношение цена/качество. - Китайские корпорации: интеграции анонсировали Tencent (в WeChat),
автопроизводители (BYD и другие), телеком-операторы, производители
смартфонов. Масштабы — сотни миллионов конечных пользователей. - Облачные платформы: Microsoft Azure, Amazon Bedrock и Nvidia NIM добавили
R1 в свои каталоги моделей уже через недели после релиза — редкий случай для
китайской модели. - Энтузиасты локального запуска: дистилляты R1 (7B, 14B, 32B, 70B) — из
самых скачиваемых моделей на Hugging Face; счёт загрузок шёл на миллионы
в первые месяцы. - Точных публичных цифр по выручке и MAU у компании нет — она частная и
непрозрачная; оценки аудитории приложения в начале 2025 колебались в районе
десятков миллионов пользователей в месяц.
Альтернативы и конкуренты
- OpenAI (GPT/o-серия). Плюсы: самая широкая экосистема, мультимодальность,
надёжный enterprise-API. Минусы: закрытые веса, цены на флагманы в разы выше. - Anthropic Claude. Плюсы: сильнейшие модели для кода и длинных документов,
аккуратность в следовании инструкциям. Минусы: закрытые веса, премиальный
ценник. - Qwen (Alibaba). Плюсы: огромная линейка открытых моделей всех размеров,
сильная мультиязычность. Минусы: та же китайская юрисдикция у API; бренд
менее «громкий» на Западе. - Llama (Meta). Плюсы: зрелая экосистема инструментов для локального
запуска, американская юрисдикция. Минусы: лицензия с ограничениями, флагманы
последних поколений отставали от топов рынка.
Когда НЕ стоит использовать
- Персональные и чувствительные данные через официальные API/приложение —
потому что серверы и юрисдикция — КНР, политика обработки данных
непрозрачна, а регуляторы ряда стран (Италия, Южная Корея, Австралия — для
госустройств) уже вводили запреты. Для таких данных — только self-hosted
вариант или другая модель. - Задачи, где ответ касается политически чувствительных для Китая тем —
потому что модель обучена уходить от них или отвечать в русле официальной
позиции; для аналитики, медиа и исследований это систематическое искажение. - Критичный продакшен без запасного варианта — потому что API DeepSeek
переживал длительные деградации под наплывом пользователей (январь–февраль
2025 — хрестоматийный случай), а SLA-гарантии слабее, чем у гиперскейлеров.
Нужен фолбэк на вторую модель.
Дёшево — не значит без счёта
Рассуждающие модели тратят токены на «размышления»: один сложный запрос к R1 может съесть в 5–10 раз больше выходных токенов, чем обычный ответ. При массовых прогонах сначала померь реальный расход на сотне примеров, потом умножай на объём — «копеечная» модель на миллионе записей всё ещё стоит денег.
Связанные понятия
- MoE (Mixture of Experts) — архитектура «много экспертов, работают
избранные»; разбирали её отдельной статьёй 18 июня. - Дистилляция (knowledge distillation) — перенос способностей большой
модели в маленькую через обучение на её ответах. - Инференс (inference) — этап работы обученной модели (в отличие от
обучения); именно его стоимость DeepSeek радикально снизил. - Open weights — публикация весов модели без обучающих данных и пайплайна;
«открытая модель» ≠ «open source» в строгом смысле. - RLHF / RL — обучение с подкреплением (по человеческим оценкам или
проверяемым наградам); фундамент «рассуждающих» моделей. - Контекстное окно — сколько токенов модель видит за раз; у DeepSeek
типично 64–128 тысяч, меньше, чем у некоторых западных флагманов.
Литература и источники
- Технический отчёт «DeepSeek-V3 Technical Report» (2024, en) — на arXiv.org;
главный первоисточник по архитектуре и стоимости обучения. - Статья «DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via
Reinforcement Learning» (2025, en) — тоже arXiv; про R1-Zero и GRPO. - Wikipedia (en): статья «DeepSeek» — хроника компании и «DeepSeek moment»,
https://en.wikipedia.org/wiki/DeepSeek - Официальная документация API — api-docs.deepseek.com (актуальные цены и
лимиты; цифры из статей быстро устаревают). - Интервью Лян Вэньфэна изданию 36Kr в переводе (en) — искать в Google по
запросу «Liang Wenfeng interview translation deepseek 36kr»; редкий взгляд
на мотивацию основателя. - Разбор экономики MoE-моделей — искать «why is deepseek so cheap MLA MoE
explained»; хороших разборов много, выбирай свежие.
Где встретилось у меня
Вчера сверял эталонный прогон Claude Opus с историческими вердиктами DeepSeek
во внутреннем конвейере валидации лидов: два набора оценок по одним и тем же
данным, разбор всех расхождений и итоговый отчёт. Попутно всплыл поучительный
режим отказа — часть записей вообще осталась без вердикта из-за ошибки оплаты
на стороне API-агрегатора, и конвейер молча пропустил их как «чистые»
(fail-open) — отдельный урок про то, что дешёвый API тоже требует контроля
ошибок.
Краткое резюме
- DeepSeek — китайская лаборатория (Ханчжоу, с 2023, на деньги хедж-фонда
High-Flyer), делающая модели уровня западных флагманов с открытыми весами. - Главный прорыв — цена: MoE + MLA + FP8 снизили стоимость обучения и
инференса на порядок; январь 2025 («DeepSeek moment») переоценил всю
экономику отрасли и стоил Nvidia рекордных ~590 млрд долларов за день. - R1 доказала, что способность рассуждать выращивается чистым обучением
с подкреплением — научный вклад, а не только удешевление. - Сильные стороны: цена, открытые веса (MIT), математика и код; слабые:
юрисдикция данных, цензура, стабильность API. - Практический паттерн: массовые формализуемые задачи — на дешёвой модели,
спорные случаи и эталоны — на дорогой, и обязательно контроль ошибок API.