Kimi (Moonshot AI)

21 июля 2026 · ~13 мин чтения

llm ai open-source китай moe

Kimi (Moonshot AI)

Kimi — семейство больших языковых моделей китайской компании Moonshot AI. Флагманская линейка K2 — открытая MoE-модель (Mixture of Experts, «смесь экспертов») примерно на триллион параметров, из которых на каждое слово реально работает лишь малая часть, — при этом по качеству она соревнуется с закрытыми западными флагманами, а стоит в разы дешевле.

История

Компания Moonshot AI основана в марте 2023 года в Пекине. Китайское название — 月之暗面, «Тёмная сторона Луны», прямая отсылка к альбому Pink Floyd «The Dark Side of the Moon». Основатель — Ян Чжилинь (Yang Zhilin), выпускник университета Цинхуа и Карнеги-Меллона, соавтор известных научных работ по архитектурам языковых моделей Transformer-XL и XLNet. То есть это не «предприниматель, нанявший инженеров», а исследователь, который сам стоял у истоков современных трансформеров (архитектура нейросетей, на которой построены все нынешние LLM).

Ключевые вехи:

Статус на сегодня: частная компания, один из «шести тигров ИИ» Китая (так пресса называет ведущие китайские ИИ-стартапы), среди инвесторов — Alibaba и Tencent.

Что это такое

Слово «Kimi» обозначает сразу три вещи, и их полезно различать.

Во-первых, это потребительский чат-бот — китайский аналог ChatGPT. Приложение и сайт, которыми пользуются десятки миллионов людей в Китае. Для нас он малоинтересен.

Во-вторых, это семейство моделей. Флагман — Kimi K2: гигантская модель на ~1,04 триллиона параметров общим объёмом, построенная по архитектуре MoE. Смысл MoE в том, что модель разбита на 384 «экспертов» (независимых блока нейросети), и для обработки каждого токена включаются только 8 из них плюс один общий. В итоге «активных» параметров всего ~32 миллиарда — модель думает как гигант, а вычислительных ресурсов ест как середняк. Это тот же принцип, что у DeepSeek-V3, и вообще архитектурно K2 — близкий родственник DeepSeek (больше экспертов, немного другие настройки внимания).

В-третьих, это API (программный интерфейс) — способ дёргать модель из своих скриптов и сервисов. API совместим с форматом OpenAI, то есть код, написанный под ChatGPT, переключается на Kimi заменой пары строк.

Ключевые пары для понимания:

Открытые веса — это не благотворительность

Стратегия та же, что у Meta с Llama и у DeepSeek: открытая модель мгновенно получает всемирное сообщество, интеграции во все инструменты и место в бенчмарках, а деньги компания зарабатывает на API, корпоративных продуктах и следующих закрытых версиях. Для тебя как потребителя это означает конкуренцию и низкие цены — но не гарантию, что следующая версия тоже будет открытой.

Аналогии из жизни

Бригада узких специалистов на стройке (про MoE). Вместо одного мастера-универсала, который делает всё подряд, у тебя штат из 384 узких специалистов, и на каждую операцию прораб вызывает восьмерых нужных. Платишь только вышедшим на смену, а не всему штату. Где работает: хорошо передаёт главную идею — огромная суммарная «квалификация» при небольших затратах на каждый отдельный шаг. Где ломается: у реальной MoE-модели «эксперты» — не понятные людям специальности вроде «сантехник» и «электрик». Роутер (управляющая сеть) распределяет работу по математическим признакам, и один «эксперт» может участвовать и в стихах, и в коде. Никто, включая авторов модели, не может сказать, «за что отвечает» конкретный эксперт.

Чертежи станка в открытом доступе (про открытые веса). Завод выложил полные чертежи своего лучшего станка: бери, строй у себя, дорабатывай. Где работает: передаёт суть свободы — независимость от производителя, возможность модификаций, нулевая цена лицензии. Где ломается: чертежи — это статичная вещь, а веса модели без описания того, на каких данных и как её учили, — «станок без техпроцесса». Ты можешь его использовать и даже дообучить, но не можешь проверить, что именно в него заложили, — например, какие темы модель обучена обходить.

Авиалоукостер (про цену). Билет из пункта А в пункт Б в пять раз дешевле, летит тот же маршрут. Где работает: хорошо описывает экономику — задачи вроде классификации текстов Kimi решает на уровне дорогих моделей за малую долю цены. Где ломается: у лоукостера дешевизна достигается урезанием сервиса, а у K2 качество на многих задачах реально флагманское. Зато «аэропорт дальше от города»: экосистема беднее — меньше готовых интеграций, тонкой документации, гарантий SLA (соглашение об уровне сервиса), и на сложных многошаговых рассуждениях западные флагманы всё ещё чаще оказываются точнее.

Как это работает

Пройдём путь одного запроса и заодно посмотрим, чем K2 отличается «под капотом».

Шаг 1. Текст превращается в токены. Твой промт (запрос) режется на токены — куски слов. «Проверь этот лид» — это 4–6 токенов.

Шаг 2. Роутинг по экспертам. Каждый токен проходит через 61 слой нейросети. В MoE-слоях стоит роутер — маленькая сеть, которая для каждого токена выбирает 8 из 384 экспертов (плюс один общий эксперт, работающий всегда). Выбранные эксперты обрабатывают токен, их ответы смешиваются с весами, которые назначил роутер. Именно поэтому из ~1,04 трлн параметров на каждый токен работает только ~32 млрд: остальные эксперты в этот момент просто лежат в памяти.

Шаг 3. Внимание на длинном контексте. Механизм внимания (attention — способ модели «смотреть» на все предыдущие слова разом) у K2 устроен по схеме MLA (Multi-head Latent Attention — сжатое представление истории диалога), унаследованной от DeepSeek. Это позволяет держать контекст 128–256 тысяч токенов, не взрывая память.

Шаг 4. Генерация. Модель предсказывает следующий токен, добавляет его к тексту, и цикл повторяется — токен за токеном, пока не соберётся ответ.

Чем K2 выделяется в обучении. Две вещи, которые Moonshot подчёркивает в техническом отчёте:

  1. MuonClip — собственный оптимизатор (алгоритм, управляющий процессом обучения). Обучение гигантских моделей часто «взрывается» — числа внутри сети уходят в бесконечность, и недели вычислений идут насмарку. Moonshot заявляет, что прогнала через K2 15,5 триллиона токенов без единого такого срыва — за счёт приёма qk-clip, который придерживает разгоняющиеся значения внимания.
  2. Агентное пост-обучение. После базовой тренировки модель гоняли по огромному массиву синтетических (сгенерированных) сценариев «вызови инструмент → посмотри результат → реши, что дальше». Поэтому K2 так хороша в режиме агента — когда модель не просто отвечает текстом, а работает: запускает код, ищет, правит файлы.

Схема запроса через OpenRouter (агрегатор моделей, через который вчера и шёл A/B-тест):

твой скрипт ──HTTP──▶ OpenRouter ──▶ провайдер инференса (Moonshot/Groq/…)
     ▲                                        │
     └────────── JSON-ответ модели ◀──────────┘

OpenRouter принимает запрос в формате OpenAI, сам выбирает провайдера, который физически крутит веса K2, и возвращает ответ. Смена модели — одна строка: "model": "moonshotai/kimi-k2".

Где встречается в обычной жизни

Где встречается в IT и бизнесе

Дешёвый токен не равно дешёвая задача

Сравнивать модели по прайсу за миллион токенов — ловушка. Рассуждающие модели «думают» длинно и сжигают в разы больше токенов на ту же задачу; слабая модель может требовать повторных прогонов и ручных проверок. Считай цену за решённую задачу — за валидированный лид, за обработанный документ, — как и было сделано во вчерашнем A/B-тесте.

Кто пользуется

Порядок цен для ориентира (по состоянию на конец 2025 года, проверяй актуальность): API Kimi K2 стоил около $0,6 за миллион входных токенов и $2,5 за миллион выходных — против $3/$15 у Claude Sonnet того же периода. Разница в 5–6 раз на равной задаче.

Альтернативы и конкуренты

Когда НЕ стоит использовать

Связанные понятия

Литература и источники

Где встретилось у меня

Вчера в рабочем проекте шёл A/B-тест валидатора лидов: одни и те же заявки прогонялись через DeepSeek и через Kimi K2.5 по OpenRouter, чтобы сравнить качество разметки и посчитать цену за один провалидированный лид. Kimi всплывала в переписке постоянно — как один из двух финалистов на роль «рабочей лошадки» пайплайна.

Краткое резюме