Kimi (Moonshot AI)
Kimi (Moonshot AI)
Kimi — семейство больших языковых моделей китайской компании Moonshot AI. Флагманская линейка K2 — открытая MoE-модель (Mixture of Experts, «смесь экспертов») примерно на триллион параметров, из которых на каждое слово реально работает лишь малая часть, — при этом по качеству она соревнуется с закрытыми западными флагманами, а стоит в разы дешевле.
История
Компания Moonshot AI основана в марте 2023 года в Пекине. Китайское название — 月之暗面, «Тёмная сторона Луны», прямая отсылка к альбому Pink Floyd «The Dark Side of the Moon». Основатель — Ян Чжилинь (Yang Zhilin), выпускник университета Цинхуа и Карнеги-Меллона, соавтор известных научных работ по архитектурам языковых моделей Transformer-XL и XLNet. То есть это не «предприниматель, нанявший инженеров», а исследователь, который сам стоял у истоков современных трансформеров (архитектура нейросетей, на которой построены все нынешние LLM).
Ключевые вехи:
- Октябрь 2023 — запуск чат-бота Kimi для китайского рынка. Главная фишка на старте — рекордно длинный контекст: модель «держала в голове» порядка 200 тысяч китайских иероглифов за раз, когда конкуренты работали с в разы меньшими объёмами.
- Февраль 2024 — инвестиционный раунд более 1 млрд долларов во главе с Alibaba. Оценка компании — около 2,5 млрд долларов, к концу 2024 года, по разным оценкам, выросла до ~3,3 млрд.
- Март 2024 — контекст чат-бота расширен до 2 миллионов иероглифов: в модель можно было «скормить» несколько толстых книг разом.
- Январь 2025 — Kimi K1.5, первая «рассуждающая» (reasoning) модель компании, обученная через обучение с подкреплением (reinforcement learning — модель учится на наградах за правильные ответы, а не только на примерах).
- 11 июля 2025 — главное событие: выход Kimi K2 с открытыми весами под модифицированной MIT-лицензией. Модель мгновенно стала одной из самых обсуждаемых открытых LLM в мире.
- Сентябрь 2025 — обновление K2-0905: контекст расширен до 256 тысяч токенов (токен — кусочек слова, единица, которой модель «ест» текст).
- Ноябрь 2025 — Kimi K2 Thinking: рассуждающая версия, умеющая чередовать «размышления» с вызовом инструментов (поиск, код, браузер) сотни раз подряд.
- K2.5 — самая свежая линейка. Точных публичных деталей об архитектурных изменениях у меня нет — актуальное смотри в анонсах Moonshot AI и на их странице в Hugging Face.
Статус на сегодня: частная компания, один из «шести тигров ИИ» Китая (так пресса называет ведущие китайские ИИ-стартапы), среди инвесторов — Alibaba и Tencent.
Что это такое
Слово «Kimi» обозначает сразу три вещи, и их полезно различать.
Во-первых, это потребительский чат-бот — китайский аналог ChatGPT. Приложение и сайт, которыми пользуются десятки миллионов людей в Китае. Для нас он малоинтересен.
Во-вторых, это семейство моделей. Флагман — Kimi K2: гигантская модель на ~1,04 триллиона параметров общим объёмом, построенная по архитектуре MoE. Смысл MoE в том, что модель разбита на 384 «экспертов» (независимых блока нейросети), и для обработки каждого токена включаются только 8 из них плюс один общий. В итоге «активных» параметров всего ~32 миллиарда — модель думает как гигант, а вычислительных ресурсов ест как середняк. Это тот же принцип, что у DeepSeek-V3, и вообще архитектурно K2 — близкий родственник DeepSeek (больше экспертов, немного другие настройки внимания).
В-третьих, это API (программный интерфейс) — способ дёргать модель из своих скриптов и сервисов. API совместим с форматом OpenAI, то есть код, написанный под ChatGPT, переключается на Kimi заменой пары строк.
Ключевые пары для понимания:
- Kimi vs DeepSeek: оба — китайские открытые MoE-гиганты. DeepSeek исторически силён в математике и рассуждениях, K2 с самого релиза позиционировался как «агентная» модель — заточенная под вызов инструментов, написание кода и многошаговые задачи.
- Открытые веса vs open source: Moonshot выкладывает веса (обученные числа-параметры модели), но не тренировочные данные и не полный код обучения. Скачать и запустить — можно; воспроизвести с нуля — нет.
- Kimi vs GPT/Claude/Gemini: западные флагманы закрыты — их можно использовать только через API владельца. K2 можно скачать и крутить на своём железе, если у тебя есть серверы с достаточным объёмом видеопамяти (для полной модели — сотни гигабайт).
Открытые веса — это не благотворительность
Стратегия та же, что у Meta с Llama и у DeepSeek: открытая модель мгновенно получает всемирное сообщество, интеграции во все инструменты и место в бенчмарках, а деньги компания зарабатывает на API, корпоративных продуктах и следующих закрытых версиях. Для тебя как потребителя это означает конкуренцию и низкие цены — но не гарантию, что следующая версия тоже будет открытой.
Аналогии из жизни
Бригада узких специалистов на стройке (про MoE). Вместо одного мастера-универсала, который делает всё подряд, у тебя штат из 384 узких специалистов, и на каждую операцию прораб вызывает восьмерых нужных. Платишь только вышедшим на смену, а не всему штату. Где работает: хорошо передаёт главную идею — огромная суммарная «квалификация» при небольших затратах на каждый отдельный шаг. Где ломается: у реальной MoE-модели «эксперты» — не понятные людям специальности вроде «сантехник» и «электрик». Роутер (управляющая сеть) распределяет работу по математическим признакам, и один «эксперт» может участвовать и в стихах, и в коде. Никто, включая авторов модели, не может сказать, «за что отвечает» конкретный эксперт.
Чертежи станка в открытом доступе (про открытые веса). Завод выложил полные чертежи своего лучшего станка: бери, строй у себя, дорабатывай. Где работает: передаёт суть свободы — независимость от производителя, возможность модификаций, нулевая цена лицензии. Где ломается: чертежи — это статичная вещь, а веса модели без описания того, на каких данных и как её учили, — «станок без техпроцесса». Ты можешь его использовать и даже дообучить, но не можешь проверить, что именно в него заложили, — например, какие темы модель обучена обходить.
Авиалоукостер (про цену). Билет из пункта А в пункт Б в пять раз дешевле, летит тот же маршрут. Где работает: хорошо описывает экономику — задачи вроде классификации текстов Kimi решает на уровне дорогих моделей за малую долю цены. Где ломается: у лоукостера дешевизна достигается урезанием сервиса, а у K2 качество на многих задачах реально флагманское. Зато «аэропорт дальше от города»: экосистема беднее — меньше готовых интеграций, тонкой документации, гарантий SLA (соглашение об уровне сервиса), и на сложных многошаговых рассуждениях западные флагманы всё ещё чаще оказываются точнее.
Как это работает
Пройдём путь одного запроса и заодно посмотрим, чем K2 отличается «под капотом».
Шаг 1. Текст превращается в токены. Твой промт (запрос) режется на токены — куски слов. «Проверь этот лид» — это 4–6 токенов.
Шаг 2. Роутинг по экспертам. Каждый токен проходит через 61 слой нейросети. В MoE-слоях стоит роутер — маленькая сеть, которая для каждого токена выбирает 8 из 384 экспертов (плюс один общий эксперт, работающий всегда). Выбранные эксперты обрабатывают токен, их ответы смешиваются с весами, которые назначил роутер. Именно поэтому из ~1,04 трлн параметров на каждый токен работает только ~32 млрд: остальные эксперты в этот момент просто лежат в памяти.
Шаг 3. Внимание на длинном контексте. Механизм внимания (attention — способ модели «смотреть» на все предыдущие слова разом) у K2 устроен по схеме MLA (Multi-head Latent Attention — сжатое представление истории диалога), унаследованной от DeepSeek. Это позволяет держать контекст 128–256 тысяч токенов, не взрывая память.
Шаг 4. Генерация. Модель предсказывает следующий токен, добавляет его к тексту, и цикл повторяется — токен за токеном, пока не соберётся ответ.
Чем K2 выделяется в обучении. Две вещи, которые Moonshot подчёркивает в техническом отчёте:
- MuonClip — собственный оптимизатор (алгоритм, управляющий процессом обучения). Обучение гигантских моделей часто «взрывается» — числа внутри сети уходят в бесконечность, и недели вычислений идут насмарку. Moonshot заявляет, что прогнала через K2 15,5 триллиона токенов без единого такого срыва — за счёт приёма qk-clip, который придерживает разгоняющиеся значения внимания.
- Агентное пост-обучение. После базовой тренировки модель гоняли по огромному массиву синтетических (сгенерированных) сценариев «вызови инструмент → посмотри результат → реши, что дальше». Поэтому K2 так хороша в режиме агента — когда модель не просто отвечает текстом, а работает: запускает код, ищет, правит файлы.
Схема запроса через OpenRouter (агрегатор моделей, через который вчера и шёл A/B-тест):
твой скрипт ──HTTP──▶ OpenRouter ──▶ провайдер инференса (Moonshot/Groq/…)
▲ │
└────────── JSON-ответ модели ◀──────────┘
OpenRouter принимает запрос в формате OpenAI, сам выбирает провайдера, который физически крутит веса K2, и возвращает ответ. Смена модели — одна строка: "model": "moonshotai/kimi-k2".
Где встречается в обычной жизни
- Чат-боты поддержки и «умные» функции в приложениях. Когда сервис отвечает тебе осмысленным текстом, внутри всё чаще стоит не дорогой западный API, а открытая модель вроде Kimi или DeepSeek — для бизнеса это разница в расходах на порядок.
- Резюме звонков и встреч. Сервисы, которые присылают краткое содержание созвона, гоняют расшифровку через LLM. Длинный контекст Kimi — как раз про «переварить двухчасовую встречу целиком».
- Переводы и пересказы длинных документов. «Вставь договор — получи выжимку» — задача, ради которой Kimi изначально и делали с её огромным контекстом.
- Автоответы и сортировка почты. Фильтры «важное/спам/предложение» на базе LLM — типичная задача для дешёвой модели: миллионы писем, простое решение по каждому.
- Игровые и учебные ассистенты. Подсказки, объяснения, диалоговые NPC — везде, где нужно много генерации за маленькие деньги.
Где встречается в IT и бизнесе
- Массовая обработка текстов. Классификация лидов, тегирование обращений, извлечение полей из заявок. Нужно, когда объём большой, задача типовая, и платить флагманскую цену за каждый вызов бессмысленно. Ровно наш вчерашний случай: валидатор лидов, где важна цена за один размеченный лид.
- ИИ-агенты. Автоматизации, где модель сама вызывает инструменты: сходить в API, распарсить ответ, записать в таблицу. K2 обучали именно под это.
- Кодинг-ассистенты. K2 встроена в разные IDE-инструменты и агентские оболочки; на бенчмарках агентного программирования (SWE-bench и подобных) она с релиза держалась в лидерах среди открытых моделей.
- Self-hosting для приватности. Банки, медицина, госсектор — там, где данные нельзя отправлять во внешний API, открытые веса позволяют развернуть модель в своём контуре.
- Дистилляция и дообучение. Открытую модель можно дообучить на своих данных (например, на истории твоих продаж) — с закрытыми флагманами это либо невозможно, либо сильно ограничено.
Дешёвый токен не равно дешёвая задача
Сравнивать модели по прайсу за миллион токенов — ловушка. Рассуждающие модели «думают» длинно и сжигают в разы больше токенов на ту же задачу; слабая модель может требовать повторных прогонов и ручных проверок. Считай цену за решённую задачу — за валидированный лид, за обработанный документ, — как и было сделано во вчерашнем A/B-тесте.
Кто пользуется
- Потребительский Kimi в Китае — десятки миллионов пользователей (точные текущие цифры не назову; в пике хайпа 2024 года приложение было в топах китайских сторов).
- Провайдеры инференса — Groq, Together AI, Fireworks, DeepInfra и другие хостят K2 и продают доступ к ней; Groq известен экстремально быстрой генерацией (сотни токенов в секунду).
- OpenRouter — K2 стабильно в верхних строчках рейтинга популярности открытых моделей по реальному трафику; это хороший «народный» индикатор того, чем действительно пользуются разработчики.
- Агентские кодинг-инструменты — ряд оболочек для программирования с ИИ предлагают K2 как дешёвую альтернативу Claude и GPT для рутинных правок кода.
- Alibaba и Tencent — как инвесторы; Alibaba Cloud также предоставляет китайским компаниям инфраструктуру для работы с моделями Moonshot.
Порядок цен для ориентира (по состоянию на конец 2025 года, проверяй актуальность): API Kimi K2 стоил около $0,6 за миллион входных токенов и $2,5 за миллион выходных — против $3/$15 у Claude Sonnet того же периода. Разница в 5–6 раз на равной задаче.
Альтернативы и конкуренты
- DeepSeek (V3.x/R1) — главный «сосед» по нише. Плюсы: ещё агрессивнее по цене, сильная математика и рассуждения, огромное комьюнити. Минусы: агентные и кодинговые сценарии в среднем скромнее, чем у K2 (хотя разрыв плавает от версии к версии).
- Qwen (Alibaba) — самое широкое семейство открытых моделей: от крошечных до гигантских, с мультимодальностью (картинки, аудио). Плюсы: выбор размеров, отличная поддержка языков. Минусы: флагманские версии частично закрыты, в агентных задачах топ-Qwen обычно чуть позади K2.
- Llama (Meta) — прародитель открытой волны. Плюсы: максимальная экосистема и совместимость, все инструменты мира её поддерживают. Минусы: последние поколения разочаровали по качеству относительно китайских конкурентов.
- GPT / Claude / Gemini — закрытые флагманы. Плюсы: верх качества на сложных рассуждениях, зрелые экосистемы, надёжные SLA. Минусы: цена в разы выше, веса не скачать, данные уходят в чужой контур.
Когда НЕ стоит использовать
- Жёсткий комплаенс по юрисдикции данных. Если работаешь через API самой Moonshot, данные уходят на серверы китайской компании — для многих корпоративных и государственных заказчиков это стоп-фактор. Потому что регуляторные риски не лечатся качеством модели. Выход — западный провайдер инференса или self-hosting, но это надо явно проектировать.
- Задачи, где цена ошибки максимальна, а бюджет вторичен. Юридические заключения, медицина, сложная архитектура кода: на тонких многошаговых рассуждениях закрытые флагманы всё ещё стабильнее. Потому что экономия 80% на токенах не окупает один дорогой промах.
- Мультимодальные сценарии. Если нужно разбирать картинки, PDF со схемами или аудио — базовая линейка K2 текстовая; тут естественнее Qwen-VL, Gemini или GPT с их зрелым «зрением» (про возможности новейших K2.5 — проверь актуальные анонсы, точно не знаю).
Связанные понятия
- MoE (Mixture of Experts) — архитектура, где на каждый токен работает лишь часть параметров модели; фундамент K2 и DeepSeek.
- Открытые веса (open weights) — публикация обученных параметров модели без тренировочных данных и кода обучения.
- OpenRouter — агрегатор LLM-API: один ключ и один формат запросов ко множеству моделей разных компаний.
- Инференс (inference) — этап работы обученной модели, «прогон» запроса через веса; его продают провайдеры вроде Groq и Together.
- Reasoning-модель — модель, генерирующая скрытую цепочку рассуждений перед ответом; у Kimi это ветка K1.5 → K2 Thinking.
- Дистилляция — обучение маленькой модели на ответах большой, чтобы получить «сжатую» дешёвую копию.
Литература и источники
- «Kimi K2: Open Agentic Intelligence» — технический отчёт Moonshot AI (2025, en), лучший первоисточник про архитектуру и MuonClip; искать на arXiv по названию.
- Hugging Face: moonshotai — официальные карточки моделей K2/K2 Thinking с весами, лицензией и бенчмарками: huggingface.co/moonshotai.
- Документация Moonshot AI Platform — описание API, цены, лимиты; искать «Moonshot AI platform docs».
- Wikipedia (en): Moonshot AI — история компании, раунды инвестиций: en.wikipedia.org/wiki/Moonshot_AI.
- Технический отчёт DeepSeek-V3 (2024, en) — для понимания архитектуры, на которой основан и K2; искать «DeepSeek-V3 Technical Report» на arXiv.
- Рейтинги OpenRouter — живая статистика, какие модели реально используют: openrouter.ai/rankings.
Где встретилось у меня
Вчера в рабочем проекте шёл A/B-тест валидатора лидов: одни и те же заявки прогонялись через DeepSeek и через Kimi K2.5 по OpenRouter, чтобы сравнить качество разметки и посчитать цену за один провалидированный лид. Kimi всплывала в переписке постоянно — как один из двух финалистов на роль «рабочей лошадки» пайплайна.
Краткое резюме
- Kimi — семейство LLM китайской Moonshot AI (основана в 2023 году Ян Чжилинем); флагман K2 вышел в июле 2025-го с открытыми весами.
- Архитектура MoE: ~1 трлн параметров всего, ~32 млрд активных на токен — качество гиганта по цене середняка.
- Главная специализация K2 — агентные задачи: вызов инструментов, код, многошаговые автоматизации.
- Цена через API — в разы ниже западных флагманов, что делает Kimi кандидатом на массовые типовые задачи вроде валидации лидов.
- Открытые веса — это свобода запуска и дообучения, но не полный open source: данные и код обучения закрыты.
- Сравнивай модели не по цене за токен, а по цене за решённую задачу — именно так строился вчерашний A/B-тест.