Gemini
Gemini
Gemini — семейство больших языковых моделей Google DeepMind: флагманский
ИИ Google, который встроен в поиск, Android, Gmail и продаётся разработчикам
через API. Главные фишки — нативная мультимодальность (текст, картинки,
аудио, видео одним входом) и огромное контекстное окно в 1 миллион токенов.
История
Чтобы понять, откуда взялся Gemini, надо вспомнить два факта про Google.
Первый: сама архитектура, на которой работают все современные нейросети-чаты,
родилась внутри Google. В 2017 году восемь исследователей Google опубликовали
статью «Attention Is All You Need» и описали трансформер (transformer —
архитектура нейросети, где модель «взвешивает» связи между всеми словами
текста сразу). GPT от OpenAI, Claude от Anthropic, Llama от Meta — все они
потомки той статьи.
Второй: несмотря на это, эпоху чат-ботов Google проспал. Когда в ноябре 2022
OpenAI выпустила ChatGPT и за два месяца набрала 100 миллионов пользователей,
в Google, по сообщениям прессы, объявили внутренний «code red»: главный
бизнес компании — поиск — впервые за 20 лет получил реального конкурента.
Дальше события шли так:
- Февраль 2023 — Google спешно выпускает чат-бот Bard. Запуск выходит
скомканным: в рекламном ролике Bard ошибается в факте про телескоп
«Джеймс Уэбб», и акции Alphabet за день теряют около 100 миллиардов
долларов капитализации. - Апрель 2023 — Google объединяет два своих ИИ-подразделения, Google
Brain и DeepMind, в единую команду Google DeepMind под руководством
Демиса Хассабиса (сооснователь DeepMind, купленной Google в 2014).
Название Gemini («Близнецы») часто объясняют в том числе этим слиянием
двух команд. - 6 декабря 2023 — анонс Gemini 1.0 в трёх размерах: Ultra (самая
умная), Pro (рабочая лошадка), Nano (крошечная, работает прямо на
телефоне, впервые — на Pixel 8 Pro). - Февраль 2024 — Bard переименован в Gemini: бренд чат-бота и бренд
модели сливаются. Тогда же выходит Gemini 1.5 Pro с контекстным окном в
1 миллион токенов — на тот момент это на порядок больше, чем у
конкурентов. Параллельно Google выпускает Gemma — открытые
модели-родственники, которые можно скачать и запускать у себя. - Декабрь 2024 — Gemini 2.0: ставка на «агентность» (модель не только
отвечает, но и выполняет многошаговые задачи) и на дешёвую быструю
линейку Flash. - 2025 — поколение 2.5 с «рассуждающим» режимом (модель тратит
дополнительные токены на размышление перед ответом), затем начинают
появляться версии 3.x.
Текущий статус: Gemini — центральный ИИ-продукт Alphabet. Он отвечает на
запросы в AI Overviews в поиске Google, заменяет Google Assistant на
Android, пишет черновики в Gmail и Docs, а разработчикам продаётся через
Google AI Studio и Vertex AI. На агрегаторе OpenRouter вчерашний снимок
показывал 19 доступных по API моделей Gemini — от копеечной 2.5-flash-lite
до флагманских 3.1-pro.
Что это такое
Gemini — это не одна нейросеть, а линейка моделей разного размера и цены
под общим брендом. Понимать это важнее всего, потому что «подключить
Gemini» — это всегда выбор конкретной модели из линейки, и цена между
крайними вариантами отличается в десятки раз.
Размерные классы (сложилось три яруса):
- Pro — самые умные и дорогие. Для сложных задач: анализ, код,
длинные рассуждения. - Flash — средний ярус: заметно дешевле и быстрее, чуть проще. Для
массовых задач: чат-боты, суммаризация, классификация. - Flash-Lite / Nano — минимальные: Lite — самая дешёвая облачная
(вчерашний снимок цен: $0.10 за миллион входных токенов), Nano — вообще
работает на устройстве без интернета.
Теперь важные пары «X vs Y», где путаются чаще всего:
- Gemini vs ChatGPT. ChatGPT — продукт-чат от OpenAI, внутри которого
модели GPT. Gemini — и бренд моделей, и бренд чата Google одновременно
(после переименования Bard). Сравнивать честно: модели Gemini против
моделей GPT, приложение Gemini против приложения ChatGPT. - Gemini vs Gemma. Gemini — закрытые модели, доступ только через
облако Google. Gemma — открытые младшие родственники: веса можно скачать
и запустить на своём железе. - Модель vs приложение. «У меня Gemini на телефоне» и «мы используем
Gemini по API» — разные вещи: первое — готовый ассистент Google, второе
— доступ к «голой» модели, вокруг которой ты строишь своё.
Две технические особенности, которые выделяют Gemini среди конкурентов.
Первая — нативная мультимодальность: модель с самого начала обучалась
на тексте, изображениях, аудио и видео вместе, а не получила «прикрученное»
зрение позже. Ей можно отдать часовое видео или PDF со сканами — одним
запросом. Вторая — контекстное окно в 1 миллион токенов (1 048 576;
токен — кусочек текста, в среднем примерно 3–4 символа). Это порядка
700 тысяч слов: целая книжная полка помещается в один запрос.
Аналогии из жизни
Линейка двигателей одного автоконцерна. У производителя есть платформа
и на ней моторы: 1.2 для города, 2.0 для трассы, 3.0 turbo для тех, кому
надо всё. Gemini Pro / Flash / Flash-Lite — то же самое: одна «платформа»
(архитектура, обучение), разные мощность и расход. Выбор модели — как
выбор комплектации: переплачивать за 3.0, чтобы ездить за хлебом, глупо.
Где ломается: купленный двигатель годами остаётся тем же, а модели
обновляются раз в несколько месяцев, старые версии отключают, и «мотор»,
на котором ты построил продукт, может просто исчезнуть из прайса — с
железом такого не бывает.
Полиглот-референт со зрением и слухом. Обычные текстовые модели — как
референт, которому всё нужно надиктовывать письменно. Мультимодальный
Gemini — как сотрудник, которому можно бросить на стол фотографию счёта,
запись совещания и стопку документов: он сам посмотрит, послушает и
прочитает. Где ломается: человек, когда не понял, переспросит или
скажет «не разобрал почерк». Модель не скажет — она с уверенным лицом
выдаст правдоподобный ответ, даже если ошиблась (это называют
галлюцинацией), и проверка остаётся на тебе.
Тарифы электричества. Платишь за фактически потреблённые киловатты;
у входа и выхода разные счётчики. API-модели тарифицируются так же: отдельно
за входные токены (твой запрос и приложенные документы), отдельно — за
выходные (ответ модели), и выходные обычно в 4–8 раз дороже. Где
ломается: киловатт у любой розетки одинаков, а «токен у Gemini» и «токен
у Claude» — нет: у моделей разные токенизаторы (способы резать текст на
кусочки), разное качество ответа на тот же запрос, поэтому сравнивать
только цену за миллион токенов — как сравнивать тарифы, когда из одной
розетки течёт 220 вольт, а из другой 110.
Как это работает
Пройдём путь одного запроса к Gemini по API — без магии, по шагам.
-
Ты формируешь запрос. HTTP POST на эндпоинт Google (AI Studio /
Vertex AI) или агрегатора вроде OpenRouter. В запросе: идентификатор
модели (например,google/gemini-2.5-flash), сообщения, при
мультимодальном сценарии — картинки/аудио/видео, и параметры (лимит
ответа, температура — степень «творческости»). -
Вход превращается в токены. Текст режется токенизатором на кусочки;
картинки, аудио и видео тоже кодируются в последовательности токенов в
том же «пространстве». Именно поэтому Gemini «нативно мультимодален»:
для модели кадр видео и абзац текста — элементы одной последовательности. -
Работает трансформер с MoE. Начиная с версии 1.5 Gemini использует
архитектуру Mixture of Experts (смесь экспертов): внутри модели много
«подсетей»-экспертов, и на каждый токен активируется лишь малая часть.
Модель формально огромная, но на каждый шаг тратится вычислений как у
модели поменьше — так Google удерживает цены на Flash-линейке низкими. -
Железо — TPU. Почти вся индустрия обучает и запускает модели на
GPU NVIDIA, а Google — на собственных чипах TPU (Tensor Processing
Unit, тензорный процессор; разрабатываются с 2015 года).
Вертикальная интеграция — главный козырь
Google — единственный из большой тройки (OpenAI, Anthropic, Google), кто владеет всей вертикалью: свои чипы (TPU), свои дата-центры, свои данные (поиск, YouTube), свои модели и свои каналы дистрибуции (Android, Chrome, Workspace). Ему не нужно покупать GPU у NVIDIA и аренду у облаков — отсюда возможность демпинговать ценой Flash-моделей.
-
Генерация ответа. Модель предсказывает выходные токены по одному,
каждый следующий — с учётом всех предыдущих. В «рассуждающем» режиме
(у поколения 2.5+) модель сначала генерирует внутреннюю цепочку
размышлений и только потом ответ — качество выше, но и токенов (денег,
времени) уходит больше. -
Счёт. Биллинг считает входные и выходные токены отдельно. По
вчерашнему снимку цен OpenRouter: у 2.5-flash-lite это $0.10 за миллион
входных и $0.40 за миллион выходных, у 3.1-pro — $2.00 и $12.00. Разница
между соседними ярусами — в разы, между крайними — в сотню раз.
Отдельный практический момент — версии и алиасы. У Google в прайсе
одновременно живут: стабильные версии (gemini-2.5-flash), превью
(gemini-3-flash-preview — может измениться или исчезнуть) и плавающие
алиасы (gemini-flash-latest — указывает на «текущую» flash-модель и
молча переключается на новую при смене поколения).
Не строй прод на «-latest»
Плавающий алиас удобен для экспериментов, но в продакшене это бомба: Google выпускает новое поколение — и твой промт, отлаженный под старую модель, начинает работать иначе без единого изменения с твоей стороны. Правило: в проде пинить (фиксировать) конкретную версию модели и переезжать на новую осознанно, с тестами.
Где встречается в обычной жизни
- Гуглишь что-нибудь — и сверху над ссылками появляется сводка-ответ
AI Overviews. Это Gemini прочитал выдачу и пересказал её тебе. - Говоришь «Окей, Google» на новом Android — с 2024 года на большинстве
флагманов вместо старого Google Assistant отвечает Gemini. - Пишешь письмо в Gmail и жмёшь «Help me write» («Помоги написать») —
черновик генерирует Gemini, встроенный в Workspace. То же в Docs, Sheets,
Meet (автоконспекты встреч). - Фотографируешь документ на Pixel — суммаризация диктофонных записей,
умные ответы в мессенджерах и часть фотомагии работают на Gemini Nano
прямо на телефоне, без отправки в облако. - Пользуешься Samsung Galaxy — часть функций Galaxy AI (переводчик
звонков, суммаризация заметок) по партнёрству Samsung и Google тоже
работает на моделях Gemini.
Где встречается в IT и бизнесе
- Чат-боты и поддержка. Классика: Flash-модели дёшевы настолько, что
диалог с клиентом стоит доли цента. Нужно, когда трафик обращений большой,
а бюджет — нет. - Разбор документов и длинный контекст. Договор на 300 страниц, вся
переписка по проекту, база знаний целиком — влезают в окно в 1M токенов
одним запросом, без построения сложной поисковой прослойки (RAG —
retrieval-augmented generation, подмешивание найденных кусков в запрос).
Нужно, когда важна связность по всему массиву сразу. - Мультимодальные конвейеры. Распознать счёт-фактуру по фото, описать
дефект по видео с производства, вытащить данные из сканов — один API
вместо связки «OCR + отдельная LLM». - Массовая классификация и извлечение данных. Разметить миллион
отзывов, вытащить поля из тысяч анкет — работа для Flash-Lite: качество
достаточное, цена минимальная в индустрии. - Генерация изображений. Отдельные image-модели линейки (в снимке
OpenRouter их было четыре) генерируют и редактируют картинки — баннеры,
карточки товаров, иллюстрации.
Кто пользуется
- Сам Google — крупнейший пользователь: поиск (AI Overviews
показываются миллиардам пользователей), Android (несколько миллиардов
активных устройств), Workspace (по данным Google — миллиарды
пользователей сервисов), YouTube, Google Photos. - Samsung — функции Galaxy AI на флагманах частично работают на Gemini.
- Apple — по сообщениям СМИ, договорилась с Google об использовании
Gemini в обновлённой Siri; детали и сроки менялись, точный статус —
проверь свежие новости. - Разработчики через Vertex AI и AI Studio — от стартапов до
энтерпрайза; у AI Studio есть бесплатный тир, что сделало Gemini
популярной «первой моделью» для прототипов. - Пользователи агрегаторов вроде OpenRouter — там Gemini стабильно в
топах по объёму трафика благодаря соотношению цена/качество у
Flash-линейки. Вчерашний снимок: 19 моделей, цены от $0.10 до $12 за
миллион токенов в зависимости от яруса и направления (вход/выход).
Альтернативы и конкуренты
- GPT / o-серия (OpenAI).
Плюсы: самый известный бренд, огромная экосистема, сильные рассуждающие модели.
Минусы: дороже Flash-линейки на массовых задачах, нет своего железа и дистрибуции масштаба Android. - Claude (Anthropic).
Плюсы: сильна в коде и длинных структурированных текстах, аккуратно следует инструкциям.
Минусы: контекстное окно меньше геминиевского миллиона, мультимодальность уже (нет видео/аудио на вход в том же объёме). - Llama (Meta).
Плюсы: открытые веса — можно запускать на своём железе, полный контроль над данными.
Минусы: инфраструктура и надёжность — твоя забота; топовым закрытым моделям уступает. - DeepSeek / Qwen (открытые китайские).
Плюсы: агрессивное соотношение цена/качество, открытые веса у ряда версий.
Минусы: юридические и комплаенс-вопросы для западных заказчиков, меньше экосистема инструментов.
Когда НЕ стоит использовать
- Данные нельзя отдавать в чужое облако. Gemini (кроме Nano на
устройстве) работает только через серверы Google. Медицина, банки,
гостайна, персональные данные с жёсткой локализацией — потому что сам
факт отправки данных наружу уже нарушение; смотри в сторону открытых
моделей на своём железе. - Нужна долгосрочная стабильность поведения. Превью-модели живут
месяцами, поколения сменяются быстро, старые версии отключают — потому
что если твой продукт чувствителен к малейшей смене формулировок ответа,
каждый апгрейд — это регрессионное тестирование, и цикл обновлений Google
будет диктовать твой роадмап. - Оплата и доступ из России. Прямой биллинг Google для российских
юрлиц недоступен — потому что работать придётся через агрегаторы и
посредников (тот же OpenRouter), а это дополнительная комиссия, ещё один
контрагент в цепочке и ещё одна точка отказа.
Связанные понятия
- LLM — большая языковая модель; общий класс, к которому относится Gemini.
- Контекстное окно — максимальный объём токенов, который модель «видит» в одном запросе.
- Токен — единица тарификации и обработки текста; примерно 3–4 символа.
- MoE (Mixture of Experts) — архитектура «смеси экспертов», на которой построены Gemini 1.5+.
- TPU — тензорный процессор Google, железо, на котором обучается и работает Gemini.
- OpenRouter — агрегатор LLM-API: один ключ и один формат запросов для моделей разных вендоров.
- RAG — подмешивание найденных документов в запрос; частичная альтернатива огромному контекстному окну.
Литература и источники
- «Attention Is All You Need» — Vaswani et al., 2017 (en) — статья,
породившая трансформеры: https://arxiv.org/abs/1706.03762 - «Gemini: A Family of Highly Capable Multimodal Models» — Google DeepMind,
2023 (en) — технический отчёт о первом поколении; искать на arxiv.org. - Официальная документация Gemini API — https://ai.google.dev (en) — модели,
цены, лимиты из первых рук. - Wikipedia (en): «Gemini (language model)» — история версий с датами:
https://en.wikipedia.org/wiki/Gemini_(language_model) - Мустафа Сулейман, «The Coming Wave», 2023 (en, есть ru-перевод
«Надвигающаяся волна») — сооснователь DeepMind о том, куда всё это
катится; полезно для стратегического взгляда. - Актуальный список и цены Gemini-моделей у агрегатора — openrouter.ai,
раздел Models, фильтр «google» (en).
Где встретилось у меня
Вчера проверял через API OpenRouter, какие модели Gemini там доступны:
собрал таблицу из 19 моделей с ценами и размерами контекста, оформил её в
самодостаточный HTML-файл для коллеги и отправил через телеграм-бота.
Попутно всплыла тема плавающих алиасов -latest и того, почему в проде
версию модели надо пинить.
Краткое резюме
- Gemini — семейство LLM от Google DeepMind: не одна модель, а линейка
ярусов Pro / Flash / Flash-Lite / Nano с разницей в цене в десятки раз. - Два козыря: нативная мультимодальность (текст, фото, аудио, видео одним
входом) и контекстное окно в 1 миллион токенов. - Google — единственный вендор с полной вертикалью: свои чипы TPU, данные,
модели и дистрибуция через Android, поиск и Workspace. - Тарификация — за токены, вход и выход считаются отдельно; выход в разы
дороже. Сравнивать модели только по цене за миллион токенов — ошибка. - В проде фиксируй конкретную версию модели; плавающие алиасы
-latestи
превью-модели — только для экспериментов.