Gemini

20 июля 2026 · ~13 мин чтения

llm google ai-модель мультимодальность облако

Gemini

Gemini — семейство больших языковых моделей Google DeepMind: флагманский
ИИ Google, который встроен в поиск, Android, Gmail и продаётся разработчикам
через API. Главные фишки — нативная мультимодальность (текст, картинки,
аудио, видео одним входом) и огромное контекстное окно в 1 миллион токенов.

История

Чтобы понять, откуда взялся Gemini, надо вспомнить два факта про Google.

Первый: сама архитектура, на которой работают все современные нейросети-чаты,
родилась внутри Google. В 2017 году восемь исследователей Google опубликовали
статью «Attention Is All You Need» и описали трансформер (transformer —
архитектура нейросети, где модель «взвешивает» связи между всеми словами
текста сразу). GPT от OpenAI, Claude от Anthropic, Llama от Meta — все они
потомки той статьи.

Второй: несмотря на это, эпоху чат-ботов Google проспал. Когда в ноябре 2022
OpenAI выпустила ChatGPT и за два месяца набрала 100 миллионов пользователей,
в Google, по сообщениям прессы, объявили внутренний «code red»: главный
бизнес компании — поиск — впервые за 20 лет получил реального конкурента.

Дальше события шли так:

Текущий статус: Gemini — центральный ИИ-продукт Alphabet. Он отвечает на
запросы в AI Overviews в поиске Google, заменяет Google Assistant на
Android, пишет черновики в Gmail и Docs, а разработчикам продаётся через
Google AI Studio и Vertex AI. На агрегаторе OpenRouter вчерашний снимок
показывал 19 доступных по API моделей Gemini — от копеечной 2.5-flash-lite
до флагманских 3.1-pro.

Что это такое

Gemini — это не одна нейросеть, а линейка моделей разного размера и цены
под общим брендом
. Понимать это важнее всего, потому что «подключить
Gemini» — это всегда выбор конкретной модели из линейки, и цена между
крайними вариантами отличается в десятки раз.

Размерные классы (сложилось три яруса):

Теперь важные пары «X vs Y», где путаются чаще всего:

Две технические особенности, которые выделяют Gemini среди конкурентов.
Первая — нативная мультимодальность: модель с самого начала обучалась
на тексте, изображениях, аудио и видео вместе, а не получила «прикрученное»
зрение позже. Ей можно отдать часовое видео или PDF со сканами — одним
запросом. Вторая — контекстное окно в 1 миллион токенов (1 048 576;
токен — кусочек текста, в среднем примерно 3–4 символа). Это порядка
700 тысяч слов: целая книжная полка помещается в один запрос.

Аналогии из жизни

Линейка двигателей одного автоконцерна. У производителя есть платформа
и на ней моторы: 1.2 для города, 2.0 для трассы, 3.0 turbo для тех, кому
надо всё. Gemini Pro / Flash / Flash-Lite — то же самое: одна «платформа»
(архитектура, обучение), разные мощность и расход. Выбор модели — как
выбор комплектации: переплачивать за 3.0, чтобы ездить за хлебом, глупо.
Где ломается: купленный двигатель годами остаётся тем же, а модели
обновляются раз в несколько месяцев, старые версии отключают, и «мотор»,
на котором ты построил продукт, может просто исчезнуть из прайса — с
железом такого не бывает.

Полиглот-референт со зрением и слухом. Обычные текстовые модели — как
референт, которому всё нужно надиктовывать письменно. Мультимодальный
Gemini — как сотрудник, которому можно бросить на стол фотографию счёта,
запись совещания и стопку документов: он сам посмотрит, послушает и
прочитает. Где ломается: человек, когда не понял, переспросит или
скажет «не разобрал почерк». Модель не скажет — она с уверенным лицом
выдаст правдоподобный ответ, даже если ошиблась (это называют
галлюцинацией), и проверка остаётся на тебе.

Тарифы электричества. Платишь за фактически потреблённые киловатты;
у входа и выхода разные счётчики. API-модели тарифицируются так же: отдельно
за входные токены (твой запрос и приложенные документы), отдельно — за
выходные (ответ модели), и выходные обычно в 4–8 раз дороже. Где
ломается:
киловатт у любой розетки одинаков, а «токен у Gemini» и «токен
у Claude» — нет: у моделей разные токенизаторы (способы резать текст на
кусочки), разное качество ответа на тот же запрос, поэтому сравнивать
только цену за миллион токенов — как сравнивать тарифы, когда из одной
розетки течёт 220 вольт, а из другой 110.

Как это работает

Пройдём путь одного запроса к Gemini по API — без магии, по шагам.

  1. Ты формируешь запрос. HTTP POST на эндпоинт Google (AI Studio /
    Vertex AI) или агрегатора вроде OpenRouter. В запросе: идентификатор
    модели (например, google/gemini-2.5-flash), сообщения, при
    мультимодальном сценарии — картинки/аудио/видео, и параметры (лимит
    ответа, температура — степень «творческости»).

  2. Вход превращается в токены. Текст режется токенизатором на кусочки;
    картинки, аудио и видео тоже кодируются в последовательности токенов в
    том же «пространстве». Именно поэтому Gemini «нативно мультимодален»:
    для модели кадр видео и абзац текста — элементы одной последовательности.

  3. Работает трансформер с MoE. Начиная с версии 1.5 Gemini использует
    архитектуру Mixture of Experts (смесь экспертов): внутри модели много
    «подсетей»-экспертов, и на каждый токен активируется лишь малая часть.
    Модель формально огромная, но на каждый шаг тратится вычислений как у
    модели поменьше — так Google удерживает цены на Flash-линейке низкими.

  4. Железо — TPU. Почти вся индустрия обучает и запускает модели на
    GPU NVIDIA, а Google — на собственных чипах TPU (Tensor Processing
    Unit, тензорный процессор; разрабатываются с 2015 года).

Вертикальная интеграция — главный козырь

Google — единственный из большой тройки (OpenAI, Anthropic, Google), кто владеет всей вертикалью: свои чипы (TPU), свои дата-центры, свои данные (поиск, YouTube), свои модели и свои каналы дистрибуции (Android, Chrome, Workspace). Ему не нужно покупать GPU у NVIDIA и аренду у облаков — отсюда возможность демпинговать ценой Flash-моделей.

  1. Генерация ответа. Модель предсказывает выходные токены по одному,
    каждый следующий — с учётом всех предыдущих. В «рассуждающем» режиме
    (у поколения 2.5+) модель сначала генерирует внутреннюю цепочку
    размышлений и только потом ответ — качество выше, но и токенов (денег,
    времени) уходит больше.

  2. Счёт. Биллинг считает входные и выходные токены отдельно. По
    вчерашнему снимку цен OpenRouter: у 2.5-flash-lite это $0.10 за миллион
    входных и $0.40 за миллион выходных, у 3.1-pro — $2.00 и $12.00. Разница
    между соседними ярусами — в разы, между крайними — в сотню раз.

Отдельный практический момент — версии и алиасы. У Google в прайсе
одновременно живут: стабильные версии (gemini-2.5-flash), превью
(gemini-3-flash-preview — может измениться или исчезнуть) и плавающие
алиасы (gemini-flash-latest — указывает на «текущую» flash-модель и
молча переключается на новую при смене поколения).

Не строй прод на «-latest»

Плавающий алиас удобен для экспериментов, но в продакшене это бомба: Google выпускает новое поколение — и твой промт, отлаженный под старую модель, начинает работать иначе без единого изменения с твоей стороны. Правило: в проде пинить (фиксировать) конкретную версию модели и переезжать на новую осознанно, с тестами.

Где встречается в обычной жизни

Где встречается в IT и бизнесе

Кто пользуется

Альтернативы и конкуренты

Когда НЕ стоит использовать

Связанные понятия

Литература и источники

Где встретилось у меня

Вчера проверял через API OpenRouter, какие модели Gemini там доступны:
собрал таблицу из 19 моделей с ценами и размерами контекста, оформил её в
самодостаточный HTML-файл для коллеги и отправил через телеграм-бота.
Попутно всплыла тема плавающих алиасов -latest и того, почему в проде
версию модели надо пинить.

Краткое резюме