Veo

24 сентября 2026 · ~14 мин чтения

генеративный-ии видео google диффузия сервис

Veo

Veo — семейство генеративных моделей Google DeepMind, которые превращают текстовое описание (и опционально стартовый кадр) в короткий видеоролик. Начиная с третьей версии Veo генерирует ещё и звуковую дорожку — речь, шумы, музыку — синхронно с изображением.

История

Видеогенерация у Google выросла не из одного проекта, а из нескольких параллельных
линий исследований.

2022–2023, подготовка почвы. Google Research показывает Imagen Video и Phenaki —
ранние текст-в-видео модели. Качество тогда примерно как у гифки с VHS: узнаваемо,
но смотреть невозможно. В декабре 2023 появляется VideoPoet, в январе 2024 —
Lumiere. Обе работы интересны исследователям, но продуктом не становятся.

Апрель 2023 — слияние. Google объединяет Google Brain и DeepMind в одно
подразделение Google DeepMind под руководством Демиса Хассабиса. Наработки по
видео сходятся в одну команду.

14 мая 2024, Google I/O — Veo 1. Первый публичный анонс. Обещание: 1080p,
ролики длиннее минуты, понимание кинематографических терминов вроде «timelapse»
или «aerial shot». Доступ — по спискам ожидания, через экспериментальный
интерфейс VideoFX.

Декабрь 2024 — Veo 2. Заметный скачок по физике: предметы перестают
проходить сквозь друг друга, вода ведёт себя как вода. Заявлено разрешение
до 4K. Главный конкурент на тот момент — OpenAI Sora, выпущенная публично
9 декабря 2024, почти день в день.

20 мая 2025, Google I/O — Veo 3. Вот это и есть перелом. Veo 3 научилась
генерировать звук вместе с картинкой: диалоги персонажей, шаги, шум улицы,
фоновую музыку. До этого все видеогенераторы выдавали немое кино, а звук
приходилось клеить отдельно — и губы никогда не совпадали. В тот же день Google
выпускает Flow — отдельный интерфейс «для киноделов», где Veo, генератор
картинок Imagen и Gemini собраны в одном окне. Появляется вариант Veo 3 Fast:
быстрее и дешевле, качество чуть ниже.

Осень 2025 — Veo 3.1. Уточняющее обновление: лучше звук, поддержка
референсных изображений (можно дать модели фото человека, чтобы она
использовала именно его внешность), продление уже сгенерированной сцены.

Почему звук — это не мелочь

Кажется, что «добавили аудио» — это просто ещё одна фича. На деле это смена постановки задачи. Пока звук генерируется отдельно, липсинк (совпадение губ с речью) приходится подгонять третьим инструментом, и это самое хрупкое место всего пайплайна. Когда модель генерирует картинку и звук в одном проходе, липсинк получается бесплатно — он просто часть одного и того же предсказания.

Текущий статус. Veo — закрытая проприетарная модель Google. Веса не
публикуются, полной научной статьи нет, есть только model card и технический
отчёт. Доступ: подписки Google AI Pro / Ultra, приложение Gemini, Flow,
облако Vertex AI, Gemini API, а также сторонние агрегаторы, которые
перепродают доступ через свой интерфейс.

Что это такое

Veo — это не программа, которую ставят на компьютер, и не «редактор видео».
Это модель: набор весов на серверах Google, которому вы отправляете текст, а
он возвращает видеофайл. Всё взаимодействие сводится к трём вещам: промт
(текстовое описание), настройки (длительность, соотношение сторон,
разрешение, звук вкл/выкл) и опционально start image — стартовый кадр,
от которого модель должна оттолкнуться.

Важно понимать ограничение: Veo 3 генерирует ролики до 8 секунд. Это не
каприз интерфейса, а следствие того, как устроена модель, — об этом ниже.
Всё, что длиннее, собирается склейкой нескольких генераций. Стандартный
приём: брать последний кадр предыдущего ролика как start image следующего —
тогда шов на склейке почти не виден.

Veo vs обычный видеоредактор. Редактор (Premiere, DaVinci) монтирует то,
что уже снято. Veo создаёт кадры, которых не существовало. Это принципиально
разные операции: монтаж детерминирован, генерация — вероятностна, один и тот
же промт дважды даст разные ролики.

Veo vs анимация фото (image-to-video). Многие сервисы умеют «оживить»
фотографию: слегка подвигать камеру, моргнуть. Veo делает это тоже, но её
основной режим — синтез сцены целиком по описанию, включая то, чего на
исходном фото нет.

Veo vs дипфейк. Дипфейк подменяет лицо в существующем видео. Veo рисует
новое видео. Внешне результат может быть похож, технология — разная.
Практическая разница: дипфейку нужен исходный ролик и видео-донор, Veo нужен
только текст.

Veo vs Kling / Runway / Sora. Это прямые конкуренты, одна и та же
категория задач. Отличия — в качестве физики, в наличии нативного звука, в
максимальной длине, в цене за ролик и в том, откуда вы географически можете
до них дотянуться.

Аналогии из жизни

1. Скульптор и глыба мрамора. Диффузионная модель начинает не с пустого
холста, а с блока чистого шума — визуального «серого песка». Дальше она шаг
за шагом убирает лишнее, пока из шума не проступит сцена. Микеланджело
приписывают фразу про то, что он «отсекает всё лишнее»; здесь буквально так.

Где ломается: скульптор видит конечную статую заранее и движется к ней
осознанно. Модель не «знает» результат — на каждом шаге она лишь оценивает,
какой шум нужно вычесть, чтобы стало чуть правдоподобнее. Поэтому она может
«передумать» на середине и выдать шесть пальцев: у неё нет плана, есть только
локальные решения.

2. Оркестр без дирижёра, но с общей партитурой. Veo 3 генерирует картинку
и звук одновременно, и они совпадают, потому что растут из одного
внутреннего представления сцены. Как музыканты в ансамбле, играющие по одной
партитуре: никто не подстраивается под соседа постфактум, все читают одно и
то же.

Где ломается: в оркестре у каждого инструмента своя чётко прописанная
партия, и дирижёр может остановить и переиграть такт. У модели картинка и
звук — не две партии, а один поток данных, и «переиграть только звук»
невозможно. Именно поэтому, если речь в ролике вышла неудачной, нельзя
поправить только её: перегенерация меняет и видеоряд.

3. Переводчик-синхронист, который никогда не переспрашивает. Вы даёте
промт, модель мгновенно переводит его в изображение. Работает быстро и
обычно попадает в смысл.

Где ломается: синхронист в затруднении может уточнить или передать
интонацию «примерно, но точно». Модель не задаёт вопросов. Всё, чего вы не
написали, она додумает сама — и додумает по среднестатистическому варианту
из обучающих данных. Не написали «static camera» — получите наезд камеры,
потому что в киноматериале наездов много. Не запретили субтитры — она может
нарисовать текст прямо в кадре, потому что в обучающей выборке полно видео
с надписями.

Промт — это не пожелание, а спецификация

Самая частая ошибка новичка: описывать, что хочется, и молчать о том, чего не хочется. В генеративных моделях запреты работают наравне с требованиями. «Средний план, камера с рук, без наезда, без субтитров» — это не придирчивость, это половина результата.

Как это работает

Полной публикации по Veo нет, но архитектурный класс известен: латентный
диффузионный трансформер
. Разберём по шагам, что происходит между вашим
нажатием «Generate» и готовым файлом.

Шаг 1. Сжатие в латент. Видео 8 секунд в 720p — это около 200 кадров по
миллиону пикселей. Работать с ними напрямую нереально дорого. Поэтому
сначала обучают автоэнкодер (кодировщик-декодировщик): он сжимает видео в
компактное внутреннее представление — «латент» (latent, скрытое
пространство). Латент меньше исходника в десятки раз, но хранит смысл сцены:
кто в кадре, как движется, какое освещение. Вся тяжёлая работа модели
происходит там.

Шаг 2. Понимание промта. Ваш текст прогоняется через языковую модель
(у Google — родственную Gemini) и превращается в набор чисел — эмбеддинг
(векторное представление смысла). Это то «условие», под которое будет
подстраиваться генерация.

Шаг 3. Обучение через зашумление. Тут ключевая идея диффузии, и она
контринтуитивна. Чтобы научить модель создавать видео, её учат обратному:
берут настоящее видео, постепенно засыпают его шумом за сотни шагов и просят
модель на каждом шаге угадать — какой именно шум добавили. Задача «убери шум»
решается несравнимо легче, чем «нарисуй видео с нуля», а при повторении сотни
раз подряд она в это самое «с нуля» и превращается.

Шаг 4. Генерация — обратный ход. На инференсе (когда модель работает, а
не учится) берётся чистый случайный шум в латентном пространстве, и модель
шаг за шагом его расчищает, каждый раз сверяясь с эмбеддингом вашего промта.
Схематично:

чистый шум ──┐
             ├─> [трансформер] ─> «вот этот шум лишний» ─> вычли
промт (эмб.) ─┘                                              │
                      повторить N раз  <─────────────────────┘
                                ↓
                       чистый латент сцены
                                ↓
                       [декодер] ─> пиксели + звук

Шаг 5. Почему именно трансформер. Классическая диффузия для картинок
использовала свёрточную U-Net. Для видео этого мало: нужно, чтобы кадр 150
«помнил» про кадр 1, иначе у героя посреди ролика поменяется цвет рубашки.
Трансформер с механизмом внимания (attention) смотрит на всю
последовательность сразу — поэтому он и вытеснил U-Net в видеогенерации.

Шаг 6. Откуда берётся 8-секундный потолок. Внимание в трансформере стоит
примерно квадрат от длины последовательности: удвоили длину ролика —
учетверили вычисления и память. Восемь секунд — это не техническая
невозможность, а точка, где Google сочла соотношение «качество / стоимость
GPU-часа» приемлемым.

Шаг 7. Звук. В Veo 3 аудио не приклеивается сверху, а входит в ту же
латентную последовательность, что и кадры. Модель учится на видео со
звуком
, и связь «губы двигаются так → звучит вот это» попадает в веса
наравне со связью «стакан падает → он разбивается». Отсюда и синхронность.

Шаг 8. Маркировка и фильтры. На выход накладывается SynthID —
невидимый водяной знак Google DeepMind, позволяющий потом определить, что
контент сгенерирован ИИ. Плюс фильтры на запрещённые темы и на узнаваемых
публичных лиц.

Где встречается в обычной жизни

Где встречается в IT и бизнесе

Кто пользуется

Точных публичных цифр по Veo немного, и Google их раскрывает выборочно.

Порядок цен, чтобы был ориентир: один 8-секундный ролик в быстром режиме у
агрегаторов стоит порядка сотен внутренних кредитов, что в пересчёте —
единицы долларов. Качественный режим дороже в несколько раз. Точные тарифы
меняются часто, так что сверяйтесь на экране генерации, а не с памятью.

Альтернативы и конкуренты

Kling (Kuaishou, Китай). Плюсы: качество движения и физики на уровне
лучших, длинные ролики, хороший липсинк по готовому аудио, доступен без
географических ограничений Google. Минусы: китайский вендор со своими
правилами обработки данных, интерфейс местами непереведён, звук исторически
слабее, чем у Veo.

Sora (OpenAI). Плюсы: сильная физика и длинные связные сцены, узнаваемый
бренд, вторая версия умеет звук. Минусы: жёсткая модерация, ограниченная
география, доступ привязан к подписке OpenAI.

Runway (Gen-3 / Gen-4). Плюсы: заточен под профессиональный продакшен —
инструменты контроля камеры, движения, масок; давно на рынке, зрелый
интерфейс. Минусы: дороже, кривая обучения круче, генерация звука не
основная сильная сторона.

Открытые модели (Wan от Alibaba, LTX-Video от Lightricks, Mochi). Плюсы:
веса доступны, можно запустить локально или в своём облаке — данные не уходят
наружу, за генерацию не платите. Минусы: нужна серьёзная видеокарта, качество
отстаёт от топовых закрытых моделей примерно на поколение, за пайплайн
отвечаете вы сами.

Когда НЕ стоит использовать

Когда нужна фактическая точность. Если в кадре должен быть конкретный
товар с конкретной этикеткой, конкретное здание или работающий интерфейс
вашего приложения — генерация подведёт. Модель рисует правдоподобное, а не
точное: логотип поплывёт, текст на упаковке превратится в псевдобуквы.
Потому что она не «знает» ваш продукт, она воспроизводит статистику похожих
изображений.

Когда в кадре реальный человек и есть правовой риск. Генерация
узнаваемого лица без согласия — это вопрос не технологии, а права на
изображение, а в ряде юрисдикций ещё и законодательства о дипфейках. Потому
что технический доступ к инструменту не создаёт права использовать чужую
внешность.

Когда правки будут итеративными. Если заказчик скажет «всё отлично,
только поменяй фразу во второй секунде», вы не сможете поменять только её —
придётся генерировать ролик заново, и остальное тоже изменится. Потому что
модель недетерминирована: нет способа зафиксировать всё, кроме одной детали.
Для сценариев с частыми точечными правками честнее снять или смонтировать.

Связанные понятия

Литература и источники

Где встретилось у меня

Вчера в проекте по ИИ-помощнику для риелторов мы собирали персональное
поздравительное видео: генерировали опорные кадры, потом по каждому — ролик
с речью, потом склеивали три восьмисекундных фрагмента в один сюжет. По ходу
пришлось разобраться, чем отличается быстрый режим от качественного, почему
в API агрегатора модель есть не всегда, и почему переозвучивать готовый
ролик с нуля опаснее, чем перекрасить тембр в уже имеющемся звуке.

Краткое резюме