Veo
Veo
Veo — семейство генеративных моделей Google DeepMind, которые превращают текстовое описание (и опционально стартовый кадр) в короткий видеоролик. Начиная с третьей версии Veo генерирует ещё и звуковую дорожку — речь, шумы, музыку — синхронно с изображением.
История
Видеогенерация у Google выросла не из одного проекта, а из нескольких параллельных
линий исследований.
2022–2023, подготовка почвы. Google Research показывает Imagen Video и Phenaki —
ранние текст-в-видео модели. Качество тогда примерно как у гифки с VHS: узнаваемо,
но смотреть невозможно. В декабре 2023 появляется VideoPoet, в январе 2024 —
Lumiere. Обе работы интересны исследователям, но продуктом не становятся.
Апрель 2023 — слияние. Google объединяет Google Brain и DeepMind в одно
подразделение Google DeepMind под руководством Демиса Хассабиса. Наработки по
видео сходятся в одну команду.
14 мая 2024, Google I/O — Veo 1. Первый публичный анонс. Обещание: 1080p,
ролики длиннее минуты, понимание кинематографических терминов вроде «timelapse»
или «aerial shot». Доступ — по спискам ожидания, через экспериментальный
интерфейс VideoFX.
Декабрь 2024 — Veo 2. Заметный скачок по физике: предметы перестают
проходить сквозь друг друга, вода ведёт себя как вода. Заявлено разрешение
до 4K. Главный конкурент на тот момент — OpenAI Sora, выпущенная публично
9 декабря 2024, почти день в день.
20 мая 2025, Google I/O — Veo 3. Вот это и есть перелом. Veo 3 научилась
генерировать звук вместе с картинкой: диалоги персонажей, шаги, шум улицы,
фоновую музыку. До этого все видеогенераторы выдавали немое кино, а звук
приходилось клеить отдельно — и губы никогда не совпадали. В тот же день Google
выпускает Flow — отдельный интерфейс «для киноделов», где Veo, генератор
картинок Imagen и Gemini собраны в одном окне. Появляется вариант Veo 3 Fast:
быстрее и дешевле, качество чуть ниже.
Осень 2025 — Veo 3.1. Уточняющее обновление: лучше звук, поддержка
референсных изображений (можно дать модели фото человека, чтобы она
использовала именно его внешность), продление уже сгенерированной сцены.
Почему звук — это не мелочь
Кажется, что «добавили аудио» — это просто ещё одна фича. На деле это смена постановки задачи. Пока звук генерируется отдельно, липсинк (совпадение губ с речью) приходится подгонять третьим инструментом, и это самое хрупкое место всего пайплайна. Когда модель генерирует картинку и звук в одном проходе, липсинк получается бесплатно — он просто часть одного и того же предсказания.
Текущий статус. Veo — закрытая проприетарная модель Google. Веса не
публикуются, полной научной статьи нет, есть только model card и технический
отчёт. Доступ: подписки Google AI Pro / Ultra, приложение Gemini, Flow,
облако Vertex AI, Gemini API, а также сторонние агрегаторы, которые
перепродают доступ через свой интерфейс.
Что это такое
Veo — это не программа, которую ставят на компьютер, и не «редактор видео».
Это модель: набор весов на серверах Google, которому вы отправляете текст, а
он возвращает видеофайл. Всё взаимодействие сводится к трём вещам: промт
(текстовое описание), настройки (длительность, соотношение сторон,
разрешение, звук вкл/выкл) и опционально start image — стартовый кадр,
от которого модель должна оттолкнуться.
Важно понимать ограничение: Veo 3 генерирует ролики до 8 секунд. Это не
каприз интерфейса, а следствие того, как устроена модель, — об этом ниже.
Всё, что длиннее, собирается склейкой нескольких генераций. Стандартный
приём: брать последний кадр предыдущего ролика как start image следующего —
тогда шов на склейке почти не виден.
Veo vs обычный видеоредактор. Редактор (Premiere, DaVinci) монтирует то,
что уже снято. Veo создаёт кадры, которых не существовало. Это принципиально
разные операции: монтаж детерминирован, генерация — вероятностна, один и тот
же промт дважды даст разные ролики.
Veo vs анимация фото (image-to-video). Многие сервисы умеют «оживить»
фотографию: слегка подвигать камеру, моргнуть. Veo делает это тоже, но её
основной режим — синтез сцены целиком по описанию, включая то, чего на
исходном фото нет.
Veo vs дипфейк. Дипфейк подменяет лицо в существующем видео. Veo рисует
новое видео. Внешне результат может быть похож, технология — разная.
Практическая разница: дипфейку нужен исходный ролик и видео-донор, Veo нужен
только текст.
Veo vs Kling / Runway / Sora. Это прямые конкуренты, одна и та же
категория задач. Отличия — в качестве физики, в наличии нативного звука, в
максимальной длине, в цене за ролик и в том, откуда вы географически можете
до них дотянуться.
Аналогии из жизни
1. Скульптор и глыба мрамора. Диффузионная модель начинает не с пустого
холста, а с блока чистого шума — визуального «серого песка». Дальше она шаг
за шагом убирает лишнее, пока из шума не проступит сцена. Микеланджело
приписывают фразу про то, что он «отсекает всё лишнее»; здесь буквально так.
Где ломается: скульптор видит конечную статую заранее и движется к ней
осознанно. Модель не «знает» результат — на каждом шаге она лишь оценивает,
какой шум нужно вычесть, чтобы стало чуть правдоподобнее. Поэтому она может
«передумать» на середине и выдать шесть пальцев: у неё нет плана, есть только
локальные решения.
2. Оркестр без дирижёра, но с общей партитурой. Veo 3 генерирует картинку
и звук одновременно, и они совпадают, потому что растут из одного
внутреннего представления сцены. Как музыканты в ансамбле, играющие по одной
партитуре: никто не подстраивается под соседа постфактум, все читают одно и
то же.
Где ломается: в оркестре у каждого инструмента своя чётко прописанная
партия, и дирижёр может остановить и переиграть такт. У модели картинка и
звук — не две партии, а один поток данных, и «переиграть только звук»
невозможно. Именно поэтому, если речь в ролике вышла неудачной, нельзя
поправить только её: перегенерация меняет и видеоряд.
3. Переводчик-синхронист, который никогда не переспрашивает. Вы даёте
промт, модель мгновенно переводит его в изображение. Работает быстро и
обычно попадает в смысл.
Где ломается: синхронист в затруднении может уточнить или передать
интонацию «примерно, но точно». Модель не задаёт вопросов. Всё, чего вы не
написали, она додумает сама — и додумает по среднестатистическому варианту
из обучающих данных. Не написали «static camera» — получите наезд камеры,
потому что в киноматериале наездов много. Не запретили субтитры — она может
нарисовать текст прямо в кадре, потому что в обучающей выборке полно видео
с надписями.
Промт — это не пожелание, а спецификация
Самая частая ошибка новичка: описывать, что хочется, и молчать о том, чего не хочется. В генеративных моделях запреты работают наравне с требованиями. «Средний план, камера с рук, без наезда, без субтитров» — это не придирчивость, это половина результата.
Как это работает
Полной публикации по Veo нет, но архитектурный класс известен: латентный
диффузионный трансформер. Разберём по шагам, что происходит между вашим
нажатием «Generate» и готовым файлом.
Шаг 1. Сжатие в латент. Видео 8 секунд в 720p — это около 200 кадров по
миллиону пикселей. Работать с ними напрямую нереально дорого. Поэтому
сначала обучают автоэнкодер (кодировщик-декодировщик): он сжимает видео в
компактное внутреннее представление — «латент» (latent, скрытое
пространство). Латент меньше исходника в десятки раз, но хранит смысл сцены:
кто в кадре, как движется, какое освещение. Вся тяжёлая работа модели
происходит там.
Шаг 2. Понимание промта. Ваш текст прогоняется через языковую модель
(у Google — родственную Gemini) и превращается в набор чисел — эмбеддинг
(векторное представление смысла). Это то «условие», под которое будет
подстраиваться генерация.
Шаг 3. Обучение через зашумление. Тут ключевая идея диффузии, и она
контринтуитивна. Чтобы научить модель создавать видео, её учат обратному:
берут настоящее видео, постепенно засыпают его шумом за сотни шагов и просят
модель на каждом шаге угадать — какой именно шум добавили. Задача «убери шум»
решается несравнимо легче, чем «нарисуй видео с нуля», а при повторении сотни
раз подряд она в это самое «с нуля» и превращается.
Шаг 4. Генерация — обратный ход. На инференсе (когда модель работает, а
не учится) берётся чистый случайный шум в латентном пространстве, и модель
шаг за шагом его расчищает, каждый раз сверяясь с эмбеддингом вашего промта.
Схематично:
чистый шум ──┐
├─> [трансформер] ─> «вот этот шум лишний» ─> вычли
промт (эмб.) ─┘ │
повторить N раз <─────────────────────┘
↓
чистый латент сцены
↓
[декодер] ─> пиксели + звук
Шаг 5. Почему именно трансформер. Классическая диффузия для картинок
использовала свёрточную U-Net. Для видео этого мало: нужно, чтобы кадр 150
«помнил» про кадр 1, иначе у героя посреди ролика поменяется цвет рубашки.
Трансформер с механизмом внимания (attention) смотрит на всю
последовательность сразу — поэтому он и вытеснил U-Net в видеогенерации.
Шаг 6. Откуда берётся 8-секундный потолок. Внимание в трансформере стоит
примерно квадрат от длины последовательности: удвоили длину ролика —
учетверили вычисления и память. Восемь секунд — это не техническая
невозможность, а точка, где Google сочла соотношение «качество / стоимость
GPU-часа» приемлемым.
Шаг 7. Звук. В Veo 3 аудио не приклеивается сверху, а входит в ту же
латентную последовательность, что и кадры. Модель учится на видео со
звуком, и связь «губы двигаются так → звучит вот это» попадает в веса
наравне со связью «стакан падает → он разбивается». Отсюда и синхронность.
Шаг 8. Маркировка и фильтры. На выход накладывается SynthID —
невидимый водяной знак Google DeepMind, позволяющий потом определить, что
контент сгенерирован ИИ. Плюс фильтры на запрещённые темы и на узнаваемых
публичных лиц.
Где встречается в обычной жизни
- Реклама в соцсетях. Ролик на 6–10 секунд, где безупречно снятая еда
парит над столом в нереально красивом свете, — вероятнее всего не съёмка,
а генерация. Производство такого клипа съёмочной группой стоит десятки
тысяч рублей и занимает день; генерация — минуты. - Поздравительные и персональные видео. Сценарий ровно такой: берут
фото человека, делают по нему опорный кадр, генерируют 2–3 ролика по 8
секунд, склеивают в 20-секундное поздравление. - Заставки и перебивки на YouTube. Абстрактные пролёты камеры, городские
панорамы, фоновые сцены — стоковое видео, которое раньше покупали на
Shutterstock, теперь генерируют. - Объяснялки в TikTok и Reels. Когда для иллюстрации тезиса нужен
трёхсекундный кадр «человек смотрит в окно», проще сгенерировать. - Обучающие курсы. Говорящая голова, которой не существует, зачитывает
урок. Раньше требовался актёр, студия и переснимание при правке текста.
Где встречается в IT и бизнесе
- Креативное тестирование в перформанс-маркетинге. Классическая боль:
чтобы найти работающий креатив, нужно протестировать двадцать, а на съёмку
бюджета хватает на два. Генерация снимает это ограничение — двадцать
вариантов за вечер. - Пре-визуализация (превиз). До дорогой съёмки режиссёр генерирует
черновик сцены, чтобы согласовать раскадровку с заказчиком. Правки стоят
минут, а не смены. - Локализация. Один сюжет, разные лица и интерьеры под разные рынки.
- Прототипирование продукта. Демо-ролик фичи, которой ещё нет в коде, —
для питча инвесторам или для пользовательского теста. - Наполнение маркетплейсов и каталогов. Карточка товара с коротким видео
конвертирует лучше статичного фото, но снимать видео к каждой из десяти
тысяч позиций никто не станет.
Кто пользуется
Точных публичных цифр по Veo немного, и Google их раскрывает выборочно.
- Сам Google — через приложение Gemini и Flow. Аудитория Gemini
исчисляется сотнями миллионов пользователей; какая доля трогала видео —
неизвестно. - Google Cloud / Vertex AI — корпоративный канал: рекламные агентства,
медиахолдинги, ритейл. Здесь Veo продаётся как API с оплатой за секунду
видео. - YouTube — Google встраивала генерацию в Shorts; это, пожалуй, самый
массовый канал распространения таких роликов. - Агрегаторы и перепродавцы. Сервисы, которые собирают под одной крышей
несколько моделей (Veo, Kling, Seedance и прочие) и продают доступ за
внутренние кредиты. Удобно тем, что не нужно заводить подписку у каждого
вендора; платите вы при этом наценку. - Рекламные холдинги. WPP, Publicis, Omnicom публично объявляли о
партнёрствах с поставщиками генеративного видео. Конкретные объёмы
производства не раскрываются.
Порядок цен, чтобы был ориентир: один 8-секундный ролик в быстром режиме у
агрегаторов стоит порядка сотен внутренних кредитов, что в пересчёте —
единицы долларов. Качественный режим дороже в несколько раз. Точные тарифы
меняются часто, так что сверяйтесь на экране генерации, а не с памятью.
Альтернативы и конкуренты
Kling (Kuaishou, Китай). Плюсы: качество движения и физики на уровне
лучших, длинные ролики, хороший липсинк по готовому аудио, доступен без
географических ограничений Google. Минусы: китайский вендор со своими
правилами обработки данных, интерфейс местами непереведён, звук исторически
слабее, чем у Veo.
Sora (OpenAI). Плюсы: сильная физика и длинные связные сцены, узнаваемый
бренд, вторая версия умеет звук. Минусы: жёсткая модерация, ограниченная
география, доступ привязан к подписке OpenAI.
Runway (Gen-3 / Gen-4). Плюсы: заточен под профессиональный продакшен —
инструменты контроля камеры, движения, масок; давно на рынке, зрелый
интерфейс. Минусы: дороже, кривая обучения круче, генерация звука не
основная сильная сторона.
Открытые модели (Wan от Alibaba, LTX-Video от Lightricks, Mochi). Плюсы:
веса доступны, можно запустить локально или в своём облаке — данные не уходят
наружу, за генерацию не платите. Минусы: нужна серьёзная видеокарта, качество
отстаёт от топовых закрытых моделей примерно на поколение, за пайплайн
отвечаете вы сами.
Когда НЕ стоит использовать
Когда нужна фактическая точность. Если в кадре должен быть конкретный
товар с конкретной этикеткой, конкретное здание или работающий интерфейс
вашего приложения — генерация подведёт. Модель рисует правдоподобное, а не
точное: логотип поплывёт, текст на упаковке превратится в псевдобуквы.
Потому что она не «знает» ваш продукт, она воспроизводит статистику похожих
изображений.
Когда в кадре реальный человек и есть правовой риск. Генерация
узнаваемого лица без согласия — это вопрос не технологии, а права на
изображение, а в ряде юрисдикций ещё и законодательства о дипфейках. Потому
что технический доступ к инструменту не создаёт права использовать чужую
внешность.
Когда правки будут итеративными. Если заказчик скажет «всё отлично,
только поменяй фразу во второй секунде», вы не сможете поменять только её —
придётся генерировать ролик заново, и остальное тоже изменится. Потому что
модель недетерминирована: нет способа зафиксировать всё, кроме одной детали.
Для сценариев с частыми точечными правками честнее снять или смонтировать.
Связанные понятия
- Диффузионная модель — класс генеративных моделей, которые учатся
создавать данные, обращая процесс постепенного зашумления. - Латентное пространство (latent space) — сжатое внутреннее
представление данных, в котором модель работает вместо сырых пикселей. - Трансформер / механизм внимания (attention) — архитектура, позволяющая
модели учитывать всю последовательность сразу, а не только соседние
элементы. - Липсинк (lip sync) — совпадение движения губ с произносимой речью;
главный маркер «настоящести» говорящего видео. - Voice conversion (перекраска голоса) — замена тембра в готовой записи
с сохранением темпа и интонации; в отличие от синтеза с нуля не ломает
липсинк. - SynthID — технология Google DeepMind для невидимой маркировки
ИИ-контента. - Промт-инжиниринг — практика составления описаний так, чтобы модель
давала предсказуемый результат; для видео включает явные запреты.
Литература и источники
- Wikipedia (en), «Veo (text-to-video model)» —
https://en.wikipedia.org/wiki/Veo_(text-to-video_model) — фактология,
даты релизов, список версий. - Официальная страница Google DeepMind по Veo — deepmind.google/models/veo/ —
model card, декларируемые возможности и ограничения. Первоисточник, но
маркетинговый по тону. - Ho, Jain, Abbeel, «Denoising Diffusion Probabilistic Models» (2020, en) —
основополагающая статья по диффузии, arxiv.org. Математики много, но первые
страницы читаемы и дают верную интуицию. - Peebles, Xie, «Scalable Diffusion Models with Transformers» (2023, en) —
та самая работа про DiT, диффузионный трансформер; объясняет, почему
видеогенерация выглядит именно так. - Документация Google Cloud по Veo в Vertex AI — практическая часть:
параметры API, тарификация за секунду видео, лимиты. - Для сравнения моделей в динамике — искать в Google по запросу
«video generation model comparison benchmark <год>»; рынок меняется
быстрее, чем любая книга успевает выйти.
Где встретилось у меня
Вчера в проекте по ИИ-помощнику для риелторов мы собирали персональное
поздравительное видео: генерировали опорные кадры, потом по каждому — ролик
с речью, потом склеивали три восьмисекундных фрагмента в один сюжет. По ходу
пришлось разобраться, чем отличается быстрый режим от качественного, почему
в API агрегатора модель есть не всегда, и почему переозвучивать готовый
ролик с нуля опаснее, чем перекрасить тембр в уже имеющемся звуке.
Краткое резюме
- Veo — генеративная модель Google DeepMind, делающая короткое видео по
тексту; с версии 3 (май 2025) генерирует звук и речь вместе с картинкой,
отчего липсинк получается сам собой. - Технически это латентный диффузионный трансформер: модель учится убирать
шум из сжатого представления видео, ориентируясь на эмбеддинг вашего промта. - Потолок в 8 секунд — следствие квадратичной стоимости внимания; длинные
сюжеты собираются склейкой, где последний кадр становится первым кадром
следующего ролика. - Промт — это спецификация, а не пожелание: запреты («без наезда камеры»,
«без субтитров») влияют на результат не меньше, чем требования. - Не подходит там, где нужна фактическая точность (логотипы, текст, реальные
объекты) и где предстоят точечные правки: перегенерация меняет всё сразу.