AIArt.ruAIArt.ru
Инструкции7 мин чтения

Как сделать видео из фото и текста нейросетью: модели, промпты и цены

Из одной картинки — ролик со звуком за пару минут. Сравниваем видеомодели, объясняем, как описывать движение, и показываем, что ещё можно сделать: липсинк, перенос движений, стили.

Содержание

Есть два способа получить видео от нейросети. Первый — описать сцену текстом, и модель придумает всё с нуля. Второй — загрузить картинку, и модель её «оживит»: добавит движение, камеру, звук. Второй способ даёт гораздо больше контроля: композицию, персонажа, цвета и свет вы задаёте заранее, а нейросеть отвечает только за движение.

В этой статье — про видео из фото: какую модель выбрать, как писать промпт и как не потратить лишние кредиты. Про генерацию из одного текста есть отдельный гайд.

Какие модели доступны

МодельЧем хорошаДлительностьКредитов за ролик
MiniMax H3 TurboСамая быстрая и доступная: живое движение и звук, около минуты5 или 10 сек22 за 5 сек в 720p
MiniMax H3Лидер по оживлению фото: естественная мимика, стерео-звук5 или 10 сек44 за 5 сек в 720p
Gemini Omni FlashФлагман Google: точная физика, речь и звук5, 8 или 10 сек55 за 5 сек в 720p
Wan 3.0Сюжетная анимация и озвучка, хорошо держит детали кадра5 или 10 сек55 за 5 сек в 720p
Kling 3Плавное кинематографичное движение, портреты и сцены5 или 10 сек70 за 5 сек со звуком
Veo 3.1 FastРеалистичная физика и звук от Google4, 6 или 8 сек66 за 4 сек со звуком

Цена зависит от длительности, разрешения и звука и всегда видна на кнопке до запуска. Ролик на 10 секунд стоит вдвое дороже пятисекундного, 1080p тоже дороже, чем 720p.

Что выбрать

  • Черновики и проверка идеи — MiniMax H3 Turbo: быстро и дёшево.
  • Портрет, где важны мимика и эмоции, — MiniMax H3 или Kling 3.
  • Сцена с физикой — вода, ткань, падающие предметы — или персонаж, который должен что-то сказать, — Gemini Omni Flash.
  • Мини-история с несколькими планами — Wan 3.0.
  • Короткий реалистичный клип со звуком — Veo 3.1 Fast.

Как подготовить фото

  • Сразу выберите формат: для Reels и Shorts — вертикальное 9:16, для YouTube — 16:9. Kling 3 подрежет картинку под выбранный формат, а большинство других моделей берут пропорции исходного фото.
  • Оставьте «воздух» вокруг объекта. Если человек упирается головой в край кадра, при движении камеры ему просто некуда деться.
  • Чем чище исходник, тем стабильнее видео. Размытое или шумное фото сначала прогоните через апскейлер.
  • Подойдут и сгенерированные картинки: сделайте кадр в генераторе изображений, а потом оживите — это самый дешёвый способ получить контролируемый результат.

Как писать промпт для видео из фото

Главная ошибка — заново описывать то, что уже есть на картинке. Модель и так видит девушку в красном пальто на мосту. Ей нужно другое: что должно двигаться, как и куда смотрит камера. Формула: движение субъекта + движение окружения + камера + темп.

Промпт

Девушка медленно поворачивает голову к камере и улыбается, ветер слегка шевелит волосы и полы пальто, по реке за ней проплывает катер. Камера плавно наезжает. Спокойный темп, естественные движения

Промпт

Пар поднимается над чашкой кофе, за окном идёт снег, огонёк свечи слегка колышется. Камера неподвижна. Уютная атмосфера, тихий звук улицы

Промпт

Кроссовок медленно вращается на подиуме, по поверхности скользит луч света, в воздухе висит лёгкая дымка. Камера облетает объект по полукругу. Рекламная съёмка

Слова, которые помогают

  • Камера: «медленный наезд», «отъезд», «облёт по кругу», «съёмка с дрона», «статичный кадр», «ручная камера».
  • Темп: «slow motion», «спокойно», «динамично», «таймлапс».
  • Звук — для моделей со звуком: «шум прибоя», «тихая музыка в кафе», «гул города».
  • Ограничения: «лицо не меняется», «без резких движений», «фон остаётся неподвижным».

Что ещё можно сделать с фото и видео

  • Говорящий аватар — загружаете портрет и аудиозапись до 30 секунд, человек на фото произносит ваш текст с живой мимикой. 70 кредитов за 10 секунд.
  • Липсинк — замена речи в уже готовом видео: Sync Lipsync 2 для максимальной точности или VEED Lipsync для простых роликов с одним лицом, в разы дешевле.
  • Перенос движений — человек с фото повторяет танец или движения из видео-референса (Kling 3 Motion Control, ролики от 3 до 15 секунд).
  • Продолжение ролика — MiniMax H3 Turbo продолжит видео с последнего кадра: тот же герой, свет и камера.
  • Видео-стили — VHS, мультфильм 70-х, 16-битный пиксель-арт, low-poly и рисованная анимация — из промпта и, по желанию, фото.

Нужно, чтобы человек на фото заговорил вашим голосом? Это делает отдельный инструмент.

Говорящий аватар

Частые ошибки

  • Слишком много действий за 5 секунд — ролик превращается в хаос. Одно действие, одно движение камеры.
  • Промпт пересказывает картинку вместо описания движения — модель не понимает, что именно должно двигаться.
  • Горизонтальное фото для вертикального ролика — при обрезке теряется половина кадра.
  • Мелкое лицо на групповом фото — мимика получается неестественной. Для оживления портретов лицо должно быть крупным.
  • Генерация сразу в 1080p на дорогой модели — если движение не то, кредиты потрачены зря.

Как сэкономить кредиты

  1. Доведите кадр до идеала в фоторедакторе или генераторе изображений — фото стоит в разы дешевле видео.
  2. Первый прогон делайте на MiniMax H3 Turbo в 720p и на 5 секунд, чтобы проверить, правильно ли модель поняла движение.
  3. Когда промпт работает, запускайте финал на нужной модели и в нужном разрешении.
  4. Если ролик понравился, но нужен в 4K, дешевле сделать апскейл видео, чем генерировать сразу в высоком разрешении.

Видеогенерация занимает от минуты до нескольких минут в зависимости от модели. Готовые ролики сохраняются в истории генераций — их можно скачать или доработать позже.

Попробуйте сами

Повторите всё из статьи за пару минут

Все модели и инструменты из статьи доступны в одном сервисе. После регистрации начисляется 10 бесплатных кредитов, а цена каждого действия видна до запуска.

Оживить фото

Читайте также