Новости ИИ

GPTunneL показал 3D-сцену для точного видео по промпту

Работа с 3D-сценой и видео в студии: планшет, раскадровка, камера и мониторы с кодом

В GPTunneL сделали ноду «3D-сцена», которая помогает Seedance 2.5 и MiniMax Hailuo H3 точнее следовать задумке. Вместо того чтобы бесконечно переписывать промпт, можно собрать простую превиз-сцену, задать камеру и получить рендер-референс для видео.

Зачем вообще понадобилась 3D-сцена

Автор статьи Илья Трикоз из GPTunneL объясняет проблему просто: современные видеомодели хорошо рисуют картинку, но часто сами решают, как именно снимать сцену. В итоге в ролике могут быть нужные персонажи и объекты, но не тот пролёт камеры, не тот ритм и не те каты, которые были в промпте.

Чтобы обойти это, команда взяла подход из кино — превизуализацию. Сначала сцену собирают из простых фигур, расставляют камеру и движение, а уже потом отдают это как видеореференс. В таком режиме Seedance 2.5 и Hailuo H3 должны повторять операторскую работу гораздо точнее, а внешний вид сцены добирается из текста и референсных изображений.

Как это работает на практике

Пользователь добавляет на холст ноду «3D-сцена», описывает сцену в чате и при желании правит детали вручную. После рендера выходы video и prompt подключаются к генерации видео: первый задаёт движение и тайминг, второй — словесные инструкции.

Внутри сцена хранится как обычный документ: с длительностью, фоном, объектами, камерами, светом и списком катов. Для объектов используются простые примитивы — куб, сфера, пирамида и группа. Группа работает как пивот, поэтому сложные объекты вроде трактора или орла можно двигать как единое целое.

Почему это полезно для работы с видео

Главная польза — предсказуемость. В статье приводится пример сложного 15-секундного пролёта: от крупного плана в тоннеле до выхода к полю и движущемуся трактору. Такой сценарий сложно получить с первого промпта, а через 3D-превиз его можно собрать на холсте, проверить и подправить до рендера.

Ещё один плюс — техническая аккуратность. Превью, гизмо и офлайн-рендер считают состояние сцены одной и той же функцией, поэтому картинка во вьюпорте совпадает с финальным рендером. Рендер делают прямо в браузере: для быстрого пути используют WebCodecs и H.264, а запасной вариант — PNG-кадры через ffmpeg.wasm. Это удобно для тех, кто делает прототипы, рекламные ролики, обучающие видео или тестирует сложные движения камеры без лишних дублей.

Частые вопросы

Что решает нода «3D-сцена»?
Она помогает задать не только текст, но и саму режиссуру ролика: камеру, тайминг, каты и расположение объектов. Это снижает шанс, что видеомодель «съедет» в свою интерпретацию.
Нужно ли уметь работать в 3D?
Нет, сложную сцену собирает ассистент по текстовому описанию. Если модель поняла что-то не так, отдельные элементы можно просто подвинуть руками.
Чем это помогает в генерации видео?
Видеомодель получает рендер-референс и лучше повторяет движение камеры и структуру сцены. А внешний вид персонажей или объектов можно дополнительно задать картинками.
Для кого это может быть полезно?
Для тех, кто делает видео для маркетинга, обучения, презентаций и прототипов. Особенно это удобно, если важны точные пролёты камеры и повторяемый монтаж.

Читайте также

Попробовать Lord GPT бесплатно →