Перейти к основному содержимому
megapromotingДавайте обсудим

Экспертиза · Видео и контент с AI

Короткие ролики, собранные в HTML, с синтезированным голосом и с лицензией каждого элемента на бумаге.

Мы производим проморолики и наборы визуалов, используя инструменты генерации — синтезированный голос, изображения, анимированные композиции, отрендеренные из HTML. Каждый элемент, который попадает в кадр, имеет указанную источник и лицензию, а звук измеряется, а не оценивается приблизительно.

Уже построеноЭто поставленные материалы, на диске, которые мы сегодня измерили инструментами, а не прочитали из отчёта. Набор из четырёх клипов по 30 секунд ровно (два языка × два формата) для собственной платформы, второй набор из четырёх вводных клипов, собственная композиция, отрендеренная в семи вариантах для продвижения компании, и два раунда статических кампанийных визуалов для транспортного оператора. Мы повторно проверили звук одного из клипов с `ffmpeg … ebur128`: −16,2 LUFS integrated, реальный пик −1,8 dBTP — ровно цифры из внутреннего документа, что происходит не каждый раз. Важная поправка к нашему собственному инвентарю: `hyperframes` НЕ является нашим кодом. Это клон публичного репозитория другой компании, под лицензией Apache 2.0, без какого-либо нашего коммита. Это инструмент, с которым мы работаем; достижения — это композиции и рендеры, а не инструмент.

У 30-секундного ролика есть три способа сломаться, и только один виден при первом просмотре. Он ломается визуально — это замечают все. Он ломается по звуку, и тогда ролик звучит громче или тише всего, что вокруг него в сети, куда он попадает, и это замечают только после публикации. И он ломается юридически, что не замечают никогда, до того дня, когда замечают. Мы работаем по всем трём направлениям, а по двум последним у нас есть письменная процедура, а не доброжелательность.

Сборка выполняется в HTML, а не в редакторе. Композиция — это документ с дорожками и роликами, у каждого есть момент начала и длительность, записанные как атрибуты — например, ролик, который начинается на 8,4 секунды и длится 5,0 секунды, с намеренным перекрытием с предыдущим для перехода. Практическое следствие в том, что ролик можно пересобрать идентично: те же атрибуты, тот же результат, а исправление текста не требует ручной пересборки монтажа. Рендер нашей промо-композиции вышел в 1920×1080, 60 кадров в секунду, 1200 кадров, ровно 20,000000 секунды — цифры прочитаны из файла, а не из брифа.

Голос синтезирован, с настройками, записанными в сценарии вместе с текстом, чтобы пересборка звучала идентично: мультиязычная модель, стабильность, сходство, стиль и скорость отмечены как значения, а не как впечатления. Текст калибруется по длительности до генерации — ролик на 30 секунд поддерживает около 65 слов на румынском, а если сценарий содержит 80, сокращают текст, а не ускоряют голос. Финальный звук нормализуется в два прохода к целевому значению и после этого измеряется на переданном файле: четыре ролика одного недавнего набора держатся на −16,2 и −15,9 LUFS, с реальным пиком −1,8 dBTP.

Правило, которого мы придерживаемся и которое ясно видно в досье лицензий одного переданного набора: ничто в ролике не имеет лицензии, которую мы не можем показать. Музыкальная подложка и звуковые эффекты были синтезированы локально с `ffmpeg` — пять синусоидальных осцилляторов с низкочастотным фильтром для музыки, фильтрованный розовый шум для эффекта перехода, импульс 1500 Hz с экспоненциальной огибающей для щелчка — именно потому, что звук, сделанный нами, имеет доказуемую лицензию, а файл «бесплатно» со страницы, где не сказано, на каких условиях, — нет. Рамки телефона и ноутбука нарисованы в SVG, а не являются фотографиями продукта. Скриншоты — это наша платформа, сделанные автоматически на локальной производственной версии. Шрифт размещён у нас самих, под открытой лицензией для шрифтов.

Что входит

Работа, по составляющим

Сценарий с таймингами, откалиброванный по длительности до генерации

Таблица сцен с интервалами и текстом, произносимым для каждой, плюс целевой ритм. Исходный текст для синтеза пишется отдельно, одним блоком, а паузы задаёт пунктуация. Если текст превышает длительность, текст сокращается — ускорение голоса слышно, а ролик, который звучит торопливо, теряет именно то, что должен был выиграть.

Композиция в HTML, с дорожками и роликами с записанными таймингами

У каждого ролика есть старт и длительность как атрибуты, а перекрытия для переходов намеренны и видны в исходнике. Наша промо-композиция имеет пять роликов на основной дорожке и отдельные индексы дорожек для элементов, идущих поверх, в таймлайне длиной двадцать секунд. Записанный монтаж можно пересобрать идентично; сделанный вручную — нет.

Рендер с проверяемыми параметрами

Последний рендер собственной композиции, измеренный с помощью `ffprobe`: H.264, 1920×1080, 60/1 кадров в секунду, 1200 кадров, 20,000000 секунд. Не «примерно двадцать секунд» — точно, потому что число кадров целое и получается из композиции.

Синтезированный голос с настройками, указанными в сценарии

Многоязычная модель, поддерживающая румынский, со стабильностью, сходством, стилем и скоростью, указанными как значения рядом с текстом. Те же настройки дают тот же голос через три месяца, когда кто-то просит вариант с изменённой фразой. Для русского используем отдельный голос, выбранный для языка, а не переведённый на тот же.

Звук измерен, а не оценён

Нормализация в два прохода к целевому уровню громкости, затем измерение по доставленному файлу по европейскому стандарту громкости. Значения для недавнего набора: −16,2 и −15,9 LUFS integrated, истинный пик −1,8 dBTP, динамический диапазон 10,5 LU. Аудио AAC на 48 kHz, stereo, около 160 kbps, с заголовком, перенесённым в начало, чтобы файл запускался без полной загрузки.

Два языка и два формата из одного материала

Горизонтальный 1920×1080 и вертикальный 1080×1920, на румынском и на русском — четыре файла для одной и той же истории, потому что горизонтальный клип, автоматически обрезанный до вертикального, теряет именно ту часть, где что-то происходит. Второй доставленный набор, вводный, имеет ту же структуру, на 20,36 секунд.

Автоматически сгенерированные снимки реального продукта

В клипе показаны записи платформы, сделанные с помощью инструмента автоматизации браузера на локально запущенной production-версии: публичные страницы, отредактированные, без лиц, без регистрационных номеров, без точных адресов. Для промо-композиции мы отдельно извлекли снимки в нескольких позициях прокрутки, а также цвета, шрифты и анимации страницы, чтобы движение в клипе было похоже на движение на сайте.

Папка лицензий для каждого элемента в кадре

Таблица с источником и лицензией каждого звука и каждого изображения, плюс раздел о том, чего НЕТ в клипе: без библиотечной музыки, без стоковых съёмок, без записанных человеческих голосов, без логотипов учреждений, без снимков с других платформ. Музыка и эффекты синтезируются локально с `ffmpeg`, поэтому лицензию можно подтвердить, повторно запустив скрипт.

Наборы статичных визуалов для кампаний

Когда сообщение тестируют, его не снимают: два раунда по тридцать креативов для одной кампании, в вертикальном формате для соцсетей, каждый со своим углом сообщения в имени файла. Дешевле понять, какое сообщение цепляет, по изображениям, чем по клипам, и только потом снимать.

Как это выглядит

Путь, шаг за шагом.

01

Пишем сценарий с таймингами и режем его по длительности

Сцены, интервалы, произносимый текст, целевой темп. Здесь решается, поместится ли сообщение — не на монтаже. Мы сдаём сценарий до любой генерации, потому что это единственный дешёвый момент, когда можно изменить идею.

02

Собираем материал и сразу определяем для него лицензию

Автоматически сгенерированные снимки на тестовой версии, нарисованные элементы, локально синтезированные звуки, сгенерированный голос. Каждый элемент получает строку в папке лицензий в момент, когда он входит в проект, а не в конце, когда уже никто не помнит, откуда он появился.

03

Строим композицию и рендерим её с фиксированными параметрами

Дорожки, клипы с началом и длительностью, переходы через намеренное наложение. Рендер проверяется инструментами: разрешение, кадры в секунду, число кадров, длительность. Если длительность не соответствует сценарию, это ошибка композиции, а не округление.

04

Мы нормализуем звук и измеряем его на финальном файле

Два прохода к целевому уровню громкости, затем измерение на переданном файле, а не на промежуточном. Полученные цифры записываются в документ передачи, чтобы их можно было оспорить.

05

Мы передаем варианты и исходник

Оба формата, оба языка, плюс отдельные части — озвучка, музыка, кадры сценария — и композиция. Причина, по которой мы передаем и исходник, проста: через год кто-то захочет другую фразу на двадцатой секунде.

Un centru. În jur, ce intră în el — pe trasee separate.ЦЕНТР ОПИРАЕТСЯ НА ВСЁ, ЧТО ЕСТЬ ВОКРУГ НЕГО
В центре — композиция: документ с дорожками и клипами с прописанными таймкодами. Вокруг него вращаются элементы, которые попадают в кадр, каждый со своей лицензией: автоматически сгенерированные снимки продукта, рамки, нарисованные в SVG, музыкальный фон и локально синтезированные эффекты, сгенерированный голос, самохостируемый шрифт. Элемент без метки не входит в орбиту.

Данные

К чему прикасаемся, где оно лежит и сколько остаётся

Вопросы, которые задаёт всякий, у кого есть ответственный за защиту данных, — заданы здесь раньше, чем их задаст он.

Что входит в кадр и откуда это берется
Скриншоты платформы клиента или продукта, автоматически сгенерированные на тестовой версии, плюс элементы, нарисованные нами. У каждого есть строка в лицензионном досье. Практическое правило: если мы не можем показать, откуда это берется, в клип это не входит.
Персональные данные в снятом материале
Они редактируются до захвата, а не после монтажа: без лиц, без номерных знаков, без точных адресов, без реальных данных клиентов на показанных экранах. Демонстрационный экран заполняется вымышленными данными, и это решается до запуска захвата.
Синтезированный голос и условия поставщика
Аудио, сгенерированное на нашем аккаунте или аккаунте клиента, используется коммерчески на условиях оплаченного плана. Чего мы не делаем, потому что это прямо запрещено в условиях поставщика: мы не обучаем и не тестируем на его выходе конкурирующую модель. Ограничение также распространяется на наше собственное исследовательское направление по голосу.
Что передается в конце
Финальные файлы в обоих форматах и обоих языках, отдельная озвучка, размещенная по временной оси, отдельная музыкальная подложка, извлеченные кадры сценария, сценарий с таймкодами и лицензионное досье. Исходник композиции остается у клиента, чтобы изменение текста через год не требовало переделки с нуля.

Случай

Клип длительностью тридцать секунд, в четырех файлах, с лицензионным досье рядом

Ситуация

Продвижение собственной публичной платформы, на двух языках, для сетей, где один и тот же материал должен существовать и горизонтально, и вертикально. Самоналоженное ограничение: ни один элемент в клипе не должен иметь лицензию, которую мы не можем показать.

Что мы построили

Сценарий с таймкодами и произносимым текстом по сценам, на обоих языках, с отдельно выбранными голосами по языку. Скриншоты платформы, автоматически сгенерированные на локально запущенной production-версии, с отредактированными страницами — без лиц, без номерных знаков, без точных адресов. Рамки телефона и ноутбука, нарисованные в SVG, а не фотографии продукта. Музыкальная подложка и два звуковых эффекта, синтезированные локально с `ffmpeg`: синусоидальные осцилляторы с фильтром нижних частот для музыки, отфильтрованный розовый шум для перехода, импульс 1500 Hz с экспоненциальной огибающей для щелчка. Звук нормализован в два прохода к целевому уровню громкости.

Что получилось

Четыре файла — два языка × два формата — ровно по 30,00 секунды каждый, при 30 кадрах в секунду, H.264 с аудио AAC 48 kHz stereo примерно 160 kbps и заголовком, перенесенным в начало. Сегодня мы повторно измерили горизонтальную версию на румынском: −16,2 LUFS интегрировано, истинный пик −1,8 dBTP, динамический диапазон 10,5 LU, 900 кадров за 30,00 секунды. Цифры совпадают с документом передачи. Помимо файлов были переданы отдельная озвучка, отдельная музыкальная подложка, кадры сценария и таблица лицензий.

Чего этот случай не говорит

Среда для рендеринга не наша — это проект с открытым исходным кодом другой компании, под Apache 2.0, и наш вклад в него равен нулю. Голос синтезируется на нашем аккаунте, в условиях платного плана поставщика, а его условия прямо запрещают использовать результат для обучения или тестирования конкурирующей модели; это ограничение мы соблюдаем. И ещё одно, по здравому смыслу: клип не исправляет сообщение, которое не работает — поэтому, когда можно, мы тестируем сообщение на изображениях заранее.

Вопросы

О чём нас спрашивают перед тем, как позвонить

У вас есть собственный движок генерации видео?

Нет, и важно не создавать такое впечатление. Мы собираем в HTML и рендерим с помощью среды с открытым исходным кодом, разработанной другой компанией, по лицензии Apache 2.0. Мы проверили: в нашей копии нет ни одного нашего commit. Наше — это композиции, сценарии, снимки, локально синтезированные звуки и дисциплина лицензий. Инструмент — не результат.

Что конкретно означает «видео с AI»? Видно, что оно сгенерировано?

В наших материалах генерация покрывает голос и часть рекламных изображений. Движение и монтаж написаны, а не сгенерированы: клип с таймингами и дорожками, рендеримый детерминированно. Мы не производим синтетических людей, которые говорят в кадре. Причина практическая: клип, в котором видно реальный продукт, автоматически захваченный, стареет медленнее и не имеет проблемы с достоверностью, как несуществующий ведущий.

Кому принадлежат права на клип?

Клиенту — на поставленный материал, а внешние источники остаются под их лицензией, которая построчно указана в файле лицензий. Сгенерированный голос используется коммерчески на условиях платного плана поставщика, на аккаунте, на котором он был сгенерирован. Мы передаём и файл с документацией, а не только файлы — если через два года кто-то спросит, откуда тот звук, ответ будет в письменном виде.

Почему вы синтезируете музыку вместо того, чтобы взять бесплатный трек?

Потому что «бесплатный» трек предполагает доверие к странице, которая говорит, что он бесплатный. Музыкальная подложка, сделанная из пяти синусоидальных осцилляторов с фильтром и коротким эхом, имеет лицензию, которую мы можем доказать, запустив скрипт ещё раз. Если проекту нужен настоящий трек, это возможно — но тогда в файл входят точный источник, точная лицензия и дата загрузки, а не расплывчатое упоминание.

На каких языках и в каких форматах вы поставляете?

На румынском и русском, в горизонтальном 1920×1080 и вертикальном 1080×1920. Мы не обрезаем автоматически горизонталь в вертикаль: композиция выстраивается отдельно, потому что в вертикальном кадре другое содержимое. Другие языки можно сделать теми же инструментами, но голос выбирается по языку и прослушивается заранее, а не предполагается.

Почему важна измеренная громкость?

Потому что клип, который тише, чем окружающие его материалы в социальной сети, пропускают, а слишком громкий — закрывают. Мы нормализуем в два прохода к цели и измеряем на поставляемом файле по европейскому стандарту громкости. Для недавнего набора цифры — −16,2 и −15,9 LUFS, с реальным пиком −1,8 dBTP. Это измерено, а не оценено, и мы записываем это в документ передачи именно для проверки.

Можете делать клипы с моим продуктом, а не с общими анимациями?

Да, и мы предпочитаем именно это. Снимки делаются автоматически, с помощью инструмента автоматизации браузера, на тестовой версии продукта, в нескольких позициях прокрутки; для одной композиции мы отдельно извлекли и цвета, шрифты и анимации страницы, чтобы движение в клипе было похоже на реальное движение интерфейса. Условие — должна быть версия, которую мы можем запустить, и демонстрационные данные, которые не являются реальными.

Как быстро можно изменить фразу через несколько месяцев?

Поскольку монтаж — это документ с таймингами, а не проект в редакторе, фраза меняется в сценарии, заново генерируется озвучка с теми же настройками голоса, и всё снова рендерится. Поэтому мы передаём исходник и настройки голоса, а не только финальный файл. Без них любое изменение означает переделку.

Делаете ли вы и кампании с изображениями, а не только клипы?

Да, и часто это правильный шаг перед клипом. Для одной кампании мы произвели два раунда по тридцать вертикальных креативов, каждый с другим углом сообщения. Проверяется, какое сообщение лучше работает на изображениях, какие дешево переделать, и только потом инвестируют в клип по выигравшему сообщению.

На чём основаны утверждения выше (11 источников)
  1. Условия поставщика голоса запрещают обучение или тестирование конкурирующей модели на его выводеhttps://elevenlabs.io/use-policy · 2026-09-06

10 из них — код и файлы из наших репозиториев. Мы не публикуем их название и строку: вместе, на одной странице, они слишком точно описали бы, как устроены системы, которые принадлежат не только нам. Мы разбираем их вместе с тобой, в репозитории, по запросу — проверка остаётся возможной, просто она проходит в разговоре.

Что вы хотели бы наладить?

Расскажите о своём процессе. Вместе определим, что стоит построить, что можно подключить и как проверим результат.

Давайте обсудим