Экспертиза · Видео и контент с AI
Короткие ролики, собранные в HTML, с синтезированным голосом и с лицензией каждого элемента на бумаге.
Мы производим проморолики и наборы визуалов, используя инструменты генерации — синтезированный голос, изображения, анимированные композиции, отрендеренные из HTML. Каждый элемент, который попадает в кадр, имеет указанную источник и лицензию, а звук измеряется, а не оценивается приблизительно.
Уже построеноЭто поставленные материалы, на диске, которые мы сегодня измерили инструментами, а не прочитали из отчёта. Набор из четырёх клипов по 30 секунд ровно (два языка × два формата) для собственной платформы, второй набор из четырёх вводных клипов, собственная композиция, отрендеренная в семи вариантах для продвижения компании, и два раунда статических кампанийных визуалов для транспортного оператора. Мы повторно проверили звук одного из клипов с `ffmpeg … ebur128`: −16,2 LUFS integrated, реальный пик −1,8 dBTP — ровно цифры из внутреннего документа, что происходит не каждый раз. Важная поправка к нашему собственному инвентарю: `hyperframes` НЕ является нашим кодом. Это клон публичного репозитория другой компании, под лицензией Apache 2.0, без какого-либо нашего коммита. Это инструмент, с которым мы работаем; достижения — это композиции и рендеры, а не инструмент.
У 30-секундного ролика есть три способа сломаться, и только один виден при первом просмотре. Он ломается визуально — это замечают все. Он ломается по звуку, и тогда ролик звучит громче или тише всего, что вокруг него в сети, куда он попадает, и это замечают только после публикации. И он ломается юридически, что не замечают никогда, до того дня, когда замечают. Мы работаем по всем трём направлениям, а по двум последним у нас есть письменная процедура, а не доброжелательность.
Сборка выполняется в HTML, а не в редакторе. Композиция — это документ с дорожками и роликами, у каждого есть момент начала и длительность, записанные как атрибуты — например, ролик, который начинается на 8,4 секунды и длится 5,0 секунды, с намеренным перекрытием с предыдущим для перехода. Практическое следствие в том, что ролик можно пересобрать идентично: те же атрибуты, тот же результат, а исправление текста не требует ручной пересборки монтажа. Рендер нашей промо-композиции вышел в 1920×1080, 60 кадров в секунду, 1200 кадров, ровно 20,000000 секунды — цифры прочитаны из файла, а не из брифа.
Голос синтезирован, с настройками, записанными в сценарии вместе с текстом, чтобы пересборка звучала идентично: мультиязычная модель, стабильность, сходство, стиль и скорость отмечены как значения, а не как впечатления. Текст калибруется по длительности до генерации — ролик на 30 секунд поддерживает около 65 слов на румынском, а если сценарий содержит 80, сокращают текст, а не ускоряют голос. Финальный звук нормализуется в два прохода к целевому значению и после этого измеряется на переданном файле: четыре ролика одного недавнего набора держатся на −16,2 и −15,9 LUFS, с реальным пиком −1,8 dBTP.
Правило, которого мы придерживаемся и которое ясно видно в досье лицензий одного переданного набора: ничто в ролике не имеет лицензии, которую мы не можем показать. Музыкальная подложка и звуковые эффекты были синтезированы локально с `ffmpeg` — пять синусоидальных осцилляторов с низкочастотным фильтром для музыки, фильтрованный розовый шум для эффекта перехода, импульс 1500 Hz с экспоненциальной огибающей для щелчка — именно потому, что звук, сделанный нами, имеет доказуемую лицензию, а файл «бесплатно» со страницы, где не сказано, на каких условиях, — нет. Рамки телефона и ноутбука нарисованы в SVG, а не являются фотографиями продукта. Скриншоты — это наша платформа, сделанные автоматически на локальной производственной версии. Шрифт размещён у нас самих, под открытой лицензией для шрифтов.