Перейти до основного вмісту
megapromotingПоговорімо

Експертиза · Відео та контент з AI

Короткі ролики, зібрані з HTML, із синтезованим голосом і з ліцензією кожного елемента на папері.

Ми створюємо промо-ролики та набори візуалів, використовуючи інструменти генерації — синтезований голос, зображення, анімовані композиції, відрендерені з HTML. Кожен елемент, що потрапляє в кадр, має письмове джерело і ліцензію, а звук вимірюється, а не приблизно оцінюється.

Вже збудованоSunt materiale livrate, pe disc, pe care le-am măsurat azi cu unelte, nu le-am citit dintr-un raport. Un set de patru clipuri de 30 de secunde fix (două limbi × două formate) pentru o platformă proprie, un al doilea set de patru clipuri de introducere, o compoziție proprie randată în șapte variante pentru promovarea companiei, și două runde de vizualuri statice de campanie pentru un operator de transport. Am reverificat sonorul unuia dintre clipuri cu `ffmpeg … ebur128`: −16,2 LUFS integrat, vârf real −1,8 dBTP — exact cifrele din documentul intern, ceea ce nu se întâmplă de fiecare dată. Corecție importantă față de propriul nostru inventar: `hyperframes` NU este codul nostru. E clona depozitului public al altei companii, sub licență Apache 2.0, fără niciun commit al nostru. E unealta cu care lucrăm; realizările sunt compozițiile și randările, nu unealta.

Ролик на тридцять секунд має три способи зіпсуватися, і лише один видно з першого перегляду. Він псується візуально — це помічають усі. Він псується на слух, і тоді ролик звучить голосніше або тихіше за все, що є навколо нього в мережі, куди він потрапляє, що помітно лише після публікації. І він псується юридично, що ніколи не помітно, аж до дня, коли це помітять. Ми працюємо з усіма трьома, а щодо останніх двох маємо письмову процедуру, а не добру волю.

Компонування робиться в HTML, а не в редакторі. Композиція — це документ із доріжками та кліпами, кожен із часом старту та тривалістю, записаними як атрибути — наприклад, кліп, що починається на секунді 8,4 і триває 5,0 секунди, з навмисним перекриттям над попереднім для переходу. Практичний наслідок у тому, що кліп можна відтворити ідентично: ті самі атрибути, той самий результат, а виправлення тексту не вимагає ручного перероблення монтажу. Рендер нашої рекламної композиції вийшов 1920×1080, 60 кадрів на секунду, 1200 кадрів, рівно 20,000000 секунди — цифри прочитані з файлу, а не з brief.

Голос синтезується, із налаштуваннями, записаними в сценарії разом із текстом, щоб повторення звучало ідентично: багатомовна модель, стабільність, схожість, стиль і швидкість позначені як значення, а не як враження. Текст калібрується на тривалість до генерації — ролик на тридцять секунд підтримує близько шістдесяти п’яти слів румунською, а якщо сценарій має вісімдесят, скорочують текст, а не прискорюють голос. Фінальний звук нормалізується у два проходи до цільового значення і після цього вимірюється у файлі, що передається: чотири ролики з нещодавнього набору мають −16,2 і −15,9 LUFS, із реальним піком −1,8 dBTP.

Правило, якого ми дотримуємося і яке чітко видно у файлі ліцензій одного переданого набору: у роликy немає нічого з ліцензією, яку ми не можемо показати. Музичну підкладку та звукові ефекти було синтезовано локально за допомогою `ffmpeg` — п’ять синусоїдальних осциляторів із фільтром низьких частот для музики, відфільтрований рожевий шум для ефекту переходу, імпульс 1500 Hz з експоненційною огинаючою для кліку — саме тому, що звук, зроблений нами, має доказувану ліцензію, а «безкоштовний» файл зі сторінки, яка не каже, на яких умовах, — ні. Рамки телефону й ноутбука намальовані в SVG, а не фотографії продукту. Знімки — це нашої платформи, зроблені автоматично на локальній виробничій версії. Шрифт самостійно розміщений, під відкритою ліцензією для шрифтів.

Що входить

Робота, за складовими

Сценарій із таймінгами, відкалібрований на тривалість до генерації

Таблиця сцен з інтервалами та текстом, який промовляється для кожної, плюс ціль ритму. Сирий текст для синтезу пишеться окремо, одним блоком, а паузи задає пунктуація. Якщо текст перевищує тривалість, текст скорочується — прискорення голосу чути, а ролик, що звучить поспіхом, втрачає саме те, що мав би виграти.

Композиція в HTML, із доріжками та кліпами з записаними таймінгами

Кожен кліп має старт і тривалість як атрибути, а перекриття для переходів є навмисними й видимими в джерелі. Наша рекламна композиція має п’ять кліпів на основній доріжці та окремі індекси доріжок для елементів, що йдуть поверх, у двадцятисекундній часовій лінії. Записаний монтаж можна відтворити ідентично; зроблений вручну — ні.

Рендер із перевірюваними параметрами

Останній рендер власної композиції, виміряний за допомогою `ffprobe`: H.264, 1920×1080, 60/1 кадрів за секунду, 1200 кадрів, 20,000000 секунд. Не «приблизно двадцять секунд» — точно, тому що кількість кадрів є цілим числом і випливає з композиції.

Синтезований голос із налаштуваннями, зазначеними в сценарії

Багатомовна модель, що підтримує румунську, зі стабільністю, схожістю, стилем і швидкістю, записаними як значення поруч із текстом. Ті самі налаштування дають той самий голос через три місяці, коли хтось просить варіант зі зміненим реченням. Для російської ми використовуємо окремий голос, підібраний для мови, а не перекладений тим самим.

Звук, виміряний, а не оцінений

Нормалізація у два проходи до цільового рівня гучності, потім вимірювання на файлі, переданому за європейським стандартом гучності. Значення для недавнього набору: −16,2 і −15,9 LUFS інтегровано, справжній пік −1,8 dBTP, динамічний діапазон 10,5 LU. Аудіо AAC на 48 kHz, stereo, близько 160 kbps, із заголовком, переміщеним на початок, щоб файл запускався без повного завантаження.

Дві мови і два формати з одного й того самого матеріалу

Горизонтальний 1920×1080 і вертикальний 1080×1920, румунською та російською — чотири файли для однієї й тієї самої історії, бо горизонтальний кліп, автоматично обрізаний до вертикального, втрачає саме ту частину, де щось відбувається. Другий набір, для вступу, має ту саму структуру, на 20,36 секунди.

Знімки реального продукту, згенеровані автоматично

У кліпі видно записи платформи, зроблені за допомогою інструмента автоматизації браузера на локально запущеній продакшн-версії: публічні сторінки, відредаговані, без облич, без номерів реєстрації, без точних адрес. Для промо-композиції я окремо витягнув знімки в кількох положеннях прокрутки, а також кольори, шрифти й анімації сторінки, щоб рух у кліпі був схожий на рух на сайті.

Папка ліцензій для кожного елемента в кадрі

Таблиця з джерелом і ліцензією кожного звуку та кожного зображення, плюс розділ про те, чого НЕМАЄ в кліпі: без бібліотечної музики, без стокових відео, без записаних людських голосів, без логотипів установ, без знімків з інших платформ. Музика та ефекти синтезуються локально за допомогою `ffmpeg`, тож ліцензію можна довести, запустивши скрипт ще раз.

Набори статичних візуалів для кампаній

Коли повідомлення тестують, а не знімають: два раунди по тридцять креативів для однієї кампанії, у вертикальному форматі для соцмереж, кожен зі своїм кутом повідомлення в назві файлу. Дешевше з’ясувати, яке повідомлення працює, на зображеннях, ніж на кліпах, і лише потім знімати.

Як це виглядає

Шлях, крок за кроком.

01

Пишемо сценарій із таймінгами й ріжемо його за тривалістю

Сцени, інтервали, текст, що озвучується, цільовий ритм. Тут вирішується, чи вміститься повідомлення — не в монтажі. Ми передаємо сценарій до будь-якої генерації, бо це єдиний дешевий момент, коли можна змінити ідею.

02

Збираємо матеріал і визначаємо його ліцензію разом із ним

Автоматично згенеровані знімки на тестовій версії, намальовані елементи, локально синтезовані звуки, згенерований голос. Кожен елемент отримує рядок у папці ліцензій у момент, коли потрапляє в проєкт, а не наприкінці, коли ніхто вже не пам’ятає, звідки він узявся.

03

Будуємо композицію і рендеримо її за фіксованими параметрами

Доріжки, кліпи зі стартом і тривалістю, переходи через навмисне накладання. Рендер перевіряється інструментами: роздільна здатність, кадри за секунду, кількість кадрів, тривалість. Якщо тривалість не така, як у сценарії, це помилка композиції, а не округлення.

04

Нормалізуємо звук і вимірюємо його на фінальному файлі

Два проходи до цільової гучності, потім вимірювання на переданому файлі, а не на проміжному. Отримані цифри записуються в документ передачі, щоб їх можна було оскаржити.

05

Передаємо варіанти та джерело

Обидва формати, обидві мови, плюс окремі елементи — нарація, музика, кадри сценарію — і композиція. Причина, чому ми передаємо і джерело, проста: за рік хтось захоче іншу фразу на двадцятій секунді.

Un centru. În jur, ce intră în el — pe trasee separate.CENTRUL SE SPRIJINĂ PE CE E ÎN JURUL LUI
În centru, compoziția — un document cu piste și clipuri cu timpi scriși. În jurul ei orbitează elementele care intră în cadru, fiecare cu eticheta lui de licență: capturile produsului generate automat, ramele desenate în SVG, patul muzical și efectele sintetizate local, vocea generată, fontul autogăzduit. Un element fără etichetă nu intră pe orbită.

Дані

Чого торкаємося, де воно лежить і скільки лишається

Запитання, які ставить кожен, у кого є відповідальний за захист даних, — поставлені тут раніше, ніж їх поставить він.

Що потрапляє в кадр і звідки воно
Знімки платформи клієнта або продукту, автоматично згенеровані на тестовій версії, плюс елементи, намальовані нами. Кожен має рядок у файлі ліцензій. Практичне правило: якщо ми не можемо показати, звідки це походить, воно не потрапляє в кліп.
Персональні дані у відзнятому матеріалі
Вони редагуються до захоплення, а не після монтажу: без облич, без номерних знаків, без точних адрес, без реальних даних клієнтів на показаних екранах. Демонстраційний екран заповнюється вигаданими даними, і це вирішується до запуску захоплення.
Синтезований голос і умови постачальника
Аудіо, згенероване на нашому або клієнтському акаунті, використовується комерційно на умовах оплачуваного плану. Чого ми не робимо, тому що це прямо заборонено в умовах постачальника: не навчаємо і не тестуємо конкуруючу модель на його виході. Обмеження застосовується також до нашого власного напряму досліджень щодо голосу.
Що передається наприкінці
Фінальні файли в обох форматах і обох мовах, окремо розташована нарація на часовій осі, окрема музична основа, витягнуті кадри сценарію, сценарій із часовими мітками та файл ліцензій. Джерело композиції залишається у клієнта, щоб зміна тексту через рік не вимагала переробки з нуля.

Випадок

Кліп тривалістю тридцять секунд, у чотирьох файлах, разом із файлом ліцензій

Ситуація

Просування власної публічної платформи, двома мовами, для мереж, де той самий матеріал має існувати і горизонтально, і вертикально. Самовстановлене обмеження: жоден елемент у кліпі не повинен мати ліцензію, яку ми не можемо показати.

Що ми збудували

Сценарій із часовими мітками та текстом, що промовляється по сценах, обома мовами, з окремо обраними голосами за мовою. Знімки платформи, автоматично згенеровані на локально запущеній виробничій версії, з відредагованими сторінками — без облич, без номерних знаків, без точних адрес. Рамки телефону та ноутбука, намальовані в SVG, а не фотографії продукту. Музична основа та два звукові ефекти синтезовані локально за допомогою `ffmpeg`: синусоїдальні осцилятори з низькочастотним фільтром для музики, відфільтрований рожевий шум для переходу, імпульс 1500 Гц з експоненційною огинаючою для клацання. Звук нормалізовано у два проходи до цільової гучності.

Що вийшло

Чотири файли — дві мови × два формати — рівно по 30,00 секунди кожен, із 30 кадрами на секунду, H.264 з аудіо AAC 48 kHz stereo приблизно 160 kbps і заголовком, перенесеним на початок. Сьогодні ми повторно виміряли горизонтальну версію румунською: −16,2 LUFS інтегровано, справжній пік −1,8 dBTP, динамічний діапазон 10,5 LU, 900 кадрів для 30,00 секунди. Цифри збігаються з документом передачі. Окрім файлів були передані окрема нарація, окрема музична основа, кадри сценарію та таблиця ліцензій.

Чого цей випадок не каже

Рамка для рендерингу не наша — це проєкт з відкритим кодом іншої компанії, під Apache 2.0, а наш внесок у нього — нульовий. Голос синтезується на нашому акаунті, на умовах платного плану постачальника, а його умови прямо забороняють використовувати вихід для навчання чи тестування конкуруючої моделі; це межа, яку ми дотримуємо. І ще одна, здорового глузду: кліп не вирішує повідомлення, яке не працює — тому, коли можна, ми тестуємо повідомлення на зображеннях перед тим.

Питання

Про що нас питають, перш ніж зателефонувати

У вас є власний двигун для генерації відео?

Ні, і важливо не створювати такого враження. Ми компонуємо в HTML і рендеримо, використовуючи фреймворк з відкритим кодом, розроблений іншою компанією, за ліцензією Apache 2.0. Ми перевірили: у нашому клоні немає жодного нашого commit. Наше — це композиції, сценарії, скріншоти, звуки, синтезовані локально, і дисципліна ліцензій. Інструмент — не результат.

Що конкретно означає «відео з AI»? Видно, що воно згенероване?

У наших матеріалах генерація покриває голос і частину зображень кампанії. Рух і монтаж написані, а не згенеровані: кліп із таймінгами та доріжками, рендерений детерміновано. Ми не створюємо синтетичних людей, які говорять у кадрі. Причина практична: кліп, у якому видно реальний продукт, автоматично захоплений, старіє повільніше і не має проблеми достовірності неіснуючого ведучого.

Хто володіє правами на кліп?

Клієнт — на матеріал, що передається, а зовнішні джерела залишаються під їхньою ліцензією, яка елемент за елементом прописана в ліцензійному досьє. Згенерований голос використовується комерційно на умовах платного плану постачальника, на акаунті, на якому його було згенеровано. Ми передаємо і досьє, а не лише файли — якщо хтось через два роки запитає, звідки той звук, відповідь є письмово.

Чому ви синтезуєте музику замість того, щоб взяти безкоштовний трек?

Тому що «безкоштовний» трек означає довіру до сторінки, яка каже, що він безкоштовний. Музичний фон, зроблений із п’яти синусоїдальних осциляторів із фільтром і коротким ехо, має ліцензію, яку ми можемо довести, запустивши скрипт ще раз. Якщо проєкт потребує справжнього треку, це можливо — але тоді в досьє входять точне джерело, точна ліцензія і дата завантаження, а не нечітка згадка.

У яких мовах і форматах ви передаєте?

Румунською та російською, у горизонтальному 1920×1080 і вертикальному 1080×1920. Ми не обрізаємо автоматично горизонталь у вертикаль: композиція вибудовується окремо, бо у вертикалі в кадр потрапляє інше. Інші мови можна зробити тими самими інструментами, але голос обирається за мовою і прослуховується наперед, а не припускається.

Чому має значення виміряна гучність?

Бо кліп, тихіший за те, що навколо нього в соціальній мережі, пропускають, а занадто гучний — закривають. Ми нормалізуємо у два проходи до цілі та вимірюємо на переданому файлі за європейським стандартом гучності. Для недавнього набору цифри — −16,2 і −15,9 LUFS, з реальним піком −1,8 dBTP. Це виміряно, а не оцінено, і ми пишемо це в документі передачі саме для перевірки.

Ви можете робити кліпи з моїм продуктом, а не з типовими анімаціями?

Так, і саме це ми віддаємо перевагу. Скріншоти робляться автоматично, інструментом автоматизації браузера, на тестовій версії продукту, у кількох позиціях прокрутки; для однієї композиції ми окремо витягли також кольори, шрифти й анімації сторінки, щоб рух у кліпі був схожий на реальний рух інтерфейсу. Умова — щоб існувала версія, яку ми можемо запустити, і демонстраційні дані, які не є реальними.

Як швидко можна змінити фразу через кілька місяців?

Оскільки монтаж — це документ із таймінгами, а не проєкт в редакторі, фраза змінюється в сценарії, наново генерується нарація з тими самими налаштуваннями голосу, і все рендериться ще раз. Саме тому ми передаємо джерело і налаштування голосу, а не лише фінальний файл. Без них будь-яка зміна означає переробку.

Ви робите також кампанії зображень, не лише кліпи?

Так, і часто це правильний крок перед кліпом. Для однієї кампанії ми підготували два раунди по тридцять вертикальних креативів, кожен з іншим кутом повідомлення. Перевіряють, яке повідомлення працює на зображеннях, які дешеві в переробці, і лише потім інвестують у кліп на повідомлення-переможець.

На чому ґрунтуються твердження вище (11 джерел)
  1. Termenii furnizorului de voce interzic antrenarea sau testarea unui model concurent pe ieșirea luihttps://elevenlabs.io/use-policy · 2026-09-06

10 з них — це код і файли з наших репозиторіїв. Ми не публікуємо їхні назви чи номери рядків: разом, на одній сторінці, це надто точно описало б, як побудовані системи, які належать не лише нам. Ми проходимо їх разом із вами, у репозиторії, за запитом — перевірка залишається можливою, просто вона відбувається в розмові.

Що вам хотілося б налагодити?

Розкажіть про свій процес. Разом визначимо, що варто збудувати, що можна підключити і як перевіримо результат.

Поговорімо