Przejdź do treści
megapromotingPorozmawiajmy

Ekspertyza · Wideo i treści z AI

Krótkie klipy zbudowane w HTML, z syntetyzowanym głosem i z licencją każdego elementu na papierze.

Produkujemy klipy promocyjne i zestawy wizualizacji z użyciem narzędzi generatywnych — syntetyzowanego głosu, obrazów, animowanych kompozycji renderowanych z HTML. Każdy element, który trafia do kadru, ma zapisane źródło i licencję, a dźwięk jest mierzony, nie szacowany.

Już zbudowaneSunt materiale livrate, pe disc, pe care le-am măsurat azi cu unelte, nu le-am citit dintr-un raport. Un set de patru clipuri de 30 de secunde fix (două limbi × două formate) pentru o platformă proprie, un al doilea set de patru clipuri de introducere, o compoziție proprie randată în șapte variante pentru promovarea companiei, și două runde de vizualuri statice de campanie pentru un operator de transport. Am reverificat sonorul unuia dintre clipuri cu `ffmpeg … ebur128`: −16,2 LUFS integrat, vârf real −1,8 dBTP — exact cifrele din documentul intern, ceea ce nu se întâmplă de fiecare dată. Corecție importantă față de propriul nostru inventar: `hyperframes` NU este codul nostru. E clona depozitului public al altei companii, sub licență Apache 2.0, fără niciun commit al nostru. E unealta cu care lucrăm; realizările sunt compozițiile și randările, nu unealta.

Trzydziestosekundowy klip może zepsuć się na trzy sposoby i tylko jeden widać przy pierwszym obejrzeniu. Psuje się wizualnie — to zauważa każdy. Psuje się dźwiękowo i wtedy klip jest głośniejszy albo cichszy niż wszystko wokół niego w sieci, do której trafia, co widać dopiero po publikacji. I psuje się prawnie, czego nie widać nigdy, aż do dnia, w którym zaczyna być widać. Pracujemy nad wszystkimi trzema, a w przypadku dwóch ostatnich mamy pisemną procedurę, nie dobrą wolę.

Kompozycję tworzy się w HTML, a nie w edytorze. Kompozycja to dokument ze ścieżkami i klipami, każdy z momentem startu i czasem trwania zapisanymi jako atrybuty — na przykład klip zaczynający się w 8,4 sekundzie i trwający 5,0 sekund, z celowym nakładaniem się na poprzedni dla przejścia. Praktyczna konsekwencja jest taka, że klip można odtworzyć identycznie: te same atrybuty, ten sam rezultat, a poprawka tekstu nie wymaga ręcznego odtwarzania montażu. Render z naszej kompozycji promocyjnej wyszedł w 1920×1080, 60 klatek na sekundę, 1200 klatek, dokładnie 20,000000 sekundy — liczby odczytane z pliku, a nie z briefu.

Głos jest syntetyzowany, z ustawieniami zapisanymi w scenariuszu razem z tekstem, tak aby odtworzenie brzmiało identycznie: model wielojęzyczny, stabilność, podobieństwo, styl i szybkość zapisane jako wartości, a nie wrażenia. Tekst jest kalibrowany pod czas przed generowaniem — klip trzydziestosekundowy mieści około sześćdziesięciu pięciu słów po rumuńsku, a jeśli scenariusz ma osiemdziesiąt, skraca się tekst, a nie przyspiesza głos. Końcowy dźwięk normalizuje się w dwóch przejściach do celu i mierzy potem na dostarczonym pliku: cztery klipy z jednego niedawnego zestawu mają −16,2 i −15,9 LUFS, z prawdziwym szczytem −1,8 dBTP.

Zasada, której przestrzegamy i która wyraźnie widać w dossier licencji jednego z dostarczonych zestawów: nic w klipie nie ma licencji, której nie możemy pokazać. Podkład muzyczny i efekty dźwiękowe zostały wygenerowane lokalnie za pomocą `ffmpeg` — pięć sinusoidalnych oscylatorów z filtrem dolnoprzepustowym do muzyki, filtrowany różowy szum do efektu przejścia, impuls 1500 Hz z obwiednią wykładniczą do kliknięcia — właśnie po to, że dźwięk zrobiony przez nas ma możliwą do wykazania licencję, a „darmowy” plik ze strony, która nie mówi, na jakich warunkach, nie. Ramki telefonu i laptopa są narysowane w SVG, a nie jako zdjęcia produktów. Zrzuty ekranu są z naszej platformy, wykonane automatycznie na lokalnej wersji produkcyjnej. Czcionka jest hostowana samodzielnie, na otwartej licencji dla fontów.

Co obejmuje

Praca, komponent po komponencie

Scenariusz z czasami, skalibrowany pod czas przed generowaniem

Tabela scen z interwałami i tekstem mówionym dla każdej, plus docelowe tempo. Surowy tekst do syntezy zapisuje się osobno, w jednym bloku, a pauzy nadaje interpunkcja. Jeśli tekst przekracza czas trwania, skraca się tekst — przyspieszenie głosu słychać, a klip, który brzmi zbyt pospiesznie, traci dokładnie to, co miał zyskać.

Kompozycja w HTML, ze ścieżkami i klipami z zapisanymi czasami

Każdy klip ma start i czas trwania jako atrybuty, a nakładki do przejść są celowe i widoczne w źródle. Nasza kompozycja promocyjna ma pięć klipów na głównej ścieżce i oddzielne indeksy ścieżek dla elementów nakładanych, w osi czasu dwudziestu sekund. Zapisany montaż można odtworzyć identycznie; ręcznie zrobionego — nie.

Render z parametrami możliwymi do weryfikacji

Ostatnia renderowana własnej kompozycji, zmierzona za pomocą `ffprobe`: H.264, 1920×1080, 60/1 klatek na sekundę, 1200 klatek, 20,000000 sekundy. Nie „około dwudziestu sekund” — dokładnie, ponieważ liczba klatek jest całkowita i wynika z kompozycji.

Syntezowany głos z ustawieniami notowanymi w scenariuszu

Model wielojęzyczny obsługujący rumuński, ze stabilnością, podobieństwem, stylem i szybkością zapisanymi jako wartości obok tekstu. Te same ustawienia dają ten sam głos po trzech miesiącach, gdy ktoś prosi o wariant z jedną zmienioną frazą. Dla rosyjskiego używamy oddzielnego głosu, dobranego do języka, a nie tłumaczonego tym samym.

Dźwięk mierzony, nie szacowany

Normalizacja w dwóch przejściach do celu głośności, potem pomiar na dostarczonym pliku zgodnie z europejskim standardem głośności. Wartości dla niedawnego zestawu: −16,2 i −15,9 LUFS zintegrowane, prawdziwy szczyt −1,8 dBTP, zakres dynamiczny 10,5 LU. Audio AAC przy 48 kHz, stereo, około 160 kbps, z nagłówkiem przeniesionym na początek, aby plik uruchamiał się bez pełnego pobierania.

Dwa języki i dwa formaty z tego samego materiału

Poziomo 1920×1080 i pionowo 1080×1920, po rumuńsku i po rosyjsku — cztery pliki dla tej samej historii, ponieważ poziomy klip automatycznie przycięty do pionu traci dokładnie tę część, w której coś się dzieje. Drugi dostarczony zestaw, wprowadzający, ma tę samą strukturę, przy 20,36 sekundy.

Zrzuty ekranu rzeczywistego produktu, generowane automatycznie

To, co widać w klipie, to nagrania platformy, wykonane narzędziem automatyzacji przeglądarki na lokalnie uruchomionej wersji produkcyjnej: publiczne strony, redagowane, bez twarzy, bez numerów rejestracyjnych, bez dokładnych adresów. Do kompozycji promocyjnej wyodrębniliśmy osobno zrzuty z kilku pozycji przewijania, plus kolory, fonty i animacje strony, aby ruch w klipie przypominał ruch na stronie.

Dosier licencji dla każdego elementu w kadrze

Tabela z źródłem i licencją każdego dźwięku i każdego obrazu, plus sekcja o tym, czego NIE ma w klipie: bez muzyki bibliotecznej, bez stockowych nagrań, bez nagranych ludzkich głosów, bez logo instytucji, bez zrzutów z innych platform. Muzyka i efekty są syntetyzowane lokalnie za pomocą `ffmpeg`, więc licencję można wykazać, uruchamiając skrypt ponownie.

Zestawy statycznych wizualizacji do kampanii

Gdy testuje się komunikat, nie filmuje się: dwie rundy po trzydzieści kreacji dla jednej kampanii, w formacie pionowym dla sieci, każda z własnym kątem komunikatu w nazwie pliku. Taniej jest sprawdzić, który komunikat działa z obrazów niż z klipów, a dopiero potem filmować.

Jak to wygląda

Trasa, krok po kroku.

01

Pisemy scenariusz z czasami i tniemy go pod czas trwania

Sceny, interwały, mówiony tekst, cel tempa. Tutaj decyduje się, czy komunikat się zmieści — nie w montażu. Dostarczamy scenariusz przed jakąkolwiek generacją, ponieważ to jedyny tani moment, w którym można zmienić ideę.

02

Zbieramy materiał i ustalamy jego licencję razem z nim

Automatycznie generowane zrzuty ekranu na wersji testowej, rysowane elementy, lokalnie syntetyzowane dźwięki, generowany głos. Każdy element otrzymuje wiersz w dosierze licencji w momencie, gdy wchodzi do projektu, a nie na końcu, gdy nikt już nie pamięta, skąd się pojawił.

03

Budujemy kompozycję i renderujemy ją przy stałych parametrach

Ścieżki, klipy ze startem i czasem trwania, przejścia przez celowe nakładanie. Render sprawdza się narzędziami: rozdzielczość, liczba klatek na sekundę, liczba klatek, czas trwania. Jeśli czas trwania nie jest taki jak w scenariuszu, to błąd kompozycji, a nie zaokrąglenie.

04

Normalizujemy dźwięk i mierzymy go na pliku końcowym

Dwa przejścia do celu głośności, potem pomiar na dostarczonym pliku, nie na pośrednim. Uzyskane liczby wpisuje się do dokumentu przekazania, aby można było je zakwestionować.

05

Dostarczamy warianty i źródło

Oba formaty, oba języki, plus osobne elementy — narracja, muzyka, kadry scenariusza — oraz kompozycję. Powód, dla którego przekazujemy też źródło, jest prosty: za rok ktoś będzie chciał inne zdanie w dwudziestej sekundzie.

Un centru. În jur, ce intră în el — pe trasee separate.CENTRUL SE SPRIJINĂ PE CE E ÎN JURUL LUI
În centru, compoziția — un document cu piste și clipuri cu timpi scriși. În jurul ei orbitează elementele care intră în cadru, fiecare cu eticheta lui de licență: capturile produsului generate automat, ramele desenate în SVG, patul muzical și efectele sintetizate local, vocea generată, fontul autogăzduit. Un element fără etichetă nu intră pe orbită.

Dane

Czego dotykamy, gdzie to leży i jak długo zostaje

Pytania, które zadaje każdy, kto ma inspektora ochrony danych — postawione tutaj, zanim on je zada.

Co wchodzi do kadru i skąd pochodzi
Zrzuty platformy klienta lub produktu, generowane automatycznie na wersji testowej, plus elementy narysowane przez nas. Każdy ma wpis w dossier licencji. Praktyczna zasada: jeśli nie możemy pokazać, skąd to pochodzi, nie trafia do klipu.
Dane osobowe w materiale filmowanym
Opracowuje się je przed zrzutem, nie po montażu: bez twarzy, bez numerów rejestracyjnych, bez dokładnych adresów, bez rzeczywistych danych klienta na pokazanych ekranach. Ekran demonstracyjny wypełnia się zmyślonymi danymi, a to ustala się przed uruchomieniem zrzutów.
Syntetyczny głos i warunki dostawcy
Audio generowane na naszym albo klienta koncie używa się komercyjnie na warunkach opłaconego planu. Czego nie robimy, ponieważ jest to wyraźnie zabronione w warunkach dostawcy: nie trenujemy i nie testujemy modelu konkurencyjnego na jego wyjściu. Ograniczenie obowiązuje również nasz własny kierunek badań nad głosem.
Co przekazuje się na końcu
Pliki końcowe w obu formatach i obu językach, osobno ułożona narracja na osi czasu, osobny podkład muzyczny, wyodrębnione kadry scenariusza, scenariusz z czasami i dossier licencji. Źródło kompozycji pozostaje u klienta, aby zmiana tekstu za rok nie wymagała odtwarzania od zera.

Przykład

Klip trzydziestosekundowy, w czterech plikach, z dossier licencji obok

Sytuacja

Promowanie własnej publicznej platformy, w dwóch językach, dla sieci, gdzie ten sam materiał musi istnieć zarówno poziomo, jak i pionowo. Samo nałożone ograniczenie: żaden element klipu nie ma mieć licencji, której nie możemy pokazać.

Co zbudowaliśmy

Scenariusz z czasami i tekstem mówionym według scen, w obu językach, z osobno wybranymi głosami dla każdego języka. Zrzuty platformy generowane automatycznie na lokalnie uruchamianej wersji produkcyjnej, z opracowanymi stronami — bez twarzy, bez numerów rejestracyjnych, bez dokładnych adresów. Ramki telefonu i laptopa narysowane w SVG, nie zdjęcia produktu. Podkład muzyczny i dwa efekty dźwiękowe syntetyzowane lokalnie za pomocą `ffmpeg`: oscylatory sinusoidalne z filtrem dolnoprzepustowym dla muzyki, filtrowany szum różowy dla przejścia, impuls 1500 Hz z obwiednią wykładniczą dla kliknięcia. Dźwięk znormalizowany w dwóch przejściach do celu głośności.

Co z tego wyszło

Cztery pliki — dwa języki × dwa formaty — dokładnie po 30,00 sekundy każdy, przy 30 klatkach na sekundę, H.264 z audio AAC 48 kHz stereo około 160 kbps i nagłówkiem przeniesionym na początek. Dziś ponownie zmierzyliśmy wariant poziomy po rumuńsku: −16,2 LUFS zintegrowany, szczyt rzeczywisty −1,8 dBTP, zakres dynamiczny 10,5 LU, 900 klatek dla 30,00 sekundy. Liczby pokrywają się z dokumentem przekazania. Oprócz plików przekazano osobną narrację, osobny podkład muzyczny, kadry scenariusza i tabelę licencji.

Czego nie mówi ten przypadek

Ramka robocza do renderowania nie jest nasza — to projekt open source innej firmy, na licencji Apache 2.0, a nasz wkład w niego wynosi zero. Głos jest syntetyzowany na naszym koncie, na warunkach płatnego planu dostawcy, a jego regulamin wyraźnie zabrania używania wyjścia do trenowania lub testowania konkurencyjnego modelu; to granica, której przestrzegamy. I jeszcze jedna, zdroworozsądkowa: klip nie rozwiązuje komunikatu, który nie działa — dlatego, kiedy to możliwe, testujemy komunikat na obrazach przedtem.

Pytania

O co pytają ludzie, zanim zadzwonią

Czy macie własny silnik generowania wideo?

Nie i ważne jest, aby nie sprawiać takiego wrażenia. Składamy w HTML i renderujemy, używając ramki roboczej open source, rozwijanej przez inną firmę, na licencji Apache 2.0. Sprawdziliśmy: w naszej kopii nie ma żadnego naszego commita. Nasze są kompozycje, scenariusze, zrzuty ekranu, lokalnie syntetyzowane dźwięki i dyscyplina licencyjna. Narzędzie nie jest osiągnięciem.

Co konkretnie oznacza „wideo z AI”? Widać, że jest generowane?

W naszych materiałach generowanie obejmuje głos i część obrazów kampanii. Ruch i montaż są napisane, nie generowane: klip z timingiem i ścieżkami, renderowany deterministycznie. Nie tworzymy syntetycznych osób mówiących w kadrze. Powód jest praktyczny: klip, w którym widać prawdziwy produkt, automatycznie zarejestrowany, starzeje się wolniej i nie ma problemu z wiarygodnością nieistniejącego prezentera.

Kto ma prawa do klipu?

Klient, do dostarczonego materiału, a źródła zewnętrzne pozostają pod swoją licencją, która jest zapisana element po elemencie w dossier licencyjnym. Generowany głos jest używany komercyjnie na warunkach płatnego planu dostawcy, na koncie, na którym został wygenerowany. Przekazujemy także dossier, nie tylko pliki — jeśli ktoś zapyta po dwóch latach, skąd jest ten dźwięk, odpowiedź istnieje na piśmie.

Dlaczego syntetyzujecie muzykę zamiast użyć darmowego utworu?

Bo „darmowy” utwór zakłada zaufanie do strony, która twierdzi, że jest darmowy. Tło muzyczne z pięciu oscylatorów sinusoidalnych z filtrem i krótkim echem ma licencję, którą możemy wykazać, uruchamiając skrypt ponownie. Jeśli projekt wymaga prawdziwego utworu, można — ale wtedy do dossier trafia dokładne źródło, dokładna licencja i data pobrania, nie niejasna wzmianka.

W jakich językach i formatach dostarczacie?

Rumuński i rosyjski, w poziomie 1920×1080 i w pionie 1080×1920. Nie przycinamy automatycznie poziomu do pionu: kompozycja jest układana oddzielnie, bo w pionie do kadru wchodzi coś innego. Inne języki można zrobić tymi samymi narzędziami, ale głos wybiera się według języka i odsłuchuje wcześniej, nie zakłada.

Dlaczego ma znaczenie zmierzona głośność?

Bo klip cichszy niż otoczenie w sieci społecznościowej jest pomijany, a zbyt głośny jest zamykany. Normalizujemy w dwóch przejściach do celu i mierzymy na dostarczonym pliku według europejskiego standardu głośności. Dla niedawnego zestawu liczby wynoszą −16,2 i −15,9 LUFS, z prawdziwym szczytem −1,8 dBTP. Są zmierzone, nie oszacowane, i zapisujemy je w dokumencie przekazania właśnie po to, aby można je było sprawdzić.

Czy możecie robić klipy z moim produktem, a nie z ogólnymi animacjami?

Tak i to preferujemy. Zrzuty ekranu są wykonywane automatycznie, za pomocą narzędzia do automatyzacji przeglądarki, na testowej wersji produktu, w wielu pozycjach przewijania; do jednej kompozycji wyodrębniliśmy osobno także kolory, fonty i animacje strony, aby ruch w klipie przypominał rzeczywisty ruch interfejsu. Warunkiem jest istnienie wersji, którą możemy uruchomić, oraz danych demonstracyjnych, które nie są rzeczywiste.

Jak szybko można zmienić zdanie za kilka miesięcy?

Ponieważ montaż jest dokumentem z timingiem, a nie projektem z edytora, zdanie zmienia się w scenariuszu, narracja jest generowana ponownie z tymi samymi ustawieniami głosu i wszystko renderuje się jeszcze raz. Dlatego przekazujemy źródło i ustawienia głosu, nie tylko plik końcowy. Bez nich każda modyfikacja oznacza przeróbkę od nowa.

Robicie też kampanie obrazowe, nie tylko klipy?

Tak, i często to właściwy krok przed klipem. Dla jednej kampanii przygotowaliśmy dwie rundy po trzydzieści pionowych kreacji, każda z innym kątem komunikatu. Testuje się, który komunikat działa na obrazach, które są tanie do przerobienia, a dopiero potem inwestuje się w klip na zwycięski komunikat.

Na czym opierają się powyższe stwierdzenia (11 źródeł)
  1. Termenii furnizorului de voce interzic antrenarea sau testarea unui model concurent pe ieșirea luihttps://elevenlabs.io/use-policy · 2026-09-06

10 z nich to kod i pliki z naszych repozytoriów. Nie publikujemy ich nazw ani numerów linii: razem, na jednej stronie, opisałoby to zbyt dokładnie, jak zbudowane są systemy, które nie należą tylko do nas. Przechodzimy je razem z Tobą, w repozytorium, na życzenie — weryfikacja pozostaje możliwa, tylko odbywa się w rozmowie.

Co chcesz, żeby działało lepiej?

Opowiedz nam o swoim procesie. Wspólnie ustalimy, co warto zbudować, co da się połączyć i jak sprawdzimy wynik.

Porozmawiajmy