Ekspertyza · Wideo i treści z AI
Krótkie klipy zbudowane w HTML, z syntetyzowanym głosem i z licencją każdego elementu na papierze.
Produkujemy klipy promocyjne i zestawy wizualizacji z użyciem narzędzi generatywnych — syntetyzowanego głosu, obrazów, animowanych kompozycji renderowanych z HTML. Każdy element, który trafia do kadru, ma zapisane źródło i licencję, a dźwięk jest mierzony, nie szacowany.
Już zbudowaneSunt materiale livrate, pe disc, pe care le-am măsurat azi cu unelte, nu le-am citit dintr-un raport. Un set de patru clipuri de 30 de secunde fix (două limbi × două formate) pentru o platformă proprie, un al doilea set de patru clipuri de introducere, o compoziție proprie randată în șapte variante pentru promovarea companiei, și două runde de vizualuri statice de campanie pentru un operator de transport. Am reverificat sonorul unuia dintre clipuri cu `ffmpeg … ebur128`: −16,2 LUFS integrat, vârf real −1,8 dBTP — exact cifrele din documentul intern, ceea ce nu se întâmplă de fiecare dată. Corecție importantă față de propriul nostru inventar: `hyperframes` NU este codul nostru. E clona depozitului public al altei companii, sub licență Apache 2.0, fără niciun commit al nostru. E unealta cu care lucrăm; realizările sunt compozițiile și randările, nu unealta.
Trzydziestosekundowy klip może zepsuć się na trzy sposoby i tylko jeden widać przy pierwszym obejrzeniu. Psuje się wizualnie — to zauważa każdy. Psuje się dźwiękowo i wtedy klip jest głośniejszy albo cichszy niż wszystko wokół niego w sieci, do której trafia, co widać dopiero po publikacji. I psuje się prawnie, czego nie widać nigdy, aż do dnia, w którym zaczyna być widać. Pracujemy nad wszystkimi trzema, a w przypadku dwóch ostatnich mamy pisemną procedurę, nie dobrą wolę.
Kompozycję tworzy się w HTML, a nie w edytorze. Kompozycja to dokument ze ścieżkami i klipami, każdy z momentem startu i czasem trwania zapisanymi jako atrybuty — na przykład klip zaczynający się w 8,4 sekundzie i trwający 5,0 sekund, z celowym nakładaniem się na poprzedni dla przejścia. Praktyczna konsekwencja jest taka, że klip można odtworzyć identycznie: te same atrybuty, ten sam rezultat, a poprawka tekstu nie wymaga ręcznego odtwarzania montażu. Render z naszej kompozycji promocyjnej wyszedł w 1920×1080, 60 klatek na sekundę, 1200 klatek, dokładnie 20,000000 sekundy — liczby odczytane z pliku, a nie z briefu.
Głos jest syntetyzowany, z ustawieniami zapisanymi w scenariuszu razem z tekstem, tak aby odtworzenie brzmiało identycznie: model wielojęzyczny, stabilność, podobieństwo, styl i szybkość zapisane jako wartości, a nie wrażenia. Tekst jest kalibrowany pod czas przed generowaniem — klip trzydziestosekundowy mieści około sześćdziesięciu pięciu słów po rumuńsku, a jeśli scenariusz ma osiemdziesiąt, skraca się tekst, a nie przyspiesza głos. Końcowy dźwięk normalizuje się w dwóch przejściach do celu i mierzy potem na dostarczonym pliku: cztery klipy z jednego niedawnego zestawu mają −16,2 i −15,9 LUFS, z prawdziwym szczytem −1,8 dBTP.
Zasada, której przestrzegamy i która wyraźnie widać w dossier licencji jednego z dostarczonych zestawów: nic w klipie nie ma licencji, której nie możemy pokazać. Podkład muzyczny i efekty dźwiękowe zostały wygenerowane lokalnie za pomocą `ffmpeg` — pięć sinusoidalnych oscylatorów z filtrem dolnoprzepustowym do muzyki, filtrowany różowy szum do efektu przejścia, impuls 1500 Hz z obwiednią wykładniczą do kliknięcia — właśnie po to, że dźwięk zrobiony przez nas ma możliwą do wykazania licencję, a „darmowy” plik ze strony, która nie mówi, na jakich warunkach, nie. Ramki telefonu i laptopa są narysowane w SVG, a nie jako zdjęcia produktów. Zrzuty ekranu są z naszej platformy, wykonane automatycznie na lokalnej wersji produkcyjnej. Czcionka jest hostowana samodzielnie, na otwartej licencji dla fontów.