Expertiză · Video și conținut cu AI
Clipuri scurte construite din HTML, cu voce sintetizată și cu licența fiecărui element pe hârtie.
Producem clipuri de promovare și seturi de vizualuri folosind unelte de generare — voce sintetizată, imagini, compoziții animate randate din HTML. Fiecare element care intră în cadru are o sursă și o licență scrise, iar sonorul se măsoară, nu se aproximează.
Construit dejaSunt materiale livrate, pe disc, pe care le-am măsurat azi cu unelte, nu le-am citit dintr-un raport. Un set de patru clipuri de 30 de secunde fix (două limbi × două formate) pentru o platformă proprie, un al doilea set de patru clipuri de introducere, o compoziție proprie randată în șapte variante pentru promovarea companiei, și două runde de vizualuri statice de campanie pentru un operator de transport. Am reverificat sonorul unuia dintre clipuri cu `ffmpeg … ebur128`: −16,2 LUFS integrat, vârf real −1,8 dBTP — exact cifrele din documentul intern, ceea ce nu se întâmplă de fiecare dată. Corecție importantă față de propriul nostru inventar: `hyperframes` NU este codul nostru. E clona depozitului public al altei companii, sub licență Apache 2.0, fără niciun commit al nostru. E unealta cu care lucrăm; realizările sunt compozițiile și randările, nu unealta.
Un clip de treizeci de secunde are trei feluri de a se strica, și doar unul se vede la prima vizionare. Se strică vizual — asta observă toată lumea. Se strică sonor, și atunci clipul e mai tare sau mai încet decât tot ce e în jurul lui pe rețeaua unde ajunge, ceea ce se observă abia după publicare. Și se strică juridic, ceea ce nu se observă niciodată, până în ziua în care se observă. Lucrăm pe toate trei, iar pe ultimele două avem procedură scrisă, nu bunăvoință.
Compunerea se face în HTML, nu într-un editor. O compoziție este un document cu piste și clipuri, fiecare cu momentul de start și durata scrise ca atribute — de exemplu un clip care începe la secunda 8,4 și ține 5,0 secunde, cu suprapunere intenționată peste cel dinainte pentru trecere. Consecința practică e că un clip se poate reface identic: aceleași atribute, același rezultat, iar o corecție de text nu cere refacerea manuală a montajului. Randarea din compoziția noastră de promovare a ieșit la 1920×1080, 60 de cadre pe secundă, 1200 de cadre, exact 20,000000 secunde — cifre citite din fișier, nu din brief.
Vocea este sintetizată, cu setări scrise în scenariu împreună cu textul, ca o refacere să sune identic: model multilingv, stabilitate, asemănare, stil și viteză notate ca valori, nu ca impresii. Textul e calibrat pe durată înainte de generare — un clip de treizeci de secunde suportă în jur de șaizeci și cinci de cuvinte în română, iar dacă scenariul are optzeci, se taie textul, nu se accelerează vocea. Sonorul final se normalizează în două treceri către o țintă și se măsoară după aceea pe fișierul livrat: cele patru clipuri ale unui set recent stau la −16,2 și −15,9 LUFS, cu vârf real −1,8 dBTP.
Regula pe care o ținem și care se vede clar în dosarul de licențe al unui set livrat: nimic din clip nu are o licență pe care să nu o putem arăta. Patul muzical și efectele sonore au fost sintetizate local cu `ffmpeg` — cinci oscilatoare sinusoidale cu filtru trece-jos pentru muzică, zgomot roz filtrat pentru efectul de trecere, impuls de 1500 Hz cu anvelopă exponențială pentru clic — tocmai pentru că un sunet făcut de noi are o licență demonstrabilă, iar un fișier „gratis” de pe o pagină care nu spune sub ce condiții, nu. Ramele de telefon și de laptop sunt desenate în SVG, nu fotografii de produs. Capturile sunt ale platformei noastre, făcute automat pe o versiune de producție locală. Fontul e autogăzduit, sub licență deschisă pentru fonturi.