Competenza · Video e contenuto con AI
Clip brevi costruite in HTML, con voce sintetizzata e con la licenza di ogni elemento su carta.
Produciamo clip di promozione e set di visual usando strumenti di generazione — voce sintetizzata, immagini, composizioni animate renderizzate da HTML. Ogni elemento che entra nell'inquadratura ha una fonte e una licenza scritte, e il sonoro si misura, non si approssima.
Già costruitoSunt materiale livrate, pe disc, pe care le-am măsurat azi cu unelte, nu le-am citit dintr-un raport. Un set de patru clipuri de 30 de secunde fix (două limbi × două formate) pentru o platformă proprie, un al doilea set de patru clipuri de introducere, o compoziție proprie randată în șapte variante pentru promovarea companiei, și două runde de vizualuri statice de campanie pentru un operator de transport. Am reverificat sonorul unuia dintre clipuri cu `ffmpeg … ebur128`: −16,2 LUFS integrat, vârf real −1,8 dBTP — exact cifrele din documentul intern, ceea ce nu se întâmplă de fiecare dată. Corecție importantă față de propriul nostru inventar: `hyperframes` NU este codul nostru. E clona depozitului public al altei companii, sub licență Apache 2.0, fără niciun commit al nostru. E unealta cu care lucrăm; realizările sunt compozițiile și randările, nu unealta.
Una clip di trenta secondi ha tre modi di guastarsi, e solo uno si vede alla prima visione. Si guasta visivamente — questo lo nota tutti. Si guasta sul piano sonoro, e allora la clip è più forte o più debole di tutto ciò che le sta intorno sulla rete in cui arriva, cosa che si nota solo dopo la pubblicazione. E si guasta giuridicamente, cosa che non si nota mai, fino al giorno in cui si nota. Lavoriamo su tutte e tre, e sulle ultime due abbiamo una procedura scritta, non buona volontà.
La composizione si fa in HTML, non in un editor. Una composizione è un documento con tracce e clip, ciascuno con il momento di inizio e la durata scritti come attributi — per esempio una clip che inizia al secondo 8,4 e dura 5,0 secondi, con sovrapposizione intenzionale rispetto alla precedente per la transizione. La conseguenza pratica è che una clip si può rifare in modo identico: stessi attributi, stesso risultato, e una correzione di testo non richiede il rifacimento manuale del montaggio. Il render della nostra composizione promozionale è uscito a 1920×1080, 60 fotogrammi al secondo, 1200 fotogrammi, esattamente 20,000000 secondi — cifre lette dal file, non dal brief.
La voce è sintetizzata, con impostazioni scritte nello сценарio insieme al testo, così che una rifacimento suoni identico: modello multilingue, stabilità, somiglianza, stile e velocità annotati come valori, non come impressioni. Il testo viene calibrato sulla durata prima della generazione — una clip di trenta secondi supporta circa sessantacinque parole in romeno, e se lo сценарio ne ha ottanta, si taglia il testo, non si accelera la voce. L’audio finale viene normalizzato in due passaggi verso un obiettivo e misurato dopo sul file consegnato: le quattro clip di un set recente stanno a −16,2 e −15,9 LUFS, con picco reale −1,8 dBTP.
La regola che manteniamo e che si vede chiaramente nel dossier delle licenze di un set consegnato: nulla della clip ha una licenza che non possiamo mostrare. Il tappeto musicale e gli effetti sonori sono stati sintetizzati localmente con `ffmpeg` — cinque oscillatori sinusoidali con filtro passa-basso per la musica, rumore rosa filtrato per l’effetto di transizione, impulso a 1500 Hz con inviluppo esponenziale per il clic — proprio perché un suono fatto da noi ha una licenza dimostrabile, mentre un file “gratis” da una pagina che non dice a quali condizioni, no. I telai di telefono e laptop sono disegnati in SVG, non fotografie di prodotto. Le catture sono della nostra piattaforma, fatte automaticamente su una versione di produzione locale. Il font è auto-ospitato, sotto licenza aperta per font.