Vai al contenuto
megapromotingParliamone

Competenza · Video e contenuto con AI

Clip brevi costruite in HTML, con voce sintetizzata e con la licenza di ogni elemento su carta.

Produciamo clip di promozione e set di visual usando strumenti di generazione — voce sintetizzata, immagini, composizioni animate renderizzate da HTML. Ogni elemento che entra nell'inquadratura ha una fonte e una licenza scritte, e il sonoro si misura, non si approssima.

Già costruitoSunt materiale livrate, pe disc, pe care le-am măsurat azi cu unelte, nu le-am citit dintr-un raport. Un set de patru clipuri de 30 de secunde fix (două limbi × două formate) pentru o platformă proprie, un al doilea set de patru clipuri de introducere, o compoziție proprie randată în șapte variante pentru promovarea companiei, și două runde de vizualuri statice de campanie pentru un operator de transport. Am reverificat sonorul unuia dintre clipuri cu `ffmpeg … ebur128`: −16,2 LUFS integrat, vârf real −1,8 dBTP — exact cifrele din documentul intern, ceea ce nu se întâmplă de fiecare dată. Corecție importantă față de propriul nostru inventar: `hyperframes` NU este codul nostru. E clona depozitului public al altei companii, sub licență Apache 2.0, fără niciun commit al nostru. E unealta cu care lucrăm; realizările sunt compozițiile și randările, nu unealta.

Una clip di trenta secondi ha tre modi di guastarsi, e solo uno si vede alla prima visione. Si guasta visivamente — questo lo nota tutti. Si guasta sul piano sonoro, e allora la clip è più forte o più debole di tutto ciò che le sta intorno sulla rete in cui arriva, cosa che si nota solo dopo la pubblicazione. E si guasta giuridicamente, cosa che non si nota mai, fino al giorno in cui si nota. Lavoriamo su tutte e tre, e sulle ultime due abbiamo una procedura scritta, non buona volontà.

La composizione si fa in HTML, non in un editor. Una composizione è un documento con tracce e clip, ciascuno con il momento di inizio e la durata scritti come attributi — per esempio una clip che inizia al secondo 8,4 e dura 5,0 secondi, con sovrapposizione intenzionale rispetto alla precedente per la transizione. La conseguenza pratica è che una clip si può rifare in modo identico: stessi attributi, stesso risultato, e una correzione di testo non richiede il rifacimento manuale del montaggio. Il render della nostra composizione promozionale è uscito a 1920×1080, 60 fotogrammi al secondo, 1200 fotogrammi, esattamente 20,000000 secondi — cifre lette dal file, non dal brief.

La voce è sintetizzata, con impostazioni scritte nello сценарio insieme al testo, così che una rifacimento suoni identico: modello multilingue, stabilità, somiglianza, stile e velocità annotati come valori, non come impressioni. Il testo viene calibrato sulla durata prima della generazione — una clip di trenta secondi supporta circa sessantacinque parole in romeno, e se lo сценарio ne ha ottanta, si taglia il testo, non si accelera la voce. L’audio finale viene normalizzato in due passaggi verso un obiettivo e misurato dopo sul file consegnato: le quattro clip di un set recente stanno a −16,2 e −15,9 LUFS, con picco reale −1,8 dBTP.

La regola che manteniamo e che si vede chiaramente nel dossier delle licenze di un set consegnato: nulla della clip ha una licenza che non possiamo mostrare. Il tappeto musicale e gli effetti sonori sono stati sintetizzati localmente con `ffmpeg` — cinque oscillatori sinusoidali con filtro passa-basso per la musica, rumore rosa filtrato per l’effetto di transizione, impulso a 1500 Hz con inviluppo esponenziale per il clic — proprio perché un suono fatto da noi ha una licenza dimostrabile, mentre un file “gratis” da una pagina che non dice a quali condizioni, no. I telai di telefono e laptop sono disegnati in SVG, non fotografie di prodotto. Le catture sono della nostra piattaforma, fatte automaticamente su una versione di produzione locale. Il font è auto-ospitato, sotto licenza aperta per font.

Cosa comprende

Il lavoro, per componenti

Sceneggiatura con tempi, calibrata sulla durata prima della generazione

Tabella di scene con intervalli e testo parlato per ciascuna, più il target di ritmo. Il testo grezzo per la sintesi si scrive separatamente, in un unico blocco, e le pause le dà la punteggiatura. Se il testo supera la durata, si abbrevia il testo — l’accelerazione della voce si sente, e una clip che suona affrettata perde esattamente ciò che avrebbe dovuto guadagnare.

Composizione in HTML, con tracce e clip con tempi scritti

Ogni clip ha inizio e durata come attributi, e le sovrapposizioni per le transizioni sono intenzionali e visibili nella sorgente. La nostra composizione promozionale ha cinque clip sulla traccia principale e indici di traccia separati per gli elementi che vanno sopra, in una linea del tempo di venti secondi. Un montaggio scritto si può rifare in modo identico; uno fatto a mano, no.

Render con parametri verificabili

Ultimo rendering della composizione proprietaria, misurato con `ffprobe`: H.264, 1920×1080, 60/1 fotogrammi al secondo, 1200 fotogrammi, 20,000000 secondi. Non „circa venti secondi” — esatto, perché il numero di fotogrammi è intero e deriva dalla composizione.

Voce sintetizzata con impostazioni annotate nello сценарio

Modello multilingue che supporta il romeno, con stabilità, somiglianza, stile e velocità scritte come valori accanto al testo. Le stesse impostazioni danno la stessa voce tra tre mesi, quando qualcuno richiede una variante con una frase cambiata. Per il russo usiamo una voce separata, scelta per la lingua, non tradotta con la stessa.

Audio misurato, non stimato

Normalizzazione in due passaggi verso un obiettivo di sonorità, poi misurazione sul file consegnato con lo standard europeo di sonorità. I valori per un set recente: −16,2 e −15,9 LUFS integrato, picco reale −1,8 dBTP, intervallo dinamico 10,5 LU. Audio AAC a 48 kHz, stereo, intorno a 160 kbps, con l’intestazione spostata all’inizio così il file può avviarsi senza scaricamento completo.

Due lingue e due formati dallo stesso materiale

Orizzontale 1920×1080 e verticale 1080×1920, in romeno e in russo — quattro file per la stessa storia, perché un clip orizzontale tagliato automaticamente in verticale perde esattamente la parte in cui succede qualcosa. Un secondo set consegnato, di introduzione, ha la stessa struttura, a 20,36 secondi.

Screenshot del prodotto reale, generati automaticamente

Ciò che si vede nel clip sono registrazioni della piattaforma, fatte con uno strumento di automazione del browser su una versione di produzione eseguita localmente: pagine pubbliche, redatte, senza volti, senza numeri di targa, senza indirizzi esatti. Per la composizione promozionale abbiamo estratto separatamente screenshot da più posizioni di scorrimento, più i colori, i font e le animazioni della pagina, così il movimento nel clip assomigli al movimento del sito.

Dossier di licenze per ogni elemento nell’inquadratura

Una tabella con la fonte e la licenza di ogni suono e di ogni immagine, più una sezione su ciò che NON è nel clip: senza musica di biblioteca, senza riprese stock, senza voci umane registrate, senza loghi di istituzioni, senza screenshot da altre piattaforme. Musica ed effetti sono sintetizzati localmente con `ffmpeg`, quindi la licenza può essere dimostrata rieseguendo lo script.

Set di visual statici per campagne

Quando il messaggio si testa, non si filma: due tornate da trenta creazioni per una sola campagna, in formato verticale per i social, ciascuna con il proprio angolo di messaggio nel nome del file. È più economico scoprire quale messaggio funziona dalle immagini che dai clip, e solo dopo si filma.

Come si presenta

Il percorso, passo dopo passo.

01

Scriviamo lo scenario con i tempi e lo tagliamo sulla durata

Scene, intervalli, testo pronunciato, obiettivo di ritmo. Qui si decide se il messaggio ci sta: non in montaggio. Consegniamo lo scenario prima di qualsiasi generazione, perché è l’unico momento economico in cui si può cambiare l’idea.

02

Raccogliamo il materiale e ne stabiliamo la licenza insieme ad esso

Screenshot generati automaticamente su una versione di test, elementi disegnati, suoni sintetizzati localmente, voce generata. Ogni elemento riceve una riga nel dossier di licenze nel momento in cui entra nel progetto, non alla fine, quando nessuno ricorda più da dove sia comparso.

03

Costruiamo la composizione e la rendiamo a parametri fissi

Tracce, clip con inizio e durata, passaggi tramite sovrapposizione intenzionale. Il rendering viene verificato con strumenti: risoluzione, fotogrammi al secondo, numero di fotogrammi, durata. Se la durata non è quella dello scenario, è un errore di composizione, non un arrotondamento.

04

Normalizziamo l’audio e lo misuriamo sul file finale

Due passaggi verso il target di sonorità, poi misurazione sul file consegnato, non su quello intermedio. I valori risultanti si scrivono nel documento di consegna, così possono essere contestati.

05

Consegnamo le varianti e la sorgente

Entrambi i formati, entrambe le lingue, più gli elementi separati: narrazione, musica, fotogrammi di scenario, e la composizione. Il motivo per cui consegniamo anche la sorgente è semplice: tra un anno qualcuno vorrà un’altra frase al ventesimo secondo.

Un centru. În jur, ce intră în el — pe trasee separate.CENTRUL SE SPRIJINĂ PE CE E ÎN JURUL LUI
În centru, compoziția — un document cu piste și clipuri cu timpi scriși. În jurul ei orbitează elementele care intră în cadru, fiecare cu eticheta lui de licență: capturile produsului generate automat, ramele desenate în SVG, patul muzical și efectele sintetizate local, vocea generată, fontul autogăzduit. Un element fără etichetă nu intră pe orbită.

I dati

Cosa tocchiamo, dove risiedono e quanto rimangono

Le domande che pone chiunque abbia un responsabile della protezione dei dati — poste qui prima che le ponga lui.

Che cosa entra nell’inquadratura e da dove viene
Capture della piattaforma del cliente o del prodotto, generate automaticamente su una versione di test, più elementi disegnati da noi. Ognuna ha una riga nel dossier di licenze. Regola pratica: se non possiamo mostrare da dove proviene, non entra nel clip.
I dati personali nel materiale filmato
Si redigono prima della capture, non dopo il montaggio: niente volti, niente targhe, niente indirizzi esatti, niente dati reali dei clienti sugli schermi mostrati. Uno schermo dimostrativo si popola con dati inventati, e questo si decide prima di avviare le capture.
La voce sintetizzata e i termini del fornitore
L’audio generato sul nostro account o su quello del cliente viene usato commercialmente alle condizioni del piano pagato. Ciò che non facciamo, perché è espressamente vietato nei termini del fornitore: non addestriamo né testiamo un modello concorrente sulla sua uscita. Il limite si applica anche alla nostra direzione di ricerca interna sulla voce.
Cosa si consegna alla fine
I file finali in entrambi i formati e in entrambe le lingue, la narrazione separata posizionata sulla linea temporale, la base musicale separata, i fotogrammi dello scenario estratti, lo scenario con i tempi e il dossier delle licenze. La sorgente della composizione rimane al cliente, affinché una modifica di testo tra un anno non richieda il rifacimento da zero.

Un caso

Un clip di trenta secondi, in quattro file, con il dossier di licenze accanto

La situazione

La promozione di una piattaforma pubblica propria, in due lingue, per reti in cui lo stesso materiale deve esistere sia in orizzontale sia in verticale. Il vincolo autoimposto: nessun elemento del clip deve avere una licenza che non possiamo mostrare.

Cosa abbiamo costruito

Sceneggiatura con tempi e testo parlato per scene, in entrambe le lingue, con voci separate scelte per lingua. Capture della piattaforma generate automaticamente su una versione di produzione eseguita localmente, con pagine redatte — senza volti, senza targhe, senza indirizzi esatti. Le cornici per telefono e laptop disegnate in SVG, non fotografie di prodotto. La base musicale e i due effetti sonori sintetizzati localmente con `ffmpeg`: oscillatori sinusoidali con filtro passa-basso per la musica, rumore rosa filtrato per il passaggio, impulso di 1500 Hz con inviluppo esponenziale per il clic. L’audio normalizzato in due passaggi verso un target di sonorità.

Cosa è emerso

Quattro file — due lingue × due formati — di esattamente 30,00 secondi ciascuno, a 30 fotogrammi al secondo, H.264 con audio AAC 48 kHz stereo intorno a 160 kbps e header spostato all’inizio. Abbiamo rimisurato oggi la variante orizzontale in romeno: −16,2 LUFS integrato, picco reale −1,8 dBTP, intervallo dinamico 10,5 LU, 900 fotogrammi per 30,00 secondi. Le cifre coincidono con il documento di consegna. Oltre ai file sono stati consegnati la narrazione separata, la base musicale separata, i fotogrammi dello scenario e la tabella delle licenze.

Cosa non dice il caso

Il framework di rendering non è nostro — è un progetto open source di un’altra azienda, sotto Apache 2.0, e il nostro contributo in esso è zero. La voce è sintetizzata sul nostro account, alle condizioni del piano a pagamento del fornitore, e i suoi termini vietano esplicitamente l’uso dell’output per addestrare o testare un modello concorrente; è un limite che rispettiamo. E ancora una, di buon senso: un clip non risolve un messaggio che non funziona — perciò, quando è possibile, testiamo il messaggio sulle immagini prima.

Domande

Cosa ci chiedono le persone prima di chiamare

Avete un motore proprietario per la generazione video?

No, ed è importante non lasciare questa impressione. Componiamo in HTML e renderizziamo usando un framework open source, sviluppato da un’altra società, sotto licenza Apache 2.0. Abbiamo verificato: nel nostro clone non esiste alcun nostro commit. Ciò che è nostro sono le composizioni, gli scenari, le catture, i suoni sintetizzati localmente e la disciplina delle licenze. Lo strumento non è la realizzazione.

Cosa significa concretamente «video con AI»? Si vede che è generato?

Nei nostri materiali, la generazione copre la voce e una parte delle immagini della campagna. Il movimento e il montaggio sono scritti, non generati: un clip con tempi e tracce, reso in modo deterministico. Non produciamo persone sintetiche che parlano in quadro. Il motivo è pratico: un clip in cui si vede il prodotto reale, catturato automaticamente, invecchia meno e non ha il problema di credibilità di un presentatore inesistente.

Chi detiene i diritti sul clip?

Il cliente, per il materiale consegnato, mentre le fonti esterne rimangono sotto la loro licenza, che è scritta elemento per elemento nel dossier delle licenze. La voce generata si usa commercialmente alle condizioni del piano a pagamento del fornitore, sull’account su cui è stata generata. Consegniamo anche il dossier, non solo i file — se qualcuno tra due anni chiede da dove proviene quel suono, la risposta esiste per iscritto.

Perché sintetizzate la musica invece di prendere un brano gratuito?

Perché un brano «gratuito» implica fiducia in una pagina che dice di essere gratuita. Un letto musicale fatto di cinque oscillatori sinusoidali con filtro e un breve eco ha una licenza che possiamo dimostrare rieseguendo lo script. Se un progetto richiede un brano vero, si può — ma allora nel dossier entrano la fonte esatta, la licenza esatta e la data di download, non una menzione vaga.

In quali lingue e formati consegnate?

Rumeno e russo, in orizzontale 1920×1080 e verticale 1080×1920. Non tagliamo automaticamente l’orizzontale in verticale: la composizione si imposta separatamente, perché nel verticale entra altro in quadro. Altre lingue si possono fare con gli stessi strumenti, ma la voce si sceglie per lingua e si ascolta prima, non si presuppone.

Perché conta la sonorità misurata?

Perché un clip più silenzioso di ciò che lo circonda su un social network viene saltato, e uno più forte viene chiuso. Normalizziamo in due passaggi verso un target e misuriamo sul file consegnato con lo standard europeo di sonorità. Per un set recente i valori sono −16,2 e −15,9 LUFS, con picco reale −1,8 dBTP. Sono misurati, non stimati, e li scriviamo nel documento di consegna proprio per poterli verificare.

Potete fare clip con il mio prodotto, non con animazioni generiche?

Sì, e lo preferiamo. Le catture si fanno automaticamente, con uno strumento di automazione del browser, su una versione di prova del prodotto, a più posizioni di scorrimento; per una composizione abbiamo estratto separatamente anche i colori, i font e le animazioni della pagina, così che il movimento nel clip somigli al movimento reale dell’interfaccia. La condizione è che esista una versione che possiamo eseguire e dati dimostrativi che non siano reali.

Quanto velocemente si può cambiare una frase tra qualche mese?

Poiché il montaggio è un documento con tempi, non un progetto in un editor, una frase si cambia nello script, si rigenera la narrazione con le stesse impostazioni di voce e si rende di nuovo. Per questo consegniamo la sorgente e le impostazioni di voce, non solo il file finale. Senza di esse, qualsiasi modifica significa rifacimento.

Fate anche campagne di immagini, non solo clip?

Sì, e spesso è il passo corretto prima del clip. Per una sola campagna abbiamo prodotto due turni da trenta creatività verticali, ciascuna con un diverso angolo di messaggio. Si testa quale messaggio funziona sulle immagini, quali sono economiche da rifare, e solo dopo si investe nel clip sul messaggio vincente.

Su cosa si basano le affermazioni sopra (11 fonti)
  1. Termenii furnizorului de voce interzic antrenarea sau testarea unui model concurent pe ieșirea luihttps://elevenlabs.io/use-policy · 2026-09-06

10 di esse sono codice e file dei nostri repository. Non ne pubblichiamo il nome né la riga: insieme, in un'unica pagina, descriverebbero con troppa precisione come sono costruiti sistemi che non sono solo nostri. Le esaminiamo con te, nel repository, su richiesta — la verifica resta possibile, solo che avviene in una discussione.

Cosa vorresti che funzionasse meglio?

Raccontaci il tuo processo. Insieme stabiliamo cosa vale la pena costruire, cosa possiamo collegare e come verifichiamo il risultato.

Parliamone