Passer au contenu
megapromotingDiscutons

Expertise · Vidéo et contenu avec IA

De courts clips construits en HTML, avec une voix synthétisée et la licence de chaque élément sur papier.

Nous produisons des clips de promotion et des ensembles de visuels à l’aide d’outils de génération — voix synthétisée, images, compositions animées rendues à partir de HTML. Chaque élément qui entre dans le cadre a une source et une licence écrites, et le son se mesure, il ne s’estime pas.

Déjà construitSunt materiale livrate, pe disc, pe care le-am măsurat azi cu unelte, nu le-am citit dintr-un raport. Un set de patru clipuri de 30 de secunde fix (două limbi × două formate) pentru o platformă proprie, un al doilea set de patru clipuri de introducere, o compoziție proprie randată în șapte variante pentru promovarea companiei, și două runde de vizualuri statice de campanie pentru un operator de transport. Am reverificat sonorul unuia dintre clipuri cu `ffmpeg … ebur128`: −16,2 LUFS integrat, vârf real −1,8 dBTP — exact cifrele din documentul intern, ceea ce nu se întâmplă de fiecare dată. Corecție importantă față de propriul nostru inventar: `hyperframes` NU este codul nostru. E clona depozitului public al altei companii, sub licență Apache 2.0, fără niciun commit al nostru. E unealta cu care lucrăm; realizările sunt compozițiile și randările, nu unealta.

Un clip de trente secondes a trois façons de se détériorer, et une seule se voit à la première vision. Il se détériore visuellement — cela, tout le monde le remarque. Il se détériore au niveau sonore, et alors le clip est plus fort ou plus faible que tout ce qui l’entoure sur le réseau où il arrive, ce qui ne se remarque qu’après publication. Et il se détériore juridiquement, ce qui ne se remarque jamais, jusqu’au jour où cela se remarque. Nous travaillons sur les trois, et sur les deux derniers nous avons une procédure écrite, pas de la bonne volonté.

La composition se fait en HTML, pas dans un éditeur. Une composition est un document avec des pistes et des clips, chacun avec son moment de départ et sa durée écrits comme attributs — par exemple un clip qui commence à la seconde 8,4 et dure 5,0 secondes, avec un chevauchement intentionnel sur le précédent pour la transition. La conséquence pratique est qu’un clip peut être refait à l’identique : mêmes attributs, même résultat, et une correction de texte ne demande pas de refaire manuellement le montage. Le rendu de notre composition de promotion est sorti en 1920×1080, 60 images par seconde, 1200 images, exactement 20,000000 secondes — des chiffres lus dans le fichier, pas dans le brief.

La voix est synthétisée, avec des réglages écrits dans le scénario en même temps que le texte, afin qu’une refonte sonne à l’identique : modèle multilingue, stabilité, similitude, style et vitesse notés comme des valeurs, pas comme des impressions. Le texte est calibré sur la durée avant génération — un clip de trente secondes supporte environ soixante-cinq mots en roumain, et si le scénario en a quatre-vingts, c’est le texte qu’on coupe, pas la voix qu’on accélère. L’audio final est normalisé en deux passes vers une cible, puis mesuré ensuite sur le fichier livré : les quatre clips d’un ensemble récent se situent à −16,2 et −15,9 LUFS, avec un vrai pic de −1,8 dBTP.

La règle que nous maintenons et qui se voit clairement dans le dossier de licences d’un ensemble livré : rien dans le clip n’a une licence que nous ne puissions montrer. La base musicale et les effets sonores ont été synthétisés localement avec `ffmpeg` — cinq oscillateurs sinusoïdaux avec filtre passe-bas pour la musique, bruit rose filtré pour l’effet de transition, impulsion de 1500 Hz avec enveloppe exponentielle pour le clic — justement parce qu’un son fait par nous a une licence démontrable, tandis qu’un fichier « gratuit » sur une page qui n’indique pas sous quelles conditions, non. Les cadres de téléphone et d’ordinateur portable sont dessinés en SVG, pas des photos de produit. Les captures sont celles de notre plateforme, faites automatiquement sur une version locale de production. La police est auto-hébergée, sous licence ouverte pour les polices.

Ce que cela comprend

Le travail, par composantes

Scénario avec timings, calibré sur la durée avant génération

Tableau de scènes avec intervalles et le texte parlé pour chacune, plus la cible de rythme. Le texte brut pour la synthèse est rédigé séparément, en un seul bloc, et les pauses sont données par la ponctuation. Si le texte dépasse la durée, on raccourcit le texte — l’accélération de la voix s’entend, et un clip qui sonne pressé perd exactement ce qu’il devait gagner.

Composition en HTML, avec des pistes et des clips aux temps écrits

Chaque clip a un début et une durée comme attributs, et les chevauchements pour les transitions sont intentionnels et visibles dans la source. Notre composition de promotion comporte cinq clips sur la piste principale et des indices de piste séparés pour les éléments qui passent par-dessus, dans une ligne de temps de vingt secondes. Un montage écrit peut être refait à l’identique ; un montage fait à la main, non.

Rendu à des paramètres vérifiables

Dernier rendu de la composition propre, mesuré avec `ffprobe` : H.264, 1920×1080, 60/1 images par seconde, 1200 images, 20,000000 secondes. Pas « environ vingt secondes » — exact, car le nombre d’images est entier et résulte de la composition.

Voix synthétisée avec les réglages notés dans le scénario

Modèle multilingue qui prend en charge le roumain, avec stabilité, ressemblance, style et vitesse indiqués comme valeurs à côté du texte. Les mêmes réglages donnent la même voix trois mois plus tard, quand quelqu’un demande une variante avec une phrase modifiée. Pour le russe, nous utilisons une voix séparée, choisie pour la langue, non traduite avec la même.

Son mesuré, non estimé

Normalisation en deux passes vers une cible de sonie, puis mesure sur le fichier livré avec la norme européenne de sonie. Les valeurs pour un ensemble récent : −16,2 et −15,9 LUFS intégré, pic réel −1,8 dBTP, plage dynamique 10,5 LU. Audio AAC à 48 kHz, stéréo, autour de 160 kbps, avec l’en-tête déplacé au début pour que le fichier démarre sans téléchargement complet.

Deux langues et deux formats à partir du même matériau

Horizontal 1920×1080 et vertical 1080×1920, en roumain et en russe — quatre fichiers pour la même histoire, car un clip horizontal recadré automatiquement en vertical perd exactement la partie où quelque chose se passe. Un deuxième ensemble livré, d’introduction, a la même structure, à 20,36 secondes.

Captures du produit réel, générées automatiquement

Ce que l’on voit dans le clip sont des enregistrements de la plateforme, réalisés avec un outil d’automatisation du navigateur sur une version de production exécutée localement : pages publiques, rédigées, sans visages, sans numéros d’immatriculation, sans adresses exactes. Pour la composition de promotion, nous avons extrait séparément des captures à plusieurs positions de défilement, ainsi que les couleurs, les polices et les animations de la page, afin que le mouvement du clip ressemble au mouvement du site.

Dossier de licences pour chaque élément du cadre

Un tableau avec la source et la licence de chaque son et de chaque image, plus une section sur ce qui N’EST PAS dans le clip : pas de musique de bibliothèque, pas de séquences d’archives, pas de voix humaines enregistrées, pas de logos d’institutions, pas de captures d’autres plateformes. La musique et les effets sont synthétisés localement avec `ffmpeg`, donc la licence peut être démontrée en relançant le script.

Ensembles de visuels statiques pour les campagnes

Quand le message est testé, il n’est pas filmé : deux séries de trente créations pour une seule campagne, au format vertical pour les réseaux, chacune avec son propre angle de message dans le nom du fichier. Il est moins coûteux de savoir quel message fonctionne à partir d’images qu’à partir de clips, et ce n’est qu’ensuite que l’on filme.

À quoi cela ressemble

Le parcours, étape par étape.

01

Nous rédigeons le scénario avec les durées et le taillons selon la durée

Scènes, intervalles, texte parlé, cible de rythme. C’est ici que l’on décide si le message tient — pas au montage. Nous livrons le scénario avant toute génération, car c’est le seul moment peu coûteux où l’idée peut encore être changée.

02

Nous rassemblons le matériel et en fixons la licence en même temps

Captures générées automatiquement sur une version de test, éléments dessinés, sons synthétisés localement, voix générée. Chaque élément reçoit une ligne dans le dossier de licences au moment où il entre dans le projet, pas à la fin, quand plus personne ne se souvient d’où il est apparu.

03

Nous construisons la composition et la rendons selon des paramètres fixes

Pistes, clips avec début et durée, passages par superposition intentionnelle. Le rendu est vérifié avec des outils : résolution, images par seconde, nombre d’images, durée. Si la durée n’est pas celle du scénario, c’est une erreur de composition, pas un arrondi.

04

Nous normalisons le son et le mesurons sur le fichier final

Deux passages vers la cible de sonorité, puis mesure sur le fichier livré, et non sur celui intermédiaire. Les chiffres obtenus sont inscrits dans le document de remise, afin qu’ils puissent être contestés.

05

Nous livrons les variantes et la source

Les deux formats, les deux langues, plus les pièces séparées — narration, musique, cadres de scénario — et la composition. La raison pour laquelle nous remettons aussi la source est simple : dans un an, quelqu’un voudra une autre phrase à la vingtième seconde.

Un centru. În jur, ce intră în el — pe trasee separate.CENTRUL SE SPRIJINĂ PE CE E ÎN JURUL LUI
În centru, compoziția — un document cu piste și clipuri cu timpi scriși. În jurul ei orbitează elementele care intră în cadru, fiecare cu eticheta lui de licență: capturile produsului generate automat, ramele desenate în SVG, patul muzical și efectele sintetizate local, vocea generată, fontul autogăzduit. Un element fără etichetă nu intră pe orbită.

Les données

Ce que nous touchons, où elles sont et combien de temps elles restent

Les questions que pose toute personne ayant un délégué à la protection des données — posées ici avant qu'il ne les pose.

Ce qui entre dans le cadre et d’où cela vient
Captures de la plateforme du client ou du produit, générées automatiquement sur une version de test, plus des éléments dessinés par nous. Chacun a une ligne dans le dossier de licences. Règle pratique : si nous ne pouvons pas montrer d’où cela vient, cela n’entre pas dans le clip.
Les données personnelles dans le matériel filmé
Elles sont rédigées avant la capture, pas après le montage : pas de visages, pas de numéros d’immatriculation, pas d’adresses exactes, pas de vraies données de clients sur les écrans montrés. Un écran de démonstration est rempli de données inventées, et cela se décide avant de lancer les captures.
La voix synthétisée et les termes du fournisseur
L’audio généré sur notre compte ou sur celui du client est utilisé commercialement dans les conditions du plan payé. Ce que nous ne faisons pas, parce que c’est explicitement interdit dans les conditions du fournisseur : nous n’entraînons pas et nous ne testons pas un modèle concurrent sur sa sortie. La limite s’applique y compris à notre propre axe de recherche interne sur la voix.
Ce qui est livré à la fin
Les fichiers finaux dans les deux formats et les deux langues, la narration séparée placée sur l’axe du temps, le lit musical séparé, les cadres de scénario extraits, le scénario avec les temps et le dossier de licences. La source de la composition reste chez le client, afin qu’un changement de texte dans un an ne demande pas une refonte à partir de zéro.

Un cas

Un clip de trente secondes, en quatre fichiers, avec le dossier de licences à côté

La situation

La promotion d’une plateforme publique propre, en deux langues, pour les réseaux où le même matériel doit exister à la fois en horizontal et en vertical. La contrainte auto-imposée : aucun élément du clip ne doit avoir une licence que nous ne puissions pas montrer.

Ce que nous avons construit

Scénario avec les temps et le texte parlé par scènes, dans les deux langues, avec des voix séparées choisies par langue. Captures de la plateforme générées automatiquement sur une version de production exécutée localement, avec des pages rédigées — sans visages, sans numéros d’immatriculation, sans adresses exactes. Les cadres de téléphone et d’ordinateur portable dessinés en SVG, et non des photos de produit. Le lit musical et les deux effets sonores synthétisés localement avec `ffmpeg` : oscillateurs sinusoïdaux avec filtre passe-bas pour la musique, bruit rose filtré pour le passage, impulsion de 1500 Hz avec enveloppe exponentielle pour le clic. Le son normalisé en deux passages vers une cible de sonorité.

Ce qui en est sorti

Quatre fichiers — deux langues × deux formats — de 30,00 secondes exactement chacun, à 30 images par seconde, H.264 avec audio AAC 48 kHz stéréo autour de 160 kbps et l’en-tête déplacé au début. Nous avons remesuré aujourd’hui la version horizontale en roumain : −16,2 LUFS intégrés, pic véritable −1,8 dBTP, plage dynamique 10,5 LU, 900 images pour 30,00 secondes. Les chiffres coïncident avec le document de remise. En plus des fichiers ont été remis la narration séparée, le lit musical séparé, les cadres de scénario et le tableau des licences.

Ce que le cas ne dit pas

Le cadre de travail pour le rendu n’est pas le nôtre — c’est un projet open source d’une autre entreprise, sous Apache 2.0, et notre contribution y est nulle. La voix est synthétisée sur notre compte, dans les conditions du plan payant du fournisseur, et ses conditions interdisent explicitement d’utiliser la sortie pour entraîner ou tester un modèle concurrent ; c’est une limite que nous respectons. Et une autre, de bon sens : un clip ne résout pas un message qui ne fonctionne pas — c’est pourquoi, quand c’est possible, nous testons le message sur des images d’abord.

Questions

Ce que les gens nous demandent avant d'appeler

Avez-vous votre propre moteur de génération vidéo ?

Non, et il est important de ne pas donner cette impression. Nous composons en HTML et rendons à l’aide d’un cadre de travail open source, développé par une autre entreprise, sous licence Apache 2.0. Nous avons vérifié : dans notre clone, il n’y a aucun commit de notre part. Ce qui est à nous, ce sont les compositions, les scénarios, les captures, les sons synthétisés localement et la discipline des licences. L’outil n’est pas la réalisation.

Que signifie concrètement « vidéo avec IA » ? Cela se voit que c’est généré ?

Dans nos matériaux, la génération couvre la voix et une partie des visuels de campagne. Le mouvement et le montage sont écrits, pas générés : un clip avec des temps et des pistes, rendu de manière déterministe. Nous ne produisons pas d’humains synthétiques qui parlent à l’image. La raison est pratique : un clip où l’on voit le vrai produit, capturé automatiquement, vieillit moins vite et n’a pas le problème de crédibilité d’un présentateur inexistant.

Qui détient les droits sur le clip ?

Le client, pour le matériel livré, et les sources externes restent sous leur licence, qui est consignée élément par élément dans le dossier de licences. La voix générée est utilisée commercialement dans les conditions du plan payant du fournisseur, sur le compte sur lequel elle a été générée. Nous remettons aussi le dossier, pas seulement les fichiers — si quelqu’un demande dans deux ans d’où vient ce son, la réponse existe par écrit.

Pourquoi synthétisez-vous la musique au lieu de prendre un morceau gratuit ?

Parce qu’un morceau « gratuit » suppose de faire confiance à une page qui dit qu’il est gratuit. Un fond musical composé de cinq oscillateurs sinusoïdaux avec un filtre et un court écho a une licence que nous pouvons démontrer en relançant le script. Si un projet exige un vrai morceau, c’est possible — mais alors le dossier contient la source exacte, la licence exacte et la date de téléchargement, pas une mention vague.

Dans quelles langues et quels formats livrez-vous ?

Roumain et russe, en horizontal 1920×1080 et vertical 1080×1920. Nous ne découpons pas automatiquement l’horizontal en vertical : la composition est ajustée séparément, car en vertical, autre chose entre dans le cadre. D’autres langues peuvent être réalisées avec les mêmes outils, mais la voix est choisie selon la langue et écoutée à l’avance, pas supposée.

Pourquoi la sonorité mesurée compte-t-elle ?

Parce qu’un clip plus silencieux que ce qui l’entoure sur un réseau social est ignoré, et un clip plus fort est fermé. Nous normalisons en deux passes vers une cible et mesurons sur le fichier livré avec la norme européenne de sonorité. Pour un ensemble récent, les chiffres sont −16,2 et −15,9 LUFS, avec un pic réel de −1,8 dBTP. Ils sont mesurés, pas estimés, et nous les indiquons dans le document de remise précisément pour qu’ils puissent être vérifiés.

Pouvez-vous faire des clips avec mon produit, et non avec des animations génériques ?

Oui, et c’est ce que nous préférons. Les captures sont faites automatiquement, avec un outil d’automatisation du navigateur, sur une version de test du produit, à plusieurs positions de défilement ; pour une composition, nous avons aussi extrait séparément les couleurs, les polices et les animations de la page, afin que le mouvement du clip ressemble au mouvement réel de l’interface. La condition est qu’il existe une version que nous pouvons exécuter et des données de démonstration qui ne sont pas réelles.

À quelle vitesse une phrase peut-elle changer en quelques mois ?

Parce que le montage est un document avec des timings, pas un projet dans un éditeur, une phrase est modifiée dans le scénario, la narration est régénérée avec les mêmes paramètres de voix, puis le tout est rendu à nouveau. C’est pourquoi nous remettons la source et les paramètres de voix, pas seulement le fichier final. Sans eux, toute modification signifie une reprise complète.

Faites-vous aussi des campagnes d’images, pas seulement des clips ?

Oui, et c’est souvent l’étape correcte avant la vidéo. Pour une seule campagne, nous avons produit deux séries de trente créations verticales, chacune avec un angle de message différent. On teste quel message fonctionne sur les visuels, lesquels sont peu coûteux à refaire, puis seulement après on investit dans la vidéo sur le message gagnant.

Sur quoi reposent les affirmations ci-dessus (11 sources)
  1. Termenii furnizorului de voce interzic antrenarea sau testarea unui model concurent pe ieșirea luihttps://elevenlabs.io/use-policy · 2026-09-06

10 d'entre elles sont du code et des fichiers de nos dépôts. Nous n'en publions ni le nom ni la ligne : réunies sur une seule page, elles décriraient trop précisément comment sont construits des systèmes qui ne sont pas seulement les nôtres. Nous les parcourons avec vous, dans le dépôt, sur demande — la vérification reste possible, elle se fait simplement lors d'un échange.

Qu'est-ce que vous voudriez voir mieux fonctionner ?

Racontez-nous votre processus. Ensemble, nous décidons ce qui vaut la peine d'être construit, ce que nous pouvons connecter et comment nous vérifions le résultat.

Discutons