Experiencia · Vídeo y contenido con AI
Clips cortos construidos con HTML, con voz sintetizada y con la licencia de cada elemento por escrito.
Producimos clips de promoción y conjuntos de visuales usando herramientas de generación — voz sintetizada, imágenes, composiciones animadas renderizadas desde HTML. Cada elemento que entra en кадru tiene una fuente y una licencia escritas, y el sonido se mide, no se aproxima.
Ya construidoSunt materiale livrate, pe disc, pe care le-am măsurat azi cu unelte, nu le-am citit dintr-un raport. Un set de patru clipuri de 30 de secunde fix (două limbi × două formate) pentru o platformă proprie, un al doilea set de patru clipuri de introducere, o compoziție proprie randată în șapte variante pentru promovarea companiei, și două runde de vizualuri statice de campanie pentru un operator de transport. Am reverificat sonorul unuia dintre clipuri cu `ffmpeg … ebur128`: −16,2 LUFS integrat, vârf real −1,8 dBTP — exact cifrele din documentul intern, ceea ce nu se întâmplă de fiecare dată. Corecție importantă față de propriul nostru inventar: `hyperframes` NU este codul nostru. E clona depozitului public al altei companii, sub licență Apache 2.0, fără niciun commit al nostru. E unealta cu care lucrăm; realizările sunt compozițiile și randările, nu unealta.
Un clip de treinta segundos tiene tres formas de fallar, y solo una se ve a la primera visualización. Falla visualmente — eso lo ve todo el mundo. Falla en el audio, y entonces el clip suena más alto o más bajo que todo lo que lo rodea en la red donde llega, lo cual se observa solo después de la publicación. Y falla jurídicamente, lo cual no se observa nunca, hasta el día en que se observa. Trabajamos sobre las tres, y sobre las dos últimas tenemos un procedimiento escrito, no buena voluntad.
La composición se hace en HTML, no en un editor. Una composición es un documento con pistas y clips, cada uno con el momento de inicio y la duración escritos como atributos — por ejemplo, un clip que empieza en el segundo 8,4 y dura 5,0 segundos, con solapamiento intencional sobre el anterior para la transición. La consecuencia práctica es que un clip se puede rehacer idénticamente: los mismos atributos, el mismo resultado, y una corrección de texto no requiere rehacer manualmente el montaje. El render de nuestra composición promocional salió a 1920×1080, 60 fotogramas por segundo, 1200 fotogramas, exactamente 20,000000 segundos — cifras leídas del archivo, no del brief.
La voz está sintetizada, con ajustes escritos en el guion junto con el texto, para que una repetición suene idéntica: modelo multilingüe, estabilidad, similitud, estilo y velocidad anotados como valores, no como impresiones. El texto se calibra por duración antes de la generación — un clip de treinta segundos soporta en torno a sesenta y cinco palabras en rumano, y si el guion tiene ochenta, se recorta el texto, no se acelera la voz. El audio final se normaliza en dos pasadas hacia un objetivo y luego se mide en el archivo entregado: los cuatro clips de un conjunto reciente están a −16,2 y −15,9 LUFS, con pico real −1,8 dBTP.
La regla que mantenemos y que se ve claramente en el dossier de licencias de un conjunto entregado: nada del clip tiene una licencia que no podamos mostrar. La base musical y los efectos sonoros se sintetizaron localmente con `ffmpeg` — cinco osciladores sinusoidales con filtro pasa-bajo para la música, ruido rosa filtrado para el efecto de transición, impulso de 1500 Hz con envolvente exponencial para el clic — precisamente porque un sonido hecho por nosotros tiene una licencia demostrable, y un archivo “gratis” de una página que no dice bajo qué condiciones, no. Los marcos del teléfono y del portátil están dibujados en SVG, no son fotografías de producto. Las capturas son de nuestra plataforma, hechas automáticamente sobre una versión de producción local. La fuente está autohospedada, bajo una licencia abierta para fuentes.