Saltar al contenido
megapromotingVamos a hablar

Experiencia · Vídeo y contenido con AI

Clips cortos construidos con HTML, con voz sintetizada y con la licencia de cada elemento por escrito.

Producimos clips de promoción y conjuntos de visuales usando herramientas de generación — voz sintetizada, imágenes, composiciones animadas renderizadas desde HTML. Cada elemento que entra en кадru tiene una fuente y una licencia escritas, y el sonido se mide, no se aproxima.

Ya construidoSunt materiale livrate, pe disc, pe care le-am măsurat azi cu unelte, nu le-am citit dintr-un raport. Un set de patru clipuri de 30 de secunde fix (două limbi × două formate) pentru o platformă proprie, un al doilea set de patru clipuri de introducere, o compoziție proprie randată în șapte variante pentru promovarea companiei, și două runde de vizualuri statice de campanie pentru un operator de transport. Am reverificat sonorul unuia dintre clipuri cu `ffmpeg … ebur128`: −16,2 LUFS integrat, vârf real −1,8 dBTP — exact cifrele din documentul intern, ceea ce nu se întâmplă de fiecare dată. Corecție importantă față de propriul nostru inventar: `hyperframes` NU este codul nostru. E clona depozitului public al altei companii, sub licență Apache 2.0, fără niciun commit al nostru. E unealta cu care lucrăm; realizările sunt compozițiile și randările, nu unealta.

Un clip de treinta segundos tiene tres formas de fallar, y solo una se ve a la primera visualización. Falla visualmente — eso lo ve todo el mundo. Falla en el audio, y entonces el clip suena más alto o más bajo que todo lo que lo rodea en la red donde llega, lo cual se observa solo después de la publicación. Y falla jurídicamente, lo cual no se observa nunca, hasta el día en que se observa. Trabajamos sobre las tres, y sobre las dos últimas tenemos un procedimiento escrito, no buena voluntad.

La composición se hace en HTML, no en un editor. Una composición es un documento con pistas y clips, cada uno con el momento de inicio y la duración escritos como atributos — por ejemplo, un clip que empieza en el segundo 8,4 y dura 5,0 segundos, con solapamiento intencional sobre el anterior para la transición. La consecuencia práctica es que un clip se puede rehacer idénticamente: los mismos atributos, el mismo resultado, y una corrección de texto no requiere rehacer manualmente el montaje. El render de nuestra composición promocional salió a 1920×1080, 60 fotogramas por segundo, 1200 fotogramas, exactamente 20,000000 segundos — cifras leídas del archivo, no del brief.

La voz está sintetizada, con ajustes escritos en el guion junto con el texto, para que una repetición suene idéntica: modelo multilingüe, estabilidad, similitud, estilo y velocidad anotados como valores, no como impresiones. El texto se calibra por duración antes de la generación — un clip de treinta segundos soporta en torno a sesenta y cinco palabras en rumano, y si el guion tiene ochenta, se recorta el texto, no se acelera la voz. El audio final se normaliza en dos pasadas hacia un objetivo y luego se mide en el archivo entregado: los cuatro clips de un conjunto reciente están a −16,2 y −15,9 LUFS, con pico real −1,8 dBTP.

La regla que mantenemos y que se ve claramente en el dossier de licencias de un conjunto entregado: nada del clip tiene una licencia que no podamos mostrar. La base musical y los efectos sonoros se sintetizaron localmente con `ffmpeg` — cinco osciladores sinusoidales con filtro pasa-bajo para la música, ruido rosa filtrado para el efecto de transición, impulso de 1500 Hz con envolvente exponencial para el clic — precisamente porque un sonido hecho por nosotros tiene una licencia demostrable, y un archivo “gratis” de una página que no dice bajo qué condiciones, no. Los marcos del teléfono y del portátil están dibujados en SVG, no son fotografías de producto. Las capturas son de nuestra plataforma, hechas automáticamente sobre una versión de producción local. La fuente está autohospedada, bajo una licencia abierta para fuentes.

Qué incluye

El trabajo, por componentes

Guion con tiempos, calibrado por duración antes de la generación

Tabla de escenas con intervalos y el texto hablado para cada una, más el objetivo de ritmo. El texto bruto para la síntesis se escribe aparte, en un solo bloque, y las pausas las da la puntuación. Si el texto supera la duración, se recorta el texto — acelerar la voz se oye, y un clip que suena apresurado pierde exactamente lo que debía ganar.

Composición en HTML, con pistas y clips con tiempos escritos

Cada clip tiene inicio y duración como atributos, y los solapamientos para las transiciones son intencionales y visibles en el origen. Nuestra composición promocional tiene cinco clips en la pista principal e índices de pista separados para los elementos que van encima, en una línea de tiempo de veinte segundos. Un montaje escrito se puede rehacer idénticamente; uno hecho a mano, no.

Render a parámetros verificables

Última renderización de la composición propia, medida con `ffprobe`: H.264, 1920×1080, 60/1 fotogramas por segundo, 1200 fotogramas, 20,000000 segundos. No “aproximadamente veinte segundos” — exacto, porque el número de fotogramas es entero y resulta de la composición.

Voz sintetizada con ajustes anotados en el guion

Modelo multilingüe que admite rumano, con estabilidad, similitud, estilo y velocidad escritos como valores junto al texto. Los mismos ajustes dan la misma voz dentro de tres meses, cuando alguien pide una variante con una frase cambiada. Para ruso usamos una voz separada, elegida para el idioma, no traducida con la misma.

Sonido medido, no estimado

Normalización en dos pasadas hacia un objetivo de sonoridad, luego medición en el archivo entregado con el estándar europeo de sonoridad. Los valores para un conjunto reciente: −16,2 y −15,9 LUFS integrados, pico real −1,8 dBTP, intervalo dinámico 10,5 LU. Audio AAC a 48 kHz, estéreo, alrededor de 160 kbps, con la cabecera movida al inicio para que el archivo arranque sin descarga completa.

Dos idiomas y dos formatos del mismo material

Horizontal 1920×1080 y vertical 1080×1920, en rumano y en ruso — cuatro archivos para la misma historia, porque un clip horizontal recortado automáticamente a vertical pierde exactamente la parte en la que pasa algo. Un segundo conjunto entregado, de introducción, tiene la misma estructura, a 20,36 segundos.

Capturas del producto real, generadas automáticamente

Lo que se ve en el clip son grabaciones de la plataforma, hechas con una herramienta de automatización del navegador sobre una versión de producción ejecutada localmente: páginas públicas, redactadas, sin rostros, sin números de matrícula, sin direcciones exactas. Para la composición promocional extrajimos por separado capturas en varias posiciones de desplazamiento, además de los colores, las fuentes y las animaciones de la página, para que el movimiento del clip se parezca al movimiento del sitio.

Dossier de licencias para cada elemento del encuadre

Una tabla con la fuente y la licencia de cada sonido y de cada imagen, además de una sección sobre lo que NO está en el clip: sin música de biblioteca, sin filmaciones de stock, sin voces humanas grabadas, sin logotipos de instituciones, sin capturas de otras plataformas. La música y los efectos están sintetizados localmente con `ffmpeg`, así que la licencia se puede demostrar ejecutando de nuevo el script.

Conjuntos de visuales estáticos para campañas

Cuando el mensaje se prueba, no se filma: dos rondas de treinta creaciones para una sola campaña, en formato vertical para redes, cada una con su propio ángulo de mensaje en el nombre del archivo. Es más barato averiguar qué mensaje funciona con imágenes que con clips, y solo después filmar.

Qué aspecto tiene

El recorrido, paso a paso.

01

Escribimos el guion con tiempos y lo cortamos por duración

Escenas, intervalos, texto hablado, objetivo de ritmo. Aquí se decide si el mensaje cabe — no en el montaje. Entregamos el guion antes de cualquier generación, porque es el único momento barato en el que se puede cambiar la idea.

02

Juntamos el material y establecemos su licencia junto con él

Capturas generadas automáticamente en una versión de prueba, elementos dibujados, sonidos sintetizados localmente, voz generada. Cada elemento recibe una línea en el dossier de licencias en el momento en que entra en el proyecto, no al final, cuando nadie ya recuerda de dónde apareció.

03

Construimos la composición y la renderizamos a parámetros fijos

Tomas, clips con inicio y duración, transiciones por superposición intencional. La renderización se verifica con herramientas: resolución, fotogramas por segundo, número de fotogramas, duración. Si la duración no es la del guion, es un error de composición, no un redondeo.

04

Normalizamos el sonido y lo medimos en el archivo final

Dos pasadas hacia el objetivo de sonoridad, luego medición en el archivo entregado, no en el intermedio. Las cifras resultantes se escriben en el documento de entrega, para que puedan ser impugnadas.

05

Entregamos las variantes y la fuente

Ambos formatos, ambos idiomas, más las piezas separadas — narración, música, cuadros de guion — y la composición. La razón por la que también entregamos la fuente es simple: dentro de un año alguien querrá otra frase en el segundo veinte.

Un centru. În jur, ce intră în el — pe trasee separate.CENTRUL SE SPRIJINĂ PE CE E ÎN JURUL LUI
În centru, compoziția — un document cu piste și clipuri cu timpi scriși. În jurul ei orbitează elementele care intră în cadru, fiecare cu eticheta lui de licență: capturile produsului generate automat, ramele desenate în SVG, patul muzical și efectele sintetizate local, vocea generată, fontul autogăzduit. Un element fără etichetă nu intră pe orbită.

Los datos

Qué tocamos, dónde están y cuánto se quedan

Las preguntas que hace cualquiera que tenga un delegado de protección de datos — hechas aquí antes de que las haga él.

Qué entra en cuadro y de dónde viene
Capturas de la plataforma del cliente o del producto, generadas automáticamente en una versión de prueba, más elementos dibujados por nosotros. Cada uno tiene una línea en el dossier de licencias. Regla práctica: si no podemos mostrar de dónde viene, no entra en el clip.
Los datos personales en el material filmado
Se redactan antes de la captura, no después del montaje: sin rostros, sin matrículas, sin direcciones exactas, sin datos reales de clientes en las pantallas mostradas. Una pantalla de demostración se rellena con datos inventados, y eso se decide antes de iniciar las capturas.
La voz sintetizada y los términos del proveedor
El audio generado en nuestra cuenta o en la del cliente se usa comercialmente en las condiciones del plan pagado. Lo que no hacemos, porque está expresamente prohibido en los términos del proveedor: no entrenamos ni probamos un modelo competidor con su salida. La limitación se aplica incluso a nuestra propia línea de investigación sobre voz.
Qué se entrega al final
Los archivos finales en ambos formatos y ambos idiomas, la narración separada colocada sobre el eje temporal, la base musical separada, los cuadros de guion extraídos, el guion con tiempos y el dossier de licencias. La fuente de la composición permanece en el cliente, para que un cambio de texto dentro de un año no exija rehacerlo desde cero.

Un caso

Un clip de treinta segundos, en cuatro archivos, con el dossier de licencias al lado

La situación

La promoción de una plataforma pública propia, en dos idiomas, para redes donde el mismo material debe existir tanto en horizontal como en vertical. La restricción autoimpuesta: que ningún elemento del clip tenga una licencia que no podamos mostrar.

Qué construimos

Guion con tiempos y texto hablado por escenas, en ambos idiomas, con voces separadas elegidas por idioma. Las capturas de la plataforma generadas automáticamente en una versión de producción ejecutada localmente, con páginas redactadas — sin rostros, sin matrículas, sin direcciones exactas. Los marcos de teléfono y de portátil dibujados en SVG, no fotos de producto. La base musical y los dos efectos sonoros sintetizados localmente con `ffmpeg`: osciladores sinusoidales con filtro pasa-bajos para la música, ruido rosa filtrado para la transición, impulso de 1500 Hz con envolvente exponencial para el clic. El sonido normalizado en dos pasadas hacia un objetivo de sonoridad.

Qué salió

Cuatro archivos — dos idiomas × dos formatos — de exactamente 30,00 segundos cada uno, a 30 fotogramas por segundo, H.264 con audio AAC 48 kHz estéreo en torno a 160 kbps y el encabezado movido al inicio. Volvimos a medir hoy la versión horizontal en rumano: −16,2 LUFS integrado, pico real −1,8 dBTP, rango dinámico 10,5 LU, 900 fotogramas para 30,00 segundos. Las cifras coinciden con el documento de entrega. Además de los archivos se entregaron la narración separada, la base musical separada, los cuadros de guion y la tabla de licencias.

Qué no dice el caso

El framework de renderizado no es nuestro: es un proyecto de código abierto de otra empresa, bajo Apache 2.0, y nuestra contribución en él es cero. La voz se sintetiza en nuestra cuenta, en las condiciones del plan de pago del proveedor, y sus términos prohíben explícitamente usar la salida para entrenar o probar un modelo competidor; es un límite que respetamos. Y otro más, de sentido común: un clip no arregla un mensaje que no funciona; por eso, cuando se puede, probamos antes el mensaje en imágenes.

Preguntas

Lo que nos pregunta la gente antes de llamar

¿Tienen un motor propio de generación de video?

No, e es importante no dejar esa impresión. Componemos en HTML y renderizamos usando un marco de trabajo de código abierto, desarrollado por otra empresa, bajo licencia Apache 2.0. Lo hemos verificado: en nuestro clon no existe ningún commit nuestro. Lo nuestro son las composiciones, los guiones, las capturas, los sonidos sintetizados localmente y la disciplina de licencias. La herramienta no es la realización.

¿Qué significa concretamente «video con IA»? ¿Se ve que está generado?

En nuestros materiales, la generación cubre la voz y una parte de las imágenes de campaña. El movimiento y el montaje están escritos, no generados: un clip con tiempos y pistas, renderizado de forma determinista. No producimos personas sintéticas que hablen en cuadro. El motivo es práctico: un clip en el que se ve el producto real, capturado automáticamente, envejece peor y no tiene el problema de credibilidad de un presentador inexistente.

¿Quién posee los derechos sobre el clip?

El cliente, para el material entregado, y las fuentes externas siguen bajo su licencia, que está escrita elemento por elemento en el dossier de licencias. La voz generada se usa comercialmente en las condiciones del plan de pago del proveedor, en la cuenta en la que se generó. Entregamos también el dossier, no solo los archivos — si alguien pregunta dentro de dos años de dónde salió ese sonido, la respuesta está por escrito.

¿Por qué sintetizan la música en lugar de tomar una pista gratuita?

Porque una pista «gratuita» supone confiar en una página que dice que es gratuita. Una base musical hecha de cinco osciladores sinusoidales con filtro y un eco corto tiene una licencia que podemos demostrar volviendo a ejecutar el script. Si un proyecto pide una pista real, se puede — pero entonces en el dossier entran la fuente exacta, la licencia exacta y la fecha de descarga, no una mención vaga.

¿En qué idiomas y formatos entregan?

Rumano y ruso, en horizontal 1920×1080 y vertical 1080×1920. No cortamos automáticamente el horizontal en vertical: la composición se prepara aparte, porque en vertical entra otra cosa en cuadro. Otros idiomas se pueden hacer con las mismas herramientas, pero la voz se elige por idioma y se escucha antes, no se supone.

¿Por qué importa la sonoridad medida?

Porque un clip más silencioso que lo que hay a su alrededor en una red social se salta, y uno más fuerte se cierra. Normalizamos en dos pasadas hacia un objetivo y medimos en el archivo entregado con el estándar europeo de sonoridad. Para un conjunto reciente, las cifras son −16,2 y −15,9 LUFS, con pico real de −1,8 dBTP. Están medidas, no estimadas, y las escribimos en el documento de entrega precisamente para que puedan verificarse.

¿Pueden hacer clips con mi producto, no con animaciones genéricas?

Sí, y eso es lo que preferimos. Las capturas se hacen automáticamente, con una herramienta de automatización del navegador, sobre una versión de prueba del producto, en varias posiciones de desplazamiento; para una composición extraímos también por separado los colores, las fuentes y las animaciones de la página, para que el movimiento del clip se parezca al movimiento real de la interfaz. La condición es que exista una versión que podamos ejecutar y datos de demostración que no sean reales.

¿Qué tan rápido se puede cambiar una frase dentro de unos meses?

Como el montaje es un documento con tiempos, no un proyecto de un editor, una frase se cambia en el guion, se regenera la narración con los mismos ajustes de voz y se vuelve a renderizar. Por eso entregamos la fuente y los ajustes de voz, no solo el archivo final. Sin ellos, cualquier modificación implica rehacerlo.

¿También hacen campañas de imágenes, no solo clips?

Sí, y muchas veces es el paso correcto antes del video. Para una sola campaña produjimos dos rondas de treinta creatividades verticales cada una, cada una con otro ángulo de mensaje. Se prueba qué mensaje funciona en imágenes, cuáles son baratos de rehacer, y solo después se invierte en video sobre el mensaje ganador.

En qué se basan las afirmaciones anteriores (11 fuentes)
  1. Termenii furnizorului de voce interzic antrenarea sau testarea unui model concurent pe ieșirea luihttps://elevenlabs.io/use-policy · 2026-09-06

10 de ellas son código y archivos de nuestros repositorios. No publicamos su nombre ni la línea: juntos, en una sola página, describirían con demasiada precisión cómo están construidos sistemas que no son solo nuestros. Los repasamos contigo, en el repositorio, a petición — la verificación sigue siendo posible, solo que se hace en una conversación.

¿Qué te gustaría que funcionara mejor?

Cuéntanos tu proceso. Juntos decidimos qué merece la pena construir, qué podemos conectar y cómo verificamos el resultado.

Vamos a hablar