Saltar para o conteúdo
megapromotingVamos falar

Especialização · Vídeo e conteúdo com AI

Clipes curtos construídos em HTML, com voz sintetizada e com a licença de cada elemento no papel.

Produzimos clipes de promoção e conjuntos de visuais usando ferramentas de geração — voz sintetizada, imagens, composições animadas renderizadas em HTML. Cada elemento que entra em quadro tem uma fonte e uma licença escritas, e o som é medido, não aproximado.

Já construídoSunt materiale livrate, pe disc, pe care le-am măsurat azi cu unelte, nu le-am citit dintr-un raport. Un set de patru clipuri de 30 de secunde fix (două limbi × două formate) pentru o platformă proprie, un al doilea set de patru clipuri de introducere, o compoziție proprie randată în șapte variante pentru promovarea companiei, și două runde de vizualuri statice de campanie pentru un operator de transport. Am reverificat sonorul unuia dintre clipuri cu `ffmpeg … ebur128`: −16,2 LUFS integrat, vârf real −1,8 dBTP — exact cifrele din documentul intern, ceea ce nu se întâmplă de fiecare dată. Corecție importantă față de propriul nostru inventar: `hyperframes` NU este codul nostru. E clona depozitului public al altei companii, sub licență Apache 2.0, fără niciun commit al nostru. E unealta cu care lucrăm; realizările sunt compozițiile și randările, nu unealta.

Um clipe de trinta segundos tem três formas de se estragar, e só uma se vê à primeira visualização. Estraga-se visualmente — isso toda a gente observa. Estraga-se sonoramente, e então o clipe fica mais alto ou mais baixo do que tudo o que o rodeia na rede onde chega, o que só se observa após a publicação. E estraga-se juridicamente, o que nunca se observa, até ao dia em que se observa. Trabalhamos nos três, e nos dois últimos temos procedimento escrito, não boa vontade.

A composição é feita em HTML, não num editor. Uma composição é um documento com faixas e clipes, cada um com o momento de início e a duração escritos como atributos — por exemplo, um clipe que começa aos 8,4 segundos e dura 5,0 segundos, com sobreposição intencional sobre o anterior para a transição. A consequência prática é que um clipe pode ser refeito de forma idêntica: os mesmos atributos, o mesmo resultado, e uma correção de texto não exige refazer manualmente a montagem. A renderização da nossa composição de promoção saiu em 1920×1080, 60 fotogramas por segundo, 1200 fotogramas, exatamente 20,000000 segundos — números lidos do ficheiro, não do briefing.

A voz é sintetizada, com definições escritas no guião juntamente com o texto, para que uma repetição soe idêntica: modelo multilingue, estabilidade, semelhança, estilo e velocidade assinalados como valores, não como impressões. O texto é calibrado pela duração antes da geração — um clipe de trinta segundos suporta cerca de sessenta e cinco palavras em romeno, e se o guião tiver oitenta, corta-se o texto, não se acelera a voz. O som final é normalizado em duas passagens até um alvo e depois medido no ficheiro entregue: os quatro clipes de um conjunto recente ficam em −16,2 e −15,9 LUFS, com pico real −1,8 dBTP.

A regra que seguimos, e que se vê claramente no dossier de licenças de um conjunto entregue: nada no clipe tem uma licença que não possamos mostrar. A faixa musical e os efeitos sonoros foram sintetizados localmente com `ffmpeg` — cinco osciladores sinusoidais com filtro passa-baixo para a música, ruído rosa filtrado para o efeito de transição, impulso de 1500 Hz com envolvente exponencial para o clique — precisamente porque um som feito por nós tem uma licença demonstrável, e um ficheiro «gratuito» de uma página que não diz em que condições, não. As molduras de telefone e de portátil são desenhadas em SVG, não fotografias de produto. As capturas são da nossa plataforma, feitas automaticamente numa versão de produção local. A fonte é auto-hospedada, sob licença aberta para fontes.

Qué incluye

El trabajo, por componentes

Guião com tempos, calibrado pela duração antes da geração

Tabela de cenas com intervalos e o texto falado de cada uma, mais o alvo de ritmo. O texto bruto para síntese escreve-se separadamente, num único bloco, e as pausas são dadas pela pontuação. Se o texto exceder a duração, o texto é encurtado — a aceleração da voz ouve-se, e um clipe que soa apressado perde exatamente o que deveria ganhar.

Composição em HTML, com faixas e clipes com tempos escritos

Cada clipe tem início e duração como atributos, e as sobreposições para transições são intencionais e visíveis na fonte. A nossa composição de promoção tem cinco clipes na faixa principal e índices de faixa separados para os elementos que passam por cima, numa linha temporal de vinte segundos. Uma montagem escrita pode ser refeita de forma idêntica; uma feita à mão, não.

Renderização com parâmetros verificáveis

A última renderização da composição própria, medida com `ffprobe`: H.264, 1920×1080, 60/1 fotogramas por segundo, 1200 fotogramas, 20,000000 segundos. Não «aproximadamente vinte segundos» — exatamente, porque o número de fotogramas é inteiro e resulta da composição.

Voz sintetizada com definições anotadas no guião

Modelo multilíngue que suporta romeno, com estabilidade, semelhança, estilo e velocidade escritos como valores ao lado do texto. As mesmas definições dão a mesma voz daqui a três meses, quando alguém pedir uma versão com uma frase alterada. Para russo usamos uma voz separada, escolhida para a língua, não traduzida com a mesma.

Som medido, não estimado

Normalização em duas passagens para um alvo de sonoridade, depois medição no ficheiro entregue com o padrão europeu de sonoridade. Os valores para um conjunto recente: −16,2 e −15,9 LUFS integrado, pico real −1,8 dBTP, intervalo dinâmico 10,5 LU. Áudio AAC a 48 kHz, estéreo, em torno de 160 kbps, com o cabeçalho movido para o início para o ficheiro arrancar sem transferência completa.

Duas línguas e dois formatos do mesmo material

Horizontal 1920×1080 e vertical 1080×1920, em romeno e em russo — quatro ficheiros para a mesma história, porque um clip horizontal cortado automaticamente para vertical perde exatamente a parte em que algo acontece. Um segundo conjunto entregue, de introdução, tem a mesma estrutura, com 20,36 segundos.

Capturas do produto real, geradas automaticamente

O que se vê no clip são gravações da plataforma, feitas com uma ferramenta de automatização do browser numa versão de produção executada localmente: páginas públicas, editadas, sem rostos, sem números de matrícula, sem endereços exatos. Para a composição de promoção extraí separadamente capturas em várias posições de deslocação, mais as cores, as fontes e as animações da página, para que o movimento no clip se pareça com o movimento no site.

Dossier de licenças para cada elemento no enquadramento

Uma tabela com a fonte e a licença de cada som e de cada imagem, mais uma secção sobre o que NÃO está no clip: sem música de biblioteca, sem filmagens de stock, sem vozes humanas gravadas, sem logótipos de instituições, sem capturas de outras plataformas. A música e os efeitos são sintetizados localmente com `ffmpeg`, por isso a licença pode ser demonstrada executando o script novamente.

Conjuntos de visuais estáticos para campanhas

Quando a mensagem é testada, não é filmada: duas rondas de trinta criações para uma única campanha, em formato vertical para redes, cada uma com o seu próprio ângulo de mensagem no nome do ficheiro. É mais barato saber que mensagem resulta a partir de imagens do que de clips, e só depois filmar.

Qué aspecto tiene

El recorrido, paso a paso.

01

Escrevemos o guião com tempos e cortamo-lo por duração

Cenas, intervalos, texto falado, alvo de ritmo. Aqui decide-se se a mensagem cabe — não na montagem. Entregamos o guião antes de qualquer geração, porque é o único momento barato em que a ideia pode ser mudada.

02

Juntamos o material e definimos a licença dele ao mesmo tempo

Capturas geradas automaticamente numa versão de teste, elementos desenhados, sons sintetizados localmente, voz gerada. Cada elemento recebe uma linha no dossier de licenças no momento em que entra no projeto, não no fim, quando ninguém já se lembra de onde apareceu.

03

Construímos a composição e renderizamo-la com parâmetros fixos

Faixas, clips com início e duração, passagens por sobreposição intencional. A renderização é verificada com ferramentas: resolução, fotogramas por segundo, número de fotogramas, duração. Se a duração não for a do guião, é um erro de composição, não um arredondamento.

04

Normalizamos o som e medimo-lo no ficheiro final

Duas passagens até ao alvo de sonoridade, depois medição no ficheiro entregue, não no intermédio. Os números resultantes são escritos no documento de entrega, para poderem ser contestados.

05

Entregamos as variantes e a fonte

Ambos os formatos, ambas as línguas, mais as peças separadas — narração, música, frames de guião — e a composição. O motivo pelo qual também entregamos a fonte é simples: daqui a um ano alguém vai querer outra frase no segundo vinte.

Un centru. În jur, ce intră în el — pe trasee separate.CENTRUL SE SPRIJINĂ PE CE E ÎN JURUL LUI
În centru, compoziția — un document cu piste și clipuri cu timpi scriși. În jurul ei orbitează elementele care intră în cadru, fiecare cu eticheta lui de licență: capturile produsului generate automat, ramele desenate în SVG, patul muzical și efectele sintetizate local, vocea generată, fontul autogăzduit. Un element fără etichetă nu intră pe orbită.

Os dados

Qué tocamos, dónde están y cuánto se quedan

Las preguntas que hace cualquiera que tenga un delegado de protección de datos — hechas aquí antes de que las haga él.

O que entra no quadro e de onde vem
Capturas da plataforma do cliente ou do produto, geradas automaticamente numa versão de teste, mais elementos desenhados por nós. Cada um tem uma linha no dossier de licenças. Regra prática: se não conseguimos mostrar de onde vem, não entra no clip.
Os dados pessoais no material filmado
É redigido antes da captura, não depois da montagem: sem rostos, sem matrículas, sem moradas exactas, sem dados reais de clientes nos ecrãs mostrados. Um ecrã de demonstração é preenchido com dados inventados, e isso é decidido antes de iniciar as capturas.
A voz sintetizada e os termos do fornecedor
O áudio gerado na nossa conta ou na conta do cliente é usado comercialmente nas condições do plano pago. O que não fazemos, porque é explicitamente proibido nos termos do fornecedor: não treinamos nem testamos um modelo concorrente na sua saída. A limitação aplica-se também à nossa própria direção de investigação em voz.
O que é entregue no final
Os ficheiros finais em ambos os formatos e ambas as línguas, a narração separada colocada no eixo do tempo, a base musical separada, os frames de guião extraídos, o guião com tempos e o dossier de licenças. A fonte da composição permanece com o cliente, para que uma alteração de texto daqui a um ano não exija refazer tudo do zero.

Un caso

Um clip de trinta segundos, em quatro ficheiros, com o dossier de licenças ao lado

A situação

A promoção de uma plataforma pública própria, em duas línguas, para redes onde o mesmo material tem de existir tanto na horizontal como na vertical. A restrição autoimposta: nenhum elemento do clip pode ter uma licença que não possamos mostrar.

Qué construimos

Guião com tempos e texto falado por cenas, em ambas as línguas, com vozes separadas escolhidas por língua. Capturas da plataforma geradas automaticamente numa versão de produção executada localmente, com páginas redigidas — sem rostos, sem matrículas, sem moradas exactas. As molduras de telefone e de portátil desenhadas em SVG, não fotografias de produto. A base musical e os dois efeitos sonoros sintetizados localmente com `ffmpeg`: osciladores sinusoidais com filtro passa-baixo para a música, ruído rosa filtrado para a transição, impulso de 1500 Hz com envelope exponencial para o clique. O som normalizado em duas passagens até um alvo de sonoridade.

Qué salió

Quatro ficheiros — duas línguas × dois formatos — com exatamente 30,00 segundos cada, a 30 fotogramas por segundo, H.264 com áudio AAC 48 kHz estéreo em torno de 160 kbps e o cabeçalho movido para o início. Remedi hoje a versão horizontal em romeno: −16,2 LUFS integrado, pico verdadeiro −1,8 dBTP, gama dinâmica 10,5 LU, 900 fotogramas para 30,00 segundos. Os números coincidem com o documento de entrega. Além dos ficheiros, foram entregues a narração separada, a base musical separada, os frames de guião e a tabela de licenças.

Qué no dice el caso

A estrutura de trabalho para renderização não é nossa — é um projeto de código aberto de outra empresa, sob Apache 2.0, e a nossa contribuição nele é zero. A voz é sintetizada na nossa conta, nas condições do plano pago do fornecedor, e os seus termos proíbem explicitamente usar a saída para treinar ou testar um modelo concorrente; é um limite que respeitamos. E mais um, de bom senso: um clip não resolve uma mensagem que não funciona — por isso, quando possível, testamos a mensagem em imagens antes.

Perguntas

Lo que nos pregunta la gente antes de llamar

Vocês têm um motor próprio de geração de vídeo?

Não, e é importante não deixar essa impressão. Componhamos em HTML e renderizamos usando uma estrutura de código aberto, desenvolvida por outra empresa, sob licença Apache 2.0. Verificámos: no nosso clone não existe nenhum commit nosso. O que é nosso são as composições, os guiões, as capturas, os sons sintetizados localmente e a disciplina de licenças. A ferramenta não é a realização.

O que significa concretamente «vídeo com IA»? Vê-se que é gerado?

Nos nossos materiais, a geração abrange a voz e parte das imagens de campanha. O movimento e a montagem são escritos, não gerados: um clip com timings e pistas, renderizado de forma determinística. Não produzimos humanos sintéticos que falam em cena. O motivo é prático: um clip em que se vê o produto real, capturado automaticamente, envelhece mais lentamente e não tem o problema de credibilidade de um apresentador inexistente.

Quem detém os direitos sobre o clip?

O cliente, para o material entregue, e as fontes externas permanecem sob a respetiva licença, que está escrita elemento a elemento no dossier de licenças. A voz gerada é utilizada comercialmente nas condições do plano pago do fornecedor, na conta em que foi gerada. Entregamos também o dossier, não apenas os ficheiros — se alguém perguntar daqui a dois anos de onde vem aquele som, a resposta existe por escrito.

Porque é que sintetizam a música em vez de usar uma faixa gratuita?

Porque uma faixa «gratuita» pressupõe confiança numa página que diz que é gratuita. Um fundo musical feito de cinco osciladores sinusoidais com filtro e um eco curto tem uma licença que podemos demonstrar executando o script novamente. Se um projeto exigir uma faixa verdadeira, é possível — mas então no dossier entram a fonte exata, a licença exata e a data de descarregamento, não uma menção vaga.

Em que línguas e formatos entregam?

Romeno e russo, em horizontal 1920×1080 e vertical 1080×1920. Não cortamos automaticamente o horizontal para vertical: a composição é ajustada separadamente, porque no vertical entra outra coisa em quadro. Outras línguas podem ser feitas com as mesmas ferramentas, mas a voz é escolhida por língua e ouvida antes, não presumida.

Porque é que a sonoridade medida importa?

Porque um clip mais baixo do que o que o rodeia numa rede social é ignorado, e um mais alto é fechado. Normalizamos em duas passagens para um alvo e medimos no ficheiro entregue com o padrão europeu de sonoridade. Para um conjunto recente, os números são −16,2 e −15,9 LUFS, com pico real de −1,8 dBTP. São medidos, não estimados, e escrevemo-los no documento de entrega precisamente para poderem ser verificados.

Podem fazer clips com o meu produto, não com animações genéricas?

Sim, e é isso que preferimos. As capturas são feitas automaticamente, com uma ferramenta de automatização do navegador, numa versão de teste do produto, em várias posições de deslocamento; para uma composição extraímos também separadamente as cores, os tipos de letra e as animações da página, para que o movimento no clip se assemelhe ao movimento real da interface. A condição é existir uma versão que possamos executar e dados de demonstração que não sejam reais.

Quão depressa se pode alterar uma frase daqui a alguns meses?

Como a montagem é um documento com timings, e não um projeto num editor, uma frase é alterada no guião, a narração é regenerada com as mesmas definições de voz e é renderizada de novo. Por isso entregamos a fonte e as definições de voz, não apenas o ficheiro final. Sem eles, qualquer alteração significa refazer.

Também fazem campanhas de imagens, e não apenas clips?

Sim, e muitas vezes o passo certo antes do vídeo. Para uma única campanha, produzimos duas rondas de trinta criações verticais cada, cada uma com um ângulo de mensagem diferente. Testa-se que mensagem funciona nas imagens, quais são baratas de refazer e só depois se investe em vídeo na mensagem vencedora.

Em que se baseiam as afirmações acima (11 fontes)
  1. Termenii furnizorului de voce interzic antrenarea sau testarea unui model concurent pe ieșirea luihttps://elevenlabs.io/use-policy · 2026-09-06

10 delas são código e ficheiros dos nossos repositórios. Não publicamos o nome nem a linha: juntos, numa única página, descreveriam com demasiada precisão como estão construídos sistemas que não são só nossos. Percorremo-los consigo, no repositório, a pedido — a verificação continua possível, só que se faz numa conversa.

O que gostaria que funcionasse melhor?

Conte-nos o seu processo. Em conjunto decidimos o que vale a pena construir, o que podemos ligar e como verificamos o resultado.

Vamos falar