Saltar para o conteúdo
megapromotingVamos falar
Produtos Voice Studio

Produção de voz Instrument specializat

Do texto, uma voz para o seu material.

Um estúdio para a geração, audição e descarregamento de materiais vocais através de modelos text-to-speech. A interface reúne a escolha da voz e os ajustes úteis para a produção.

  1. 1Text și voce
  2. 2Generare audio
  3. 3Ascultare și export
Schemă explicativă ·Voice Studio

Voice Studio

Da informação ao trabalho feito.

01

Prepara o texto

Escreve o material e escolhe a voz autorizada para utilização.

02

Reglezi

Ajusta os parâmetros e as opções disponíveis do modelo vocal.

03

Revizuiești

Ouves, corriges e descarregas o material para o projeto.

Onde se torna útil.

Narațiune

Materiais explicativos, apresentações e conteúdo áudio.

Producție

Um fluxo de geração e revisão para as equipas de conteúdo.

Experimentare

Comparação das interpretações de um texto antes de o utilizar.

A ferramenta utiliza modelos de voz dos fornecedores integrados. Aplicam-se os custos, os direitos sobre as vozes e as regras do fornecedor.

Voice Studio em detalhe

O que você pode fazer com este projeto.

Voice Studio é a cadeia do texto ao ficheiro áudio: escreve o texto, escolhe a voz, adiciona marcações de emoção e pausas, ajusta o modelo, ouve, corrige e descarrega. O fornecedor é ElevenLabs — dizemo-lo pelo nome, porque isso determina que vozes podem ser usadas, quanto custa e o que pode fazer com o resultado.

A parte que não se vê e que é, na verdade, o motivo pelo qual a ferramenta existe: a chave de API nunca chega ao browser. A interface envia apenas o texto para uma função própria no servidor, e essa é que detém a chave e comunica com ElevenLabs. Sem esta camada, qualquer página que gere voz expõe a sua chave a quem abrir a consola do browser.

Não é Grai. Grai é investigação de modelo vocal, sem produto. Voice Studio é produção com fornecedor integrado, disponível hoje. As duas não partilham qualquer código.

01

Quatro modelos, escolhidos por compromissos diferentes

Eleven v3 para expressividade e marcações de emoção, Multilingual v2 para estabilidade, Turbo v2.5 para custo, Flash v2.5 para latência mínima. Não são quatro variantes da mesma coisa: v3 aceita marcações que as outras ignoram, e Flash sacrifica a nuance pela velocidade.

02

Marcações de interpretação, não apenas texto

No Eleven v3 pode inserir no texto 14 estados de emoção (de [excited] e [whispers] até [sarcastic] e [tired]), 9 marcações não verbais e de pausa ([laughs], [sighs], [clears throat], [pause], [breathes]) e 7 de entrega ([rushed], [drawn out], [singing], [muttering], [quietly]). Inserem-se na posição do cursor, porque o lugar conta tanto como a marcação.

03

Ajustes que se vêem no resultado

Estabilidade, semelhança com a voz de origem, exagero de estilo, velocidade entre 0,7 e 1,2, mais o impulso do locutor. No v3, a estabilidade não é um cursor contínuo, mas três níveis — Criativo, Natural, Robust — porque o modelo se comporta de forma discreta, não contínua, e um cursor fino sugeriria um controlo que não existe.

04

Cinco formatos de exportação, incluindo um para telefonia

MP3 a 44,1 kHz 128 ou 192 kbps, MP3 22 kHz 32 kbps para ficheiros pequenos, PCM 44,1 kHz para WAV bruto que entra numa montagem, e μ-law 8 kHz — o formato de telefonia, se o material chegar a um IVR ou a uma central.

05

Oito línguas forçáveis, ou deteção a partir do texto

Romeno, russo, inglês, ucraniano, francês, italiano, espanhol, alemão — ou deixada em automático. A imposição da língua conta em textos mistos, onde a deteção automática escolhe mal precisamente os nomes próprios.

Dados e funcionamento

O que entra no sistema. O que deve ser verificado.

A chave fica num único lugar
Numa variável de ambiente encriptada no servidor, nunca no código, no git ou no frontend. O browser chama apenas a nossa própria função. A chave recebe da ElevenLabs apenas permissão de síntese, não acesso a toda a conta, além de um limite mensal de caracteres — porque a verdadeira defesa de uma chave não é o seu segredo, mas o mal que pode causar se for exposta.
O texto chega ao fornecedor
Essa é a implicação direta de usar um fornecedor externo: o texto que você envia para sintetização vai para a ElevenLabs. Um texto com dados pessoais, preços não publicados ou informação de cliente não é enviado sem autorização. Não é uma formalidade — é a única decisão de conformidade que a ferramenta transfere para o utilizador.
As vozes são clonadas, por isso é preciso consentimento
As vozes fixadas na interface não são vozes de biblioteca, mas vozes clonadas a partir de amostras de pessoas reais, criadas através da interface de clonagem da ElevenLabs. Isso significa que não é uma questão de licença do produto, mas sim do acordo da pessoa. Na República da Moldávia, a Lei 195/2024 trata a voz como dado biométrico a partir de 23 de agosto de 2026.
Nada fica guardado
As gerações permanecem na memória do separador do browser, no máximo as últimas 12, e desaparecem ao recarregar. Não existe base de dados, não existe histórico no servidor, não existe conta. A resposta de áudio é servida com Cache-Control: no-store.
O que você pode fazer com o resultado
A subscrição da ElevenLabs concede direito de uso comercial sobre o material gerado, mas a sua política de utilização proíbe explicitamente o uso da saída para treinar, testar ou construir um sistema concorrente. Na prática: o ficheiro de áudio pode ser usado num material de cliente; não pode tornar-se dados de treino para um modelo próprio.

Da exploração à implementação

Como preparamos um projeto com Voice Studio.

01

Esclarecemos o material e quem o ouve

Um spot de rádio, uma narração de apresentação e uma mensagem de IVR têm exigências diferentes de formato, ritmo e comprimento. O formato de exportação é escolhido aqui, não no final.

02

Resolvemos primeiro os direitos de voz

Que voz é usada e com base em que acordo. Se for precisa uma voz nova, a clonagem exige amostras e o consentimento da pessoa, não apenas um ficheiro áudio.

03

Geramos, ouvimos e corrigimos o texto, não as definições

A maioria dos problemas de pronúncia resolve-se reescrevendo o texto, não mexendo nos cursores: as abreviações são desenvolvidas, os números são escritos por extenso onde há ambiguidade, e os nomes próprios são testados isoladamente antes de serem colocados na frase.

04

Entregamos o ficheiro e registamos o que é permitido

A exportação verificada, mais uma nota sobre a voz utilizada e os limites de utilização — para que o material possa ser reutilizado daqui a seis meses sem voltarmos a iniciar a discussão sobre direitos.

Perguntas que vale a pena esclarecer.

Que fornecedor você utiliza?

ElevenLabs. A nossa função de servidor chama diretamente api.elevenlabs.io, o endpoint de síntese. Não é um fornecedor abstrato: dele dependem as vozes disponíveis, o custo, os formatos de saída e as regras de utilização do resultado.

Que vozes posso usar?

As fixadas na interface, que são vozes clonadas a partir de amostras fornecidas — não vozes de biblioteca. Uma nova voz é criada carregando amostras através da interface de clonagem da ElevenLabs, com o limite deles de 11 MB por ficheiro; acima disso, recomprimimos automaticamente para mono 22 kHz 64 kbps. A parte que não é técnica é a que importa: clonar a voz de uma pessoa exige o consentimento dessa pessoa. Na República da Moldova, a voz é dado biométrico desde 23 de agosto de 2026, por isso uma gravação pública não autoriza nada.

Quanto texto posso enviar de uma vez?

5.000 caracteres por pedido, limite imposto por nós, não pelo fornecedor. O motivo é o custo: um pedido errado com um texto cem vezes mais longo é uma fatura, não um erro. A função tem 60 segundos de execução, o que é suficiente para um bloco desta dimensão.

Em que formatos exporta?

MP3 a 44,1 kHz 128 kbps (predefinição) ou 192 kbps, MP3 22 kHz 32 kbps para tamanho reduzido, PCM 44,1 kHz para WAV bruto, e μ-law 8 kHz para telefonia. O último é aquele que as pessoas esquecem e depois descobrem que o material soa mal na central telefónica.

Posso usar o áudio gerado para treinar uma voz minha?

Não. A subscrição ElevenLabs dá-lhe direito de uso comercial sobre o material, mas a política de utilização deles proíbe explicitamente usar a saída para treinar, testar ou desenvolver um sistema concorrente. Um ficheiro entregue a um cliente está correto; o mesmo ficheiro como dados de treino para um modelo próprio não está. É uma distinção que se paga se for ignorada, e é o motivo pelo qual Grai não é treinado com nada que saia daqui.

Fica guardado algures o que geramos?

Não. O histórico vive na memória do separador, no máximo 12 gerações, e desaparece ao recarregar. Não existe conta, base de dados nem armazenamento no servidor; a resposta de áudio é marcada explicitamente como não cacheável. Se quer o ficheiro, descarrega-o nesse momento.

Posso usá-lo sozinho?

Não hoje. O deployment está atrás da autenticação Vercel e, opcionalmente, de um token adicional de acesso pedido como cabeçalho em cada pedido. É uma ferramenta de trabalho interna para produção de materiais, não um serviço com registo. O que entregamos é o material áudio, não o acesso ao painel.

Exemplo ilustrativo

A narração de um material de apresentação, em duas línguas

Um cenário de utilização, sem dados de cliente nem resultados comerciais atribuídos.

Situação inicial

O texto de uma apresentação de produto, que deve ser lido em romeno e russo pela mesma voz, com a mesma energia.

Como funciona

Escolhe-se Eleven v3 pela expressividade e força-se explicitamente a língua em cada variante, em vez de a deixar para deteção automática — em textos com nomes próprios, a deteção escolhe mal precisamente onde se ouve mais. A estabilidade é colocada em Natural; as pausas são marcadas no texto com [pause] e [short pause] na posição exata, não no fim da frase. Ouvem-se e corrigem-se o texto, não os cursores.

Rezultatul

Dois ficheiros MP3 a 44,1 kHz, a mesma voz, a mesma energia, descarregados no momento da geração. Se o material for entrar numa montagem, usa-se PCM em vez de MP3, para não ser comprimido duas vezes.

Ce este necesar:Vocea trebuie să fie una pentru care există acordul persoanei clonate. Textul nu trebuie să conțină informație care nu are voie să ajungă la un furnizor extern.

Possibilidades de colaboração

Voice Studio, no contexto da sua organização.

Processamento de conteúdo áudio

Projetos de transcrição e geração vocal em materiais para os quais existem direitos de utilização e uma finalidade documentada.

Empresas privadas

Definimos um piloto em torno de um processo real: utilizadores, dados, integrações, custos e critérios de aceitação. A expansão segue após a avaliação do resultado.

Instituições e empresas públicas

Estabelecemos os requisitos de acessibilidade, alojamento, proteção de dados e interoperabilidade. Qualquer ligação a serviços AGE ou STISC requer a validação da elegibilidade, do acesso e das aprovações.

Estes são cenários de adaptação, não declarações sobre contratos ou parcerias existentes. As funções propostas confirmam-se no âmbito de trabalho do projeto.

Fale sobre um piloto

Parte de um ecossistema.

O que gostaria que funcionasse melhor?

Conte-nos o seu processo. Em conjunto decidimos o que vale a pena construir, o que podemos ligar e como verificamos o resultado.

Vamos falar