Prepara o texto
Escreve o material e escolhe a voz autorizada para utilização.
Produção de voz Instrument specializat
Um estúdio para a geração, audição e descarregamento de materiais vocais através de modelos text-to-speech. A interface reúne a escolha da voz e os ajustes úteis para a produção.
Voice Studio
Escreve o material e escolhe a voz autorizada para utilização.
Ajusta os parâmetros e as opções disponíveis do modelo vocal.
Ouves, corriges e descarregas o material para o projeto.
Materiais explicativos, apresentações e conteúdo áudio.
Um fluxo de geração e revisão para as equipas de conteúdo.
Comparação das interpretações de um texto antes de o utilizar.
A ferramenta utiliza modelos de voz dos fornecedores integrados. Aplicam-se os custos, os direitos sobre as vozes e as regras do fornecedor.
Voice Studio em detalhe
Voice Studio é a cadeia do texto ao ficheiro áudio: escreve o texto, escolhe a voz, adiciona marcações de emoção e pausas, ajusta o modelo, ouve, corrige e descarrega. O fornecedor é ElevenLabs — dizemo-lo pelo nome, porque isso determina que vozes podem ser usadas, quanto custa e o que pode fazer com o resultado.
A parte que não se vê e que é, na verdade, o motivo pelo qual a ferramenta existe: a chave de API nunca chega ao browser. A interface envia apenas o texto para uma função própria no servidor, e essa é que detém a chave e comunica com ElevenLabs. Sem esta camada, qualquer página que gere voz expõe a sua chave a quem abrir a consola do browser.
Não é Grai. Grai é investigação de modelo vocal, sem produto. Voice Studio é produção com fornecedor integrado, disponível hoje. As duas não partilham qualquer código.
Eleven v3 para expressividade e marcações de emoção, Multilingual v2 para estabilidade, Turbo v2.5 para custo, Flash v2.5 para latência mínima. Não são quatro variantes da mesma coisa: v3 aceita marcações que as outras ignoram, e Flash sacrifica a nuance pela velocidade.
No Eleven v3 pode inserir no texto 14 estados de emoção (de [excited] e [whispers] até [sarcastic] e [tired]), 9 marcações não verbais e de pausa ([laughs], [sighs], [clears throat], [pause], [breathes]) e 7 de entrega ([rushed], [drawn out], [singing], [muttering], [quietly]). Inserem-se na posição do cursor, porque o lugar conta tanto como a marcação.
Estabilidade, semelhança com a voz de origem, exagero de estilo, velocidade entre 0,7 e 1,2, mais o impulso do locutor. No v3, a estabilidade não é um cursor contínuo, mas três níveis — Criativo, Natural, Robust — porque o modelo se comporta de forma discreta, não contínua, e um cursor fino sugeriria um controlo que não existe.
MP3 a 44,1 kHz 128 ou 192 kbps, MP3 22 kHz 32 kbps para ficheiros pequenos, PCM 44,1 kHz para WAV bruto que entra numa montagem, e μ-law 8 kHz — o formato de telefonia, se o material chegar a um IVR ou a uma central.
Romeno, russo, inglês, ucraniano, francês, italiano, espanhol, alemão — ou deixada em automático. A imposição da língua conta em textos mistos, onde a deteção automática escolhe mal precisamente os nomes próprios.
Dados e funcionamento
Da exploração à implementação
Um spot de rádio, uma narração de apresentação e uma mensagem de IVR têm exigências diferentes de formato, ritmo e comprimento. O formato de exportação é escolhido aqui, não no final.
Que voz é usada e com base em que acordo. Se for precisa uma voz nova, a clonagem exige amostras e o consentimento da pessoa, não apenas um ficheiro áudio.
A maioria dos problemas de pronúncia resolve-se reescrevendo o texto, não mexendo nos cursores: as abreviações são desenvolvidas, os números são escritos por extenso onde há ambiguidade, e os nomes próprios são testados isoladamente antes de serem colocados na frase.
A exportação verificada, mais uma nota sobre a voz utilizada e os limites de utilização — para que o material possa ser reutilizado daqui a seis meses sem voltarmos a iniciar a discussão sobre direitos.
ElevenLabs. A nossa função de servidor chama diretamente api.elevenlabs.io, o endpoint de síntese. Não é um fornecedor abstrato: dele dependem as vozes disponíveis, o custo, os formatos de saída e as regras de utilização do resultado.
As fixadas na interface, que são vozes clonadas a partir de amostras fornecidas — não vozes de biblioteca. Uma nova voz é criada carregando amostras através da interface de clonagem da ElevenLabs, com o limite deles de 11 MB por ficheiro; acima disso, recomprimimos automaticamente para mono 22 kHz 64 kbps. A parte que não é técnica é a que importa: clonar a voz de uma pessoa exige o consentimento dessa pessoa. Na República da Moldova, a voz é dado biométrico desde 23 de agosto de 2026, por isso uma gravação pública não autoriza nada.
5.000 caracteres por pedido, limite imposto por nós, não pelo fornecedor. O motivo é o custo: um pedido errado com um texto cem vezes mais longo é uma fatura, não um erro. A função tem 60 segundos de execução, o que é suficiente para um bloco desta dimensão.
MP3 a 44,1 kHz 128 kbps (predefinição) ou 192 kbps, MP3 22 kHz 32 kbps para tamanho reduzido, PCM 44,1 kHz para WAV bruto, e μ-law 8 kHz para telefonia. O último é aquele que as pessoas esquecem e depois descobrem que o material soa mal na central telefónica.
Não. A subscrição ElevenLabs dá-lhe direito de uso comercial sobre o material, mas a política de utilização deles proíbe explicitamente usar a saída para treinar, testar ou desenvolver um sistema concorrente. Um ficheiro entregue a um cliente está correto; o mesmo ficheiro como dados de treino para um modelo próprio não está. É uma distinção que se paga se for ignorada, e é o motivo pelo qual Grai não é treinado com nada que saia daqui.
Não. O histórico vive na memória do separador, no máximo 12 gerações, e desaparece ao recarregar. Não existe conta, base de dados nem armazenamento no servidor; a resposta de áudio é marcada explicitamente como não cacheável. Se quer o ficheiro, descarrega-o nesse momento.
Não hoje. O deployment está atrás da autenticação Vercel e, opcionalmente, de um token adicional de acesso pedido como cabeçalho em cada pedido. É uma ferramenta de trabalho interna para produção de materiais, não um serviço com registo. O que entregamos é o material áudio, não o acesso ao painel.
Exemplo ilustrativo
Um cenário de utilização, sem dados de cliente nem resultados comerciais atribuídos.
O texto de uma apresentação de produto, que deve ser lido em romeno e russo pela mesma voz, com a mesma energia.
Escolhe-se Eleven v3 pela expressividade e força-se explicitamente a língua em cada variante, em vez de a deixar para deteção automática — em textos com nomes próprios, a deteção escolhe mal precisamente onde se ouve mais. A estabilidade é colocada em Natural; as pausas são marcadas no texto com [pause] e [short pause] na posição exata, não no fim da frase. Ouvem-se e corrigem-se o texto, não os cursores.
Dois ficheiros MP3 a 44,1 kHz, a mesma voz, a mesma energia, descarregados no momento da geração. Se o material for entrar numa montagem, usa-se PCM em vez de MP3, para não ser comprimido duas vezes.
Ce este necesar:Vocea trebuie să fie una pentru care există acordul persoanei clonate. Textul nu trebuie să conțină informație care nu are voie să ajungă la un furnizor extern.
Possibilidades de colaboração
Projetos de transcrição e geração vocal em materiais para os quais existem direitos de utilização e uma finalidade documentada.
Definimos um piloto em torno de um processo real: utilizadores, dados, integrações, custos e critérios de aceitação. A expansão segue após a avaliação do resultado.
Estabelecemos os requisitos de acessibilidade, alojamento, proteção de dados e interoperabilidade. Qualquer ligação a serviços AGE ou STISC requer a validação da elegibilidade, do acesso e das aprovações.
Estes são cenários de adaptação, não declarações sobre contratos ou parcerias existentes. As funções propostas confirmam-se no âmbito de trabalho do projeto.
Fale sobre um pilotoConstruímos agentes que atendem e fazem chamadas, usam a informação do negócio e trabalham com os seus sistemas.
PlatformăGrai é a nossa linha de investigação em síntese de voz e modelos adaptados às línguas que se falam aqui.
Cercetare & dezvoltareUma ferramenta para captura, transcrição e organização de anúncios de rádio.
Instrument specializatConte-nos o seu processo. Em conjunto decidimos o que vale a pena construir, o que podemos ligar e como verificamos o resultado.