Dados e língua
Preparação e avaliação do material vocal utilizado com os direitos necessários.
Investigação de voz Cercetare & dezvoltare
Grai é a nossa linha de investigação para síntese vocal e modelos adaptados às línguas usadas aqui. Trabalhamos na pronúncia, expressividade e na ligação entre o modelo de voz e as aplicações conversacionais.
Grai
Preparação e avaliação do material vocal utilizado com os direitos necessários.
Experiências para pronúncia, ritmo e expressividade.
Avaliação do modelo em cenários conversacionais e acesso via API.
Atenção à pronúncia e ao ritmo da fala, inclusive em contextos locais.
Investigação e avaliação para romeno e russo.
Kallina é a plataforma de agentes; Grai é uma direção distinta de desenvolvimento do modelo vocal.
Apresentamos um projeto em investigação, com resultados que são avaliados iterativamente. A disponibilidade de um modelo para produção é confirmada separadamente.
Grai em detalhe
Grai é o nosso projeto de investigação sobre voz em romeno. Não é um produto, não pode ser comprado e não tem um botão de experimentar. É uma tentativa de entender por que motivo o romeno é mal servido pelos sistemas de voz existentes e quanto custaria servi-lo melhor.
A arquitetura que estudamos é em cascata, não duplex nativo: reconhecimento → modelo de linguagem → síntese, três componentes separados. O reconhecimento e a síntese correm localmente, no processador; o modelo de linguagem é substituível e fica fora da máquina, por trás de um gateway compatível com OpenAI. A escolha é deliberada e tem um custo que medimos.
A distinção que importa: Grai explora a voz. Kallina organiza a conversa e as ações. Voice Studio produz ficheiros de áudio com fornecedores integrados. São três coisas diferentes, e a única delas que é investigação é Grai.
O protocolo é fixado e declarado: 200 enunciados por língua do conjunto de teste FLEURS, escolhidos uniformemente ao acaso com a semente 20260831, descodificação em fluxo com consciência de cache — não descodificação offline em ficheiro inteiro, que é mais fácil e dá números mais bonitos. O resultado próprio na janela predefinida de 1120 ms: 26,31% de taxa de erro de palavras em romeno, 9,30% em russo.
Medimos cada segmento com duas pontas observadas, não calculadas. Na decomposição publicada, o modelo de linguagem é de longe a maior fatia: 2180 ms, contra 92 ms de reconhecimento e 305 ms de síntese. A conclusão útil é que, para uma conversa vocal, a velocidade não se ganha otimizando o reconhecimento — ele já é quase gratuito. Ganha-se no modelo de linguagem.
Dividimos a amostra em enunciados com números e sem números. Sem números: 25,08% de erro. Com números: 30,37%. A diferença de mais de cinco pontos é a observação mais útil do estudo, porque é exatamente aí que vivem os casos de negócio — números de telefone, valores, datas, números de encomenda. Um sistema que soa bem em prosa pode ser inutilizável numa encomenda.
Um limiar fixo de silêncio é o erro habitual. Na nossa medição, um limiar fixo chega a erro igual a 820 ms; na prosódia, a 560 ms. A taxa de corte correta é 52% — praticamente uma moeda ao ar, e dizemo-lo porque é o ponto a partir do qual começa o treino proposto, não um resultado de que nos orgulhamos.
Inventariámos sete corpus para romeno e anotámos, para cada um, a licença e se permite uso comercial. A conclusão prática: os maiores recursos para romeno são não comerciais, e o caminho limpo continua a ser o VoxPopuli sob CC0 — 89 de horas — mais voz gravada por nós, com cessão de direitos e consentimento biométrico. Na República da Moldova, a Lei 195/2024 trata a voz como dados biométricos e está em vigor desde 23 de agosto de 2026.
Dados e funcionamento
Da exploração à implementação
A língua, o tipo de texto, o público, as condições de audição e, sobretudo, onde o cronómetro começa. A maioria dos valores de latência no mercado não é comparável porque mede segmentos diferentes da mesma conversa.
Nomes próprios, localidades, abreviaturas e, obrigatoriamente, números. A diferença de mais de cinco pontos entre enunciados com números e sem números é a razão pela qual um conjunto de teste feito apenas de prosa não diz nada sobre um caso de negócio.
Para cada corpus: quem o detém, que licença tem, se permite uso comercial e se cobre a obra derivada. Para voz gravada: consentimento biométrico e cessão por escrito.
Na precisão em romeno, perdemos face aos grandes sistemas comerciais. Está escrito no nosso próprio site, na tabela de comparação, onde as linhas de terceiros estão marcadas como declaradas e as nossas como medidas. Uma comparação em que você sai sempre em primeiro lugar é uma comparação em que ninguém deve acreditar.
Não. Não existe demonstração pública, não existe API pública, não existe integração de telefonia, não existe duplex nativo e a clonagem vocal não está no produto. Todos os cinco estão listados como ausentes no nosso próprio roteiro. Se você precisa de um agente vocal que funcione agora, a resposta é Kallina, não Grai; se você precisa de um ficheiro de áudio, é Voice Studio.
Em reconhecimento em romeno, 26,31% de taxa de erro por palavras na janela predefinida de 1120 ms, com intervalo de confiança de 95% entre 24,07 e 28,60; em russo, 9,30%. Protocolo: 200 enunciados por idioma do FLEURS, semente 20260831, descodificação em fluxo. Quão bom é: não é bom. A nossa própria conclusão, escrita na tabela de comparação, é que na precisão em romeno perdemos face aos sistemas comerciais, com um fator de cinco a nove. O romeno é quase três vezes mais difícil de reconhecer do que o russo com a mesma configuração, o que é precisamente o problema que estudamos.
Na decomposição medida, o modelo de linguagem leva 2180 ms do percurso, o reconhecimento 92 ms e a síntese 305 ms. O reconhecimento é praticamente gratuito; a síntese quase o mesmo. Quem quiser uma conversa vocal mais rápida tem de atacar o modelo de linguagem — através de um modelo mais pequeno, através de streaming da resposta ou através do encurtamento das respostas. Aqui também temos de ser honestos connosco: os números de segmento publicados no site não somam o total publicado no mesmo ecrã, e a diferença é de cerca de meio segundo. A decomposição é a que nos inspira confiança; o total agregado tem de ser recalculado antes de ser citado.
Porque em cascata você pode mudar cada componente separadamente e pode manter o reconhecimento e a síntese locais, no processador, sem GPU. O preço é a latência de encadeamento e o facto de o modelo de linguagem, que é a maior parte do atraso, estar fora da máquina. O duplex nativo é uma direção, não algo que tenhamos — está na lista de «ainda não existe».
O roteiro propõe três treinos abaixo de 1.200 dólares no total: reconhecimento para romeno em VoxPopuli CC0, 89 horas, aproximadamente 50 horas de H100, cerca de 500 dólares; um detector de fim de turno para romeno, aproximadamente 2.000 amostras próprias, abaixo de 100 dólares; uma voz própria, 500-800 dólares. A terceira não está bloqueada por dinheiro, mas por dados — e pelo facto de o modelo de síntese em que nos baseávamos ter sido arquivado pelos seus autores. O valor-alvo para o primeiro treino, cerca de 21%, é uma extrapolação das melhorias obtidas em grego e búlgaro, não uma medição.
O método estudado é otimização inversa em pesos congelados, não clonagem a partir de alguns segundos: 6-30 minutos de material por voz, aproximadamente 3.000 passos de otimização, 2,6 GB de memória de pico, sendo o artefacto entregue da ordem dos kilobytes. Mas isso não está no produto, e é importante dizer por que não se trata apenas de uma questão técnica: na República da Moldova a voz é dado biométrico desde 23 de agosto de 2026. Sem consentimento explícito e cessão, a questão não é se é possível, mas que não se faz.
Porque, de outra forma, não faria sentido publicá-los de todo. Uma tabela em que você sai sempre em primeiro lugar é uma tabela de marketing. A nossa marca as linhas de terceiros como declaradas e apenas as nossas como medidas, e a conclusão escrita por baixo diz que perdemos. Ainda assim, é preciso dizer claramente o que ninguém de fora pode fazer: o código que produziu estas medições não é público e não acompanha o site, portanto os números não podem ser reproduzidos por um terceiro hoje. Trate-os como medições internas, não como resultados verificados de forma independente.
Exemplo ilustrativo
Um cenário de utilização, sem dados de cliente nem resultados comerciais atribuídos.
Um agente vocal em romeno desenrasca bem uma conversa de abertura e falha precisamente quando o cliente dita um número de telefone ou uma quantia.
Dividimos a amostra de 200 enunciados FLEURS em duas: 163 sem dígitos e 37 com dígitos, depois medimos separadamente.
25,08% taxa de erro sem números, 30,37% com números — mais de cinco pontos de diferença, e, na transcrição bruta, sem normalização, o fosso aumenta para mais de onze pontos. Não é uma impressão: é a parte dos dados onde o reconhecimento falha, e é exatamente a parte de que depende um caso de negócio.
Ce este necesar:Un set de test care conține efectiv partea grea. Un set format din proză curată nu ar fi arătat niciodată această diferență, iar sistemul ar fi părut mai bun decât e.
Possibilidades de colaboração
Projetos de transcrição e geração vocal em materiais para os quais existem direitos de utilização e uma finalidade documentada.
Definimos um piloto em torno de um processo real: utilizadores, dados, integrações, custos e critérios de aceitação. A expansão segue após a avaliação do resultado.
Estabelecemos os requisitos de acessibilidade, alojamento, proteção de dados e interoperabilidade. Qualquer ligação a serviços AGE ou STISC requer a validação da elegibilidade, do acesso e das aprovações.
Estes são cenários de adaptação, não declarações sobre contratos ou parcerias existentes. As funções propostas confirmam-se no âmbito de trabalho do projeto.
Fale sobre um pilotoConstruímos agentes que atendem e fazem chamadas, usam a informação do negócio e trabalham com os seus sistemas.
PlatformăAcesso API a modelos de IA através de uma interface comum.
PlatformăUm estúdio para gerar, ouvir e descarregar materiais de voz com modelos text-to-speech.
Instrument specializatConte-nos o seu processo. Em conjunto decidimos o que vale a pena construir, o que podemos ligar e como verificamos o resultado.