Saltar al contenido
megapromotingVamos a hablar
Productos Grai

Investigación de voz Cercetare & dezvoltare

Una voz construida para la forma en que hablamos.

Grai es nuestra línea de investigación para síntesis vocal y modelos adaptados a las lenguas utilizadas aquí. Trabajamos en la pronunciación, la expresividad y el vínculo entre el modelo de voz y las aplicaciones conversacionales.

  1. 1Date autorizate
  2. 2Model și evaluare
  3. 3Sinteză vocală
Schemă explicativă ·Grai

Grai

De la información al trabajo hecho.

01

Datos y lengua

La preparación y evaluación del material vocal utilizado con los derechos necesarios.

02

Model

Experimentos para la pronunciación, el ritmo y la expresividad.

03

Aplicație

Evaluación del modelo en escenarios conversacionales y acceso por API.

Dónde resulta útil.

Română

Atención a la pronunciación y al ritmo del habla, incluso en contextos locales.

Experimentos multilingües

Investigación y evaluación para rumano y ruso.

Agentes de voz

Kallina es la plataforma de agentes; Grai es una línea distinta de desarrollo del modelo vocal.

Presentamos un proyecto en investigación, con resultados que se evalúan de forma iterativa. La disponibilidad de un modelo para producción se confirma por separado.

Grai en detalle

Qué puedes hacer con este proyecto.

Grai es nuestro proyecto de investigación sobre voz en rumano. No es un producto, no se puede comprar y no tiene un botón para probarlo. Es un intento de entender por qué el rumano está mal servido por los sistemas de voz existentes y cuánto costaría servirlo mejor.

La arquitectura que estudiamos es en cascada, no dúplex nativa: reconocimiento → modelo de lenguaje → síntesis, tres componentes separados. El reconocimiento y la síntesis se ejecutan localmente, en el procesador; el modelo de lenguaje es intercambiable y está fuera de la máquina, detrás de un gateway compatible con OpenAI. La elección es deliberada y tiene un coste que medimos.

La distinción que importa: Grai explora la voz. Kallina organiza la conversación y las acciones. Voice Studio produce archivos de audio con proveedores integrados. Son tres cosas distintas, y la única de ellas que es investigación es Grai.

01

Qué estudiamos: el reconocimiento en rumano, medido en FLEURS

El protocolo está fijado y declarado: 200 enunciados por idioma del conjunto de prueba FLEURS, elegidos uniformemente al azar con la semilla 20260831, decodificación en flujo con conciencia de caché — no decodificación offline sobre el archivo completo, que es más fácil y da cifras más bonitas. El resultado propio en la ventana predeterminada de 1120 ms: 26,31% de tasa de error de palabras en rumano, 9,30% en ruso.

02

Dónde se va el tiempo en una conversación

Medimos cada segmento con dos extremos observados, no calculados. En el desglose publicado, el modelo de lenguaje es, con mucho, la mayor parte: 2180 ms, frente a 92 ms de reconocimiento y 305 ms de síntesis. La conclusión útil es que, para una conversación vocal, la velocidad no se gana optimizando el reconocimiento — ya es casi gratis. Se gana en el modelo de lenguaje.

03

Las cifras se rompen exactamente donde también se rompe la conversación real

Dividimos la muestra en enunciados con cifras y sin cifras. Sin cifras: 25,08% de error. Con cifras: 30,37%. La diferencia de más de cinco puntos es la observación más útil del estudio, porque exactamente ahí viven los casos de negocio — números de teléfono, importes, fechas, números de pedido. Un sistema que suena bien en prosa puede ser inutilizable en un pedido.

04

La detección del fin de turno, que es el problema real de la interrupción

Un umbral fijo de silencio es el error habitual. En la medición propia, un umbral fijo llega a un error igual en 820 ms; en prosodia, a 560 ms. La tasa de corte correcta es 52% — prácticamente una moneda al aire, y lo decimos porque ese es el punto desde el que empieza el entrenamiento propuesto, no un resultado del que presumimos.

05

Inventario de datos, con sus licencias

He inventariado siete corpus para rumano y he anotado para cada uno la licencia y si permite uso comercial. La conclusión práctica: los recursos más grandes para rumano son no comerciales, y el camino limpio sigue siendo VoxPopuli bajo CC0 — 89 de horas — más voz grabada por nosotros, con cesión de derechos y consentimiento biométrico. En la República de Moldavia, la Ley 195/2024 trata la voz como datos biométricos y está en vigor desde el 23 de agosto de 2026.

Datos y funcionamiento

Qué entra en el sistema. Qué hay que verificar.

La voz es un dato biométrico
En la República de Moldavia, la Ley 195/2024 está en vigor desde el 23 de agosto de 2026 y encuadra la voz como dato biométrico. En la práctica: una grabación pública no autoriza el uso de la identidad vocal de nadie. Cualquier proyecto que clone una voz requiere consentimiento explícito y cesión, no solo acceso al archivo.
Las licencias de los corpus deciden lo que se puede construir
De los siete corpus inventariados para rumano, dos de los más grandes son explícitamente no comerciales, y uno está cerrado detrás de una puerta de acceso. Un modelo entrenado con datos no comerciales no puede acabar en un producto, por muy bien que suene. Por eso el inventario de licencias se hace antes del entrenamiento, no después.
El componente de síntesis en el que se apoya todo está al final de su vida útil
El modelo de síntesis usado en cascada fue archivado por sus autores: sin desarrollo y sin soporte oficial, y su herramienta para construir voces se cerró el 31 de agosto de 2026. Los pesos siguen disponibles y el modelo sigue funcionando localmente, pero ya no recibe nada. Eso mueve la síntesis propia de «quizá más tarde» a ruta crítica, y es un cambio de plan que preferimos decir antes que ocultar.
El conjunto de evaluación no se mezcla con el de entrenamiento
Es la regla elemental y la más incumplida. Una comparación solo tiene sentido si conserva la versión del modelo, el texto, la semilla y el criterio. Nuestro estudio señala que nosotros mismos cometimos un error de medición en nuestro propio sitio: una cifra de latencia de 455 ms empezaba el cronómetro después del reconocimiento, así que medía otra cosa distinta de la que sugería; la cifra real era aproximadamente cinco veces mayor.

De la exploración a la implementación

Cómo preparamos un proyecto con Grai.

01

Establecemos qué se mide, antes de medir

El idioma, el tipo de texto, el público, las condiciones de escucha y, sobre todo, dónde arranca el cronómetro. La mayoría de las cifras de latencia del mercado no son comparables porque miden segmentos distintos de la misma conversación.

02

Construimos un conjunto de prueba que contiene la parte difícil

Nombres propios, localidades, abreviaturas y, obligatoriamente, números. La diferencia de más de cinco puntos entre las pronunciaciones con cifras y las que no las llevan es la razón por la que un conjunto de prueba formado solo por prosa no dice nada sobre un caso de negocio.

03

Verificamos la licencia antes de cualquier entrenamiento

Para cada corpus: quién lo posee, qué licencia lleva, si permite uso comercial y si cubre la obra derivada. Para voz grabada: consentimiento biométrico y cesión por escrito.

04

Publicamos también el resultado que no nos conviene

En precisión en rumano perdemos frente a los grandes sistemas comerciales. Está escrito en nuestro propio sitio, en la tabla de comparación, donde las filas de terceros están marcadas como declaradas y las nuestras como medidas. Una comparación en la que siempre sales primero es una comparación que nadie debería creer.

Preguntas que vale la pena aclarar.

¿Puedo usar Grai en un proyecto hoy?

No. No existe demostración pública, no existe API pública, no existe integración de telefonía, no existe dúplex nativo y la clonación vocal no está en el producto. Las cinco figuran como ausentes en nuestra propia hoja de ruta. Si necesitas un agente vocal que funcione ahora, la respuesta es Kallina, no Grai; si necesitas un archivo de audio, es Voice Studio.

¿Qué se midió efectivamente y qué tan bueno es el resultado?

En reconocimiento en rumano, 26,31% de tasa de error de palabras en la ventana predeterminada de 1120 ms, con intervalo de confianza del 95% entre 24,07 y 28,60; en ruso, 9,30%. Protocolo: 200 enunciados por idioma de FLEURS, semilla 20260831, decodificación en flujo. Qué tan bueno es: no es bueno. Nuestra propia conclusión, escrita en la tabla de comparación, es que en precisión en rumano perdemos frente a los sistemas comerciales, con un factor de cinco a nueve. El rumano es casi tres veces más difícil de reconocer que el ruso con la misma configuración, que es justamente el problema que estudiamos.

¿Por qué se pierde tiempo y dónde se ganaría?

En la descomposición medida, el modelo de lenguaje toma 2180 ms del recorrido, el reconocimiento 92 ms y la síntesis 305 ms. El reconocimiento es prácticamente gratis; la síntesis casi igual. Quien quiera una conversación vocal más rápida debe atacar el modelo de lenguaje — con un modelo más pequeño, con streaming de la respuesta o acortando las respuestas. Aquí también debemos ser honestos con nosotros: las cifras de segmento publicadas en el sitio no suman el total publicado en la misma pantalla, y la diferencia es de aproximadamente medio segundo. La descomposición es la que nos inspira confianza; el total agregado debe recalcularse antes de citarse.

¿Por qué una arquitectura en cascada y no dúplex nativo?

Porque en cascada puedes cambiar cada componente por separado y puedes mantener el reconocimiento y la síntesis localmente, en el procesador, sin GPU. El precio es la latencia de encadenamiento y el hecho de que el modelo de lenguaje, que es la mayor parte del retraso, está fuera de la máquina. El dúplex nativo es una dirección, no algo que tengamos — está en la lista de «no existe todavía».

¿Cuánto costaría que fuera mejor?

La hoja de ruta propone tres entrenamientos por menos de 1.200 dólares en total: reconocimiento para rumano en VoxPopuli CC0, 89 horas, aproximadamente 50 horas de H100, en torno a 500 dólares; un detector de fin de turno para rumano, aproximadamente 2.000 muestras propias, menos de 100 dólares; una voz propia, 500-800 dólares. El tercero no está bloqueado por dinero, sino por datos — y por el hecho de que el modelo de síntesis en el que nos basábamos fue archivado por sus autores. La cifra objetivo para el primer entrenamiento, en torno al 21%, es una extrapolación de las mejoras obtenidas en griego y búlgaro, no una medición.

¿Puede reproducir la voz de una persona?

El método estudiado es optimización inversa sobre pesos congelados, no clonación desde unos segundos: 6-30 minutos de material por voz, aproximadamente 3.000 pasos de optimización, 2,6 GB de memoria pico, siendo el artefacto entregado del orden de los kilobytes. Pero no está en el producto, y es importante decir por qué no es solo una cuestión técnica: en la República de Moldavia la voz es dato biométrico desde el 23 de agosto de 2026. Sin consentimiento explícito y cesión, la cuestión no es si se puede, sino que no se hace.

¿Por qué publican cifras que los ponen en mala luz?

Porque si no, no tendría sentido publicarlas en absoluto. Una tabla en la que siempre sales primero es una tabla de marketing. La nuestra marca las filas de terceros como declaradas y solo las nuestras como medidas, y la conclusión escrita debajo dice que perdemos. Sin embargo, hay que decir claramente también lo que nadie de fuera puede hacer: el código que produjo estas mediciones no es público y no acompaña al sitio, así que las cifras no pueden ser reproducidas por un tercero hoy. Trátalas como mediciones internas, no como resultados verificados de forma independiente.

Ejemplo ilustrativo

Por qué un agente vocal tropieza exactamente con el número de teléfono

Un escenario de uso, sin datos de cliente ni resultados comerciales atribuidos.

Situación inicial

Un agente vocal en rumano maneja bien una conversación de apertura y se equivoca justo cuando el cliente dicta un número de teléfono o una suma.

Cómo funciona

Dividimos la muestra de 200 enunciados FLEURS en dos: 163 sin cifras y 37 con cifras, luego medimos por separado.

Rezultatul

25,08% tasa de error sin cifras, 30,37% con cifras — más de cinco puntos de diferencia, y en la transcripción bruta, sin normalización, la brecha crece a más de once puntos. No es una impresión: es la parte de los datos donde el reconocimiento cede, y es exactamente la parte de la que depende un caso de negocio.

Ce este necesar:Un set de test care conține efectiv partea grea. Un set format din proză curată nu ar fi arătat niciodată această diferență, iar sistemul ar fi părut mai bun decât e.

Posibilidades de colaboración

Grai, en el contexto de tu organización.

Procesamiento del contenido de audio

Proyectos de transcripción y generación de voz sobre materiales para los que existe un derecho de uso y un propósito documentado.

Empresas privadas

Definimos un piloto en torno a un proceso real: usuarios, datos, integraciones, costes y criterios de aceptación. La ampliación sigue después de evaluar el resultado.

Instituciones y empresas públicas

Establecemos los requisitos de accesibilidad, alojamiento, protección de datos e interoperabilidad. Cualquier conexión con servicios AGE o STISC requiere la validación de la elegibilidad, el acceso y las aprobaciones.

Estos son escenarios de adaptación, no declaraciones sobre contratos o colaboraciones existentes. Las funciones propuestas se confirman en el ámbito de trabajo del proyecto.

Habla de un piloto

Parte de un ecosistema.

¿Qué te gustaría que funcionara mejor?

Cuéntanos tu proceso. Juntos decidimos qué merece la pena construir, qué podemos conectar y cómo verificamos el resultado.

Vamos a hablar