Datos y lengua
La preparación y evaluación del material vocal utilizado con los derechos necesarios.
Investigación de voz Cercetare & dezvoltare
Grai es nuestra línea de investigación para síntesis vocal y modelos adaptados a las lenguas utilizadas aquí. Trabajamos en la pronunciación, la expresividad y el vínculo entre el modelo de voz y las aplicaciones conversacionales.
Grai
La preparación y evaluación del material vocal utilizado con los derechos necesarios.
Experimentos para la pronunciación, el ritmo y la expresividad.
Evaluación del modelo en escenarios conversacionales y acceso por API.
Atención a la pronunciación y al ritmo del habla, incluso en contextos locales.
Investigación y evaluación para rumano y ruso.
Kallina es la plataforma de agentes; Grai es una línea distinta de desarrollo del modelo vocal.
Presentamos un proyecto en investigación, con resultados que se evalúan de forma iterativa. La disponibilidad de un modelo para producción se confirma por separado.
Grai en detalle
Grai es nuestro proyecto de investigación sobre voz en rumano. No es un producto, no se puede comprar y no tiene un botón para probarlo. Es un intento de entender por qué el rumano está mal servido por los sistemas de voz existentes y cuánto costaría servirlo mejor.
La arquitectura que estudiamos es en cascada, no dúplex nativa: reconocimiento → modelo de lenguaje → síntesis, tres componentes separados. El reconocimiento y la síntesis se ejecutan localmente, en el procesador; el modelo de lenguaje es intercambiable y está fuera de la máquina, detrás de un gateway compatible con OpenAI. La elección es deliberada y tiene un coste que medimos.
La distinción que importa: Grai explora la voz. Kallina organiza la conversación y las acciones. Voice Studio produce archivos de audio con proveedores integrados. Son tres cosas distintas, y la única de ellas que es investigación es Grai.
El protocolo está fijado y declarado: 200 enunciados por idioma del conjunto de prueba FLEURS, elegidos uniformemente al azar con la semilla 20260831, decodificación en flujo con conciencia de caché — no decodificación offline sobre el archivo completo, que es más fácil y da cifras más bonitas. El resultado propio en la ventana predeterminada de 1120 ms: 26,31% de tasa de error de palabras en rumano, 9,30% en ruso.
Medimos cada segmento con dos extremos observados, no calculados. En el desglose publicado, el modelo de lenguaje es, con mucho, la mayor parte: 2180 ms, frente a 92 ms de reconocimiento y 305 ms de síntesis. La conclusión útil es que, para una conversación vocal, la velocidad no se gana optimizando el reconocimiento — ya es casi gratis. Se gana en el modelo de lenguaje.
Dividimos la muestra en enunciados con cifras y sin cifras. Sin cifras: 25,08% de error. Con cifras: 30,37%. La diferencia de más de cinco puntos es la observación más útil del estudio, porque exactamente ahí viven los casos de negocio — números de teléfono, importes, fechas, números de pedido. Un sistema que suena bien en prosa puede ser inutilizable en un pedido.
Un umbral fijo de silencio es el error habitual. En la medición propia, un umbral fijo llega a un error igual en 820 ms; en prosodia, a 560 ms. La tasa de corte correcta es 52% — prácticamente una moneda al aire, y lo decimos porque ese es el punto desde el que empieza el entrenamiento propuesto, no un resultado del que presumimos.
He inventariado siete corpus para rumano y he anotado para cada uno la licencia y si permite uso comercial. La conclusión práctica: los recursos más grandes para rumano son no comerciales, y el camino limpio sigue siendo VoxPopuli bajo CC0 — 89 de horas — más voz grabada por nosotros, con cesión de derechos y consentimiento biométrico. En la República de Moldavia, la Ley 195/2024 trata la voz como datos biométricos y está en vigor desde el 23 de agosto de 2026.
Datos y funcionamiento
De la exploración a la implementación
El idioma, el tipo de texto, el público, las condiciones de escucha y, sobre todo, dónde arranca el cronómetro. La mayoría de las cifras de latencia del mercado no son comparables porque miden segmentos distintos de la misma conversación.
Nombres propios, localidades, abreviaturas y, obligatoriamente, números. La diferencia de más de cinco puntos entre las pronunciaciones con cifras y las que no las llevan es la razón por la que un conjunto de prueba formado solo por prosa no dice nada sobre un caso de negocio.
Para cada corpus: quién lo posee, qué licencia lleva, si permite uso comercial y si cubre la obra derivada. Para voz grabada: consentimiento biométrico y cesión por escrito.
En precisión en rumano perdemos frente a los grandes sistemas comerciales. Está escrito en nuestro propio sitio, en la tabla de comparación, donde las filas de terceros están marcadas como declaradas y las nuestras como medidas. Una comparación en la que siempre sales primero es una comparación que nadie debería creer.
No. No existe demostración pública, no existe API pública, no existe integración de telefonía, no existe dúplex nativo y la clonación vocal no está en el producto. Las cinco figuran como ausentes en nuestra propia hoja de ruta. Si necesitas un agente vocal que funcione ahora, la respuesta es Kallina, no Grai; si necesitas un archivo de audio, es Voice Studio.
En reconocimiento en rumano, 26,31% de tasa de error de palabras en la ventana predeterminada de 1120 ms, con intervalo de confianza del 95% entre 24,07 y 28,60; en ruso, 9,30%. Protocolo: 200 enunciados por idioma de FLEURS, semilla 20260831, decodificación en flujo. Qué tan bueno es: no es bueno. Nuestra propia conclusión, escrita en la tabla de comparación, es que en precisión en rumano perdemos frente a los sistemas comerciales, con un factor de cinco a nueve. El rumano es casi tres veces más difícil de reconocer que el ruso con la misma configuración, que es justamente el problema que estudiamos.
En la descomposición medida, el modelo de lenguaje toma 2180 ms del recorrido, el reconocimiento 92 ms y la síntesis 305 ms. El reconocimiento es prácticamente gratis; la síntesis casi igual. Quien quiera una conversación vocal más rápida debe atacar el modelo de lenguaje — con un modelo más pequeño, con streaming de la respuesta o acortando las respuestas. Aquí también debemos ser honestos con nosotros: las cifras de segmento publicadas en el sitio no suman el total publicado en la misma pantalla, y la diferencia es de aproximadamente medio segundo. La descomposición es la que nos inspira confianza; el total agregado debe recalcularse antes de citarse.
Porque en cascada puedes cambiar cada componente por separado y puedes mantener el reconocimiento y la síntesis localmente, en el procesador, sin GPU. El precio es la latencia de encadenamiento y el hecho de que el modelo de lenguaje, que es la mayor parte del retraso, está fuera de la máquina. El dúplex nativo es una dirección, no algo que tengamos — está en la lista de «no existe todavía».
La hoja de ruta propone tres entrenamientos por menos de 1.200 dólares en total: reconocimiento para rumano en VoxPopuli CC0, 89 horas, aproximadamente 50 horas de H100, en torno a 500 dólares; un detector de fin de turno para rumano, aproximadamente 2.000 muestras propias, menos de 100 dólares; una voz propia, 500-800 dólares. El tercero no está bloqueado por dinero, sino por datos — y por el hecho de que el modelo de síntesis en el que nos basábamos fue archivado por sus autores. La cifra objetivo para el primer entrenamiento, en torno al 21%, es una extrapolación de las mejoras obtenidas en griego y búlgaro, no una medición.
El método estudiado es optimización inversa sobre pesos congelados, no clonación desde unos segundos: 6-30 minutos de material por voz, aproximadamente 3.000 pasos de optimización, 2,6 GB de memoria pico, siendo el artefacto entregado del orden de los kilobytes. Pero no está en el producto, y es importante decir por qué no es solo una cuestión técnica: en la República de Moldavia la voz es dato biométrico desde el 23 de agosto de 2026. Sin consentimiento explícito y cesión, la cuestión no es si se puede, sino que no se hace.
Porque si no, no tendría sentido publicarlas en absoluto. Una tabla en la que siempre sales primero es una tabla de marketing. La nuestra marca las filas de terceros como declaradas y solo las nuestras como medidas, y la conclusión escrita debajo dice que perdemos. Sin embargo, hay que decir claramente también lo que nadie de fuera puede hacer: el código que produjo estas mediciones no es público y no acompaña al sitio, así que las cifras no pueden ser reproducidas por un tercero hoy. Trátalas como mediciones internas, no como resultados verificados de forma independiente.
Ejemplo ilustrativo
Un escenario de uso, sin datos de cliente ni resultados comerciales atribuidos.
Un agente vocal en rumano maneja bien una conversación de apertura y se equivoca justo cuando el cliente dicta un número de teléfono o una suma.
Dividimos la muestra de 200 enunciados FLEURS en dos: 163 sin cifras y 37 con cifras, luego medimos por separado.
25,08% tasa de error sin cifras, 30,37% con cifras — más de cinco puntos de diferencia, y en la transcripción bruta, sin normalización, la brecha crece a más de once puntos. No es una impresión: es la parte de los datos donde el reconocimiento cede, y es exactamente la parte de la que depende un caso de negocio.
Ce este necesar:Un set de test care conține efectiv partea grea. Un set format din proză curată nu ar fi arătat niciodată această diferență, iar sistemul ar fi părut mai bun decât e.
Posibilidades de colaboración
Proyectos de transcripción y generación de voz sobre materiales para los que existe un derecho de uso y un propósito documentado.
Definimos un piloto en torno a un proceso real: usuarios, datos, integraciones, costes y criterios de aceptación. La ampliación sigue después de evaluar el resultado.
Establecemos los requisitos de accesibilidad, alojamiento, protección de datos e interoperabilidad. Cualquier conexión con servicios AGE o STISC requiere la validación de la elegibilidad, el acceso y las aprobaciones.
Estos son escenarios de adaptación, no declaraciones sobre contratos o colaboraciones existentes. Las funciones propuestas se confirman en el ámbito de trabajo del proyecto.
Habla de un pilotoConstruimos agentes que atienden y lanzan llamadas, usan la información del negocio y trabajan con tus sistemas.
PlatformăAcceso API a modelos de IA a través de una interfaz común.
PlatformăUn estudio para generar, escuchar y descargar materiales de voz con modelos text-to-speech.
Instrument specializatCuéntanos tu proceso. Juntos decidimos qué merece la pena construir, qué podemos conectar y cómo verificamos el resultado.