Preparas el texto
Escribes el material y eliges la voz autorizada para su uso.
Producción de voz Instrument specializat
Un estudio para generar, escuchar y descargar materiales vocales mediante modelos text-to-speech. La interfaz reúne la elección de la voz y los ajustes útiles para la producción.
Voice Studio
Escribes el material y eliges la voz autorizada para su uso.
Ajustas los parámetros y las opciones disponibles del modelo vocal.
Escuchas, corriges y descargas el material para el proyecto.
Materiales explicativos, presentaciones y contenido de audio.
Un flujo de generación y revisión para los equipos de contenido.
La comparación de las interpretaciones de un texto antes de usarlo.
La herramienta utiliza modelos de voz de los proveedores integrados. Se aplican los costes, los derechos sobre las voces y las reglas del proveedor.
Voice Studio en detalle
Voice Studio es la cadena de texto a archivo de audio: escribes el texto, eliges la voz, añades marcas de emoción y pausas, ajustas el modelo, escuchas, corriges y descargas. El proveedor es ElevenLabs — lo decimos por su nombre, porque eso determina qué voces se pueden usar, cuánto cuesta y qué puedes hacer con el resultado.
La parte que no se ve y que es, de hecho, el motivo por el que existe la herramienta: la clave de API nunca llega al navegador. La interfaz solo envía el texto a una función propia del servidor, y esa función tiene la clave y habla con ElevenLabs. Sin esta capa, cualquier página que genere voz expone su clave a cualquiera que abra la consola del navegador.
No es Grai. Grai es investigación de modelo de voz, sin producto. Voice Studio es producción con proveedor integrado, disponible hoy. Los dos no comparten ningún código.
Eleven v3 para expresividad y marcas de emoción, Multilingual v2 para estabilidad, Turbo v2.5 para coste, Flash v2.5 para latencia mínima. No son cuatro variantes de lo mismo: v3 acepta marcas que las demás ignoran, y Flash sacrifica el matiz por la velocidad.
En Eleven v3 puedes insertar en el texto 14 estados de emoción (desde [excited] y [whispers] hasta [sarcastic] y [tired]), 9 marcas no verbales y de pausa ([laughs], [sighs], [clears throat], [pause], [breathes]) y 7 de entrega ([rushed], [drawn out], [singing], [muttering], [quietly]). Se insertan en la posición del cursor, porque el lugar importa tanto como la marca.
Estabilidad, similitud con la voz de origen, exageración de estilo, velocidad entre 0,7 y 1,2, además del impulso del hablante. En v3 la estabilidad no es un cursor continuo, sino tres niveles — Creativ, Natural, Robust — porque el modelo se comporta de forma discreta, no continua, y un cursor fino sugeriría un control que no existe.
MP3 a 44,1 kHz 128 o 192 kbps, MP3 22 kHz 32 kbps para archivos pequeños, PCM 44,1 kHz para WAV bruto que entra en una edición, y μ-law 8 kHz — el formato de telefonía, si el material llega a un IVR o a una centralita.
Rumano, ruso, inglés, ucraniano, francés, italiano, español, alemán — o dejado en automático. Forzar el idioma importa en textos mixtos, donde la detección automática elige mal precisamente en los nombres propios.
Datos y funcionamiento
De la exploración a la implementación
Un anuncio de radio, una narración de presentación y un mensaje de IVR tienen requisitos distintos de formato, ritmo y longitud. El formato de exportación se elige desde aquí, no al final.
Qué voz se usa y sobre la base de qué acuerdo. Si hace falta una voz nueva, la clonación requiere muestras y el consentimiento de la persona, no solo un archivo de audio.
La mayoría de los problemas de pronunciación se resuelven reescribiendo el texto, no moviendo los cursores: las abreviaturas se desarrollan, los números se escriben con letras donde hay ambigüedad, y los nombres propios se prueban por separado antes de ponerlos en la frase.
Exportación verificada, más una nota sobre la voz usada y los límites de uso — para que el material pueda reutilizarse dentro de seis meses sin reabrir la discusión sobre derechos.
ElevenLabs. Nuestra función de servidor llama directamente a api.elevenlabs.io, el endpoint de síntesis. No es un proveedor abstracto: de él dependen las voces disponibles, el coste, los formatos de salida y las reglas de uso del resultado.
Las fijadas en la interfaz, que son voces clonadas a partir de muestras proporcionadas — no voces de biblioteca. Se crea una voz nueva cargando muestras mediante la interfaz de clonación de ElevenLabs, con su límite de 11 MB por archivo; por encima de eso recomprimimos automáticamente a mono 22 kHz 64 kbps. La parte que no es técnica es la que importa: clonar la voz de una persona requiere el consentimiento de esa persona. En la República de Moldova la voz es un dato biométrico desde el 23 de agosto de 2026, así que una grabación pública no autoriza nada.
5.000 caracteres por solicitud, límite impuesto por nosotros, no por el proveedor. El motivo es el coste: una solicitud errónea con un texto cien veces más largo es una factura, no un error. La función tiene 60 segundos de ejecución, lo que es suficiente para un bloque de este tamaño.
MP3 a 44,1 kHz 128 kbps (predeterminado) o 192 kbps, MP3 22 kHz 32 kbps para un tamaño pequeño, PCM 44,1 kHz para WAV bruto, y μ-law 8 kHz para telefonía. El último es el que la gente olvida y luego descubre que el material suena mal en la central telefónica.
No. La suscripción de ElevenLabs te da derecho de uso comercial sobre el material, pero su política de uso prohíbe explícitamente usar la salida para entrenar, probar o desarrollar un sistema competidor. Un archivo entregado a un cliente está bien; el mismo archivo como datos de entrenamiento para un modelo propio no. Es una distinción que se paga si se ignora, y es el motivo por el que Grai no se entrena con nada salido de aquí.
No. El historial vive en la memoria de la pestaña, como mucho 12 generaciones, y desaparece al recargar. No hay cuenta, base de datos ni almacenamiento en el servidor; la respuesta de audio se marca explícitamente como no cacheable. Si quieres el archivo, lo descargas en ese momento.
No hoy. El despliegue está detrás de la autenticación de Vercel y, opcionalmente, de un token adicional de acceso solicitado como encabezado en cada petición. Es una herramienta de trabajo interna para la producción de materiales, no un servicio con registro. Lo que entregamos es el material de audio, no el acceso al panel.
Ejemplo ilustrativo
Un escenario de uso, sin datos de cliente ni resultados comerciales atribuidos.
El texto de una presentación de producto, que debe leerse en rumano y ruso por la misma voz, con la misma energía.
Se elige Eleven v3 por su expresividad y se fuerza el idioma explícitamente en cada variante, en lugar de dejarlo a la detección automática — en textos con nombres propios la detección elige mal justo donde más se nota. La estabilidad se pone en Natural; las pausas se marcan en el texto con [pause] y [short pause] en la posición exacta, no al final de la frase. Se escucha y se corrige el texto, no los deslizadores.
Dos archivos MP3 a 44,1 kHz, la misma voz, la misma energía, descargados en el momento de la generación. Si el material va a entrar en un montaje, se usa PCM en lugar de MP3, para que no se comprima dos veces.
Ce este necesar:Vocea trebuie să fie una pentru care există acordul persoanei clonate. Textul nu trebuie să conțină informație care nu are voie să ajungă la un furnizor extern.
Posibilidades de colaboración
Proyectos de transcripción y generación de voz sobre materiales para los que existe un derecho de uso y un propósito documentado.
Definimos un piloto en torno a un proceso real: usuarios, datos, integraciones, costes y criterios de aceptación. La ampliación sigue después de evaluar el resultado.
Establecemos los requisitos de accesibilidad, alojamiento, protección de datos e interoperabilidad. Cualquier conexión con servicios AGE o STISC requiere la validación de la elegibilidad, el acceso y las aprobaciones.
Estos son escenarios de adaptación, no declaraciones sobre contratos o colaboraciones existentes. Las funciones propuestas se confirman en el ámbito de trabajo del proyecto.
Habla de un pilotoConstruimos agentes que atienden y lanzan llamadas, usan la información del negocio y trabajan con tus sistemas.
PlatformăGrai es nuestra línea de investigación en síntesis de voz y modelos adaptados a las lenguas que se hablan aquí.
Cercetare & dezvoltareUna herramienta para captura, transcripción y organización de anuncios de radio.
Instrument specializatCuéntanos tu proceso. Juntos decidimos qué merece la pena construir, qué podemos conectar y cómo verificamos el resultado.