Saltar al contenido
megapromotingVamos a hablar
Productos Voice Studio

Producción de voz Instrument specializat

Del texto, una voz para tu material.

Un estudio para generar, escuchar y descargar materiales vocales mediante modelos text-to-speech. La interfaz reúne la elección de la voz y los ajustes útiles para la producción.

  1. 1Text și voce
  2. 2Generare audio
  3. 3Ascultare și export
Schemă explicativă ·Voice Studio

Voice Studio

De la información al trabajo hecho.

01

Preparas el texto

Escribes el material y eliges la voz autorizada para su uso.

02

Reglezi

Ajustas los parámetros y las opciones disponibles del modelo vocal.

03

Revizuiești

Escuchas, corriges y descargas el material para el proyecto.

Dónde resulta útil.

Narațiune

Materiales explicativos, presentaciones y contenido de audio.

Producție

Un flujo de generación y revisión para los equipos de contenido.

Experimentare

La comparación de las interpretaciones de un texto antes de usarlo.

La herramienta utiliza modelos de voz de los proveedores integrados. Se aplican los costes, los derechos sobre las voces y las reglas del proveedor.

Voice Studio en detalle

Qué puedes hacer con este proyecto.

Voice Studio es la cadena de texto a archivo de audio: escribes el texto, eliges la voz, añades marcas de emoción y pausas, ajustas el modelo, escuchas, corriges y descargas. El proveedor es ElevenLabs — lo decimos por su nombre, porque eso determina qué voces se pueden usar, cuánto cuesta y qué puedes hacer con el resultado.

La parte que no se ve y que es, de hecho, el motivo por el que existe la herramienta: la clave de API nunca llega al navegador. La interfaz solo envía el texto a una función propia del servidor, y esa función tiene la clave y habla con ElevenLabs. Sin esta capa, cualquier página que genere voz expone su clave a cualquiera que abra la consola del navegador.

No es Grai. Grai es investigación de modelo de voz, sin producto. Voice Studio es producción con proveedor integrado, disponible hoy. Los dos no comparten ningún código.

01

Cuatro modelos, elegidos por compromisos distintos

Eleven v3 para expresividad y marcas de emoción, Multilingual v2 para estabilidad, Turbo v2.5 para coste, Flash v2.5 para latencia mínima. No son cuatro variantes de lo mismo: v3 acepta marcas que las demás ignoran, y Flash sacrifica el matiz por la velocidad.

02

Marcas de interpretación, no solo texto

En Eleven v3 puedes insertar en el texto 14 estados de emoción (desde [excited] y [whispers] hasta [sarcastic] y [tired]), 9 marcas no verbales y de pausa ([laughs], [sighs], [clears throat], [pause], [breathes]) y 7 de entrega ([rushed], [drawn out], [singing], [muttering], [quietly]). Se insertan en la posición del cursor, porque el lugar importa tanto como la marca.

03

Ajustes que se ven en el resultado

Estabilidad, similitud con la voz de origen, exageración de estilo, velocidad entre 0,7 y 1,2, además del impulso del hablante. En v3 la estabilidad no es un cursor continuo, sino tres niveles — Creativ, Natural, Robust — porque el modelo se comporta de forma discreta, no continua, y un cursor fino sugeriría un control que no existe.

04

Cinco formatos de exportación, incluido uno para telefonía

MP3 a 44,1 kHz 128 o 192 kbps, MP3 22 kHz 32 kbps para archivos pequeños, PCM 44,1 kHz para WAV bruto que entra en una edición, y μ-law 8 kHz — el formato de telefonía, si el material llega a un IVR o a una centralita.

05

Ocho idiomas forzables, o detección desde el texto

Rumano, ruso, inglés, ucraniano, francés, italiano, español, alemán — o dejado en automático. Forzar el idioma importa en textos mixtos, donde la detección automática elige mal precisamente en los nombres propios.

Datos y funcionamiento

Qué entra en el sistema. Qué hay que verificar.

La clave está en un solo lugar
En una variable de entorno cifrada en el servidor, nunca en el código, en git ni en el frontend. El navegador llama solo a nuestra propia función. La clave recibe de ElevenLabs solo permiso de síntesis, no acceso a toda la cuenta, además de un límite mensual de caracteres — porque la verdadera protección de una clave no es su secreto, sino cuánto daño puede hacer si se filtra.
El texto llega al proveedor
Esa es la implicación directa de usar un proveedor externo: el texto que das para sintetizar se envía a ElevenLabs. Un texto con datos personales, precios no publicados o información del cliente no se envía sin autorización. No es una formalidad — es la única decisión de cumplimiento que la herramienta traslada al usuario.
Las voces están clonadas, así que hace falta consentimiento
Las voces fijadas en la interfaz no son voces de biblioteca, sino voces clonadas a partir de muestras de personas reales, creadas mediante la interfaz de clonación de ElevenLabs. Eso significa que no es una cuestión de licencia de producto, sino del acuerdo de la persona. En la República de Moldavia, la Ley 195/2024 trata la voz como dato biométrico a partir del 23 de agosto de 2026.
No se guarda nada
Las generaciones permanecen en la memoria de la pestaña del navegador, como mucho las últimas 12, y desaparecen al recargar. No existe base de datos, no existe historial en el servidor, no existe cuenta. La respuesta de audio se sirve con Cache-Control: no-store.
Qué puedes hacer con el resultado
La suscripción de ElevenLabs otorga derecho de uso comercial sobre el material generado, pero su política de uso prohíbe explícitamente utilizar la salida para entrenar, probar o construir un sistema competidor. En la práctica: el archivo de audio puede ir en un material de cliente; no puede convertirse en datos de entrenamiento para un modelo propio.

De la exploración a la implementación

Cómo preparamos un proyecto con Voice Studio.

01

Aclaramos el material y quién lo escucha

Un anuncio de radio, una narración de presentación y un mensaje de IVR tienen requisitos distintos de formato, ritmo y longitud. El formato de exportación se elige desde aquí, no al final.

02

Resolvemos primero los derechos de voz

Qué voz se usa y sobre la base de qué acuerdo. Si hace falta una voz nueva, la clonación requiere muestras y el consentimiento de la persona, no solo un archivo de audio.

03

Generamos, escuchamos y corregimos el texto, no la configuración

La mayoría de los problemas de pronunciación se resuelven reescribiendo el texto, no moviendo los cursores: las abreviaturas se desarrollan, los números se escriben con letras donde hay ambigüedad, y los nombres propios se prueban por separado antes de ponerlos en la frase.

04

Entregamos el archivo y dejamos constancia de lo permitido

Exportación verificada, más una nota sobre la voz usada y los límites de uso — para que el material pueda reutilizarse dentro de seis meses sin reabrir la discusión sobre derechos.

Preguntas que vale la pena aclarar.

¿Qué proveedor usas?

ElevenLabs. Nuestra función de servidor llama directamente a api.elevenlabs.io, el endpoint de síntesis. No es un proveedor abstracto: de él dependen las voces disponibles, el coste, los formatos de salida y las reglas de uso del resultado.

¿Qué voces puedo usar?

Las fijadas en la interfaz, que son voces clonadas a partir de muestras proporcionadas — no voces de biblioteca. Se crea una voz nueva cargando muestras mediante la interfaz de clonación de ElevenLabs, con su límite de 11 MB por archivo; por encima de eso recomprimimos automáticamente a mono 22 kHz 64 kbps. La parte que no es técnica es la que importa: clonar la voz de una persona requiere el consentimiento de esa persona. En la República de Moldova la voz es un dato biométrico desde el 23 de agosto de 2026, así que una grabación pública no autoriza nada.

¿Cuánto texto puedo enviar de una vez?

5.000 caracteres por solicitud, límite impuesto por nosotros, no por el proveedor. El motivo es el coste: una solicitud errónea con un texto cien veces más largo es una factura, no un error. La función tiene 60 segundos de ejecución, lo que es suficiente para un bloque de este tamaño.

¿En qué formatos exporta?

MP3 a 44,1 kHz 128 kbps (predeterminado) o 192 kbps, MP3 22 kHz 32 kbps para un tamaño pequeño, PCM 44,1 kHz para WAV bruto, y μ-law 8 kHz para telefonía. El último es el que la gente olvida y luego descubre que el material suena mal en la central telefónica.

¿Puedo usar el audio generado para entrenar una voz propia?

No. La suscripción de ElevenLabs te da derecho de uso comercial sobre el material, pero su política de uso prohíbe explícitamente usar la salida para entrenar, probar o desarrollar un sistema competidor. Un archivo entregado a un cliente está bien; el mismo archivo como datos de entrenamiento para un modelo propio no. Es una distinción que se paga si se ignora, y es el motivo por el que Grai no se entrena con nada salido de aquí.

¿Se guarda en algún lado lo que generé?

No. El historial vive en la memoria de la pestaña, como mucho 12 generaciones, y desaparece al recargar. No hay cuenta, base de datos ni almacenamiento en el servidor; la respuesta de audio se marca explícitamente como no cacheable. Si quieres el archivo, lo descargas en ese momento.

¿Puedo usarlo yo solo?

No hoy. El despliegue está detrás de la autenticación de Vercel y, opcionalmente, de un token adicional de acceso solicitado como encabezado en cada petición. Es una herramienta de trabajo interna para la producción de materiales, no un servicio con registro. Lo que entregamos es el material de audio, no el acceso al panel.

Ejemplo ilustrativo

La narración de un material de presentación, en dos idiomas

Un escenario de uso, sin datos de cliente ni resultados comerciales atribuidos.

Situación inicial

El texto de una presentación de producto, que debe leerse en rumano y ruso por la misma voz, con la misma energía.

Cómo funciona

Se elige Eleven v3 por su expresividad y se fuerza el idioma explícitamente en cada variante, en lugar de dejarlo a la detección automática — en textos con nombres propios la detección elige mal justo donde más se nota. La estabilidad se pone en Natural; las pausas se marcan en el texto con [pause] y [short pause] en la posición exacta, no al final de la frase. Se escucha y se corrige el texto, no los deslizadores.

Rezultatul

Dos archivos MP3 a 44,1 kHz, la misma voz, la misma energía, descargados en el momento de la generación. Si el material va a entrar en un montaje, se usa PCM en lugar de MP3, para que no se comprima dos veces.

Ce este necesar:Vocea trebuie să fie una pentru care există acordul persoanei clonate. Textul nu trebuie să conțină informație care nu are voie să ajungă la un furnizor extern.

Posibilidades de colaboración

Voice Studio, en el contexto de tu organización.

Procesamiento del contenido de audio

Proyectos de transcripción y generación de voz sobre materiales para los que existe un derecho de uso y un propósito documentado.

Empresas privadas

Definimos un piloto en torno a un proceso real: usuarios, datos, integraciones, costes y criterios de aceptación. La ampliación sigue después de evaluar el resultado.

Instituciones y empresas públicas

Establecemos los requisitos de accesibilidad, alojamiento, protección de datos e interoperabilidad. Cualquier conexión con servicios AGE o STISC requiere la validación de la elegibilidad, el acceso y las aprobaciones.

Estos son escenarios de adaptación, no declaraciones sobre contratos o colaboraciones existentes. Las funciones propuestas se confirman en el ámbito de trabajo del proyecto.

Habla de un piloto

Parte de un ecosistema.

¿Qué te gustaría que funcionara mejor?

Cuéntanos tu proceso. Juntos decidimos qué merece la pena construir, qué podemos conectar y cómo verificamos el resultado.

Vamos a hablar