Vai al contenuto
megapromotingParliamone
Prodotti Voice Studio

Producție vocală Instrument specializat

Dal testo, una voce per il vostro materiale.

Uno studio per la generazione, l'ascolto e il download di materiali vocali tramite modelli text-to-speech. L'interfaccia riunisce la scelta della voce e le regolazioni utili alla produzione.

  1. 1Text și voce
  2. 2Generare audio
  3. 3Ascultare și export
Schemă explicativă ·Voice Studio

Voice Studio

Dall’informazione al lavoro svolto.

01

Preparate il testo

Scrivete il materiale e scegliete la voce autorizzata all'uso.

02

Reglezi

Regolate i parametri e le opzioni disponibili del modello vocale.

03

Revizuiești

Ascoltate, correggete e scaricate il materiale per il progetto.

Dove diventa utile.

Narațiune

Materiali esplicativi, presentazioni e contenuti audio.

Producție

Un flusso di generazione e revisione per i team di contenuti.

Experimentare

Confronto delle interpretazioni di un testo prima dell'uso.

Lo strumento utilizza modelli vocali dei fornitori integrati. Si applicano i costi, i diritti sulle voci e le regole del fornitore.

Voice Studio in dettaglio

Cosa potete fare con questo progetto.

Voice Studio è la catena dal testo al file audio: scrivete il testo, scegliete la voce, inserite marcatori di emozione e pause, regolate il modello, ascoltate, correggete e scaricate. Il fornitore è ElevenLabs — lo diciamo per nome, perché questo determina quali voci si possono usare, quanto costa e cosa è consentito fare con il risultato.

La parte che non si vede e che in realtà è il motivo per cui lo strumento esiste: la chiave API non arriva mai nel browser. L'interfaccia invia solo il testo a una funzione server propria, e quella detiene la chiave e comunica con ElevenLabs. Senza questo strato, qualsiasi pagina che genera voce espone la propria chiave a chiunque apra la console del browser.

Non è Grai. Grai è ricerca di modelli vocali, senza prodotto. Voice Studio è produzione con fornitore integrato, disponibile oggi. I due non condividono alcun codice.

01

Quattro modelli, scelti per compromessi diversi

Eleven v3 per espressività e marcatori di emozione, Multilingual v2 per stabilità, Turbo v2.5 per il costo, Flash v2.5 per la latenza minima. Non sono quattro varianti della stessa cosa: v3 accetta marcatori che gli altri ignorano, mentre Flash sacrifica la sfumatura per la velocità.

02

Marcatori di recitazione, non solo testo

Su Eleven v3 potete inserire nel testo 14 stati di emozione (da [excited] e [whispers] fino a [sarcastic] e [tired]), 9 marcatori non verbali e di pausa ([laughs], [sighs], [clears throat], [pause], [breathes]) e 7 di resa ([rushed], [drawn out], [singing], [muttering], [quietly]). Si inseriscono nella posizione del cursore, perché il luogo conta tanto quanto il marcatore.

03

Regolazioni visibili nel risultato

Stabilità, somiglianza con la voce sorgente, esagerazione dello stile, velocità tra 0,7 e 1,2, più l'impulso del parlante. Su v3 la stabilità non è un cursore continuo, ma tre livelli — Creativo, Naturale, Robusto — perché il modello si comporta in modo discreto, non continuo, e un cursore fine suggerirebbe un controllo che non esiste.

04

Cinque formati di esportazione, incluso uno per la telefonia

MP3 a 44,1 kHz 128 o 192 kbps, MP3 22 kHz 32 kbps per file piccoli, PCM 44,1 kHz per WAV grezzo che entra in un montaggio, e μ-law 8 kHz — il formato per la telefonia, se il materiale arriva in un IVR o in una centrale.

05

Otto lingue forzabili, oppure rilevamento dal testo

Rumeno, russo, inglese, ucraino, francese, italiano, spagnolo, tedesco — oppure lasciate in automatico. La forzatura della lingua conta nei testi misti, dove il rilevamento automatico sceglie male proprio sui nomi propri.

Dati e funzionamento

Ciò che entra nel sistema. Ciò che deve essere verificato.

La chiave sta in un solo posto
In una variabile d'ambiente crittografata sul server, mai nel codice, in git o nel frontend. Il browser chiama solo la nostra funzione. La chiave riceve da ElevenLabs solo il permesso di sintesi, non l'accesso all'intero account, più un limite mensile di caratteri — perché la vera difesa di una chiave non è il suo segreto, ma quanto danno può fare se viene compromessa.
Il testo arriva al fornitore
Questa è la conseguenza diretta dell’uso di un fornitore esterno: il testo che inviate per la sintesi viene trasmesso a ElevenLabs. Un testo con dati personali, prezzi non pubblicati o informazioni del cliente non viene inviato senza autorizzazione. Non è una formalità — è l’unica decisione di conformità che lo strumento trasferisce all’utente.
Le voci sono clonate, quindi è richiesto il consenso
Le voci fissate nell’interfaccia non sono voci di libreria, ma voci clonate da campioni di persone reali, create tramite l’interfaccia di clonazione di ElevenLabs. Ciò significa che non è una questione di licenza del prodotto, ma del consenso della persona. Nella Repubblica di Moldova, la Legge 195/2024 tratta la voce come dato biometrico dal 23 agosto 2026.
Niente viene conservato
Le generazioni restano nella memoria della scheda del browser, al massimo le ultime 12, e scompaiono al ricaricamento. Non esiste database, non esiste cronologia sul server, non esiste account. La risposta audio è servita con Cache-Control: no-store.
Cosa potete fare con il risultato
L’abbonamento ElevenLabs conferisce il diritto d’uso commerciale sul materiale generato, ma la loro politica di utilizzo vieta esplicitamente l’uso dell’output per addestrare, testare o costruire un sistema concorrente. In pratica: il file audio può finire in un materiale del cliente; non può diventare dati di addestramento per un modello proprio.

Dall’esplorazione all’implementazione

Come prepariamo un progetto con Voice Studio.

01

Chiarifichiamo il materiale e chi lo ascolta

Uno spot radio, una narrazione di presentazione e un messaggio IVR hanno requisiti diversi di formato, ritmo e lunghezza. Il formato di esportazione si sceglie qui, non alla fine.

02

Risolviamo prima i diritti sulla voce

Quale voce si usa e in base a quale accordo. Se serve una nuova voce, la clonazione richiede campioni e il consenso della persona, non solo un file audio.

03

Generiamo, ascoltiamo e correggiamo il testo, non le impostazioni

La maggior parte dei problemi di pronuncia si risolve riscrivendo il testo, non spostando i cursori: le abbreviazioni si sciolgono, i numeri si scrivono in lettere dove è ambiguo, e i nomi propri si testano isolatamente prima di essere inseriti nella frase.

04

Consegniamo il file e annotiamo ciò che è consentito

L’esportazione verificata, più una nota sulla voce usata e sui limiti di utilizzo — così il materiale possa essere riutilizzato tra sei mesi senza riaprire la discussione sui diritti.

Domande che meritano di essere chiarite.

Quale fornitore utilizzate?

ElevenLabs. La nostra funzione server chiama direttamente api.elevenlabs.io, l’endpoint di sintesi. Non è un fornitore astratto: da esso dipendono le voci disponibili, il costo, i formati di output e le regole di utilizzo del risultato.

Quali voci posso utilizzare?

Quelle fissate nell’interfaccia, che sono voci clonate da campioni forniti — non voci di libreria. Una nuova voce si crea caricando campioni tramite l’interfaccia di clonazione di ElevenLabs, con il loro limite di 11 MB per file; oltre tale limite, ricomprimiamo automaticamente in mono 22 kHz 64 kbps. La parte non tecnica è quella che conta: clonare la voce di una persona richiede il consenso di quella persona. Nella Repubblica Moldova la voce è un dato biometrico dal 23 agosto 2026, quindi una registrazione pubblica non autorizza nulla.

Quanto testo posso inviare alla volta?

5.000 caratteri per richiesta, limite imposto da noi, non dal fornitore. Il motivo è il costo: una richiesta errata con un testo cento volte più lungo è una fattura, non un errore. La funzione ha 60 secondi di esecuzione, il che è sufficiente per un blocco di queste dimensioni.

In quali formati esporta?

MP3 a 44,1 kHz 128 kbps (predefinito) oppure 192 kbps, MP3 22 kHz 32 kbps per dimensioni ridotte, PCM 44,1 kHz per WAV grezzo, e μ-law 8 kHz per la telefonia. L’ultimo è quello che la gente dimentica e poi scopre che il materiale suona male nella centrale telefonica.

Posso usare l’audio generato per addestrare una mia voce?

No. L’abbonamento ElevenLabs le dà il diritto di uso commerciale sul materiale, ma la loro politica d’uso vieta esplicitamente l’utilizzo dell’output per addestrare, testare o sviluppare un sistema concorrente. Un file consegnato a un cliente va bene; lo stesso file come dati di addestramento per un modello proprio no. È una distinzione che si paga se viene ignorata, ed è il motivo per cui Grai non si addestra su nulla di uscito da qui.

Viene conservato da qualche parte ciò che ho generato?

No. La cronologia vive nella memoria della scheda, al massimo 12 generazioni, e scompare al ricaricamento. Non esiste account, database o archiviazione sul server; la risposta audio è contrassegnata esplicitamente come non cacheabile. Se vuole il file, lo scarica in quel momento.

Posso usarlo da solo?

Non oggi. Il deployment è dietro l’autenticazione Vercel e, facoltativamente, dietro un token di accesso aggiuntivo richiesto come intestazione a ogni richiesta. È uno strumento di lavoro interno per la produzione di materiali, non un servizio con registrazione. Quello che consegniamo è il materiale audio, non l’accesso al pannello.

Esempio illustrativo

La narrazione di un materiale di presentazione, in due lingue

Uno scenario di utilizzo, senza dati del cliente o risultati commerciali attribuiti.

Situazione iniziale

Il testo di una presentazione di prodotto, che deve essere letto in romeno e russo dalla stessa voce, con la stessa energia.

Come funziona

Si sceglie Eleven v3 per l’espressività e si forza esplicitamente la lingua per ogni variante, invece di lasciarla al rilevamento automatico — nei testi con nomi propri il rilevamento sceglie male proprio dove si sente di più. La stabilità si imposta su Natural; le pause si segnano nel testo con [pause] e [short pause] nella posizione esatta, non alla fine della frase. Si ascolta e si corregge il testo, non i cursori.

Rezultatul

Due file MP3 a 44,1 kHz, stessa voce, stessa energia, scaricati al momento della generazione. Se il materiale deve entrare in un montaggio, si usa PCM invece di MP3, così non viene compresso due volte.

Ce este necesar:Vocea trebuie să fie una pentru care există acordul persoanei clonate. Textul nu trebuie să conțină informație care nu are voie să ajungă la un furnizor extern.

Possibilità di collaborazione

Voice Studio, nel contesto della Sua organizzazione.

Elaborazione del contenuto audio

Progetti di trascrizione e generazione vocale su materiali per i quali esistono diritti d’uso e un obiettivo documentato.

Imprese private

Definiamo un pilot attorno a un processo reale: utenti, dati, integrazioni, costi e criteri di accettazione. L’estensione segue dopo la valutazione del risultato.

Istituzioni e società statali

Stabiliamo i requisiti di accessibilità, hosting, protezione dei dati e interoperabilità. Ogni connessione con servizi AGE o STISC richiede la validazione dell’ammissibilità, dell’accesso e delle approvazioni.

Questi sono scenari di adattamento, non dichiarazioni su contratti o partenariati esistenti. Le funzioni proposte si confermano nell’ambito di lavoro del progetto.

Discută un pilot

Parte di un ecosistema.

Cosa vorresti che funzionasse meglio?

Raccontaci il tuo processo. Insieme stabiliamo cosa vale la pena costruire, cosa possiamo collegare e come verifichiamo il risultato.

Parliamone