Preparate il testo
Scrivete il materiale e scegliete la voce autorizzata all'uso.
Producție vocală Instrument specializat
Uno studio per la generazione, l'ascolto e il download di materiali vocali tramite modelli text-to-speech. L'interfaccia riunisce la scelta della voce e le regolazioni utili alla produzione.
Voice Studio
Scrivete il materiale e scegliete la voce autorizzata all'uso.
Regolate i parametri e le opzioni disponibili del modello vocale.
Ascoltate, correggete e scaricate il materiale per il progetto.
Materiali esplicativi, presentazioni e contenuti audio.
Un flusso di generazione e revisione per i team di contenuti.
Confronto delle interpretazioni di un testo prima dell'uso.
Lo strumento utilizza modelli vocali dei fornitori integrati. Si applicano i costi, i diritti sulle voci e le regole del fornitore.
Voice Studio in dettaglio
Voice Studio è la catena dal testo al file audio: scrivete il testo, scegliete la voce, inserite marcatori di emozione e pause, regolate il modello, ascoltate, correggete e scaricate. Il fornitore è ElevenLabs — lo diciamo per nome, perché questo determina quali voci si possono usare, quanto costa e cosa è consentito fare con il risultato.
La parte che non si vede e che in realtà è il motivo per cui lo strumento esiste: la chiave API non arriva mai nel browser. L'interfaccia invia solo il testo a una funzione server propria, e quella detiene la chiave e comunica con ElevenLabs. Senza questo strato, qualsiasi pagina che genera voce espone la propria chiave a chiunque apra la console del browser.
Non è Grai. Grai è ricerca di modelli vocali, senza prodotto. Voice Studio è produzione con fornitore integrato, disponibile oggi. I due non condividono alcun codice.
Eleven v3 per espressività e marcatori di emozione, Multilingual v2 per stabilità, Turbo v2.5 per il costo, Flash v2.5 per la latenza minima. Non sono quattro varianti della stessa cosa: v3 accetta marcatori che gli altri ignorano, mentre Flash sacrifica la sfumatura per la velocità.
Su Eleven v3 potete inserire nel testo 14 stati di emozione (da [excited] e [whispers] fino a [sarcastic] e [tired]), 9 marcatori non verbali e di pausa ([laughs], [sighs], [clears throat], [pause], [breathes]) e 7 di resa ([rushed], [drawn out], [singing], [muttering], [quietly]). Si inseriscono nella posizione del cursore, perché il luogo conta tanto quanto il marcatore.
Stabilità, somiglianza con la voce sorgente, esagerazione dello stile, velocità tra 0,7 e 1,2, più l'impulso del parlante. Su v3 la stabilità non è un cursore continuo, ma tre livelli — Creativo, Naturale, Robusto — perché il modello si comporta in modo discreto, non continuo, e un cursore fine suggerirebbe un controllo che non esiste.
MP3 a 44,1 kHz 128 o 192 kbps, MP3 22 kHz 32 kbps per file piccoli, PCM 44,1 kHz per WAV grezzo che entra in un montaggio, e μ-law 8 kHz — il formato per la telefonia, se il materiale arriva in un IVR o in una centrale.
Rumeno, russo, inglese, ucraino, francese, italiano, spagnolo, tedesco — oppure lasciate in automatico. La forzatura della lingua conta nei testi misti, dove il rilevamento automatico sceglie male proprio sui nomi propri.
Dati e funzionamento
Dall’esplorazione all’implementazione
Uno spot radio, una narrazione di presentazione e un messaggio IVR hanno requisiti diversi di formato, ritmo e lunghezza. Il formato di esportazione si sceglie qui, non alla fine.
Quale voce si usa e in base a quale accordo. Se serve una nuova voce, la clonazione richiede campioni e il consenso della persona, non solo un file audio.
La maggior parte dei problemi di pronuncia si risolve riscrivendo il testo, non spostando i cursori: le abbreviazioni si sciolgono, i numeri si scrivono in lettere dove è ambiguo, e i nomi propri si testano isolatamente prima di essere inseriti nella frase.
L’esportazione verificata, più una nota sulla voce usata e sui limiti di utilizzo — così il materiale possa essere riutilizzato tra sei mesi senza riaprire la discussione sui diritti.
ElevenLabs. La nostra funzione server chiama direttamente api.elevenlabs.io, l’endpoint di sintesi. Non è un fornitore astratto: da esso dipendono le voci disponibili, il costo, i formati di output e le regole di utilizzo del risultato.
Quelle fissate nell’interfaccia, che sono voci clonate da campioni forniti — non voci di libreria. Una nuova voce si crea caricando campioni tramite l’interfaccia di clonazione di ElevenLabs, con il loro limite di 11 MB per file; oltre tale limite, ricomprimiamo automaticamente in mono 22 kHz 64 kbps. La parte non tecnica è quella che conta: clonare la voce di una persona richiede il consenso di quella persona. Nella Repubblica Moldova la voce è un dato biometrico dal 23 agosto 2026, quindi una registrazione pubblica non autorizza nulla.
5.000 caratteri per richiesta, limite imposto da noi, non dal fornitore. Il motivo è il costo: una richiesta errata con un testo cento volte più lungo è una fattura, non un errore. La funzione ha 60 secondi di esecuzione, il che è sufficiente per un blocco di queste dimensioni.
MP3 a 44,1 kHz 128 kbps (predefinito) oppure 192 kbps, MP3 22 kHz 32 kbps per dimensioni ridotte, PCM 44,1 kHz per WAV grezzo, e μ-law 8 kHz per la telefonia. L’ultimo è quello che la gente dimentica e poi scopre che il materiale suona male nella centrale telefonica.
No. L’abbonamento ElevenLabs le dà il diritto di uso commerciale sul materiale, ma la loro politica d’uso vieta esplicitamente l’utilizzo dell’output per addestrare, testare o sviluppare un sistema concorrente. Un file consegnato a un cliente va bene; lo stesso file come dati di addestramento per un modello proprio no. È una distinzione che si paga se viene ignorata, ed è il motivo per cui Grai non si addestra su nulla di uscito da qui.
No. La cronologia vive nella memoria della scheda, al massimo 12 generazioni, e scompare al ricaricamento. Non esiste account, database o archiviazione sul server; la risposta audio è contrassegnata esplicitamente come non cacheabile. Se vuole il file, lo scarica in quel momento.
Non oggi. Il deployment è dietro l’autenticazione Vercel e, facoltativamente, dietro un token di accesso aggiuntivo richiesto come intestazione a ogni richiesta. È uno strumento di lavoro interno per la produzione di materiali, non un servizio con registrazione. Quello che consegniamo è il materiale audio, non l’accesso al pannello.
Esempio illustrativo
Uno scenario di utilizzo, senza dati del cliente o risultati commerciali attribuiti.
Il testo di una presentazione di prodotto, che deve essere letto in romeno e russo dalla stessa voce, con la stessa energia.
Si sceglie Eleven v3 per l’espressività e si forza esplicitamente la lingua per ogni variante, invece di lasciarla al rilevamento automatico — nei testi con nomi propri il rilevamento sceglie male proprio dove si sente di più. La stabilità si imposta su Natural; le pause si segnano nel testo con [pause] e [short pause] nella posizione esatta, non alla fine della frase. Si ascolta e si corregge il testo, non i cursori.
Due file MP3 a 44,1 kHz, stessa voce, stessa energia, scaricati al momento della generazione. Se il materiale deve entrare in un montaggio, si usa PCM invece di MP3, così non viene compresso due volte.
Ce este necesar:Vocea trebuie să fie una pentru care există acordul persoanei clonate. Textul nu trebuie să conțină informație care nu are voie să ajungă la un furnizor extern.
Possibilità di collaborazione
Progetti di trascrizione e generazione vocale su materiali per i quali esistono diritti d’uso e un obiettivo documentato.
Definiamo un pilot attorno a un processo reale: utenti, dati, integrazioni, costi e criteri di accettazione. L’estensione segue dopo la valutazione del risultato.
Stabiliamo i requisiti di accessibilità, hosting, protezione dei dati e interoperabilità. Ogni connessione con servizi AGE o STISC richiede la validazione dell’ammissibilità, dell’accesso e delle approvazioni.
Questi sono scenari di adattamento, non dichiarazioni su contratti o partenariati esistenti. Le funzioni proposte si confermano nell’ambito di lavoro del progetto.
Discută un pilotSviluppiamo agenti che rispondono e avviano chiamate, usano le informazioni dell'attività e lavorano con i vostri sistemi.
PlatformăGrai è la nostra direzione di ricerca per la sintesi vocale e modelli adattati alle lingue usate qui.
Cercetare & dezvoltareUno strumento per la cattura, la trascrizione e l’organizzazione degli spot radiofonici.
Instrument specializatRaccontaci il tuo processo. Insieme stabiliamo cosa vale la pena costruire, cosa possiamo collegare e come verifichiamo il risultato.