Pregătești textul
Scrii materialul și alegi vocea autorizată pentru utilizare.
Producție vocală Instrument specializat
Un studio pentru generarea, ascultarea și descărcarea materialelor vocale prin modele text-to-speech. Interfața aduce la un loc alegerea vocii și reglajele utile producției.
Voice Studio
Scrii materialul și alegi vocea autorizată pentru utilizare.
Ajustezi parametrii și opțiunile disponibile modelului vocal.
Asculți, corectezi și descarci materialul pentru proiect.
Materiale explicative, prezentări și conținut audio.
Un flux de generare și revizuire pentru echipele de conținut.
Compararea interpretărilor unui text înainte de utilizare.
Instrumentul folosește modele vocale ale furnizorilor integrați. Costurile, drepturile asupra vocilor și regulile furnizorului se aplică.
Voice Studio în detaliu
Voice Studio e lanțul de la text la fișier audio: scrii textul, alegi vocea, pui marcaje de emoție și pauze, reglezi modelul, asculți, corectezi și descarci. Furnizorul e ElevenLabs — o spunem pe nume, pentru că asta determină ce voci se pot folosi, cât costă și ce ai voie să faci cu rezultatul.
Partea care nu se vede și care e de fapt motivul pentru care instrumentul există: cheia de API nu ajunge niciodată în browser. Interfața trimite doar textul către o funcție de server proprie, iar aceea deține cheia și vorbește cu ElevenLabs. Fără stratul acesta, orice pagină care generează voce își expune cheia oricui deschide consola browserului.
Nu e Grai. Grai e cercetare de model vocal, fără produs. Voice Studio e producție cu furnizor integrat, disponibilă azi. Cele două nu împart niciun cod.
Eleven v3 pentru expresivitate și marcaje de emoție, Multilingual v2 pentru stabilitate, Turbo v2.5 pentru cost, Flash v2.5 pentru latență minimă. Nu sunt patru variante ale aceluiași lucru: v3 acceptă marcaje pe care celelalte le ignoră, iar Flash sacrifică nuanța pentru viteză.
Pe Eleven v3 poți insera în text 14 stări de emoție (de la [excited] și [whispers] până la [sarcastic] și [tired]), 9 marcaje non-verbale și de pauză ([laughs], [sighs], [clears throat], [pause], [breathes]) și 7 de livrare ([rushed], [drawn out], [singing], [muttering], [quietly]). Se inserează la poziția cursorului, pentru că locul contează la fel de mult ca marcajul.
Stabilitate, similaritate cu vocea sursă, exagerare de stil, viteză între 0,7 și 1,2, plus impulsul de vorbitor. Pe v3 stabilitatea nu e un cursor continuu, ci trei trepte — Creativ, Natural, Robust — pentru că modelul se comportă discret, nu continuu, iar un cursor fin ar sugera un control care nu există.
MP3 la 44,1 kHz 128 sau 192 kbps, MP3 22 kHz 32 kbps pentru fișiere mici, PCM 44,1 kHz pentru WAV brut care intră într-un montaj, și μ-law 8 kHz — formatul de telefonie, dacă materialul ajunge într-un IVR sau într-o centrală.
Română, rusă, engleză, ucraineană, franceză, italiană, spaniolă, germană — sau lăsată pe automat. Forțarea limbii contează în texte mixte, unde detectarea automată alege greșit exact pe numele proprii.
Date și funcționare
De la explorare la implementare
Un spot radio, o narațiune de prezentare și un mesaj de IVR au cerințe diferite de format, de ritm și de lungime. Formatul de export se alege de aici, nu la sfârșit.
Ce voce se folosește și pe baza cărui acord. Dacă e nevoie de o voce nouă, clonarea cere mostre și consimțământul persoanei, nu doar un fișier audio.
Cele mai multe probleme de pronunție se rezolvă rescriind textul, nu mișcând cursoarele: abrevierile se desfac, numerele se scriu în litere acolo unde e ambiguu, iar numele proprii se testează izolat înainte de a fi puse în frază.
Exportul verificat, plus o notă despre vocea folosită și limitele de utilizare — ca materialul să poată fi refolosit peste șase luni fără să repornim discuția despre drepturi.
ElevenLabs. Funcția noastră de server cheamă direct api.elevenlabs.io, endpointul de sinteză. Nu e un furnizor abstract: de el depind vocile disponibile, costul, formatele de ieșire și regulile de utilizare a rezultatului.
Cele fixate în interfață, care sunt voci clonate din mostre furnizate — nu voci de bibliotecă. O voce nouă se creează încărcând mostre prin interfața de clonare a ElevenLabs, cu limita lor de 11 MB per fișier; peste ea recomprimăm automat la mono 22 kHz 64 kbps. Partea care nu e tehnică e cea care contează: clonarea vocii unei persoane cere acordul acelei persoane. În Republica Moldova vocea e dată biometrică din 23 august 2026, deci o înregistrare publică nu autorizează nimic.
5.000 de caractere per cerere, plafon impus de noi, nu de furnizor. Motivul e costul: o cerere greșită cu un text de o sută de ori mai lung e o factură, nu o eroare. Funcția are 60 de secunde de execuție, ceea ce e suficient pentru un bloc de această mărime.
MP3 la 44,1 kHz 128 kbps (implicit) sau 192 kbps, MP3 22 kHz 32 kbps pentru dimensiune mică, PCM 44,1 kHz pentru WAV brut, și μ-law 8 kHz pentru telefonie. Ultimul e cel pe care lumea îl uită și apoi descoperă că materialul sună prost în centrala telefonică.
Nu. Abonamentul ElevenLabs îți dă drept de uz comercial asupra materialului, dar politica lor de utilizare interzice explicit folosirea ieșirii pentru a antrena, testa sau dezvolta un sistem concurent. Un fișier livrat unui client e în regulă; același fișier ca date de antrenare pentru un model propriu nu e. E o distincție care se plătește dacă e ignorată, și e motivul pentru care Grai nu se antrenează pe nimic ieșit de aici.
Nu. Istoricul trăiește în memoria filei, cel mult 12 generări, și dispare la reîncărcare. Nu există cont, bază de date sau stocare pe server; răspunsul audio e marcat explicit ca necacheabil. Dacă vrei fișierul, îl descarci în momentul acela.
Nu astăzi. Deployment-ul e în spatele autentificării Vercel și, opțional, al unui token suplimentar de acces cerut ca antet la fiecare cerere. E un instrument de lucru intern pentru producția de materiale, nu un serviciu cu înregistrare. Ce livrăm e materialul audio, nu accesul la panou.
Exemplu ilustrativ
Un scenariu de utilizare, fără date de client sau rezultate comerciale atribuite.
Textul unei prezentări de produs, care trebuie citit în română și rusă de aceeași voce, cu aceeași energie.
Se alege Eleven v3 pentru expresivitate și se forțează limba explicit la fiecare variantă, în loc să fie lăsată pe detectare automată — în texte cu nume proprii detectarea alege greșit exact acolo unde se aude cel mai tare. Stabilitatea se pune pe Natural; pauzele se marchează în text cu [pause] și [short pause] la poziția exactă, nu la sfârșit de frază. Se ascultă și se corectează textul, nu cursoarele.
Două fișiere MP3 la 44,1 kHz, aceeași voce, aceeași energie, descărcate în momentul generării. Dacă materialul urmează să intre într-un montaj, se ia PCM în loc de MP3, ca să nu se comprime de două ori.
Ce este necesar:Vocea trebuie să fie una pentru care există acordul persoanei clonate. Textul nu trebuie să conțină informație care nu are voie să ajungă la un furnizor extern.
Posibilități de colaborare
Proiecte de transcriere și generare vocală pe materiale pentru care există drepturi de utilizare și un scop documentat.
Definim un pilot în jurul unui proces real: utilizatori, date, integrări, costuri și criterii de acceptare. Extinderea urmează după evaluarea rezultatului.
Stabilim cerințele de accesibilitate, găzduire, protecție a datelor și interoperabilitate. Orice conexiune cu servicii AGE sau STISC necesită validarea eligibilității, accesului și aprobărilor.
Acestea sunt scenarii de adaptare, nu declarații despre contracte sau parteneriate existente. Funcțiile propuse se confirmă în domeniul de lucru al proiectului.
Discută un pilotConstruim agenți care preiau și inițiază apeluri, folosesc informațiile afacerii și lucrează cu sistemele tale.
PlatformăGrai este direcția noastră de cercetare pentru sinteză vocală și modele adaptate limbilor folosite aici.
Cercetare & dezvoltareUn instrument pentru captură, transcriere și organizarea reclamelor radio.
Instrument specializatPovestește-ne despre procesul tău. Împreună stabilim ce merită construit, ce putem conecta și cum verificăm rezultatul.