Sari la conținut
megapromotingHai să discutăm
Produse Voice Studio

Producție vocală Instrument specializat

Din text, o voce pentru materialul tău.

Un studio pentru generarea, ascultarea și descărcarea materialelor vocale prin modele text-to-speech. Interfața aduce la un loc alegerea vocii și reglajele utile producției.

  1. 1Text și voce
  2. 2Generare audio
  3. 3Ascultare și export
Schemă explicativă ·Voice Studio

Voice Studio

De la informație la lucru făcut.

01

Pregătești textul

Scrii materialul și alegi vocea autorizată pentru utilizare.

02

Reglezi

Ajustezi parametrii și opțiunile disponibile modelului vocal.

03

Revizuiești

Asculți, corectezi și descarci materialul pentru proiect.

Unde devine util.

Narațiune

Materiale explicative, prezentări și conținut audio.

Producție

Un flux de generare și revizuire pentru echipele de conținut.

Experimentare

Compararea interpretărilor unui text înainte de utilizare.

Instrumentul folosește modele vocale ale furnizorilor integrați. Costurile, drepturile asupra vocilor și regulile furnizorului se aplică.

Voice Studio în detaliu

Ce poți face cu acest proiect.

Voice Studio e lanțul de la text la fișier audio: scrii textul, alegi vocea, pui marcaje de emoție și pauze, reglezi modelul, asculți, corectezi și descarci. Furnizorul e ElevenLabs — o spunem pe nume, pentru că asta determină ce voci se pot folosi, cât costă și ce ai voie să faci cu rezultatul.

Partea care nu se vede și care e de fapt motivul pentru care instrumentul există: cheia de API nu ajunge niciodată în browser. Interfața trimite doar textul către o funcție de server proprie, iar aceea deține cheia și vorbește cu ElevenLabs. Fără stratul acesta, orice pagină care generează voce își expune cheia oricui deschide consola browserului.

Nu e Grai. Grai e cercetare de model vocal, fără produs. Voice Studio e producție cu furnizor integrat, disponibilă azi. Cele două nu împart niciun cod.

01

Patru modele, alese pentru compromisuri diferite

Eleven v3 pentru expresivitate și marcaje de emoție, Multilingual v2 pentru stabilitate, Turbo v2.5 pentru cost, Flash v2.5 pentru latență minimă. Nu sunt patru variante ale aceluiași lucru: v3 acceptă marcaje pe care celelalte le ignoră, iar Flash sacrifică nuanța pentru viteză.

02

Marcaje de joc actoricesc, nu doar text

Pe Eleven v3 poți insera în text 14 stări de emoție (de la [excited] și [whispers] până la [sarcastic] și [tired]), 9 marcaje non-verbale și de pauză ([laughs], [sighs], [clears throat], [pause], [breathes]) și 7 de livrare ([rushed], [drawn out], [singing], [muttering], [quietly]). Se inserează la poziția cursorului, pentru că locul contează la fel de mult ca marcajul.

03

Reglaje care se văd în rezultat

Stabilitate, similaritate cu vocea sursă, exagerare de stil, viteză între 0,7 și 1,2, plus impulsul de vorbitor. Pe v3 stabilitatea nu e un cursor continuu, ci trei trepte — Creativ, Natural, Robust — pentru că modelul se comportă discret, nu continuu, iar un cursor fin ar sugera un control care nu există.

04

Cinci formate de export, inclusiv unul pentru telefonie

MP3 la 44,1 kHz 128 sau 192 kbps, MP3 22 kHz 32 kbps pentru fișiere mici, PCM 44,1 kHz pentru WAV brut care intră într-un montaj, și μ-law 8 kHz — formatul de telefonie, dacă materialul ajunge într-un IVR sau într-o centrală.

05

Opt limbi forțabile, sau detectare din text

Română, rusă, engleză, ucraineană, franceză, italiană, spaniolă, germană — sau lăsată pe automat. Forțarea limbii contează în texte mixte, unde detectarea automată alege greșit exact pe numele proprii.

Date și funcționare

Ce intră în sistem. Ce trebuie verificat.

Cheia stă într-un singur loc
Într-o variabilă de mediu criptată pe server, niciodată în cod, în git sau în frontend. Browserul cheamă doar propria noastră funcție. Cheia primește la ElevenLabs doar permisiunea de sinteză, nu acces la tot contul, plus o limită lunară de caractere — pentru că apărarea reală a unei chei nu e secretul ei, ci cât rău poate face dacă scapă.
Textul ajunge la furnizor
Asta e implicația directă a folosirii unui furnizor extern: textul pe care îl dai spre sintetizare pleacă la ElevenLabs. Un text cu date personale, prețuri nepublicate sau informație de client nu se trimite fără autorizare. Nu e o formalitate — e singura decizie de conformitate pe care instrumentul o transferă utilizatorului.
Vocile sunt clonate, deci cer consimțământ
Vocile fixate în interfață nu sunt voci de bibliotecă, ci voci clonate din mostre de la persoane reale, create prin interfața de clonare a ElevenLabs. Asta înseamnă că nu e o chestiune de licență de produs, ci de acordul persoanei. În Republica Moldova, Legea 195/2024 tratează vocea ca dată biometrică din 23 august 2026.
Nimic nu se păstrează
Generările rămân în memoria filei de browser, cel mult ultimele 12, și dispar la reîncărcare. Nu există bază de date, nu există istoric pe server, nu există cont. Răspunsul audio e servit cu Cache-Control: no-store.
Ce ai voie să faci cu rezultatul
Abonamentul ElevenLabs acordă drept de uz comercial asupra materialului generat, dar politica lor de utilizare interzice explicit folosirea ieșirii pentru a antrena, testa sau construi un sistem concurent. Practic: fișierul audio poate merge într-un material de client; nu poate deveni date de antrenare pentru un model propriu.

De la explorare la implementare

Cum pregătim un proiect cu Voice Studio.

01

Clarificăm materialul și cine îl ascultă

Un spot radio, o narațiune de prezentare și un mesaj de IVR au cerințe diferite de format, de ritm și de lungime. Formatul de export se alege de aici, nu la sfârșit.

02

Rezolvăm întâi drepturile de voce

Ce voce se folosește și pe baza cărui acord. Dacă e nevoie de o voce nouă, clonarea cere mostre și consimțământul persoanei, nu doar un fișier audio.

03

Generăm, ascultăm și corectăm textul, nu setările

Cele mai multe probleme de pronunție se rezolvă rescriind textul, nu mișcând cursoarele: abrevierile se desfac, numerele se scriu în litere acolo unde e ambiguu, iar numele proprii se testează izolat înainte de a fi puse în frază.

04

Predăm fișierul și consemnăm ce e permis

Exportul verificat, plus o notă despre vocea folosită și limitele de utilizare — ca materialul să poată fi refolosit peste șase luni fără să repornim discuția despre drepturi.

Întrebări care merită clarificate.

Ce furnizor folosiți?

ElevenLabs. Funcția noastră de server cheamă direct api.elevenlabs.io, endpointul de sinteză. Nu e un furnizor abstract: de el depind vocile disponibile, costul, formatele de ieșire și regulile de utilizare a rezultatului.

Ce voci pot folosi?

Cele fixate în interfață, care sunt voci clonate din mostre furnizate — nu voci de bibliotecă. O voce nouă se creează încărcând mostre prin interfața de clonare a ElevenLabs, cu limita lor de 11 MB per fișier; peste ea recomprimăm automat la mono 22 kHz 64 kbps. Partea care nu e tehnică e cea care contează: clonarea vocii unei persoane cere acordul acelei persoane. În Republica Moldova vocea e dată biometrică din 23 august 2026, deci o înregistrare publică nu autorizează nimic.

Cât text pot trimite deodată?

5.000 de caractere per cerere, plafon impus de noi, nu de furnizor. Motivul e costul: o cerere greșită cu un text de o sută de ori mai lung e o factură, nu o eroare. Funcția are 60 de secunde de execuție, ceea ce e suficient pentru un bloc de această mărime.

În ce formate exportă?

MP3 la 44,1 kHz 128 kbps (implicit) sau 192 kbps, MP3 22 kHz 32 kbps pentru dimensiune mică, PCM 44,1 kHz pentru WAV brut, și μ-law 8 kHz pentru telefonie. Ultimul e cel pe care lumea îl uită și apoi descoperă că materialul sună prost în centrala telefonică.

Pot folosi audio-ul generat ca să antrenez o voce proprie?

Nu. Abonamentul ElevenLabs îți dă drept de uz comercial asupra materialului, dar politica lor de utilizare interzice explicit folosirea ieșirii pentru a antrena, testa sau dezvolta un sistem concurent. Un fișier livrat unui client e în regulă; același fișier ca date de antrenare pentru un model propriu nu e. E o distincție care se plătește dacă e ignorată, și e motivul pentru care Grai nu se antrenează pe nimic ieșit de aici.

Se păstrează undeva ce am generat?

Nu. Istoricul trăiește în memoria filei, cel mult 12 generări, și dispare la reîncărcare. Nu există cont, bază de date sau stocare pe server; răspunsul audio e marcat explicit ca necacheabil. Dacă vrei fișierul, îl descarci în momentul acela.

Pot să-l folosesc singur?

Nu astăzi. Deployment-ul e în spatele autentificării Vercel și, opțional, al unui token suplimentar de acces cerut ca antet la fiecare cerere. E un instrument de lucru intern pentru producția de materiale, nu un serviciu cu înregistrare. Ce livrăm e materialul audio, nu accesul la panou.

Exemplu ilustrativ

Narațiunea unui material de prezentare, în două limbi

Un scenariu de utilizare, fără date de client sau rezultate comerciale atribuite.

Situația inițială

Textul unei prezentări de produs, care trebuie citit în română și rusă de aceeași voce, cu aceeași energie.

Cum lucrează

Se alege Eleven v3 pentru expresivitate și se forțează limba explicit la fiecare variantă, în loc să fie lăsată pe detectare automată — în texte cu nume proprii detectarea alege greșit exact acolo unde se aude cel mai tare. Stabilitatea se pune pe Natural; pauzele se marchează în text cu [pause] și [short pause] la poziția exactă, nu la sfârșit de frază. Se ascultă și se corectează textul, nu cursoarele.

Rezultatul

Două fișiere MP3 la 44,1 kHz, aceeași voce, aceeași energie, descărcate în momentul generării. Dacă materialul urmează să intre într-un montaj, se ia PCM în loc de MP3, ca să nu se comprime de două ori.

Ce este necesar:Vocea trebuie să fie una pentru care există acordul persoanei clonate. Textul nu trebuie să conțină informație care nu are voie să ajungă la un furnizor extern.

Posibilități de colaborare

Voice Studio, în contextul organizației tale.

Prelucrarea conținutului audio

Proiecte de transcriere și generare vocală pe materiale pentru care există drepturi de utilizare și un scop documentat.

Companii private

Definim un pilot în jurul unui proces real: utilizatori, date, integrări, costuri și criterii de acceptare. Extinderea urmează după evaluarea rezultatului.

Instituții și companii de stat

Stabilim cerințele de accesibilitate, găzduire, protecție a datelor și interoperabilitate. Orice conexiune cu servicii AGE sau STISC necesită validarea eligibilității, accesului și aprobărilor.

Acestea sunt scenarii de adaptare, nu declarații despre contracte sau parteneriate existente. Funcțiile propuse se confirmă în domeniul de lucru al proiectului.

Discută un pilot

Parte dintr-un ecosistem.

Ce ai vrea să funcționeze mai bine?

Povestește-ne despre procesul tău. Împreună stabilim ce merită construit, ce putem conecta și cum verificăm rezultatul.

Hai să discutăm