Przejdź do treści
megapromotingPorozmawiajmy
Produkty Voice Studio

Producție vocală Instrument specializat

Z tekstu — głos dla Twojego materiału.

Studio do generowania, odsłuchiwania i pobierania materiałów głosowych za pomocą modeli text-to-speech. Interfejs łączy wybór głosu i ustawienia przydatne w produkcji.

  1. 1Text și voce
  2. 2Generare audio
  3. 3Ascultare și export
Schemă explicativă ·Voice Studio

Voice Studio

Od informacji do wykonanej pracy.

01

Przygotowujesz tekst

Piszesz materiał i wybierasz głos autoryzowany do użycia.

02

Reglezi

Dostosowujesz parametry i dostępne opcje modelu głosowego.

03

Revizuiești

Odsłuchujesz, poprawiasz i pobierasz materiał do projektu.

Gdzie staje się przydatny.

Narațiune

Materiały objaśniające, prezentacje i treści audio.

Producție

Proces generowania i weryfikacji dla zespołów contentowych.

Experimentare

Porównanie interpretacji tekstu przed użyciem.

Narzędzie korzysta z modeli głosowych zintegrowanych dostawców. Obowiązują koszty, prawa do głosów oraz zasady dostawcy.

Voice Studio w szczegółach

Co możesz zrobić z tym projektem.

Voice Studio to łańcuch od tekstu do pliku audio: wpisujesz tekst, wybierasz głos, dodajesz znaczniki emocji i pauz, regulujesz model, odsłuchujesz, poprawiasz i pobierasz. Dostawcą jest ElevenLabs — mówimy o tym wprost, bo to decyduje o tym, jakich głosów można używać, ile to kosztuje i co wolno zrobić z wynikiem.

Część, której nie widać, a która jest właściwie powodem, dla którego to narzędzie istnieje: klucz API nigdy nie trafia do przeglądarki. Interfejs wysyła tylko tekst do własnej funkcji serwerowej, a ta przechowuje klucz i komunikuje się z ElevenLabs. Bez tej warstwy każda strona generująca głos ujawnia swój klucz każdemu, kto otworzy konsolę przeglądarki.

To nie jest Grai. Grai to badania nad modelem głosowym, bez produktu. Voice Studio to produkcja z zintegrowanym dostawcą, dostępna dziś. Te dwa rozwiązania nie współdzielą żadnego kodu.

01

Cztery modele, wybrane ze względu na różne kompromisy

Eleven v3 dla ekspresji i znaczników emocji, Multilingual v2 dla stabilności, Turbo v2.5 dla kosztu, Flash v2.5 dla minimalnego opóźnienia. To nie są cztery warianty tego samego: v3 akceptuje znaczniki, które pozostałe ignorują, a Flash poświęca niuanse na rzecz szybkości.

02

Znaczniki gry aktorskiej, nie tylko tekst

W Eleven v3 można wstawić w tekst 14 stanów emocji (od [excited] i [whispers] po [sarcastic] i [tired]), 9 znaczników niewerbalnych i pauz ([laughs], [sighs], [clears throat], [pause], [breathes]) oraz 7 znaczników sposobu mówienia ([rushed], [drawn out], [singing], [muttering], [quietly]). Wstawia się je w miejscu kursora, bo miejsce liczy się tak samo jak znacznik.

03

Ustawienia widoczne w wyniku

Stabilność, podobieństwo do głosu źródłowego, przesada stylu, prędkość między 0,7 a 1,2, plus impuls mówiącego. W v3 stabilność nie jest ciągłym suwakiem, lecz trzema poziomami — Creative, Natural, Robust — ponieważ model zachowuje się dyskretnie, nie ciągle, a precyzyjny suwak sugerowałby kontrolę, której nie ma.

04

Pięć formatów eksportu, w tym jeden dla telefonii

MP3 przy 44,1 kHz 128 lub 192 kbps, MP3 22 kHz 32 kbps dla małych plików, PCM 44,1 kHz dla surowego WAV, który trafia do montażu, oraz μ-law 8 kHz — format telefoniczny, jeśli materiał trafia do IVR albo centrali.

05

Osiem języków do wymuszenia lub wykrywanie z tekstu

Rumuński, rosyjski, angielski, ukraiński, francuski, włoski, hiszpański, niemiecki — albo pozostawione na automacie. Wymuszenie języka ma znaczenie w tekstach mieszanych, gdzie automatyczne wykrywanie wybiera źle właśnie nazwy własne.

Dane i działanie

Co trafia do systemu. Co trzeba sprawdzić.

Klucz znajduje się w jednym miejscu
W zaszyfrowanej zmiennej środowiskowej na serwerze, nigdy w kodzie, w git ani we frontendzie. Przeglądarka wywołuje tylko naszą własną funkcję. Klucz daje ElevenLabs tylko uprawnienie do syntezy, nie dostęp do całego konta, plus miesięczny limit znaków — bo prawdziwa obrona klucza nie polega na jego tajności, lecz na tym, ile szkód może wyrządzić, jeśli wycieknie.
Tekst trafia do dostawcy
To jest bezpośrednia konsekwencja korzystania z zewnętrznego dostawcy: tekst przekazany do syntezy trafia do ElevenLabs. Tekst zawierający dane osobowe, nieopublikowane ceny lub informacje klienta nie jest wysyłany bez upoważnienia. To nie formalność — to jedyna decyzja zgodności, którą narzędzie przenosi na użytkowniczkę lub użytkownika.
Głosy są klonowane, więc potrzebna jest zgoda
Głosy przypięte w interfejsie nie są głosami z biblioteki, lecz głosami sklonowanymi z próbek od prawdziwych osób, utworzonymi przez interfejs klonowania ElevenLabs. Oznacza to, że nie jest to kwestia licencji produktu, lecz zgody tej osoby. W Republice Mołdawii Ustawa 195/2024 traktuje głos jako dane biometryczne od 23 sierpnia 2026.
Nic nie jest przechowywane
Generacje pozostają w pamięci karty przeglądarki, najwyżej ostatnie 12, i znikają po ponownym wczytaniu. Nie ma bazy danych, nie ma historii na serwerze, nie ma konta. Odpowiedź audio jest serwowana z Cache-Control: no-store.
Co wolno robić z wynikiem
Subskrypcja ElevenLabs przyznaje prawo do komercyjnego użycia wygenerowanego materiału, ale ich polityka użytkowania wyraźnie zabrania wykorzystywania wyniku do trenowania, testowania lub budowania konkurencyjnego systemu. W praktyce: plik audio może trafić do materiału klienta; nie może stać się danymi treningowymi dla własnego modelu.

Od eksploracji do wdrożenia

Jak przygotowujemy projekt z Voice Studio.

01

Doprecyzowujemy materiał i to, kto go odsłuchuje

Spot radiowy, narracja prezentacyjna i komunikat IVR mają różne wymagania dotyczące formatu, tempa i długości. Format eksportu wybiera się tutaj, nie na końcu.

02

Najpierw rozwiązujemy prawa do głosu

Jaki głos jest używany i na podstawie jakiej zgody. Jeśli potrzebny jest nowy głos, klonowanie wymaga próbek i zgody tej osoby, nie tylko pliku audio.

03

Generujemy, odsłuchujemy i poprawiamy tekst, nie ustawienia

Większość problemów z wymową rozwiązuje się przez przepisanie tekstu, a nie przez przesuwanie suwaków: skróty rozwija się, liczby zapisuje się słowami tam, gdzie są niejednoznaczne, a nazwy własne testuje się osobno przed wstawieniem ich do zdania.

04

Przekazujemy plik i odnotowujemy, co jest dozwolone

Zweryfikowany eksport, plus nota o użytym głosie i ograniczeniach użytkowania — aby materiał można było ponownie wykorzystać po sześciu miesiącach bez ponownego rozpoczynania rozmowy o prawach.

Pytania, które warto wyjaśnić.

Jakiego dostawcy używacie?

ElevenLabs. Nasza funkcja serwerowa wywołuje bezpośrednio api.elevenlabs.io, endpoint syntezy. To nie jest abstrakcyjny dostawca: od niego zależą dostępne głosy, koszt, formaty wyjściowe i zasady użytkowania wyniku.

Jakie głosy mogę używać?

Te przypięte w interfejsie, które są głosami sklonowanymi z dostarczonych próbek — nie głosami z biblioteki. Nowy głos tworzy się przez przesłanie próbek przez interfejs klonowania ElevenLabs, z ich limitem 11 MB na plik; powyżej tego automatycznie rekompresujemy do mono 22 kHz 64 kbps. Część nietechniczna jest tą, która ma znaczenie: klonowanie głosu osoby wymaga zgody tej osoby. W Republice Mołdawii głos jest daną biometryczną od 23 sierpnia 2026 r., więc publiczne nagranie niczego nie autoryzuje.

Ile tekstu mogę wysłać naraz?

5.000 znaków na żądanie, limit ustalony przez nas, a nie przez dostawcę. Powód to koszt: jedno błędne żądanie z tekstem sto razy dłuższym to rachunek, a nie błąd. Funkcja ma 60 sekund czasu wykonania, co wystarcza dla bloku tej wielkości.

W jakich formatach eksportuje?

MP3 przy 44,1 kHz 128 kbps (domyślnie) albo 192 kbps, MP3 22 kHz 32 kbps dla małego rozmiaru, PCM 44,1 kHz dla surowego WAV, oraz μ-law 8 kHz dla telefonii. Ten ostatni to ten, o którym ludzie zapominają, a potem odkrywają, że materiał brzmi źle w centrali telefonicznej.

Czy mogę użyć wygenerowanego audio, żeby trenować własny głos?

Nie. Abonament ElevenLabs daje prawo do komercyjnego użycia materiału, ale ich polityka użytkowania wyraźnie zabrania używania wyjścia do trenowania, testowania lub rozwijania systemu konkurencyjnego. Plik dostarczony klientowi jest w porządku; ten sam plik jako dane treningowe dla własnego modelu nie jest. To rozróżnienie, za ignorowanie którego płaci się cenę, i dlatego Grai nie trenuje się na niczym stąd wygenerowanym.

Czy to, co wygenerowałam/em, jest gdzieś zachowywane?

Nie. Historia żyje w pamięci zakładki, maksymalnie 12 generacji, i znika po przeładowaniu. Nie ma konta, bazy danych ani przechowywania na serwerze; odpowiedź audio jest wyraźnie oznaczona jako niecacheowalna. Jeśli chcesz plik, pobierasz go w tym momencie.

Czy mogę używać tego samodzielnie?

Nie dziś. Wdrożenie jest za uwierzytelnianiem Vercel i, opcjonalnie, za dodatkowym tokenem dostępu wymaganym jako nagłówek przy każdym żądaniu. To wewnętrzne narzędzie pracy do produkcji materiałów, a nie usługa z rejestracją. Dostarczamy materiał audio, a nie dostęp do panelu.

Przykład ilustracyjny

Narracja materiału prezentacyjnego, w dwóch językach

Scenariusz użycia, bez danych klienta ani przypisanych wyników handlowych.

Sytuacja początkowa

Tekst prezentacji produktu, który ma być przeczytany po rumuńsku i rosyjsku tym samym głosem, z tą samą energią.

Jak to działa

Wybiera się Eleven v3 dla ekspresyjności i wymusza język jawnie przy każdej wersji, zamiast zostawiać go automatycznemu wykrywaniu — w tekstach z nazwami własnymi wykrywanie wybiera błędnie dokładnie tam, gdzie słychać to najmocniej. Stabilność ustawia się na Natural; pauzy oznacza się w tekście przez [pause] i [short pause] w dokładnej pozycji, a nie na końcu zdania. Słucha się i koryguje tekst, nie suwaki.

Rezultatul

Dwa pliki MP3 przy 44,1 kHz, ten sam głos, ta sama energia, pobierane w momencie generowania. Jeśli materiał ma wejść do montażu, bierze się PCM zamiast MP3, żeby nie kompresować dwa razy.

Ce este necesar:Vocea trebuie să fie una pentru care există acordul persoanei clonate. Textul nu trebuie să conțină informație care nu are voie să ajungă la un furnizor extern.

Możliwości współpracy

Voice Studio, w kontekście twojej organizacji.

Przetwarzanie treści audio

Projekty transkrypcji i generowania głosu na materiałach, do których istnieją prawa użytkowania oraz udokumentowany cel.

Firmy prywatne

Definiujemy pilotaż wokół realnego procesu: użytkownicy, dane, integracje, koszty i kryteria akceptacji. Rozszerzenie następuje po ocenie wyniku.

Instytucje i spółki państwowe

Ustalamy wymagania dotyczące dostępności, hostingu, ochrony danych i interoperacyjności. Każde połączenie z usługami AGE lub STISC wymaga walidacji kwalifikowalności, dostępu i zatwierdzeń.

To są scenariusze adaptacji, a nie oświadczenia o istniejących umowach lub partnerstwach. Proponowane funkcje są potwierdzane w zakresie pracy projektu.

Discută un pilot

Część ekosystemu.

Co chcesz, żeby działało lepiej?

Opowiedz nam o swoim procesie. Wspólnie ustalimy, co warto zbudować, co da się połączyć i jak sprawdzimy wynik.

Porozmawiajmy