Przygotowujesz tekst
Piszesz materiał i wybierasz głos autoryzowany do użycia.
Producție vocală Instrument specializat
Studio do generowania, odsłuchiwania i pobierania materiałów głosowych za pomocą modeli text-to-speech. Interfejs łączy wybór głosu i ustawienia przydatne w produkcji.
Voice Studio
Piszesz materiał i wybierasz głos autoryzowany do użycia.
Dostosowujesz parametry i dostępne opcje modelu głosowego.
Odsłuchujesz, poprawiasz i pobierasz materiał do projektu.
Materiały objaśniające, prezentacje i treści audio.
Proces generowania i weryfikacji dla zespołów contentowych.
Porównanie interpretacji tekstu przed użyciem.
Narzędzie korzysta z modeli głosowych zintegrowanych dostawców. Obowiązują koszty, prawa do głosów oraz zasady dostawcy.
Voice Studio w szczegółach
Voice Studio to łańcuch od tekstu do pliku audio: wpisujesz tekst, wybierasz głos, dodajesz znaczniki emocji i pauz, regulujesz model, odsłuchujesz, poprawiasz i pobierasz. Dostawcą jest ElevenLabs — mówimy o tym wprost, bo to decyduje o tym, jakich głosów można używać, ile to kosztuje i co wolno zrobić z wynikiem.
Część, której nie widać, a która jest właściwie powodem, dla którego to narzędzie istnieje: klucz API nigdy nie trafia do przeglądarki. Interfejs wysyła tylko tekst do własnej funkcji serwerowej, a ta przechowuje klucz i komunikuje się z ElevenLabs. Bez tej warstwy każda strona generująca głos ujawnia swój klucz każdemu, kto otworzy konsolę przeglądarki.
To nie jest Grai. Grai to badania nad modelem głosowym, bez produktu. Voice Studio to produkcja z zintegrowanym dostawcą, dostępna dziś. Te dwa rozwiązania nie współdzielą żadnego kodu.
Eleven v3 dla ekspresji i znaczników emocji, Multilingual v2 dla stabilności, Turbo v2.5 dla kosztu, Flash v2.5 dla minimalnego opóźnienia. To nie są cztery warianty tego samego: v3 akceptuje znaczniki, które pozostałe ignorują, a Flash poświęca niuanse na rzecz szybkości.
W Eleven v3 można wstawić w tekst 14 stanów emocji (od [excited] i [whispers] po [sarcastic] i [tired]), 9 znaczników niewerbalnych i pauz ([laughs], [sighs], [clears throat], [pause], [breathes]) oraz 7 znaczników sposobu mówienia ([rushed], [drawn out], [singing], [muttering], [quietly]). Wstawia się je w miejscu kursora, bo miejsce liczy się tak samo jak znacznik.
Stabilność, podobieństwo do głosu źródłowego, przesada stylu, prędkość między 0,7 a 1,2, plus impuls mówiącego. W v3 stabilność nie jest ciągłym suwakiem, lecz trzema poziomami — Creative, Natural, Robust — ponieważ model zachowuje się dyskretnie, nie ciągle, a precyzyjny suwak sugerowałby kontrolę, której nie ma.
MP3 przy 44,1 kHz 128 lub 192 kbps, MP3 22 kHz 32 kbps dla małych plików, PCM 44,1 kHz dla surowego WAV, który trafia do montażu, oraz μ-law 8 kHz — format telefoniczny, jeśli materiał trafia do IVR albo centrali.
Rumuński, rosyjski, angielski, ukraiński, francuski, włoski, hiszpański, niemiecki — albo pozostawione na automacie. Wymuszenie języka ma znaczenie w tekstach mieszanych, gdzie automatyczne wykrywanie wybiera źle właśnie nazwy własne.
Dane i działanie
Od eksploracji do wdrożenia
Spot radiowy, narracja prezentacyjna i komunikat IVR mają różne wymagania dotyczące formatu, tempa i długości. Format eksportu wybiera się tutaj, nie na końcu.
Jaki głos jest używany i na podstawie jakiej zgody. Jeśli potrzebny jest nowy głos, klonowanie wymaga próbek i zgody tej osoby, nie tylko pliku audio.
Większość problemów z wymową rozwiązuje się przez przepisanie tekstu, a nie przez przesuwanie suwaków: skróty rozwija się, liczby zapisuje się słowami tam, gdzie są niejednoznaczne, a nazwy własne testuje się osobno przed wstawieniem ich do zdania.
Zweryfikowany eksport, plus nota o użytym głosie i ograniczeniach użytkowania — aby materiał można było ponownie wykorzystać po sześciu miesiącach bez ponownego rozpoczynania rozmowy o prawach.
ElevenLabs. Nasza funkcja serwerowa wywołuje bezpośrednio api.elevenlabs.io, endpoint syntezy. To nie jest abstrakcyjny dostawca: od niego zależą dostępne głosy, koszt, formaty wyjściowe i zasady użytkowania wyniku.
Te przypięte w interfejsie, które są głosami sklonowanymi z dostarczonych próbek — nie głosami z biblioteki. Nowy głos tworzy się przez przesłanie próbek przez interfejs klonowania ElevenLabs, z ich limitem 11 MB na plik; powyżej tego automatycznie rekompresujemy do mono 22 kHz 64 kbps. Część nietechniczna jest tą, która ma znaczenie: klonowanie głosu osoby wymaga zgody tej osoby. W Republice Mołdawii głos jest daną biometryczną od 23 sierpnia 2026 r., więc publiczne nagranie niczego nie autoryzuje.
5.000 znaków na żądanie, limit ustalony przez nas, a nie przez dostawcę. Powód to koszt: jedno błędne żądanie z tekstem sto razy dłuższym to rachunek, a nie błąd. Funkcja ma 60 sekund czasu wykonania, co wystarcza dla bloku tej wielkości.
MP3 przy 44,1 kHz 128 kbps (domyślnie) albo 192 kbps, MP3 22 kHz 32 kbps dla małego rozmiaru, PCM 44,1 kHz dla surowego WAV, oraz μ-law 8 kHz dla telefonii. Ten ostatni to ten, o którym ludzie zapominają, a potem odkrywają, że materiał brzmi źle w centrali telefonicznej.
Nie. Abonament ElevenLabs daje prawo do komercyjnego użycia materiału, ale ich polityka użytkowania wyraźnie zabrania używania wyjścia do trenowania, testowania lub rozwijania systemu konkurencyjnego. Plik dostarczony klientowi jest w porządku; ten sam plik jako dane treningowe dla własnego modelu nie jest. To rozróżnienie, za ignorowanie którego płaci się cenę, i dlatego Grai nie trenuje się na niczym stąd wygenerowanym.
Nie. Historia żyje w pamięci zakładki, maksymalnie 12 generacji, i znika po przeładowaniu. Nie ma konta, bazy danych ani przechowywania na serwerze; odpowiedź audio jest wyraźnie oznaczona jako niecacheowalna. Jeśli chcesz plik, pobierasz go w tym momencie.
Nie dziś. Wdrożenie jest za uwierzytelnianiem Vercel i, opcjonalnie, za dodatkowym tokenem dostępu wymaganym jako nagłówek przy każdym żądaniu. To wewnętrzne narzędzie pracy do produkcji materiałów, a nie usługa z rejestracją. Dostarczamy materiał audio, a nie dostęp do panelu.
Przykład ilustracyjny
Scenariusz użycia, bez danych klienta ani przypisanych wyników handlowych.
Tekst prezentacji produktu, który ma być przeczytany po rumuńsku i rosyjsku tym samym głosem, z tą samą energią.
Wybiera się Eleven v3 dla ekspresyjności i wymusza język jawnie przy każdej wersji, zamiast zostawiać go automatycznemu wykrywaniu — w tekstach z nazwami własnymi wykrywanie wybiera błędnie dokładnie tam, gdzie słychać to najmocniej. Stabilność ustawia się na Natural; pauzy oznacza się w tekście przez [pause] i [short pause] w dokładnej pozycji, a nie na końcu zdania. Słucha się i koryguje tekst, nie suwaki.
Dwa pliki MP3 przy 44,1 kHz, ten sam głos, ta sama energia, pobierane w momencie generowania. Jeśli materiał ma wejść do montażu, bierze się PCM zamiast MP3, żeby nie kompresować dwa razy.
Ce este necesar:Vocea trebuie să fie una pentru care există acordul persoanei clonate. Textul nu trebuie să conțină informație care nu are voie să ajungă la un furnizor extern.
Możliwości współpracy
Projekty transkrypcji i generowania głosu na materiałach, do których istnieją prawa użytkowania oraz udokumentowany cel.
Definiujemy pilotaż wokół realnego procesu: użytkownicy, dane, integracje, koszty i kryteria akceptacji. Rozszerzenie następuje po ocenie wyniku.
Ustalamy wymagania dotyczące dostępności, hostingu, ochrony danych i interoperacyjności. Każde połączenie z usługami AGE lub STISC wymaga walidacji kwalifikowalności, dostępu i zatwierdzeń.
To są scenariusze adaptacji, a nie oświadczenia o istniejących umowach lub partnerstwach. Proponowane funkcje są potwierdzane w zakresie pracy projektu.
Discută un pilotBudujemy agentów, którzy odbierają i inicjują połączenia, korzystają z informacji biznesowych i pracują z Twoimi systemami.
PlatformăGrai to nasz kierunek badawczy dla syntezy głosu i modeli dostosowanych do języków używanych tutaj.
Cercetare & dezvoltareNarzędzie do przechwytywania, transkrypcji i porządkowania reklam radiowych.
Instrument specializatOpowiedz nam o swoim procesie. Wspólnie ustalimy, co warto zbudować, co da się połączyć i jak sprawdzimy wynik.