Перейти до основного вмісту
megapromotingПоговорімо
Продукти Voice Studio

Producție vocală Instrument specializat

Із тексту — голос для вашого матеріалу.

Студія для генерації, прослуховування та завантаження голосових матеріалів через моделі text-to-speech. Інтерфейс поєднує вибір голосу та налаштування, корисні для виробництва.

  1. 1Text și voce
  2. 2Generare audio
  3. 3Ascultare și export
Schemă explicativă ·Voice Studio

Voice Studio

Від інформації до виконаної роботи.

01

Ви готуєте текст

Ви пишете матеріал і обираєте голос, авторизований для використання.

02

Reglezi

Ви налаштовуєте параметри та доступні опції голосової моделі.

03

Revizuiești

Ви слухаєте, виправляєте та завантажуєте матеріал для проєкту.

Де стає корисним.

Narațiune

Пояснювальні матеріали, презентації та аудіоконтент.

Producție

Потік генерації та перегляду для контент-команд.

Experimentare

Порівняння інтерпретацій тексту перед використанням.

Інструмент використовує голосові моделі інтегрованих постачальників. Застосовуються витрати, права на голоси та правила постачальника.

Voice Studio докладно

Що ви можете робити з цим проєктом.

Voice Studio — це ланцюг від тексту до аудіофайлу: ви пишете текст, обираєте голос, ставите позначки емоції та пауз, налаштовуєте модель, слухаєте, виправляєте та завантажуєте. Постачальник — ElevenLabs — ми називаємо його прямо, бо це визначає, які голоси можна використовувати, скільки це коштує і що вам дозволено робити з результатом.

Частина, якої не видно і яка насправді є причиною, чому інструмент існує: API-ключ ніколи не потрапляє в браузер. Інтерфейс надсилає лише текст до власної серверної функції, а та зберігає ключ і спілкується з ElevenLabs. Без цього шару будь-яка сторінка, що генерує голос, відкриває свій ключ кожному, хто відкриє консоль браузера.

Це не Grai. Grai — це дослідження голосової моделі, без продукту. Voice Studio — це виробництво з інтегрованим постачальником, доступне сьогодні. Ці дві речі не мають спільного коду.

01

Чотири моделі, обрані для різних компромісів

Eleven v3 для виразності та позначок емоції, Multilingual v2 для стабільності, Turbo v2.5 для вартості, Flash v2.5 для мінімальної затримки. Це не чотири варіанти одного й того самого: v3 підтримує позначки, які інші ігнорують, а Flash жертвує нюансом заради швидкості.

02

Позначки акторської гри, а не лише текст

У Eleven v3 ви можете вставляти в текст 14 станів емоції (від [excited] і [whispers] до [sarcastic] і [tired]), 9 невербальних і паузних позначок ([laughs], [sighs], [clears throat], [pause], [breathes]) і 7 позначок подачі ([rushed], [drawn out], [singing], [muttering], [quietly]). Вони вставляються в позицію курсора, бо місце важить так само, як і позначка.

03

Налаштування, які видно в результаті

Стабільність, схожість із джерельним голосом, перебільшення стилю, швидкість від 0,7 до 1,2, плюс імпульс мовця. У v3 стабільність — це не безперервний повзунок, а три рівні — Творчий, Природний, Стійкий — бо модель поводиться дискретно, а не безперервно, і тонкий повзунок натякав би на контроль, якого не існує.

04

П’ять форматів експорту, включно з одним для телефонії

MP3 на 44,1 kHz 128 або 192 kbps, MP3 22 kHz 32 kbps для малих файлів, PCM 44,1 kHz для сирого WAV, який входить у монтаж, і μ-law 8 kHz — формат для телефонії, якщо матеріал потрапляє в IVR або в телефонну станцію.

05

Вісім мов, які можна примусово задати, або виявлення з тексту

Румунська, російська, англійська, українська, французька, італійська, іспанська, німецька — або залишена на автоматі. Примусове задання мови має значення в змішаних текстах, де автоматичне визначення помиляється саме на власних назвах.

Дані та робота

Що входить у систему. Що потрібно перевірити.

Ключ зберігається в одному місці
У зашифрованій змінній середовища на сервері, ніколи в коді, у git або у frontend. Браузер викликає лише нашу власну функцію. Ключ надає ElevenLabs лише дозвіл на синтез, а не доступ до всього облікового запису, плюс щомісячний ліміт символів — бо справжній захист ключа полягає не в його таємниці, а в тому, яку шкоду він може завдати, якщо потрапить у чужі руки.
Текст потрапляє до постачальника
Це прямий наслідок використання зовнішнього постачальника: текст, який ви даєте для синтезу, відправляється до ElevenLabs. Текст із персональними даними, неопублікованими цінами або інформацією клієнта не надсилається без авторизації. Це не формальність — це єдине рішення щодо відповідності, яке інструмент передає користувачеві.
Голоси клонуються, тож потрібна згода
Голоси, закріплені в інтерфейсі, не є бібліотечними голосами, а клонами голосів із зразків реальних людей, створеними через інтерфейс клонування ElevenLabs. Це означає, що йдеться не про ліцензію продукту, а про згоду людини. У Республіці Молдова Закон 195/2024 розглядає голос як біометричні дані з 23 серпня 2026.
Нічого не зберігається
Генерації залишаються в пам’яті вкладки браузера, максимум останні 12, і зникають після перезавантаження. Немає бази даних, немає історії на сервері, немає облікового запису. Аудіовідповідь подається з Cache-Control: no-store.
Що ви маєте право робити з результатом
Підписка ElevenLabs надає право комерційного використання згенерованого матеріалу, але їхня політика використання прямо забороняє використовувати вихідні дані для навчання, тестування або побудови конкуруючої системи. Практично: аудіофайл може бути використаний у матеріалі клієнта; він не може стати навчальними даними для власної моделі.

Від дослідження до впровадження

Як ми готуємо проєкт із Voice Studio.

01

Уточнюємо матеріал і хто його слухає

Радіоролик, презентаційна нарація і повідомлення для IVR мають різні вимоги до формату, ритму й довжини. Формат експорту обирається тут, а не наприкінці.

02

Спочатку вирішуємо права на голос

Який голос використовується і на підставі якої згоди. Якщо потрібен новий голос, клонування вимагає зразків і згоди людини, а не лише аудіофайлу.

03

Генеруємо, слухаємо і виправляємо текст, а не налаштування

Більшість проблем із вимовою вирішуються переписуванням тексту, а не переміщенням повзунків: абревіатури розгортаються, числа пишуться словами там, де є неоднозначність, а власні назви тестуються окремо перед тим, як їх вставити у фразу.

04

Передаємо файл і фіксуємо, що дозволено

Експорт перевірено, плюс примітка про використану голосову модель і межі використання — щоб матеріал можна було повторно використовувати через шість місяців без повторного запуску розмови про права.

Питання, які варто уточнити.

Якого постачальника ви використовуєте?

ElevenLabs. Наша серверна функція безпосередньо викликає api.elevenlabs.io, endpoint синтезу. Це не абстрактний постачальник: від нього залежать доступні голоси, вартість, формати виходу та правила використання результату.

Які голоси я можу використовувати?

Ті, що закріплені в інтерфейсі, які є клонованими голосами з наданих зразків — не голосами з бібліотеки. Новий голос створюється шляхом завантаження зразків через інтерфейс клонування ElevenLabs, з їхнім лімітом у 11 MB на файл; понад нього ми автоматично перепаковуємо до mono 22 kHz 64 kbps. Частина, яка не є технічною, є тією, що має значення: клонування голосу людини потребує згоди цієї людини. У Республіці Молдова голос є біометричними даними з 23 серпня 2026 року, отже публічний запис нічого не дозволяє.

Скільки тексту я можу надіслати одразу?

5.000 символів на запит, ліміт, встановлений нами, а не постачальником. Причина — вартість: хибний запит із текстом у сто разів довшим — це рахунок, а не помилка. Функція має 60 секунд на виконання, чого достатньо для блоку такого розміру.

У яких форматах експортує?

MP3 на 44,1 kHz 128 kbps (за замовчуванням) або 192 kbps, MP3 22 kHz 32 kbps для малої розмірності, PCM 44,1 kHz для сирого WAV, і μ-law 8 kHz для телефонії. Останній — це той, про який усі забувають, а потім виявляють, що матеріал погано звучить у телефонній станції.

Чи можу я використовувати згенероване аудіо, щоб навчити власний голос?

Ні. Підписка ElevenLabs надає вам право комерційного використання матеріалу, але їхня політика використання прямо забороняє використовувати вихід для навчання, тестування або розробки конкуруючої системи. Файл, переданий клієнту, є допустимим; той самий файл як навчальні дані для власної моделі — ні. Це розрізнення дорого коштує, якщо його ігнорувати, і саме тому Grai не навчається на нічому, що вийшло звідси.

Чи зберігається десь те, що я згенерував?

Ні. Історія живе в пам’яті вкладки, максимум 12 генерацій, і зникає після перезавантаження. Немає облікового запису, бази даних або зберігання на сервері; аудіовідповідь явно позначена як такою, що не кешується. Якщо вам потрібен файл, ви завантажуєте його в той момент.

Чи можу я користуватися ним самостійно?

Не сьогодні. Deployment перебуває за автентифікацією Vercel і, опційно, за додатковим токеном доступу, який запитується як заголовок у кожному запиті. Це внутрішній робочий інструмент для виробництва матеріалів, а не сервіс із реєстрацією. Те, що ми передаємо, — це аудіоматеріал, а не доступ до панелі.

Ілюстративний приклад

Нарація презентаційного матеріалу, двома мовами

Сценарій використання, без даних клієнта чи приписаних комерційних результатів.

Початкова ситуація

Текст презентації продукту, який потрібно прочитати румунською та російською однією й тією ж голосовою моделлю, з тією самою енергією.

Як працює

Обирається Eleven v3 для виразності та явно примусово встановлюється мова для кожного варіанта, замість того щоб залишати її на автоматичне визначення — у текстах із власними назвами визначення помиляється саме там, де це чути найсильніше. Стабільність ставиться на Natural; паузи позначаються в тексті [pause] і [short pause] у точній позиції, а не в кінці речення. Прослуховується й виправляється текст, а не повзунки.

Rezultatul

Два файли MP3 із частотою 44,1 kHz, той самий голос, та сама енергія, завантажені в момент генерації. Якщо матеріал має піти в монтаж, береться PCM замість MP3, щоб не стискати двічі.

Ce este necesar:Vocea trebuie să fie una pentru care există acordul persoanei clonate. Textul nu trebuie să conțină informație care nu are voie să ajungă la un furnizor extern.

Можливості співпраці

Voice Studio, у контексті вашої організації.

Обробка аудіоконтенту

Проєкти транскрипції та генерації голосу на матеріалах, для яких існують права на використання та задокументована мета.

Приватні компанії

Ми визначаємо пілот навколо реального процесу: користувачі, дані, інтеграції, витрати та критерії приймання. Розширення відбувається після оцінки результату.

Державні установи та компанії

Визначаємо вимоги до доступності, хостингу, захисту даних та інтероперабельності. Будь-яке з’єднання з послугами AGE або STISC потребує валідації придатності, доступу та схвалень.

Це сценарії адаптації, а не заяви про наявні контракти чи партнерства. Запропоновані функції підтверджуються в межах робочої сфери проєкту.

Обговорити пілот

Частина екосистеми.

Що вам хотілося б налагодити?

Розкажіть про свій процес. Разом визначимо, що варто збудувати, що можна підключити і як перевіримо результат.

Поговорімо