Вы подготавливаете текст
Вы пишете материал и выбираете голос, авторизованный для использования.
Producție vocală Instrument specializat
Студия для генерации, прослушивания и скачивания голосовых материалов с помощью моделей text-to-speech. Интерфейс объединяет выбор голоса и настройки, полезные для производства.
Voice Studio
Вы пишете материал и выбираете голос, авторизованный для использования.
Вы настраиваете параметры и доступные опции голосовой модели.
Вы прослушиваете, исправляете и скачиваете материал для проекта.
Пояснительные материалы, презентации и аудиоконтент.
Поток генерации и проверки для контент-команд.
Сравнение интерпретаций текста перед использованием.
Инструмент использует голосовые модели интегрированных поставщиков. Применяются затраты, права на голоса и правила поставщика.
Voice Studio в деталях
Voice Studio — это цепочка от текста до аудиофайла: вы пишете текст, выбираете голос, ставите метки эмоций и пауз, настраиваете модель, прослушиваете, исправляете и скачиваете. Поставщик — ElevenLabs — мы называем его по имени, потому что именно это определяет, какие голоса можно использовать, сколько это стоит и что вам разрешено делать с результатом.
Часть, которую не видно и которая на самом деле является причиной существования инструмента: API-ключ никогда не попадает в браузер. Интерфейс отправляет только текст в собственную серверную функцию, а та хранит ключ и взаимодействует с ElevenLabs. Без этого слоя любая страница, которая генерирует голос, раскрывает свой ключ любому, кто откроет консоль браузера.
Это не Grai. Grai — это исследование голосовой модели, без продукта. Voice Studio — это производство с интегрированным поставщиком, доступное уже сегодня. Эти два решения не разделяют ни один код.
Eleven v3 для выразительности и меток эмоций, Multilingual v2 для стабильности, Turbo v2.5 для стоимости, Flash v2.5 для минимальной задержки. Это не четыре варианта одного и того же: v3 принимает метки, которые остальные игнорируют, а Flash жертвует нюансами ради скорости.
В Eleven v3 вы можете вставлять в текст 14 эмоциональных состояний (от [excited] и [whispers] до [sarcastic] и [tired]), 9 невербальных и паузных меток ([laughs], [sighs], [clears throat], [pause], [breathes]) и 7 меток подачи ([rushed], [drawn out], [singing], [muttering], [quietly]). Они вставляются в позицию курсора, потому что место имеет значение не меньше, чем сама метка.
Стабильность, сходство с исходным голосом, степень стилизации, скорость от 0,7 до 1,2, плюс импульс говорящего. В v3 стабильность — это не непрерывный ползунок, а три ступени — Creative, Natural, Robust — потому что модель ведёт себя дискретно, а не непрерывно, и тонкий ползунок создавал бы иллюзию несуществующего контроля.
MP3 при 44,1 kHz 128 или 192 kbps, MP3 22 kHz 32 kbps для небольших файлов, PCM 44,1 kHz для необработанного WAV, который входит в монтаж, и μ-law 8 kHz — формат телефонии, если материал попадает в IVR или в телефонную станцию.
Румынский, русский, английский, украинский, французский, итальянский, испанский, немецкий — или оставить на автомате. Принудительный выбор языка важен в смешанных текстах, где автоматическое определение ошибается именно на именах собственных.
Данные и работа
От исследования к внедрению
Радиоролик, презентационная озвучка и IVR-сообщение имеют разные требования к формату, ритму и длине. Формат экспорта выбирается здесь, а не в конце.
Какой голос используется и на каком основании согласия. Если нужен новый голос, клонирование требует образцов и согласия человека, а не только аудиофайла.
Большинство проблем с произношением решаются переписыванием текста, а не перемещением ползунков: сокращения раскрываются, числа пишутся словами там, где есть неоднозначность, а собственные имена тестируются отдельно перед тем, как их вставить в предложение.
Проверенный экспорт, плюс примечание о использованном голосе и ограничениях использования — чтобы материал можно было использовать повторно через шесть месяцев без повторного обсуждения прав.
ElevenLabs. Наша серверная функция напрямую вызывает api.elevenlabs.io, endpoint синтеза. Это не абстрактный поставщик: от него зависят доступные голоса, стоимость, форматы вывода и правила использования результата.
Те, что закреплены в интерфейсе, — это клонированные голоса из предоставленных образцов, а не библиотечные голоса. Новый голос создается загрузкой образцов через интерфейс клонирования ElevenLabs, с их лимитом 11 МБ на файл; сверх него мы автоматически перекодируем в mono 22 kHz 64 kbps. Нетехническая часть здесь самая важная: клонирование голоса человека требует согласия этого человека. В Республике Молдова голос является биометрическими данными с 23 августа 2026, поэтому публичная запись ничего не авторизует.
5.000 символов на запрос, лимит, установленный нами, а не поставщиком. Причина — стоимость: ошибочный запрос с текстом в сто раз длиннее — это счет, а не ошибка. Функция имеет 60 секунд на выполнение, чего достаточно для блока такого размера.
MP3 44,1 kHz 128 kbps (по умолчанию) или 192 kbps, MP3 22 kHz 32 kbps для маленького размера, PCM 44,1 kHz для необработанного WAV и μ-law 8 kHz для телефонии. Последний — тот, о котором все забывают, а потом обнаруживают, что материал плохо звучит в телефонной станции.
Нет. Подписка ElevenLabs дает вам право коммерческого использования материала, но их политика использования прямо запрещает применять выход для обучения, тестирования или разработки конкурирующей системы. Файл, переданный клиенту, — это нормально; тот же файл как данные для обучения собственной модели — нет. Это различие дорого стоит, если его игнорировать, и именно поэтому Grai не обучается ни на чем, что выходит отсюда.
Нет. История живет в памяти вкладки, максимум 12 генераций, и исчезает при перезагрузке. Нет ни аккаунта, ни базы данных, ни хранения на сервере; аудиоответ явно помечен как не подлежащий кэшированию. Если вам нужен файл, вы скачиваете его в тот момент.
Не сегодня. Развертывание находится за аутентификацией Vercel и, опционально, за дополнительным токеном доступа, который требуется как заголовок в каждом запросе. Это внутренний рабочий инструмент для производства материалов, а не сервис с регистрацией. Мы поставляем аудиоматериал, а не доступ к панели.
Показательный пример
Сценарий использования, без данных клиента или приписанных коммерческих результатов.
Текст продуктовой презентации, который нужно прочитать на румынском и русском одним и тем же голосом, с той же энергией.
Выбирается Eleven v3 для выразительности и язык явно принудительно задается для каждой версии, вместо того чтобы полагаться на автоматическое определение — в текстах с собственными именами определение ошибается именно там, где это слышно сильнее всего. Стабильность ставится на Natural; паузы отмечаются в тексте как [pause] и [short pause] в точной позиции, а не в конце фразы. Слушают и исправляют текст, а не ползунки.
Два файла MP3 44,1 kHz, один и тот же голос, одна и та же энергия, скачанные в момент генерации. Если материал должен пойти в монтаж, берут PCM вместо MP3, чтобы не сжимать дважды.
Ce este necesar:Vocea trebuie să fie una pentru care există acordul persoanei clonate. Textul nu trebuie să conțină informație care nu are voie să ajungă la un furnizor extern.
Возможности сотрудничества
Проекты по транскрибации и голосовой генерации на материалах, для которых есть право использования и задокументированная цель.
Мы определяем пилот вокруг реального процесса: пользователи, данные, интеграции, затраты и критерии приемки. Масштабирование следует после оценки результата.
Мы устанавливаем требования к доступности, размещению, защите данных и совместимости. Любое соединение с сервисами AGE или STISC требует проверки соответствия, доступа и утверждений.
Это сценарии адаптации, а не заявления о существующих контрактах или партнерствах. Предлагаемые функции подтверждаются в рабочей области проекта.
Обсудить пилотСтроим агентов, которые принимают и инициируют звонки, используют информацию бизнеса и работают с вашими системами.
PlatformăGrai — наше исследовательское направление в синтезе речи и моделях, приспособленных к языкам, на которых здесь говорят.
Cercetare & dezvoltareИнструмент для захвата, транскрибации и организации радиорекламы.
Instrument specializatРасскажите о своём процессе. Вместе определим, что стоит построить, что можно подключить и как проверим результат.