Перейти к основному содержимому
megapromotingДавайте обсудим
Продукты Grai

Голосовые исследования Cercetare & dezvoltare

Голос, созданный для того, как мы говорим.

Grai — это наше направление исследований для синтеза голоса и моделей, адаптированных к языкам, используемым здесь. Мы работаем над произношением, выразительностью и связью между моделью голоса и разговорными приложениями.

  1. 1Date autorizate
  2. 2Model și evaluare
  3. 3Sinteză vocală
Schemă explicativă ·Grai

Grai

От информации к сделанному делу.

01

Данные и язык

Подготовка и оценка голосового материала, используемого с необходимыми правами.

02

Model

Эксперименты по произношению, ритму и выразительности.

03

Aplicație

Оценка модели в разговорных сценариях и доступ через API.

Где это становится полезным.

Română

Внимание к произношению и ритму речи, в том числе в локальных контекстах.

Многоязычные эксперименты

Исследование и оценка для румынского и русского.

Голосовые агенты

Kallina — платформа агентов; Grai — отдельное направление разработки голосовой модели.

Мы представляем проект в исследовании, с результатами, которые оцениваются итеративно. Доступность модели для производства подтверждается отдельно.

Grai подробнее

Что вы можете делать с этим проектом.

Grai — наш исследовательский проект по голосу на румынском языке. Это не продукт, его нельзя купить, и у него нет кнопки попробовать. Это попытка понять, почему румынский язык плохо обслуживается существующими голосовыми системами и сколько бы стоило обслуживать его лучше.

Изучаемая нами архитектура каскадная, а не нативно duplex: распознавание → языковая модель → синтез, три отдельные компонента. Распознавание и синтез работают локально, на процессоре; языковая модель заменяемая и находится вне машины, за шлюзом, совместимым с OpenAI. Выбор сделан намеренно и имеет цену, которую мы измеряем.

Различие, которое имеет значение: Grai исследует голос. Kallina организует разговор и действия. Voice Studio производит аудиофайлы с интегрированными поставщиками. Это три разные вещи, и единственное из них, что является исследованием, — это Grai.

01

Что мы изучаем: распознавание на румынском, измеренное на FLEURS

Протокол фиксирован и объявлен: 200 высказываний на язык из тестового набора FLEURS, равномерно случайно выбранных с семенем 20260831, потоковое декодирование с учётом кэша — не офлайн-декодирование по всему файлу, которое проще и даёт более красивые цифры. Собственный результат на окне по умолчанию 1120 ms: 26,31% ошибка по словам на румынском, 9,30% на русском.

02

Куда уходит время в разговоре

Мы измеряем каждый сегмент по двум наблюдаемым концам, а не вычисляемым. По опубликованной разбивке модель языка — с большим отрывом самый крупный кусок: 2180 ms, против 92 ms распознавания и 305 ms синтеза. Полезный вывод в том, что для голосового разговора скорость не выигрывается за счёт оптимизации распознавания — оно и так почти бесплатно. Она выигрывается на модели языка.

03

Цифры ломаются точно там, где ломается и реальный разговор

Мы разделили выборку на высказывания с цифрами и без. Без цифр: 25,08% ошибка. С цифрами: 30,37%. Разница более чем в пять пунктов — самое полезное наблюдение исследования, потому что именно там живут бизнес-кейсы — номера телефонов, суммы, даты, номера заказов. Система, которая звучит хорошо на прозе, может быть непригодной на заказе.

04

Определение конца очереди, которое и есть реальная проблема прерывания

Фиксированный порог тишины — обычная ошибка. По собственному измерению, фиксированный порог достигает равной ошибки при 820 ms; по просодии — при 560 ms. Правильная частота отсечения — 52% — практически подброшенная монета, и мы говорим это потому, что это точка, с которой начинается предложенное обучение, а не результат, которым мы хвастаемся.

05

Инвентаризация данных, с их лицензиями

Мы инвентаризировали семь корпусов для румынского языка и для каждого отметили лицензию и то, разрешает ли она коммерческое использование. Практический вывод: самые большие ресурсы для румынского языка некоммерческие, а чистый путь остаётся VoxPopuli под CC0 — 89 часов — плюс записанный нами голос, с уступкой прав и биометрическим согласием. В Республике Молдова Закон 195/2024 рассматривает голос как биометрические данные и действует с 23 августа 2026.

Данные и работа

Что входит в систему. Что нужно проверить.

Голос — биометрические данные
В Республике Молдова Закон 195/2024 действует с 23 августа 2026 и относит голос к биометрическим данным. Практически: публичная запись не даёт разрешения на использование голосовой идентичности кого-либо. Любой проект, который клонирует голос, требует явного согласия и уступки прав, а не только доступа к файлу.
Лицензии корпусов определяют, что можно построить
Из семи инвентаризированных для румынского языка корпусов два из крупнейших прямо некоммерческие, а один закрыт за воротами доступа. Модель, обученная на некоммерческих данных, не может попасть в продукт, независимо от того, насколько хорошо она звучит. Поэтому инвентаризация лицензий делается до обучения, а не после.
Компонент синтеза, на котором всё держится, в конце срока службы
Модель синтеза, использованная в каскаде, была заархивирована ее авторами: без разработки и без официальной поддержки, а их инструмент для построения голосов был закрыт 31 августа 2026 года. Веса остаются доступными, и модель по-прежнему запускается локально, но больше ничего не получает. Это переводит собственный синтез из «может быть, позже» на критический путь, и это изменение плана, о котором мы предпочитаем сказать, а не скрывать.
Набор для оценки не смешивается с набором для обучения
Это элементарное правило, и его чаще всего нарушают. Сравнение имеет смысл только тогда, когда сохраняются версия модели, текст, seed и критерий. Наше исследование отмечает, что мы сами допустили ошибку измерения на собственном сайте: цифра задержки 455 мс запускала таймер после распознавания, то есть измеряла не то, что подразумевалось; реальная цифра была примерно в пять раз выше.

От исследования к внедрению

Как мы готовим проект с Grai.

01

Определяем, что именно измеряется, прежде чем измерять

Язык, тип текста, аудитория, условия прослушивания и, прежде всего, где запускается таймер. Большинство цифр задержки на рынке несопоставимы, потому что измеряют разные сегменты одного и того же разговора.

02

Создаём тестовый набор, который содержит сложную часть

Собственные имена, населённые пункты, сокращения и, обязательно, числа. Разница более пяти пунктов между произношениями с цифрами и без них — причина, по которой тестовый набор, состоящий только из прозы, ничего не говорит о бизнес-кейсе.

03

Проверяем лицензию до любого обучения

Для каждого корпуса: кто им владеет, какая у него лицензия, разрешает ли она коммерческое использование и покрывает ли производную работу. Для записанного голоса: биометрическое согласие и письменная уступка прав.

04

Публикуем и результат, который нам не подходит

По точности на румынском мы проигрываем крупным коммерческим системам. Это написано на нашем собственном сайте, в таблице сравнения, где строки третьих сторон помечены как заявленные, а наши — как измеренные. Сравнение, в котором вы всегда первый, — это сравнение, в которое никто не должен верить.

Вопросы, которые стоит уточнить.

Могу ли я использовать Grai в проекте сегодня?

Нет. Нет публичной демонстрации, нет публичного API, нет интеграции телефонии, нет нативного duplex, и клонирование голоса не входит в продукт. Все пять пунктов указаны как отсутствующие в нашей собственной дорожной карте. Если вам нужен голосовой агент, который работает сейчас, ответ — Kallina, а не Grai; если вам нужен аудиофайл, это Voice Studio.

Что фактически измерялось и насколько хорош результат?

По распознаванию на румынском — 26,31% ошибки по словам на стандартном окне 1120 мс, с 95% доверительным интервалом от 24,07 до 28,60; на русском — 9,30%. Протокол: 200 произнесений на язык из FLEURS, seed 20260831, потоковая декодировка. Насколько это хорошо: не хорошо. Наш собственный вывод, написанный в таблице сравнения, состоит в том, что по точности на румынском мы проигрываем коммерческим системам, с коэффициентом от пяти до девяти. Румынский почти в три раза труднее распознавать, чем русский, при той же конфигурации, и это как раз та проблема, которую мы изучаем.

Почему теряется время и где можно выиграть?

По измеренному разложению языковая модель забирает 2180 мс из тракта, распознавание — 92 мс, а синтез — 305 мс. Распознавание фактически бесплатное; синтез почти такой же. Тому, кто хочет более быстрый голосовой разговор, нужно атаковать языковую модель — через меньшую модель, через потоковую передачу ответа или через сокращение ответов. Здесь мы должны быть честны и с собой: опубликованные на сайте цифры сегментов не складываются в опубликованный на том же экране итог, и разница составляет примерно полсекунды. Разложение — это то, чему мы доверяем; агрегированный итог нужно пересчитать до того, как его цитировать.

Почему каскадная архитектура, а не нативный duplex?

Потому что в каскаде можно отдельно менять каждый компонент и держать распознавание и синтез локально, на процессоре, без GPU. Цена — последовательная задержка и то, что языковая модель, которая составляет самую большую часть задержки, находится вне машины. Нативный duplex — это направление, а не то, что у нас есть — он в списке «ещё не существует».

Во сколько бы это обошлось, чтобы стало лучше?

Дорожная карта предлагает три обучения в сумме менее 1.200 долларов: распознавание для румынского на VoxPopuli CC0, 89 часов, около 50 часов на H100, примерно 500 долларов; детектор конца реплики для румынского, примерно 2.000 собственных примеров, менее 100 долларов; собственный голос, 500-800 долларов. Третье ограничено не деньгами, а данными — и тем, что модель синтеза, на которую мы опирались, была архивирована её авторами. Целевая цифра для первого обучения, около 21%, — это экстраполяция из улучшений, полученных на греческом и болгарском, а не измерение.

Может ли он воспроизвести голос человека?

Изученный метод — обратная оптимизация по замороженным весам, а не клонирование по нескольким секундам: 6–30 минут материала на голос, примерно 3 000 шагов оптимизации, 2,6 ГБ пиковой памяти, поставляемый артефакт — порядка килобайт. Но это не в продукте, и важно сказать, почему это не только технический вопрос: в Республике Молдова голос является биометрическими данными с 23 августа 2026 года. Без явного согласия и передачи прав вопрос не в том, можно ли, а в том, что это не делается.

Почему вы публикуете цифры, которые выставляют вас в плохом свете?

Потому что иначе не было бы смысла публиковать их вообще. Таблица, в которой вы всегда первые, — это таблица маркетинга. Наша помечает строки третьих сторон как заявленные, а только наши — как измеренные, и написанный под ней вывод говорит, что мы проигрываем. Но нужно также ясно сказать и то, чего не может сделать никто извне: код, который произвёл эти измерения, не опубликован и не сопровождает сайт, поэтому цифры сегодня не может воспроизвести третья сторона. Считайте их внутренними измерениями, а не независимо верифицированными результатами.

Показательный пример

Почему голосовой агент спотыкается именно на номере телефона

Сценарий использования, без данных клиента или приписанных коммерческих результатов.

Исходная ситуация

Голосовой агент на румынском хорошо справляется с началом разговора и ошибается именно тогда, когда клиент диктует номер телефона или сумму.

Как это работает

Мы разделили набор из 200 реплик FLEURS на две части: 163 без цифр и 37 с цифрами, затем измерили отдельно.

Rezultatul

25,08% ошибок без цифр, 30,37% с цифрами — разница более пяти пунктов, а на грубой транскрипции, без нормализации, разрыв растёт более чем до одиннадцати пунктов. Это не впечатление: это та часть данных, где распознавание срывается, и именно от неё зависит бизнес-кейс.

Ce este necesar:Un set de test care conține efectiv partea grea. Un set format din proză curată nu ar fi arătat niciodată această diferență, iar sistemul ar fi părut mai bun decât e.

Возможности сотрудничества

Grai, в контексте вашей организации.

Обработка аудиоконтента

Проекты по транскрибации и голосовой генерации на материалах, для которых есть право использования и задокументированная цель.

Частные компании

Мы определяем пилот вокруг реального процесса: пользователи, данные, интеграции, затраты и критерии приемки. Масштабирование следует после оценки результата.

Государственные учреждения и компании

Мы устанавливаем требования к доступности, размещению, защите данных и совместимости. Любое соединение с сервисами AGE или STISC требует проверки соответствия, доступа и утверждений.

Это сценарии адаптации, а не заявления о существующих контрактах или партнерствах. Предлагаемые функции подтверждаются в рабочей области проекта.

Обсудить пилот

Часть экосистемы.

Что вы хотели бы наладить?

Расскажите о своём процессе. Вместе определим, что стоит построить, что можно подключить и как проверим результат.

Давайте обсудим