Данные и язык
Подготовка и оценка голосового материала, используемого с необходимыми правами.
Голосовые исследования Cercetare & dezvoltare
Grai — это наше направление исследований для синтеза голоса и моделей, адаптированных к языкам, используемым здесь. Мы работаем над произношением, выразительностью и связью между моделью голоса и разговорными приложениями.
Grai
Подготовка и оценка голосового материала, используемого с необходимыми правами.
Эксперименты по произношению, ритму и выразительности.
Оценка модели в разговорных сценариях и доступ через API.
Внимание к произношению и ритму речи, в том числе в локальных контекстах.
Исследование и оценка для румынского и русского.
Kallina — платформа агентов; Grai — отдельное направление разработки голосовой модели.
Мы представляем проект в исследовании, с результатами, которые оцениваются итеративно. Доступность модели для производства подтверждается отдельно.
Grai подробнее
Grai — наш исследовательский проект по голосу на румынском языке. Это не продукт, его нельзя купить, и у него нет кнопки попробовать. Это попытка понять, почему румынский язык плохо обслуживается существующими голосовыми системами и сколько бы стоило обслуживать его лучше.
Изучаемая нами архитектура каскадная, а не нативно duplex: распознавание → языковая модель → синтез, три отдельные компонента. Распознавание и синтез работают локально, на процессоре; языковая модель заменяемая и находится вне машины, за шлюзом, совместимым с OpenAI. Выбор сделан намеренно и имеет цену, которую мы измеряем.
Различие, которое имеет значение: Grai исследует голос. Kallina организует разговор и действия. Voice Studio производит аудиофайлы с интегрированными поставщиками. Это три разные вещи, и единственное из них, что является исследованием, — это Grai.
Протокол фиксирован и объявлен: 200 высказываний на язык из тестового набора FLEURS, равномерно случайно выбранных с семенем 20260831, потоковое декодирование с учётом кэша — не офлайн-декодирование по всему файлу, которое проще и даёт более красивые цифры. Собственный результат на окне по умолчанию 1120 ms: 26,31% ошибка по словам на румынском, 9,30% на русском.
Мы измеряем каждый сегмент по двум наблюдаемым концам, а не вычисляемым. По опубликованной разбивке модель языка — с большим отрывом самый крупный кусок: 2180 ms, против 92 ms распознавания и 305 ms синтеза. Полезный вывод в том, что для голосового разговора скорость не выигрывается за счёт оптимизации распознавания — оно и так почти бесплатно. Она выигрывается на модели языка.
Мы разделили выборку на высказывания с цифрами и без. Без цифр: 25,08% ошибка. С цифрами: 30,37%. Разница более чем в пять пунктов — самое полезное наблюдение исследования, потому что именно там живут бизнес-кейсы — номера телефонов, суммы, даты, номера заказов. Система, которая звучит хорошо на прозе, может быть непригодной на заказе.
Фиксированный порог тишины — обычная ошибка. По собственному измерению, фиксированный порог достигает равной ошибки при 820 ms; по просодии — при 560 ms. Правильная частота отсечения — 52% — практически подброшенная монета, и мы говорим это потому, что это точка, с которой начинается предложенное обучение, а не результат, которым мы хвастаемся.
Мы инвентаризировали семь корпусов для румынского языка и для каждого отметили лицензию и то, разрешает ли она коммерческое использование. Практический вывод: самые большие ресурсы для румынского языка некоммерческие, а чистый путь остаётся VoxPopuli под CC0 — 89 часов — плюс записанный нами голос, с уступкой прав и биометрическим согласием. В Республике Молдова Закон 195/2024 рассматривает голос как биометрические данные и действует с 23 августа 2026.
Данные и работа
От исследования к внедрению
Язык, тип текста, аудитория, условия прослушивания и, прежде всего, где запускается таймер. Большинство цифр задержки на рынке несопоставимы, потому что измеряют разные сегменты одного и того же разговора.
Собственные имена, населённые пункты, сокращения и, обязательно, числа. Разница более пяти пунктов между произношениями с цифрами и без них — причина, по которой тестовый набор, состоящий только из прозы, ничего не говорит о бизнес-кейсе.
Для каждого корпуса: кто им владеет, какая у него лицензия, разрешает ли она коммерческое использование и покрывает ли производную работу. Для записанного голоса: биометрическое согласие и письменная уступка прав.
По точности на румынском мы проигрываем крупным коммерческим системам. Это написано на нашем собственном сайте, в таблице сравнения, где строки третьих сторон помечены как заявленные, а наши — как измеренные. Сравнение, в котором вы всегда первый, — это сравнение, в которое никто не должен верить.
Нет. Нет публичной демонстрации, нет публичного API, нет интеграции телефонии, нет нативного duplex, и клонирование голоса не входит в продукт. Все пять пунктов указаны как отсутствующие в нашей собственной дорожной карте. Если вам нужен голосовой агент, который работает сейчас, ответ — Kallina, а не Grai; если вам нужен аудиофайл, это Voice Studio.
По распознаванию на румынском — 26,31% ошибки по словам на стандартном окне 1120 мс, с 95% доверительным интервалом от 24,07 до 28,60; на русском — 9,30%. Протокол: 200 произнесений на язык из FLEURS, seed 20260831, потоковая декодировка. Насколько это хорошо: не хорошо. Наш собственный вывод, написанный в таблице сравнения, состоит в том, что по точности на румынском мы проигрываем коммерческим системам, с коэффициентом от пяти до девяти. Румынский почти в три раза труднее распознавать, чем русский, при той же конфигурации, и это как раз та проблема, которую мы изучаем.
По измеренному разложению языковая модель забирает 2180 мс из тракта, распознавание — 92 мс, а синтез — 305 мс. Распознавание фактически бесплатное; синтез почти такой же. Тому, кто хочет более быстрый голосовой разговор, нужно атаковать языковую модель — через меньшую модель, через потоковую передачу ответа или через сокращение ответов. Здесь мы должны быть честны и с собой: опубликованные на сайте цифры сегментов не складываются в опубликованный на том же экране итог, и разница составляет примерно полсекунды. Разложение — это то, чему мы доверяем; агрегированный итог нужно пересчитать до того, как его цитировать.
Потому что в каскаде можно отдельно менять каждый компонент и держать распознавание и синтез локально, на процессоре, без GPU. Цена — последовательная задержка и то, что языковая модель, которая составляет самую большую часть задержки, находится вне машины. Нативный duplex — это направление, а не то, что у нас есть — он в списке «ещё не существует».
Дорожная карта предлагает три обучения в сумме менее 1.200 долларов: распознавание для румынского на VoxPopuli CC0, 89 часов, около 50 часов на H100, примерно 500 долларов; детектор конца реплики для румынского, примерно 2.000 собственных примеров, менее 100 долларов; собственный голос, 500-800 долларов. Третье ограничено не деньгами, а данными — и тем, что модель синтеза, на которую мы опирались, была архивирована её авторами. Целевая цифра для первого обучения, около 21%, — это экстраполяция из улучшений, полученных на греческом и болгарском, а не измерение.
Изученный метод — обратная оптимизация по замороженным весам, а не клонирование по нескольким секундам: 6–30 минут материала на голос, примерно 3 000 шагов оптимизации, 2,6 ГБ пиковой памяти, поставляемый артефакт — порядка килобайт. Но это не в продукте, и важно сказать, почему это не только технический вопрос: в Республике Молдова голос является биометрическими данными с 23 августа 2026 года. Без явного согласия и передачи прав вопрос не в том, можно ли, а в том, что это не делается.
Потому что иначе не было бы смысла публиковать их вообще. Таблица, в которой вы всегда первые, — это таблица маркетинга. Наша помечает строки третьих сторон как заявленные, а только наши — как измеренные, и написанный под ней вывод говорит, что мы проигрываем. Но нужно также ясно сказать и то, чего не может сделать никто извне: код, который произвёл эти измерения, не опубликован и не сопровождает сайт, поэтому цифры сегодня не может воспроизвести третья сторона. Считайте их внутренними измерениями, а не независимо верифицированными результатами.
Показательный пример
Сценарий использования, без данных клиента или приписанных коммерческих результатов.
Голосовой агент на румынском хорошо справляется с началом разговора и ошибается именно тогда, когда клиент диктует номер телефона или сумму.
Мы разделили набор из 200 реплик FLEURS на две части: 163 без цифр и 37 с цифрами, затем измерили отдельно.
25,08% ошибок без цифр, 30,37% с цифрами — разница более пяти пунктов, а на грубой транскрипции, без нормализации, разрыв растёт более чем до одиннадцати пунктов. Это не впечатление: это та часть данных, где распознавание срывается, и именно от неё зависит бизнес-кейс.
Ce este necesar:Un set de test care conține efectiv partea grea. Un set format din proză curată nu ar fi arătat niciodată această diferență, iar sistemul ar fi părut mai bun decât e.
Возможности сотрудничества
Проекты по транскрибации и голосовой генерации на материалах, для которых есть право использования и задокументированная цель.
Мы определяем пилот вокруг реального процесса: пользователи, данные, интеграции, затраты и критерии приемки. Масштабирование следует после оценки результата.
Мы устанавливаем требования к доступности, размещению, защите данных и совместимости. Любое соединение с сервисами AGE или STISC требует проверки соответствия, доступа и утверждений.
Это сценарии адаптации, а не заявления о существующих контрактах или партнерствах. Предлагаемые функции подтверждаются в рабочей области проекта.
Обсудить пилотСтроим агентов, которые принимают и инициируют звонки, используют информацию бизнеса и работают с вашими системами.
PlatformăДоступ по API к моделям ИИ через общий интерфейс.
PlatformăСтудия для генерации, прослушивания и скачивания голосовых материалов с помощью моделей text-to-speech.
Instrument specializatРасскажите о своём процессе. Вместе определим, что стоит построить, что можно подключить и как проверим результат.