Перейти до основного вмісту
megapromotingПоговорімо
Продукти Grai

Голосові дослідження Cercetare & dezvoltare

Голос, створений для того, як ми говоримо.

Grai є нашим напрямом досліджень для синтезу голосу та моделей, адаптованих до мов, що використовуються тут. Ми працюємо над вимовою, виразністю та зв’язком між голосовою моделлю й розмовними застосунками.

  1. 1Date autorizate
  2. 2Model și evaluare
  3. 3Sinteză vocală
Schemă explicativă ·Grai

Grai

Від інформації до виконаної роботи.

01

Дані та мова

Підготовка та оцінка голосового матеріалу, що використовується з необхідними правами.

02

Model

Експерименти щодо вимови, ритму та виразності.

03

Aplicație

Оцінка моделі в розмовних сценаріях і доступ через API.

Де стає корисним.

Română

Увага до вимови та ритму мовлення, зокрема в локальних контекстах.

Багатомовні експерименти

Дослідження та оцінка для румунської та російської мов.

Голосові агенти

Kallina — це платформа агентів; Grai — це окремий напрям розвитку голосової моделі.

Ми представляємо проєкт у дослідженні, з результатами, які оцінюються ітеративно. Доступність моделі для продакшну підтверджується окремо.

Grai докладно

Що ви можете робити з цим проєктом.

Grai — це наш дослідницький проєкт з голосу румунською мовою. Це не продукт, його не можна купити, і в нього немає кнопки спробувати. Це спроба зрозуміти, чому румунська мова погано обслуговується наявними голосовими системами і скільки коштувало б обслуговувати її краще.

Архітектура, яку ми вивчаємо, каскадна, а не нативно duplex: розпізнавання → мовна модель → синтез, три окремі компоненти. Розпізнавання і синтез працюють локально, на процесорі; мовна модель є змінною і знаходиться поза машиною, за gateway, сумісним з OpenAI. Вибір є навмисним і має ціну, яку ми вимірюємо.

Різниця, яка має значення: Grai досліджує голос. Kallina організовує розмову та дії. Voice Studio створює аудіофайли з інтегрованими постачальниками. Це три різні речі, і єдина з них, що є дослідженням, — це Grai.

01

Що ми досліджуємо: розпізнавання румунською, виміряне на FLEURS

Протокол зафіксований і задекларований: 200 висловлювань на мову з тестового набору FLEURS, обраних рівномірно випадково із seed 20260831, потокове декодування з урахуванням cache — не офлайн-декодування по всьому файлу, яке є легшим і дає красивіші цифри. Власний результат на стандартному вікні 1120 ms: 26,31% rate de eroare pe cuvinte у румунській, 9,30% у російській.

02

Куди йде час у розмові

Ми вимірюємо кожен сегмент за двома спостережуваними кінцями, а не обчисленими. За опублікованим розподілом, мовна модель — далеко найбільша частка: 2180 ms, порівняно з 92 ms розпізнавання і 305 ms синтезу. Корисний висновок такий: для голосової розмови швидкість не виграється оптимізацією розпізнавання — воно вже майже безкоштовне. Виграється на мовній моделі.

03

Цифри ламаються саме там, де ламається і реальна розмова

Ми розділили вибірку на висловлювання з цифрами і без. Без цифр: 25,08% помилка. З цифрами: 30,37%. Різниця понад п’ять пунктів — це найкорисніше спостереження дослідження, бо саме там живуть бізнес-випадки — номери телефонів, суми, дати, номери замовлень. Система, яка звучить добре на прозі, може бути непридатною для замовлення.

04

Виявлення кінця черги, яке є реальною проблемою переривання

Фіксований поріг тиші — це звичайна помилка. За нашими вимірюваннями, фіксований поріг дає помилку на 820 ms; на просодії — на 560 ms. Рівень правильного відсікання — 52% — практично кинута монета, і ми це кажемо, бо це точка, з якої починається запропоноване навчання, а не результат, яким ми хвалимося.

05

Інвентар даних, з його ліцензіями

Ми інвентаризували сім корпусів для румунської мови і для кожного зазначили ліцензію та чи дозволяє вона комерційне використання. Практичний висновок: найбільші ресурси для румунської є некомерційними, а чистий шлях залишається VoxPopuli під CC0 — 89 годин — плюс голос, записаний нами, з передачею прав і біометричною згодою. У Республіці Молдова Закон 195/2024 трактує голос як біометричні дані і діє з 23 серпня 2026.

Дані та робота

Що входить у систему. Що потрібно перевірити.

Голос — це біометричні дані
У Республіці Молдова Закон 195/2024 діє з 23 серпня 2026 і відносить голос до біометричних даних. Практично: публічний запис не авторизує використання голосової ідентичності будь-кого. Будь-який проєкт, що клонують голос, потребує явної згоди і передачі прав, а не лише доступу до файлу.
Ліцензії корпусів визначають, що можна створити
Із семи корпусів, інвентаризованих для румунської, два з найбільших є явно некомерційними, а один закритий за шлюзом доступу. Модель, навчена на некомерційних даних, не може потрапити в продукт, незалежно від того, як добре це звучить. Саме тому інвентар ліцензій робиться до навчання, а не після.
Компонент синтезу, на якому все тримається, перебуває наприкінці життєвого циклу
Модель синтезу, використана в каскаді, була архівована її авторами: без розвитку і без офіційної підтримки, а їхній інструмент для створення голосів був закритий 31 серпня 2026 року. Ваги залишаються доступними, і модель і далі працює локально, але більше нічого не отримує. Це переносить власний синтез із «можливо, пізніше» в критичний шлях, і це зміна плану, про яку ми воліємо сказати, ніж приховувати її.
Набір для оцінювання не змішується з набором для навчання
Це елементарне правило, і його порушують найчастіше. Порівняння має сенс лише тоді, коли збережено версію моделі, текст, зерно і критерій. Наше дослідження зазначає, що ми самі припустилися помилки вимірювання на власному сайті: цифра затримки 455 мс запускала секундомір після розпізнавання, отже вимірювала не те, що натякало; реальна цифра була приблизно у п’ять разів більшою.

Від дослідження до впровадження

Як ми готуємо проєкт із Grai.

01

Визначаємо, що саме вимірюється, до того як вимірювати

Мова, тип тексту, аудиторія, умови прослуховування і, передусім, де запускається секундомір. Більшість цифр затримки на ринку не є порівнюваними, бо вимірюють різні сегменти тієї самої розмови.

02

Будуємо тестовий набір, який містить складну частину

Власні назви, населені пункти, скорочення і, обов’язково, числа. Різниця понад п’ять пунктів між вимовами з цифрами і без них — причина, чому тестовий набір, що складається лише з прози, нічого не каже про бізнес-кейс.

03

Перевіряємо ліцензію перед будь-яким навчанням

Для кожного корпусу: хто ним володіє, яку ліцензію він має, чи дозволяє комерційне використання і чи охоплює похідну роботу. Для записаного голосу: біометрична згода і письмова передача прав.

04

Публікуємо й результат, який нас не влаштовує

За точністю в румунській ми поступаємося великим комерційним системам. Це написано на нашому власному сайті, у таблиці порівняння, де рядки третіх сторін позначені як заявлені, а наші — як виміряні. Порівняння, у якому ви завжди виходите першим, — це порівняння, у яке ніхто не повинен вірити.

Питання, які варто уточнити.

Чи можу я використовувати Grai в проєкті сьогодні?

Ні. Немає публічної демонстрації, немає публічного API, немає інтеграції телефонії, немає нативного дуплексу, і клонування голосу не входить до продукту. Усі п’ять пунктів перелічені як відсутні у нашій власній дорожній карті. Якщо вам потрібен голосовий агент, який працює зараз, відповідь — Kallina, а не Grai; якщо вам потрібен аудіофайл, це Voice Studio.

Що саме було виміряно і наскільки добрий результат?

На розпізнаванні румунською мовою — 26,31% рівень помилки по словах на типовому вікні 1120 мс, з 95% довірчим інтервалом між 24,07 і 28,60; російською — 9,30%. Протокол: 200 висловлювань на мову з FLEURS, seed 20260831, потокове декодування. Наскільки це добре: не добре. Наш власний висновок, написаний у таблиці порівняння, полягає в тому, що за точністю румунською ми поступаємося комерційним системам, у п’ять до дев’яти разів. Румунську майже втричі важче розпізнавати, ніж російську, за тієї самої конфігурації, і саме це ми й досліджуємо.

Чому втрачається час і де можна виграти?

За виміряним розподілом, мовна модель забирає 2180 мс із траєкторії, розпізнавання — 92 мс, а синтез — 305 мс. Розпізнавання практично безкоштовне; синтез майже так само. Хто хоче швидшу голосову розмову, має атакувати мовну модель — через меншу модель, через потокову передачу відповіді або через скорочення відповідей. Тут треба бути чесними й із собою: опубліковані на сайті сегментні цифри не складаються в опублікований на тому ж екрані загальний показник, і різниця становить приблизно пів секунди. Розподіл — це те, в чому ми впевнені; агрегований загальний показник треба перерахувати перед тим, як його цитувати.

Чому каскадна архітектура, а не нативний duplex?

Тому що в каскаді можна змінювати кожен компонент окремо і можна тримати розпізнавання та синтез локально, на процесорі, без GPU. Ціна — затримка ланцюжка і те, що мовна модель, яка є найбільшою частиною затримки, знаходиться поза машиною. Нативний duplex — це напрям, а не те, що ми маємо — він у списку «ще не існує».

Скільки це коштувало б, щоб бути кращим?

Дорожня карта пропонує три навчання загалом менш ніж за 1.200 доларів: розпізнавання для румунської на VoxPopuli CC0, 89 годин, приблизно 50 годин H100, близько 500 доларів; детектор кінця черги для румунської, приблизно 2.000 власних зразків, менш ніж 100 доларів; власний голос, 500-800 доларів. Третє не заблоковано грошима, а даними — і тим, що модель синтезу, на яку ми спиралися, була заархівована її авторами. Цільова цифра для першого навчання, близько 21%, — це екстраполяція з поліпшень, отриманих на грецькій і болгарській, а не вимірювання.

Чи може це відтворювати голос людини?

Досліджуваний метод — це зворотна оптимізація на заморожених вагових коефіцієнтах, а не клонування за кілька секунд: 6-30 хвилин матеріалу на один голос, приблизно 3.000 кроків оптимізації, 2,6 GB пікової пам’яті, а доставлений артефакт — порядку кілобайтів. Але це не в продукті, і важливо сказати, чому це не лише технічне питання: у Республіці Молдова голос є біометричними даними з 23 серпня 2026 року. Без явної згоди та відступлення питання не в тому, чи можна, а в тому, що так не роблять.

Чому ви публікуєте цифри, які виставляють вас у поганому світлі?

Тому що інакше не мало б сенсу публікувати їх взагалі. Таблиця, в якій ви завжди перші, — це маркетингова таблиця. Наша позначає рядки третіх сторін як заявлені, а лише наші — як виміряні, і висновок під нею каже, що ми програємо. Втім, треба чітко сказати і те, чого не може ніхто ззовні: код, який створив ці вимірювання, не є публічним і не супроводжує сайт, тож цифри не можуть бути відтворені третьою стороною сьогодні. Сприймайте їх як внутрішні вимірювання, а не як незалежно перевірені результати.

Ілюстративний приклад

Чому голосовий агент спотикається саме на номері телефону

Сценарій використання, без даних клієнта чи приписаних комерційних результатів.

Початкова ситуація

Голосовий агент румунською добре справляється з початковою розмовою і помиляється саме тоді, коли клієнт диктує номер телефону або суму.

Як працює

Ми розділили вибірку з 200 висловлювань FLEURS на дві частини: 163 без цифр і 37 з цифрами, а потім виміряли окремо.

Rezultatul

25,08% рівень помилки без цифр, 30,37% з цифрами — понад п’ять пунктів різниці, а на сирій транскрипції, без нормалізації, прірва зростає до понад одинадцяти пунктів. Це не враження: це частина даних, де розпізнавання дає збій, і саме це є частиною, від якої залежить бізнес-кейс.

Ce este necesar:Un set de test care conține efectiv partea grea. Un set format din proză curată nu ar fi arătat niciodată această diferență, iar sistemul ar fi părut mai bun decât e.

Можливості співпраці

Grai, у контексті вашої організації.

Обробка аудіоконтенту

Проєкти транскрипції та генерації голосу на матеріалах, для яких існують права на використання та задокументована мета.

Приватні компанії

Ми визначаємо пілот навколо реального процесу: користувачі, дані, інтеграції, витрати та критерії приймання. Розширення відбувається після оцінки результату.

Державні установи та компанії

Визначаємо вимоги до доступності, хостингу, захисту даних та інтероперабельності. Будь-яке з’єднання з послугами AGE або STISC потребує валідації придатності, доступу та схвалень.

Це сценарії адаптації, а не заяви про наявні контракти чи партнерства. Запропоновані функції підтверджуються в межах робочої сфери проєкту.

Обговорити пілот

Частина екосистеми.

Що вам хотілося б налагодити?

Розкажіть про свій процес. Разом визначимо, що варто збудувати, що можна підключити і як перевіримо результат.

Поговорімо