Дані та мова
Підготовка та оцінка голосового матеріалу, що використовується з необхідними правами.
Голосові дослідження Cercetare & dezvoltare
Grai є нашим напрямом досліджень для синтезу голосу та моделей, адаптованих до мов, що використовуються тут. Ми працюємо над вимовою, виразністю та зв’язком між голосовою моделлю й розмовними застосунками.
Grai
Підготовка та оцінка голосового матеріалу, що використовується з необхідними правами.
Експерименти щодо вимови, ритму та виразності.
Оцінка моделі в розмовних сценаріях і доступ через API.
Увага до вимови та ритму мовлення, зокрема в локальних контекстах.
Дослідження та оцінка для румунської та російської мов.
Kallina — це платформа агентів; Grai — це окремий напрям розвитку голосової моделі.
Ми представляємо проєкт у дослідженні, з результатами, які оцінюються ітеративно. Доступність моделі для продакшну підтверджується окремо.
Grai докладно
Grai — це наш дослідницький проєкт з голосу румунською мовою. Це не продукт, його не можна купити, і в нього немає кнопки спробувати. Це спроба зрозуміти, чому румунська мова погано обслуговується наявними голосовими системами і скільки коштувало б обслуговувати її краще.
Архітектура, яку ми вивчаємо, каскадна, а не нативно duplex: розпізнавання → мовна модель → синтез, три окремі компоненти. Розпізнавання і синтез працюють локально, на процесорі; мовна модель є змінною і знаходиться поза машиною, за gateway, сумісним з OpenAI. Вибір є навмисним і має ціну, яку ми вимірюємо.
Різниця, яка має значення: Grai досліджує голос. Kallina організовує розмову та дії. Voice Studio створює аудіофайли з інтегрованими постачальниками. Це три різні речі, і єдина з них, що є дослідженням, — це Grai.
Протокол зафіксований і задекларований: 200 висловлювань на мову з тестового набору FLEURS, обраних рівномірно випадково із seed 20260831, потокове декодування з урахуванням cache — не офлайн-декодування по всьому файлу, яке є легшим і дає красивіші цифри. Власний результат на стандартному вікні 1120 ms: 26,31% rate de eroare pe cuvinte у румунській, 9,30% у російській.
Ми вимірюємо кожен сегмент за двома спостережуваними кінцями, а не обчисленими. За опублікованим розподілом, мовна модель — далеко найбільша частка: 2180 ms, порівняно з 92 ms розпізнавання і 305 ms синтезу. Корисний висновок такий: для голосової розмови швидкість не виграється оптимізацією розпізнавання — воно вже майже безкоштовне. Виграється на мовній моделі.
Ми розділили вибірку на висловлювання з цифрами і без. Без цифр: 25,08% помилка. З цифрами: 30,37%. Різниця понад п’ять пунктів — це найкорисніше спостереження дослідження, бо саме там живуть бізнес-випадки — номери телефонів, суми, дати, номери замовлень. Система, яка звучить добре на прозі, може бути непридатною для замовлення.
Фіксований поріг тиші — це звичайна помилка. За нашими вимірюваннями, фіксований поріг дає помилку на 820 ms; на просодії — на 560 ms. Рівень правильного відсікання — 52% — практично кинута монета, і ми це кажемо, бо це точка, з якої починається запропоноване навчання, а не результат, яким ми хвалимося.
Ми інвентаризували сім корпусів для румунської мови і для кожного зазначили ліцензію та чи дозволяє вона комерційне використання. Практичний висновок: найбільші ресурси для румунської є некомерційними, а чистий шлях залишається VoxPopuli під CC0 — 89 годин — плюс голос, записаний нами, з передачею прав і біометричною згодою. У Республіці Молдова Закон 195/2024 трактує голос як біометричні дані і діє з 23 серпня 2026.
Дані та робота
Від дослідження до впровадження
Мова, тип тексту, аудиторія, умови прослуховування і, передусім, де запускається секундомір. Більшість цифр затримки на ринку не є порівнюваними, бо вимірюють різні сегменти тієї самої розмови.
Власні назви, населені пункти, скорочення і, обов’язково, числа. Різниця понад п’ять пунктів між вимовами з цифрами і без них — причина, чому тестовий набір, що складається лише з прози, нічого не каже про бізнес-кейс.
Для кожного корпусу: хто ним володіє, яку ліцензію він має, чи дозволяє комерційне використання і чи охоплює похідну роботу. Для записаного голосу: біометрична згода і письмова передача прав.
За точністю в румунській ми поступаємося великим комерційним системам. Це написано на нашому власному сайті, у таблиці порівняння, де рядки третіх сторін позначені як заявлені, а наші — як виміряні. Порівняння, у якому ви завжди виходите першим, — це порівняння, у яке ніхто не повинен вірити.
Ні. Немає публічної демонстрації, немає публічного API, немає інтеграції телефонії, немає нативного дуплексу, і клонування голосу не входить до продукту. Усі п’ять пунктів перелічені як відсутні у нашій власній дорожній карті. Якщо вам потрібен голосовий агент, який працює зараз, відповідь — Kallina, а не Grai; якщо вам потрібен аудіофайл, це Voice Studio.
На розпізнаванні румунською мовою — 26,31% рівень помилки по словах на типовому вікні 1120 мс, з 95% довірчим інтервалом між 24,07 і 28,60; російською — 9,30%. Протокол: 200 висловлювань на мову з FLEURS, seed 20260831, потокове декодування. Наскільки це добре: не добре. Наш власний висновок, написаний у таблиці порівняння, полягає в тому, що за точністю румунською ми поступаємося комерційним системам, у п’ять до дев’яти разів. Румунську майже втричі важче розпізнавати, ніж російську, за тієї самої конфігурації, і саме це ми й досліджуємо.
За виміряним розподілом, мовна модель забирає 2180 мс із траєкторії, розпізнавання — 92 мс, а синтез — 305 мс. Розпізнавання практично безкоштовне; синтез майже так само. Хто хоче швидшу голосову розмову, має атакувати мовну модель — через меншу модель, через потокову передачу відповіді або через скорочення відповідей. Тут треба бути чесними й із собою: опубліковані на сайті сегментні цифри не складаються в опублікований на тому ж екрані загальний показник, і різниця становить приблизно пів секунди. Розподіл — це те, в чому ми впевнені; агрегований загальний показник треба перерахувати перед тим, як його цитувати.
Тому що в каскаді можна змінювати кожен компонент окремо і можна тримати розпізнавання та синтез локально, на процесорі, без GPU. Ціна — затримка ланцюжка і те, що мовна модель, яка є найбільшою частиною затримки, знаходиться поза машиною. Нативний duplex — це напрям, а не те, що ми маємо — він у списку «ще не існує».
Дорожня карта пропонує три навчання загалом менш ніж за 1.200 доларів: розпізнавання для румунської на VoxPopuli CC0, 89 годин, приблизно 50 годин H100, близько 500 доларів; детектор кінця черги для румунської, приблизно 2.000 власних зразків, менш ніж 100 доларів; власний голос, 500-800 доларів. Третє не заблоковано грошима, а даними — і тим, що модель синтезу, на яку ми спиралися, була заархівована її авторами. Цільова цифра для першого навчання, близько 21%, — це екстраполяція з поліпшень, отриманих на грецькій і болгарській, а не вимірювання.
Досліджуваний метод — це зворотна оптимізація на заморожених вагових коефіцієнтах, а не клонування за кілька секунд: 6-30 хвилин матеріалу на один голос, приблизно 3.000 кроків оптимізації, 2,6 GB пікової пам’яті, а доставлений артефакт — порядку кілобайтів. Але це не в продукті, і важливо сказати, чому це не лише технічне питання: у Республіці Молдова голос є біометричними даними з 23 серпня 2026 року. Без явної згоди та відступлення питання не в тому, чи можна, а в тому, що так не роблять.
Тому що інакше не мало б сенсу публікувати їх взагалі. Таблиця, в якій ви завжди перші, — це маркетингова таблиця. Наша позначає рядки третіх сторін як заявлені, а лише наші — як виміряні, і висновок під нею каже, що ми програємо. Втім, треба чітко сказати і те, чого не може ніхто ззовні: код, який створив ці вимірювання, не є публічним і не супроводжує сайт, тож цифри не можуть бути відтворені третьою стороною сьогодні. Сприймайте їх як внутрішні вимірювання, а не як незалежно перевірені результати.
Ілюстративний приклад
Сценарій використання, без даних клієнта чи приписаних комерційних результатів.
Голосовий агент румунською добре справляється з початковою розмовою і помиляється саме тоді, коли клієнт диктує номер телефону або суму.
Ми розділили вибірку з 200 висловлювань FLEURS на дві частини: 163 без цифр і 37 з цифрами, а потім виміряли окремо.
25,08% рівень помилки без цифр, 30,37% з цифрами — понад п’ять пунктів різниці, а на сирій транскрипції, без нормалізації, прірва зростає до понад одинадцяти пунктів. Це не враження: це частина даних, де розпізнавання дає збій, і саме це є частиною, від якої залежить бізнес-кейс.
Ce este necesar:Un set de test care conține efectiv partea grea. Un set format din proză curată nu ar fi arătat niciodată această diferență, iar sistemul ar fi părut mai bun decât e.
Можливості співпраці
Проєкти транскрипції та генерації голосу на матеріалах, для яких існують права на використання та задокументована мета.
Ми визначаємо пілот навколо реального процесу: користувачі, дані, інтеграції, витрати та критерії приймання. Розширення відбувається після оцінки результату.
Визначаємо вимоги до доступності, хостингу, захисту даних та інтероперабельності. Будь-яке з’єднання з послугами AGE або STISC потребує валідації придатності, доступу та схвалень.
Це сценарії адаптації, а не заяви про наявні контракти чи партнерства. Запропоновані функції підтверджуються в межах робочої сфери проєкту.
Обговорити пілотБудуємо агентів, які приймають та ініціюють дзвінки, використовують інформацію бізнесу і працюють з вашими системами.
PlatformăДоступ через API до моделей ШІ єдиним інтерфейсом.
PlatformăСтудія для генерації, прослуховування та завантаження голосових матеріалів за допомогою text-to-speech моделей.
Instrument specializatРозкажіть про свій процес. Разом визначимо, що варто збудувати, що можна підключити і як перевіримо результат.