Przejdź do treści
megapromotingPorozmawiajmy
Produkty Grai

Cercetare vocală Cercetare & dezvoltare

Głos zbudowany dla sposobu, w jaki mówimy.

Grai to nasz kierunek badań nad syntezą mowy i modelami dostosowanymi do języków używanych tutaj. Pracujemy nad wymową, ekspresywnością i połączeniem między modelem głosu a aplikacjami konwersacyjnymi.

  1. 1Date autorizate
  2. 2Model și evaluare
  3. 3Sinteză vocală
Schemă explicativă ·Grai

Grai

Od informacji do wykonanej pracy.

01

Dane i język

Przygotowanie i ocena materiału głosowego używanego z niezbędnymi prawami.

02

Model

Eksperymenty nad wymową, rytmem i ekspresywnością.

03

Aplicație

Ocena modelu w scenariuszach konwersacyjnych i dostęp przez API.

Gdzie staje się przydatny.

Română

Uwaga na wymowę i rytm mowy, także w lokalnych kontekstach.

Eksperymenty wielojęzyczne

Badania i ocena dla języka rumuńskiego i rosyjskiego.

Agenci głosowi

Kallina to platforma agentów; Grai to odrębny kierunek rozwoju modelu głosowego.

Prezentujemy projekt badawczy, z wynikami ocenianymi iteracyjnie. Dostępność modelu do produkcji potwierdza się osobno.

Grai w szczegółach

Co możesz zrobić z tym projektem.

Grai to nasz projekt badawczy nad głosem w języku rumuńskim. Nie jest produktem, nie da się go kupić i nie ma przycisku do wypróbowania. To próba zrozumienia, dlaczego rumuński jest słabo obsługiwany przez istniejące systemy głosowe i ile kosztowałoby jego lepsze obsłużenie.

Badana przez nas architektura jest kaskadowa, nie natywnie duplex: rozpoznawanie → model językowy → synteza, trzy oddzielne komponenty. Rozpoznawanie i synteza działają lokalnie, na procesorze; model językowy jest wymienny i znajduje się poza maszyną, za bramką zgodną z OpenAI. Wybór jest świadomy i ma cenę, którą mierzymy.

Istotne rozróżnienie: Grai bada głos. Kallina organizuje rozmowę i działania. Voice Studio produkuje pliki audio z zintegrowanymi dostawcami. To trzy różne rzeczy, a jedyną z nich, która jest badawcza, jest Grai.

01

Co badamy: rozpoznawanie po rumuńsku, mierzone na FLEURS

Protokół jest ustalony i jawny: 200 wypowiedzi na język z zestawu testowego FLEURS, wybranych równomiernie losowo z ziarnem 20260831, dekodowanie strumieniowe z uwzględnieniem cache — nie dekodowanie offline całego pliku, które jest łatwiejsze i daje ładniejsze liczby. Wynik własny na domyślnym oknie 1120 ms: 26,31% wskaźnika błędu słów w rumuńskim, 9,30% w rosyjskim.

02

Gdzie znika czas w rozmowie

Mierzymy każdy segment z dwoma obserwowanymi końcami, nie obliczonymi. W opublikowanym rozkładzie model językowy zdecydowanie zajmuje największą część: 2180 ms, wobec 92 ms rozpoznawania i 305 ms syntezy. Użyteczny wniosek jest taki, że w rozmowie głosowej prędkości nie zyskuje się przez optymalizację rozpoznawania — ono jest już niemal darmowe. Zyskuje się na modelu językowym.

03

Liczby łamią się dokładnie tam, gdzie łamie się też rzeczywista rozmowa

Podzieliliśmy próbkę na wypowiedzi z cyframi i bez. Bez cyfr: 25,08% błędu. Z cyframi: 30,37%. Różnica ponad pięciu punktów to najważniejsza obserwacja badania, bo właśnie tam mieszkają przypadki biznesowe — numery telefonów, kwoty, daty, numery zamówień. System, który brzmi dobrze w prozie, może być bezużyteczny przy zamówieniu.

04

Wykrywanie końca tury, czyli rzeczywisty problem przerwania

Stały próg ciszy to zwykły błąd. W naszych pomiarach stały próg daje błąd równy przy 820 ms; w prozodii, przy 560 ms. Prawidłowa stopa ucięcia wynosi 52% — praktycznie rzut monetą, i mówimy to, bo to punkt wyjścia proponowanego trenowania, nie wynik, którym się chwalimy.

05

Inwentarz danych wraz z licencjami

Sporządziliśmy inwentarz siedmiu korpusów dla rumuńskiego i odnotowaliśmy dla każdego licencję oraz to, czy dopuszcza użytek komercyjny. Praktyczny wniosek: największe zasoby dla rumuńskiego są niekomercyjne, a czysta ścieżka pozostaje VoxPopuli na CC0 — 89 godzin — plus głos nagrany przez nas, z cesją praw i zgodą biomeryczną. W Republice Mołdawii Ustawa nr 195/2024 traktuje głos jako dane biometryczne i obowiązuje od 23 sierpnia 2026.

Dane i działanie

Co trafia do systemu. Co trzeba sprawdzić.

Głos jest danymi biometrycznymi
W Republice Mołdawii Ustawa nr 195/2024 obowiązuje od 23 sierpnia 2026 i kwalifikuje głos jako dane biometryczne. W praktyce: publiczne nagranie nie upoważnia do użycia niczyjej tożsamości głosowej. Każdy projekt, który klonuje głos, wymaga wyraźnej zgody i cesji, a nie tylko dostępu do pliku.
Licencje korpusów decydują, co można zbudować
Spośród siedmiu skorpusowanych dla języka rumuńskiego, dwa z największych są wyraźnie niekomercyjne, a jeden jest zamknięty za bramą dostępu. Model wytrenowany na danych niekomercyjnych nie może trafić do produktu, niezależnie od tego, jak dobrze to brzmi. Dlatego inwentaryzacja licencji jest wykonywana przed trenowaniem, a nie po.
Komponent syntezy, na którym opiera się wszystko, jest u kresu życia
Model syntezy używany w kaskadzie został zarchiwizowany przez jego autorów: bez rozwoju i bez oficjalnego wsparcia, a ich narzędzie do budowania głosów zostało zamknięte 31 sierpnia 2026. Wagi pozostają dostępne i model nadal działa lokalnie, ale nie otrzymuje już niczego. To przenosi własną syntezę z „może później” na ścieżkę krytyczną i jest to zmiana planu, którą wolimy powiedzieć niż ukrywać.
Zbiór ewaluacyjny nie miesza się ze zbiorem treningowym
To podstawowa zasada i najczęściej łamana. Porównanie ma sens tylko wtedy, gdy zachowuje wersję modelu, tekst, ziarno i kryterium. Nasze badanie odnotowuje, że sami popełniliśmy błąd pomiaru na własnej stronie: liczba opóźnienia 455 ms uruchamiała stoper po rozpoznaniu, więc mierzyła coś innego niż sugerowała; rzeczywista liczba była około pięć razy większa.

Od eksploracji do wdrożenia

Jak przygotowujemy projekt z Grai.

01

Ustalamy, co dokładnie jest mierzone, zanim zaczniemy mierzyć

Język, typ tekstu, grupa odbiorcza, warunki odsłuchu i, przede wszystkim, gdzie uruchamia się stoper. Większość liczb opóźnienia na rynku nie jest porównywalna, ponieważ mierzy różne segmenty tej samej rozmowy.

02

Budujemy zestaw testowy, który zawiera trudną część

Nazwy własne, miejscowości, skróty i, obowiązkowo, liczby. Różnica ponad pięciu punktów między wypowiedziami z cyframi i bez nich jest powodem, dla którego zestaw testowy złożony wyłącznie z prozy nic nie mówi o przypadku biznesowym.

03

Sprawdzamy licencję przed jakimkolwiek trenowaniem

Dla każdego korpusu: kto go posiada, jaką licencję ma, czy pozwala na użytek komercyjny i czy obejmuje pracę pochodną. Dla nagranej głosu: zgoda biometryczna i pisemne przeniesienie praw.

04

Publikujemy także wynik, który nam nie odpowiada

Pod względem dokładności w języku rumuńskim przegrywamy z dużymi komercyjnymi systemami. Jest to napisane na naszej własnej stronie, w tabeli porównawczej, gdzie wiersze stron trzecich są oznaczone jako deklarowane, a nasze jako zmierzone. Porównanie, w którym zawsze wychodzisz pierwsza, to porównanie, w które nikt nie powinien wierzyć.

Pytania, które warto wyjaśnić.

Czy mogę dziś użyć Grai w projekcie?

Nie. Nie istnieje publiczna demonstracja, nie istnieje publiczne API, nie istnieje integracja z telefonią, nie istnieje natywne duplex i klonowanie głosu nie jest w produkcie. Wszystkie pięć jest wymienione jako brak w naszej własnej mapie drogowej. Jeśli potrzebujesz agenta głosowego, który działa teraz, odpowiedzią jest Kallina, nie Grai; jeśli potrzebujesz pliku audio, jest to Voice Studio.

Co faktycznie zostało zmierzone i jak dobry jest wynik?

W rozpoznawaniu w języku rumuńskim, 26,31% wskaźnik błędu słów na domyślnym oknie 1120 ms, z 95% przedziałem ufności między 24,07 a 28,60; w języku rosyjskim 9,30%. Protokół: 200 wypowiedzi na język z FLEURS, ziarno 20260831, dekodowanie strumieniowe. Jak dobry jest wynik: nie jest dobry. Nasz własny wniosek, zapisany w tabeli porównawczej, jest taki, że pod względem dokładności w języku rumuńskim przegrywamy z komercyjnymi systemami, z czynnikiem od pięciu do dziewięciu. Rumuński jest prawie trzy razy trudniejszy do rozpoznania niż rosyjski przy tej samej konfiguracji, co jest właśnie problemem, który badamy.

Dlaczego traci się czas i gdzie można by go zyskać?

W podziale na zmierzone segmenty model językowy zajmuje 2180 ms trasy, rozpoznawanie 92 ms, a synteza 305 ms. Rozpoznawanie jest praktycznie darmowe; synteza prawie tak samo. Kto chce szybszą rozmowę głosową, musi uderzyć w model językowy — przez mniejszy model, przez streaming odpowiedzi albo przez skrócenie odpowiedzi. Tu trzeba być uczciwą także wobec siebie: liczby segmentów opublikowane na stronie nie sumują się do całkowitej opublikowanej na tym samym ekranie, a różnica wynosi około pół sekundy. Wierzymy w rozbicie na segmenty; łączny wynik trzeba przeliczyć przed zacytowaniem.

Dlaczego architektura kaskadowa, a nie natywne duplex?

Bo w architekturze kaskadowej można osobno zmieniać każdy komponent i trzymać rozpoznawanie oraz syntezę lokalnie, na procesorze, bez GPU. Kosztem jest opóźnienie wynikające z łańcuchowania i fakt, że model językowy, który stanowi największą część opóźnienia, działa poza maszyną. Natywny duplex to kierunek, a nie coś, czym dysponujemy — jest na liście „jeszcze nie istnieje”.

Ile kosztowałoby, żeby było lepsze?

Mapa drogowa proponuje trzy treningi za mniej niż 1.200 dolarów łącznie: rozpoznawanie dla rumuńskiego na VoxPopuli CC0, 89 godzin, około 50 godzin H100, w przybliżeniu 500 dolarów; detektor końca tury dla rumuńskiego, około 2.000 własnych próbek, poniżej 100 dolarów; własny głos, 500-800 dolarów. Trzecia rzecz nie jest zablokowana przez pieniądze, tylko przez dane — i przez fakt, że model syntezy, na którym się opierano, został zarchiwizowany przez jego autorów. Docelowa wartość dla pierwszego treningu, około 21%, jest ekstrapolacją z popraw uzyskanych dla greckiego i bułgarskiego, a nie pomiarem.

Czy może odtworzyć głos danej osoby?

Badana metoda to optymalizacja odwrotna na zamrożonych wagach, a nie klonowanie z kilku sekund: 6-30 minut materiału na każdy głos, około 3.000 kroków optymalizacji, 2,6 GB pamięci szczytowej, a dostarczony artefakt ma rząd kilobajtów. Ale nie ma tego w produkcie i ważne jest, by powiedzieć, dlaczego nie jest to tylko kwestia techniczna: w Republice Mołdawii głos jest danymi biometrycznymi od 23 sierpnia 2026. Bez wyraźnej zgody i cesji pytanie nie brzmi, czy można, tylko że się tego nie robi.

Dlaczego publikujecie liczby, które stawiają was w złym świetle?

Bo inaczej nie miałoby sensu publikować ich w ogóle. Tabela, w której zawsze wychodzi się na pierwszym miejscu, jest tabelą marketingową. Nasza oznacza wiersze stron trzecich jako deklarowane, a tylko nasze jako mierzone, a wniosek napisany pod nią mówi, że przegrywamy. Trzeba jednak jasno powiedzieć także to, czego nie może zrobić nikt z zewnątrz: kod, który wygenerował te pomiary, nie jest publiczny i nie towarzyszy stronie, więc liczb nie da się dziś odtworzyć przez stronę trzecią. Traktuj je jako pomiary wewnętrzne, a nie jako wyniki zweryfikowane niezależnie.

Przykład ilustracyjny

Dlaczego agent głosowy zacina się dokładnie przy numerze telefonu

Scenariusz użycia, bez danych klienta ani przypisanych wyników handlowych.

Sytuacja początkowa

Agent głosowy po rumuńsku dobrze radzi sobie z rozmową otwierającą i myli się właśnie wtedy, gdy klient dyktuje numer telefonu albo kwotę.

Jak to działa

Podzieliliśmy próbkę 200 wypowiedzi FLEURS na dwie części: 163 bez cyfr i 37 z cyframi, a potem mierzyliśmy osobno.

Rezultatul

25,08% wskaźnik błędu bez cyfr, 30,37% z cyframi — ponad pięć punktów różnicy, a na surowej transkrypcji, bez normalizacji, przepaść rośnie do ponad jedenastu punktów. To nie jest wrażenie: to część danych, w której rozpoznawanie zawodzi, i dokładnie ta część, od której zależy przypadek biznesowy.

Ce este necesar:Un set de test care conține efectiv partea grea. Un set format din proză curată nu ar fi arătat niciodată această diferență, iar sistemul ar fi părut mai bun decât e.

Możliwości współpracy

Grai, w kontekście twojej organizacji.

Przetwarzanie treści audio

Projekty transkrypcji i generowania głosu na materiałach, do których istnieją prawa użytkowania oraz udokumentowany cel.

Firmy prywatne

Definiujemy pilotaż wokół realnego procesu: użytkownicy, dane, integracje, koszty i kryteria akceptacji. Rozszerzenie następuje po ocenie wyniku.

Instytucje i spółki państwowe

Ustalamy wymagania dotyczące dostępności, hostingu, ochrony danych i interoperacyjności. Każde połączenie z usługami AGE lub STISC wymaga walidacji kwalifikowalności, dostępu i zatwierdzeń.

To są scenariusze adaptacji, a nie oświadczenia o istniejących umowach lub partnerstwach. Proponowane funkcje są potwierdzane w zakresie pracy projektu.

Discută un pilot

Część ekosystemu.

Co chcesz, żeby działało lepiej?

Opowiedz nam o swoim procesie. Wspólnie ustalimy, co warto zbudować, co da się połączyć i jak sprawdzimy wynik.

Porozmawiajmy