Dane i język
Przygotowanie i ocena materiału głosowego używanego z niezbędnymi prawami.
Cercetare vocală Cercetare & dezvoltare
Grai to nasz kierunek badań nad syntezą mowy i modelami dostosowanymi do języków używanych tutaj. Pracujemy nad wymową, ekspresywnością i połączeniem między modelem głosu a aplikacjami konwersacyjnymi.
Grai
Przygotowanie i ocena materiału głosowego używanego z niezbędnymi prawami.
Eksperymenty nad wymową, rytmem i ekspresywnością.
Ocena modelu w scenariuszach konwersacyjnych i dostęp przez API.
Uwaga na wymowę i rytm mowy, także w lokalnych kontekstach.
Badania i ocena dla języka rumuńskiego i rosyjskiego.
Kallina to platforma agentów; Grai to odrębny kierunek rozwoju modelu głosowego.
Prezentujemy projekt badawczy, z wynikami ocenianymi iteracyjnie. Dostępność modelu do produkcji potwierdza się osobno.
Grai w szczegółach
Grai to nasz projekt badawczy nad głosem w języku rumuńskim. Nie jest produktem, nie da się go kupić i nie ma przycisku do wypróbowania. To próba zrozumienia, dlaczego rumuński jest słabo obsługiwany przez istniejące systemy głosowe i ile kosztowałoby jego lepsze obsłużenie.
Badana przez nas architektura jest kaskadowa, nie natywnie duplex: rozpoznawanie → model językowy → synteza, trzy oddzielne komponenty. Rozpoznawanie i synteza działają lokalnie, na procesorze; model językowy jest wymienny i znajduje się poza maszyną, za bramką zgodną z OpenAI. Wybór jest świadomy i ma cenę, którą mierzymy.
Istotne rozróżnienie: Grai bada głos. Kallina organizuje rozmowę i działania. Voice Studio produkuje pliki audio z zintegrowanymi dostawcami. To trzy różne rzeczy, a jedyną z nich, która jest badawcza, jest Grai.
Protokół jest ustalony i jawny: 200 wypowiedzi na język z zestawu testowego FLEURS, wybranych równomiernie losowo z ziarnem 20260831, dekodowanie strumieniowe z uwzględnieniem cache — nie dekodowanie offline całego pliku, które jest łatwiejsze i daje ładniejsze liczby. Wynik własny na domyślnym oknie 1120 ms: 26,31% wskaźnika błędu słów w rumuńskim, 9,30% w rosyjskim.
Mierzymy każdy segment z dwoma obserwowanymi końcami, nie obliczonymi. W opublikowanym rozkładzie model językowy zdecydowanie zajmuje największą część: 2180 ms, wobec 92 ms rozpoznawania i 305 ms syntezy. Użyteczny wniosek jest taki, że w rozmowie głosowej prędkości nie zyskuje się przez optymalizację rozpoznawania — ono jest już niemal darmowe. Zyskuje się na modelu językowym.
Podzieliliśmy próbkę na wypowiedzi z cyframi i bez. Bez cyfr: 25,08% błędu. Z cyframi: 30,37%. Różnica ponad pięciu punktów to najważniejsza obserwacja badania, bo właśnie tam mieszkają przypadki biznesowe — numery telefonów, kwoty, daty, numery zamówień. System, który brzmi dobrze w prozie, może być bezużyteczny przy zamówieniu.
Stały próg ciszy to zwykły błąd. W naszych pomiarach stały próg daje błąd równy przy 820 ms; w prozodii, przy 560 ms. Prawidłowa stopa ucięcia wynosi 52% — praktycznie rzut monetą, i mówimy to, bo to punkt wyjścia proponowanego trenowania, nie wynik, którym się chwalimy.
Sporządziliśmy inwentarz siedmiu korpusów dla rumuńskiego i odnotowaliśmy dla każdego licencję oraz to, czy dopuszcza użytek komercyjny. Praktyczny wniosek: największe zasoby dla rumuńskiego są niekomercyjne, a czysta ścieżka pozostaje VoxPopuli na CC0 — 89 godzin — plus głos nagrany przez nas, z cesją praw i zgodą biomeryczną. W Republice Mołdawii Ustawa nr 195/2024 traktuje głos jako dane biometryczne i obowiązuje od 23 sierpnia 2026.
Dane i działanie
Od eksploracji do wdrożenia
Język, typ tekstu, grupa odbiorcza, warunki odsłuchu i, przede wszystkim, gdzie uruchamia się stoper. Większość liczb opóźnienia na rynku nie jest porównywalna, ponieważ mierzy różne segmenty tej samej rozmowy.
Nazwy własne, miejscowości, skróty i, obowiązkowo, liczby. Różnica ponad pięciu punktów między wypowiedziami z cyframi i bez nich jest powodem, dla którego zestaw testowy złożony wyłącznie z prozy nic nie mówi o przypadku biznesowym.
Dla każdego korpusu: kto go posiada, jaką licencję ma, czy pozwala na użytek komercyjny i czy obejmuje pracę pochodną. Dla nagranej głosu: zgoda biometryczna i pisemne przeniesienie praw.
Pod względem dokładności w języku rumuńskim przegrywamy z dużymi komercyjnymi systemami. Jest to napisane na naszej własnej stronie, w tabeli porównawczej, gdzie wiersze stron trzecich są oznaczone jako deklarowane, a nasze jako zmierzone. Porównanie, w którym zawsze wychodzisz pierwsza, to porównanie, w które nikt nie powinien wierzyć.
Nie. Nie istnieje publiczna demonstracja, nie istnieje publiczne API, nie istnieje integracja z telefonią, nie istnieje natywne duplex i klonowanie głosu nie jest w produkcie. Wszystkie pięć jest wymienione jako brak w naszej własnej mapie drogowej. Jeśli potrzebujesz agenta głosowego, który działa teraz, odpowiedzią jest Kallina, nie Grai; jeśli potrzebujesz pliku audio, jest to Voice Studio.
W rozpoznawaniu w języku rumuńskim, 26,31% wskaźnik błędu słów na domyślnym oknie 1120 ms, z 95% przedziałem ufności między 24,07 a 28,60; w języku rosyjskim 9,30%. Protokół: 200 wypowiedzi na język z FLEURS, ziarno 20260831, dekodowanie strumieniowe. Jak dobry jest wynik: nie jest dobry. Nasz własny wniosek, zapisany w tabeli porównawczej, jest taki, że pod względem dokładności w języku rumuńskim przegrywamy z komercyjnymi systemami, z czynnikiem od pięciu do dziewięciu. Rumuński jest prawie trzy razy trudniejszy do rozpoznania niż rosyjski przy tej samej konfiguracji, co jest właśnie problemem, który badamy.
W podziale na zmierzone segmenty model językowy zajmuje 2180 ms trasy, rozpoznawanie 92 ms, a synteza 305 ms. Rozpoznawanie jest praktycznie darmowe; synteza prawie tak samo. Kto chce szybszą rozmowę głosową, musi uderzyć w model językowy — przez mniejszy model, przez streaming odpowiedzi albo przez skrócenie odpowiedzi. Tu trzeba być uczciwą także wobec siebie: liczby segmentów opublikowane na stronie nie sumują się do całkowitej opublikowanej na tym samym ekranie, a różnica wynosi około pół sekundy. Wierzymy w rozbicie na segmenty; łączny wynik trzeba przeliczyć przed zacytowaniem.
Bo w architekturze kaskadowej można osobno zmieniać każdy komponent i trzymać rozpoznawanie oraz syntezę lokalnie, na procesorze, bez GPU. Kosztem jest opóźnienie wynikające z łańcuchowania i fakt, że model językowy, który stanowi największą część opóźnienia, działa poza maszyną. Natywny duplex to kierunek, a nie coś, czym dysponujemy — jest na liście „jeszcze nie istnieje”.
Mapa drogowa proponuje trzy treningi za mniej niż 1.200 dolarów łącznie: rozpoznawanie dla rumuńskiego na VoxPopuli CC0, 89 godzin, około 50 godzin H100, w przybliżeniu 500 dolarów; detektor końca tury dla rumuńskiego, około 2.000 własnych próbek, poniżej 100 dolarów; własny głos, 500-800 dolarów. Trzecia rzecz nie jest zablokowana przez pieniądze, tylko przez dane — i przez fakt, że model syntezy, na którym się opierano, został zarchiwizowany przez jego autorów. Docelowa wartość dla pierwszego treningu, około 21%, jest ekstrapolacją z popraw uzyskanych dla greckiego i bułgarskiego, a nie pomiarem.
Badana metoda to optymalizacja odwrotna na zamrożonych wagach, a nie klonowanie z kilku sekund: 6-30 minut materiału na każdy głos, około 3.000 kroków optymalizacji, 2,6 GB pamięci szczytowej, a dostarczony artefakt ma rząd kilobajtów. Ale nie ma tego w produkcie i ważne jest, by powiedzieć, dlaczego nie jest to tylko kwestia techniczna: w Republice Mołdawii głos jest danymi biometrycznymi od 23 sierpnia 2026. Bez wyraźnej zgody i cesji pytanie nie brzmi, czy można, tylko że się tego nie robi.
Bo inaczej nie miałoby sensu publikować ich w ogóle. Tabela, w której zawsze wychodzi się na pierwszym miejscu, jest tabelą marketingową. Nasza oznacza wiersze stron trzecich jako deklarowane, a tylko nasze jako mierzone, a wniosek napisany pod nią mówi, że przegrywamy. Trzeba jednak jasno powiedzieć także to, czego nie może zrobić nikt z zewnątrz: kod, który wygenerował te pomiary, nie jest publiczny i nie towarzyszy stronie, więc liczb nie da się dziś odtworzyć przez stronę trzecią. Traktuj je jako pomiary wewnętrzne, a nie jako wyniki zweryfikowane niezależnie.
Przykład ilustracyjny
Scenariusz użycia, bez danych klienta ani przypisanych wyników handlowych.
Agent głosowy po rumuńsku dobrze radzi sobie z rozmową otwierającą i myli się właśnie wtedy, gdy klient dyktuje numer telefonu albo kwotę.
Podzieliliśmy próbkę 200 wypowiedzi FLEURS na dwie części: 163 bez cyfr i 37 z cyframi, a potem mierzyliśmy osobno.
25,08% wskaźnik błędu bez cyfr, 30,37% z cyframi — ponad pięć punktów różnicy, a na surowej transkrypcji, bez normalizacji, przepaść rośnie do ponad jedenastu punktów. To nie jest wrażenie: to część danych, w której rozpoznawanie zawodzi, i dokładnie ta część, od której zależy przypadek biznesowy.
Ce este necesar:Un set de test care conține efectiv partea grea. Un set format din proză curată nu ar fi arătat niciodată această diferență, iar sistemul ar fi părut mai bun decât e.
Możliwości współpracy
Projekty transkrypcji i generowania głosu na materiałach, do których istnieją prawa użytkowania oraz udokumentowany cel.
Definiujemy pilotaż wokół realnego procesu: użytkownicy, dane, integracje, koszty i kryteria akceptacji. Rozszerzenie następuje po ocenie wyniku.
Ustalamy wymagania dotyczące dostępności, hostingu, ochrony danych i interoperacyjności. Każde połączenie z usługami AGE lub STISC wymaga walidacji kwalifikowalności, dostępu i zatwierdzeń.
To są scenariusze adaptacji, a nie oświadczenia o istniejących umowach lub partnerstwach. Proponowane funkcje są potwierdzane w zakresie pracy projektu.
Discută un pilotBudujemy agentów, którzy odbierają i inicjują połączenia, korzystają z informacji biznesowych i pracują z Twoimi systemami.
PlatformăDostęp API do modeli AI przez wspólny interfejs.
PlatformăStudio do generowania, odsłuchiwania i pobierania materiałów głosowych za pomocą modeli text-to-speech.
Instrument specializatOpowiedz nam o swoim procesie. Wspólnie ustalimy, co warto zbudować, co da się połączyć i jak sprawdzimy wynik.