Passer au contenu
megapromotingDiscutons
Produits Grai

Recherche vocale Cercetare & dezvoltare

Une voix construite pour la façon dont nous parlons.

Grai est notre orientation de recherche pour la synthèse vocale et des modèles adaptés aux langues utilisées ici. Nous travaillons sur la prononciation, l’expressivité et le lien entre le modèle vocal et les applications conversationnelles.

  1. 1Date autorizate
  2. 2Model și evaluare
  3. 3Sinteză vocală
Schemă explicativă ·Grai

Grai

De l’information au travail accompli.

01

Données et langue

Préparation et évaluation du matériel vocal utilisé avec les droits nécessaires.

02

Model

Expériences sur la prononciation, le rythme et l’expressivité.

03

Aplicație

Évaluation du modèle dans des scénarios conversationnels et accès via API.

Là où il devient utile.

Română

Attention à la prononciation et au rythme de la parole, y compris dans des contextes locaux.

Expériences multilingues

Recherche et évaluation pour le roumain et le russe.

Agents vocaux

Kallina est la plateforme d’agents ; Grai est une direction distincte de développement du modèle vocal.

Nous présentons un projet de recherche, avec des résultats évalués de manière itérative. La disponibilité d’un modèle pour la production est confirmée séparément.

Grai en détail

Ce que vous pouvez faire avec ce projet.

Grai est notre projet de recherche sur la voix en roumain. Ce n’est pas un produit, il ne s’achète pas et il n’a pas de bouton pour l’essayer. C’est une tentative de comprendre pourquoi le roumain est mal servi par les systèmes vocaux existants et combien il en coûterait pour qu’il soit mieux servi.

L’architecture que nous étudions est en cascade, et non duplext native : reconnaissance → modèle de langage → synthèse, trois composants séparés. La reconnaissance et la synthèse s’exécutent localement, sur le processeur ; le modèle de langage est interchangeable et se trouve hors de la machine, derrière une passerelle compatible OpenAI. Le choix est délibéré et a un coût que nous mesurons.

La distinction qui compte : Grai explore la voix. Kallina organise la conversation et les actions. Voice Studio produit des fichiers audio avec des fournisseurs intégrés. Ce sont trois choses différentes, et la seule d’entre elles qui relève de la recherche est Grai.

01

Ce que nous étudions : la reconnaissance en roumain, mesurée sur FLEURS

Le protocole est fixé et déclaré : 200 énoncés par langue du jeu de test FLEURS, choisis uniformément au hasard avec la graine 20260831, décodage en flux avec prise en compte du cache — et non un décodage hors ligne sur le fichier entier, qui est plus facile et donne des chiffres plus flatteurs. Notre résultat propre sur la fenêtre par défaut de 1120 ms : 26,31 % de taux d’erreur sur les mots en roumain, 9,30 % en russe.

02

Où part le temps dans une conversation

Nous mesurons chaque segment avec deux extrémités observées, et non calculées. Dans la décomposition publiée, le modèle de langage est de loin la plus grande part : 2180 ms, contre 92 ms de reconnaissance et 305 ms de synthèse. La conclusion utile est que, pour une conversation vocale, la vitesse ne se gagne pas en optimisant la reconnaissance — elle est déjà presque gratuite. Elle se gagne sur le modèle de langage.

03

Les chiffres se brisent exactement là où se brise aussi la conversation réelle

Nous avons divisé l’échantillon en énoncés avec chiffres et sans chiffres. Sans chiffres : 25,08 % d’erreur. Avec chiffres : 30,37 %. La différence de plus de cinq points est l’observation la plus utile de l’étude, car c’est précisément là que vivent les cas métier — numéros de téléphone, montants, dates, numéros de commande. Un système qui sonne bien sur la prose peut être inutilisable sur une commande.

04

La détection de la fin de tour, qui est le vrai problème de l’interruption

Un seuil fixe de silence est l’erreur habituelle. Sur notre mesure propre, un seuil fixe atteint une erreur égale à 820 ms ; sur la prosodie, à 560 ms. Le taux de coupure correcte est de 52 % — pratiquement pile ou face, et nous le disons parce que c’est le point de départ de l’entraînement proposé, pas un résultat dont nous nous vantons.

05

L’inventaire des données, avec ses licences

J’ai inventorié sept corpus pour le roumain et j’ai noté pour chacun la licence et s’il permet un usage commercial. La conclusion pratique : les plus grandes ressources pour le roumain sont non commerciales, et la voie propre reste VoxPopuli sous CC0 — 89 heures — plus une voix enregistrée par nous, avec cession des droits et consentement biométrique. En République de Moldavie, la Loi 195/2024 traite la voix comme une donnée biométrique et est en vigueur depuis le 23 août 2026.

Données et fonctionnement

Ce qui entre dans le système. Ce qu'il faut vérifier.

La voix est une donnée biométrique
En République de Moldavie, la Loi 195/2024 est en vigueur depuis le 23 août 2026 et qualifie la voix de donnée biométrique. En pratique : un enregistrement public n’autorise pas l’utilisation de l’identité vocale de qui que ce soit. Tout projet qui clone une voix exige un consentement explicite et une cession, pas seulement l’accès au fichier.
Les licences des corpus déterminent ce qu’il est possible de construire
Parmi les sept corpus inventoriés pour le roumain, deux des plus grands sont explicitement non commerciaux, et l’un est fermé derrière une porte d’accès. Un modèle entraîné sur des données non commerciales ne peut pas être intégré à un produit, quelle que soit sa qualité sonore. C’est pourquoi l’inventaire des licences est fait avant l’entraînement, pas après.
Le composant de synthèse sur lequel tout repose est en fin de vie
Le modèle de synthèse utilisé en cascade a été archivé par ses auteurs : sans développement et sans support officiel, et leur outil de création de voix a été fermé le 31 août 2026. Les poids restent disponibles et le modèle continue de fonctionner en local, mais il ne reçoit plus rien. Cela fait passer la synthèse propre de « peut-être plus tard » à un chemin critique, et c’est un changement de plan que nous préférons dire plutôt que cacher.
Le jeu d’évaluation ne se mélange pas avec celui d’entraînement
C’est la règle élémentaire et la plus souvent enfreinte. Une comparaison n’a de sens que si elle conserve la version du modèle, le texte, la graine et le critère. Notre étude note que nous avons nous-mêmes commis une erreur de mesure sur notre propre site : une valeur de latence de 455 ms lançait le chronomètre après la reconnaissance, donc mesurait autre chose que ce qu’elle laissait entendre ; la valeur réelle était environ cinq fois plus élevée.

De l'exploration à l'implémentation

Comment nous préparons un projet avec Grai.

01

Nous définissons ce qui doit être mesuré, avant de mesurer

La langue, le type de texte, le public, les conditions d’écoute et, surtout, où démarre le chronomètre. La plupart des chiffres de latence sur le marché ne sont pas comparables parce qu’ils mesurent des segments différents de la même conversation.

02

Nous construisons un jeu de test qui contient la partie difficile

Noms propres, localités, abréviations et, obligatoirement, des chiffres. L’écart de plus de cinq points entre les énoncés avec chiffres et ceux sans chiffres est la raison pour laquelle un jeu de test composé uniquement de prose ne dit rien sur un cas d’affaires.

03

Nous vérifions la licence avant tout entraînement

Pour chaque corpus : qui en est le propriétaire, quelle licence il porte, s’il permet un usage commercial et s’il couvre l’œuvre dérivée. Pour la voix enregistrée : consentement biométrique et cession écrite.

04

Nous publions aussi le résultat qui ne nous convient pas

En précision en roumain, nous perdons face aux grands systèmes commerciaux. C’est écrit sur notre propre site, dans le tableau de comparaison, où les lignes des tiers sont marquées comme déclarées et les nôtres comme mesurées. Une comparaison dans laquelle vous arrivez toujours premier est une comparaison que personne ne devrait croire.

Des questions qui méritent d’être clarifiées.

Puis-je utiliser Grai dans un projet aujourd’hui ?

Non. Il n’existe pas de démonstration publique, il n’existe pas d’API publique, il n’existe pas d’intégration téléphonique, il n’existe pas de duplex natif et le clonage vocal n’est pas dans le produit. Les cinq sont indiqués comme absents dans notre propre feuille de route. Si vous avez besoin d’un agent vocal qui fonctionne maintenant, la réponse est Kallina, pas Grai ; si vous avez besoin d’un fichier audio, c’est Voice Studio.

Qu’a-t-on mesuré concrètement et à quel point le résultat est-il bon ?

En reconnaissance en roumain, 26,31 % de taux d’erreur sur les mots avec la fenêtre par défaut de 1120 ms, avec un intervalle de confiance de 95 % entre 24,07 et 28,60 ; en russe, 9,30 %. Protocole : 200 énoncés par langue issus de FLEURS, graine 20260831, décodage en flux. À quel point c’est bon : ce n’est pas bon. Notre propre conclusion, écrite dans le tableau de comparaison, est qu’en précision en roumain nous perdons face aux systèmes commerciaux, avec un facteur de cinq à neuf. Le roumain est presque trois fois plus difficile à reconnaître que le russe avec la même configuration, ce qui est précisément le problème que nous étudions.

Pourquoi le temps est-il perdu et où pourrait-on en gagner ?

Dans la décomposition mesurée, le modèle de langage prend 2180 ms du trajet, la reconnaissance 92 ms et la synthèse 305 ms. La reconnaissance est pratiquement gratuite ; la synthèse presque autant. Qui veut une conversation vocale plus rapide doit s’attaquer au modèle de langage — par un modèle plus petit, par le streaming de la réponse ou par le raccourcissement des réponses. Ici, nous devons aussi être honnêtes avec nous-mêmes : les chiffres de segment publiés sur le site ne s’additionnent pas au total publié sur le même écran, et l’écart est d’environ une demi-seconde. La décomposition est celle en laquelle nous avons confiance ; le total agrégé doit être recalculé avant d’être cité.

Pourquoi une architecture en cascade et pas un duplex natif ?

Parce qu’en cascade, vous pouvez changer chaque composant séparément et vous pouvez garder la reconnaissance et la synthèse en local, sur le processeur, sans GPU. Le prix, c’est la latence d’enchaînement et le fait que le modèle de langage, qui constitue la plus grande partie du retard, se trouve en dehors de la machine. Le duplex natif est une direction, pas quelque chose que nous avons — il est sur la liste des « n’existe pas encore ».

Combien faudrait-il dépenser pour que ce soit meilleur ?

La feuille de route propose trois entraînements à moins de 1.200 dollars au total : reconnaissance pour le roumain sur VoxPopuli CC0, 89 heures, environ 50 heures de H100, autour de 500 dollars ; un détecteur de fin de tour pour le roumain, environ 2.000 exemples propres, moins de 100 dollars ; une voix propre, 500-800 dollars. Le troisième n’est pas bloqué par l’argent, mais par les données — et par le fait que le modèle de synthèse sur lequel nous nous appuyions a été archivé par ses auteurs. Le chiffre cible pour le premier entraînement, autour de 21 %, est une extrapolation des améliorations obtenues sur le grec et le bulgare, pas une mesure.

Peut-il reproduire la voix d’une personne ?

La méthode étudiée est une optimisation inverse sur des poids gelés, pas un clonage en quelques secondes : 6-30 minutes de matériau par voix, environ 3.000 pas d’optimisation, 2,6 GB de mémoire de pointe, l’artéfact livré étant de l’ordre du kilooctet. Mais ce n’est pas dans le produit, et il est important de dire pourquoi ce n’est pas seulement une question technique : en République de Moldova, la voix est une donnée biométrique depuis le 23 août 2026. Sans consentement explicite et cession, la question n’est pas de savoir si c’est possible, mais qu’il ne faut pas le faire.

Pourquoi publiez-vous des chiffres qui vous mettent sous un mauvais jour ?

Parce que sinon il n’aurait aucun sens de les publier du tout. Un tableau dans lequel vous arrivez toujours premier est un tableau de marketing. Le nôtre marque les lignes des tiers comme déclarées et seulement les nôtres comme mesurées, et la conclusion écrite dessous dit que nous perdons. Il faut toutefois dire clairement aussi ce qu’aucun externe ne peut faire : le code qui a produit ces mesures n’est pas public et n’accompagne pas le site, donc les chiffres ne peuvent pas être reproduits par un tiers aujourd’hui. Traitez-les comme des mesures internes, et non comme des résultats vérifiés indépendamment.

Exemple illustratif

Pourquoi un agent vocal trébuche-t-il précisément sur le numéro de téléphone

Un scénario d’utilisation, sans données client ni résultats commerciaux attribués.

Situation initiale

Un agent vocal en roumain gère bien une conversation d’ouverture et se trompe précisément lorsque le client dicte un numéro de téléphone ou une somme.

Comment ça fonctionne

Nous avons réparti l’échantillon de 200 énoncés FLEURS en deux : 163 sans chiffres et 37 avec chiffres, puis nous avons mesuré séparément.

Rezultatul

25,08 % taux d’erreur sans chiffres, 30,37 % avec chiffres — plus de cinq points d’écart, et sur la transcription brute, sans normalisation, l’écart dépasse onze points. Ce n’est pas une impression : c’est la partie des données où la reconnaissance cède, et c’est exactement la partie dont dépend un cas d’affaires.

Ce este necesar:Un set de test care conține efectiv partea grea. Un set format din proză curată nu ar fi arătat niciodată această diferență, iar sistemul ar fi părut mai bun decât e.

Possibilités de collaboration

Grai, dans le contexte de votre organisation.

Traitement du contenu audio

Projets de transcription et de génération vocale sur des matériaux pour lesquels il existe des droits d’utilisation et une finalité documentée.

Entreprises privées

Nous définissons un pilote autour d’un processus réel : utilisateurs, données, intégrations, coûts et critères d’acceptation. L’extension suit après l’évaluation du résultat.

Institutions et entreprises publiques

Nous établissons les exigences d’accessibilité, d’hébergement, de protection des données et d’interopérabilité. Toute connexion avec des services AGE ou STISC nécessite la validation de l’éligibilité, de l’accès et des approbations.

Ce sont des scénarios d’adaptation, non des déclarations sur des contrats ou partenariats existants. Les fonctions proposées sont confirmées dans le périmètre de travail du projet.

Discuter d'un pilote

Faisant partie d’un écosystème.

Qu'est-ce que vous voudriez voir mieux fonctionner ?

Racontez-nous votre processus. Ensemble, nous décidons ce qui vaut la peine d'être construit, ce que nous pouvons connecter et comment nous vérifions le résultat.

Discutons